{"timestamp_utc": "2026-04-12T10:46:24Z", "mode": "train", "global_step": 1, "epoch": 4.016548178495401e-05, "loss": 0.1041, "grad_norm": 10.209015846252441, "learning_rate": 1e-05, "num_tokens": 2463.0, "completions/mean_length": 121.875, "completions/min_length": 81.0, "completions/max_length": 160.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.875, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 160.0, "rewards/meter/mean": 0.42592284083366394, "rewards/meter/std": 0.33591756224632263, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9937220811843872, "rewards/repeat_penalty/std": 0.004517034627497196, "rewards/near_duplicate_penalty/mean": 0.9937220811843872, "rewards/near_duplicate_penalty/std": 0.004517034627497196, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15128016471862793, "rewards/total_composite/std": 0.13516460359096527, "reward": 0.15128016471862793, "reward_std": 0.13516458868980408, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2232884168624878, "sampling/sampling_logp_difference/max": 2.2234439849853516, "sampling/importance_sampling_ratio/min": 0.10823570936918259, "sampling/importance_sampling_ratio/mean": 1.0212712287902832, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.127237632870674, "clip_ratio/low_mean": 0.1246343944221735, "clip_ratio/low_min": 0.1246343944221735, "clip_ratio/high_mean": 0.08433323167264462, "clip_ratio/high_max": 0.08433323167264462, "clip_ratio/region_mean": 0.20896762609481812, "reward_total_mean": 0.15128016471862793, "reward_meter_mean": 0.42592284083366394, "reward_meter_std": 0.33591756224632263, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9937220811843872, "reward_repeat_penalty_std": 0.004517034627497196, "reward_near_duplicate_penalty_mean": 0.9937220811843872, "reward_near_duplicate_penalty_std": 0.004517034627497196, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.15128016471862793, "reward_total_composite_std": 0.13516460359096527} {"timestamp_utc": "2026-04-12T10:46:34Z", "mode": "train", "global_step": 2, "epoch": 8.033096356990803e-05, "loss": 0.105, "grad_norm": 15.227958679199219, "learning_rate": 9.996969696969698e-06, "num_tokens": 4944.0, "completions/mean_length": 109.125, "completions/min_length": 96.0, "completions/max_length": 129.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.125, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 129.0, "rewards/meter/mean": 0.7208319902420044, "rewards/meter/std": 0.2011304646730423, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.9835867881774902, "rewards/repeat_penalty/std": 0.002223996678367257, "rewards/near_duplicate_penalty/mean": 0.9835867881774902, "rewards/near_duplicate_penalty/std": 0.002223996678367257, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.566516637802124, "rewards/total_composite/std": 0.2884424030780792, "reward": 0.566516637802124, "reward_std": 0.2884424030780792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15910686552524567, "sampling/sampling_logp_difference/max": 3.482398509979248, "sampling/importance_sampling_ratio/min": 0.030733609572052956, "sampling/importance_sampling_ratio/mean": 0.9993525147438049, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.633471455425024, "clip_ratio/low_mean": 0.06075856648385525, "clip_ratio/low_min": 0.06075856648385525, "clip_ratio/high_mean": 0.05482602585107088, "clip_ratio/high_max": 0.05482602585107088, "clip_ratio/region_mean": 0.11558459233492613, "reward_total_mean": 0.566516637802124, "reward_meter_mean": 0.7208319902420044, "reward_meter_std": 0.2011304646730423, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9835867881774902, "reward_repeat_penalty_std": 0.002223996678367257, "reward_near_duplicate_penalty_mean": 0.9835867881774902, "reward_near_duplicate_penalty_std": 0.002223996678367257, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.566516637802124, "reward_total_composite_std": 0.2884424030780792} {"timestamp_utc": "2026-04-12T10:46:43Z", "mode": "train", "global_step": 3, "epoch": 0.00012049644535486203, "loss": 0.1276, "grad_norm": 15.129196166992188, "learning_rate": 9.993939393939395e-06, "num_tokens": 6507.0, "completions/mean_length": 40.375, "completions/min_length": 23.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.5452406406402588, "rewards/meter/std": 0.43102967739105225, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.35063210129737854, "rewards/repeat_penalty/mean": 0.99625563621521, "rewards/repeat_penalty/std": 0.00466901296749711, "rewards/near_duplicate_penalty/mean": 0.99625563621521, "rewards/near_duplicate_penalty/std": 0.00466901296749711, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24037756025791168, "rewards/total_composite/std": 0.3203948438167572, "reward": 0.24037756025791168, "reward_std": 0.3203948438167572, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23142485320568085, "sampling/sampling_logp_difference/max": 1.662959098815918, "sampling/importance_sampling_ratio/min": 0.18957717716693878, "sampling/importance_sampling_ratio/mean": 1.0225555896759033, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7431422844529152, "clip_ratio/low_mean": 0.16276154574006796, "clip_ratio/low_min": 0.16276154574006796, "clip_ratio/high_mean": 0.05761563032865524, "clip_ratio/high_max": 0.05761563032865524, "clip_ratio/region_mean": 0.2203771760687232, "reward_total_mean": 0.24037756025791168, "reward_meter_mean": 0.5452406406402588, "reward_meter_std": 0.43102967739105225, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.99625563621521, "reward_repeat_penalty_std": 0.00466901296749711, "reward_near_duplicate_penalty_mean": 0.99625563621521, "reward_near_duplicate_penalty_std": 0.00466901296749711, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.35063210129737854, "reward_total_composite_mean": 0.24037756025791168, "reward_total_composite_std": 0.3203948438167572} {"timestamp_utc": "2026-04-12T10:46:56Z", "mode": "train", "global_step": 4, "epoch": 0.00016066192713981605, "loss": -0.0339, "grad_norm": 8.383411407470703, "learning_rate": 9.990909090909093e-06, "num_tokens": 9567.0, "completions/mean_length": 167.5, "completions/min_length": 106.0, "completions/max_length": 243.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 167.5, "completions/min_terminated_length": 106.0, "completions/max_terminated_length": 243.0, "rewards/meter/mean": 0.3337455689907074, "rewards/meter/std": 0.27989256381988525, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9940738081932068, "rewards/lexical_plausibility/std": 0.011887531727552414, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9878745675086975, "rewards/repeat_penalty/std": 0.018476979807019234, "rewards/near_duplicate_penalty/mean": 0.9936480522155762, "rewards/near_duplicate_penalty/std": 0.006021037232130766, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9941724538803101, "rewards/distinct_2/std": 0.016482684761285782, "rewards/total_composite/mean": 0.09443728625774384, "rewards/total_composite/std": 0.052527233958244324, "reward": 0.09443728625774384, "reward_std": 0.052527233958244324, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22497865557670593, "sampling/sampling_logp_difference/max": 1.6787109375, "sampling/importance_sampling_ratio/min": 0.18661437928676605, "sampling/importance_sampling_ratio/mean": 1.0238019227981567, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.535755380988121, "clip_ratio/low_mean": 0.04465997405350208, "clip_ratio/low_min": 0.04465997405350208, "clip_ratio/high_mean": 0.1727588288486004, "clip_ratio/high_max": 0.1727588288486004, "clip_ratio/region_mean": 0.21741880290210247, "reward_total_mean": 0.09443728625774384, "reward_meter_mean": 0.3337455689907074, "reward_meter_std": 0.27989256381988525, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9940738081932068, "reward_lexical_plausibility_std": 0.011887531727552414, "reward_repeat_penalty_mean": 0.9878745675086975, "reward_repeat_penalty_std": 0.018476979807019234, "reward_near_duplicate_penalty_mean": 0.9936480522155762, "reward_near_duplicate_penalty_std": 0.006021037232130766, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9941724538803101, "reward_distinct_2_std": 0.016482684761285782, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.09443728625774384, "reward_total_composite_std": 0.052527233958244324} {"timestamp_utc": "2026-04-12T10:47:05Z", "mode": "train", "global_step": 5, "epoch": 0.00020082740892477004, "loss": 0.0498, "grad_norm": 20.20990753173828, "learning_rate": 9.987878787878788e-06, "num_tokens": 11123.0, "completions/mean_length": 40.5, "completions/min_length": 31.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.29064032435417175, "rewards/meter/std": 0.3684650957584381, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47874999046325684, "rewards/judge_quality/std": 0.1683056354522705, "rewards/repeat_penalty/mean": 0.9905592799186707, "rewards/repeat_penalty/std": 0.014576256275177002, "rewards/near_duplicate_penalty/mean": 0.9905592799186707, "rewards/near_duplicate_penalty/std": 0.014576256275177002, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13773858547210693, "rewards/total_composite/std": 0.16502845287322998, "reward": 0.13773858547210693, "reward_std": 0.1650284379720688, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2425910085439682, "sampling/sampling_logp_difference/max": 1.4678411483764648, "sampling/importance_sampling_ratio/min": 0.23042239248752594, "sampling/importance_sampling_ratio/mean": 1.0286279916763306, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3794576972723007, "clip_ratio/low_mean": 0.17255527526140213, "clip_ratio/low_min": 0.17255527526140213, "clip_ratio/high_mean": 0.056785713881254196, "clip_ratio/high_max": 0.056785713881254196, "clip_ratio/region_mean": 0.22934098914265633, "reward_total_mean": 0.13773858547210693, "reward_meter_mean": 0.29064032435417175, "reward_meter_std": 0.3684650957584381, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9905592799186707, "reward_repeat_penalty_std": 0.014576256275177002, "reward_near_duplicate_penalty_mean": 0.9905592799186707, "reward_near_duplicate_penalty_std": 0.014576256275177002, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.47874999046325684, "reward_judge_quality_std": 0.1683056354522705, "reward_total_composite_mean": 0.13773858547210693, "reward_total_composite_std": 0.16502845287322998} {"timestamp_utc": "2026-04-12T10:47:14Z", "mode": "train", "global_step": 6, "epoch": 0.00024099289070972406, "loss": -0.0723, "grad_norm": 15.78359603881836, "learning_rate": 9.984848484848485e-06, "num_tokens": 12786.0, "completions/mean_length": 49.875, "completions/min_length": 34.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.875, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.5357946157455444, "rewards/meter/std": 0.3965552747249603, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.990384578704834, "rewards/lexical_plausibility/std": 0.01780424639582634, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.9968063831329346, "rewards/repeat_penalty/std": 0.005851962603628635, "rewards/near_duplicate_penalty/mean": 0.9968063831329346, "rewards/near_duplicate_penalty/std": 0.005851962603628635, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19787782430648804, "rewards/total_composite/std": 0.16528819501399994, "reward": 0.19787782430648804, "reward_std": 0.16528819501399994, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24047894775867462, "sampling/sampling_logp_difference/max": 2.8058953285217285, "sampling/importance_sampling_ratio/min": 0.060452621430158615, "sampling/importance_sampling_ratio/mean": 1.0489442348480225, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.553137093782425, "clip_ratio/low_mean": 0.11882871203124523, "clip_ratio/low_min": 0.11882871203124523, "clip_ratio/high_mean": 0.10576356761157513, "clip_ratio/high_max": 0.10576356761157513, "clip_ratio/region_mean": 0.22459227964282036, "reward_total_mean": 0.19787782430648804, "reward_meter_mean": 0.5357946157455444, "reward_meter_std": 0.3965552747249603, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.990384578704834, "reward_lexical_plausibility_std": 0.01780424639582634, "reward_repeat_penalty_mean": 0.9968063831329346, "reward_repeat_penalty_std": 0.005851962603628635, "reward_near_duplicate_penalty_mean": 0.9968063831329346, "reward_near_duplicate_penalty_std": 0.005851962603628635, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.19787782430648804, "reward_total_composite_std": 0.16528819501399994} {"timestamp_utc": "2026-04-12T10:47:23Z", "mode": "train", "global_step": 7, "epoch": 0.00028115837249467805, "loss": 0.1518, "grad_norm": 19.81330108642578, "learning_rate": 9.981818181818183e-06, "num_tokens": 14380.0, "completions/mean_length": 40.25, "completions/min_length": 34.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.561120867729187, "rewards/meter/std": 0.38149482011795044, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5337499976158142, "rewards/judge_quality/std": 0.21540245413780212, "rewards/repeat_penalty/mean": 0.9547847509384155, "rewards/repeat_penalty/std": 0.1135256439447403, "rewards/near_duplicate_penalty/mean": 0.9917590618133545, "rewards/near_duplicate_penalty/std": 0.01057454850524664, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.28039056062698364, "rewards/total_composite/std": 0.21561163663864136, "reward": 0.28039056062698364, "reward_std": 0.21561162173748016, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21762706339359283, "sampling/sampling_logp_difference/max": 1.4331035614013672, "sampling/importance_sampling_ratio/min": 0.23856738209724426, "sampling/importance_sampling_ratio/mean": 1.0254625082015991, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9640412628650665, "clip_ratio/low_mean": 0.08554505370557308, "clip_ratio/low_min": 0.08554505370557308, "clip_ratio/high_mean": 0.10183645226061344, "clip_ratio/high_max": 0.10183645226061344, "clip_ratio/region_mean": 0.18738150596618652, "reward_total_mean": 0.28039056062698364, "reward_meter_mean": 0.561120867729187, "reward_meter_std": 0.38149482011795044, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9547847509384155, "reward_repeat_penalty_std": 0.1135256439447403, "reward_near_duplicate_penalty_mean": 0.9917590618133545, "reward_near_duplicate_penalty_std": 0.01057454850524664, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.5337499976158142, "reward_judge_quality_std": 0.21540245413780212, "reward_total_composite_mean": 0.28039056062698364, "reward_total_composite_std": 0.21561163663864136} {"timestamp_utc": "2026-04-12T10:47:37Z", "mode": "train", "global_step": 8, "epoch": 0.0003213238542796321, "loss": -0.0938, "grad_norm": 6.824868679046631, "learning_rate": 9.97878787878788e-06, "num_tokens": 17989.0, "completions/mean_length": 256.125, "completions/min_length": 99.0, "completions/max_length": 396.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 256.125, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 396.0, "rewards/meter/mean": 0.6256775856018066, "rewards/meter/std": 0.17330610752105713, "rewards/count_adherence/mean": 0.8977273106575012, "rewards/count_adherence/std": 0.14928004145622253, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9633318185806274, "rewards/repeat_penalty/std": 0.058776505291461945, "rewards/near_duplicate_penalty/mean": 0.9902274012565613, "rewards/near_duplicate_penalty/std": 0.012147120200097561, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9723308086395264, "rewards/distinct_2/std": 0.04843715578317642, "rewards/total_composite/mean": 0.17009173333644867, "rewards/total_composite/std": 0.10656578093767166, "reward": 0.17009173333644867, "reward_std": 0.10656578093767166, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22988878190517426, "sampling/sampling_logp_difference/max": 1.8197107315063477, "sampling/importance_sampling_ratio/min": 0.16207262873649597, "sampling/importance_sampling_ratio/mean": 1.0383141040802002, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8317363262176514, "clip_ratio/low_mean": 0.07635685615241528, "clip_ratio/low_min": 0.07635685615241528, "clip_ratio/high_mean": 0.1352237407118082, "clip_ratio/high_max": 0.1352237407118082, "clip_ratio/region_mean": 0.21158059686422348, "reward_total_mean": 0.17009173333644867, "reward_meter_mean": 0.6256775856018066, "reward_meter_std": 0.17330610752105713, "reward_count_adherence_mean": 0.8977273106575012, "reward_count_adherence_std": 0.14928004145622253, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9633318185806274, "reward_repeat_penalty_std": 0.058776505291461945, "reward_near_duplicate_penalty_mean": 0.9902274012565613, "reward_near_duplicate_penalty_std": 0.012147120200097561, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9723308086395264, "reward_distinct_2_std": 0.04843715578317642, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.17009173333644867, "reward_total_composite_std": 0.10656578093767166} {"timestamp_utc": "2026-04-12T10:47:47Z", "mode": "train", "global_step": 9, "epoch": 0.0003614893360645861, "loss": 0.0476, "grad_norm": 18.376598358154297, "learning_rate": 9.975757575757577e-06, "num_tokens": 20445.0, "completions/mean_length": 124.0, "completions/min_length": 85.0, "completions/max_length": 146.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 124.0, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.7044054269790649, "rewards/meter/std": 0.32541099190711975, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6474999785423279, "rewards/judge_quality/std": 0.297981321811676, "rewards/repeat_penalty/mean": 0.9833334684371948, "rewards/repeat_penalty/std": 0.0076095727272331715, "rewards/near_duplicate_penalty/mean": 0.9833334684371948, "rewards/near_duplicate_penalty/std": 0.0076095727272331715, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49316665530204773, "rewards/total_composite/std": 0.3613712787628174, "reward": 0.49316665530204773, "reward_std": 0.36137130856513977, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19040951132774353, "sampling/sampling_logp_difference/max": 2.7353835105895996, "sampling/importance_sampling_ratio/min": 0.06486912816762924, "sampling/importance_sampling_ratio/mean": 0.9912941455841064, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7231591157615185, "clip_ratio/low_mean": 0.1145949698984623, "clip_ratio/low_min": 0.1145949698984623, "clip_ratio/high_mean": 0.0339728519320488, "clip_ratio/high_max": 0.0339728519320488, "clip_ratio/region_mean": 0.1485678218305111, "reward_total_mean": 0.49316665530204773, "reward_meter_mean": 0.7044054269790649, "reward_meter_std": 0.32541099190711975, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9833334684371948, "reward_repeat_penalty_std": 0.0076095727272331715, "reward_near_duplicate_penalty_mean": 0.9833334684371948, "reward_near_duplicate_penalty_std": 0.0076095727272331715, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6474999785423279, "reward_judge_quality_std": 0.297981321811676, "reward_total_composite_mean": 0.49316665530204773, "reward_total_composite_std": 0.3613712787628174} {"timestamp_utc": "2026-04-12T10:47:58Z", "mode": "train", "global_step": 10, "epoch": 0.0004016548178495401, "loss": 0.2127, "grad_norm": 12.192911148071289, "learning_rate": 9.972727272727274e-06, "num_tokens": 22691.0, "completions/mean_length": 106.75, "completions/min_length": 72.0, "completions/max_length": 139.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.75, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 139.0, "rewards/meter/mean": 0.6715837717056274, "rewards/meter/std": 0.3977217972278595, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9872806668281555, "rewards/repeat_penalty/std": 0.013390115462243557, "rewards/near_duplicate_penalty/mean": 0.9872806668281555, "rewards/near_duplicate_penalty/std": 0.013390115462243557, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25240373611450195, "rewards/total_composite/std": 0.16661977767944336, "reward": 0.25240373611450195, "reward_std": 0.16661976277828217, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20312635600566864, "sampling/sampling_logp_difference/max": 1.5351839065551758, "sampling/importance_sampling_ratio/min": 0.2154160737991333, "sampling/importance_sampling_ratio/mean": 1.0280596017837524, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.019076704978943, "clip_ratio/low_mean": 0.09650039486587048, "clip_ratio/low_min": 0.09650039486587048, "clip_ratio/high_mean": 0.10350521840155125, "clip_ratio/high_max": 0.10350521840155125, "clip_ratio/region_mean": 0.20000561326742172, "reward_total_mean": 0.25240373611450195, "reward_meter_mean": 0.6715837717056274, "reward_meter_std": 0.3977217972278595, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9872806668281555, "reward_repeat_penalty_std": 0.013390115462243557, "reward_near_duplicate_penalty_mean": 0.9872806668281555, "reward_near_duplicate_penalty_std": 0.013390115462243557, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.25240373611450195, "reward_total_composite_std": 0.16661977767944336} {"timestamp_utc": "2026-04-12T10:48:07Z", "mode": "train", "global_step": 11, "epoch": 0.00044182029963449413, "loss": 0.0765, "grad_norm": 13.076592445373535, "learning_rate": 9.96969696969697e-06, "num_tokens": 24463.0, "completions/mean_length": 55.5, "completions/min_length": 46.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.5, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.27222830057144165, "rewards/meter/std": 0.2973862588405609, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9712885022163391, "rewards/lexical_plausibility/std": 0.08120834082365036, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9347968101501465, "rewards/repeat_penalty/std": 0.17061248421669006, "rewards/near_duplicate_penalty/mean": 0.9826840162277222, "rewards/near_duplicate_penalty/std": 0.03586622327566147, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9704141616821289, "rewards/distinct_2/std": 0.08368128538131714, "rewards/total_composite/mean": 0.16706141829490662, "rewards/total_composite/std": 0.2936072051525116, "reward": 0.16706141829490662, "reward_std": 0.2936071753501892, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2019934505224228, "sampling/sampling_logp_difference/max": 2.018817901611328, "sampling/importance_sampling_ratio/min": 0.13281236588954926, "sampling/importance_sampling_ratio/mean": 1.0267703533172607, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3748232424259186, "clip_ratio/low_mean": 0.14291187189519405, "clip_ratio/low_min": 0.14291187189519405, "clip_ratio/high_mean": 0.05877896584570408, "clip_ratio/high_max": 0.05877896584570408, "clip_ratio/region_mean": 0.20169083774089813, "reward_total_mean": 0.16706141829490662, "reward_meter_mean": 0.27222830057144165, "reward_meter_std": 0.2973862588405609, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9712885022163391, "reward_lexical_plausibility_std": 0.08120834082365036, "reward_repeat_penalty_mean": 0.9347968101501465, "reward_repeat_penalty_std": 0.17061248421669006, "reward_near_duplicate_penalty_mean": 0.9826840162277222, "reward_near_duplicate_penalty_std": 0.03586622327566147, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9704141616821289, "reward_distinct_2_std": 0.08368128538131714, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.16706141829490662, "reward_total_composite_std": 0.2936072051525116} {"timestamp_utc": "2026-04-12T10:48:22Z", "mode": "train", "global_step": 12, "epoch": 0.0004819857814194481, "loss": 0.0813, "grad_norm": 5.912014961242676, "learning_rate": 9.966666666666667e-06, "num_tokens": 29097.0, "completions/mean_length": 354.25, "completions/min_length": 201.0, "completions/max_length": 487.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 354.25, "completions/min_terminated_length": 201.0, "completions/max_terminated_length": 487.0, "rewards/meter/mean": 0.35211530327796936, "rewards/meter/std": 0.24533754587173462, "rewards/count_adherence/mean": 0.884615421295166, "rewards/count_adherence/std": 0.058148376643657684, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9808359146118164, "rewards/repeat_penalty/std": 0.016977891325950623, "rewards/near_duplicate_penalty/mean": 0.9925937652587891, "rewards/near_duplicate_penalty/std": 0.004112385679036379, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9881381988525391, "rewards/distinct_2/std": 0.015464049763977528, "rewards/total_composite/mean": 0.0739469900727272, "rewards/total_composite/std": 0.054342567920684814, "reward": 0.0739469900727272, "reward_std": 0.054342564195394516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22679691016674042, "sampling/sampling_logp_difference/max": 2.1510400772094727, "sampling/importance_sampling_ratio/min": 0.11636307090520859, "sampling/importance_sampling_ratio/mean": 1.038204550743103, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.89529550075531, "clip_ratio/low_mean": 0.11654424481093884, "clip_ratio/low_min": 0.11654424481093884, "clip_ratio/high_mean": 0.08761620707809925, "clip_ratio/high_max": 0.08761620707809925, "clip_ratio/region_mean": 0.20416045188903809, "reward_total_mean": 0.0739469900727272, "reward_meter_mean": 0.35211530327796936, "reward_meter_std": 0.24533754587173462, "reward_count_adherence_mean": 0.884615421295166, "reward_count_adherence_std": 0.058148376643657684, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9808359146118164, "reward_repeat_penalty_std": 0.016977891325950623, "reward_near_duplicate_penalty_mean": 0.9925937652587891, "reward_near_duplicate_penalty_std": 0.004112385679036379, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9881381988525391, "reward_distinct_2_std": 0.015464049763977528, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.0739469900727272, "reward_total_composite_std": 0.054342567920684814} {"timestamp_utc": "2026-04-12T10:48:32Z", "mode": "train", "global_step": 13, "epoch": 0.0005221512632044022, "loss": 0.2481, "grad_norm": 19.421398162841797, "learning_rate": 9.963636363636364e-06, "num_tokens": 30718.0, "completions/mean_length": 42.625, "completions/min_length": 31.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.625, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.5187985897064209, "rewards/meter/std": 0.4365939795970917, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8742079734802246, "rewards/lexical_plausibility/std": 0.19562670588493347, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9942833185195923, "rewards/repeat_penalty/std": 0.01435972098261118, "rewards/near_duplicate_penalty/mean": 0.9942833185195923, "rewards/near_duplicate_penalty/std": 0.01435972098261118, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15214984118938446, "rewards/total_composite/std": 0.18843550980091095, "reward": 0.15214984118938446, "reward_std": 0.18843549489974976, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23536482453346252, "sampling/sampling_logp_difference/max": 2.879500389099121, "sampling/importance_sampling_ratio/min": 0.056162815541028976, "sampling/importance_sampling_ratio/mean": 1.0110152959823608, "sampling/importance_sampling_ratio/max": 1.987526774406433, "entropy": 1.822215810418129, "clip_ratio/low_mean": 0.10695216665044427, "clip_ratio/low_min": 0.10695216665044427, "clip_ratio/high_mean": 0.08850806392729282, "clip_ratio/high_max": 0.08850806392729282, "clip_ratio/region_mean": 0.1954602305777371, "reward_total_mean": 0.15214984118938446, "reward_meter_mean": 0.5187985897064209, "reward_meter_std": 0.4365939795970917, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8742079734802246, "reward_lexical_plausibility_std": 0.19562670588493347, "reward_repeat_penalty_mean": 0.9942833185195923, "reward_repeat_penalty_std": 0.01435972098261118, "reward_near_duplicate_penalty_mean": 0.9942833185195923, "reward_near_duplicate_penalty_std": 0.01435972098261118, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.15214984118938446, "reward_total_composite_std": 0.18843550980091095} {"timestamp_utc": "2026-04-12T10:48:40Z", "mode": "train", "global_step": 14, "epoch": 0.0005623167449893561, "loss": 0.0002, "grad_norm": 16.93572998046875, "learning_rate": 9.960606060606062e-06, "num_tokens": 32314.0, "completions/mean_length": 40.5, "completions/min_length": 31.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8533340692520142, "rewards/meter/std": 0.20150882005691528, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.9495680928230286, "rewards/repeat_penalty/std": 0.11365896463394165, "rewards/near_duplicate_penalty/mean": 0.9868184328079224, "rewards/near_duplicate_penalty/std": 0.016084030270576477, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.37042945623397827, "rewards/total_composite/std": 0.06580816209316254, "reward": 0.37042945623397827, "reward_std": 0.06580816209316254, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19301632046699524, "sampling/sampling_logp_difference/max": 1.195810317993164, "sampling/importance_sampling_ratio/min": 0.3146522641181946, "sampling/importance_sampling_ratio/mean": 1.0376253128051758, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7731505632400513, "clip_ratio/low_mean": 0.09220211394131184, "clip_ratio/low_min": 0.09220211394131184, "clip_ratio/high_mean": 0.08251201920211315, "clip_ratio/high_max": 0.08251201920211315, "clip_ratio/region_mean": 0.174714133143425, "reward_total_mean": 0.37042945623397827, "reward_meter_mean": 0.8533340692520142, "reward_meter_std": 0.20150882005691528, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9495680928230286, "reward_repeat_penalty_std": 0.11365896463394165, "reward_near_duplicate_penalty_mean": 0.9868184328079224, "reward_near_duplicate_penalty_std": 0.016084030270576477, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.37042945623397827, "reward_total_composite_std": 0.06580816209316254} {"timestamp_utc": "2026-04-12T10:48:50Z", "mode": "train", "global_step": 15, "epoch": 0.0006024822267743102, "loss": 0.0265, "grad_norm": 16.918575286865234, "learning_rate": 9.957575757575757e-06, "num_tokens": 34037.0, "completions/mean_length": 45.375, "completions/min_length": 38.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6372770071029663, "rewards/meter/std": 0.43653595447540283, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9914492964744568, "rewards/lexical_plausibility/std": 0.024185042828321457, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30071666836738586, "rewards/total_composite/std": 0.27117469906806946, "reward": 0.30071666836738586, "reward_std": 0.27117466926574707, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.224419966340065, "sampling/sampling_logp_difference/max": 1.8789808750152588, "sampling/importance_sampling_ratio/min": 0.17696641385555267, "sampling/importance_sampling_ratio/mean": 1.0451421737670898, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2488113194704056, "clip_ratio/low_mean": 0.07137374579906464, "clip_ratio/low_min": 0.07137374579906464, "clip_ratio/high_mean": 0.14608749747276306, "clip_ratio/high_max": 0.14608749747276306, "clip_ratio/region_mean": 0.2174612432718277, "reward_total_mean": 0.30071666836738586, "reward_meter_mean": 0.6372770071029663, "reward_meter_std": 0.43653595447540283, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9914492964744568, "reward_lexical_plausibility_std": 0.024185042828321457, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.30071666836738586, "reward_total_composite_std": 0.27117469906806946} {"timestamp_utc": "2026-04-12T10:49:05Z", "mode": "train", "global_step": 16, "epoch": 0.0006426477085592642, "loss": -0.1238, "grad_norm": 4.117391109466553, "learning_rate": 9.954545454545456e-06, "num_tokens": 37943.0, "completions/mean_length": 341.25, "completions/min_length": 241.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 316.8571472167969, "completions/min_terminated_length": 241.0, "completions/max_terminated_length": 505.0, "rewards/meter/mean": 0.7447863817214966, "rewards/meter/std": 0.20929576456546783, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.0629940927028656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.987236499786377, "rewards/lexical_plausibility/std": 0.03610069304704666, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9948620796203613, "rewards/repeat_penalty/std": 0.0043237595818936825, "rewards/near_duplicate_penalty/mean": 0.9962705373764038, "rewards/near_duplicate_penalty/std": 0.001476338948123157, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9985859394073486, "rewards/distinct_2/std": 0.003999483305960894, "rewards/total_composite/mean": 0.21612676978111267, "rewards/total_composite/std": 0.08605542778968811, "reward": 0.21612676978111267, "reward_std": 0.08605542778968811, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.226578027009964, "sampling/sampling_logp_difference/max": 1.4890222549438477, "sampling/importance_sampling_ratio/min": 0.22559311985969543, "sampling/importance_sampling_ratio/mean": 1.0435864925384521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8357963263988495, "clip_ratio/low_mean": 0.04257149621844292, "clip_ratio/low_min": 0.04257149621844292, "clip_ratio/high_mean": 0.1372001487761736, "clip_ratio/high_max": 0.1372001487761736, "clip_ratio/region_mean": 0.1797716449946165, "reward_total_mean": 0.21612676978111267, "reward_meter_mean": 0.7447863817214966, "reward_meter_std": 0.20929576456546783, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.0629940927028656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.987236499786377, "reward_lexical_plausibility_std": 0.03610069304704666, "reward_repeat_penalty_mean": 0.9948620796203613, "reward_repeat_penalty_std": 0.0043237595818936825, "reward_near_duplicate_penalty_mean": 0.9962705373764038, "reward_near_duplicate_penalty_std": 0.001476338948123157, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9985859394073486, "reward_distinct_2_std": 0.003999483305960894, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.21612676978111267, "reward_total_composite_std": 0.08605542778968811} {"timestamp_utc": "2026-04-12T10:49:14Z", "mode": "train", "global_step": 17, "epoch": 0.0006828131903442181, "loss": 0.1153, "grad_norm": 12.76971435546875, "learning_rate": 9.951515151515152e-06, "num_tokens": 39853.0, "completions/mean_length": 61.75, "completions/min_length": 52.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.75, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.5454095602035522, "rewards/meter/std": 0.4127260148525238, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9719981551170349, "rewards/lexical_plausibility/std": 0.06866878271102905, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.15059404075145721, "rewards/repeat_penalty/mean": 0.9964045882225037, "rewards/repeat_penalty/std": 0.009191551245748997, "rewards/near_duplicate_penalty/mean": 0.9964045882225037, "rewards/near_duplicate_penalty/std": 0.009191551245748997, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15721666812896729, "rewards/total_composite/std": 0.17351087927818298, "reward": 0.15721666812896729, "reward_std": 0.17351087927818298, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21241459250450134, "sampling/sampling_logp_difference/max": 1.8289339542388916, "sampling/importance_sampling_ratio/min": 0.16058465838432312, "sampling/importance_sampling_ratio/mean": 1.0272700786590576, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.273869574069977, "clip_ratio/low_mean": 0.1418552715331316, "clip_ratio/low_min": 0.1418552715331316, "clip_ratio/high_mean": 0.05208333395421505, "clip_ratio/high_max": 0.05208333395421505, "clip_ratio/region_mean": 0.19393860548734665, "reward_total_mean": 0.15721666812896729, "reward_meter_mean": 0.5454095602035522, "reward_meter_std": 0.4127260148525238, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9719981551170349, "reward_lexical_plausibility_std": 0.06866878271102905, "reward_repeat_penalty_mean": 0.9964045882225037, "reward_repeat_penalty_std": 0.009191551245748997, "reward_near_duplicate_penalty_mean": 0.9964045882225037, "reward_near_duplicate_penalty_std": 0.009191551245748997, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.15059404075145721, "reward_total_composite_mean": 0.15721666812896729, "reward_total_composite_std": 0.17351087927818298} {"timestamp_utc": "2026-04-12T10:49:24Z", "mode": "train", "global_step": 18, "epoch": 0.0007229786721291722, "loss": 0.1304, "grad_norm": 10.411269187927246, "learning_rate": 9.948484848484849e-06, "num_tokens": 42337.0, "completions/mean_length": 111.5, "completions/min_length": 82.0, "completions/max_length": 153.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.5, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.30559873580932617, "rewards/meter/std": 0.2158714085817337, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9970646500587463, "rewards/lexical_plausibility/std": 0.008302465081214905, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.993833065032959, "rewards/repeat_penalty/std": 0.005085999146103859, "rewards/near_duplicate_penalty/mean": 0.993833065032959, "rewards/near_duplicate_penalty/std": 0.005085999146103859, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09969823062419891, "rewards/total_composite/std": 0.07957087457180023, "reward": 0.09969823062419891, "reward_std": 0.07957086712121964, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22139480710029602, "sampling/sampling_logp_difference/max": 1.6972432136535645, "sampling/importance_sampling_ratio/min": 0.1831878274679184, "sampling/importance_sampling_ratio/mean": 1.0457409620285034, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.325631469488144, "clip_ratio/low_mean": 0.1352362111210823, "clip_ratio/low_min": 0.1352362111210823, "clip_ratio/high_mean": 0.07688837312161922, "clip_ratio/high_max": 0.07688837312161922, "clip_ratio/region_mean": 0.21212458424270153, "reward_total_mean": 0.09969823062419891, "reward_meter_mean": 0.30559873580932617, "reward_meter_std": 0.2158714085817337, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9970646500587463, "reward_lexical_plausibility_std": 0.008302465081214905, "reward_repeat_penalty_mean": 0.993833065032959, "reward_repeat_penalty_std": 0.005085999146103859, "reward_near_duplicate_penalty_mean": 0.993833065032959, "reward_near_duplicate_penalty_std": 0.005085999146103859, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.09969823062419891, "reward_total_composite_std": 0.07957087457180023} {"timestamp_utc": "2026-04-12T10:49:39Z", "mode": "train", "global_step": 19, "epoch": 0.0007631441539141262, "loss": -0.1513, "grad_norm": 4.030255317687988, "learning_rate": 9.945454545454546e-06, "num_tokens": 45873.0, "completions/mean_length": 423.0, "completions/min_length": 340.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 369.6000061035156, "completions/min_terminated_length": 340.0, "completions/max_terminated_length": 421.0, "rewards/meter/mean": 0.7693527936935425, "rewards/meter/std": 0.2262124866247177, "rewards/count_adherence/mean": 0.859375, "rewards/count_adherence/std": 0.09300298243761063, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.993139922618866, "rewards/repeat_penalty/std": 0.004596802871674299, "rewards/near_duplicate_penalty/mean": 0.9956949353218079, "rewards/near_duplicate_penalty/std": 0.0011396065820008516, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9974359273910522, "rewards/distinct_2/std": 0.004941675346344709, "rewards/total_composite/mean": 0.12036975473165512, "rewards/total_composite/std": 0.1208464652299881, "reward": 0.12036975473165512, "reward_std": 0.1208464577794075, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2371300756931305, "sampling/sampling_logp_difference/max": 1.7566866874694824, "sampling/importance_sampling_ratio/min": 0.17261584103107452, "sampling/importance_sampling_ratio/mean": 1.0483399629592896, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2320169508457184, "clip_ratio/low_mean": 0.044943422079086304, "clip_ratio/low_min": 0.044943422079086304, "clip_ratio/high_mean": 0.07177441194653511, "clip_ratio/high_max": 0.07177441194653511, "clip_ratio/region_mean": 0.11671783402562141, "reward_total_mean": 0.12036975473165512, "reward_meter_mean": 0.7693527936935425, "reward_meter_std": 0.2262124866247177, "reward_count_adherence_mean": 0.859375, "reward_count_adherence_std": 0.09300298243761063, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.993139922618866, "reward_repeat_penalty_std": 0.004596802871674299, "reward_near_duplicate_penalty_mean": 0.9956949353218079, "reward_near_duplicate_penalty_std": 0.0011396065820008516, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9974359273910522, "reward_distinct_2_std": 0.004941675346344709, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.12036975473165512, "reward_total_composite_std": 0.1208464652299881} {"timestamp_utc": "2026-04-12T10:49:49Z", "mode": "train", "global_step": 20, "epoch": 0.0008033096356990802, "loss": -0.0446, "grad_norm": 14.589115142822266, "learning_rate": 9.942424242424244e-06, "num_tokens": 47559.0, "completions/mean_length": 56.75, "completions/min_length": 50.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.75, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.7581713199615479, "rewards/meter/std": 0.27885109186172485, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.1642080396413803, "rewards/repeat_penalty/mean": 0.953586757183075, "rewards/repeat_penalty/std": 0.05533900484442711, "rewards/near_duplicate_penalty/mean": 0.984272837638855, "rewards/near_duplicate_penalty/std": 0.017149362713098526, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9687758684158325, "rewards/distinct_2/std": 0.052724964916706085, "rewards/total_composite/mean": 0.313514769077301, "rewards/total_composite/std": 0.17180955410003662, "reward": 0.313514769077301, "reward_std": 0.17180955410003662, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20675396919250488, "sampling/sampling_logp_difference/max": 1.9559001922607422, "sampling/importance_sampling_ratio/min": 0.1414370983839035, "sampling/importance_sampling_ratio/mean": 1.0213472843170166, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1328125447034836, "clip_ratio/low_mean": 0.07940024230629206, "clip_ratio/low_min": 0.07940024230629206, "clip_ratio/high_mean": 0.12832210678607225, "clip_ratio/high_max": 0.12832210678607225, "clip_ratio/region_mean": 0.2077223490923643, "reward_total_mean": 0.313514769077301, "reward_meter_mean": 0.7581713199615479, "reward_meter_std": 0.27885109186172485, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.953586757183075, "reward_repeat_penalty_std": 0.05533900484442711, "reward_near_duplicate_penalty_mean": 0.984272837638855, "reward_near_duplicate_penalty_std": 0.017149362713098526, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9687758684158325, "reward_distinct_2_std": 0.052724964916706085, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.1642080396413803, "reward_total_composite_mean": 0.313514769077301, "reward_total_composite_std": 0.17180955410003662} {"timestamp_utc": "2026-04-12T10:49:58Z", "mode": "train", "global_step": 21, "epoch": 0.0008434751174840342, "loss": -0.1181, "grad_norm": 23.028400421142578, "learning_rate": 9.939393939393939e-06, "num_tokens": 49413.0, "completions/mean_length": 63.75, "completions/min_length": 46.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.75, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.30991411209106445, "rewards/meter/std": 0.31503260135650635, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.951915979385376, "rewards/repeat_penalty/std": 0.04889478534460068, "rewards/near_duplicate_penalty/mean": 0.9737776517868042, "rewards/near_duplicate_penalty/std": 0.0162584837526083, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9773937463760376, "rewards/distinct_2/std": 0.04370811954140663, "rewards/total_composite/mean": 0.11938978731632233, "rewards/total_composite/std": 0.13373103737831116, "reward": 0.11938978731632233, "reward_std": 0.13373102247714996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25628936290740967, "sampling/sampling_logp_difference/max": 2.406100273132324, "sampling/importance_sampling_ratio/min": 0.09016623347997665, "sampling/importance_sampling_ratio/mean": 1.0086053609848022, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8061425983905792, "clip_ratio/low_mean": 0.15841219387948513, "clip_ratio/low_min": 0.15841219387948513, "clip_ratio/high_mean": 0.08339367993175983, "clip_ratio/high_max": 0.08339367993175983, "clip_ratio/region_mean": 0.24180587381124496, "reward_total_mean": 0.11938978731632233, "reward_meter_mean": 0.30991411209106445, "reward_meter_std": 0.31503260135650635, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.951915979385376, "reward_repeat_penalty_std": 0.04889478534460068, "reward_near_duplicate_penalty_mean": 0.9737776517868042, "reward_near_duplicate_penalty_std": 0.0162584837526083, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9773937463760376, "reward_distinct_2_std": 0.04370811954140663, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.11938978731632233, "reward_total_composite_std": 0.13373103737831116} {"timestamp_utc": "2026-04-12T10:50:06Z", "mode": "train", "global_step": 22, "epoch": 0.0008836405992689883, "loss": 0.2068, "grad_norm": 20.567657470703125, "learning_rate": 9.936363636363638e-06, "num_tokens": 51184.0, "completions/mean_length": 38.375, "completions/min_length": 32.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.8363314867019653, "rewards/meter/std": 0.3087863326072693, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.9796510338783264, "rewards/repeat_penalty/std": 0.023779788985848427, "rewards/near_duplicate_penalty/mean": 0.9888085126876831, "rewards/near_duplicate_penalty/std": 0.011351306922733784, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.6647837162017822, "rewards/total_composite/std": 0.3457593619823456, "reward": 0.6647837162017822, "reward_std": 0.3457593619823456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10561378300189972, "sampling/sampling_logp_difference/max": 1.8625006675720215, "sampling/importance_sampling_ratio/min": 0.1552838236093521, "sampling/importance_sampling_ratio/mean": 1.0084288120269775, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.727835550904274, "clip_ratio/low_mean": 0.06501548085361719, "clip_ratio/low_min": 0.06501548085361719, "clip_ratio/high_mean": 0.030665107304230332, "clip_ratio/high_max": 0.030665107304230332, "clip_ratio/region_mean": 0.09568058815784752, "reward_total_mean": 0.6647837162017822, "reward_meter_mean": 0.8363314867019653, "reward_meter_std": 0.3087863326072693, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9796510338783264, "reward_repeat_penalty_std": 0.023779788985848427, "reward_near_duplicate_penalty_mean": 0.9888085126876831, "reward_near_duplicate_penalty_std": 0.011351306922733784, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.6647837162017822, "reward_total_composite_std": 0.3457593619823456} {"timestamp_utc": "2026-04-12T10:50:21Z", "mode": "train", "global_step": 23, "epoch": 0.0009238060810539422, "loss": -0.0034, "grad_norm": 2.6942813396453857, "learning_rate": 9.933333333333334e-06, "num_tokens": 53733.0, "completions/mean_length": 498.625, "completions/min_length": 405.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 458.5, "completions/min_terminated_length": 405.0, "completions/max_terminated_length": 512.0, "rewards/meter/mean": 0.8259201049804688, "rewards/meter/std": 0.15692374110221863, "rewards/count_adherence/mean": 0.9642857313156128, "rewards/count_adherence/std": 0.05399492755532265, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9857219457626343, "rewards/lexical_plausibility/std": 0.026594150811433792, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9891016483306885, "rewards/repeat_penalty/std": 0.008064168505370617, "rewards/near_duplicate_penalty/mean": 0.9955102801322937, "rewards/near_duplicate_penalty/std": 0.0016857460141181946, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9935599565505981, "rewards/distinct_2/std": 0.0075568766333162785, "rewards/total_composite/mean": 0.1499270498752594, "rewards/total_composite/std": 0.042359739542007446, "reward": 0.1499270498752594, "reward_std": 0.042359739542007446, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2144458144903183, "sampling/sampling_logp_difference/max": 1.8869943618774414, "sampling/importance_sampling_ratio/min": 0.1515265703201294, "sampling/importance_sampling_ratio/mean": 1.034726619720459, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.765936017036438, "clip_ratio/low_mean": 0.021484375, "clip_ratio/low_min": 0.021484375, "clip_ratio/high_mean": 0.024074073880910873, "clip_ratio/high_max": 0.024074073880910873, "clip_ratio/region_mean": 0.04555844888091087, "reward_total_mean": 0.1499270498752594, "reward_meter_mean": 0.8259201049804688, "reward_meter_std": 0.15692374110221863, "reward_count_adherence_mean": 0.9642857313156128, "reward_count_adherence_std": 0.05399492755532265, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9857219457626343, "reward_lexical_plausibility_std": 0.026594150811433792, "reward_repeat_penalty_mean": 0.9891016483306885, "reward_repeat_penalty_std": 0.008064168505370617, "reward_near_duplicate_penalty_mean": 0.9955102801322937, "reward_near_duplicate_penalty_std": 0.0016857460141181946, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9935599565505981, "reward_distinct_2_std": 0.0075568766333162785, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1499270498752594, "reward_total_composite_std": 0.042359739542007446} {"timestamp_utc": "2026-04-12T10:50:31Z", "mode": "train", "global_step": 24, "epoch": 0.0009639715628388962, "loss": 0.0694, "grad_norm": 11.913330078125, "learning_rate": 9.930303030303031e-06, "num_tokens": 55755.0, "completions/mean_length": 85.75, "completions/min_length": 53.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.75, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.516542911529541, "rewards/meter/std": 0.34262797236442566, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9855961203575134, "rewards/repeat_penalty/std": 0.01391402818262577, "rewards/near_duplicate_penalty/mean": 0.9855961203575134, "rewards/near_duplicate_penalty/std": 0.01391402818262577, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14416193962097168, "rewards/total_composite/std": 0.11695463955402374, "reward": 0.14416193962097168, "reward_std": 0.11695463955402374, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21823984384536743, "sampling/sampling_logp_difference/max": 2.2229785919189453, "sampling/importance_sampling_ratio/min": 0.10828609019517899, "sampling/importance_sampling_ratio/mean": 1.012178897857666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1747989654541016, "clip_ratio/low_mean": 0.07377693615853786, "clip_ratio/low_min": 0.07377693615853786, "clip_ratio/high_mean": 0.15401890873908997, "clip_ratio/high_max": 0.15401890873908997, "clip_ratio/region_mean": 0.22779584489762783, "reward_total_mean": 0.14416193962097168, "reward_meter_mean": 0.516542911529541, "reward_meter_std": 0.34262797236442566, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9855961203575134, "reward_repeat_penalty_std": 0.01391402818262577, "reward_near_duplicate_penalty_mean": 0.9855961203575134, "reward_near_duplicate_penalty_std": 0.01391402818262577, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.14416193962097168, "reward_total_composite_std": 0.11695463955402374} {"timestamp_utc": "2026-04-12T10:50:40Z", "mode": "train", "global_step": 25, "epoch": 0.0010041370446238502, "loss": 0.1321, "grad_norm": 11.314960479736328, "learning_rate": 9.927272727272728e-06, "num_tokens": 57941.0, "completions/mean_length": 88.25, "completions/min_length": 69.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 88.25, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.3611519932746887, "rewards/meter/std": 0.3820111155509949, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9807378053665161, "rewards/lexical_plausibility/std": 0.029874874278903008, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9859764575958252, "rewards/repeat_penalty/std": 0.022083619609475136, "rewards/near_duplicate_penalty/mean": 0.992519736289978, "rewards/near_duplicate_penalty/std": 0.007646000944077969, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.13510285317897797, "rewards/total_composite/std": 0.14426524937152863, "reward": 0.13510285317897797, "reward_std": 0.14426523447036743, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1977376788854599, "sampling/sampling_logp_difference/max": 1.5759835243225098, "sampling/importance_sampling_ratio/min": 0.2068040668964386, "sampling/importance_sampling_ratio/mean": 1.0206221342086792, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7679535001516342, "clip_ratio/low_mean": 0.11564315110445023, "clip_ratio/low_min": 0.11564315110445023, "clip_ratio/high_mean": 0.07766031473875046, "clip_ratio/high_max": 0.07766031473875046, "clip_ratio/region_mean": 0.19330346584320068, "reward_total_mean": 0.13510285317897797, "reward_meter_mean": 0.3611519932746887, "reward_meter_std": 0.3820111155509949, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9807378053665161, "reward_lexical_plausibility_std": 0.029874874278903008, "reward_repeat_penalty_mean": 0.9859764575958252, "reward_repeat_penalty_std": 0.022083619609475136, "reward_near_duplicate_penalty_mean": 0.992519736289978, "reward_near_duplicate_penalty_std": 0.007646000944077969, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.13510285317897797, "reward_total_composite_std": 0.14426524937152863} {"timestamp_utc": "2026-04-12T10:50:49Z", "mode": "train", "global_step": 26, "epoch": 0.0010443025264088043, "loss": 0.0648, "grad_norm": 16.19539451599121, "learning_rate": 9.924242424242425e-06, "num_tokens": 59731.0, "completions/mean_length": 64.75, "completions/min_length": 46.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.75, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.5833607316017151, "rewards/meter/std": 0.4440600275993347, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9788110256195068, "rewards/lexical_plausibility/std": 0.05993138626217842, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.9924741387367249, "rewards/repeat_penalty/std": 0.011241739615797997, "rewards/near_duplicate_penalty/mean": 0.9924741387367249, "rewards/near_duplicate_penalty/std": 0.011241739615797997, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2691909372806549, "rewards/total_composite/std": 0.2605314254760742, "reward": 0.2691909372806549, "reward_std": 0.2605314254760742, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2431088238954544, "sampling/sampling_logp_difference/max": 1.6622037887573242, "sampling/importance_sampling_ratio/min": 0.18972042202949524, "sampling/importance_sampling_ratio/mean": 1.0399829149246216, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0710978358983994, "clip_ratio/low_mean": 0.08128589391708374, "clip_ratio/low_min": 0.08128589391708374, "clip_ratio/high_mean": 0.1346008237451315, "clip_ratio/high_max": 0.1346008237451315, "clip_ratio/region_mean": 0.21588671766221523, "reward_total_mean": 0.2691909372806549, "reward_meter_mean": 0.5833607316017151, "reward_meter_std": 0.4440600275993347, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9788110256195068, "reward_lexical_plausibility_std": 0.05993138626217842, "reward_repeat_penalty_mean": 0.9924741387367249, "reward_repeat_penalty_std": 0.011241739615797997, "reward_near_duplicate_penalty_mean": 0.9924741387367249, "reward_near_duplicate_penalty_std": 0.011241739615797997, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.2691909372806549, "reward_total_composite_std": 0.2605314254760742} {"timestamp_utc": "2026-04-12T10:50:59Z", "mode": "train", "global_step": 27, "epoch": 0.0010844680081937583, "loss": 0.054, "grad_norm": 18.46763801574707, "learning_rate": 9.921212121212121e-06, "num_tokens": 61588.0, "completions/mean_length": 57.125, "completions/min_length": 42.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.125, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.5880099534988403, "rewards/meter/std": 0.3607083559036255, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9886506795883179, "rewards/repeat_penalty/std": 0.02050127275288105, "rewards/near_duplicate_penalty/mean": 0.9960471391677856, "rewards/near_duplicate_penalty/std": 0.007033475674688816, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.18190374970436096, "rewards/total_composite/std": 0.11817481368780136, "reward": 0.18190374970436096, "reward_std": 0.11817480623722076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23327620327472687, "sampling/sampling_logp_difference/max": 1.5300722122192383, "sampling/importance_sampling_ratio/min": 0.2165200412273407, "sampling/importance_sampling_ratio/mean": 1.0309526920318604, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9116510599851608, "clip_ratio/low_mean": 0.11785485781729221, "clip_ratio/low_min": 0.11785485781729221, "clip_ratio/high_mean": 0.0773110780864954, "clip_ratio/high_max": 0.0773110780864954, "clip_ratio/region_mean": 0.1951659359037876, "reward_total_mean": 0.18190374970436096, "reward_meter_mean": 0.5880099534988403, "reward_meter_std": 0.3607083559036255, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9886506795883179, "reward_repeat_penalty_std": 0.02050127275288105, "reward_near_duplicate_penalty_mean": 0.9960471391677856, "reward_near_duplicate_penalty_std": 0.007033475674688816, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.18190374970436096, "reward_total_composite_std": 0.11817481368780136} {"timestamp_utc": "2026-04-12T10:51:07Z", "mode": "train", "global_step": 28, "epoch": 0.0011246334899787122, "loss": -0.0355, "grad_norm": 16.11900520324707, "learning_rate": 9.918181818181818e-06, "num_tokens": 63174.0, "completions/mean_length": 51.25, "completions/min_length": 37.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7667711973190308, "rewards/meter/std": 0.35821136832237244, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9875565767288208, "rewards/lexical_plausibility/std": 0.025101033970713615, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9867918491363525, "rewards/repeat_penalty/std": 0.028985347598791122, "rewards/near_duplicate_penalty/mean": 0.9867918491363525, "rewards/near_duplicate_penalty/std": 0.028985347598791122, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2989039719104767, "rewards/total_composite/std": 0.16186337172985077, "reward": 0.2989039719104767, "reward_std": 0.16186335682868958, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2023225873708725, "sampling/sampling_logp_difference/max": 1.1405749320983887, "sampling/importance_sampling_ratio/min": 0.31963521242141724, "sampling/importance_sampling_ratio/mean": 1.0361260175704956, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1601669788360596, "clip_ratio/low_mean": 0.041732910089194775, "clip_ratio/low_min": 0.041732910089194775, "clip_ratio/high_mean": 0.1668364442884922, "clip_ratio/high_max": 0.1668364442884922, "clip_ratio/region_mean": 0.20856935437768698, "reward_total_mean": 0.2989039719104767, "reward_meter_mean": 0.7667711973190308, "reward_meter_std": 0.35821136832237244, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9875565767288208, "reward_lexical_plausibility_std": 0.025101033970713615, "reward_repeat_penalty_mean": 0.9867918491363525, "reward_repeat_penalty_std": 0.028985347598791122, "reward_near_duplicate_penalty_mean": 0.9867918491363525, "reward_near_duplicate_penalty_std": 0.028985347598791122, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.2989039719104767, "reward_total_composite_std": 0.16186337172985077} {"timestamp_utc": "2026-04-12T10:51:21Z", "mode": "train", "global_step": 29, "epoch": 0.0011647989717636664, "loss": 0.109, "grad_norm": 8.28359603881836, "learning_rate": 9.915151515151515e-06, "num_tokens": 66740.0, "completions/mean_length": 208.75, "completions/min_length": 181.0, "completions/max_length": 240.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 208.75, "completions/min_terminated_length": 181.0, "completions/max_terminated_length": 240.0, "rewards/meter/mean": 0.1128695011138916, "rewards/meter/std": 0.04446408152580261, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9927715063095093, "rewards/repeat_penalty/std": 0.007351625245064497, "rewards/near_duplicate_penalty/mean": 0.9953268766403198, "rewards/near_duplicate_penalty/std": 0.003063744166865945, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9974359273910522, "rewards/distinct_2/std": 0.007252376992255449, "rewards/total_composite/mean": 0.03924858197569847, "rewards/total_composite/std": 0.014390570111572742, "reward": 0.03924858197569847, "reward_std": 0.014390568248927593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23383566737174988, "sampling/sampling_logp_difference/max": 2.1666746139526367, "sampling/importance_sampling_ratio/min": 0.11455792933702469, "sampling/importance_sampling_ratio/mean": 1.0412983894348145, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5335609018802643, "clip_ratio/low_mean": 0.10280177742242813, "clip_ratio/low_min": 0.10280177742242813, "clip_ratio/high_mean": 0.11149711534380913, "clip_ratio/high_max": 0.11149711534380913, "clip_ratio/region_mean": 0.21429889276623726, "reward_total_mean": 0.03924858197569847, "reward_meter_mean": 0.1128695011138916, "reward_meter_std": 0.04446408152580261, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9927715063095093, "reward_repeat_penalty_std": 0.007351625245064497, "reward_near_duplicate_penalty_mean": 0.9953268766403198, "reward_near_duplicate_penalty_std": 0.003063744166865945, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9974359273910522, "reward_distinct_2_std": 0.007252376992255449, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.03924858197569847, "reward_total_composite_std": 0.014390570111572742} {"timestamp_utc": "2026-04-12T10:51:31Z", "mode": "train", "global_step": 30, "epoch": 0.0012049644535486203, "loss": 0.0386, "grad_norm": 11.373634338378906, "learning_rate": 9.912121212121213e-06, "num_tokens": 68703.0, "completions/mean_length": 81.375, "completions/min_length": 65.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.375, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.20140917599201202, "rewards/meter/std": 0.25694817304611206, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9899923205375671, "rewards/repeat_penalty/std": 0.008522940799593925, "rewards/near_duplicate_penalty/mean": 0.9899923205375671, "rewards/near_duplicate_penalty/std": 0.008522940799593925, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08122860640287399, "rewards/total_composite/std": 0.09018824994564056, "reward": 0.08122860640287399, "reward_std": 0.09018824994564056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20405979454517365, "sampling/sampling_logp_difference/max": 1.3296279907226562, "sampling/importance_sampling_ratio/min": 0.26457566022872925, "sampling/importance_sampling_ratio/mean": 1.0039526224136353, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7351030707359314, "clip_ratio/low_mean": 0.14230559766292572, "clip_ratio/low_min": 0.14230559766292572, "clip_ratio/high_mean": 0.050825824961066246, "clip_ratio/high_max": 0.050825824961066246, "clip_ratio/region_mean": 0.19313142262399197, "reward_total_mean": 0.08122860640287399, "reward_meter_mean": 0.20140917599201202, "reward_meter_std": 0.25694817304611206, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9899923205375671, "reward_repeat_penalty_std": 0.008522940799593925, "reward_near_duplicate_penalty_mean": 0.9899923205375671, "reward_near_duplicate_penalty_std": 0.008522940799593925, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.08122860640287399, "reward_total_composite_std": 0.09018824994564056} {"timestamp_utc": "2026-04-12T10:51:41Z", "mode": "train", "global_step": 31, "epoch": 0.0012451299353335742, "loss": 0.0581, "grad_norm": 13.426535606384277, "learning_rate": 9.90909090909091e-06, "num_tokens": 70320.0, "completions/mean_length": 52.125, "completions/min_length": 34.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.6859865188598633, "rewards/meter/std": 0.33277973532676697, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.25783440470695496, "rewards/repeat_penalty/mean": 0.9892197847366333, "rewards/repeat_penalty/std": 0.0152900917455554, "rewards/near_duplicate_penalty/mean": 0.9892197847366333, "rewards/near_duplicate_penalty/std": 0.0152900917455554, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3664495348930359, "rewards/total_composite/std": 0.3514110743999481, "reward": 0.3664495348930359, "reward_std": 0.3514110743999481, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21009325981140137, "sampling/sampling_logp_difference/max": 2.2127251625061035, "sampling/importance_sampling_ratio/min": 0.10940210521221161, "sampling/importance_sampling_ratio/mean": 1.0185762643814087, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6987058073282242, "clip_ratio/low_mean": 0.0922289052978158, "clip_ratio/low_min": 0.0922289052978158, "clip_ratio/high_mean": 0.07851307280361652, "clip_ratio/high_max": 0.07851307280361652, "clip_ratio/region_mean": 0.17074197810143232, "reward_total_mean": 0.3664495348930359, "reward_meter_mean": 0.6859865188598633, "reward_meter_std": 0.33277973532676697, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9892197847366333, "reward_repeat_penalty_std": 0.0152900917455554, "reward_near_duplicate_penalty_mean": 0.9892197847366333, "reward_near_duplicate_penalty_std": 0.0152900917455554, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.25783440470695496, "reward_total_composite_mean": 0.3664495348930359, "reward_total_composite_std": 0.3514110743999481} {"timestamp_utc": "2026-04-12T10:51:50Z", "mode": "train", "global_step": 32, "epoch": 0.0012852954171185284, "loss": 0.0553, "grad_norm": 13.0629243850708, "learning_rate": 9.906060606060607e-06, "num_tokens": 71997.0, "completions/mean_length": 47.625, "completions/min_length": 32.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.625, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.6337600946426392, "rewards/meter/std": 0.4233327805995941, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9900386929512024, "rewards/repeat_penalty/std": 0.01413870882242918, "rewards/near_duplicate_penalty/mean": 0.9900386929512024, "rewards/near_duplicate_penalty/std": 0.01413870882242918, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20086389780044556, "rewards/total_composite/std": 0.18254370987415314, "reward": 0.20086389780044556, "reward_std": 0.18254370987415314, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19689208269119263, "sampling/sampling_logp_difference/max": 2.0852737426757812, "sampling/importance_sampling_ratio/min": 0.12427309155464172, "sampling/importance_sampling_ratio/mean": 1.0180888175964355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.149626463651657, "clip_ratio/low_mean": 0.09710591286420822, "clip_ratio/low_min": 0.09710591286420822, "clip_ratio/high_mean": 0.12454579956829548, "clip_ratio/high_max": 0.12454579956829548, "clip_ratio/region_mean": 0.2216517124325037, "reward_total_mean": 0.20086389780044556, "reward_meter_mean": 0.6337600946426392, "reward_meter_std": 0.4233327805995941, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9900386929512024, "reward_repeat_penalty_std": 0.01413870882242918, "reward_near_duplicate_penalty_mean": 0.9900386929512024, "reward_near_duplicate_penalty_std": 0.01413870882242918, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.20086389780044556, "reward_total_composite_std": 0.18254370987415314} {"timestamp_utc": "2026-04-12T10:52:01Z", "mode": "train", "global_step": 33, "epoch": 0.0013254608989034823, "loss": 0.0425, "grad_norm": 7.572989463806152, "learning_rate": 9.903030303030305e-06, "num_tokens": 74906.0, "completions/mean_length": 174.625, "completions/min_length": 118.0, "completions/max_length": 226.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 174.625, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 226.0, "rewards/meter/mean": 0.6810822486877441, "rewards/meter/std": 0.2588964104652405, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625820279121399, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9818412065505981, "rewards/lexical_plausibility/std": 0.028247511014342308, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9900496602058411, "rewards/repeat_penalty/std": 0.013502294197678566, "rewards/near_duplicate_penalty/mean": 0.996315598487854, "rewards/near_duplicate_penalty/std": 0.002750101499259472, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9936931133270264, "rewards/distinct_2/std": 0.011680135503411293, "rewards/total_composite/mean": 0.178521990776062, "rewards/total_composite/std": 0.07563900202512741, "reward": 0.178521990776062, "reward_std": 0.07563900202512741, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2178238481283188, "sampling/sampling_logp_difference/max": 2.948610305786133, "sampling/importance_sampling_ratio/min": 0.0524124950170517, "sampling/importance_sampling_ratio/mean": 1.042715311050415, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6625306010246277, "clip_ratio/low_mean": 0.12989515997469425, "clip_ratio/low_min": 0.12989515997469425, "clip_ratio/high_mean": 0.07445338554680347, "clip_ratio/high_max": 0.07445338554680347, "clip_ratio/region_mean": 0.20434854552149773, "reward_total_mean": 0.178521990776062, "reward_meter_mean": 0.6810822486877441, "reward_meter_std": 0.2588964104652405, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625820279121399, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9818412065505981, "reward_lexical_plausibility_std": 0.028247511014342308, "reward_repeat_penalty_mean": 0.9900496602058411, "reward_repeat_penalty_std": 0.013502294197678566, "reward_near_duplicate_penalty_mean": 0.996315598487854, "reward_near_duplicate_penalty_std": 0.002750101499259472, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9936931133270264, "reward_distinct_2_std": 0.011680135503411293, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.178521990776062, "reward_total_composite_std": 0.07563900202512741} {"timestamp_utc": "2026-04-12T10:52:12Z", "mode": "train", "global_step": 34, "epoch": 0.0013656263806884363, "loss": 0.0509, "grad_norm": 9.460807800292969, "learning_rate": 9.9e-06, "num_tokens": 77072.0, "completions/mean_length": 105.75, "completions/min_length": 74.0, "completions/max_length": 133.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 105.75, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 133.0, "rewards/meter/mean": 0.49930068850517273, "rewards/meter/std": 0.4238707423210144, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.995398998260498, "rewards/lexical_plausibility/std": 0.013013492338359356, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9959745407104492, "rewards/repeat_penalty/std": 0.0037175368051975965, "rewards/near_duplicate_penalty/mean": 0.9959745407104492, "rewards/near_duplicate_penalty/std": 0.0037175368051975965, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24013672769069672, "rewards/total_composite/std": 0.23535257577896118, "reward": 0.24013672769069672, "reward_std": 0.23535257577896118, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20552921295166016, "sampling/sampling_logp_difference/max": 1.8478271961212158, "sampling/importance_sampling_ratio/min": 0.1575791835784912, "sampling/importance_sampling_ratio/mean": 1.0442026853561401, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3008000552654266, "clip_ratio/low_mean": 0.12665731459856033, "clip_ratio/low_min": 0.12665731459856033, "clip_ratio/high_mean": 0.08025272376835346, "clip_ratio/high_max": 0.08025272376835346, "clip_ratio/region_mean": 0.2069100383669138, "reward_total_mean": 0.24013672769069672, "reward_meter_mean": 0.49930068850517273, "reward_meter_std": 0.4238707423210144, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.995398998260498, "reward_lexical_plausibility_std": 0.013013492338359356, "reward_repeat_penalty_mean": 0.9959745407104492, "reward_repeat_penalty_std": 0.0037175368051975965, "reward_near_duplicate_penalty_mean": 0.9959745407104492, "reward_near_duplicate_penalty_std": 0.0037175368051975965, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.24013672769069672, "reward_total_composite_std": 0.23535257577896118} {"timestamp_utc": "2026-04-12T10:52:25Z", "mode": "train", "global_step": 35, "epoch": 0.0014057918624733904, "loss": 0.033, "grad_norm": 5.8426289558410645, "learning_rate": 9.896969696969699e-06, "num_tokens": 81030.0, "completions/mean_length": 284.75, "completions/min_length": 189.0, "completions/max_length": 331.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 284.75, "completions/min_terminated_length": 189.0, "completions/max_terminated_length": 331.0, "rewards/meter/mean": 0.46129634976387024, "rewards/meter/std": 0.23356977105140686, "rewards/count_adherence/mean": 0.9027777910232544, "rewards/count_adherence/std": 0.07120776921510696, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9986007213592529, "rewards/lexical_plausibility/std": 0.003957694862037897, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9915546178817749, "rewards/repeat_penalty/std": 0.007529374677687883, "rewards/near_duplicate_penalty/mean": 0.9934437870979309, "rewards/near_duplicate_penalty/std": 0.004776338115334511, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9980959892272949, "rewards/distinct_2/std": 0.005385419353842735, "rewards/total_composite/mean": 0.06845705211162567, "rewards/total_composite/std": 0.058959536254405975, "reward": 0.06845705211162567, "reward_std": 0.05895953252911568, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21234013140201569, "sampling/sampling_logp_difference/max": 2.172140121459961, "sampling/importance_sampling_ratio/min": 0.11393352597951889, "sampling/importance_sampling_ratio/mean": 1.0409951210021973, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7264479994773865, "clip_ratio/low_mean": 0.07352687604725361, "clip_ratio/low_min": 0.07352687604725361, "clip_ratio/high_mean": 0.13289386592805386, "clip_ratio/high_max": 0.13289386592805386, "clip_ratio/region_mean": 0.20642074197530746, "reward_total_mean": 0.06845705211162567, "reward_meter_mean": 0.46129634976387024, "reward_meter_std": 0.23356977105140686, "reward_count_adherence_mean": 0.9027777910232544, "reward_count_adherence_std": 0.07120776921510696, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9986007213592529, "reward_lexical_plausibility_std": 0.003957694862037897, "reward_repeat_penalty_mean": 0.9915546178817749, "reward_repeat_penalty_std": 0.007529374677687883, "reward_near_duplicate_penalty_mean": 0.9934437870979309, "reward_near_duplicate_penalty_std": 0.004776338115334511, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9980959892272949, "reward_distinct_2_std": 0.005385419353842735, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.06845705211162567, "reward_total_composite_std": 0.058959536254405975} {"timestamp_utc": "2026-04-12T10:52:40Z", "mode": "train", "global_step": 36, "epoch": 0.0014459573442583444, "loss": -0.0778, "grad_norm": 4.092381477355957, "learning_rate": 9.893939393939395e-06, "num_tokens": 84863.0, "completions/mean_length": 449.125, "completions/min_length": 310.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 411.3999938964844, "completions/min_terminated_length": 310.0, "completions/max_terminated_length": 464.0, "rewards/meter/mean": 0.1800491064786911, "rewards/meter/std": 0.09611400961875916, "rewards/count_adherence/mean": 0.9117647409439087, "rewards/count_adherence/std": 0.06288499385118484, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9814121723175049, "rewards/repeat_penalty/std": 0.020063040778040886, "rewards/near_duplicate_penalty/mean": 0.9937238693237305, "rewards/near_duplicate_penalty/std": 0.005176292732357979, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9875483512878418, "rewards/distinct_2/std": 0.015593364834785461, "rewards/total_composite/mean": 0.03374875336885452, "rewards/total_composite/std": 0.03367682546377182, "reward": 0.03374875336885452, "reward_std": 0.03367682173848152, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21900925040245056, "sampling/sampling_logp_difference/max": 2.311619758605957, "sampling/importance_sampling_ratio/min": 0.09910060465335846, "sampling/importance_sampling_ratio/mean": 1.0577551126480103, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0560347735881805, "clip_ratio/low_mean": 0.06574058718979359, "clip_ratio/low_min": 0.06574058718979359, "clip_ratio/high_mean": 0.04515678249299526, "clip_ratio/high_max": 0.04515678249299526, "clip_ratio/region_mean": 0.11089736968278885, "reward_total_mean": 0.03374875336885452, "reward_meter_mean": 0.1800491064786911, "reward_meter_std": 0.09611400961875916, "reward_count_adherence_mean": 0.9117647409439087, "reward_count_adherence_std": 0.06288499385118484, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9814121723175049, "reward_repeat_penalty_std": 0.020063040778040886, "reward_near_duplicate_penalty_mean": 0.9937238693237305, "reward_near_duplicate_penalty_std": 0.005176292732357979, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9875483512878418, "reward_distinct_2_std": 0.015593364834785461, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.03374875336885452, "reward_total_composite_std": 0.03367682546377182} {"timestamp_utc": "2026-04-12T10:52:50Z", "mode": "train", "global_step": 37, "epoch": 0.0014861228260432983, "loss": 0.1322, "grad_norm": 11.867147445678711, "learning_rate": 9.890909090909092e-06, "num_tokens": 86734.0, "completions/mean_length": 57.875, "completions/min_length": 42.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.875, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.9086538553237915, "rewards/meter/std": 0.1690373420715332, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9959057569503784, "rewards/repeat_penalty/std": 0.011237816885113716, "rewards/near_duplicate_penalty/mean": 0.9959057569503784, "rewards/near_duplicate_penalty/std": 0.011237816885113716, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4023837745189667, "rewards/total_composite/std": 0.15859727561473846, "reward": 0.4023837745189667, "reward_std": 0.15859729051589966, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1997494101524353, "sampling/sampling_logp_difference/max": 1.7911901473999023, "sampling/importance_sampling_ratio/min": 0.1667615920305252, "sampling/importance_sampling_ratio/mean": 1.0365508794784546, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.137260004878044, "clip_ratio/low_mean": 0.05545040871948004, "clip_ratio/low_min": 0.05545040871948004, "clip_ratio/high_mean": 0.11482405569404364, "clip_ratio/high_max": 0.11482405569404364, "clip_ratio/region_mean": 0.17027446441352367, "reward_total_mean": 0.4023837745189667, "reward_meter_mean": 0.9086538553237915, "reward_meter_std": 0.1690373420715332, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9959057569503784, "reward_repeat_penalty_std": 0.011237816885113716, "reward_near_duplicate_penalty_mean": 0.9959057569503784, "reward_near_duplicate_penalty_std": 0.011237816885113716, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.4023837745189667, "reward_total_composite_std": 0.15859727561473846} {"timestamp_utc": "2026-04-12T10:52:59Z", "mode": "train", "global_step": 38, "epoch": 0.0015262883078282525, "loss": 0.0979, "grad_norm": 11.908285140991211, "learning_rate": 9.887878787878789e-06, "num_tokens": 88228.0, "completions/mean_length": 41.75, "completions/min_length": 33.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.2573082745075226, "rewards/meter/std": 0.3478483557701111, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.27445724606513977, "rewards/repeat_penalty/mean": 0.977064847946167, "rewards/repeat_penalty/std": 0.02895965613424778, "rewards/near_duplicate_penalty/mean": 0.977064847946167, "rewards/near_duplicate_penalty/std": 0.02895965613424778, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11427588760852814, "rewards/total_composite/std": 0.21644611656665802, "reward": 0.11427588760852814, "reward_std": 0.21644611656665802, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19935156404972076, "sampling/sampling_logp_difference/max": 1.3580989837646484, "sampling/importance_sampling_ratio/min": 0.2571491599082947, "sampling/importance_sampling_ratio/mean": 1.0438369512557983, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6971920430660248, "clip_ratio/low_mean": 0.2066736575216055, "clip_ratio/low_min": 0.2066736575216055, "clip_ratio/high_mean": 0.022727273404598236, "clip_ratio/high_max": 0.022727273404598236, "clip_ratio/region_mean": 0.22940093092620373, "reward_total_mean": 0.11427588760852814, "reward_meter_mean": 0.2573082745075226, "reward_meter_std": 0.3478483557701111, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.977064847946167, "reward_repeat_penalty_std": 0.02895965613424778, "reward_near_duplicate_penalty_mean": 0.977064847946167, "reward_near_duplicate_penalty_std": 0.02895965613424778, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.27445724606513977, "reward_total_composite_mean": 0.11427588760852814, "reward_total_composite_std": 0.21644611656665802} {"timestamp_utc": "2026-04-12T10:53:14Z", "mode": "train", "global_step": 39, "epoch": 0.0015664537896132064, "loss": 0.0351, "grad_norm": 4.0106892585754395, "learning_rate": 9.884848484848486e-06, "num_tokens": 93289.0, "completions/mean_length": 451.625, "completions/min_length": 323.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 443.0000305175781, "completions/min_terminated_length": 323.0, "completions/max_terminated_length": 511.0, "rewards/meter/mean": 0.7355791330337524, "rewards/meter/std": 0.31982097029685974, "rewards/count_adherence/mean": 0.942307710647583, "rewards/count_adherence/std": 0.05439282953739166, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9885231256484985, "rewards/repeat_penalty/std": 0.012684613466262817, "rewards/near_duplicate_penalty/mean": 0.995418906211853, "rewards/near_duplicate_penalty/std": 0.0017438719514757395, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9930649995803833, "rewards/distinct_2/std": 0.01195761002600193, "rewards/total_composite/mean": 0.07325583696365356, "rewards/total_composite/std": 0.059081532061100006, "reward": 0.07325583696365356, "reward_std": 0.059081532061100006, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19850671291351318, "sampling/sampling_logp_difference/max": 1.7185239791870117, "sampling/importance_sampling_ratio/min": 0.17933064699172974, "sampling/importance_sampling_ratio/mean": 1.0332156419754028, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.398359000682831, "clip_ratio/low_mean": 0.06206880137324333, "clip_ratio/low_min": 0.06206880137324333, "clip_ratio/high_mean": 0.08713553473353386, "clip_ratio/high_max": 0.08713553473353386, "clip_ratio/region_mean": 0.1492043361067772, "reward_total_mean": 0.07325583696365356, "reward_meter_mean": 0.7355791330337524, "reward_meter_std": 0.31982097029685974, "reward_count_adherence_mean": 0.942307710647583, "reward_count_adherence_std": 0.05439282953739166, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9885231256484985, "reward_repeat_penalty_std": 0.012684613466262817, "reward_near_duplicate_penalty_mean": 0.995418906211853, "reward_near_duplicate_penalty_std": 0.0017438719514757395, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9930649995803833, "reward_distinct_2_std": 0.01195761002600193, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.07325583696365356, "reward_total_composite_std": 0.059081532061100006} {"timestamp_utc": "2026-04-12T10:53:23Z", "mode": "train", "global_step": 40, "epoch": 0.0016066192713981603, "loss": 0.0841, "grad_norm": 14.31587028503418, "learning_rate": 9.881818181818182e-06, "num_tokens": 95077.0, "completions/mean_length": 50.5, "completions/min_length": 37.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.5, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.5635181665420532, "rewards/meter/std": 0.396634966135025, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9785957336425781, "rewards/lexical_plausibility/std": 0.041514668613672256, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9940464496612549, "rewards/repeat_penalty/std": 0.009807905182242393, "rewards/near_duplicate_penalty/mean": 0.9940464496612549, "rewards/near_duplicate_penalty/std": 0.009807905182242393, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1789971888065338, "rewards/total_composite/std": 0.16574008762836456, "reward": 0.1789971888065338, "reward_std": 0.16574008762836456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22694624960422516, "sampling/sampling_logp_difference/max": 1.3110485076904297, "sampling/importance_sampling_ratio/min": 0.2695372998714447, "sampling/importance_sampling_ratio/mean": 1.0326288938522339, "sampling/importance_sampling_ratio/max": 1.9913641214370728, "entropy": 2.6005669236183167, "clip_ratio/low_mean": 0.12105423025786877, "clip_ratio/low_min": 0.12105423025786877, "clip_ratio/high_mean": 0.08914576843380928, "clip_ratio/high_max": 0.08914576843380928, "clip_ratio/region_mean": 0.21019999869167805, "reward_total_mean": 0.1789971888065338, "reward_meter_mean": 0.5635181665420532, "reward_meter_std": 0.396634966135025, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9785957336425781, "reward_lexical_plausibility_std": 0.041514668613672256, "reward_repeat_penalty_mean": 0.9940464496612549, "reward_repeat_penalty_std": 0.009807905182242393, "reward_near_duplicate_penalty_mean": 0.9940464496612549, "reward_near_duplicate_penalty_std": 0.009807905182242393, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.1789971888065338, "reward_total_composite_std": 0.16574008762836456} {"timestamp_utc": "2026-04-12T10:53:31Z", "mode": "train", "global_step": 41, "epoch": 0.0016467847531831145, "loss": -0.0119, "grad_norm": 10.00015926361084, "learning_rate": 9.87878787878788e-06, "num_tokens": 96556.0, "completions/mean_length": 28.875, "completions/min_length": 28.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.875, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.7382493019104004, "rewards/meter/std": 0.05320190265774727, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9312499761581421, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.9941987991333008, "rewards/repeat_penalty/std": 0.002123442478477955, "rewards/near_duplicate_penalty/mean": 0.9941987991333008, "rewards/near_duplicate_penalty/std": 0.002123442478477955, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.688033401966095, "rewards/total_composite/std": 0.059163473546504974, "reward": 0.688033401966095, "reward_std": 0.059163469821214676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04594084620475769, "sampling/sampling_logp_difference/max": 1.053290605545044, "sampling/importance_sampling_ratio/min": 0.34878814220428467, "sampling/importance_sampling_ratio/mean": 1.0141326189041138, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2016809294000268, "clip_ratio/low_mean": 0.013392857741564512, "clip_ratio/low_min": 0.013392857741564512, "clip_ratio/high_mean": 0.03191451169550419, "clip_ratio/high_max": 0.03191451169550419, "clip_ratio/region_mean": 0.0453073694370687, "reward_total_mean": 0.688033401966095, "reward_meter_mean": 0.7382493019104004, "reward_meter_std": 0.05320190265774727, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9941987991333008, "reward_repeat_penalty_std": 0.002123442478477955, "reward_near_duplicate_penalty_mean": 0.9941987991333008, "reward_near_duplicate_penalty_std": 0.002123442478477955, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9312499761581421, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.688033401966095, "reward_total_composite_std": 0.059163473546504974} {"timestamp_utc": "2026-04-12T10:53:46Z", "mode": "train", "global_step": 42, "epoch": 0.0016869502349680684, "loss": 0.0701, "grad_norm": 1.3855376243591309, "learning_rate": 9.875757575757576e-06, "num_tokens": 99223.0, "completions/mean_length": 487.375, "completions/min_length": 328.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 413.5, "completions/min_terminated_length": 328.0, "completions/max_terminated_length": 499.0, "rewards/meter/mean": 0.7093162536621094, "rewards/meter/std": 0.1799566149711609, "rewards/count_adherence/mean": 0.9666666984558105, "rewards/count_adherence/std": 0.035634830594062805, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9994212985038757, "rewards/lexical_plausibility/std": 0.0016368150245398283, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9619626998901367, "rewards/repeat_penalty/std": 0.08446221798658371, "rewards/near_duplicate_penalty/mean": 0.9942110180854797, "rewards/near_duplicate_penalty/std": 0.004683594219386578, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9709505438804626, "rewards/distinct_2/std": 0.0712062269449234, "rewards/total_composite/mean": 0.10023243725299835, "rewards/total_composite/std": 0.10760188847780228, "reward": 0.10023243725299835, "reward_std": 0.10760188102722168, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2188817411661148, "sampling/sampling_logp_difference/max": 1.5691289901733398, "sampling/importance_sampling_ratio/min": 0.20822647213935852, "sampling/importance_sampling_ratio/mean": 1.0500988960266113, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7934285998344421, "clip_ratio/low_mean": 0.017911585047841072, "clip_ratio/low_min": 0.017911585047841072, "clip_ratio/high_mean": 0.02655310556292534, "clip_ratio/high_max": 0.02655310556292534, "clip_ratio/region_mean": 0.04446469061076641, "reward_total_mean": 0.10023243725299835, "reward_meter_mean": 0.7093162536621094, "reward_meter_std": 0.1799566149711609, "reward_count_adherence_mean": 0.9666666984558105, "reward_count_adherence_std": 0.035634830594062805, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9994212985038757, "reward_lexical_plausibility_std": 0.0016368150245398283, "reward_repeat_penalty_mean": 0.9619626998901367, "reward_repeat_penalty_std": 0.08446221798658371, "reward_near_duplicate_penalty_mean": 0.9942110180854797, "reward_near_duplicate_penalty_std": 0.004683594219386578, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9709505438804626, "reward_distinct_2_std": 0.0712062269449234, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.10023243725299835, "reward_total_composite_std": 0.10760188847780228} {"timestamp_utc": "2026-04-12T10:53:55Z", "mode": "train", "global_step": 43, "epoch": 0.0017271157167530224, "loss": 0.0607, "grad_norm": 10.016197204589844, "learning_rate": 9.872727272727274e-06, "num_tokens": 101282.0, "completions/mean_length": 87.375, "completions/min_length": 66.0, "completions/max_length": 107.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 107.0, "rewards/meter/mean": 0.41793814301490784, "rewards/meter/std": 0.41469404101371765, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9853937029838562, "rewards/lexical_plausibility/std": 0.02810603752732277, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9918968677520752, "rewards/repeat_penalty/std": 0.008489455096423626, "rewards/near_duplicate_penalty/mean": 0.9918968677520752, "rewards/near_duplicate_penalty/std": 0.008489455096423626, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13019166886806488, "rewards/total_composite/std": 0.15118736028671265, "reward": 0.13019166886806488, "reward_std": 0.15118736028671265, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20895442366600037, "sampling/sampling_logp_difference/max": 1.5569829940795898, "sampling/importance_sampling_ratio/min": 0.21077100932598114, "sampling/importance_sampling_ratio/mean": 1.0310027599334717, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.384279817342758, "clip_ratio/low_mean": 0.09161348175257444, "clip_ratio/low_min": 0.09161348175257444, "clip_ratio/high_mean": 0.06697879917919636, "clip_ratio/high_max": 0.06697879917919636, "clip_ratio/region_mean": 0.1585922809317708, "reward_total_mean": 0.13019166886806488, "reward_meter_mean": 0.41793814301490784, "reward_meter_std": 0.41469404101371765, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9853937029838562, "reward_lexical_plausibility_std": 0.02810603752732277, "reward_repeat_penalty_mean": 0.9918968677520752, "reward_repeat_penalty_std": 0.008489455096423626, "reward_near_duplicate_penalty_mean": 0.9918968677520752, "reward_near_duplicate_penalty_std": 0.008489455096423626, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.13019166886806488, "reward_total_composite_std": 0.15118736028671265} {"timestamp_utc": "2026-04-12T10:54:06Z", "mode": "train", "global_step": 44, "epoch": 0.0017672811985379765, "loss": 0.0253, "grad_norm": 9.294432640075684, "learning_rate": 9.869696969696971e-06, "num_tokens": 103889.0, "completions/mean_length": 150.875, "completions/min_length": 103.0, "completions/max_length": 197.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 150.875, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 197.0, "rewards/meter/mean": 0.4813275933265686, "rewards/meter/std": 0.4182776212692261, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.988006591796875, "rewards/repeat_penalty/std": 0.015328135341405869, "rewards/near_duplicate_penalty/mean": 0.9916410446166992, "rewards/near_duplicate_penalty/std": 0.007457350846379995, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9963017702102661, "rewards/distinct_2/std": 0.01046015229076147, "rewards/total_composite/mean": 0.14278945326805115, "rewards/total_composite/std": 0.12642918527126312, "reward": 0.14278945326805115, "reward_std": 0.12642918527126312, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21853402256965637, "sampling/sampling_logp_difference/max": 3.2357258796691895, "sampling/importance_sampling_ratio/min": 0.039331644773483276, "sampling/importance_sampling_ratio/mean": 1.0230604410171509, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0845102220773697, "clip_ratio/low_mean": 0.10745364427566528, "clip_ratio/low_min": 0.10745364427566528, "clip_ratio/high_mean": 0.07006077468395233, "clip_ratio/high_max": 0.07006077468395233, "clip_ratio/region_mean": 0.17751441895961761, "reward_total_mean": 0.14278945326805115, "reward_meter_mean": 0.4813275933265686, "reward_meter_std": 0.4182776212692261, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.988006591796875, "reward_repeat_penalty_std": 0.015328135341405869, "reward_near_duplicate_penalty_mean": 0.9916410446166992, "reward_near_duplicate_penalty_std": 0.007457350846379995, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9963017702102661, "reward_distinct_2_std": 0.01046015229076147, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.14278945326805115, "reward_total_composite_std": 0.12642918527126312} {"timestamp_utc": "2026-04-12T10:54:15Z", "mode": "train", "global_step": 45, "epoch": 0.0018074466803229305, "loss": 0.0626, "grad_norm": 11.02723503112793, "learning_rate": 9.866666666666668e-06, "num_tokens": 105874.0, "completions/mean_length": 75.125, "completions/min_length": 51.0, "completions/max_length": 106.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.125, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.361456036567688, "rewards/meter/std": 0.3149069845676422, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866727590560913, "rewards/lexical_plausibility/std": 0.02516147866845131, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9583264589309692, "rewards/repeat_penalty/std": 0.04895475506782532, "rewards/near_duplicate_penalty/mean": 0.9780596494674683, "rewards/near_duplicate_penalty/std": 0.02558378502726555, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9793447256088257, "rewards/distinct_2/std": 0.028561171144247055, "rewards/total_composite/mean": 0.16231635212898254, "rewards/total_composite/std": 0.14212195575237274, "reward": 0.16231635212898254, "reward_std": 0.14212194085121155, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19996686279773712, "sampling/sampling_logp_difference/max": 1.33187997341156, "sampling/importance_sampling_ratio/min": 0.26398053765296936, "sampling/importance_sampling_ratio/mean": 1.028428554534912, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8198257088661194, "clip_ratio/low_mean": 0.09802989661693573, "clip_ratio/low_min": 0.09802989661693573, "clip_ratio/high_mean": 0.09399807266891003, "clip_ratio/high_max": 0.09399807266891003, "clip_ratio/region_mean": 0.19202796928584576, "reward_total_mean": 0.16231635212898254, "reward_meter_mean": 0.361456036567688, "reward_meter_std": 0.3149069845676422, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866727590560913, "reward_lexical_plausibility_std": 0.02516147866845131, "reward_repeat_penalty_mean": 0.9583264589309692, "reward_repeat_penalty_std": 0.04895475506782532, "reward_near_duplicate_penalty_mean": 0.9780596494674683, "reward_near_duplicate_penalty_std": 0.02558378502726555, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9793447256088257, "reward_distinct_2_std": 0.028561171144247055, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.16231635212898254, "reward_total_composite_std": 0.14212195575237274} {"timestamp_utc": "2026-04-12T10:54:24Z", "mode": "train", "global_step": 46, "epoch": 0.0018476121621078844, "loss": -0.004, "grad_norm": 16.038625717163086, "learning_rate": 9.863636363636364e-06, "num_tokens": 107225.0, "completions/mean_length": 46.875, "completions/min_length": 28.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.875, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.4543209373950958, "rewards/meter/std": 0.4082188904285431, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9658395051956177, "rewards/lexical_plausibility/std": 0.06418022513389587, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9392427206039429, "rewards/repeat_penalty/std": 0.11786352097988129, "rewards/near_duplicate_penalty/mean": 0.9392427206039429, "rewards/near_duplicate_penalty/std": 0.11786352097988129, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11724015325307846, "rewards/total_composite/std": 0.14281949400901794, "reward": 0.11724015325307846, "reward_std": 0.14281950891017914, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.262806236743927, "sampling/sampling_logp_difference/max": 1.9793095588684082, "sampling/importance_sampling_ratio/min": 0.13816459476947784, "sampling/importance_sampling_ratio/mean": 1.0275317430496216, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.951196700334549, "clip_ratio/low_mean": 0.1215451406314969, "clip_ratio/low_min": 0.1215451406314969, "clip_ratio/high_mean": 0.1346866339445114, "clip_ratio/high_max": 0.1346866339445114, "clip_ratio/region_mean": 0.2562317745760083, "reward_total_mean": 0.11724015325307846, "reward_meter_mean": 0.4543209373950958, "reward_meter_std": 0.4082188904285431, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9658395051956177, "reward_lexical_plausibility_std": 0.06418022513389587, "reward_repeat_penalty_mean": 0.9392427206039429, "reward_repeat_penalty_std": 0.11786352097988129, "reward_near_duplicate_penalty_mean": 0.9392427206039429, "reward_near_duplicate_penalty_std": 0.11786352097988129, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.11724015325307846, "reward_total_composite_std": 0.14281949400901794} {"timestamp_utc": "2026-04-12T10:54:34Z", "mode": "train", "global_step": 47, "epoch": 0.0018877776438928386, "loss": 0.112, "grad_norm": 23.37023162841797, "learning_rate": 9.860606060606061e-06, "num_tokens": 108866.0, "completions/mean_length": 35.125, "completions/min_length": 30.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.5010475516319275, "rewards/meter/std": 0.38557562232017517, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.9946637153625488, "rewards/repeat_penalty/std": 0.007449817378073931, "rewards/near_duplicate_penalty/mean": 0.9946637153625488, "rewards/near_duplicate_penalty/std": 0.007449817378073931, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2251858413219452, "rewards/total_composite/std": 0.29974380135536194, "reward": 0.2251858413219452, "reward_std": 0.29974377155303955, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.26643556356430054, "sampling/sampling_logp_difference/max": 1.6169767379760742, "sampling/importance_sampling_ratio/min": 0.19849790632724762, "sampling/importance_sampling_ratio/mean": 1.0140801668167114, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5216663479804993, "clip_ratio/low_mean": 0.13808361627161503, "clip_ratio/low_min": 0.13808361627161503, "clip_ratio/high_mean": 0.0861111138947308, "clip_ratio/high_max": 0.0861111138947308, "clip_ratio/region_mean": 0.22419473016634583, "reward_total_mean": 0.2251858413219452, "reward_meter_mean": 0.5010475516319275, "reward_meter_std": 0.38557562232017517, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9946637153625488, "reward_repeat_penalty_std": 0.007449817378073931, "reward_near_duplicate_penalty_mean": 0.9946637153625488, "reward_near_duplicate_penalty_std": 0.007449817378073931, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.2251858413219452, "reward_total_composite_std": 0.29974380135536194} {"timestamp_utc": "2026-04-12T10:54:43Z", "mode": "train", "global_step": 48, "epoch": 0.0019279431256777925, "loss": 0.0071, "grad_norm": 9.893824577331543, "learning_rate": 9.857575757575758e-06, "num_tokens": 111117.0, "completions/mean_length": 104.375, "completions/min_length": 82.0, "completions/max_length": 150.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 104.375, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.806372344493866, "rewards/meter/std": 0.2834595739841461, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.06408698856830597, "rewards/repeat_penalty/mean": 0.9797012209892273, "rewards/repeat_penalty/std": 0.019535429775714874, "rewards/near_duplicate_penalty/mean": 0.9892376661300659, "rewards/near_duplicate_penalty/std": 0.008412816561758518, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9903604984283447, "rewards/distinct_2/std": 0.017878584563732147, "rewards/total_composite/mean": 0.2767994999885559, "rewards/total_composite/std": 0.11022676527500153, "reward": 0.2767994999885559, "reward_std": 0.11022675782442093, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17351074516773224, "sampling/sampling_logp_difference/max": 1.263441562652588, "sampling/importance_sampling_ratio/min": 0.2826794683933258, "sampling/importance_sampling_ratio/mean": 1.019784927368164, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6085834950208664, "clip_ratio/low_mean": 0.07410561852157116, "clip_ratio/low_min": 0.07410561852157116, "clip_ratio/high_mean": 0.09488278347998857, "clip_ratio/high_max": 0.09488278347998857, "clip_ratio/region_mean": 0.16898840200155973, "reward_total_mean": 0.2767994999885559, "reward_meter_mean": 0.806372344493866, "reward_meter_std": 0.2834595739841461, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9797012209892273, "reward_repeat_penalty_std": 0.019535429775714874, "reward_near_duplicate_penalty_mean": 0.9892376661300659, "reward_near_duplicate_penalty_std": 0.008412816561758518, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9903604984283447, "reward_distinct_2_std": 0.017878584563732147, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.06408698856830597, "reward_total_composite_mean": 0.2767994999885559, "reward_total_composite_std": 0.11022676527500153} {"timestamp_utc": "2026-04-12T10:54:53Z", "mode": "train", "global_step": 49, "epoch": 0.0019681086074627464, "loss": 0.0709, "grad_norm": 14.83174991607666, "learning_rate": 9.854545454545456e-06, "num_tokens": 112936.0, "completions/mean_length": 63.375, "completions/min_length": 45.0, "completions/max_length": 99.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.375, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.3535194396972656, "rewards/meter/std": 0.29302817583084106, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9892464876174927, "rewards/repeat_penalty/std": 0.006524175871163607, "rewards/near_duplicate_penalty/mean": 0.9892464876174927, "rewards/near_duplicate_penalty/std": 0.006524175871163607, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1120145320892334, "rewards/total_composite/std": 0.09365059435367584, "reward": 0.1120145320892334, "reward_std": 0.09365059435367584, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2412882298231125, "sampling/sampling_logp_difference/max": 2.8684377670288086, "sampling/importance_sampling_ratio/min": 0.05678757280111313, "sampling/importance_sampling_ratio/mean": 1.0413163900375366, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.34032841026783, "clip_ratio/low_mean": 0.12963778898119926, "clip_ratio/low_min": 0.12963778898119926, "clip_ratio/high_mean": 0.09714464657008648, "clip_ratio/high_max": 0.09714464657008648, "clip_ratio/region_mean": 0.22678243555128574, "reward_total_mean": 0.1120145320892334, "reward_meter_mean": 0.3535194396972656, "reward_meter_std": 0.29302817583084106, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9892464876174927, "reward_repeat_penalty_std": 0.006524175871163607, "reward_near_duplicate_penalty_mean": 0.9892464876174927, "reward_near_duplicate_penalty_std": 0.006524175871163607, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.1120145320892334, "reward_total_composite_std": 0.09365059435367584} {"timestamp_utc": "2026-04-12T10:55:03Z", "mode": "train", "global_step": 50, "epoch": 0.0020082740892477004, "loss": 0.0261, "grad_norm": 17.06206512451172, "learning_rate": 9.851515151515151e-06, "num_tokens": 114662.0, "completions/mean_length": 58.75, "completions/min_length": 48.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.75, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.3583456873893738, "rewards/meter/std": 0.37512892484664917, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9947724342346191, "rewards/repeat_penalty/std": 0.006623376626521349, "rewards/near_duplicate_penalty/mean": 0.9947724342346191, "rewards/near_duplicate_penalty/std": 0.006623376626521349, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18473929166793823, "rewards/total_composite/std": 0.21375440061092377, "reward": 0.18473929166793823, "reward_std": 0.21375440061092377, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21507924795150757, "sampling/sampling_logp_difference/max": 1.6833810806274414, "sampling/importance_sampling_ratio/min": 0.18574489653110504, "sampling/importance_sampling_ratio/mean": 1.0162782669067383, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.93431057035923, "clip_ratio/low_mean": 0.12212134897708893, "clip_ratio/low_min": 0.12212134897708893, "clip_ratio/high_mean": 0.03997507132589817, "clip_ratio/high_max": 0.03997507132589817, "clip_ratio/region_mean": 0.1620964203029871, "reward_total_mean": 0.18473929166793823, "reward_meter_mean": 0.3583456873893738, "reward_meter_std": 0.37512892484664917, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9947724342346191, "reward_repeat_penalty_std": 0.006623376626521349, "reward_near_duplicate_penalty_mean": 0.9947724342346191, "reward_near_duplicate_penalty_std": 0.006623376626521349, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.18473929166793823, "reward_total_composite_std": 0.21375440061092377} {"timestamp_utc": "2026-04-12T10:57:26Z", "mode": "eval", "global_step": 50, "epoch": 0.0020082740892477004, "eval_loss": NaN, "eval_runtime": 142.8323, "eval_samples_per_second": 0.728, "eval_steps_per_second": 0.091, "eval_num_tokens": 114662.0, "eval_completions/mean_length": 180.56730769230768, "eval_completions/min_length": 37.15384615384615, "eval_completions/max_length": 402.84615384615387, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/mean_terminated_length": 159.45604647122897, "eval_completions/min_terminated_length": 37.15384615384615, "eval_completions/max_terminated_length": 339.61538461538464, "eval_rewards/meter/mean": 0.37956270346274745, "eval_rewards/meter/std": 0.3265574127435684, "eval_rewards/count_adherence/mean": 0.9397292916591351, "eval_rewards/count_adherence/std": 0.08025195621527158, "eval_rewards/arabic_clean/mean": 0.9326923076923077, "eval_rewards/arabic_clean/std": 0.13402181176038888, "eval_rewards/lexical_plausibility/mean": 0.9808496099251968, "eval_rewards/lexical_plausibility/std": 0.04648121876212267, "eval_rewards/judge_quality/mean": 0.3682692234332745, "eval_rewards/judge_quality/std": 0.18312470041788542, "eval_rewards/repeat_penalty/mean": 0.9772035846343408, "eval_rewards/repeat_penalty/std": 0.03686572052538395, "eval_rewards/near_duplicate_penalty/mean": 0.9911981270863459, "eval_rewards/near_duplicate_penalty/std": 0.011277515387449127, "eval_rewards/opening_diversity/mean": 0.9927884615384616, "eval_rewards/opening_diversity/std": 0.020397310646680687, "eval_rewards/distinct_2/mean": 0.9927693880521334, "eval_rewards/distinct_2/std": 0.014553762112672512, "eval_rewards/total_composite/mean": 0.11893160469256915, "eval_rewards/total_composite/std": 0.13336633231777412, "eval_reward": 0.11893160469256915, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.14144953741477087, "eval_sampling/sampling_logp_difference/max": 1.1957824413593, "eval_sampling/importance_sampling_ratio/min": 0.3068786939749351, "eval_sampling/importance_sampling_ratio/mean": 1.039452286866995, "eval_sampling/importance_sampling_ratio/max": 1.6445801258087158, "eval_entropy": 2.337759989958543, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.11893160469256915, "eval_reward_meter_mean": 0.37956270346274745, "eval_reward_meter_std": 0.3265574127435684, "eval_reward_count_adherence_mean": 0.9397292916591351, "eval_reward_count_adherence_std": 0.08025195621527158, "eval_reward_arabic_clean_mean": 0.9326923076923077, "eval_reward_arabic_clean_std": 0.13402181176038888, "eval_reward_lexical_plausibility_mean": 0.9808496099251968, "eval_reward_lexical_plausibility_std": 0.04648121876212267, "eval_reward_repeat_penalty_mean": 0.9772035846343408, "eval_reward_repeat_penalty_std": 0.03686572052538395, "eval_reward_near_duplicate_penalty_mean": 0.9911981270863459, "eval_reward_near_duplicate_penalty_std": 0.011277515387449127, "eval_reward_opening_diversity_mean": 0.9927884615384616, "eval_reward_opening_diversity_std": 0.020397310646680687, "eval_reward_distinct_2_mean": 0.9927693880521334, "eval_reward_distinct_2_std": 0.014553762112672512, "eval_reward_judge_quality_mean": 0.3682692234332745, "eval_reward_judge_quality_std": 0.18312470041788542, "eval_reward_total_composite_mean": 0.11893160469256915, "eval_reward_total_composite_std": 0.13336633231777412} {"timestamp_utc": "2026-04-12T10:57:39Z", "mode": "train", "global_step": 51, "epoch": 0.0020484395710326547, "loss": -0.0337, "grad_norm": 10.903347969055176, "learning_rate": 9.84848484848485e-06, "num_tokens": 116950.0, "completions/mean_length": 113.0, "completions/min_length": 69.0, "completions/max_length": 170.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 170.0, "rewards/meter/mean": 0.28861385583877563, "rewards/meter/std": 0.36539360880851746, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9817765951156616, "rewards/repeat_penalty/std": 0.01925649307668209, "rewards/near_duplicate_penalty/mean": 0.9861289858818054, "rewards/near_duplicate_penalty/std": 0.009517847560346127, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9955277442932129, "rewards/distinct_2/std": 0.012649492360651493, "rewards/total_composite/mean": 0.09108218550682068, "rewards/total_composite/std": 0.108382448554039, "reward": 0.09108218550682068, "reward_std": 0.1083824560046196, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2257484644651413, "sampling/sampling_logp_difference/max": 1.6658835411071777, "sampling/importance_sampling_ratio/min": 0.18902356922626495, "sampling/importance_sampling_ratio/mean": 1.0398006439208984, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.419378399848938, "clip_ratio/low_mean": 0.1551432702690363, "clip_ratio/low_min": 0.1551432702690363, "clip_ratio/high_mean": 0.04990053176879883, "clip_ratio/high_max": 0.04990053176879883, "clip_ratio/region_mean": 0.20504380203783512, "reward_total_mean": 0.09108218550682068, "reward_meter_mean": 0.28861385583877563, "reward_meter_std": 0.36539360880851746, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9817765951156616, "reward_repeat_penalty_std": 0.01925649307668209, "reward_near_duplicate_penalty_mean": 0.9861289858818054, "reward_near_duplicate_penalty_std": 0.009517847560346127, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9955277442932129, "reward_distinct_2_std": 0.012649492360651493, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.09108218550682068, "reward_total_composite_std": 0.108382448554039} {"timestamp_utc": "2026-04-12T10:57:48Z", "mode": "train", "global_step": 52, "epoch": 0.0020886050528176087, "loss": -0.0877, "grad_norm": 24.892927169799805, "learning_rate": 9.845454545454546e-06, "num_tokens": 118357.0, "completions/mean_length": 22.875, "completions/min_length": 15.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.875, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.5366003513336182, "rewards/meter/std": 0.40989452600479126, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6974999904632568, "rewards/judge_quality/std": 0.3259163200855255, "rewards/repeat_penalty/mean": 0.7438346147537231, "rewards/repeat_penalty/std": 0.011416047811508179, "rewards/near_duplicate_penalty/mean": 0.9917795062065125, "rewards/near_duplicate_penalty/std": 0.015221425332129002, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.43747198581695557, "rewards/total_composite/std": 0.36508339643478394, "reward": 0.43747198581695557, "reward_std": 0.36508339643478394, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21967212855815887, "sampling/sampling_logp_difference/max": 1.12404203414917, "sampling/importance_sampling_ratio/min": 0.32496359944343567, "sampling/importance_sampling_ratio/mean": 1.024284839630127, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9608293920755386, "clip_ratio/low_mean": 0.1209017550572753, "clip_ratio/low_min": 0.1209017550572753, "clip_ratio/high_mean": 0.08847926370799541, "clip_ratio/high_max": 0.08847926370799541, "clip_ratio/region_mean": 0.2093810187652707, "reward_total_mean": 0.43747198581695557, "reward_meter_mean": 0.5366003513336182, "reward_meter_std": 0.40989452600479126, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7438346147537231, "reward_repeat_penalty_std": 0.011416047811508179, "reward_near_duplicate_penalty_mean": 0.9917795062065125, "reward_near_duplicate_penalty_std": 0.015221425332129002, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6974999904632568, "reward_judge_quality_std": 0.3259163200855255, "reward_total_composite_mean": 0.43747198581695557, "reward_total_composite_std": 0.36508339643478394} {"timestamp_utc": "2026-04-12T10:57:58Z", "mode": "train", "global_step": 53, "epoch": 0.0021287705346025626, "loss": 0.085, "grad_norm": 8.417654991149902, "learning_rate": 9.842424242424243e-06, "num_tokens": 121027.0, "completions/mean_length": 154.75, "completions/min_length": 120.0, "completions/max_length": 189.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.75, "completions/min_terminated_length": 120.0, "completions/max_terminated_length": 189.0, "rewards/meter/mean": 0.45218032598495483, "rewards/meter/std": 0.35878920555114746, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9745864868164062, "rewards/lexical_plausibility/std": 0.05568007379770279, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9912744760513306, "rewards/repeat_penalty/std": 0.011122609488666058, "rewards/near_duplicate_penalty/mean": 0.9947509765625, "rewards/near_duplicate_penalty/std": 0.004814809188246727, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.996503472328186, "rewards/distinct_2/std": 0.00988961011171341, "rewards/total_composite/mean": 0.09445170313119888, "rewards/total_composite/std": 0.08176426589488983, "reward": 0.09445170313119888, "reward_std": 0.08176426589488983, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22425159811973572, "sampling/sampling_logp_difference/max": 1.8631505966186523, "sampling/importance_sampling_ratio/min": 0.15518295764923096, "sampling/importance_sampling_ratio/mean": 1.0403592586517334, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.76952862739563, "clip_ratio/low_mean": 0.10465529002249241, "clip_ratio/low_min": 0.10465529002249241, "clip_ratio/high_mean": 0.08321425691246986, "clip_ratio/high_max": 0.08321425691246986, "clip_ratio/region_mean": 0.18786954693496227, "reward_total_mean": 0.09445170313119888, "reward_meter_mean": 0.45218032598495483, "reward_meter_std": 0.35878920555114746, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9745864868164062, "reward_lexical_plausibility_std": 0.05568007379770279, "reward_repeat_penalty_mean": 0.9912744760513306, "reward_repeat_penalty_std": 0.011122609488666058, "reward_near_duplicate_penalty_mean": 0.9947509765625, "reward_near_duplicate_penalty_std": 0.004814809188246727, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.996503472328186, "reward_distinct_2_std": 0.00988961011171341, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.09445170313119888, "reward_total_composite_std": 0.08176426589488983} {"timestamp_utc": "2026-04-12T10:58:08Z", "mode": "train", "global_step": 54, "epoch": 0.0021689360163875166, "loss": 0.0818, "grad_norm": 12.048750877380371, "learning_rate": 9.83939393939394e-06, "num_tokens": 122732.0, "completions/mean_length": 49.125, "completions/min_length": 36.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.125, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5787004232406616, "rewards/meter/std": 0.38724616169929504, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9991129636764526, "rewards/repeat_penalty/std": 0.0021831849589943886, "rewards/near_duplicate_penalty/mean": 0.9991129636764526, "rewards/near_duplicate_penalty/std": 0.0021831849589943886, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2784807085990906, "rewards/total_composite/std": 0.27733859419822693, "reward": 0.2784807085990906, "reward_std": 0.27733856439590454, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22375231981277466, "sampling/sampling_logp_difference/max": 1.4279108047485352, "sampling/importance_sampling_ratio/min": 0.23980940878391266, "sampling/importance_sampling_ratio/mean": 1.0389413833618164, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.739379346370697, "clip_ratio/low_mean": 0.12489048577845097, "clip_ratio/low_min": 0.12489048577845097, "clip_ratio/high_mean": 0.06473684310913086, "clip_ratio/high_max": 0.06473684310913086, "clip_ratio/region_mean": 0.18962732888758183, "reward_total_mean": 0.2784807085990906, "reward_meter_mean": 0.5787004232406616, "reward_meter_std": 0.38724616169929504, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9991129636764526, "reward_repeat_penalty_std": 0.0021831849589943886, "reward_near_duplicate_penalty_mean": 0.9991129636764526, "reward_near_duplicate_penalty_std": 0.0021831849589943886, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.2784807085990906, "reward_total_composite_std": 0.27733859419822693} {"timestamp_utc": "2026-04-12T10:58:24Z", "mode": "train", "global_step": 55, "epoch": 0.0022091014981724705, "loss": 0.0738, "grad_norm": 2.989703416824341, "learning_rate": 9.836363636363637e-06, "num_tokens": 126060.0, "completions/mean_length": 463.0, "completions/min_length": 304.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 414.0, "completions/min_terminated_length": 304.0, "completions/max_terminated_length": 492.0, "rewards/meter/mean": 0.4480252265930176, "rewards/meter/std": 0.19926531612873077, "rewards/count_adherence/mean": 0.953125, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9838997721672058, "rewards/lexical_plausibility/std": 0.0295176412910223, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9866570234298706, "rewards/repeat_penalty/std": 0.011641118675470352, "rewards/near_duplicate_penalty/mean": 0.9968233108520508, "rewards/near_duplicate_penalty/std": 0.002474944805726409, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9897903203964233, "rewards/distinct_2/std": 0.010273823514580727, "rewards/total_composite/mean": 0.05033401772379875, "rewards/total_composite/std": 0.04285261407494545, "reward": 0.05033401772379875, "reward_std": 0.04285261407494545, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23841920495033264, "sampling/sampling_logp_difference/max": 1.7952909469604492, "sampling/importance_sampling_ratio/min": 0.16607911884784698, "sampling/importance_sampling_ratio/mean": 1.0540883541107178, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.888288974761963, "clip_ratio/low_mean": 0.06659147888422012, "clip_ratio/low_min": 0.06659147888422012, "clip_ratio/high_mean": 0.02017114870250225, "clip_ratio/high_max": 0.02017114870250225, "clip_ratio/region_mean": 0.08676262758672237, "reward_total_mean": 0.05033401772379875, "reward_meter_mean": 0.4480252265930176, "reward_meter_std": 0.19926531612873077, "reward_count_adherence_mean": 0.953125, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9838997721672058, "reward_lexical_plausibility_std": 0.0295176412910223, "reward_repeat_penalty_mean": 0.9866570234298706, "reward_repeat_penalty_std": 0.011641118675470352, "reward_near_duplicate_penalty_mean": 0.9968233108520508, "reward_near_duplicate_penalty_std": 0.002474944805726409, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9897903203964233, "reward_distinct_2_std": 0.010273823514580727, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.05033401772379875, "reward_total_composite_std": 0.04285261407494545} {"timestamp_utc": "2026-04-12T10:58:33Z", "mode": "train", "global_step": 56, "epoch": 0.0022492669799574244, "loss": 0.0507, "grad_norm": 17.793067932128906, "learning_rate": 9.833333333333333e-06, "num_tokens": 127700.0, "completions/mean_length": 45.0, "completions/min_length": 34.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.5145763754844666, "rewards/meter/std": 0.37867268919944763, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9702739715576172, "rewards/lexical_plausibility/std": 0.06984595954418182, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.24663087725639343, "rewards/repeat_penalty/mean": 0.987379789352417, "rewards/repeat_penalty/std": 0.018242988735437393, "rewards/near_duplicate_penalty/mean": 0.987379789352417, "rewards/near_duplicate_penalty/std": 0.018242988735437393, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2455739825963974, "rewards/total_composite/std": 0.2809582054615021, "reward": 0.2455739825963974, "reward_std": 0.28095823526382446, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22564570605754852, "sampling/sampling_logp_difference/max": 1.7728815078735352, "sampling/importance_sampling_ratio/min": 0.16984286904335022, "sampling/importance_sampling_ratio/mean": 1.0182222127914429, "sampling/importance_sampling_ratio/max": 1.9703538417816162, "entropy": 2.5086857080459595, "clip_ratio/low_mean": 0.11486524250358343, "clip_ratio/low_min": 0.11486524250358343, "clip_ratio/high_mean": 0.1189475804567337, "clip_ratio/high_max": 0.1189475804567337, "clip_ratio/region_mean": 0.23381282296031713, "reward_total_mean": 0.2455739825963974, "reward_meter_mean": 0.5145763754844666, "reward_meter_std": 0.37867268919944763, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9702739715576172, "reward_lexical_plausibility_std": 0.06984595954418182, "reward_repeat_penalty_mean": 0.987379789352417, "reward_repeat_penalty_std": 0.018242988735437393, "reward_near_duplicate_penalty_mean": 0.987379789352417, "reward_near_duplicate_penalty_std": 0.018242988735437393, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.24663087725639343, "reward_total_composite_mean": 0.2455739825963974, "reward_total_composite_std": 0.2809582054615021} {"timestamp_utc": "2026-04-12T10:58:43Z", "mode": "train", "global_step": 57, "epoch": 0.002289432461742379, "loss": 0.0935, "grad_norm": 13.650352478027344, "learning_rate": 9.830303030303032e-06, "num_tokens": 129539.0, "completions/mean_length": 58.875, "completions/min_length": 40.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.875, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.8692176938056946, "rewards/meter/std": 0.30586138367652893, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9266800880432129, "rewards/lexical_plausibility/std": 0.12982980906963348, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9955106973648071, "rewards/repeat_penalty/std": 0.00844684150069952, "rewards/near_duplicate_penalty/mean": 0.9955106973648071, "rewards/near_duplicate_penalty/std": 0.00844684150069952, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45738109946250916, "rewards/total_composite/std": 0.3089926540851593, "reward": 0.45738109946250916, "reward_std": 0.3089926540851593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21686285734176636, "sampling/sampling_logp_difference/max": 1.2738847732543945, "sampling/importance_sampling_ratio/min": 0.2797427475452423, "sampling/importance_sampling_ratio/mean": 1.0531916618347168, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3706904649734497, "clip_ratio/low_mean": 0.1262198593467474, "clip_ratio/low_min": 0.1262198593467474, "clip_ratio/high_mean": 0.049512987956404686, "clip_ratio/high_max": 0.049512987956404686, "clip_ratio/region_mean": 0.17573284730315208, "reward_total_mean": 0.45738109946250916, "reward_meter_mean": 0.8692176938056946, "reward_meter_std": 0.30586138367652893, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9266800880432129, "reward_lexical_plausibility_std": 0.12982980906963348, "reward_repeat_penalty_mean": 0.9955106973648071, "reward_repeat_penalty_std": 0.00844684150069952, "reward_near_duplicate_penalty_mean": 0.9955106973648071, "reward_near_duplicate_penalty_std": 0.00844684150069952, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.45738109946250916, "reward_total_composite_std": 0.3089926540851593} {"timestamp_utc": "2026-04-12T10:58:53Z", "mode": "train", "global_step": 58, "epoch": 0.0023295979435273327, "loss": 0.039, "grad_norm": 17.057424545288086, "learning_rate": 9.827272727272729e-06, "num_tokens": 131234.0, "completions/mean_length": 44.875, "completions/min_length": 33.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.4741390645503998, "rewards/meter/std": 0.38624247908592224, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.9705674648284912, "rewards/repeat_penalty/std": 0.040225934237241745, "rewards/near_duplicate_penalty/mean": 0.9705674648284912, "rewards/near_duplicate_penalty/std": 0.040225934237241745, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2696312367916107, "rewards/total_composite/std": 0.37265121936798096, "reward": 0.2696312367916107, "reward_std": 0.37265118956565857, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23961296677589417, "sampling/sampling_logp_difference/max": 1.6894340515136719, "sampling/importance_sampling_ratio/min": 0.18462397158145905, "sampling/importance_sampling_ratio/mean": 1.0087285041809082, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.136370226740837, "clip_ratio/low_mean": 0.11129444930702448, "clip_ratio/low_min": 0.11129444930702448, "clip_ratio/high_mean": 0.04762791842222214, "clip_ratio/high_max": 0.04762791842222214, "clip_ratio/region_mean": 0.15892236772924662, "reward_total_mean": 0.2696312367916107, "reward_meter_mean": 0.4741390645503998, "reward_meter_std": 0.38624247908592224, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9705674648284912, "reward_repeat_penalty_std": 0.040225934237241745, "reward_near_duplicate_penalty_mean": 0.9705674648284912, "reward_near_duplicate_penalty_std": 0.040225934237241745, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.2696312367916107, "reward_total_composite_std": 0.37265121936798096} {"timestamp_utc": "2026-04-12T10:59:02Z", "mode": "train", "global_step": 59, "epoch": 0.0023697634253122867, "loss": 0.0104, "grad_norm": 17.808332443237305, "learning_rate": 9.824242424242425e-06, "num_tokens": 132754.0, "completions/mean_length": 35.0, "completions/min_length": 33.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.8920453786849976, "rewards/meter/std": 0.04058147594332695, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.8725000023841858, "rewards/judge_quality/std": 0.1713601052761078, "rewards/repeat_penalty/mean": 0.9979227781295776, "rewards/repeat_penalty/std": 0.005288340616971254, "rewards/near_duplicate_penalty/mean": 0.9979227781295776, "rewards/near_duplicate_penalty/std": 0.005288340616971254, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7766398787498474, "rewards/total_composite/std": 0.15288196504116058, "reward": 0.7766398787498474, "reward_std": 0.15288197994232178, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09629331529140472, "sampling/sampling_logp_difference/max": 1.5427756309509277, "sampling/importance_sampling_ratio/min": 0.21378688514232635, "sampling/importance_sampling_ratio/mean": 1.0054584741592407, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.47175781801342964, "clip_ratio/low_mean": 0.0070436508394777775, "clip_ratio/low_min": 0.0070436508394777775, "clip_ratio/high_mean": 0.063939273590222, "clip_ratio/high_max": 0.063939273590222, "clip_ratio/region_mean": 0.07098292442969978, "reward_total_mean": 0.7766398787498474, "reward_meter_mean": 0.8920453786849976, "reward_meter_std": 0.04058147594332695, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9979227781295776, "reward_repeat_penalty_std": 0.005288340616971254, "reward_near_duplicate_penalty_mean": 0.9979227781295776, "reward_near_duplicate_penalty_std": 0.005288340616971254, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8725000023841858, "reward_judge_quality_std": 0.1713601052761078, "reward_total_composite_mean": 0.7766398787498474, "reward_total_composite_std": 0.15288196504116058} {"timestamp_utc": "2026-04-12T10:59:13Z", "mode": "train", "global_step": 60, "epoch": 0.0024099289070972406, "loss": 0.111, "grad_norm": 10.99131965637207, "learning_rate": 9.821212121212122e-06, "num_tokens": 134991.0, "completions/mean_length": 93.625, "completions/min_length": 68.0, "completions/max_length": 135.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.625, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.5954556465148926, "rewards/meter/std": 0.3356790542602539, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9892946481704712, "rewards/repeat_penalty/std": 0.0107206329703331, "rewards/near_duplicate_penalty/mean": 0.9929076433181763, "rewards/near_duplicate_penalty/std": 0.005824347026646137, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9963715672492981, "rewards/distinct_2/std": 0.010262799449265003, "rewards/total_composite/mean": 0.17966029047966003, "rewards/total_composite/std": 0.10174994170665741, "reward": 0.17966029047966003, "reward_std": 0.10174994170665741, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21685421466827393, "sampling/sampling_logp_difference/max": 1.3862667083740234, "sampling/importance_sampling_ratio/min": 0.25000691413879395, "sampling/importance_sampling_ratio/mean": 1.0362759828567505, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6094531416893005, "clip_ratio/low_mean": 0.09689009841531515, "clip_ratio/low_min": 0.09689009841531515, "clip_ratio/high_mean": 0.08354575373232365, "clip_ratio/high_max": 0.08354575373232365, "clip_ratio/region_mean": 0.1804358521476388, "reward_total_mean": 0.17966029047966003, "reward_meter_mean": 0.5954556465148926, "reward_meter_std": 0.3356790542602539, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9892946481704712, "reward_repeat_penalty_std": 0.0107206329703331, "reward_near_duplicate_penalty_mean": 0.9929076433181763, "reward_near_duplicate_penalty_std": 0.005824347026646137, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9963715672492981, "reward_distinct_2_std": 0.010262799449265003, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.17966029047966003, "reward_total_composite_std": 0.10174994170665741} {"timestamp_utc": "2026-04-12T10:59:23Z", "mode": "train", "global_step": 61, "epoch": 0.0024500943888821946, "loss": -0.0201, "grad_norm": 11.589716911315918, "learning_rate": 9.81818181818182e-06, "num_tokens": 136849.0, "completions/mean_length": 67.25, "completions/min_length": 49.0, "completions/max_length": 91.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.25, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.26395222544670105, "rewards/meter/std": 0.23474130034446716, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9916572570800781, "rewards/lexical_plausibility/std": 0.023596882820129395, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9916759133338928, "rewards/repeat_penalty/std": 0.008064454421401024, "rewards/near_duplicate_penalty/mean": 0.9916759133338928, "rewards/near_duplicate_penalty/std": 0.008064454421401024, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12356916815042496, "rewards/total_composite/std": 0.10796519368886948, "reward": 0.12356916815042496, "reward_std": 0.10796519368886948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21231819689273834, "sampling/sampling_logp_difference/max": 1.8033027648925781, "sampling/importance_sampling_ratio/min": 0.16475383937358856, "sampling/importance_sampling_ratio/mean": 1.039514183998108, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9188917577266693, "clip_ratio/low_mean": 0.11141200363636017, "clip_ratio/low_min": 0.11141200363636017, "clip_ratio/high_mean": 0.10190850868821144, "clip_ratio/high_max": 0.10190850868821144, "clip_ratio/region_mean": 0.2133205123245716, "reward_total_mean": 0.12356916815042496, "reward_meter_mean": 0.26395222544670105, "reward_meter_std": 0.23474130034446716, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9916572570800781, "reward_lexical_plausibility_std": 0.023596882820129395, "reward_repeat_penalty_mean": 0.9916759133338928, "reward_repeat_penalty_std": 0.008064454421401024, "reward_near_duplicate_penalty_mean": 0.9916759133338928, "reward_near_duplicate_penalty_std": 0.008064454421401024, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.12356916815042496, "reward_total_composite_std": 0.10796519368886948} {"timestamp_utc": "2026-04-12T10:59:34Z", "mode": "train", "global_step": 62, "epoch": 0.0024902598706671485, "loss": 0.0066, "grad_norm": 8.685428619384766, "learning_rate": 9.815151515151516e-06, "num_tokens": 139273.0, "completions/mean_length": 138.0, "completions/min_length": 85.0, "completions/max_length": 189.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.0, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 189.0, "rewards/meter/mean": 0.4546557664871216, "rewards/meter/std": 0.29831260442733765, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9986978769302368, "rewards/lexical_plausibility/std": 0.0036828548181802034, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9953555464744568, "rewards/repeat_penalty/std": 0.004151875153183937, "rewards/near_duplicate_penalty/mean": 0.9953555464744568, "rewards/near_duplicate_penalty/std": 0.004151875153183937, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11611887067556381, "rewards/total_composite/std": 0.083598792552948, "reward": 0.11611887067556381, "reward_std": 0.083598792552948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21783751249313354, "sampling/sampling_logp_difference/max": 1.8963346481323242, "sampling/importance_sampling_ratio/min": 0.15011785924434662, "sampling/importance_sampling_ratio/mean": 1.040421485900879, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.382453352212906, "clip_ratio/low_mean": 0.1357566211372614, "clip_ratio/low_min": 0.1357566211372614, "clip_ratio/high_mean": 0.05143502727150917, "clip_ratio/high_max": 0.05143502727150917, "clip_ratio/region_mean": 0.18719164840877056, "reward_total_mean": 0.11611887067556381, "reward_meter_mean": 0.4546557664871216, "reward_meter_std": 0.29831260442733765, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9986978769302368, "reward_lexical_plausibility_std": 0.0036828548181802034, "reward_repeat_penalty_mean": 0.9953555464744568, "reward_repeat_penalty_std": 0.004151875153183937, "reward_near_duplicate_penalty_mean": 0.9953555464744568, "reward_near_duplicate_penalty_std": 0.004151875153183937, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.11611887067556381, "reward_total_composite_std": 0.083598792552948} {"timestamp_utc": "2026-04-12T10:59:43Z", "mode": "train", "global_step": 63, "epoch": 0.002530425352452103, "loss": 0.0949, "grad_norm": 18.836515426635742, "learning_rate": 9.812121212121212e-06, "num_tokens": 140891.0, "completions/mean_length": 39.25, "completions/min_length": 31.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.5631728172302246, "rewards/meter/std": 0.45356348156929016, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1947702318429947, "rewards/total_composite/std": 0.20791685581207275, "reward": 0.1947702318429947, "reward_std": 0.20791685581207275, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2171783745288849, "sampling/sampling_logp_difference/max": 1.5032119750976562, "sampling/importance_sampling_ratio/min": 0.22241462767124176, "sampling/importance_sampling_ratio/mean": 1.0317139625549316, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.506786197423935, "clip_ratio/low_mean": 0.1136647928506136, "clip_ratio/low_min": 0.1136647928506136, "clip_ratio/high_mean": 0.09549001883715391, "clip_ratio/high_max": 0.09549001883715391, "clip_ratio/region_mean": 0.2091548116877675, "reward_total_mean": 0.1947702318429947, "reward_meter_mean": 0.5631728172302246, "reward_meter_std": 0.45356348156929016, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.1947702318429947, "reward_total_composite_std": 0.20791685581207275} {"timestamp_utc": "2026-04-12T10:59:54Z", "mode": "train", "global_step": 64, "epoch": 0.002570590834237057, "loss": 0.1169, "grad_norm": 7.857104301452637, "learning_rate": 9.809090909090911e-06, "num_tokens": 143499.0, "completions/mean_length": 141.0, "completions/min_length": 116.0, "completions/max_length": 176.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 141.0, "completions/min_terminated_length": 116.0, "completions/max_terminated_length": 176.0, "rewards/meter/mean": 0.8880764245986938, "rewards/meter/std": 0.2671806514263153, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9154520630836487, "rewards/lexical_plausibility/std": 0.11608117818832397, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9962418079376221, "rewards/repeat_penalty/std": 0.0031225020065903664, "rewards/near_duplicate_penalty/mean": 0.9962418079376221, "rewards/near_duplicate_penalty/std": 0.0031225020065903664, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1832917481660843, "rewards/total_composite/std": 0.09190372377634048, "reward": 0.1832917481660843, "reward_std": 0.09190372377634048, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20457211136817932, "sampling/sampling_logp_difference/max": 2.1627116203308105, "sampling/importance_sampling_ratio/min": 0.11501282453536987, "sampling/importance_sampling_ratio/mean": 1.0372601747512817, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6322957575321198, "clip_ratio/low_mean": 0.1129800220951438, "clip_ratio/low_min": 0.1129800220951438, "clip_ratio/high_mean": 0.08206339180469513, "clip_ratio/high_max": 0.08206339180469513, "clip_ratio/region_mean": 0.19504341389983892, "reward_total_mean": 0.1832917481660843, "reward_meter_mean": 0.8880764245986938, "reward_meter_std": 0.2671806514263153, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9154520630836487, "reward_lexical_plausibility_std": 0.11608117818832397, "reward_repeat_penalty_mean": 0.9962418079376221, "reward_repeat_penalty_std": 0.0031225020065903664, "reward_near_duplicate_penalty_mean": 0.9962418079376221, "reward_near_duplicate_penalty_std": 0.0031225020065903664, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.1832917481660843, "reward_total_composite_std": 0.09190372377634048} {"timestamp_utc": "2026-04-12T11:00:05Z", "mode": "train", "global_step": 65, "epoch": 0.0026107563160220107, "loss": 0.138, "grad_norm": 11.104138374328613, "learning_rate": 9.806060606060607e-06, "num_tokens": 145773.0, "completions/mean_length": 91.25, "completions/min_length": 58.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.25, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.5430281758308411, "rewards/meter/std": 0.4575187861919403, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9807285666465759, "rewards/lexical_plausibility/std": 0.054507844150066376, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9975701570510864, "rewards/repeat_penalty/std": 0.0033119902946054935, "rewards/near_duplicate_penalty/mean": 0.9975701570510864, "rewards/near_duplicate_penalty/std": 0.0033119902946054935, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1771267056465149, "rewards/total_composite/std": 0.17245365679264069, "reward": 0.1771267056465149, "reward_std": 0.1724536418914795, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19685818254947662, "sampling/sampling_logp_difference/max": 1.9196500778198242, "sampling/importance_sampling_ratio/min": 0.1466582715511322, "sampling/importance_sampling_ratio/mean": 1.0336054563522339, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.221826910972595, "clip_ratio/low_mean": 0.09496940113604069, "clip_ratio/low_min": 0.09496940113604069, "clip_ratio/high_mean": 0.06819553300738335, "clip_ratio/high_max": 0.06819553300738335, "clip_ratio/region_mean": 0.16316493414342403, "reward_total_mean": 0.1771267056465149, "reward_meter_mean": 0.5430281758308411, "reward_meter_std": 0.4575187861919403, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9807285666465759, "reward_lexical_plausibility_std": 0.054507844150066376, "reward_repeat_penalty_mean": 0.9975701570510864, "reward_repeat_penalty_std": 0.0033119902946054935, "reward_near_duplicate_penalty_mean": 0.9975701570510864, "reward_near_duplicate_penalty_std": 0.0033119902946054935, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.1771267056465149, "reward_total_composite_std": 0.17245365679264069} {"timestamp_utc": "2026-04-12T11:00:15Z", "mode": "train", "global_step": 66, "epoch": 0.0026509217978069647, "loss": 0.0022, "grad_norm": 24.601667404174805, "learning_rate": 9.803030303030304e-06, "num_tokens": 147548.0, "completions/mean_length": 41.875, "completions/min_length": 29.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.978650689125061, "rewards/meter/std": 0.05017535015940666, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8212499618530273, "rewards/judge_quality/std": 0.22937415540218353, "rewards/repeat_penalty/mean": 0.9656137824058533, "rewards/repeat_penalty/std": 0.0294276624917984, "rewards/near_duplicate_penalty/mean": 0.9656137824058533, "rewards/near_duplicate_penalty/std": 0.0294276624917984, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.8102796077728271, "rewards/total_composite/std": 0.24384412169456482, "reward": 0.8102796077728271, "reward_std": 0.24384410679340363, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1336280256509781, "sampling/sampling_logp_difference/max": 2.570559501647949, "sampling/importance_sampling_ratio/min": 0.07649273425340652, "sampling/importance_sampling_ratio/mean": 0.9901538491249084, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46303134225308895, "clip_ratio/low_mean": 0.04460171051323414, "clip_ratio/low_min": 0.04460171051323414, "clip_ratio/high_mean": 0.05560530349612236, "clip_ratio/high_max": 0.05560530349612236, "clip_ratio/region_mean": 0.1002070140093565, "reward_total_mean": 0.8102796077728271, "reward_meter_mean": 0.978650689125061, "reward_meter_std": 0.05017535015940666, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9656137824058533, "reward_repeat_penalty_std": 0.0294276624917984, "reward_near_duplicate_penalty_mean": 0.9656137824058533, "reward_near_duplicate_penalty_std": 0.0294276624917984, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8212499618530273, "reward_judge_quality_std": 0.22937415540218353, "reward_total_composite_mean": 0.8102796077728271, "reward_total_composite_std": 0.24384412169456482} {"timestamp_utc": "2026-04-12T11:00:24Z", "mode": "train", "global_step": 67, "epoch": 0.0026910872795919186, "loss": 0.023, "grad_norm": 20.278247833251953, "learning_rate": 9.800000000000001e-06, "num_tokens": 149152.0, "completions/mean_length": 42.5, "completions/min_length": 30.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.5701628923416138, "rewards/meter/std": 0.36496612429618835, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9910990595817566, "rewards/lexical_plausibility/std": 0.02517561987042427, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9709295034408569, "rewards/repeat_penalty/std": 0.03340797498822212, "rewards/near_duplicate_penalty/mean": 0.9709295034408569, "rewards/near_duplicate_penalty/std": 0.03340797498822212, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32349228858947754, "rewards/total_composite/std": 0.25729161500930786, "reward": 0.32349228858947754, "reward_std": 0.25729164481163025, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22895435988903046, "sampling/sampling_logp_difference/max": 1.4766225814819336, "sampling/importance_sampling_ratio/min": 0.2284078299999237, "sampling/importance_sampling_ratio/mean": 1.0299285650253296, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8747659176588058, "clip_ratio/low_mean": 0.1095969807356596, "clip_ratio/low_min": 0.1095969807356596, "clip_ratio/high_mean": 0.0692050140351057, "clip_ratio/high_max": 0.0692050140351057, "clip_ratio/region_mean": 0.1788019947707653, "reward_total_mean": 0.32349228858947754, "reward_meter_mean": 0.5701628923416138, "reward_meter_std": 0.36496612429618835, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9910990595817566, "reward_lexical_plausibility_std": 0.02517561987042427, "reward_repeat_penalty_mean": 0.9709295034408569, "reward_repeat_penalty_std": 0.03340797498822212, "reward_near_duplicate_penalty_mean": 0.9709295034408569, "reward_near_duplicate_penalty_std": 0.03340797498822212, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.32349228858947754, "reward_total_composite_std": 0.25729161500930786} {"timestamp_utc": "2026-04-12T11:00:34Z", "mode": "train", "global_step": 68, "epoch": 0.0027312527613768726, "loss": -0.0168, "grad_norm": 16.09491729736328, "learning_rate": 9.796969696969698e-06, "num_tokens": 150820.0, "completions/mean_length": 53.5, "completions/min_length": 35.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.37656503915786743, "rewards/meter/std": 0.3850724697113037, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9549214839935303, "rewards/lexical_plausibility/std": 0.10456041991710663, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9830353260040283, "rewards/repeat_penalty/std": 0.024728700518608093, "rewards/near_duplicate_penalty/mean": 0.9830353260040283, "rewards/near_duplicate_penalty/std": 0.024728700518608093, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1273587942123413, "rewards/total_composite/std": 0.13430751860141754, "reward": 0.1273587942123413, "reward_std": 0.13430751860141754, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20365306735038757, "sampling/sampling_logp_difference/max": 1.881567358970642, "sampling/importance_sampling_ratio/min": 0.15235112607479095, "sampling/importance_sampling_ratio/mean": 1.0225739479064941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.723569542169571, "clip_ratio/low_mean": 0.1031299326568842, "clip_ratio/low_min": 0.1031299326568842, "clip_ratio/high_mean": 0.11396108567714691, "clip_ratio/high_max": 0.11396108567714691, "clip_ratio/region_mean": 0.2170910183340311, "reward_total_mean": 0.1273587942123413, "reward_meter_mean": 0.37656503915786743, "reward_meter_std": 0.3850724697113037, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9549214839935303, "reward_lexical_plausibility_std": 0.10456041991710663, "reward_repeat_penalty_mean": 0.9830353260040283, "reward_repeat_penalty_std": 0.024728700518608093, "reward_near_duplicate_penalty_mean": 0.9830353260040283, "reward_near_duplicate_penalty_std": 0.024728700518608093, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.1273587942123413, "reward_total_composite_std": 0.13430751860141754} {"timestamp_utc": "2026-04-12T11:00:41Z", "mode": "train", "global_step": 69, "epoch": 0.002771418243161827, "loss": -0.018, "grad_norm": 40.95964050292969, "learning_rate": 9.793939393939394e-06, "num_tokens": 152206.0, "completions/mean_length": 25.25, "completions/min_length": 22.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.25, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.8356223702430725, "rewards/meter/std": 0.24600468575954437, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9424999952316284, "rewards/judge_quality/std": 0.013887288980185986, "rewards/repeat_penalty/mean": 0.9844276309013367, "rewards/repeat_penalty/std": 0.00961147528141737, "rewards/near_duplicate_penalty/mean": 0.9844276309013367, "rewards/near_duplicate_penalty/std": 0.00961147528141737, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7894231081008911, "rewards/total_composite/std": 0.23446962237358093, "reward": 0.7894231081008911, "reward_std": 0.23446960747241974, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07563488930463791, "sampling/sampling_logp_difference/max": 1.2072997093200684, "sampling/importance_sampling_ratio/min": 0.29900357127189636, "sampling/importance_sampling_ratio/mean": 0.9926040768623352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.23366530891507864, "clip_ratio/low_mean": 0.005681818351149559, "clip_ratio/low_min": 0.005681818351149559, "clip_ratio/high_mean": 0.06956934370100498, "clip_ratio/high_max": 0.06956934370100498, "clip_ratio/region_mean": 0.07525116205215454, "reward_total_mean": 0.7894231081008911, "reward_meter_mean": 0.8356223702430725, "reward_meter_std": 0.24600468575954437, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9844276309013367, "reward_repeat_penalty_std": 0.00961147528141737, "reward_near_duplicate_penalty_mean": 0.9844276309013367, "reward_near_duplicate_penalty_std": 0.00961147528141737, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9424999952316284, "reward_judge_quality_std": 0.013887288980185986, "reward_total_composite_mean": 0.7894231081008911, "reward_total_composite_std": 0.23446962237358093} {"timestamp_utc": "2026-04-12T11:00:56Z", "mode": "train", "global_step": 70, "epoch": 0.002811583724946781, "loss": -0.1946, "grad_norm": 3.6259946823120117, "learning_rate": 9.790909090909093e-06, "num_tokens": 156279.0, "completions/mean_length": 417.125, "completions/min_length": 310.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 385.5, "completions/min_terminated_length": 310.0, "completions/max_terminated_length": 502.0, "rewards/meter/mean": 0.8855130672454834, "rewards/meter/std": 0.10192851722240448, "rewards/count_adherence/mean": 0.9038461446762085, "rewards/count_adherence/std": 0.03560846298933029, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9922628998756409, "rewards/repeat_penalty/std": 0.005649227183312178, "rewards/near_duplicate_penalty/mean": 0.9961462020874023, "rewards/near_duplicate_penalty/std": 0.0011077204253524542, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9961007833480835, "rewards/distinct_2/std": 0.005382579285651445, "rewards/total_composite/mean": 0.2245791256427765, "rewards/total_composite/std": 0.13737398386001587, "reward": 0.2245791256427765, "reward_std": 0.13737396895885468, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2077775001525879, "sampling/sampling_logp_difference/max": 1.387526512145996, "sampling/importance_sampling_ratio/min": 0.2496921569108963, "sampling/importance_sampling_ratio/mean": 1.040596604347229, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.358903408050537, "clip_ratio/low_mean": 0.020779220387339592, "clip_ratio/low_min": 0.020779220387339592, "clip_ratio/high_mean": 0.12808114290237427, "clip_ratio/high_max": 0.12808114290237427, "clip_ratio/region_mean": 0.14886036328971386, "reward_total_mean": 0.2245791256427765, "reward_meter_mean": 0.8855130672454834, "reward_meter_std": 0.10192851722240448, "reward_count_adherence_mean": 0.9038461446762085, "reward_count_adherence_std": 0.03560846298933029, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9922628998756409, "reward_repeat_penalty_std": 0.005649227183312178, "reward_near_duplicate_penalty_mean": 0.9961462020874023, "reward_near_duplicate_penalty_std": 0.0011077204253524542, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9961007833480835, "reward_distinct_2_std": 0.005382579285651445, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.2245791256427765, "reward_total_composite_std": 0.13737398386001587} {"timestamp_utc": "2026-04-12T11:01:05Z", "mode": "train", "global_step": 71, "epoch": 0.002851749206731735, "loss": 0.0743, "grad_norm": 20.082340240478516, "learning_rate": 9.787878787878788e-06, "num_tokens": 157806.0, "completions/mean_length": 31.875, "completions/min_length": 25.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.875, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.7298133969306946, "rewards/meter/std": 0.34841012954711914, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.2707628309726715, "rewards/repeat_penalty/mean": 0.8956765532493591, "rewards/repeat_penalty/std": 0.10391052812337875, "rewards/near_duplicate_penalty/mean": 0.987528920173645, "rewards/near_duplicate_penalty/std": 0.008463931269943714, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9065170884132385, "rewards/distinct_2/std": 0.10018188506364822, "rewards/total_composite/mean": 0.5111167430877686, "rewards/total_composite/std": 0.33344566822052, "reward": 0.5111167430877686, "reward_std": 0.33344566822052, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16924262046813965, "sampling/sampling_logp_difference/max": 1.339747428894043, "sampling/importance_sampling_ratio/min": 0.2619118094444275, "sampling/importance_sampling_ratio/mean": 0.9970604181289673, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1145559754222631, "clip_ratio/low_mean": 0.1381722390651703, "clip_ratio/low_min": 0.1381722390651703, "clip_ratio/high_mean": 0.011363636702299118, "clip_ratio/high_max": 0.011363636702299118, "clip_ratio/region_mean": 0.1495358757674694, "reward_total_mean": 0.5111167430877686, "reward_meter_mean": 0.7298133969306946, "reward_meter_std": 0.34841012954711914, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8956765532493591, "reward_repeat_penalty_std": 0.10391052812337875, "reward_near_duplicate_penalty_mean": 0.987528920173645, "reward_near_duplicate_penalty_std": 0.008463931269943714, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9065170884132385, "reward_distinct_2_std": 0.10018188506364822, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.2707628309726715, "reward_total_composite_mean": 0.5111167430877686, "reward_total_composite_std": 0.33344566822052} {"timestamp_utc": "2026-04-12T11:01:14Z", "mode": "train", "global_step": 72, "epoch": 0.0028919146885166887, "loss": -0.0497, "grad_norm": 14.805048942565918, "learning_rate": 9.784848484848486e-06, "num_tokens": 159635.0, "completions/mean_length": 52.625, "completions/min_length": 36.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.45533621311187744, "rewards/meter/std": 0.4449755549430847, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9885790348052979, "rewards/repeat_penalty/std": 0.031295377761125565, "rewards/near_duplicate_penalty/mean": 0.9986138343811035, "rewards/near_duplicate_penalty/std": 0.0030318740755319595, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.13843142986297607, "rewards/total_composite/std": 0.13367311656475067, "reward": 0.13843142986297607, "reward_std": 0.13367311656475067, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2201484739780426, "sampling/sampling_logp_difference/max": 1.6301121711730957, "sampling/importance_sampling_ratio/min": 0.1959075927734375, "sampling/importance_sampling_ratio/mean": 1.0505764484405518, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2289724200963974, "clip_ratio/low_mean": 0.09259190503507853, "clip_ratio/low_min": 0.09259190503507853, "clip_ratio/high_mean": 0.10724222846329212, "clip_ratio/high_max": 0.10724222846329212, "clip_ratio/region_mean": 0.19983413349837065, "reward_total_mean": 0.13843142986297607, "reward_meter_mean": 0.45533621311187744, "reward_meter_std": 0.4449755549430847, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9885790348052979, "reward_repeat_penalty_std": 0.031295377761125565, "reward_near_duplicate_penalty_mean": 0.9986138343811035, "reward_near_duplicate_penalty_std": 0.0030318740755319595, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.13843142986297607, "reward_total_composite_std": 0.13367311656475067} {"timestamp_utc": "2026-04-12T11:01:23Z", "mode": "train", "global_step": 73, "epoch": 0.0029320801703016427, "loss": 0.0899, "grad_norm": 17.469419479370117, "learning_rate": 9.781818181818183e-06, "num_tokens": 161138.0, "completions/mean_length": 37.875, "completions/min_length": 29.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7943594455718994, "rewards/meter/std": 0.30483105778694153, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.10350983589887619, "rewards/repeat_penalty/mean": 0.9412729740142822, "rewards/repeat_penalty/std": 0.1250309944152832, "rewards/near_duplicate_penalty/mean": 0.9755563735961914, "rewards/near_duplicate_penalty/std": 0.02905178628861904, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.28405147790908813, "rewards/total_composite/std": 0.1237814724445343, "reward": 0.28405147790908813, "reward_std": 0.1237814724445343, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2270776480436325, "sampling/sampling_logp_difference/max": 1.622610092163086, "sampling/importance_sampling_ratio/min": 0.197382852435112, "sampling/importance_sampling_ratio/mean": 1.0431281328201294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2778522223234177, "clip_ratio/low_mean": 0.06417410634458065, "clip_ratio/low_min": 0.06417410634458065, "clip_ratio/high_mean": 0.14028591848909855, "clip_ratio/high_max": 0.14028591848909855, "clip_ratio/region_mean": 0.2044600248336792, "reward_total_mean": 0.28405147790908813, "reward_meter_mean": 0.7943594455718994, "reward_meter_std": 0.30483105778694153, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9412729740142822, "reward_repeat_penalty_std": 0.1250309944152832, "reward_near_duplicate_penalty_mean": 0.9755563735961914, "reward_near_duplicate_penalty_std": 0.02905178628861904, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.10350983589887619, "reward_total_composite_mean": 0.28405147790908813, "reward_total_composite_std": 0.1237814724445343} {"timestamp_utc": "2026-04-12T11:01:32Z", "mode": "train", "global_step": 74, "epoch": 0.0029722456520865966, "loss": 0.043, "grad_norm": 15.154500007629395, "learning_rate": 9.77878787878788e-06, "num_tokens": 162839.0, "completions/mean_length": 44.625, "completions/min_length": 37.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6420912146568298, "rewards/meter/std": 0.3212152421474457, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5337499976158142, "rewards/judge_quality/std": 0.23445606231689453, "rewards/repeat_penalty/mean": 0.9913415908813477, "rewards/repeat_penalty/std": 0.014010717160999775, "rewards/near_duplicate_penalty/mean": 0.9913415908813477, "rewards/near_duplicate_penalty/std": 0.014010717160999775, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3114110231399536, "rewards/total_composite/std": 0.16819478571414948, "reward": 0.3114110231399536, "reward_std": 0.16819478571414948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22432444989681244, "sampling/sampling_logp_difference/max": 1.4277992248535156, "sampling/importance_sampling_ratio/min": 0.239836186170578, "sampling/importance_sampling_ratio/mean": 1.0319697856903076, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8442463725805283, "clip_ratio/low_mean": 0.08643845655024052, "clip_ratio/low_min": 0.08643845655024052, "clip_ratio/high_mean": 0.12991708144545555, "clip_ratio/high_max": 0.12991708144545555, "clip_ratio/region_mean": 0.21635553799569607, "reward_total_mean": 0.3114110231399536, "reward_meter_mean": 0.6420912146568298, "reward_meter_std": 0.3212152421474457, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9913415908813477, "reward_repeat_penalty_std": 0.014010717160999775, "reward_near_duplicate_penalty_mean": 0.9913415908813477, "reward_near_duplicate_penalty_std": 0.014010717160999775, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5337499976158142, "reward_judge_quality_std": 0.23445606231689453, "reward_total_composite_mean": 0.3114110231399536, "reward_total_composite_std": 0.16819478571414948} {"timestamp_utc": "2026-04-12T11:01:48Z", "mode": "train", "global_step": 75, "epoch": 0.003012411133871551, "loss": 0.2983, "grad_norm": 3.368990898132324, "learning_rate": 9.775757575757576e-06, "num_tokens": 166104.0, "completions/mean_length": 454.125, "completions/min_length": 220.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 396.25, "completions/min_terminated_length": 220.0, "completions/max_terminated_length": 470.0, "rewards/meter/mean": 0.6994812488555908, "rewards/meter/std": 0.17008261382579803, "rewards/count_adherence/mean": 0.8374999761581421, "rewards/count_adherence/std": 0.16201850771903992, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9991605877876282, "rewards/lexical_plausibility/std": 0.0015816990053281188, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9920966029167175, "rewards/repeat_penalty/std": 0.006813052576035261, "rewards/near_duplicate_penalty/mean": 0.9953973889350891, "rewards/near_duplicate_penalty/std": 0.0027697717305272818, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9966833591461182, "rewards/distinct_2/std": 0.006151220761239529, "rewards/total_composite/mean": 0.09628508985042572, "rewards/total_composite/std": 0.05001360923051834, "reward": 0.09628508985042572, "reward_std": 0.05001360923051834, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22374960780143738, "sampling/sampling_logp_difference/max": 1.7989654541015625, "sampling/importance_sampling_ratio/min": 0.16546998918056488, "sampling/importance_sampling_ratio/mean": 1.0535924434661865, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8021921217441559, "clip_ratio/low_mean": 0.06391321308910847, "clip_ratio/low_min": 0.06391321308910847, "clip_ratio/high_mean": 0.02845744602382183, "clip_ratio/high_max": 0.02845744602382183, "clip_ratio/region_mean": 0.0923706591129303, "reward_total_mean": 0.09628508985042572, "reward_meter_mean": 0.6994812488555908, "reward_meter_std": 0.17008261382579803, "reward_count_adherence_mean": 0.8374999761581421, "reward_count_adherence_std": 0.16201850771903992, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9991605877876282, "reward_lexical_plausibility_std": 0.0015816990053281188, "reward_repeat_penalty_mean": 0.9920966029167175, "reward_repeat_penalty_std": 0.006813052576035261, "reward_near_duplicate_penalty_mean": 0.9953973889350891, "reward_near_duplicate_penalty_std": 0.0027697717305272818, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9966833591461182, "reward_distinct_2_std": 0.006151220761239529, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.09628508985042572, "reward_total_composite_std": 0.05001360923051834} {"timestamp_utc": "2026-04-12T11:01:58Z", "mode": "train", "global_step": 76, "epoch": 0.003052576615656505, "loss": 0.155, "grad_norm": 10.245954513549805, "learning_rate": 9.772727272727273e-06, "num_tokens": 168471.0, "completions/mean_length": 106.875, "completions/min_length": 68.0, "completions/max_length": 164.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 164.0, "rewards/meter/mean": 0.44018733501434326, "rewards/meter/std": 0.2502119839191437, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9872140884399414, "rewards/lexical_plausibility/std": 0.023682869970798492, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9958027601242065, "rewards/repeat_penalty/std": 0.003779177786782384, "rewards/near_duplicate_penalty/mean": 0.9958027601242065, "rewards/near_duplicate_penalty/std": 0.003779177786782384, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1325821578502655, "rewards/total_composite/std": 0.09790375083684921, "reward": 0.1325821578502655, "reward_std": 0.09790375083684921, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2237071543931961, "sampling/sampling_logp_difference/max": 2.673611640930176, "sampling/importance_sampling_ratio/min": 0.06900256127119064, "sampling/importance_sampling_ratio/mean": 1.0415984392166138, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.82192063331604, "clip_ratio/low_mean": 0.10153472051024437, "clip_ratio/low_min": 0.10153472051024437, "clip_ratio/high_mean": 0.06862385757267475, "clip_ratio/high_max": 0.06862385757267475, "clip_ratio/region_mean": 0.17015857808291912, "reward_total_mean": 0.1325821578502655, "reward_meter_mean": 0.44018733501434326, "reward_meter_std": 0.2502119839191437, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9872140884399414, "reward_lexical_plausibility_std": 0.023682869970798492, "reward_repeat_penalty_mean": 0.9958027601242065, "reward_repeat_penalty_std": 0.003779177786782384, "reward_near_duplicate_penalty_mean": 0.9958027601242065, "reward_near_duplicate_penalty_std": 0.003779177786782384, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1325821578502655, "reward_total_composite_std": 0.09790375083684921} {"timestamp_utc": "2026-04-12T11:02:09Z", "mode": "train", "global_step": 77, "epoch": 0.003092742097441459, "loss": 0.0214, "grad_norm": 12.224149703979492, "learning_rate": 9.76969696969697e-06, "num_tokens": 170378.0, "completions/mean_length": 74.375, "completions/min_length": 53.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.375, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.5974334478378296, "rewards/meter/std": 0.4106157124042511, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9610192775726318, "rewards/lexical_plausibility/std": 0.09549286216497421, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9934601187705994, "rewards/repeat_penalty/std": 0.005460478365421295, "rewards/near_duplicate_penalty/mean": 0.9934601187705994, "rewards/near_duplicate_penalty/std": 0.005460478365421295, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24743841588497162, "rewards/total_composite/std": 0.20405541360378265, "reward": 0.24743841588497162, "reward_std": 0.20405542850494385, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2201482504606247, "sampling/sampling_logp_difference/max": 1.216226577758789, "sampling/importance_sampling_ratio/min": 0.2963462769985199, "sampling/importance_sampling_ratio/mean": 1.0458892583847046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8140107095241547, "clip_ratio/low_mean": 0.10759576968848705, "clip_ratio/low_min": 0.10759576968848705, "clip_ratio/high_mean": 0.10649478435516357, "clip_ratio/high_max": 0.10649478435516357, "clip_ratio/region_mean": 0.21409055404365063, "reward_total_mean": 0.24743841588497162, "reward_meter_mean": 0.5974334478378296, "reward_meter_std": 0.4106157124042511, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9610192775726318, "reward_lexical_plausibility_std": 0.09549286216497421, "reward_repeat_penalty_mean": 0.9934601187705994, "reward_repeat_penalty_std": 0.005460478365421295, "reward_near_duplicate_penalty_mean": 0.9934601187705994, "reward_near_duplicate_penalty_std": 0.005460478365421295, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.24743841588497162, "reward_total_composite_std": 0.20405541360378265} {"timestamp_utc": "2026-04-12T11:02:20Z", "mode": "train", "global_step": 78, "epoch": 0.003132907579226413, "loss": 0.0933, "grad_norm": 7.355525493621826, "learning_rate": 9.766666666666667e-06, "num_tokens": 173461.0, "completions/mean_length": 179.375, "completions/min_length": 152.0, "completions/max_length": 205.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 179.375, "completions/min_terminated_length": 152.0, "completions/max_terminated_length": 205.0, "rewards/meter/mean": 0.7604238390922546, "rewards/meter/std": 0.27199587225914, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9908215999603271, "rewards/repeat_penalty/std": 0.009297901764512062, "rewards/near_duplicate_penalty/mean": 0.9939049482345581, "rewards/near_duplicate_penalty/std": 0.0034192020539194345, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9968982934951782, "rewards/distinct_2/std": 0.008773035369813442, "rewards/total_composite/mean": 0.20494306087493896, "rewards/total_composite/std": 0.0963810607790947, "reward": 0.20494306087493896, "reward_std": 0.0963810607790947, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1939438134431839, "sampling/sampling_logp_difference/max": 1.908888816833496, "sampling/importance_sampling_ratio/min": 0.14824502170085907, "sampling/importance_sampling_ratio/mean": 1.037878394126892, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2233941107988358, "clip_ratio/low_mean": 0.08701690286397934, "clip_ratio/low_min": 0.08701690286397934, "clip_ratio/high_mean": 0.0969635471701622, "clip_ratio/high_max": 0.0969635471701622, "clip_ratio/region_mean": 0.18398045003414154, "reward_total_mean": 0.20494306087493896, "reward_meter_mean": 0.7604238390922546, "reward_meter_std": 0.27199587225914, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9908215999603271, "reward_repeat_penalty_std": 0.009297901764512062, "reward_near_duplicate_penalty_mean": 0.9939049482345581, "reward_near_duplicate_penalty_std": 0.0034192020539194345, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9968982934951782, "reward_distinct_2_std": 0.008773035369813442, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.20494306087493896, "reward_total_composite_std": 0.0963810607790947} {"timestamp_utc": "2026-04-12T11:02:32Z", "mode": "train", "global_step": 79, "epoch": 0.0031730730610113667, "loss": -0.0354, "grad_norm": 6.8120436668396, "learning_rate": 9.763636363636365e-06, "num_tokens": 176653.0, "completions/mean_length": 196.0, "completions/min_length": 103.0, "completions/max_length": 254.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 196.0, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 254.0, "rewards/meter/mean": 0.6108548045158386, "rewards/meter/std": 0.36881759762763977, "rewards/count_adherence/mean": 0.8541666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9920930862426758, "rewards/lexical_plausibility/std": 0.022364171221852303, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9866504073143005, "rewards/repeat_penalty/std": 0.016313185915350914, "rewards/near_duplicate_penalty/mean": 0.9969182014465332, "rewards/near_duplicate_penalty/std": 0.0017705624923110008, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.989695131778717, "rewards/distinct_2/std": 0.015878980979323387, "rewards/total_composite/mean": 0.16621604561805725, "rewards/total_composite/std": 0.1380038559436798, "reward": 0.16621604561805725, "reward_std": 0.13800382614135742, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2137884944677353, "sampling/sampling_logp_difference/max": 1.9605722427368164, "sampling/importance_sampling_ratio/min": 0.1407778412103653, "sampling/importance_sampling_ratio/mean": 1.0485703945159912, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.92401659488678, "clip_ratio/low_mean": 0.10013115033507347, "clip_ratio/low_min": 0.10013115033507347, "clip_ratio/high_mean": 0.0744392741471529, "clip_ratio/high_max": 0.0744392741471529, "clip_ratio/region_mean": 0.17457042448222637, "reward_total_mean": 0.16621604561805725, "reward_meter_mean": 0.6108548045158386, "reward_meter_std": 0.36881759762763977, "reward_count_adherence_mean": 0.8541666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9920930862426758, "reward_lexical_plausibility_std": 0.022364171221852303, "reward_repeat_penalty_mean": 0.9866504073143005, "reward_repeat_penalty_std": 0.016313185915350914, "reward_near_duplicate_penalty_mean": 0.9969182014465332, "reward_near_duplicate_penalty_std": 0.0017705624923110008, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.989695131778717, "reward_distinct_2_std": 0.015878980979323387, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.16621604561805725, "reward_total_composite_std": 0.1380038559436798} {"timestamp_utc": "2026-04-12T11:02:41Z", "mode": "train", "global_step": 80, "epoch": 0.0032132385427963207, "loss": 0.0156, "grad_norm": 15.379478454589844, "learning_rate": 9.760606060606062e-06, "num_tokens": 178337.0, "completions/mean_length": 45.5, "completions/min_length": 34.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6371452212333679, "rewards/meter/std": 0.42659109830856323, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5287500023841858, "rewards/judge_quality/std": 0.18333713710308075, "rewards/repeat_penalty/mean": 0.9953550696372986, "rewards/repeat_penalty/std": 0.006389432121068239, "rewards/near_duplicate_penalty/mean": 0.9953550696372986, "rewards/near_duplicate_penalty/std": 0.006389432121068239, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3356579542160034, "rewards/total_composite/std": 0.2821563184261322, "reward": 0.3356579542160034, "reward_std": 0.2821563184261322, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21456630527973175, "sampling/sampling_logp_difference/max": 1.4055638313293457, "sampling/importance_sampling_ratio/min": 0.24522875249385834, "sampling/importance_sampling_ratio/mean": 1.0313081741333008, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3910775184631348, "clip_ratio/low_mean": 0.0916936518624425, "clip_ratio/low_min": 0.0916936518624425, "clip_ratio/high_mean": 0.1300747711211443, "clip_ratio/high_max": 0.1300747711211443, "clip_ratio/region_mean": 0.2217684229835868, "reward_total_mean": 0.3356579542160034, "reward_meter_mean": 0.6371452212333679, "reward_meter_std": 0.42659109830856323, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9953550696372986, "reward_repeat_penalty_std": 0.006389432121068239, "reward_near_duplicate_penalty_mean": 0.9953550696372986, "reward_near_duplicate_penalty_std": 0.006389432121068239, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5287500023841858, "reward_judge_quality_std": 0.18333713710308075, "reward_total_composite_mean": 0.3356579542160034, "reward_total_composite_std": 0.2821563184261322} {"timestamp_utc": "2026-04-12T11:02:51Z", "mode": "train", "global_step": 81, "epoch": 0.003253404024581275, "loss": 0.0635, "grad_norm": 13.21326732635498, "learning_rate": 9.757575757575758e-06, "num_tokens": 180108.0, "completions/mean_length": 48.375, "completions/min_length": 35.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.3304923474788666, "rewards/meter/std": 0.3466903567314148, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9575716257095337, "rewards/lexical_plausibility/std": 0.0786299780011177, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2584569752216339, "rewards/repeat_penalty/mean": 0.9907418489456177, "rewards/repeat_penalty/std": 0.01250008586794138, "rewards/near_duplicate_penalty/mean": 0.9907418489456177, "rewards/near_duplicate_penalty/std": 0.01250008586794138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1738933026790619, "rewards/total_composite/std": 0.22043001651763916, "reward": 0.1738933026790619, "reward_std": 0.22043000161647797, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2102905660867691, "sampling/sampling_logp_difference/max": 1.1979718208312988, "sampling/importance_sampling_ratio/min": 0.301805704832077, "sampling/importance_sampling_ratio/mean": 1.054197907447815, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.183119833469391, "clip_ratio/low_mean": 0.13772014062851667, "clip_ratio/low_min": 0.13772014062851667, "clip_ratio/high_mean": 0.07689860463142395, "clip_ratio/high_max": 0.07689860463142395, "clip_ratio/region_mean": 0.21461874525994062, "reward_total_mean": 0.1738933026790619, "reward_meter_mean": 0.3304923474788666, "reward_meter_std": 0.3466903567314148, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9575716257095337, "reward_lexical_plausibility_std": 0.0786299780011177, "reward_repeat_penalty_mean": 0.9907418489456177, "reward_repeat_penalty_std": 0.01250008586794138, "reward_near_duplicate_penalty_mean": 0.9907418489456177, "reward_near_duplicate_penalty_std": 0.01250008586794138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2584569752216339, "reward_total_composite_mean": 0.1738933026790619, "reward_total_composite_std": 0.22043001651763916} {"timestamp_utc": "2026-04-12T11:03:00Z", "mode": "train", "global_step": 82, "epoch": 0.003293569506366229, "loss": 0.0446, "grad_norm": 20.60401153564453, "learning_rate": 9.754545454545455e-06, "num_tokens": 181911.0, "completions/mean_length": 62.375, "completions/min_length": 52.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.375, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.5103211998939514, "rewards/meter/std": 0.457789808511734, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.972140371799469, "rewards/repeat_penalty/std": 0.03721826151013374, "rewards/near_duplicate_penalty/mean": 0.9814019203186035, "rewards/near_duplicate_penalty/std": 0.01771257445216179, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.16879403591156006, "rewards/total_composite/std": 0.17233037948608398, "reward": 0.16879403591156006, "reward_std": 0.17233037948608398, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20648972690105438, "sampling/sampling_logp_difference/max": 2.3103561401367188, "sampling/importance_sampling_ratio/min": 0.09922590851783752, "sampling/importance_sampling_ratio/mean": 0.9993157386779785, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8028803467750549, "clip_ratio/low_mean": 0.10225484520196915, "clip_ratio/low_min": 0.10225484520196915, "clip_ratio/high_mean": 0.04357881844043732, "clip_ratio/high_max": 0.04357881844043732, "clip_ratio/region_mean": 0.14583366364240646, "reward_total_mean": 0.16879403591156006, "reward_meter_mean": 0.5103211998939514, "reward_meter_std": 0.457789808511734, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.972140371799469, "reward_repeat_penalty_std": 0.03721826151013374, "reward_near_duplicate_penalty_mean": 0.9814019203186035, "reward_near_duplicate_penalty_std": 0.01771257445216179, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.16879403591156006, "reward_total_composite_std": 0.17233037948608398} {"timestamp_utc": "2026-04-12T11:03:10Z", "mode": "train", "global_step": 83, "epoch": 0.003333734988151183, "loss": -0.0125, "grad_norm": 11.30092716217041, "learning_rate": 9.751515151515152e-06, "num_tokens": 183548.0, "completions/mean_length": 51.625, "completions/min_length": 35.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.5117467641830444, "rewards/meter/std": 0.42367249727249146, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9543439149856567, "rewards/lexical_plausibility/std": 0.10052025318145752, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.9962121248245239, "rewards/repeat_penalty/std": 0.007013781927525997, "rewards/near_duplicate_penalty/mean": 0.9962121248245239, "rewards/near_duplicate_penalty/std": 0.007013781927525997, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2862284779548645, "rewards/total_composite/std": 0.2962500751018524, "reward": 0.2862284779548645, "reward_std": 0.2962500751018524, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18761391937732697, "sampling/sampling_logp_difference/max": 1.7637081146240234, "sampling/importance_sampling_ratio/min": 0.17140808701515198, "sampling/importance_sampling_ratio/mean": 1.0273298025131226, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.882716327905655, "clip_ratio/low_mean": 0.07597680296748877, "clip_ratio/low_min": 0.07597680296748877, "clip_ratio/high_mean": 0.1147812120616436, "clip_ratio/high_max": 0.1147812120616436, "clip_ratio/region_mean": 0.19075801502913237, "reward_total_mean": 0.2862284779548645, "reward_meter_mean": 0.5117467641830444, "reward_meter_std": 0.42367249727249146, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9543439149856567, "reward_lexical_plausibility_std": 0.10052025318145752, "reward_repeat_penalty_mean": 0.9962121248245239, "reward_repeat_penalty_std": 0.007013781927525997, "reward_near_duplicate_penalty_mean": 0.9962121248245239, "reward_near_duplicate_penalty_std": 0.007013781927525997, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.2862284779548645, "reward_total_composite_std": 0.2962500751018524} {"timestamp_utc": "2026-04-12T11:03:19Z", "mode": "train", "global_step": 84, "epoch": 0.003373900469936137, "loss": 0.1781, "grad_norm": 15.115890502929688, "learning_rate": 9.74848484848485e-06, "num_tokens": 185027.0, "completions/mean_length": 43.875, "completions/min_length": 34.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.875, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.8157832622528076, "rewards/meter/std": 0.28191104531288147, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.24599653482437134, "rewards/repeat_penalty/mean": 0.9908944368362427, "rewards/repeat_penalty/std": 0.01328963227570057, "rewards/near_duplicate_penalty/mean": 0.9908944368362427, "rewards/near_duplicate_penalty/std": 0.01328963227570057, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.47203630208969116, "rewards/total_composite/std": 0.2735925018787384, "reward": 0.47203630208969116, "reward_std": 0.2735925316810608, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20224647223949432, "sampling/sampling_logp_difference/max": 1.2447290420532227, "sampling/importance_sampling_ratio/min": 0.28801894187927246, "sampling/importance_sampling_ratio/mean": 1.0262371301651, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5166660696268082, "clip_ratio/low_mean": 0.09913571737706661, "clip_ratio/low_min": 0.09913571737706661, "clip_ratio/high_mean": 0.05674962420016527, "clip_ratio/high_max": 0.05674962420016527, "clip_ratio/region_mean": 0.15588534157723188, "reward_total_mean": 0.47203630208969116, "reward_meter_mean": 0.8157832622528076, "reward_meter_std": 0.28191104531288147, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9908944368362427, "reward_repeat_penalty_std": 0.01328963227570057, "reward_near_duplicate_penalty_mean": 0.9908944368362427, "reward_near_duplicate_penalty_std": 0.01328963227570057, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.24599653482437134, "reward_total_composite_mean": 0.47203630208969116, "reward_total_composite_std": 0.2735925018787384} {"timestamp_utc": "2026-04-12T11:03:27Z", "mode": "train", "global_step": 85, "epoch": 0.003414065951721091, "loss": 0.0799, "grad_norm": 15.081714630126953, "learning_rate": 9.745454545454547e-06, "num_tokens": 186613.0, "completions/mean_length": 47.25, "completions/min_length": 37.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.7033107280731201, "rewards/meter/std": 0.40071213245391846, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2584569752216339, "rewards/repeat_penalty/mean": 0.9889481663703918, "rewards/repeat_penalty/std": 0.009406981989741325, "rewards/near_duplicate_penalty/mean": 0.9889481663703918, "rewards/near_duplicate_penalty/std": 0.009406981989741325, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.39188358187675476, "rewards/total_composite/std": 0.34003448486328125, "reward": 0.39188358187675476, "reward_std": 0.34003445506095886, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17086577415466309, "sampling/sampling_logp_difference/max": 2.290557384490967, "sampling/importance_sampling_ratio/min": 0.10121003538370132, "sampling/importance_sampling_ratio/mean": 1.0280930995941162, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5397960841655731, "clip_ratio/low_mean": 0.10041468869894743, "clip_ratio/low_min": 0.10041468869894743, "clip_ratio/high_mean": 0.036472697742283344, "clip_ratio/high_max": 0.036472697742283344, "clip_ratio/region_mean": 0.13688738644123077, "reward_total_mean": 0.39188358187675476, "reward_meter_mean": 0.7033107280731201, "reward_meter_std": 0.40071213245391846, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9889481663703918, "reward_repeat_penalty_std": 0.009406981989741325, "reward_near_duplicate_penalty_mean": 0.9889481663703918, "reward_near_duplicate_penalty_std": 0.009406981989741325, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2584569752216339, "reward_total_composite_mean": 0.39188358187675476, "reward_total_composite_std": 0.34003448486328125} {"timestamp_utc": "2026-04-12T11:03:37Z", "mode": "train", "global_step": 86, "epoch": 0.0034542314335060447, "loss": 0.071, "grad_norm": 11.537137031555176, "learning_rate": 9.742424242424244e-06, "num_tokens": 188462.0, "completions/mean_length": 62.125, "completions/min_length": 38.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.125, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.9878455996513367, "rewards/meter/std": 0.01681375503540039, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.22273865342140198, "rewards/repeat_penalty/mean": 0.9923967123031616, "rewards/repeat_penalty/std": 0.013055448420345783, "rewards/near_duplicate_penalty/mean": 0.9923967123031616, "rewards/near_duplicate_penalty/std": 0.013055448420345783, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.40400809049606323, "rewards/total_composite/std": 0.2218370884656906, "reward": 0.40400809049606323, "reward_std": 0.2218370884656906, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19538550078868866, "sampling/sampling_logp_difference/max": 1.8238182067871094, "sampling/importance_sampling_ratio/min": 0.16140829026699066, "sampling/importance_sampling_ratio/mean": 1.0408320426940918, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1176094114780426, "clip_ratio/low_mean": 0.124702257104218, "clip_ratio/low_min": 0.124702257104218, "clip_ratio/high_mean": 0.03133971244096756, "clip_ratio/high_max": 0.03133971244096756, "clip_ratio/region_mean": 0.15604196954518557, "reward_total_mean": 0.40400809049606323, "reward_meter_mean": 0.9878455996513367, "reward_meter_std": 0.01681375503540039, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9923967123031616, "reward_repeat_penalty_std": 0.013055448420345783, "reward_near_duplicate_penalty_mean": 0.9923967123031616, "reward_near_duplicate_penalty_std": 0.013055448420345783, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.22273865342140198, "reward_total_composite_mean": 0.40400809049606323, "reward_total_composite_std": 0.2218370884656906} {"timestamp_utc": "2026-04-12T11:03:46Z", "mode": "train", "global_step": 87, "epoch": 0.003494396915290999, "loss": -0.0532, "grad_norm": 12.620993614196777, "learning_rate": 9.739393939393941e-06, "num_tokens": 190139.0, "completions/mean_length": 53.625, "completions/min_length": 38.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.750113844871521, "rewards/meter/std": 0.3385850489139557, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9992472529411316, "rewards/repeat_penalty/std": 0.0014177416451275349, "rewards/near_duplicate_penalty/mean": 0.9992472529411316, "rewards/near_duplicate_penalty/std": 0.0014177416451275349, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23165175318717957, "rewards/total_composite/std": 0.15431727468967438, "reward": 0.23165175318717957, "reward_std": 0.15431728959083557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22738726437091827, "sampling/sampling_logp_difference/max": 1.3244447708129883, "sampling/importance_sampling_ratio/min": 0.26595059037208557, "sampling/importance_sampling_ratio/mean": 1.0289357900619507, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.525059252977371, "clip_ratio/low_mean": 0.13426264375448227, "clip_ratio/low_min": 0.13426264375448227, "clip_ratio/high_mean": 0.08101851865649223, "clip_ratio/high_max": 0.08101851865649223, "clip_ratio/region_mean": 0.2152811624109745, "reward_total_mean": 0.23165175318717957, "reward_meter_mean": 0.750113844871521, "reward_meter_std": 0.3385850489139557, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9992472529411316, "reward_repeat_penalty_std": 0.0014177416451275349, "reward_near_duplicate_penalty_mean": 0.9992472529411316, "reward_near_duplicate_penalty_std": 0.0014177416451275349, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.23165175318717957, "reward_total_composite_std": 0.15431727468967438} {"timestamp_utc": "2026-04-12T11:03:56Z", "mode": "train", "global_step": 88, "epoch": 0.003534562397075953, "loss": 0.0411, "grad_norm": 10.12899398803711, "learning_rate": 9.736363636363637e-06, "num_tokens": 192516.0, "completions/mean_length": 104.125, "completions/min_length": 81.0, "completions/max_length": 135.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 104.125, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.5040664076805115, "rewards/meter/std": 0.3933837115764618, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9983552694320679, "rewards/lexical_plausibility/std": 0.004652021918445826, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9975301623344421, "rewards/repeat_penalty/std": 0.0026607722975313663, "rewards/near_duplicate_penalty/mean": 0.9975301623344421, "rewards/near_duplicate_penalty/std": 0.0026607722975313663, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21353963017463684, "rewards/total_composite/std": 0.18697339296340942, "reward": 0.21353963017463684, "reward_std": 0.18697339296340942, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20189937949180603, "sampling/sampling_logp_difference/max": 1.740591049194336, "sampling/importance_sampling_ratio/min": 0.17541669309139252, "sampling/importance_sampling_ratio/mean": 1.040609359741211, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.331147611141205, "clip_ratio/low_mean": 0.10875261202454567, "clip_ratio/low_min": 0.10875261202454567, "clip_ratio/high_mean": 0.08587215840816498, "clip_ratio/high_max": 0.08587215840816498, "clip_ratio/region_mean": 0.19462477043271065, "reward_total_mean": 0.21353963017463684, "reward_meter_mean": 0.5040664076805115, "reward_meter_std": 0.3933837115764618, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9983552694320679, "reward_lexical_plausibility_std": 0.004652021918445826, "reward_repeat_penalty_mean": 0.9975301623344421, "reward_repeat_penalty_std": 0.0026607722975313663, "reward_near_duplicate_penalty_mean": 0.9975301623344421, "reward_near_duplicate_penalty_std": 0.0026607722975313663, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.21353963017463684, "reward_total_composite_std": 0.18697339296340942} {"timestamp_utc": "2026-04-12T11:04:06Z", "mode": "train", "global_step": 89, "epoch": 0.003574727878860907, "loss": 0.1083, "grad_norm": 16.61884117126465, "learning_rate": 9.733333333333334e-06, "num_tokens": 194080.0, "completions/mean_length": 45.5, "completions/min_length": 30.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.45840001106262207, "rewards/meter/std": 0.38367897272109985, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6462500095367432, "rewards/judge_quality/std": 0.3168567717075348, "rewards/repeat_penalty/mean": 0.9884709119796753, "rewards/repeat_penalty/std": 0.016373859718441963, "rewards/near_duplicate_penalty/mean": 0.9884709119796753, "rewards/near_duplicate_penalty/std": 0.016373859718441963, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.40065518021583557, "rewards/total_composite/std": 0.3918873071670532, "reward": 0.40065518021583557, "reward_std": 0.3918873071670532, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18994733691215515, "sampling/sampling_logp_difference/max": 2.3873844146728516, "sampling/importance_sampling_ratio/min": 0.09186965972185135, "sampling/importance_sampling_ratio/mean": 1.021990180015564, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4212532937526703, "clip_ratio/low_mean": 0.09404137637466192, "clip_ratio/low_min": 0.09404137637466192, "clip_ratio/high_mean": 0.07141768280416727, "clip_ratio/high_max": 0.07141768280416727, "clip_ratio/region_mean": 0.1654590591788292, "reward_total_mean": 0.40065518021583557, "reward_meter_mean": 0.45840001106262207, "reward_meter_std": 0.38367897272109985, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9884709119796753, "reward_repeat_penalty_std": 0.016373859718441963, "reward_near_duplicate_penalty_mean": 0.9884709119796753, "reward_near_duplicate_penalty_std": 0.016373859718441963, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6462500095367432, "reward_judge_quality_std": 0.3168567717075348, "reward_total_composite_mean": 0.40065518021583557, "reward_total_composite_std": 0.3918873071670532} {"timestamp_utc": "2026-04-12T11:04:24Z", "mode": "train", "global_step": 90, "epoch": 0.003614893360645861, "loss": 0.0224, "grad_norm": 7.058398723602295, "learning_rate": 9.730303030303031e-06, "num_tokens": 197197.0, "completions/mean_length": 194.625, "completions/min_length": 137.0, "completions/max_length": 298.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 194.625, "completions/min_terminated_length": 137.0, "completions/max_terminated_length": 298.0, "rewards/meter/mean": 0.6234270334243774, "rewards/meter/std": 0.26951634883880615, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.11259915679693222, "rewards/repeat_penalty/mean": 0.9690656065940857, "rewards/repeat_penalty/std": 0.022364940494298935, "rewards/near_duplicate_penalty/mean": 0.9883231520652771, "rewards/near_duplicate_penalty/std": 0.006093398667871952, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.980473518371582, "rewards/distinct_2/std": 0.019685424864292145, "rewards/total_composite/mean": 0.2098064124584198, "rewards/total_composite/std": 0.13666240870952606, "reward": 0.2098064124584198, "reward_std": 0.13666240870952606, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22589033842086792, "sampling/sampling_logp_difference/max": 2.057332992553711, "sampling/importance_sampling_ratio/min": 0.12779435515403748, "sampling/importance_sampling_ratio/mean": 1.0478851795196533, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.973706364631653, "clip_ratio/low_mean": 0.09569885954260826, "clip_ratio/low_min": 0.09569885954260826, "clip_ratio/high_mean": 0.09893776290118694, "clip_ratio/high_max": 0.09893776290118694, "clip_ratio/region_mean": 0.1946366224437952, "reward_total_mean": 0.2098064124584198, "reward_meter_mean": 0.6234270334243774, "reward_meter_std": 0.26951634883880615, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9690656065940857, "reward_repeat_penalty_std": 0.022364940494298935, "reward_near_duplicate_penalty_mean": 0.9883231520652771, "reward_near_duplicate_penalty_std": 0.006093398667871952, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.980473518371582, "reward_distinct_2_std": 0.019685424864292145, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.11259915679693222, "reward_total_composite_mean": 0.2098064124584198, "reward_total_composite_std": 0.13666240870952606} {"timestamp_utc": "2026-04-12T11:04:37Z", "mode": "train", "global_step": 91, "epoch": 0.003655058842430815, "loss": 0.1641, "grad_norm": 6.941081523895264, "learning_rate": 9.727272727272728e-06, "num_tokens": 200683.0, "completions/mean_length": 237.75, "completions/min_length": 168.0, "completions/max_length": 355.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 237.75, "completions/min_terminated_length": 168.0, "completions/max_terminated_length": 355.0, "rewards/meter/mean": 0.502982497215271, "rewards/meter/std": 0.38829395174980164, "rewards/count_adherence/mean": 0.8888888955116272, "rewards/count_adherence/std": 0.059391383081674576, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9970703125, "rewards/lexical_plausibility/std": 0.008286407217383385, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9909600019454956, "rewards/repeat_penalty/std": 0.006515172775834799, "rewards/near_duplicate_penalty/mean": 0.9931068420410156, "rewards/near_duplicate_penalty/std": 0.0028236538637429476, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9978392124176025, "rewards/distinct_2/std": 0.006111545953899622, "rewards/total_composite/mean": 0.14956414699554443, "rewards/total_composite/std": 0.12625251710414886, "reward": 0.14956414699554443, "reward_std": 0.12625251710414886, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21524831652641296, "sampling/sampling_logp_difference/max": 1.6496601104736328, "sampling/importance_sampling_ratio/min": 0.1921152025461197, "sampling/importance_sampling_ratio/mean": 1.0547246932983398, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.1639786660671234, "clip_ratio/low_mean": 0.12241872772574425, "clip_ratio/low_min": 0.12241872772574425, "clip_ratio/high_mean": 0.07882829755544662, "clip_ratio/high_max": 0.07882829755544662, "clip_ratio/region_mean": 0.20124702528119087, "reward_total_mean": 0.14956414699554443, "reward_meter_mean": 0.502982497215271, "reward_meter_std": 0.38829395174980164, "reward_count_adherence_mean": 0.8888888955116272, "reward_count_adherence_std": 0.059391383081674576, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9970703125, "reward_lexical_plausibility_std": 0.008286407217383385, "reward_repeat_penalty_mean": 0.9909600019454956, "reward_repeat_penalty_std": 0.006515172775834799, "reward_near_duplicate_penalty_mean": 0.9931068420410156, "reward_near_duplicate_penalty_std": 0.0028236538637429476, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9978392124176025, "reward_distinct_2_std": 0.006111545953899622, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.14956414699554443, "reward_total_composite_std": 0.12625251710414886} {"timestamp_utc": "2026-04-12T11:04:50Z", "mode": "train", "global_step": 92, "epoch": 0.003695224324215769, "loss": 0.2234, "grad_norm": 6.573692321777344, "learning_rate": 9.724242424242426e-06, "num_tokens": 204357.0, "completions/mean_length": 218.25, "completions/min_length": 114.0, "completions/max_length": 293.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 218.25, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 293.0, "rewards/meter/mean": 0.5156489610671997, "rewards/meter/std": 0.40056365728378296, "rewards/count_adherence/mean": 0.9107142686843872, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9735461473464966, "rewards/lexical_plausibility/std": 0.049191076308488846, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.9880360960960388, "rewards/repeat_penalty/std": 0.011319074779748917, "rewards/near_duplicate_penalty/mean": 0.9935440421104431, "rewards/near_duplicate_penalty/std": 0.0037526292726397514, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9944518804550171, "rewards/distinct_2/std": 0.010290447622537613, "rewards/total_composite/mean": 0.09464669227600098, "rewards/total_composite/std": 0.0865207239985466, "reward": 0.09464669227600098, "reward_std": 0.0865207239985466, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2075955718755722, "sampling/sampling_logp_difference/max": 3.3988921642303467, "sampling/importance_sampling_ratio/min": 0.03341026231646538, "sampling/importance_sampling_ratio/mean": 1.05128014087677, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.64172226190567, "clip_ratio/low_mean": 0.0901694968342781, "clip_ratio/low_min": 0.0901694968342781, "clip_ratio/high_mean": 0.10005187802016735, "clip_ratio/high_max": 0.10005187802016735, "clip_ratio/region_mean": 0.19022137485444546, "reward_total_mean": 0.09464669227600098, "reward_meter_mean": 0.5156489610671997, "reward_meter_std": 0.40056365728378296, "reward_count_adherence_mean": 0.9107142686843872, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9735461473464966, "reward_lexical_plausibility_std": 0.049191076308488846, "reward_repeat_penalty_mean": 0.9880360960960388, "reward_repeat_penalty_std": 0.011319074779748917, "reward_near_duplicate_penalty_mean": 0.9935440421104431, "reward_near_duplicate_penalty_std": 0.0037526292726397514, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9944518804550171, "reward_distinct_2_std": 0.010290447622537613, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.09464669227600098, "reward_total_composite_std": 0.0865207239985466} {"timestamp_utc": "2026-04-12T11:05:07Z", "mode": "train", "global_step": 93, "epoch": 0.003735389806000723, "loss": 0.0032, "grad_norm": 8.9693603515625, "learning_rate": 9.721212121212123e-06, "num_tokens": 206682.0, "completions/mean_length": 109.625, "completions/min_length": 74.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.625, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 140.0, "rewards/meter/mean": 0.8595813512802124, "rewards/meter/std": 0.1380358338356018, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9942992329597473, "rewards/lexical_plausibility/std": 0.010885572992265224, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9930427670478821, "rewards/repeat_penalty/std": 0.007280769292265177, "rewards/near_duplicate_penalty/mean": 0.9930427670478821, "rewards/near_duplicate_penalty/std": 0.007280769292265177, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19612924754619598, "rewards/total_composite/std": 0.13066346943378448, "reward": 0.19612924754619598, "reward_std": 0.13066346943378448, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22369436919689178, "sampling/sampling_logp_difference/max": 1.2494277954101562, "sampling/importance_sampling_ratio/min": 0.2866687774658203, "sampling/importance_sampling_ratio/mean": 1.0495545864105225, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9556396305561066, "clip_ratio/low_mean": 0.08056333288550377, "clip_ratio/low_min": 0.08056333288550377, "clip_ratio/high_mean": 0.11009310558438301, "clip_ratio/high_max": 0.11009310558438301, "clip_ratio/region_mean": 0.19065643846988678, "reward_total_mean": 0.19612924754619598, "reward_meter_mean": 0.8595813512802124, "reward_meter_std": 0.1380358338356018, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9942992329597473, "reward_lexical_plausibility_std": 0.010885572992265224, "reward_repeat_penalty_mean": 0.9930427670478821, "reward_repeat_penalty_std": 0.007280769292265177, "reward_near_duplicate_penalty_mean": 0.9930427670478821, "reward_near_duplicate_penalty_std": 0.007280769292265177, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.19612924754619598, "reward_total_composite_std": 0.13066346943378448} {"timestamp_utc": "2026-04-12T11:05:21Z", "mode": "train", "global_step": 94, "epoch": 0.003775555287785677, "loss": 0.0487, "grad_norm": 15.944836616516113, "learning_rate": 9.718181818181818e-06, "num_tokens": 208244.0, "completions/mean_length": 45.25, "completions/min_length": 29.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5198861956596375, "rewards/meter/std": 0.4066314101219177, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9538085460662842, "rewards/lexical_plausibility/std": 0.09894571453332901, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9966422915458679, "rewards/repeat_penalty/std": 0.007198222912847996, "rewards/near_duplicate_penalty/mean": 0.9966422915458679, "rewards/near_duplicate_penalty/std": 0.007198222912847996, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26255714893341064, "rewards/total_composite/std": 0.25084346532821655, "reward": 0.26255714893341064, "reward_std": 0.25084346532821655, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22381380200386047, "sampling/sampling_logp_difference/max": 1.9445966482162476, "sampling/importance_sampling_ratio/min": 0.14304490387439728, "sampling/importance_sampling_ratio/mean": 1.0335097312927246, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.049190118908882, "clip_ratio/low_mean": 0.0701514994725585, "clip_ratio/low_min": 0.0701514994725585, "clip_ratio/high_mean": 0.10071430541574955, "clip_ratio/high_max": 0.10071430541574955, "clip_ratio/region_mean": 0.17086580488830805, "reward_total_mean": 0.26255714893341064, "reward_meter_mean": 0.5198861956596375, "reward_meter_std": 0.4066314101219177, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9538085460662842, "reward_lexical_plausibility_std": 0.09894571453332901, "reward_repeat_penalty_mean": 0.9966422915458679, "reward_repeat_penalty_std": 0.007198222912847996, "reward_near_duplicate_penalty_mean": 0.9966422915458679, "reward_near_duplicate_penalty_std": 0.007198222912847996, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.26255714893341064, "reward_total_composite_std": 0.25084346532821655} {"timestamp_utc": "2026-04-12T11:05:30Z", "mode": "train", "global_step": 95, "epoch": 0.003815720769570631, "loss": 0.0136, "grad_norm": 15.552061080932617, "learning_rate": 9.715151515151516e-06, "num_tokens": 209937.0, "completions/mean_length": 44.625, "completions/min_length": 41.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.30856016278266907, "rewards/meter/std": 0.3279573917388916, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9786901473999023, "rewards/repeat_penalty/std": 0.052769169211387634, "rewards/near_duplicate_penalty/mean": 0.9886085987091064, "rewards/near_duplicate_penalty/std": 0.02513744868338108, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.15059463679790497, "rewards/total_composite/std": 0.20923210680484772, "reward": 0.15059463679790497, "reward_std": 0.20923209190368652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22380156815052032, "sampling/sampling_logp_difference/max": 1.7575650215148926, "sampling/importance_sampling_ratio/min": 0.1724643111228943, "sampling/importance_sampling_ratio/mean": 1.0216649770736694, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.479477286338806, "clip_ratio/low_mean": 0.17676972784101963, "clip_ratio/low_min": 0.17676972784101963, "clip_ratio/high_mean": 0.04884453862905502, "clip_ratio/high_max": 0.04884453862905502, "clip_ratio/region_mean": 0.22561426647007465, "reward_total_mean": 0.15059463679790497, "reward_meter_mean": 0.30856016278266907, "reward_meter_std": 0.3279573917388916, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9786901473999023, "reward_repeat_penalty_std": 0.052769169211387634, "reward_near_duplicate_penalty_mean": 0.9886085987091064, "reward_near_duplicate_penalty_std": 0.02513744868338108, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.15059463679790497, "reward_total_composite_std": 0.20923210680484772} {"timestamp_utc": "2026-04-12T11:05:40Z", "mode": "train", "global_step": 96, "epoch": 0.003855886251355585, "loss": 0.0391, "grad_norm": 9.95379638671875, "learning_rate": 9.712121212121213e-06, "num_tokens": 212315.0, "completions/mean_length": 120.25, "completions/min_length": 87.0, "completions/max_length": 135.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 120.25, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.37057745456695557, "rewards/meter/std": 0.25225669145584106, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8845992684364319, "rewards/lexical_plausibility/std": 0.1551179438829422, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9951979517936707, "rewards/repeat_penalty/std": 0.003440810600295663, "rewards/near_duplicate_penalty/mean": 0.9951979517936707, "rewards/near_duplicate_penalty/std": 0.003440810600295663, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10789487510919571, "rewards/total_composite/std": 0.07092024385929108, "reward": 0.10789487510919571, "reward_std": 0.07092024385929108, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21660031378269196, "sampling/sampling_logp_difference/max": 1.989974021911621, "sampling/importance_sampling_ratio/min": 0.13669897615909576, "sampling/importance_sampling_ratio/mean": 1.0312293767929077, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.385300040245056, "clip_ratio/low_mean": 0.0720515288412571, "clip_ratio/low_min": 0.0720515288412571, "clip_ratio/high_mean": 0.13101116940379143, "clip_ratio/high_max": 0.13101116940379143, "clip_ratio/region_mean": 0.20306269824504852, "reward_total_mean": 0.10789487510919571, "reward_meter_mean": 0.37057745456695557, "reward_meter_std": 0.25225669145584106, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8845992684364319, "reward_lexical_plausibility_std": 0.1551179438829422, "reward_repeat_penalty_mean": 0.9951979517936707, "reward_repeat_penalty_std": 0.003440810600295663, "reward_near_duplicate_penalty_mean": 0.9951979517936707, "reward_near_duplicate_penalty_std": 0.003440810600295663, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.10789487510919571, "reward_total_composite_std": 0.07092024385929108} {"timestamp_utc": "2026-04-12T11:05:49Z", "mode": "train", "global_step": 97, "epoch": 0.003896051733140539, "loss": 0.0193, "grad_norm": 13.103679656982422, "learning_rate": 9.70909090909091e-06, "num_tokens": 214089.0, "completions/mean_length": 52.75, "completions/min_length": 44.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.75, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.509982705116272, "rewards/meter/std": 0.4155988097190857, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6599999666213989, "rewards/judge_quality/std": 0.2805097699165344, "rewards/repeat_penalty/mean": 0.9952415227890015, "rewards/repeat_penalty/std": 0.007189737632870674, "rewards/near_duplicate_penalty/mean": 0.9952415227890015, "rewards/near_duplicate_penalty/std": 0.007189737632870674, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32618051767349243, "rewards/total_composite/std": 0.31854259967803955, "reward": 0.32618051767349243, "reward_std": 0.31854259967803955, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18964336812496185, "sampling/sampling_logp_difference/max": 1.374903678894043, "sampling/importance_sampling_ratio/min": 0.25286394357681274, "sampling/importance_sampling_ratio/mean": 1.00651216506958, "sampling/importance_sampling_ratio/max": 1.9730236530303955, "entropy": 1.791875198483467, "clip_ratio/low_mean": 0.08039080258458853, "clip_ratio/low_min": 0.08039080258458853, "clip_ratio/high_mean": 0.12216202542185783, "clip_ratio/high_max": 0.12216202542185783, "clip_ratio/region_mean": 0.20255282800644636, "reward_total_mean": 0.32618051767349243, "reward_meter_mean": 0.509982705116272, "reward_meter_std": 0.4155988097190857, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9952415227890015, "reward_repeat_penalty_std": 0.007189737632870674, "reward_near_duplicate_penalty_mean": 0.9952415227890015, "reward_near_duplicate_penalty_std": 0.007189737632870674, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6599999666213989, "reward_judge_quality_std": 0.2805097699165344, "reward_total_composite_mean": 0.32618051767349243, "reward_total_composite_std": 0.31854259967803955} {"timestamp_utc": "2026-04-12T11:06:00Z", "mode": "train", "global_step": 98, "epoch": 0.003936217214925493, "loss": 0.0285, "grad_norm": 9.983766555786133, "learning_rate": 9.706060606060606e-06, "num_tokens": 216468.0, "completions/mean_length": 107.375, "completions/min_length": 89.0, "completions/max_length": 135.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.375, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.5628624558448792, "rewards/meter/std": 0.2919635474681854, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9685242176055908, "rewards/lexical_plausibility/std": 0.08902685344219208, "rewards/judge_quality/mean": 0.2562499940395355, "rewards/judge_quality/std": 0.14744853973388672, "rewards/repeat_penalty/mean": 0.9908519983291626, "rewards/repeat_penalty/std": 0.014483519829809666, "rewards/near_duplicate_penalty/mean": 0.9950829744338989, "rewards/near_duplicate_penalty/std": 0.004219905938953161, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.995726466178894, "rewards/distinct_2/std": 0.012087294831871986, "rewards/total_composite/mean": 0.128617063164711, "rewards/total_composite/std": 0.08563850075006485, "reward": 0.128617063164711, "reward_std": 0.08563850075006485, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20586693286895752, "sampling/sampling_logp_difference/max": 1.4943318367004395, "sampling/importance_sampling_ratio/min": 0.22439850866794586, "sampling/importance_sampling_ratio/mean": 1.0511600971221924, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7603975236415863, "clip_ratio/low_mean": 0.10669201333075762, "clip_ratio/low_min": 0.10669201333075762, "clip_ratio/high_mean": 0.05855082534253597, "clip_ratio/high_max": 0.05855082534253597, "clip_ratio/region_mean": 0.1652428386732936, "reward_total_mean": 0.128617063164711, "reward_meter_mean": 0.5628624558448792, "reward_meter_std": 0.2919635474681854, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9685242176055908, "reward_lexical_plausibility_std": 0.08902685344219208, "reward_repeat_penalty_mean": 0.9908519983291626, "reward_repeat_penalty_std": 0.014483519829809666, "reward_near_duplicate_penalty_mean": 0.9950829744338989, "reward_near_duplicate_penalty_std": 0.004219905938953161, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.995726466178894, "reward_distinct_2_std": 0.012087294831871986, "reward_judge_quality_mean": 0.2562499940395355, "reward_judge_quality_std": 0.14744853973388672, "reward_total_composite_mean": 0.128617063164711, "reward_total_composite_std": 0.08563850075006485} {"timestamp_utc": "2026-04-12T11:06:11Z", "mode": "train", "global_step": 99, "epoch": 0.003976382696710447, "loss": 0.0309, "grad_norm": 12.82423210144043, "learning_rate": 9.703030303030305e-06, "num_tokens": 218558.0, "completions/mean_length": 93.25, "completions/min_length": 77.0, "completions/max_length": 127.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.25, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.8218356370925903, "rewards/meter/std": 0.23102423548698425, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9977676272392273, "rewards/repeat_penalty/std": 0.002441425807774067, "rewards/near_duplicate_penalty/mean": 0.9977676272392273, "rewards/near_duplicate_penalty/std": 0.002441425807774067, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32219815254211426, "rewards/total_composite/std": 0.10799339413642883, "reward": 0.32219815254211426, "reward_std": 0.10799339413642883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20814354717731476, "sampling/sampling_logp_difference/max": 1.4589653015136719, "sampling/importance_sampling_ratio/min": 0.23247671127319336, "sampling/importance_sampling_ratio/mean": 1.0451229810714722, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.364054650068283, "clip_ratio/low_mean": 0.09408900327980518, "clip_ratio/low_min": 0.09408900327980518, "clip_ratio/high_mean": 0.08094443194568157, "clip_ratio/high_max": 0.08094443194568157, "clip_ratio/region_mean": 0.17503343522548676, "reward_total_mean": 0.32219815254211426, "reward_meter_mean": 0.8218356370925903, "reward_meter_std": 0.23102423548698425, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9977676272392273, "reward_repeat_penalty_std": 0.002441425807774067, "reward_near_duplicate_penalty_mean": 0.9977676272392273, "reward_near_duplicate_penalty_std": 0.002441425807774067, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.32219815254211426, "reward_total_composite_std": 0.10799339413642883} {"timestamp_utc": "2026-04-12T11:06:22Z", "mode": "train", "global_step": 100, "epoch": 0.004016548178495401, "loss": 0.0235, "grad_norm": 14.275720596313477, "learning_rate": 9.7e-06, "num_tokens": 220299.0, "completions/mean_length": 63.625, "completions/min_length": 56.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.625, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.2841872572898865, "rewards/meter/std": 0.3190371096134186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3962499797344208, "rewards/judge_quality/std": 0.24136148393154144, "rewards/repeat_penalty/mean": 0.9880180358886719, "rewards/repeat_penalty/std": 0.010971157811582088, "rewards/near_duplicate_penalty/mean": 0.9880180358886719, "rewards/near_duplicate_penalty/std": 0.010971157811582088, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11206617206335068, "rewards/total_composite/std": 0.1446806639432907, "reward": 0.11206617206335068, "reward_std": 0.1446806639432907, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2242622673511505, "sampling/sampling_logp_difference/max": 1.5184240341186523, "sampling/importance_sampling_ratio/min": 0.2190568596124649, "sampling/importance_sampling_ratio/mean": 1.0265940427780151, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3064437806606293, "clip_ratio/low_mean": 0.13668633438646793, "clip_ratio/low_min": 0.13668633438646793, "clip_ratio/high_mean": 0.05593487620353699, "clip_ratio/high_max": 0.05593487620353699, "clip_ratio/region_mean": 0.19262121059000492, "reward_total_mean": 0.11206617206335068, "reward_meter_mean": 0.2841872572898865, "reward_meter_std": 0.3190371096134186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9880180358886719, "reward_repeat_penalty_std": 0.010971157811582088, "reward_near_duplicate_penalty_mean": 0.9880180358886719, "reward_near_duplicate_penalty_std": 0.010971157811582088, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3962499797344208, "reward_judge_quality_std": 0.24136148393154144, "reward_total_composite_mean": 0.11206617206335068, "reward_total_composite_std": 0.1446806639432907} {"timestamp_utc": "2026-04-12T11:08:52Z", "mode": "eval", "global_step": 100, "epoch": 0.004016548178495401, "eval_loss": NaN, "eval_runtime": 150.0634, "eval_samples_per_second": 0.693, "eval_steps_per_second": 0.087, "eval_num_tokens": 220299.0, "eval_completions/mean_length": 179.4903846153846, "eval_completions/min_length": 41.76923076923077, "eval_completions/max_length": 391.53846153846155, "eval_completions/clipped_ratio": 0.019230769230769232, "eval_completions/mean_terminated_length": 172.60714369553787, "eval_completions/min_terminated_length": 41.76923076923077, "eval_completions/max_terminated_length": 360.61538461538464, "eval_rewards/meter/mean": 0.4438126110113584, "eval_rewards/meter/std": 0.3760697337297293, "eval_rewards/count_adherence/mean": 0.9246577987304101, "eval_rewards/count_adherence/std": 0.08610457095962304, "eval_rewards/arabic_clean/mean": 0.9038461538461539, "eval_rewards/arabic_clean/std": 0.21561105434711164, "eval_rewards/lexical_plausibility/mean": 0.9845591462575473, "eval_rewards/lexical_plausibility/std": 0.03744004376662465, "eval_rewards/judge_quality/mean": 0.34538461382572466, "eval_rewards/judge_quality/std": 0.1808490724517749, "eval_rewards/repeat_penalty/mean": 0.9725102323752183, "eval_rewards/repeat_penalty/std": 0.04685022345242592, "eval_rewards/near_duplicate_penalty/mean": 0.9911677057926471, "eval_rewards/near_duplicate_penalty/std": 0.009857276257557364, "eval_rewards/opening_diversity/mean": 0.9927884615384616, "eval_rewards/opening_diversity/std": 0.020397310646680687, "eval_rewards/distinct_2/mean": 0.9887164464363685, "eval_rewards/distinct_2/std": 0.02292853558006195, "eval_rewards/total_composite/mean": 0.14150516058389956, "eval_rewards/total_composite/std": 0.1569332918868615, "eval_reward": 0.14150516058389956, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.15858542231413034, "eval_sampling/sampling_logp_difference/max": 1.2093834510216346, "eval_sampling/importance_sampling_ratio/min": 0.3008319517740837, "eval_sampling/importance_sampling_ratio/mean": 1.0480100833452666, "eval_sampling/importance_sampling_ratio/max": 1.6585412117151113, "eval_entropy": 2.6760957057659445, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.14150516058389956, "eval_reward_meter_mean": 0.4438126110113584, "eval_reward_meter_std": 0.3760697337297293, "eval_reward_count_adherence_mean": 0.9246577987304101, "eval_reward_count_adherence_std": 0.08610457095962304, "eval_reward_arabic_clean_mean": 0.9038461538461539, "eval_reward_arabic_clean_std": 0.21561105434711164, "eval_reward_lexical_plausibility_mean": 0.9845591462575473, "eval_reward_lexical_plausibility_std": 0.03744004376662465, "eval_reward_repeat_penalty_mean": 0.9725102323752183, "eval_reward_repeat_penalty_std": 0.04685022345242592, "eval_reward_near_duplicate_penalty_mean": 0.9911677057926471, "eval_reward_near_duplicate_penalty_std": 0.009857276257557364, "eval_reward_opening_diversity_mean": 0.9927884615384616, "eval_reward_opening_diversity_std": 0.020397310646680687, "eval_reward_distinct_2_mean": 0.9887164464363685, "eval_reward_distinct_2_std": 0.02292853558006195, "eval_reward_judge_quality_mean": 0.34538461382572466, "eval_reward_judge_quality_std": 0.1808490724517749, "eval_reward_total_composite_mean": 0.14150516058389956, "eval_reward_total_composite_std": 0.1569332918868615} {"timestamp_utc": "2026-04-12T11:09:04Z", "mode": "train", "global_step": 101, "epoch": 0.004056713660280355, "loss": 0.0864, "grad_norm": 18.904470443725586, "learning_rate": 9.696969696969698e-06, "num_tokens": 221926.0, "completions/mean_length": 48.375, "completions/min_length": 38.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.8652718663215637, "rewards/meter/std": 0.276619553565979, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9877814054489136, "rewards/repeat_penalty/std": 0.020352782681584358, "rewards/near_duplicate_penalty/mean": 0.9951778650283813, "rewards/near_duplicate_penalty/std": 0.007622325327247381, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.35213059186935425, "rewards/total_composite/std": 0.14728707075119019, "reward": 0.35213059186935425, "reward_std": 0.14728707075119019, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23319759964942932, "sampling/sampling_logp_difference/max": 1.485825538635254, "sampling/importance_sampling_ratio/min": 0.27501600980758667, "sampling/importance_sampling_ratio/mean": 1.0533989667892456, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.526646763086319, "clip_ratio/low_mean": 0.027720949612557888, "clip_ratio/low_min": 0.027720949612557888, "clip_ratio/high_mean": 0.12845481652766466, "clip_ratio/high_max": 0.12845481652766466, "clip_ratio/region_mean": 0.15617576614022255, "reward_total_mean": 0.35213059186935425, "reward_meter_mean": 0.8652718663215637, "reward_meter_std": 0.276619553565979, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.9877814054489136, "reward_repeat_penalty_std": 0.020352782681584358, "reward_near_duplicate_penalty_mean": 0.9951778650283813, "reward_near_duplicate_penalty_std": 0.007622325327247381, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.35213059186935425, "reward_total_composite_std": 0.14728707075119019} {"timestamp_utc": "2026-04-12T11:09:15Z", "mode": "train", "global_step": 102, "epoch": 0.0040968791420653095, "loss": 0.1022, "grad_norm": 15.38626766204834, "learning_rate": 9.693939393939395e-06, "num_tokens": 223500.0, "completions/mean_length": 45.75, "completions/min_length": 38.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.75, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.785392701625824, "rewards/meter/std": 0.3241640627384186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9870174527168274, "rewards/lexical_plausibility/std": 0.036720167845487595, "rewards/judge_quality/mean": 0.6337499618530273, "rewards/judge_quality/std": 0.24100609123706818, "rewards/repeat_penalty/mean": 0.9874306917190552, "rewards/repeat_penalty/std": 0.01784193515777588, "rewards/near_duplicate_penalty/mean": 0.9874306917190552, "rewards/near_duplicate_penalty/std": 0.01784193515777588, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.48221316933631897, "rewards/total_composite/std": 0.3026334345340729, "reward": 0.48221316933631897, "reward_std": 0.3026334345340729, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2042502462863922, "sampling/sampling_logp_difference/max": 1.617997407913208, "sampling/importance_sampling_ratio/min": 0.19829539954662323, "sampling/importance_sampling_ratio/mean": 1.0294554233551025, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1104984432458878, "clip_ratio/low_mean": 0.1281595453619957, "clip_ratio/low_min": 0.1281595453619957, "clip_ratio/high_mean": 0.05687452293932438, "clip_ratio/high_max": 0.05687452293932438, "clip_ratio/region_mean": 0.18503406830132008, "reward_total_mean": 0.48221316933631897, "reward_meter_mean": 0.785392701625824, "reward_meter_std": 0.3241640627384186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9870174527168274, "reward_lexical_plausibility_std": 0.036720167845487595, "reward_repeat_penalty_mean": 0.9874306917190552, "reward_repeat_penalty_std": 0.01784193515777588, "reward_near_duplicate_penalty_mean": 0.9874306917190552, "reward_near_duplicate_penalty_std": 0.01784193515777588, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6337499618530273, "reward_judge_quality_std": 0.24100609123706818, "reward_total_composite_mean": 0.48221316933631897, "reward_total_composite_std": 0.3026334345340729} {"timestamp_utc": "2026-04-12T11:09:25Z", "mode": "train", "global_step": 103, "epoch": 0.004137044623850263, "loss": 0.0183, "grad_norm": 15.671799659729004, "learning_rate": 9.690909090909092e-06, "num_tokens": 224994.0, "completions/mean_length": 35.75, "completions/min_length": 32.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.870998740196228, "rewards/meter/std": 0.2737838625907898, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9353253841400146, "rewards/lexical_plausibility/std": 0.1349874883890152, "rewards/judge_quality/mean": 0.7512500286102295, "rewards/judge_quality/std": 0.24976776540279388, "rewards/repeat_penalty/mean": 0.9875068068504333, "rewards/repeat_penalty/std": 0.018238745629787445, "rewards/near_duplicate_penalty/mean": 0.9875068068504333, "rewards/near_duplicate_penalty/std": 0.018238745629787445, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6357969045639038, "rewards/total_composite/std": 0.29190483689308167, "reward": 0.6357969045639038, "reward_std": 0.2919048070907593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1651766300201416, "sampling/sampling_logp_difference/max": 2.670238494873047, "sampling/importance_sampling_ratio/min": 0.06923571228981018, "sampling/importance_sampling_ratio/mean": 1.0023692846298218, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3214549124240875, "clip_ratio/low_mean": 0.06165114138275385, "clip_ratio/low_min": 0.06165114138275385, "clip_ratio/high_mean": 0.09113431721925735, "clip_ratio/high_max": 0.09113431721925735, "clip_ratio/region_mean": 0.1527854586020112, "reward_total_mean": 0.6357969045639038, "reward_meter_mean": 0.870998740196228, "reward_meter_std": 0.2737838625907898, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9353253841400146, "reward_lexical_plausibility_std": 0.1349874883890152, "reward_repeat_penalty_mean": 0.9875068068504333, "reward_repeat_penalty_std": 0.018238745629787445, "reward_near_duplicate_penalty_mean": 0.9875068068504333, "reward_near_duplicate_penalty_std": 0.018238745629787445, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7512500286102295, "reward_judge_quality_std": 0.24976776540279388, "reward_total_composite_mean": 0.6357969045639038, "reward_total_composite_std": 0.29190483689308167} {"timestamp_utc": "2026-04-12T11:09:35Z", "mode": "train", "global_step": 104, "epoch": 0.004177210105635217, "loss": 0.0704, "grad_norm": 20.590539932250977, "learning_rate": 9.687878787878788e-06, "num_tokens": 226400.0, "completions/mean_length": 19.75, "completions/min_length": 15.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.8273722529411316, "rewards/meter/std": 0.33302101492881775, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5087499618530273, "rewards/judge_quality/std": 0.37288209795951843, "rewards/repeat_penalty/mean": 0.7364565134048462, "rewards/repeat_penalty/std": 0.025085056200623512, "rewards/near_duplicate_penalty/mean": 0.9819420576095581, "rewards/near_duplicate_penalty/std": 0.033446744084358215, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44802480936050415, "rewards/total_composite/std": 0.4030570089817047, "reward": 0.44802480936050415, "reward_std": 0.4030570089817047, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2312489151954651, "sampling/sampling_logp_difference/max": 1.2237434387207031, "sampling/importance_sampling_ratio/min": 0.29412707686424255, "sampling/importance_sampling_ratio/mean": 1.0077565908432007, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1665150076150894, "clip_ratio/low_mean": 0.11906194407492876, "clip_ratio/low_min": 0.11906194407492876, "clip_ratio/high_mean": 0.06388888973742723, "clip_ratio/high_max": 0.06388888973742723, "clip_ratio/region_mean": 0.182950833812356, "reward_total_mean": 0.44802480936050415, "reward_meter_mean": 0.8273722529411316, "reward_meter_std": 0.33302101492881775, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7364565134048462, "reward_repeat_penalty_std": 0.025085056200623512, "reward_near_duplicate_penalty_mean": 0.9819420576095581, "reward_near_duplicate_penalty_std": 0.033446744084358215, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5087499618530273, "reward_judge_quality_std": 0.37288209795951843, "reward_total_composite_mean": 0.44802480936050415, "reward_total_composite_std": 0.4030570089817047} {"timestamp_utc": "2026-04-12T11:09:44Z", "mode": "train", "global_step": 105, "epoch": 0.004217375587420171, "loss": 0.014, "grad_norm": 12.693693161010742, "learning_rate": 9.684848484848487e-06, "num_tokens": 228284.0, "completions/mean_length": 69.5, "completions/min_length": 41.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.5, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.5121266841888428, "rewards/meter/std": 0.34023505449295044, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9752435088157654, "rewards/lexical_plausibility/std": 0.046044979244470596, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9891045689582825, "rewards/repeat_penalty/std": 0.013739429414272308, "rewards/near_duplicate_penalty/mean": 0.9891045689582825, "rewards/near_duplicate_penalty/std": 0.013739429414272308, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2042568027973175, "rewards/total_composite/std": 0.139831081032753, "reward": 0.2042568027973175, "reward_std": 0.1398310661315918, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2049107700586319, "sampling/sampling_logp_difference/max": 1.7144489288330078, "sampling/importance_sampling_ratio/min": 0.1800629198551178, "sampling/importance_sampling_ratio/mean": 1.034571886062622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0561163872480392, "clip_ratio/low_mean": 0.0917549766600132, "clip_ratio/low_min": 0.0917549766600132, "clip_ratio/high_mean": 0.11717102490365505, "clip_ratio/high_max": 0.11717102490365505, "clip_ratio/region_mean": 0.20892600156366825, "reward_total_mean": 0.2042568027973175, "reward_meter_mean": 0.5121266841888428, "reward_meter_std": 0.34023505449295044, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9752435088157654, "reward_lexical_plausibility_std": 0.046044979244470596, "reward_repeat_penalty_mean": 0.9891045689582825, "reward_repeat_penalty_std": 0.013739429414272308, "reward_near_duplicate_penalty_mean": 0.9891045689582825, "reward_near_duplicate_penalty_std": 0.013739429414272308, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.2042568027973175, "reward_total_composite_std": 0.139831081032753} {"timestamp_utc": "2026-04-12T11:09:53Z", "mode": "train", "global_step": 106, "epoch": 0.004257541069205125, "loss": 0.0802, "grad_norm": 19.78082275390625, "learning_rate": 9.681818181818182e-06, "num_tokens": 230063.0, "completions/mean_length": 37.375, "completions/min_length": 32.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.4091936945915222, "rewards/meter/std": 0.38513103127479553, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.24532414972782135, "rewards/repeat_penalty/mean": 0.9900262355804443, "rewards/repeat_penalty/std": 0.019093554466962814, "rewards/near_duplicate_penalty/mean": 0.9900262355804443, "rewards/near_duplicate_penalty/std": 0.019093554466962814, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12962524592876434, "rewards/total_composite/std": 0.12251812219619751, "reward": 0.12962524592876434, "reward_std": 0.12251812219619751, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19340533018112183, "sampling/sampling_logp_difference/max": 1.4765138626098633, "sampling/importance_sampling_ratio/min": 0.22843265533447266, "sampling/importance_sampling_ratio/mean": 1.0042545795440674, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3978212103247643, "clip_ratio/low_mean": 0.10965030081570148, "clip_ratio/low_min": 0.10965030081570148, "clip_ratio/high_mean": 0.08934779465198517, "clip_ratio/high_max": 0.08934779465198517, "clip_ratio/region_mean": 0.19899809546768665, "reward_total_mean": 0.12962524592876434, "reward_meter_mean": 0.4091936945915222, "reward_meter_std": 0.38513103127479553, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9900262355804443, "reward_repeat_penalty_std": 0.019093554466962814, "reward_near_duplicate_penalty_mean": 0.9900262355804443, "reward_near_duplicate_penalty_std": 0.019093554466962814, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.24532414972782135, "reward_total_composite_mean": 0.12962524592876434, "reward_total_composite_std": 0.12251812219619751} {"timestamp_utc": "2026-04-12T11:10:03Z", "mode": "train", "global_step": 107, "epoch": 0.004297706550990079, "loss": 0.1234, "grad_norm": 12.042773246765137, "learning_rate": 9.67878787878788e-06, "num_tokens": 231925.0, "completions/mean_length": 67.75, "completions/min_length": 54.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.75, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.8805147409439087, "rewards/meter/std": 0.19566473364830017, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666865348816, "rewards/lexical_plausibility/std": 0.038575831800699234, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9657440185546875, "rewards/repeat_penalty/std": 0.044199053198099136, "rewards/near_duplicate_penalty/mean": 0.977892279624939, "rewards/near_duplicate_penalty/std": 0.024622080847620964, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.023738976567983627, "rewards/total_composite/mean": 0.32012301683425903, "rewards/total_composite/std": 0.1213817298412323, "reward": 0.32012301683425903, "reward_std": 0.1213817223906517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23260825872421265, "sampling/sampling_logp_difference/max": 1.4933059215545654, "sampling/importance_sampling_ratio/min": 0.22462882101535797, "sampling/importance_sampling_ratio/mean": 1.0501987934112549, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6822806298732758, "clip_ratio/low_mean": 0.08087963052093983, "clip_ratio/low_min": 0.08087963052093983, "clip_ratio/high_mean": 0.14885154739022255, "clip_ratio/high_max": 0.14885154739022255, "clip_ratio/region_mean": 0.22973117791116238, "reward_total_mean": 0.32012301683425903, "reward_meter_mean": 0.8805147409439087, "reward_meter_std": 0.19566473364830017, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666865348816, "reward_lexical_plausibility_std": 0.038575831800699234, "reward_repeat_penalty_mean": 0.9657440185546875, "reward_repeat_penalty_std": 0.044199053198099136, "reward_near_duplicate_penalty_mean": 0.977892279624939, "reward_near_duplicate_penalty_std": 0.024622080847620964, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.023738976567983627, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.32012301683425903, "reward_total_composite_std": 0.1213817298412323} {"timestamp_utc": "2026-04-12T11:10:16Z", "mode": "train", "global_step": 108, "epoch": 0.004337872032775033, "loss": -0.0024, "grad_norm": 6.266803741455078, "learning_rate": 9.675757575757577e-06, "num_tokens": 235644.0, "completions/mean_length": 264.875, "completions/min_length": 185.0, "completions/max_length": 360.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 264.875, "completions/min_terminated_length": 185.0, "completions/max_terminated_length": 360.0, "rewards/meter/mean": 0.195610910654068, "rewards/meter/std": 0.12062400579452515, "rewards/count_adherence/mean": 0.8375000357627869, "rewards/count_adherence/std": 0.07440237700939178, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9957386255264282, "rewards/lexical_plausibility/std": 0.012052967213094234, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9829477071762085, "rewards/repeat_penalty/std": 0.01583346351981163, "rewards/near_duplicate_penalty/mean": 0.991424024105072, "rewards/near_duplicate_penalty/std": 0.006038422230631113, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9914255142211914, "rewards/distinct_2/std": 0.012757115066051483, "rewards/total_composite/mean": 0.030561331659555435, "rewards/total_composite/std": 0.04264984652400017, "reward": 0.030561331659555435, "reward_std": 0.04264984279870987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23715300858020782, "sampling/sampling_logp_difference/max": 1.967503547668457, "sampling/importance_sampling_ratio/min": 0.13980543613433838, "sampling/importance_sampling_ratio/mean": 1.0414592027664185, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.3490786850452423, "clip_ratio/low_mean": 0.1096208244562149, "clip_ratio/low_min": 0.1096208244562149, "clip_ratio/high_mean": 0.08376534841954708, "clip_ratio/high_max": 0.08376534841954708, "clip_ratio/region_mean": 0.19338617287576199, "reward_total_mean": 0.030561331659555435, "reward_meter_mean": 0.195610910654068, "reward_meter_std": 0.12062400579452515, "reward_count_adherence_mean": 0.8375000357627869, "reward_count_adherence_std": 0.07440237700939178, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9957386255264282, "reward_lexical_plausibility_std": 0.012052967213094234, "reward_repeat_penalty_mean": 0.9829477071762085, "reward_repeat_penalty_std": 0.01583346351981163, "reward_near_duplicate_penalty_mean": 0.991424024105072, "reward_near_duplicate_penalty_std": 0.006038422230631113, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9914255142211914, "reward_distinct_2_std": 0.012757115066051483, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.030561331659555435, "reward_total_composite_std": 0.04264984652400017} {"timestamp_utc": "2026-04-12T11:10:24Z", "mode": "train", "global_step": 109, "epoch": 0.004378037514559987, "loss": 0.181, "grad_norm": 19.989253997802734, "learning_rate": 9.672727272727274e-06, "num_tokens": 237016.0, "completions/mean_length": 24.5, "completions/min_length": 17.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.630812406539917, "rewards/meter/std": 0.452547162771225, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8837499618530273, "rewards/judge_quality/std": 0.17557558417320251, "rewards/repeat_penalty/mean": 0.7260398864746094, "rewards/repeat_penalty/std": 0.04937082529067993, "rewards/near_duplicate_penalty/mean": 0.9680531620979309, "rewards/near_duplicate_penalty/std": 0.06582777202129364, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.537653923034668, "rewards/total_composite/std": 0.40953513979911804, "reward": 0.537653923034668, "reward_std": 0.40953510999679565, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14390215277671814, "sampling/sampling_logp_difference/max": 1.2209405899047852, "sampling/importance_sampling_ratio/min": 0.2949526011943817, "sampling/importance_sampling_ratio/mean": 1.0361294746398926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3929248750209808, "clip_ratio/low_mean": 0.08533278107643127, "clip_ratio/low_min": 0.08533278107643127, "clip_ratio/high_mean": 0.07347927987575531, "clip_ratio/high_max": 0.07347927987575531, "clip_ratio/region_mean": 0.15881206095218658, "reward_total_mean": 0.537653923034668, "reward_meter_mean": 0.630812406539917, "reward_meter_std": 0.452547162771225, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7260398864746094, "reward_repeat_penalty_std": 0.04937082529067993, "reward_near_duplicate_penalty_mean": 0.9680531620979309, "reward_near_duplicate_penalty_std": 0.06582777202129364, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8837499618530273, "reward_judge_quality_std": 0.17557558417320251, "reward_total_composite_mean": 0.537653923034668, "reward_total_composite_std": 0.40953513979911804} {"timestamp_utc": "2026-04-12T11:10:33Z", "mode": "train", "global_step": 110, "epoch": 0.004418202996344941, "loss": 0.1281, "grad_norm": 13.449333190917969, "learning_rate": 9.66969696969697e-06, "num_tokens": 238652.0, "completions/mean_length": 49.5, "completions/min_length": 34.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.837989866733551, "rewards/meter/std": 0.23016050457954407, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4874999523162842, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9668082594871521, "rewards/repeat_penalty/std": 0.030257586389780045, "rewards/near_duplicate_penalty/mean": 0.9668082594871521, "rewards/near_duplicate_penalty/std": 0.030257586389780045, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3983583450317383, "rewards/total_composite/std": 0.15410736203193665, "reward": 0.3983583450317383, "reward_std": 0.15410736203193665, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18442291021347046, "sampling/sampling_logp_difference/max": 1.480802059173584, "sampling/importance_sampling_ratio/min": 0.22745519876480103, "sampling/importance_sampling_ratio/mean": 1.03956139087677, "sampling/importance_sampling_ratio/max": 1.9880635738372803, "entropy": 2.166471987962723, "clip_ratio/low_mean": 0.09994436614215374, "clip_ratio/low_min": 0.09994436614215374, "clip_ratio/high_mean": 0.036318263970315456, "clip_ratio/high_max": 0.036318263970315456, "clip_ratio/region_mean": 0.1362626301124692, "reward_total_mean": 0.3983583450317383, "reward_meter_mean": 0.837989866733551, "reward_meter_std": 0.23016050457954407, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9668082594871521, "reward_repeat_penalty_std": 0.030257586389780045, "reward_near_duplicate_penalty_mean": 0.9668082594871521, "reward_near_duplicate_penalty_std": 0.030257586389780045, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4874999523162842, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.3983583450317383, "reward_total_composite_std": 0.15410736203193665} {"timestamp_utc": "2026-04-12T11:10:41Z", "mode": "train", "global_step": 111, "epoch": 0.004458368478129895, "loss": 0.1662, "grad_norm": 21.777551651000977, "learning_rate": 9.666666666666667e-06, "num_tokens": 240079.0, "completions/mean_length": 23.375, "completions/min_length": 17.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.375, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.6233583092689514, "rewards/meter/std": 0.4267948269844055, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9137561321258545, "rewards/lexical_plausibility/std": 0.1420510709285736, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.3651198446750641, "rewards/repeat_penalty/mean": 0.740288496017456, "rewards/repeat_penalty/std": 0.019515199586749077, "rewards/near_duplicate_penalty/mean": 0.9870513677597046, "rewards/near_duplicate_penalty/std": 0.026020271703600883, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.450778067111969, "rewards/total_composite/std": 0.40946274995803833, "reward": 0.450778067111969, "reward_std": 0.40946274995803833, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1604246199131012, "sampling/sampling_logp_difference/max": 1.4545950889587402, "sampling/importance_sampling_ratio/min": 0.23349489271640778, "sampling/importance_sampling_ratio/mean": 1.012116551399231, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1280418634414673, "clip_ratio/low_mean": 0.04994176980108023, "clip_ratio/low_min": 0.04994176980108023, "clip_ratio/high_mean": 0.05896358657628298, "clip_ratio/high_max": 0.05896358657628298, "clip_ratio/region_mean": 0.1089053563773632, "reward_total_mean": 0.450778067111969, "reward_meter_mean": 0.6233583092689514, "reward_meter_std": 0.4267948269844055, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9137561321258545, "reward_lexical_plausibility_std": 0.1420510709285736, "reward_repeat_penalty_mean": 0.740288496017456, "reward_repeat_penalty_std": 0.019515199586749077, "reward_near_duplicate_penalty_mean": 0.9870513677597046, "reward_near_duplicate_penalty_std": 0.026020271703600883, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.3651198446750641, "reward_total_composite_mean": 0.450778067111969, "reward_total_composite_std": 0.40946274995803833} {"timestamp_utc": "2026-04-12T11:10:50Z", "mode": "train", "global_step": 112, "epoch": 0.004498533959914849, "loss": 0.0108, "grad_norm": 16.79600715637207, "learning_rate": 9.663636363636364e-06, "num_tokens": 241638.0, "completions/mean_length": 41.875, "completions/min_length": 35.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7554359436035156, "rewards/meter/std": 0.31206610798835754, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9822304248809814, "rewards/lexical_plausibility/std": 0.0502600334584713, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.9948287010192871, "rewards/repeat_penalty/std": 0.007565564475953579, "rewards/near_duplicate_penalty/mean": 0.9948287010192871, "rewards/near_duplicate_penalty/std": 0.007565564475953579, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3201366364955902, "rewards/total_composite/std": 0.15204645693302155, "reward": 0.3201366364955902, "reward_std": 0.15204645693302155, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20717382431030273, "sampling/sampling_logp_difference/max": 1.4654204845428467, "sampling/importance_sampling_ratio/min": 0.23098085820674896, "sampling/importance_sampling_ratio/mean": 1.0283093452453613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.477309077978134, "clip_ratio/low_mean": 0.08162708580493927, "clip_ratio/low_min": 0.08162708580493927, "clip_ratio/high_mean": 0.15361600555479527, "clip_ratio/high_max": 0.15361600555479527, "clip_ratio/region_mean": 0.23524309135973454, "reward_total_mean": 0.3201366364955902, "reward_meter_mean": 0.7554359436035156, "reward_meter_std": 0.31206610798835754, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9822304248809814, "reward_lexical_plausibility_std": 0.0502600334584713, "reward_repeat_penalty_mean": 0.9948287010192871, "reward_repeat_penalty_std": 0.007565564475953579, "reward_near_duplicate_penalty_mean": 0.9948287010192871, "reward_near_duplicate_penalty_std": 0.007565564475953579, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.3201366364955902, "reward_total_composite_std": 0.15204645693302155} {"timestamp_utc": "2026-04-12T11:11:00Z", "mode": "train", "global_step": 113, "epoch": 0.004538699441699803, "loss": 0.0827, "grad_norm": 12.689526557922363, "learning_rate": 9.660606060606061e-06, "num_tokens": 243549.0, "completions/mean_length": 72.875, "completions/min_length": 60.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.875, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.6673098802566528, "rewards/meter/std": 0.34351009130477905, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9902341961860657, "rewards/lexical_plausibility/std": 0.02134176902472973, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9952738285064697, "rewards/repeat_penalty/std": 0.005715993698686361, "rewards/near_duplicate_penalty/mean": 0.9952738285064697, "rewards/near_duplicate_penalty/std": 0.005715993698686361, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25624915957450867, "rewards/total_composite/std": 0.16143901646137238, "reward": 0.25624915957450867, "reward_std": 0.16143900156021118, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22147944569587708, "sampling/sampling_logp_difference/max": 2.659895896911621, "sampling/importance_sampling_ratio/min": 0.0699555054306984, "sampling/importance_sampling_ratio/mean": 1.0350232124328613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0763853788375854, "clip_ratio/low_mean": 0.06416316702961922, "clip_ratio/low_min": 0.06416316702961922, "clip_ratio/high_mean": 0.1158969309180975, "clip_ratio/high_max": 0.1158969309180975, "clip_ratio/region_mean": 0.1800600979477167, "reward_total_mean": 0.25624915957450867, "reward_meter_mean": 0.6673098802566528, "reward_meter_std": 0.34351009130477905, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9902341961860657, "reward_lexical_plausibility_std": 0.02134176902472973, "reward_repeat_penalty_mean": 0.9952738285064697, "reward_repeat_penalty_std": 0.005715993698686361, "reward_near_duplicate_penalty_mean": 0.9952738285064697, "reward_near_duplicate_penalty_std": 0.005715993698686361, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.25624915957450867, "reward_total_composite_std": 0.16143901646137238} {"timestamp_utc": "2026-04-12T11:11:10Z", "mode": "train", "global_step": 114, "epoch": 0.004578864923484758, "loss": 0.094, "grad_norm": 13.747782707214355, "learning_rate": 9.657575757575758e-06, "num_tokens": 245461.0, "completions/mean_length": 70.0, "completions/min_length": 51.0, "completions/max_length": 97.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.0, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.5687057971954346, "rewards/meter/std": 0.3622046411037445, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.20310096442699432, "rewards/repeat_penalty/mean": 0.9959641098976135, "rewards/repeat_penalty/std": 0.0034096972085535526, "rewards/near_duplicate_penalty/mean": 0.9959641098976135, "rewards/near_duplicate_penalty/std": 0.0034096972085535526, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2490294873714447, "rewards/total_composite/std": 0.1855943202972412, "reward": 0.2490294873714447, "reward_std": 0.18559430539608002, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20971868932247162, "sampling/sampling_logp_difference/max": 1.607193946838379, "sampling/importance_sampling_ratio/min": 0.20044930279254913, "sampling/importance_sampling_ratio/mean": 1.0306721925735474, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.081496089696884, "clip_ratio/low_mean": 0.06832332257181406, "clip_ratio/low_min": 0.06832332257181406, "clip_ratio/high_mean": 0.11153036169707775, "clip_ratio/high_max": 0.11153036169707775, "clip_ratio/region_mean": 0.1798536842688918, "reward_total_mean": 0.2490294873714447, "reward_meter_mean": 0.5687057971954346, "reward_meter_std": 0.3622046411037445, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9959641098976135, "reward_repeat_penalty_std": 0.0034096972085535526, "reward_near_duplicate_penalty_mean": 0.9959641098976135, "reward_near_duplicate_penalty_std": 0.0034096972085535526, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.20310096442699432, "reward_total_composite_mean": 0.2490294873714447, "reward_total_composite_std": 0.1855943202972412} {"timestamp_utc": "2026-04-12T11:11:19Z", "mode": "train", "global_step": 115, "epoch": 0.0046190304052697116, "loss": 0.0328, "grad_norm": 19.110523223876953, "learning_rate": 9.654545454545456e-06, "num_tokens": 246852.0, "completions/mean_length": 33.875, "completions/min_length": 29.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.4572555422782898, "rewards/meter/std": 0.4458775818347931, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9634564518928528, "rewards/lexical_plausibility/std": 0.10336080938577652, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9571646451950073, "rewards/repeat_penalty/std": 0.05079825595021248, "rewards/near_duplicate_penalty/mean": 0.9774123430252075, "rewards/near_duplicate_penalty/std": 0.03181653469800949, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9791947603225708, "rewards/distinct_2/std": 0.03854253515601158, "rewards/total_composite/mean": 0.17574816942214966, "rewards/total_composite/std": 0.17165198922157288, "reward": 0.17574816942214966, "reward_std": 0.17165197432041168, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2393278032541275, "sampling/sampling_logp_difference/max": 1.797713279724121, "sampling/importance_sampling_ratio/min": 0.16567730903625488, "sampling/importance_sampling_ratio/mean": 1.054547905921936, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7014783918857574, "clip_ratio/low_mean": 0.10610019788146019, "clip_ratio/low_min": 0.10610019788146019, "clip_ratio/high_mean": 0.06926235742866993, "clip_ratio/high_max": 0.06926235742866993, "clip_ratio/region_mean": 0.17536255531013012, "reward_total_mean": 0.17574816942214966, "reward_meter_mean": 0.4572555422782898, "reward_meter_std": 0.4458775818347931, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9634564518928528, "reward_lexical_plausibility_std": 0.10336080938577652, "reward_repeat_penalty_mean": 0.9571646451950073, "reward_repeat_penalty_std": 0.05079825595021248, "reward_near_duplicate_penalty_mean": 0.9774123430252075, "reward_near_duplicate_penalty_std": 0.03181653469800949, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9791947603225708, "reward_distinct_2_std": 0.03854253515601158, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.17574816942214966, "reward_total_composite_std": 0.17165198922157288} {"timestamp_utc": "2026-04-12T11:11:31Z", "mode": "train", "global_step": 116, "epoch": 0.0046591958870546655, "loss": 0.1184, "grad_norm": 7.6971516609191895, "learning_rate": 9.651515151515153e-06, "num_tokens": 249893.0, "completions/mean_length": 158.125, "completions/min_length": 107.0, "completions/max_length": 238.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 158.125, "completions/min_terminated_length": 107.0, "completions/max_terminated_length": 238.0, "rewards/meter/mean": 0.32173824310302734, "rewards/meter/std": 0.3033269941806793, "rewards/count_adherence/mean": 0.8958333134651184, "rewards/count_adherence/std": 0.12400396913290024, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9779738187789917, "rewards/lexical_plausibility/std": 0.03407338261604309, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.984792947769165, "rewards/repeat_penalty/std": 0.011711930856108665, "rewards/near_duplicate_penalty/mean": 0.9903175830841064, "rewards/near_duplicate_penalty/std": 0.004368250258266926, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.994415283203125, "rewards/distinct_2/std": 0.010353867895901203, "rewards/total_composite/mean": 0.10354895889759064, "rewards/total_composite/std": 0.1389368623495102, "reward": 0.10354895889759064, "reward_std": 0.1389368623495102, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22458046674728394, "sampling/sampling_logp_difference/max": 2.5895376205444336, "sampling/importance_sampling_ratio/min": 0.07505473494529724, "sampling/importance_sampling_ratio/mean": 1.0412689447402954, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.583432048559189, "clip_ratio/low_mean": 0.1137649267911911, "clip_ratio/low_min": 0.1137649267911911, "clip_ratio/high_mean": 0.06895342469215393, "clip_ratio/high_max": 0.06895342469215393, "clip_ratio/region_mean": 0.18271835148334503, "reward_total_mean": 0.10354895889759064, "reward_meter_mean": 0.32173824310302734, "reward_meter_std": 0.3033269941806793, "reward_count_adherence_mean": 0.8958333134651184, "reward_count_adherence_std": 0.12400396913290024, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9779738187789917, "reward_lexical_plausibility_std": 0.03407338261604309, "reward_repeat_penalty_mean": 0.984792947769165, "reward_repeat_penalty_std": 0.011711930856108665, "reward_near_duplicate_penalty_mean": 0.9903175830841064, "reward_near_duplicate_penalty_std": 0.004368250258266926, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.994415283203125, "reward_distinct_2_std": 0.010353867895901203, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.10354895889759064, "reward_total_composite_std": 0.1389368623495102} {"timestamp_utc": "2026-04-12T11:11:40Z", "mode": "train", "global_step": 117, "epoch": 0.004699361368839619, "loss": 0.0382, "grad_norm": 13.78189468383789, "learning_rate": 9.648484848484849e-06, "num_tokens": 251506.0, "completions/mean_length": 42.625, "completions/min_length": 31.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.625, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.49554315209388733, "rewards/meter/std": 0.44302481412887573, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9687139391899109, "rewards/lexical_plausibility/std": 0.08849029988050461, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3464488387107849, "rewards/repeat_penalty/mean": 0.9968554973602295, "rewards/repeat_penalty/std": 0.006410405971109867, "rewards/near_duplicate_penalty/mean": 0.9968554973602295, "rewards/near_duplicate_penalty/std": 0.006410405971109867, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2768799364566803, "rewards/total_composite/std": 0.3126735985279083, "reward": 0.2768799364566803, "reward_std": 0.3126735985279083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19522778689861298, "sampling/sampling_logp_difference/max": 1.3107595443725586, "sampling/importance_sampling_ratio/min": 0.26961517333984375, "sampling/importance_sampling_ratio/mean": 1.0474461317062378, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.915073737502098, "clip_ratio/low_mean": 0.11497455555945635, "clip_ratio/low_min": 0.11497455555945635, "clip_ratio/high_mean": 0.08457787334918976, "clip_ratio/high_max": 0.08457787334918976, "clip_ratio/region_mean": 0.1995524289086461, "reward_total_mean": 0.2768799364566803, "reward_meter_mean": 0.49554315209388733, "reward_meter_std": 0.44302481412887573, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9687139391899109, "reward_lexical_plausibility_std": 0.08849029988050461, "reward_repeat_penalty_mean": 0.9968554973602295, "reward_repeat_penalty_std": 0.006410405971109867, "reward_near_duplicate_penalty_mean": 0.9968554973602295, "reward_near_duplicate_penalty_std": 0.006410405971109867, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3464488387107849, "reward_total_composite_mean": 0.2768799364566803, "reward_total_composite_std": 0.3126735985279083} {"timestamp_utc": "2026-04-12T11:11:50Z", "mode": "train", "global_step": 118, "epoch": 0.004739526850624573, "loss": 0.0299, "grad_norm": 11.150492668151855, "learning_rate": 9.645454545454548e-06, "num_tokens": 253279.0, "completions/mean_length": 48.625, "completions/min_length": 38.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.7285923957824707, "rewards/meter/std": 0.3594067692756653, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9673515558242798, "rewards/lexical_plausibility/std": 0.09234381467103958, "rewards/judge_quality/mean": 0.6262500286102295, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.9713559150695801, "rewards/repeat_penalty/std": 0.07632871717214584, "rewards/near_duplicate_penalty/mean": 0.9891414642333984, "rewards/near_duplicate_penalty/std": 0.02611256204545498, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.45705297589302063, "rewards/total_composite/std": 0.29990771412849426, "reward": 0.45705297589302063, "reward_std": 0.2999076843261719, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17957256734371185, "sampling/sampling_logp_difference/max": 1.7710824012756348, "sampling/importance_sampling_ratio/min": 0.17014873027801514, "sampling/importance_sampling_ratio/mean": 1.0418623685836792, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7224462032318115, "clip_ratio/low_mean": 0.10201781429350376, "clip_ratio/low_min": 0.10201781429350376, "clip_ratio/high_mean": 0.03315190505236387, "clip_ratio/high_max": 0.03315190505236387, "clip_ratio/region_mean": 0.13516971934586763, "reward_total_mean": 0.45705297589302063, "reward_meter_mean": 0.7285923957824707, "reward_meter_std": 0.3594067692756653, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9673515558242798, "reward_lexical_plausibility_std": 0.09234381467103958, "reward_repeat_penalty_mean": 0.9713559150695801, "reward_repeat_penalty_std": 0.07632871717214584, "reward_near_duplicate_penalty_mean": 0.9891414642333984, "reward_near_duplicate_penalty_std": 0.02611256204545498, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.6262500286102295, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.45705297589302063, "reward_total_composite_std": 0.29990771412849426} {"timestamp_utc": "2026-04-12T11:11:58Z", "mode": "train", "global_step": 119, "epoch": 0.004779692332409527, "loss": 0.0434, "grad_norm": 23.97408103942871, "learning_rate": 9.642424242424243e-06, "num_tokens": 254770.0, "completions/mean_length": 22.375, "completions/min_length": 17.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.375, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.7641736268997192, "rewards/meter/std": 0.37070146203041077, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7512500286102295, "rewards/judge_quality/std": 0.24976776540279388, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5957629680633545, "rewards/total_composite/std": 0.3396039307117462, "reward": 0.5957629680633545, "reward_std": 0.3396039307117462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22697778046131134, "sampling/sampling_logp_difference/max": 1.9863262176513672, "sampling/importance_sampling_ratio/min": 0.1371985375881195, "sampling/importance_sampling_ratio/mean": 1.0331143140792847, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.084925338625908, "clip_ratio/low_mean": 0.07491859421133995, "clip_ratio/low_min": 0.07491859421133995, "clip_ratio/high_mean": 0.12119132094085217, "clip_ratio/high_max": 0.12119132094085217, "clip_ratio/region_mean": 0.19610991515219212, "reward_total_mean": 0.5957629680633545, "reward_meter_mean": 0.7641736268997192, "reward_meter_std": 0.37070146203041077, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7512500286102295, "reward_judge_quality_std": 0.24976776540279388, "reward_total_composite_mean": 0.5957629680633545, "reward_total_composite_std": 0.3396039307117462} {"timestamp_utc": "2026-04-12T11:12:08Z", "mode": "train", "global_step": 120, "epoch": 0.004819857814194481, "loss": 0.0807, "grad_norm": 20.732107162475586, "learning_rate": 9.63939393939394e-06, "num_tokens": 256473.0, "completions/mean_length": 38.875, "completions/min_length": 30.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.6519851684570312, "rewards/meter/std": 0.4235266149044037, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9898897409439087, "rewards/lexical_plausibility/std": 0.028596237301826477, "rewards/judge_quality/mean": 0.6299999952316284, "rewards/judge_quality/std": 0.23071318864822388, "rewards/repeat_penalty/mean": 0.9855146408081055, "rewards/repeat_penalty/std": 0.03465944901108742, "rewards/near_duplicate_penalty/mean": 0.9920557737350464, "rewards/near_duplicate_penalty/std": 0.01630682684481144, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.4616625905036926, "rewards/total_composite/std": 0.3632766306400299, "reward": 0.4616625905036926, "reward_std": 0.3632766306400299, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20872028172016144, "sampling/sampling_logp_difference/max": 1.4982450008392334, "sampling/importance_sampling_ratio/min": 0.2235221117734909, "sampling/importance_sampling_ratio/mean": 1.0724166631698608, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.009061813354492, "clip_ratio/low_mean": 0.06882300227880478, "clip_ratio/low_min": 0.06882300227880478, "clip_ratio/high_mean": 0.06803228054195642, "clip_ratio/high_max": 0.06803228054195642, "clip_ratio/region_mean": 0.1368552828207612, "reward_total_mean": 0.4616625905036926, "reward_meter_mean": 0.6519851684570312, "reward_meter_std": 0.4235266149044037, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9898897409439087, "reward_lexical_plausibility_std": 0.028596237301826477, "reward_repeat_penalty_mean": 0.9855146408081055, "reward_repeat_penalty_std": 0.03465944901108742, "reward_near_duplicate_penalty_mean": 0.9920557737350464, "reward_near_duplicate_penalty_std": 0.01630682684481144, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.6299999952316284, "reward_judge_quality_std": 0.23071318864822388, "reward_total_composite_mean": 0.4616625905036926, "reward_total_composite_std": 0.3632766306400299} {"timestamp_utc": "2026-04-12T11:12:22Z", "mode": "train", "global_step": 121, "epoch": 0.004860023295979435, "loss": 0.1101, "grad_norm": 4.198246479034424, "learning_rate": 9.636363636363638e-06, "num_tokens": 261019.0, "completions/mean_length": 380.25, "completions/min_length": 289.0, "completions/max_length": 470.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 380.25, "completions/min_terminated_length": 289.0, "completions/max_terminated_length": 470.0, "rewards/meter/mean": 0.4872194230556488, "rewards/meter/std": 0.2961656451225281, "rewards/count_adherence/mean": 0.9038461446762085, "rewards/count_adherence/std": 0.05439282953739166, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9988567233085632, "rewards/lexical_plausibility/std": 0.0032337172888219357, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9843146204948425, "rewards/repeat_penalty/std": 0.011409228667616844, "rewards/near_duplicate_penalty/mean": 0.9946587085723877, "rewards/near_duplicate_penalty/std": 0.002646322827786207, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9895939826965332, "rewards/distinct_2/std": 0.01048082485795021, "rewards/total_composite/mean": 0.059502169489860535, "rewards/total_composite/std": 0.08205050230026245, "reward": 0.059502169489860535, "reward_std": 0.08205050230026245, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21086423099040985, "sampling/sampling_logp_difference/max": 1.8623857498168945, "sampling/importance_sampling_ratio/min": 0.15530167520046234, "sampling/importance_sampling_ratio/mean": 1.0560636520385742, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.2698571979999542, "clip_ratio/low_mean": 0.0990350991487503, "clip_ratio/low_min": 0.0990350991487503, "clip_ratio/high_mean": 0.07289245538413525, "clip_ratio/high_max": 0.07289245538413525, "clip_ratio/region_mean": 0.17192755453288555, "reward_total_mean": 0.059502169489860535, "reward_meter_mean": 0.4872194230556488, "reward_meter_std": 0.2961656451225281, "reward_count_adherence_mean": 0.9038461446762085, "reward_count_adherence_std": 0.05439282953739166, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9988567233085632, "reward_lexical_plausibility_std": 0.0032337172888219357, "reward_repeat_penalty_mean": 0.9843146204948425, "reward_repeat_penalty_std": 0.011409228667616844, "reward_near_duplicate_penalty_mean": 0.9946587085723877, "reward_near_duplicate_penalty_std": 0.002646322827786207, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9895939826965332, "reward_distinct_2_std": 0.01048082485795021, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.059502169489860535, "reward_total_composite_std": 0.08205050230026245} {"timestamp_utc": "2026-04-12T11:12:30Z", "mode": "train", "global_step": 122, "epoch": 0.004900188777764389, "loss": 0.0546, "grad_norm": 15.544112205505371, "learning_rate": 9.633333333333335e-06, "num_tokens": 262466.0, "completions/mean_length": 44.875, "completions/min_length": 30.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.4326896369457245, "rewards/meter/std": 0.4062103033065796, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9808238744735718, "rewards/lexical_plausibility/std": 0.03631000593304634, "rewards/judge_quality/mean": 0.38750001788139343, "rewards/judge_quality/std": 0.3283182382583618, "rewards/repeat_penalty/mean": 0.9809596538543701, "rewards/repeat_penalty/std": 0.039783187210559845, "rewards/near_duplicate_penalty/mean": 0.9892747402191162, "rewards/near_duplicate_penalty/std": 0.017515402287244797, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.18216806650161743, "rewards/total_composite/std": 0.3033214807510376, "reward": 0.18216806650161743, "reward_std": 0.3033214807510376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.26005348563194275, "sampling/sampling_logp_difference/max": 1.4416942596435547, "sampling/importance_sampling_ratio/min": 0.23652668297290802, "sampling/importance_sampling_ratio/mean": 1.0260099172592163, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8264652639627457, "clip_ratio/low_mean": 0.1550660226494074, "clip_ratio/low_min": 0.1550660226494074, "clip_ratio/high_mean": 0.04622093215584755, "clip_ratio/high_max": 0.04622093215584755, "clip_ratio/region_mean": 0.20128695480525494, "reward_total_mean": 0.18216806650161743, "reward_meter_mean": 0.4326896369457245, "reward_meter_std": 0.4062103033065796, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9808238744735718, "reward_lexical_plausibility_std": 0.03631000593304634, "reward_repeat_penalty_mean": 0.9809596538543701, "reward_repeat_penalty_std": 0.039783187210559845, "reward_near_duplicate_penalty_mean": 0.9892747402191162, "reward_near_duplicate_penalty_std": 0.017515402287244797, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.38750001788139343, "reward_judge_quality_std": 0.3283182382583618, "reward_total_composite_mean": 0.18216806650161743, "reward_total_composite_std": 0.3033214807510376} {"timestamp_utc": "2026-04-12T11:12:39Z", "mode": "train", "global_step": 123, "epoch": 0.004940354259549343, "loss": 0.1375, "grad_norm": 14.678629875183105, "learning_rate": 9.63030303030303e-06, "num_tokens": 264128.0, "completions/mean_length": 46.75, "completions/min_length": 33.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.32004526257514954, "rewards/meter/std": 0.4370953440666199, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9907463788986206, "rewards/repeat_penalty/std": 0.011995292268693447, "rewards/near_duplicate_penalty/mean": 0.9907463788986206, "rewards/near_duplicate_penalty/std": 0.011995292268693447, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13091403245925903, "rewards/total_composite/std": 0.17915959656238556, "reward": 0.13091403245925903, "reward_std": 0.17915959656238556, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21963627636432648, "sampling/sampling_logp_difference/max": 1.3811006546020508, "sampling/importance_sampling_ratio/min": 0.2513018250465393, "sampling/importance_sampling_ratio/mean": 1.0610466003417969, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8643734902143478, "clip_ratio/low_mean": 0.1139213452115655, "clip_ratio/low_min": 0.1139213452115655, "clip_ratio/high_mean": 0.06875000149011612, "clip_ratio/high_max": 0.06875000149011612, "clip_ratio/region_mean": 0.18267134670168161, "reward_total_mean": 0.13091403245925903, "reward_meter_mean": 0.32004526257514954, "reward_meter_std": 0.4370953440666199, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9907463788986206, "reward_repeat_penalty_std": 0.011995292268693447, "reward_near_duplicate_penalty_mean": 0.9907463788986206, "reward_near_duplicate_penalty_std": 0.011995292268693447, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.13091403245925903, "reward_total_composite_std": 0.17915959656238556} {"timestamp_utc": "2026-04-12T11:12:51Z", "mode": "train", "global_step": 124, "epoch": 0.004980519741334297, "loss": 0.071, "grad_norm": 8.55613899230957, "learning_rate": 9.627272727272728e-06, "num_tokens": 266931.0, "completions/mean_length": 161.375, "completions/min_length": 135.0, "completions/max_length": 187.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.375, "completions/min_terminated_length": 135.0, "completions/max_terminated_length": 187.0, "rewards/meter/mean": 0.7234280109405518, "rewards/meter/std": 0.28849291801452637, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.9556269645690918, "rewards/repeat_penalty/std": 0.024927888065576553, "rewards/near_duplicate_penalty/mean": 0.9893919229507446, "rewards/near_duplicate_penalty/std": 0.004175576847046614, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9658507108688354, "rewards/distinct_2/std": 0.023846343159675598, "rewards/total_composite/mean": 0.19653823971748352, "rewards/total_composite/std": 0.10214091092348099, "reward": 0.19653823971748352, "reward_std": 0.10214090347290039, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2302684783935547, "sampling/sampling_logp_difference/max": 1.5414671897888184, "sampling/importance_sampling_ratio/min": 0.2203531712293625, "sampling/importance_sampling_ratio/mean": 1.0580713748931885, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.2126179933547974, "clip_ratio/low_mean": 0.06961525604128838, "clip_ratio/low_min": 0.06961525604128838, "clip_ratio/high_mean": 0.12272296473383904, "clip_ratio/high_max": 0.12272296473383904, "clip_ratio/region_mean": 0.1923382207751274, "reward_total_mean": 0.19653823971748352, "reward_meter_mean": 0.7234280109405518, "reward_meter_std": 0.28849291801452637, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9556269645690918, "reward_repeat_penalty_std": 0.024927888065576553, "reward_near_duplicate_penalty_mean": 0.9893919229507446, "reward_near_duplicate_penalty_std": 0.004175576847046614, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9658507108688354, "reward_distinct_2_std": 0.023846343159675598, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.19653823971748352, "reward_total_composite_std": 0.10214091092348099} {"timestamp_utc": "2026-04-12T11:13:00Z", "mode": "train", "global_step": 125, "epoch": 0.005020685223119251, "loss": -0.0016, "grad_norm": 12.818426132202148, "learning_rate": 9.624242424242425e-06, "num_tokens": 268778.0, "completions/mean_length": 57.875, "completions/min_length": 43.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.875, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.7629757523536682, "rewards/meter/std": 0.36042335629463196, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9707098007202148, "rewards/lexical_plausibility/std": 0.0828452855348587, "rewards/judge_quality/mean": 0.4625000059604645, "rewards/judge_quality/std": 0.2938780188560486, "rewards/repeat_penalty/mean": 0.9815762639045715, "rewards/repeat_penalty/std": 0.02969047613441944, "rewards/near_duplicate_penalty/mean": 0.9905714988708496, "rewards/near_duplicate_penalty/std": 0.007983755320310593, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.33154475688934326, "rewards/total_composite/std": 0.2759409248828888, "reward": 0.33154475688934326, "reward_std": 0.2759409248828888, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19727781414985657, "sampling/sampling_logp_difference/max": 1.3558845520019531, "sampling/importance_sampling_ratio/min": 0.2577192187309265, "sampling/importance_sampling_ratio/mean": 1.0571469068527222, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.360900267958641, "clip_ratio/low_mean": 0.10369003191590309, "clip_ratio/low_min": 0.10369003191590309, "clip_ratio/high_mean": 0.10226017236709595, "clip_ratio/high_max": 0.10226017236709595, "clip_ratio/region_mean": 0.20595020428299904, "reward_total_mean": 0.33154475688934326, "reward_meter_mean": 0.7629757523536682, "reward_meter_std": 0.36042335629463196, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9707098007202148, "reward_lexical_plausibility_std": 0.0828452855348587, "reward_repeat_penalty_mean": 0.9815762639045715, "reward_repeat_penalty_std": 0.02969047613441944, "reward_near_duplicate_penalty_mean": 0.9905714988708496, "reward_near_duplicate_penalty_std": 0.007983755320310593, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.4625000059604645, "reward_judge_quality_std": 0.2938780188560486, "reward_total_composite_mean": 0.33154475688934326, "reward_total_composite_std": 0.2759409248828888} {"timestamp_utc": "2026-04-12T11:13:08Z", "mode": "train", "global_step": 126, "epoch": 0.005060850704904206, "loss": 0.032, "grad_norm": 21.17633819580078, "learning_rate": 9.621212121212122e-06, "num_tokens": 270279.0, "completions/mean_length": 28.625, "completions/min_length": 26.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.625, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.6716091632843018, "rewards/meter/std": 0.3910526633262634, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9916572570800781, "rewards/lexical_plausibility/std": 0.023596882820129395, "rewards/judge_quality/mean": 0.6600000262260437, "rewards/judge_quality/std": 0.2805097699165344, "rewards/repeat_penalty/mean": 0.9878971576690674, "rewards/repeat_penalty/std": 0.02144477888941765, "rewards/near_duplicate_penalty/mean": 0.9878971576690674, "rewards/near_duplicate_penalty/std": 0.02144477888941765, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.43078815937042236, "rewards/total_composite/std": 0.3094470798969269, "reward": 0.43078815937042236, "reward_std": 0.3094470798969269, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18919698894023895, "sampling/sampling_logp_difference/max": 1.7103853225708008, "sampling/importance_sampling_ratio/min": 0.18079611659049988, "sampling/importance_sampling_ratio/mean": 1.008143424987793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9981854781508446, "clip_ratio/low_mean": 0.09711630642414093, "clip_ratio/low_min": 0.09711630642414093, "clip_ratio/high_mean": 0.056547620333731174, "clip_ratio/high_max": 0.056547620333731174, "clip_ratio/region_mean": 0.1536639267578721, "reward_total_mean": 0.43078815937042236, "reward_meter_mean": 0.6716091632843018, "reward_meter_std": 0.3910526633262634, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9916572570800781, "reward_lexical_plausibility_std": 0.023596882820129395, "reward_repeat_penalty_mean": 0.9878971576690674, "reward_repeat_penalty_std": 0.02144477888941765, "reward_near_duplicate_penalty_mean": 0.9878971576690674, "reward_near_duplicate_penalty_std": 0.02144477888941765, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6600000262260437, "reward_judge_quality_std": 0.2805097699165344, "reward_total_composite_mean": 0.43078815937042236, "reward_total_composite_std": 0.3094470798969269} {"timestamp_utc": "2026-04-12T11:13:17Z", "mode": "train", "global_step": 127, "epoch": 0.00510101618668916, "loss": -0.0924, "grad_norm": 13.073019981384277, "learning_rate": 9.61818181818182e-06, "num_tokens": 272030.0, "completions/mean_length": 62.875, "completions/min_length": 45.0, "completions/max_length": 88.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.875, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.3191009759902954, "rewards/meter/std": 0.29537802934646606, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9776274561882019, "rewards/repeat_penalty/std": 0.034937307238578796, "rewards/near_duplicate_penalty/mean": 0.9852867126464844, "rewards/near_duplicate_penalty/std": 0.015377524308860302, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.12350160628557205, "rewards/total_composite/std": 0.1331329196691513, "reward": 0.12350160628557205, "reward_std": 0.1331329047679901, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2104559987783432, "sampling/sampling_logp_difference/max": 1.8942790031433105, "sampling/importance_sampling_ratio/min": 0.1504267454147339, "sampling/importance_sampling_ratio/mean": 1.0316500663757324, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1464562863111496, "clip_ratio/low_mean": 0.13627557829022408, "clip_ratio/low_min": 0.13627557829022408, "clip_ratio/high_mean": 0.0845691878348589, "clip_ratio/high_max": 0.0845691878348589, "clip_ratio/region_mean": 0.22084476612508297, "reward_total_mean": 0.12350160628557205, "reward_meter_mean": 0.3191009759902954, "reward_meter_std": 0.29537802934646606, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9776274561882019, "reward_repeat_penalty_std": 0.034937307238578796, "reward_near_duplicate_penalty_mean": 0.9852867126464844, "reward_near_duplicate_penalty_std": 0.015377524308860302, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.12350160628557205, "reward_total_composite_std": 0.1331329196691513} {"timestamp_utc": "2026-04-12T11:13:27Z", "mode": "train", "global_step": 128, "epoch": 0.005141181668474114, "loss": 0.1126, "grad_norm": 17.821298599243164, "learning_rate": 9.615151515151517e-06, "num_tokens": 273676.0, "completions/mean_length": 42.75, "completions/min_length": 32.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.31968021392822266, "rewards/meter/std": 0.2793877124786377, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9928355813026428, "rewards/lexical_plausibility/std": 0.020263994112610817, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9920704364776611, "rewards/repeat_penalty/std": 0.01435357891023159, "rewards/near_duplicate_penalty/mean": 0.9920704364776611, "rewards/near_duplicate_penalty/std": 0.01435357891023159, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13533230125904083, "rewards/total_composite/std": 0.11568300426006317, "reward": 0.13533230125904083, "reward_std": 0.11568299680948257, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23443779349327087, "sampling/sampling_logp_difference/max": 1.3514337539672852, "sampling/importance_sampling_ratio/min": 0.25886884331703186, "sampling/importance_sampling_ratio/mean": 1.0290594100952148, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5696670711040497, "clip_ratio/low_mean": 0.08619480999186635, "clip_ratio/low_min": 0.08619480999186635, "clip_ratio/high_mean": 0.13277778029441833, "clip_ratio/high_max": 0.13277778029441833, "clip_ratio/region_mean": 0.21897259028628469, "reward_total_mean": 0.13533230125904083, "reward_meter_mean": 0.31968021392822266, "reward_meter_std": 0.2793877124786377, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9928355813026428, "reward_lexical_plausibility_std": 0.020263994112610817, "reward_repeat_penalty_mean": 0.9920704364776611, "reward_repeat_penalty_std": 0.01435357891023159, "reward_near_duplicate_penalty_mean": 0.9920704364776611, "reward_near_duplicate_penalty_std": 0.01435357891023159, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.13533230125904083, "reward_total_composite_std": 0.11568300426006317} {"timestamp_utc": "2026-04-12T11:13:38Z", "mode": "train", "global_step": 129, "epoch": 0.0051813471502590676, "loss": -0.0287, "grad_norm": 11.1714448928833, "learning_rate": 9.612121212121212e-06, "num_tokens": 276217.0, "completions/mean_length": 115.625, "completions/min_length": 70.0, "completions/max_length": 179.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.625, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 179.0, "rewards/meter/mean": 0.30494463443756104, "rewards/meter/std": 0.26648348569869995, "rewards/count_adherence/mean": 0.9249999523162842, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9899933338165283, "rewards/lexical_plausibility/std": 0.02830304391682148, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9876667261123657, "rewards/repeat_penalty/std": 0.020608430728316307, "rewards/near_duplicate_penalty/mean": 0.9933052062988281, "rewards/near_duplicate_penalty/std": 0.0052453503012657166, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9942594766616821, "rewards/distinct_2/std": 0.016236674040555954, "rewards/total_composite/mean": 0.06439289450645447, "rewards/total_composite/std": 0.06670676171779633, "reward": 0.06439289450645447, "reward_std": 0.06670676171779633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2419767826795578, "sampling/sampling_logp_difference/max": 1.5326776504516602, "sampling/importance_sampling_ratio/min": 0.2159566432237625, "sampling/importance_sampling_ratio/mean": 1.0452473163604736, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6886102110147476, "clip_ratio/low_mean": 0.129961758852005, "clip_ratio/low_min": 0.129961758852005, "clip_ratio/high_mean": 0.08939770795404911, "clip_ratio/high_max": 0.08939770795404911, "clip_ratio/region_mean": 0.21935946680605412, "reward_total_mean": 0.06439289450645447, "reward_meter_mean": 0.30494463443756104, "reward_meter_std": 0.26648348569869995, "reward_count_adherence_mean": 0.9249999523162842, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9899933338165283, "reward_lexical_plausibility_std": 0.02830304391682148, "reward_repeat_penalty_mean": 0.9876667261123657, "reward_repeat_penalty_std": 0.020608430728316307, "reward_near_duplicate_penalty_mean": 0.9933052062988281, "reward_near_duplicate_penalty_std": 0.0052453503012657166, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9942594766616821, "reward_distinct_2_std": 0.016236674040555954, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.06439289450645447, "reward_total_composite_std": 0.06670676171779633} {"timestamp_utc": "2026-04-12T11:13:49Z", "mode": "train", "global_step": 130, "epoch": 0.0052215126320440215, "loss": 0.1365, "grad_norm": 8.778731346130371, "learning_rate": 9.60909090909091e-06, "num_tokens": 278568.0, "completions/mean_length": 119.875, "completions/min_length": 81.0, "completions/max_length": 179.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.875, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 179.0, "rewards/meter/mean": 0.8424458503723145, "rewards/meter/std": 0.22091150283813477, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9579651355743408, "rewards/repeat_penalty/std": 0.07393673807382584, "rewards/near_duplicate_penalty/mean": 0.9907664060592651, "rewards/near_duplicate_penalty/std": 0.013159936293959618, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9661681056022644, "rewards/distinct_2/std": 0.06276010721921921, "rewards/total_composite/mean": 0.2576933801174164, "rewards/total_composite/std": 0.12515640258789062, "reward": 0.2576933801174164, "reward_std": 0.12515640258789062, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.232686847448349, "sampling/sampling_logp_difference/max": 1.626357078552246, "sampling/importance_sampling_ratio/min": 0.1966446340084076, "sampling/importance_sampling_ratio/mean": 1.038954496383667, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.205583095550537, "clip_ratio/low_mean": 0.07093797065317631, "clip_ratio/low_min": 0.07093797065317631, "clip_ratio/high_mean": 0.10020424611866474, "clip_ratio/high_max": 0.10020424611866474, "clip_ratio/region_mean": 0.17114221677184105, "reward_total_mean": 0.2576933801174164, "reward_meter_mean": 0.8424458503723145, "reward_meter_std": 0.22091150283813477, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9579651355743408, "reward_repeat_penalty_std": 0.07393673807382584, "reward_near_duplicate_penalty_mean": 0.9907664060592651, "reward_near_duplicate_penalty_std": 0.013159936293959618, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9661681056022644, "reward_distinct_2_std": 0.06276010721921921, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.2576933801174164, "reward_total_composite_std": 0.12515640258789062} {"timestamp_utc": "2026-04-12T11:14:03Z", "mode": "train", "global_step": 131, "epoch": 0.005261678113828975, "loss": -0.0782, "grad_norm": 3.8477623462677, "learning_rate": 9.606060606060607e-06, "num_tokens": 282878.0, "completions/mean_length": 329.75, "completions/min_length": 52.0, "completions/max_length": 445.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 329.75, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 445.0, "rewards/meter/mean": 0.8844295740127563, "rewards/meter/std": 0.11742876470088959, "rewards/count_adherence/mean": 0.7291666269302368, "rewards/count_adherence/std": 0.23464766144752502, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.984276294708252, "rewards/repeat_penalty/std": 0.016946520656347275, "rewards/near_duplicate_penalty/mean": 0.9957332611083984, "rewards/near_duplicate_penalty/std": 0.002406543819233775, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9884704351425171, "rewards/distinct_2/std": 0.015221429988741875, "rewards/total_composite/mean": 0.11510159820318222, "rewards/total_composite/std": 0.07259103655815125, "reward": 0.11510159820318222, "reward_std": 0.07259103655815125, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21964924037456512, "sampling/sampling_logp_difference/max": 1.4762115478515625, "sampling/importance_sampling_ratio/min": 0.22850172221660614, "sampling/importance_sampling_ratio/mean": 1.0544650554656982, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.6216365098953247, "clip_ratio/low_mean": 0.11001992411911488, "clip_ratio/low_min": 0.11001992411911488, "clip_ratio/high_mean": 0.03885163553059101, "clip_ratio/high_max": 0.03885163553059101, "clip_ratio/region_mean": 0.1488715596497059, "reward_total_mean": 0.11510159820318222, "reward_meter_mean": 0.8844295740127563, "reward_meter_std": 0.11742876470088959, "reward_count_adherence_mean": 0.7291666269302368, "reward_count_adherence_std": 0.23464766144752502, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.984276294708252, "reward_repeat_penalty_std": 0.016946520656347275, "reward_near_duplicate_penalty_mean": 0.9957332611083984, "reward_near_duplicate_penalty_std": 0.002406543819233775, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9884704351425171, "reward_distinct_2_std": 0.015221429988741875, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.11510159820318222, "reward_total_composite_std": 0.07259103655815125} {"timestamp_utc": "2026-04-12T11:14:12Z", "mode": "train", "global_step": 132, "epoch": 0.005301843595613929, "loss": 0.1637, "grad_norm": 19.3759765625, "learning_rate": 9.603030303030304e-06, "num_tokens": 284351.0, "completions/mean_length": 36.125, "completions/min_length": 27.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.125, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.3161843419075012, "rewards/meter/std": 0.2382018268108368, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.2241770625114441, "rewards/repeat_penalty/mean": 0.9833240509033203, "rewards/repeat_penalty/std": 0.021121129393577576, "rewards/near_duplicate_penalty/mean": 0.9833240509033203, "rewards/near_duplicate_penalty/std": 0.021121129393577576, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16291549801826477, "rewards/total_composite/std": 0.162691131234169, "reward": 0.16291549801826477, "reward_std": 0.1626911461353302, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20212748646736145, "sampling/sampling_logp_difference/max": 1.7739019393920898, "sampling/importance_sampling_ratio/min": 0.16966965794563293, "sampling/importance_sampling_ratio/mean": 1.0468316078186035, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8667328841984272, "clip_ratio/low_mean": 0.09415096137672663, "clip_ratio/low_min": 0.09415096137672663, "clip_ratio/high_mean": 0.04595364350825548, "clip_ratio/high_max": 0.04595364350825548, "clip_ratio/region_mean": 0.1401046048849821, "reward_total_mean": 0.16291549801826477, "reward_meter_mean": 0.3161843419075012, "reward_meter_std": 0.2382018268108368, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9833240509033203, "reward_repeat_penalty_std": 0.021121129393577576, "reward_near_duplicate_penalty_mean": 0.9833240509033203, "reward_near_duplicate_penalty_std": 0.021121129393577576, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.2241770625114441, "reward_total_composite_mean": 0.16291549801826477, "reward_total_composite_std": 0.162691131234169} {"timestamp_utc": "2026-04-12T11:14:21Z", "mode": "train", "global_step": 133, "epoch": 0.005342009077398883, "loss": 0.0998, "grad_norm": 15.089190483093262, "learning_rate": 9.600000000000001e-06, "num_tokens": 286069.0, "completions/mean_length": 50.75, "completions/min_length": 28.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.75, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.3334487974643707, "rewards/meter/std": 0.3898901641368866, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9014673233032227, "rewards/lexical_plausibility/std": 0.13922642171382904, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.960153341293335, "rewards/repeat_penalty/std": 0.0854540467262268, "rewards/near_duplicate_penalty/mean": 0.991403341293335, "rewards/near_duplicate_penalty/std": 0.010194990783929825, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0930812805891037, "rewards/total_composite/std": 0.10575805604457855, "reward": 0.0930812805891037, "reward_std": 0.10575805604457855, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2031748741865158, "sampling/sampling_logp_difference/max": 1.1954617500305176, "sampling/importance_sampling_ratio/min": 0.30256420373916626, "sampling/importance_sampling_ratio/mean": 1.0299148559570312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.989794209599495, "clip_ratio/low_mean": 0.1021833922713995, "clip_ratio/low_min": 0.1021833922713995, "clip_ratio/high_mean": 0.06888170819729567, "clip_ratio/high_max": 0.06888170819729567, "clip_ratio/region_mean": 0.17106510046869516, "reward_total_mean": 0.0930812805891037, "reward_meter_mean": 0.3334487974643707, "reward_meter_std": 0.3898901641368866, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9014673233032227, "reward_lexical_plausibility_std": 0.13922642171382904, "reward_repeat_penalty_mean": 0.960153341293335, "reward_repeat_penalty_std": 0.0854540467262268, "reward_near_duplicate_penalty_mean": 0.991403341293335, "reward_near_duplicate_penalty_std": 0.010194990783929825, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.0930812805891037, "reward_total_composite_std": 0.10575805604457855} {"timestamp_utc": "2026-04-12T11:14:31Z", "mode": "train", "global_step": 134, "epoch": 0.005382174559183837, "loss": 0.0562, "grad_norm": 9.034200668334961, "learning_rate": 9.596969696969699e-06, "num_tokens": 288485.0, "completions/mean_length": 124.0, "completions/min_length": 95.0, "completions/max_length": 177.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 124.0, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 177.0, "rewards/meter/mean": 0.3226137161254883, "rewards/meter/std": 0.266395628452301, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9902002811431885, "rewards/repeat_penalty/std": 0.0050697955302894115, "rewards/near_duplicate_penalty/mean": 0.9902002811431885, "rewards/near_duplicate_penalty/std": 0.0050697955302894115, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08946527540683746, "rewards/total_composite/std": 0.08898165076971054, "reward": 0.08946527540683746, "reward_std": 0.08898164331912994, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24211280047893524, "sampling/sampling_logp_difference/max": 2.0446956157684326, "sampling/importance_sampling_ratio/min": 0.12941958010196686, "sampling/importance_sampling_ratio/mean": 1.0471415519714355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.588059216737747, "clip_ratio/low_mean": 0.12168584018945694, "clip_ratio/low_min": 0.12168584018945694, "clip_ratio/high_mean": 0.08939998969435692, "clip_ratio/high_max": 0.08939998969435692, "clip_ratio/region_mean": 0.21108582988381386, "reward_total_mean": 0.08946527540683746, "reward_meter_mean": 0.3226137161254883, "reward_meter_std": 0.266395628452301, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9902002811431885, "reward_repeat_penalty_std": 0.0050697955302894115, "reward_near_duplicate_penalty_mean": 0.9902002811431885, "reward_near_duplicate_penalty_std": 0.0050697955302894115, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.08946527540683746, "reward_total_composite_std": 0.08898165076971054} {"timestamp_utc": "2026-04-12T11:14:39Z", "mode": "train", "global_step": 135, "epoch": 0.005422340040968791, "loss": -0.0896, "grad_norm": 20.581274032592773, "learning_rate": 9.593939393939394e-06, "num_tokens": 289871.0, "completions/mean_length": 20.25, "completions/min_length": 16.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.6398148536682129, "rewards/meter/std": 0.41537731885910034, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9554227590560913, "rewards/lexical_plausibility/std": 0.10317420959472656, "rewards/judge_quality/mean": 0.5799999833106995, "rewards/judge_quality/std": 0.3062678575515747, "rewards/repeat_penalty/mean": 0.7446338534355164, "rewards/repeat_penalty/std": 0.015177796594798565, "rewards/near_duplicate_penalty/mean": 0.9928451180458069, "rewards/near_duplicate_penalty/std": 0.020237062126398087, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44227364659309387, "rewards/total_composite/std": 0.37129056453704834, "reward": 0.44227364659309387, "reward_std": 0.37129056453704834, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25178173184394836, "sampling/sampling_logp_difference/max": 1.6135683059692383, "sampling/importance_sampling_ratio/min": 0.199175626039505, "sampling/importance_sampling_ratio/mean": 1.0048104524612427, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.286774158477783, "clip_ratio/low_mean": 0.12150456942617893, "clip_ratio/low_min": 0.12150456942617893, "clip_ratio/high_mean": 0.06586779560893774, "clip_ratio/high_max": 0.06586779560893774, "clip_ratio/region_mean": 0.18737236503511667, "reward_total_mean": 0.44227364659309387, "reward_meter_mean": 0.6398148536682129, "reward_meter_std": 0.41537731885910034, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9554227590560913, "reward_lexical_plausibility_std": 0.10317420959472656, "reward_repeat_penalty_mean": 0.7446338534355164, "reward_repeat_penalty_std": 0.015177796594798565, "reward_near_duplicate_penalty_mean": 0.9928451180458069, "reward_near_duplicate_penalty_std": 0.020237062126398087, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5799999833106995, "reward_judge_quality_std": 0.3062678575515747, "reward_total_composite_mean": 0.44227364659309387, "reward_total_composite_std": 0.37129056453704834} {"timestamp_utc": "2026-04-12T11:14:50Z", "mode": "train", "global_step": 136, "epoch": 0.005462505522753745, "loss": -0.0265, "grad_norm": 9.126276969909668, "learning_rate": 9.590909090909091e-06, "num_tokens": 292355.0, "completions/mean_length": 109.5, "completions/min_length": 84.0, "completions/max_length": 134.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.5, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 134.0, "rewards/meter/mean": 0.6719751358032227, "rewards/meter/std": 0.31151083111763, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9214310646057129, "rewards/lexical_plausibility/std": 0.06633367389440536, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.9427301287651062, "rewards/repeat_penalty/std": 0.07048720121383667, "rewards/near_duplicate_penalty/mean": 0.9837743639945984, "rewards/near_duplicate_penalty/std": 0.013407698832452297, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9651181697845459, "rewards/distinct_2/std": 0.055662382394075394, "rewards/total_composite/mean": 0.18346239626407623, "rewards/total_composite/std": 0.11258508265018463, "reward": 0.18346239626407623, "reward_std": 0.11258507519960403, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23017889261245728, "sampling/sampling_logp_difference/max": 1.4955120086669922, "sampling/importance_sampling_ratio/min": 0.22413381934165955, "sampling/importance_sampling_ratio/mean": 1.0508452653884888, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.91239795088768, "clip_ratio/low_mean": 0.1406170055270195, "clip_ratio/low_min": 0.1406170055270195, "clip_ratio/high_mean": 0.0502953976392746, "clip_ratio/high_max": 0.0502953976392746, "clip_ratio/region_mean": 0.1909124031662941, "reward_total_mean": 0.18346239626407623, "reward_meter_mean": 0.6719751358032227, "reward_meter_std": 0.31151083111763, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9214310646057129, "reward_lexical_plausibility_std": 0.06633367389440536, "reward_repeat_penalty_mean": 0.9427301287651062, "reward_repeat_penalty_std": 0.07048720121383667, "reward_near_duplicate_penalty_mean": 0.9837743639945984, "reward_near_duplicate_penalty_std": 0.013407698832452297, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9651181697845459, "reward_distinct_2_std": 0.055662382394075394, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.18346239626407623, "reward_total_composite_std": 0.11258508265018463} {"timestamp_utc": "2026-04-12T11:15:00Z", "mode": "train", "global_step": 137, "epoch": 0.005502671004538699, "loss": -0.024, "grad_norm": 21.552860260009766, "learning_rate": 9.587878787878789e-06, "num_tokens": 293852.0, "completions/mean_length": 35.125, "completions/min_length": 29.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.786868155002594, "rewards/meter/std": 0.2549407482147217, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9798868894577026, "rewards/lexical_plausibility/std": 0.04668755084276199, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3414648175239563, "rewards/repeat_penalty/mean": 0.9912117719650269, "rewards/repeat_penalty/std": 0.010851188562810421, "rewards/near_duplicate_penalty/mean": 0.9912117719650269, "rewards/near_duplicate_penalty/std": 0.010851188562810421, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4462380111217499, "rewards/total_composite/std": 0.3615570068359375, "reward": 0.4462380111217499, "reward_std": 0.3615570068359375, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20842508971691132, "sampling/sampling_logp_difference/max": 1.7045316696166992, "sampling/importance_sampling_ratio/min": 0.18185754120349884, "sampling/importance_sampling_ratio/mean": 1.0384540557861328, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7997378706932068, "clip_ratio/low_mean": 0.14936923701316118, "clip_ratio/low_min": 0.14936923701316118, "clip_ratio/high_mean": 0.060762768844142556, "clip_ratio/high_max": 0.060762768844142556, "clip_ratio/region_mean": 0.21013200585730374, "reward_total_mean": 0.4462380111217499, "reward_meter_mean": 0.786868155002594, "reward_meter_std": 0.2549407482147217, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9798868894577026, "reward_lexical_plausibility_std": 0.04668755084276199, "reward_repeat_penalty_mean": 0.9912117719650269, "reward_repeat_penalty_std": 0.010851188562810421, "reward_near_duplicate_penalty_mean": 0.9912117719650269, "reward_near_duplicate_penalty_std": 0.010851188562810421, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3414648175239563, "reward_total_composite_mean": 0.4462380111217499, "reward_total_composite_std": 0.3615570068359375} {"timestamp_utc": "2026-04-12T11:15:09Z", "mode": "train", "global_step": 138, "epoch": 0.005542836486323654, "loss": 0.1688, "grad_norm": 18.655946731567383, "learning_rate": 9.584848484848486e-06, "num_tokens": 295172.0, "completions/mean_length": 22.0, "completions/min_length": 17.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.6750556230545044, "rewards/meter/std": 0.41225430369377136, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44987037777900696, "rewards/total_composite/std": 0.40740644931793213, "reward": 0.44987037777900696, "reward_std": 0.40740641951560974, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17174120247364044, "sampling/sampling_logp_difference/max": 1.9114164113998413, "sampling/importance_sampling_ratio/min": 0.14787079393863678, "sampling/importance_sampling_ratio/mean": 1.0470362901687622, "sampling/importance_sampling_ratio/max": 1.9874305725097656, "entropy": 1.164416842162609, "clip_ratio/low_mean": 0.08753293938934803, "clip_ratio/low_min": 0.08753293938934803, "clip_ratio/high_mean": 0.05992756085470319, "clip_ratio/high_max": 0.05992756085470319, "clip_ratio/region_mean": 0.14746050024405122, "reward_total_mean": 0.44987037777900696, "reward_meter_mean": 0.6750556230545044, "reward_meter_std": 0.41225430369377136, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.44987037777900696, "reward_total_composite_std": 0.40740644931793213} {"timestamp_utc": "2026-04-12T11:15:19Z", "mode": "train", "global_step": 139, "epoch": 0.005583001968108608, "loss": 0.1143, "grad_norm": 10.605066299438477, "learning_rate": 9.581818181818181e-06, "num_tokens": 297230.0, "completions/mean_length": 87.25, "completions/min_length": 78.0, "completions/max_length": 123.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.25, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 123.0, "rewards/meter/mean": 0.7937848567962646, "rewards/meter/std": 0.2852884829044342, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791418313980103, "rewards/lexical_plausibility/std": 0.03369014337658882, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9874218106269836, "rewards/repeat_penalty/std": 0.0075856903567910194, "rewards/near_duplicate_penalty/mean": 0.9874218106269836, "rewards/near_duplicate_penalty/std": 0.0075856903567910194, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25178635120391846, "rewards/total_composite/std": 0.11754924803972244, "reward": 0.25178635120391846, "reward_std": 0.11754924058914185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22691038250923157, "sampling/sampling_logp_difference/max": 1.4515964984893799, "sampling/importance_sampling_ratio/min": 0.23419609665870667, "sampling/importance_sampling_ratio/mean": 1.0392982959747314, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6376554667949677, "clip_ratio/low_mean": 0.10384871438145638, "clip_ratio/low_min": 0.10384871438145638, "clip_ratio/high_mean": 0.11633804067969322, "clip_ratio/high_max": 0.11633804067969322, "clip_ratio/region_mean": 0.2201867550611496, "reward_total_mean": 0.25178635120391846, "reward_meter_mean": 0.7937848567962646, "reward_meter_std": 0.2852884829044342, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9791418313980103, "reward_lexical_plausibility_std": 0.03369014337658882, "reward_repeat_penalty_mean": 0.9874218106269836, "reward_repeat_penalty_std": 0.0075856903567910194, "reward_near_duplicate_penalty_mean": 0.9874218106269836, "reward_near_duplicate_penalty_std": 0.0075856903567910194, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.25178635120391846, "reward_total_composite_std": 0.11754924803972244} {"timestamp_utc": "2026-04-12T11:15:29Z", "mode": "train", "global_step": 140, "epoch": 0.005623167449893562, "loss": 0.1606, "grad_norm": 11.118247985839844, "learning_rate": 9.57878787878788e-06, "num_tokens": 299498.0, "completions/mean_length": 109.5, "completions/min_length": 76.0, "completions/max_length": 145.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.5, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 145.0, "rewards/meter/mean": 0.594388484954834, "rewards/meter/std": 0.3843231499195099, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.982245683670044, "rewards/repeat_penalty/std": 0.020189322531223297, "rewards/near_duplicate_penalty/mean": 0.9862920045852661, "rewards/near_duplicate_penalty/std": 0.010312417522072792, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9958193898200989, "rewards/distinct_2/std": 0.0118245305493474, "rewards/total_composite/mean": 0.19535231590270996, "rewards/total_composite/std": 0.14439724385738373, "reward": 0.19535231590270996, "reward_std": 0.14439725875854492, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2408737689256668, "sampling/sampling_logp_difference/max": 1.7839741706848145, "sampling/importance_sampling_ratio/min": 0.16796928644180298, "sampling/importance_sampling_ratio/mean": 1.0467760562896729, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6270385682582855, "clip_ratio/low_mean": 0.11177855171263218, "clip_ratio/low_min": 0.11177855171263218, "clip_ratio/high_mean": 0.09924664907157421, "clip_ratio/high_max": 0.09924664907157421, "clip_ratio/region_mean": 0.2110252007842064, "reward_total_mean": 0.19535231590270996, "reward_meter_mean": 0.594388484954834, "reward_meter_std": 0.3843231499195099, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.982245683670044, "reward_repeat_penalty_std": 0.020189322531223297, "reward_near_duplicate_penalty_mean": 0.9862920045852661, "reward_near_duplicate_penalty_std": 0.010312417522072792, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9958193898200989, "reward_distinct_2_std": 0.0118245305493474, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.19535231590270996, "reward_total_composite_std": 0.14439724385738373} {"timestamp_utc": "2026-04-12T11:15:38Z", "mode": "train", "global_step": 141, "epoch": 0.005663332931678516, "loss": 0.0318, "grad_norm": 23.561901092529297, "learning_rate": 9.575757575757576e-06, "num_tokens": 300958.0, "completions/mean_length": 27.5, "completions/min_length": 23.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.5, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.4667555093765259, "rewards/meter/std": 0.39842984080314636, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.9685021638870239, "rewards/repeat_penalty/std": 0.04899715259671211, "rewards/near_duplicate_penalty/mean": 0.981907844543457, "rewards/near_duplicate_penalty/std": 0.027928875759243965, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.26016759872436523, "rewards/total_composite/std": 0.23429597914218903, "reward": 0.26016759872436523, "reward_std": 0.23429596424102783, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24755442142486572, "sampling/sampling_logp_difference/max": 1.834871768951416, "sampling/importance_sampling_ratio/min": 0.15963397920131683, "sampling/importance_sampling_ratio/mean": 1.042060375213623, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5945236384868622, "clip_ratio/low_mean": 0.14359890297055244, "clip_ratio/low_min": 0.14359890297055244, "clip_ratio/high_mean": 0.15771441347897053, "clip_ratio/high_max": 0.15771441347897053, "clip_ratio/region_mean": 0.30131331644952297, "reward_total_mean": 0.26016759872436523, "reward_meter_mean": 0.4667555093765259, "reward_meter_std": 0.39842984080314636, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9685021638870239, "reward_repeat_penalty_std": 0.04899715259671211, "reward_near_duplicate_penalty_mean": 0.981907844543457, "reward_near_duplicate_penalty_std": 0.027928875759243965, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.26016759872436523, "reward_total_composite_std": 0.23429597914218903} {"timestamp_utc": "2026-04-12T11:15:48Z", "mode": "train", "global_step": 142, "epoch": 0.00570349841346347, "loss": 0.159, "grad_norm": 15.81177043914795, "learning_rate": 9.572727272727273e-06, "num_tokens": 302747.0, "completions/mean_length": 57.625, "completions/min_length": 50.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.625, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.4928305745124817, "rewards/meter/std": 0.39109230041503906, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9955357313156128, "rewards/lexical_plausibility/std": 0.008266246877610683, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9902790784835815, "rewards/repeat_penalty/std": 0.0203789584338665, "rewards/near_duplicate_penalty/mean": 0.9971174597740173, "rewards/near_duplicate_penalty/std": 0.004312872886657715, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.21449744701385498, "rewards/total_composite/std": 0.18172529339790344, "reward": 0.21449744701385498, "reward_std": 0.18172527849674225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23863141238689423, "sampling/sampling_logp_difference/max": 1.5719995498657227, "sampling/importance_sampling_ratio/min": 0.20762960612773895, "sampling/importance_sampling_ratio/mean": 1.0410646200180054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.552950456738472, "clip_ratio/low_mean": 0.0867729727178812, "clip_ratio/low_min": 0.0867729727178812, "clip_ratio/high_mean": 0.11342363432049751, "clip_ratio/high_max": 0.11342363432049751, "clip_ratio/region_mean": 0.20019660703837872, "reward_total_mean": 0.21449744701385498, "reward_meter_mean": 0.4928305745124817, "reward_meter_std": 0.39109230041503906, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9955357313156128, "reward_lexical_plausibility_std": 0.008266246877610683, "reward_repeat_penalty_mean": 0.9902790784835815, "reward_repeat_penalty_std": 0.0203789584338665, "reward_near_duplicate_penalty_mean": 0.9971174597740173, "reward_near_duplicate_penalty_std": 0.004312872886657715, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.21449744701385498, "reward_total_composite_std": 0.18172529339790344} {"timestamp_utc": "2026-04-12T11:15:59Z", "mode": "train", "global_step": 143, "epoch": 0.0057436638952484236, "loss": 0.071, "grad_norm": 11.606022834777832, "learning_rate": 9.56969696969697e-06, "num_tokens": 305041.0, "completions/mean_length": 84.75, "completions/min_length": 69.0, "completions/max_length": 128.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.75, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.48728397488594055, "rewards/meter/std": 0.3431295156478882, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5324999690055847, "rewards/judge_quality/std": 0.21887701749801636, "rewards/repeat_penalty/mean": 0.9933649301528931, "rewards/repeat_penalty/std": 0.005677627865225077, "rewards/near_duplicate_penalty/mean": 0.9933649301528931, "rewards/near_duplicate_penalty/std": 0.005677627865225077, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23502235114574432, "rewards/total_composite/std": 0.14621780812740326, "reward": 0.23502235114574432, "reward_std": 0.14621782302856445, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22438229620456696, "sampling/sampling_logp_difference/max": 1.5458917617797852, "sampling/importance_sampling_ratio/min": 0.21312174201011658, "sampling/importance_sampling_ratio/mean": 1.0267876386642456, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5516919791698456, "clip_ratio/low_mean": 0.09482662566006184, "clip_ratio/low_min": 0.09482662566006184, "clip_ratio/high_mean": 0.10475712828338146, "clip_ratio/high_max": 0.10475712828338146, "clip_ratio/region_mean": 0.1995837539434433, "reward_total_mean": 0.23502235114574432, "reward_meter_mean": 0.48728397488594055, "reward_meter_std": 0.3431295156478882, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9933649301528931, "reward_repeat_penalty_std": 0.005677627865225077, "reward_near_duplicate_penalty_mean": 0.9933649301528931, "reward_near_duplicate_penalty_std": 0.005677627865225077, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5324999690055847, "reward_judge_quality_std": 0.21887701749801636, "reward_total_composite_mean": 0.23502235114574432, "reward_total_composite_std": 0.14621780812740326} {"timestamp_utc": "2026-04-12T11:16:08Z", "mode": "train", "global_step": 144, "epoch": 0.0057838293770333775, "loss": 0.0821, "grad_norm": 18.464693069458008, "learning_rate": 9.566666666666668e-06, "num_tokens": 306651.0, "completions/mean_length": 43.25, "completions/min_length": 31.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.7663955092430115, "rewards/meter/std": 0.35128188133239746, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9875808954238892, "rewards/lexical_plausibility/std": 0.035126470029354095, "rewards/judge_quality/mean": 0.6837499737739563, "rewards/judge_quality/std": 0.27871838212013245, "rewards/repeat_penalty/mean": 0.9908764958381653, "rewards/repeat_penalty/std": 0.014119063504040241, "rewards/near_duplicate_penalty/mean": 0.9908764958381653, "rewards/near_duplicate_penalty/std": 0.014119063504040241, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5276665091514587, "rewards/total_composite/std": 0.31427237391471863, "reward": 0.5276665091514587, "reward_std": 0.31427237391471863, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1817430704832077, "sampling/sampling_logp_difference/max": 1.4361786842346191, "sampling/importance_sampling_ratio/min": 0.2378348708152771, "sampling/importance_sampling_ratio/mean": 1.0461962223052979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7290900349617004, "clip_ratio/low_mean": 0.09043432958424091, "clip_ratio/low_min": 0.09043432958424091, "clip_ratio/high_mean": 0.077738793566823, "clip_ratio/high_max": 0.077738793566823, "clip_ratio/region_mean": 0.16817312315106392, "reward_total_mean": 0.5276665091514587, "reward_meter_mean": 0.7663955092430115, "reward_meter_std": 0.35128188133239746, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9875808954238892, "reward_lexical_plausibility_std": 0.035126470029354095, "reward_repeat_penalty_mean": 0.9908764958381653, "reward_repeat_penalty_std": 0.014119063504040241, "reward_near_duplicate_penalty_mean": 0.9908764958381653, "reward_near_duplicate_penalty_std": 0.014119063504040241, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6837499737739563, "reward_judge_quality_std": 0.27871838212013245, "reward_total_composite_mean": 0.5276665091514587, "reward_total_composite_std": 0.31427237391471863} {"timestamp_utc": "2026-04-12T11:16:19Z", "mode": "train", "global_step": 145, "epoch": 0.005823994858818331, "loss": -0.0265, "grad_norm": 11.207968711853027, "learning_rate": 9.563636363636365e-06, "num_tokens": 308810.0, "completions/mean_length": 88.875, "completions/min_length": 70.0, "completions/max_length": 121.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 88.875, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 121.0, "rewards/meter/mean": 0.6374506950378418, "rewards/meter/std": 0.33923736214637756, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9803248643875122, "rewards/lexical_plausibility/std": 0.03233964368700981, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9557034969329834, "rewards/repeat_penalty/std": 0.07959376275539398, "rewards/near_duplicate_penalty/mean": 0.9801782369613647, "rewards/near_duplicate_penalty/std": 0.027161359786987305, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9737154841423035, "rewards/distinct_2/std": 0.05863630771636963, "rewards/total_composite/mean": 0.20957598090171814, "rewards/total_composite/std": 0.1560916304588318, "reward": 0.20957598090171814, "reward_std": 0.15609164535999298, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22422216832637787, "sampling/sampling_logp_difference/max": 1.4223108291625977, "sampling/importance_sampling_ratio/min": 0.24115610122680664, "sampling/importance_sampling_ratio/mean": 1.0311670303344727, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.891635835170746, "clip_ratio/low_mean": 0.08123719692230225, "clip_ratio/low_min": 0.08123719692230225, "clip_ratio/high_mean": 0.09273464418947697, "clip_ratio/high_max": 0.09273464418947697, "clip_ratio/region_mean": 0.1739718411117792, "reward_total_mean": 0.20957598090171814, "reward_meter_mean": 0.6374506950378418, "reward_meter_std": 0.33923736214637756, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9803248643875122, "reward_lexical_plausibility_std": 0.03233964368700981, "reward_repeat_penalty_mean": 0.9557034969329834, "reward_repeat_penalty_std": 0.07959376275539398, "reward_near_duplicate_penalty_mean": 0.9801782369613647, "reward_near_duplicate_penalty_std": 0.027161359786987305, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9737154841423035, "reward_distinct_2_std": 0.05863630771636963, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.20957598090171814, "reward_total_composite_std": 0.1560916304588318} {"timestamp_utc": "2026-04-12T11:16:28Z", "mode": "train", "global_step": 146, "epoch": 0.005864160340603285, "loss": 0.0157, "grad_norm": 18.393598556518555, "learning_rate": 9.56060606060606e-06, "num_tokens": 310422.0, "completions/mean_length": 38.5, "completions/min_length": 31.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.9328004121780396, "rewards/meter/std": 0.07446634769439697, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9797683954238892, "rewards/lexical_plausibility/std": 0.03873474895954132, "rewards/judge_quality/mean": 0.4962500333786011, "rewards/judge_quality/std": 0.2371821254491806, "rewards/repeat_penalty/mean": 0.9964973330497742, "rewards/repeat_penalty/std": 0.0061165690422058105, "rewards/near_duplicate_penalty/mean": 0.9964973330497742, "rewards/near_duplicate_penalty/std": 0.0061165690422058105, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4638367295265198, "rewards/total_composite/std": 0.23023727536201477, "reward": 0.4638367295265198, "reward_std": 0.23023729026317596, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23962076008319855, "sampling/sampling_logp_difference/max": 1.4827651977539062, "sampling/importance_sampling_ratio/min": 0.2270091027021408, "sampling/importance_sampling_ratio/mean": 1.0683977603912354, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.1862524151802063, "clip_ratio/low_mean": 0.1564951315522194, "clip_ratio/low_min": 0.1564951315522194, "clip_ratio/high_mean": 0.05373218283057213, "clip_ratio/high_max": 0.05373218283057213, "clip_ratio/region_mean": 0.21022731438279152, "reward_total_mean": 0.4638367295265198, "reward_meter_mean": 0.9328004121780396, "reward_meter_std": 0.07446634769439697, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9797683954238892, "reward_lexical_plausibility_std": 0.03873474895954132, "reward_repeat_penalty_mean": 0.9964973330497742, "reward_repeat_penalty_std": 0.0061165690422058105, "reward_near_duplicate_penalty_mean": 0.9964973330497742, "reward_near_duplicate_penalty_std": 0.0061165690422058105, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962500333786011, "reward_judge_quality_std": 0.2371821254491806, "reward_total_composite_mean": 0.4638367295265198, "reward_total_composite_std": 0.23023727536201477} {"timestamp_utc": "2026-04-12T11:16:42Z", "mode": "train", "global_step": 147, "epoch": 0.005904325822388239, "loss": 0.0428, "grad_norm": 4.390659332275391, "learning_rate": 9.55757575757576e-06, "num_tokens": 315003.0, "completions/mean_length": 359.625, "completions/min_length": 319.0, "completions/max_length": 421.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 359.625, "completions/min_terminated_length": 319.0, "completions/max_terminated_length": 421.0, "rewards/meter/mean": 0.8243576288223267, "rewards/meter/std": 0.17478956282138824, "rewards/count_adherence/mean": 0.9416666626930237, "rewards/count_adherence/std": 0.06606874614953995, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9937499761581421, "rewards/lexical_plausibility/std": 0.01767767407000065, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9944760799407959, "rewards/repeat_penalty/std": 0.006702517159283161, "rewards/near_duplicate_penalty/mean": 0.9976387023925781, "rewards/near_duplicate_penalty/std": 0.0007780436426401138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9968271255493164, "rewards/distinct_2/std": 0.006180260796099901, "rewards/total_composite/mean": 0.1365898847579956, "rewards/total_composite/std": 0.1328396201133728, "reward": 0.1365898847579956, "reward_std": 0.132839635014534, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23052802681922913, "sampling/sampling_logp_difference/max": 1.9009475708007812, "sampling/importance_sampling_ratio/min": 0.14942696690559387, "sampling/importance_sampling_ratio/mean": 1.0586735010147095, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.92021045088768, "clip_ratio/low_mean": 0.07059000246226788, "clip_ratio/low_min": 0.07059000246226788, "clip_ratio/high_mean": 0.09842309728264809, "clip_ratio/high_max": 0.09842309728264809, "clip_ratio/region_mean": 0.16901309974491596, "reward_total_mean": 0.1365898847579956, "reward_meter_mean": 0.8243576288223267, "reward_meter_std": 0.17478956282138824, "reward_count_adherence_mean": 0.9416666626930237, "reward_count_adherence_std": 0.06606874614953995, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9937499761581421, "reward_lexical_plausibility_std": 0.01767767407000065, "reward_repeat_penalty_mean": 0.9944760799407959, "reward_repeat_penalty_std": 0.006702517159283161, "reward_near_duplicate_penalty_mean": 0.9976387023925781, "reward_near_duplicate_penalty_std": 0.0007780436426401138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9968271255493164, "reward_distinct_2_std": 0.006180260796099901, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1365898847579956, "reward_total_composite_std": 0.1328396201133728} {"timestamp_utc": "2026-04-12T11:16:52Z", "mode": "train", "global_step": 148, "epoch": 0.005944491304173193, "loss": 0.1382, "grad_norm": 12.24144458770752, "learning_rate": 9.554545454545455e-06, "num_tokens": 317081.0, "completions/mean_length": 79.75, "completions/min_length": 65.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.75, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.5113064646720886, "rewards/meter/std": 0.30903738737106323, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9957386255264282, "rewards/lexical_plausibility/std": 0.012052967213094234, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.996456503868103, "rewards/repeat_penalty/std": 0.004235151689499617, "rewards/near_duplicate_penalty/mean": 0.996456503868103, "rewards/near_duplicate_penalty/std": 0.004235151689499617, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15663936734199524, "rewards/total_composite/std": 0.11305032670497894, "reward": 0.15663936734199524, "reward_std": 0.11305032670497894, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23758473992347717, "sampling/sampling_logp_difference/max": 2.0828194618225098, "sampling/importance_sampling_ratio/min": 0.13883207738399506, "sampling/importance_sampling_ratio/mean": 1.038945198059082, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9721997678279877, "clip_ratio/low_mean": 0.11492341384291649, "clip_ratio/low_min": 0.11492341384291649, "clip_ratio/high_mean": 0.07696209475398064, "clip_ratio/high_max": 0.07696209475398064, "clip_ratio/region_mean": 0.19188550859689713, "reward_total_mean": 0.15663936734199524, "reward_meter_mean": 0.5113064646720886, "reward_meter_std": 0.30903738737106323, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9957386255264282, "reward_lexical_plausibility_std": 0.012052967213094234, "reward_repeat_penalty_mean": 0.996456503868103, "reward_repeat_penalty_std": 0.004235151689499617, "reward_near_duplicate_penalty_mean": 0.996456503868103, "reward_near_duplicate_penalty_std": 0.004235151689499617, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.15663936734199524, "reward_total_composite_std": 0.11305032670497894} {"timestamp_utc": "2026-04-12T11:17:01Z", "mode": "train", "global_step": 149, "epoch": 0.005984656785958147, "loss": 0.1713, "grad_norm": 24.899127960205078, "learning_rate": 9.551515151515152e-06, "num_tokens": 318752.0, "completions/mean_length": 22.875, "completions/min_length": 16.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.6699537038803101, "rewards/meter/std": 0.4266339838504791, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9975490570068359, "rewards/lexical_plausibility/std": 0.006932419259101152, "rewards/judge_quality/mean": 0.7637500166893005, "rewards/judge_quality/std": 0.3218667507171631, "rewards/repeat_penalty/mean": 0.7194664478302002, "rewards/repeat_penalty/std": 0.02592424489557743, "rewards/near_duplicate_penalty/mean": 0.9592885971069336, "rewards/near_duplicate_penalty/std": 0.03456565737724304, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.572995662689209, "rewards/total_composite/std": 0.4193941056728363, "reward": 0.572995662689209, "reward_std": 0.4193940758705139, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15369386970996857, "sampling/sampling_logp_difference/max": 1.276634693145752, "sampling/importance_sampling_ratio/min": 0.2789745330810547, "sampling/importance_sampling_ratio/mean": 1.0236783027648926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3106824792921543, "clip_ratio/low_mean": 0.05043184058740735, "clip_ratio/low_min": 0.05043184058740735, "clip_ratio/high_mean": 0.07421875, "clip_ratio/high_max": 0.07421875, "clip_ratio/region_mean": 0.12465059058740735, "reward_total_mean": 0.572995662689209, "reward_meter_mean": 0.6699537038803101, "reward_meter_std": 0.4266339838504791, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9975490570068359, "reward_lexical_plausibility_std": 0.006932419259101152, "reward_repeat_penalty_mean": 0.7194664478302002, "reward_repeat_penalty_std": 0.02592424489557743, "reward_near_duplicate_penalty_mean": 0.9592885971069336, "reward_near_duplicate_penalty_std": 0.03456565737724304, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7637500166893005, "reward_judge_quality_std": 0.3218667507171631, "reward_total_composite_mean": 0.572995662689209, "reward_total_composite_std": 0.4193941056728363} {"timestamp_utc": "2026-04-12T11:17:10Z", "mode": "train", "global_step": 150, "epoch": 0.006024822267743102, "loss": 0.0102, "grad_norm": 12.77075481414795, "learning_rate": 9.54848484848485e-06, "num_tokens": 320410.0, "completions/mean_length": 49.25, "completions/min_length": 39.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.25, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7772743701934814, "rewards/meter/std": 0.3536442816257477, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9507493376731873, "rewards/repeat_penalty/std": 0.13930194079875946, "rewards/near_duplicate_penalty/mean": 0.990851879119873, "rewards/near_duplicate_penalty/std": 0.02587468922138214, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.3888828456401825, "rewards/total_composite/std": 0.2589547634124756, "reward": 0.3888828456401825, "reward_std": 0.2589547634124756, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20877063274383545, "sampling/sampling_logp_difference/max": 1.5486278533935547, "sampling/importance_sampling_ratio/min": 0.2125394195318222, "sampling/importance_sampling_ratio/mean": 1.0580813884735107, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.122045159339905, "clip_ratio/low_mean": 0.08299900777637959, "clip_ratio/low_min": 0.08299900777637959, "clip_ratio/high_mean": 0.06708143837749958, "clip_ratio/high_max": 0.06708143837749958, "clip_ratio/region_mean": 0.15008044615387917, "reward_total_mean": 0.3888828456401825, "reward_meter_mean": 0.7772743701934814, "reward_meter_std": 0.3536442816257477, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9507493376731873, "reward_repeat_penalty_std": 0.13930194079875946, "reward_near_duplicate_penalty_mean": 0.990851879119873, "reward_near_duplicate_penalty_std": 0.02587468922138214, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.3888828456401825, "reward_total_composite_std": 0.2589547634124756} {"timestamp_utc": "2026-04-12T11:19:26Z", "mode": "eval", "global_step": 150, "epoch": 0.006024822267743102, "eval_loss": NaN, "eval_runtime": 135.8684, "eval_samples_per_second": 0.765, "eval_steps_per_second": 0.096, "eval_num_tokens": 320410.0, "eval_completions/mean_length": 157.42307692307693, "eval_completions/min_length": 39.53846153846154, "eval_completions/max_length": 349.84615384615387, "eval_completions/clipped_ratio": 0.009615384615384616, "eval_completions/mean_terminated_length": 153.90934166541467, "eval_completions/min_terminated_length": 39.53846153846154, "eval_completions/max_terminated_length": 332.6923076923077, "eval_rewards/meter/mean": 0.4222999421449808, "eval_rewards/meter/std": 0.3532765622322376, "eval_rewards/count_adherence/mean": 0.9509367025815524, "eval_rewards/count_adherence/std": 0.06137575008548223, "eval_rewards/arabic_clean/mean": 0.8557692307692307, "eval_rewards/arabic_clean/std": 0.29103099841337937, "eval_rewards/lexical_plausibility/mean": 0.9822093019118676, "eval_rewards/lexical_plausibility/std": 0.037934203882916614, "eval_rewards/judge_quality/mean": 0.3713461515995172, "eval_rewards/judge_quality/std": 0.1981737602215547, "eval_rewards/repeat_penalty/mean": 0.9721828103065491, "eval_rewards/repeat_penalty/std": 0.0459989532828331, "eval_rewards/near_duplicate_penalty/mean": 0.9884350712482746, "eval_rewards/near_duplicate_penalty/std": 0.015634029432056613, "eval_rewards/opening_diversity/mean": 0.9927884615384616, "eval_rewards/opening_diversity/std": 0.020397310646680687, "eval_rewards/distinct_2/mean": 0.9909096543605511, "eval_rewards/distinct_2/std": 0.020599648750458773, "eval_rewards/total_composite/mean": 0.13668288147220245, "eval_rewards/total_composite/std": 0.16516263782978058, "eval_reward": 0.13668288147220245, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.16735697021851173, "eval_sampling/sampling_logp_difference/max": 1.3967525775615985, "eval_sampling/importance_sampling_ratio/min": 0.2492638390797835, "eval_sampling/importance_sampling_ratio/mean": 1.0539659078304584, "eval_sampling/importance_sampling_ratio/max": 1.7433728346457849, "eval_entropy": 2.9130990413519053, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.13668288147220245, "eval_reward_meter_mean": 0.4222999421449808, "eval_reward_meter_std": 0.3532765622322376, "eval_reward_count_adherence_mean": 0.9509367025815524, "eval_reward_count_adherence_std": 0.06137575008548223, "eval_reward_arabic_clean_mean": 0.8557692307692307, "eval_reward_arabic_clean_std": 0.29103099841337937, "eval_reward_lexical_plausibility_mean": 0.9822093019118676, "eval_reward_lexical_plausibility_std": 0.037934203882916614, "eval_reward_repeat_penalty_mean": 0.9721828103065491, "eval_reward_repeat_penalty_std": 0.0459989532828331, "eval_reward_near_duplicate_penalty_mean": 0.9884350712482746, "eval_reward_near_duplicate_penalty_std": 0.015634029432056613, "eval_reward_opening_diversity_mean": 0.9927884615384616, "eval_reward_opening_diversity_std": 0.020397310646680687, "eval_reward_distinct_2_mean": 0.9909096543605511, "eval_reward_distinct_2_std": 0.020599648750458773, "eval_reward_judge_quality_mean": 0.3713461515995172, "eval_reward_judge_quality_std": 0.1981737602215547, "eval_reward_total_composite_mean": 0.13668288147220245, "eval_reward_total_composite_std": 0.16516263782978058} {"timestamp_utc": "2026-04-12T11:19:39Z", "mode": "train", "global_step": 151, "epoch": 0.006064987749528056, "loss": -0.0141, "grad_norm": 14.000923156738281, "learning_rate": 9.545454545454547e-06, "num_tokens": 321978.0, "completions/mean_length": 45.0, "completions/min_length": 31.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6058230996131897, "rewards/meter/std": 0.43810972571372986, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6799999475479126, "rewards/judge_quality/std": 0.2747986316680908, "rewards/repeat_penalty/mean": 0.9692283868789673, "rewards/repeat_penalty/std": 0.03055117465555668, "rewards/near_duplicate_penalty/mean": 0.9692283868789673, "rewards/near_duplicate_penalty/std": 0.03055117465555668, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45389193296432495, "rewards/total_composite/std": 0.40621599555015564, "reward": 0.45389193296432495, "reward_std": 0.40621596574783325, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.200367271900177, "sampling/sampling_logp_difference/max": 1.2588658332824707, "sampling/importance_sampling_ratio/min": 0.28397589921951294, "sampling/importance_sampling_ratio/mean": 1.0334672927856445, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9045850485563278, "clip_ratio/low_mean": 0.13465113565325737, "clip_ratio/low_min": 0.13465113565325737, "clip_ratio/high_mean": 0.0493504973128438, "clip_ratio/high_max": 0.0493504973128438, "clip_ratio/region_mean": 0.18400163296610117, "reward_total_mean": 0.45389193296432495, "reward_meter_mean": 0.6058230996131897, "reward_meter_std": 0.43810972571372986, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9692283868789673, "reward_repeat_penalty_std": 0.03055117465555668, "reward_near_duplicate_penalty_mean": 0.9692283868789673, "reward_near_duplicate_penalty_std": 0.03055117465555668, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6799999475479126, "reward_judge_quality_std": 0.2747986316680908, "reward_total_composite_mean": 0.45389193296432495, "reward_total_composite_std": 0.40621599555015564} {"timestamp_utc": "2026-04-12T11:19:49Z", "mode": "train", "global_step": 152, "epoch": 0.00610515323131301, "loss": 0.0195, "grad_norm": 8.529622077941895, "learning_rate": 9.542424242424242e-06, "num_tokens": 324395.0, "completions/mean_length": 111.125, "completions/min_length": 99.0, "completions/max_length": 129.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.125, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 129.0, "rewards/meter/mean": 0.8794379234313965, "rewards/meter/std": 0.19269824028015137, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9983552694320679, "rewards/lexical_plausibility/std": 0.004652021918445826, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9949206709861755, "rewards/repeat_penalty/std": 0.0037612332962453365, "rewards/near_duplicate_penalty/mean": 0.9949206709861755, "rewards/near_duplicate_penalty/std": 0.0037612332962453365, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20532241463661194, "rewards/total_composite/std": 0.1613740772008896, "reward": 0.20532241463661194, "reward_std": 0.16137409210205078, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21348437666893005, "sampling/sampling_logp_difference/max": 1.2490053176879883, "sampling/importance_sampling_ratio/min": 0.2867899239063263, "sampling/importance_sampling_ratio/mean": 1.0697646141052246, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0969585478305817, "clip_ratio/low_mean": 0.07440471276640892, "clip_ratio/low_min": 0.07440471276640892, "clip_ratio/high_mean": 0.08561559952795506, "clip_ratio/high_max": 0.08561559952795506, "clip_ratio/region_mean": 0.16002031229436398, "reward_total_mean": 0.20532241463661194, "reward_meter_mean": 0.8794379234313965, "reward_meter_std": 0.19269824028015137, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9983552694320679, "reward_lexical_plausibility_std": 0.004652021918445826, "reward_repeat_penalty_mean": 0.9949206709861755, "reward_repeat_penalty_std": 0.0037612332962453365, "reward_near_duplicate_penalty_mean": 0.9949206709861755, "reward_near_duplicate_penalty_std": 0.0037612332962453365, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.20532241463661194, "reward_total_composite_std": 0.1613740772008896} {"timestamp_utc": "2026-04-12T11:20:00Z", "mode": "train", "global_step": 153, "epoch": 0.006145318713097964, "loss": 0.0369, "grad_norm": 9.671324729919434, "learning_rate": 9.539393939393941e-06, "num_tokens": 326571.0, "completions/mean_length": 93.0, "completions/min_length": 68.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.5104454159736633, "rewards/meter/std": 0.2965039014816284, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9899665713310242, "rewards/lexical_plausibility/std": 0.028378864750266075, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9915590882301331, "rewards/repeat_penalty/std": 0.015696531161665916, "rewards/near_duplicate_penalty/mean": 0.9962067008018494, "rewards/near_duplicate_penalty/std": 0.004112233407795429, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.995309591293335, "rewards/distinct_2/std": 0.013266542926430702, "rewards/total_composite/mean": 0.11554411798715591, "rewards/total_composite/std": 0.11518596112728119, "reward": 0.11554411798715591, "reward_std": 0.11518596857786179, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23454831540584564, "sampling/sampling_logp_difference/max": 2.2007312774658203, "sampling/importance_sampling_ratio/min": 0.11072216182947159, "sampling/importance_sampling_ratio/mean": 1.035933256149292, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.980690121650696, "clip_ratio/low_mean": 0.13396853860467672, "clip_ratio/low_min": 0.13396853860467672, "clip_ratio/high_mean": 0.05198572017252445, "clip_ratio/high_max": 0.05198572017252445, "clip_ratio/region_mean": 0.18595425877720118, "reward_total_mean": 0.11554411798715591, "reward_meter_mean": 0.5104454159736633, "reward_meter_std": 0.2965039014816284, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9899665713310242, "reward_lexical_plausibility_std": 0.028378864750266075, "reward_repeat_penalty_mean": 0.9915590882301331, "reward_repeat_penalty_std": 0.015696531161665916, "reward_near_duplicate_penalty_mean": 0.9962067008018494, "reward_near_duplicate_penalty_std": 0.004112233407795429, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.995309591293335, "reward_distinct_2_std": 0.013266542926430702, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.11554411798715591, "reward_total_composite_std": 0.11518596112728119} {"timestamp_utc": "2026-04-12T11:20:10Z", "mode": "train", "global_step": 154, "epoch": 0.006185484194882918, "loss": 0.0103, "grad_norm": 20.035627365112305, "learning_rate": 9.536363636363637e-06, "num_tokens": 328056.0, "completions/mean_length": 25.625, "completions/min_length": 17.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.625, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.7828391790390015, "rewards/meter/std": 0.30151939392089844, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8999863862991333, "rewards/lexical_plausibility/std": 0.11114007234573364, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26569312810897827, "rewards/total_composite/std": 0.15375202894210815, "reward": 0.26569312810897827, "reward_std": 0.15375201404094696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2073061317205429, "sampling/sampling_logp_difference/max": 1.3186922073364258, "sampling/importance_sampling_ratio/min": 0.2674849033355713, "sampling/importance_sampling_ratio/mean": 1.0439095497131348, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5544720590114594, "clip_ratio/low_mean": 0.060484389774501324, "clip_ratio/low_min": 0.060484389774501324, "clip_ratio/high_mean": 0.13336967583745718, "clip_ratio/high_max": 0.13336967583745718, "clip_ratio/region_mean": 0.1938540656119585, "reward_total_mean": 0.26569312810897827, "reward_meter_mean": 0.7828391790390015, "reward_meter_std": 0.30151939392089844, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8999863862991333, "reward_lexical_plausibility_std": 0.11114007234573364, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.26569312810897827, "reward_total_composite_std": 0.15375202894210815} {"timestamp_utc": "2026-04-12T11:20:19Z", "mode": "train", "global_step": 155, "epoch": 0.006225649676667872, "loss": 0.158, "grad_norm": 17.03345489501953, "learning_rate": 9.533333333333334e-06, "num_tokens": 329831.0, "completions/mean_length": 38.875, "completions/min_length": 18.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.32180482149124146, "rewards/meter/std": 0.37046319246292114, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.6112217903137207, "rewards/lexical_plausibility/std": 0.2747129499912262, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3296508193016052, "rewards/repeat_penalty/mean": 0.8932257890701294, "rewards/repeat_penalty/std": 0.15036876499652863, "rewards/near_duplicate_penalty/mean": 0.9934245347976685, "rewards/near_duplicate_penalty/std": 0.01804819144308567, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.13939277827739716, "rewards/total_composite/std": 0.16900645196437836, "reward": 0.13939277827739716, "reward_std": 0.16900645196437836, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.228168785572052, "sampling/sampling_logp_difference/max": 1.8393783569335938, "sampling/importance_sampling_ratio/min": 0.158916175365448, "sampling/importance_sampling_ratio/mean": 1.0233756303787231, "sampling/importance_sampling_ratio/max": 1.908592700958252, "entropy": 2.470901608467102, "clip_ratio/low_mean": 0.11315600201487541, "clip_ratio/low_min": 0.11315600201487541, "clip_ratio/high_mean": 0.09409722313284874, "clip_ratio/high_max": 0.09409722313284874, "clip_ratio/region_mean": 0.20725322514772415, "reward_total_mean": 0.13939277827739716, "reward_meter_mean": 0.32180482149124146, "reward_meter_std": 0.37046319246292114, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.6112217903137207, "reward_lexical_plausibility_std": 0.2747129499912262, "reward_repeat_penalty_mean": 0.8932257890701294, "reward_repeat_penalty_std": 0.15036876499652863, "reward_near_duplicate_penalty_mean": 0.9934245347976685, "reward_near_duplicate_penalty_std": 0.01804819144308567, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3296508193016052, "reward_total_composite_mean": 0.13939277827739716, "reward_total_composite_std": 0.16900645196437836} {"timestamp_utc": "2026-04-12T11:20:30Z", "mode": "train", "global_step": 156, "epoch": 0.006265815158452826, "loss": -0.0176, "grad_norm": 11.074264526367188, "learning_rate": 9.530303030303031e-06, "num_tokens": 331924.0, "completions/mean_length": 78.625, "completions/min_length": 70.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 78.625, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.47446614503860474, "rewards/meter/std": 0.16489452123641968, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9808568358421326, "rewards/repeat_penalty/std": 0.017523130401968956, "rewards/near_duplicate_penalty/mean": 0.9856008887290955, "rewards/near_duplicate_penalty/std": 0.011811843141913414, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.995192289352417, "rewards/distinct_2/std": 0.013598216697573662, "rewards/total_composite/mean": 0.1452259123325348, "rewards/total_composite/std": 0.0769054964184761, "reward": 0.1452259123325348, "reward_std": 0.07690548896789551, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22640937566757202, "sampling/sampling_logp_difference/max": 1.5695104598999023, "sampling/importance_sampling_ratio/min": 0.2081470489501953, "sampling/importance_sampling_ratio/mean": 1.0527526140213013, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.949790358543396, "clip_ratio/low_mean": 0.07967651262879372, "clip_ratio/low_min": 0.07967651262879372, "clip_ratio/high_mean": 0.12765267305076122, "clip_ratio/high_max": 0.12765267305076122, "clip_ratio/region_mean": 0.20732918567955494, "reward_total_mean": 0.1452259123325348, "reward_meter_mean": 0.47446614503860474, "reward_meter_std": 0.16489452123641968, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9808568358421326, "reward_repeat_penalty_std": 0.017523130401968956, "reward_near_duplicate_penalty_mean": 0.9856008887290955, "reward_near_duplicate_penalty_std": 0.011811843141913414, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.995192289352417, "reward_distinct_2_std": 0.013598216697573662, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1452259123325348, "reward_total_composite_std": 0.0769054964184761} {"timestamp_utc": "2026-04-12T11:20:39Z", "mode": "train", "global_step": 157, "epoch": 0.0063059806402377796, "loss": 0.1223, "grad_norm": 24.670238494873047, "learning_rate": 9.527272727272729e-06, "num_tokens": 333224.0, "completions/mean_length": 20.5, "completions/min_length": 17.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.8423395156860352, "rewards/meter/std": 0.34059402346611023, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8350000381469727, "rewards/judge_quality/std": 0.27717968821525574, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.690671980381012, "rewards/total_composite/std": 0.38380205631256104, "reward": 0.690671980381012, "reward_std": 0.38380205631256104, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1779317408800125, "sampling/sampling_logp_difference/max": 1.5056533813476562, "sampling/importance_sampling_ratio/min": 0.22187228500843048, "sampling/importance_sampling_ratio/mean": 1.0350496768951416, "sampling/importance_sampling_ratio/max": 1.829878568649292, "entropy": 1.6537972539663315, "clip_ratio/low_mean": 0.033409091643989086, "clip_ratio/low_min": 0.033409091643989086, "clip_ratio/high_mean": 0.08769813040271401, "clip_ratio/high_max": 0.08769813040271401, "clip_ratio/region_mean": 0.1211072220467031, "reward_total_mean": 0.690671980381012, "reward_meter_mean": 0.8423395156860352, "reward_meter_std": 0.34059402346611023, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8350000381469727, "reward_judge_quality_std": 0.27717968821525574, "reward_total_composite_mean": 0.690671980381012, "reward_total_composite_std": 0.38380205631256104} {"timestamp_utc": "2026-04-12T11:20:50Z", "mode": "train", "global_step": 158, "epoch": 0.0063461461220227335, "loss": 0.0628, "grad_norm": 12.094988822937012, "learning_rate": 9.524242424242424e-06, "num_tokens": 335028.0, "completions/mean_length": 65.5, "completions/min_length": 30.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.5528392195701599, "rewards/meter/std": 0.39363592863082886, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9114699363708496, "rewards/lexical_plausibility/std": 0.16236990690231323, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9983820915222168, "rewards/repeat_penalty/std": 0.0038890535943210125, "rewards/near_duplicate_penalty/mean": 0.9983820915222168, "rewards/near_duplicate_penalty/std": 0.0038890535943210125, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11301341652870178, "rewards/total_composite/std": 0.10902532935142517, "reward": 0.11301341652870178, "reward_std": 0.10902532935142517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23686851561069489, "sampling/sampling_logp_difference/max": 1.5974016189575195, "sampling/importance_sampling_ratio/min": 0.20242181420326233, "sampling/importance_sampling_ratio/mean": 1.0388325452804565, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.01512011885643, "clip_ratio/low_mean": 0.1251815352588892, "clip_ratio/low_min": 0.1251815352588892, "clip_ratio/high_mean": 0.08592366427183151, "clip_ratio/high_max": 0.08592366427183151, "clip_ratio/region_mean": 0.2111051995307207, "reward_total_mean": 0.11301341652870178, "reward_meter_mean": 0.5528392195701599, "reward_meter_std": 0.39363592863082886, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9114699363708496, "reward_lexical_plausibility_std": 0.16236990690231323, "reward_repeat_penalty_mean": 0.9983820915222168, "reward_repeat_penalty_std": 0.0038890535943210125, "reward_near_duplicate_penalty_mean": 0.9983820915222168, "reward_near_duplicate_penalty_std": 0.0038890535943210125, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.11301341652870178, "reward_total_composite_std": 0.10902532935142517} {"timestamp_utc": "2026-04-12T11:20:59Z", "mode": "train", "global_step": 159, "epoch": 0.006386311603807687, "loss": 0.0045, "grad_norm": 13.970623970031738, "learning_rate": 9.521212121212121e-06, "num_tokens": 337020.0, "completions/mean_length": 44.0, "completions/min_length": 33.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7165439128875732, "rewards/meter/std": 0.3721120059490204, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4587499797344208, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9932456016540527, "rewards/repeat_penalty/std": 0.009441905654966831, "rewards/near_duplicate_penalty/mean": 0.9932456016540527, "rewards/near_duplicate_penalty/std": 0.009441905654966831, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3526611328125, "rewards/total_composite/std": 0.267297625541687, "reward": 0.3526611328125, "reward_std": 0.267297625541687, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17874982953071594, "sampling/sampling_logp_difference/max": 1.375375747680664, "sampling/importance_sampling_ratio/min": 0.2527446150779724, "sampling/importance_sampling_ratio/mean": 1.0489211082458496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8119719177484512, "clip_ratio/low_mean": 0.10304794274270535, "clip_ratio/low_min": 0.10304794274270535, "clip_ratio/high_mean": 0.06766779348254204, "clip_ratio/high_max": 0.06766779348254204, "clip_ratio/region_mean": 0.17071573622524738, "reward_total_mean": 0.3526611328125, "reward_meter_mean": 0.7165439128875732, "reward_meter_std": 0.3721120059490204, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9932456016540527, "reward_repeat_penalty_std": 0.009441905654966831, "reward_near_duplicate_penalty_mean": 0.9932456016540527, "reward_near_duplicate_penalty_std": 0.009441905654966831, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4587499797344208, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.3526611328125, "reward_total_composite_std": 0.267297625541687} {"timestamp_utc": "2026-04-12T11:21:11Z", "mode": "train", "global_step": 160, "epoch": 0.006426477085592641, "loss": -0.0205, "grad_norm": 15.368523597717285, "learning_rate": 9.518181818181819e-06, "num_tokens": 338994.0, "completions/mean_length": 65.75, "completions/min_length": 47.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.75, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.3450881838798523, "rewards/meter/std": 0.24610362946987152, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9259542226791382, "rewards/lexical_plausibility/std": 0.1133645623922348, "rewards/judge_quality/mean": 0.3712499737739563, "rewards/judge_quality/std": 0.23943014442920685, "rewards/repeat_penalty/mean": 0.9626677632331848, "rewards/repeat_penalty/std": 0.04355334863066673, "rewards/near_duplicate_penalty/mean": 0.9872620105743408, "rewards/near_duplicate_penalty/std": 0.011765980161726475, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9748167991638184, "rewards/distinct_2/std": 0.03487076237797737, "rewards/total_composite/mean": 0.09414747357368469, "rewards/total_composite/std": 0.05192834511399269, "reward": 0.09414747357368469, "reward_std": 0.05192834511399269, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19198961555957794, "sampling/sampling_logp_difference/max": 1.6694979667663574, "sampling/importance_sampling_ratio/min": 0.18834158778190613, "sampling/importance_sampling_ratio/mean": 1.0056805610656738, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3271846771240234, "clip_ratio/low_mean": 0.1068890830501914, "clip_ratio/low_min": 0.1068890830501914, "clip_ratio/high_mean": 0.07343112863600254, "clip_ratio/high_max": 0.07343112863600254, "clip_ratio/region_mean": 0.18032021168619394, "reward_total_mean": 0.09414747357368469, "reward_meter_mean": 0.3450881838798523, "reward_meter_std": 0.24610362946987152, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9259542226791382, "reward_lexical_plausibility_std": 0.1133645623922348, "reward_repeat_penalty_mean": 0.9626677632331848, "reward_repeat_penalty_std": 0.04355334863066673, "reward_near_duplicate_penalty_mean": 0.9872620105743408, "reward_near_duplicate_penalty_std": 0.011765980161726475, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9748167991638184, "reward_distinct_2_std": 0.03487076237797737, "reward_judge_quality_mean": 0.3712499737739563, "reward_judge_quality_std": 0.23943014442920685, "reward_total_composite_mean": 0.09414747357368469, "reward_total_composite_std": 0.05192834511399269} {"timestamp_utc": "2026-04-12T11:21:21Z", "mode": "train", "global_step": 161, "epoch": 0.006466642567377595, "loss": 0.0945, "grad_norm": 12.157179832458496, "learning_rate": 9.515151515151516e-06, "num_tokens": 340967.0, "completions/mean_length": 68.625, "completions/min_length": 57.0, "completions/max_length": 91.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.625, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.8782539367675781, "rewards/meter/std": 0.16990414261817932, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9693520069122314, "rewards/lexical_plausibility/std": 0.07608518749475479, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.1642080545425415, "rewards/repeat_penalty/mean": 0.9892227649688721, "rewards/repeat_penalty/std": 0.009906812570989132, "rewards/near_duplicate_penalty/mean": 0.9892227649688721, "rewards/near_duplicate_penalty/std": 0.009906812570989132, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32068121433258057, "rewards/total_composite/std": 0.14033915102481842, "reward": 0.32068121433258057, "reward_std": 0.14033915102481842, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22978489100933075, "sampling/sampling_logp_difference/max": 1.396162509918213, "sampling/importance_sampling_ratio/min": 0.24754510819911957, "sampling/importance_sampling_ratio/mean": 1.043877124786377, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8486823439598083, "clip_ratio/low_mean": 0.05545760318636894, "clip_ratio/low_min": 0.05545760318636894, "clip_ratio/high_mean": 0.15594460628926754, "clip_ratio/high_max": 0.15594460628926754, "clip_ratio/region_mean": 0.21140220947563648, "reward_total_mean": 0.32068121433258057, "reward_meter_mean": 0.8782539367675781, "reward_meter_std": 0.16990414261817932, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9693520069122314, "reward_lexical_plausibility_std": 0.07608518749475479, "reward_repeat_penalty_mean": 0.9892227649688721, "reward_repeat_penalty_std": 0.009906812570989132, "reward_near_duplicate_penalty_mean": 0.9892227649688721, "reward_near_duplicate_penalty_std": 0.009906812570989132, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.1642080545425415, "reward_total_composite_mean": 0.32068121433258057, "reward_total_composite_std": 0.14033915102481842} {"timestamp_utc": "2026-04-12T11:21:32Z", "mode": "train", "global_step": 162, "epoch": 0.00650680804916255, "loss": 0.1007, "grad_norm": 7.251101016998291, "learning_rate": 9.512121212121213e-06, "num_tokens": 344016.0, "completions/mean_length": 173.125, "completions/min_length": 147.0, "completions/max_length": 200.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 173.125, "completions/min_terminated_length": 147.0, "completions/max_terminated_length": 200.0, "rewards/meter/mean": 0.6534852981567383, "rewards/meter/std": 0.37754520773887634, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9472790956497192, "rewards/lexical_plausibility/std": 0.0891343355178833, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9930524826049805, "rewards/repeat_penalty/std": 0.0058747329749166965, "rewards/near_duplicate_penalty/mean": 0.995485782623291, "rewards/near_duplicate_penalty/std": 0.0031709817703813314, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.997565746307373, "rewards/distinct_2/std": 0.006885172799229622, "rewards/total_composite/mean": 0.18729378283023834, "rewards/total_composite/std": 0.1243356391787529, "reward": 0.18729378283023834, "reward_std": 0.1243356391787529, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23811013996601105, "sampling/sampling_logp_difference/max": 1.5276861190795898, "sampling/importance_sampling_ratio/min": 0.21703729033470154, "sampling/importance_sampling_ratio/mean": 1.0599641799926758, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.803977072238922, "clip_ratio/low_mean": 0.06561482138931751, "clip_ratio/low_min": 0.06561482138931751, "clip_ratio/high_mean": 0.14769021049141884, "clip_ratio/high_max": 0.14769021049141884, "clip_ratio/region_mean": 0.21330503188073635, "reward_total_mean": 0.18729378283023834, "reward_meter_mean": 0.6534852981567383, "reward_meter_std": 0.37754520773887634, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9472790956497192, "reward_lexical_plausibility_std": 0.0891343355178833, "reward_repeat_penalty_mean": 0.9930524826049805, "reward_repeat_penalty_std": 0.0058747329749166965, "reward_near_duplicate_penalty_mean": 0.995485782623291, "reward_near_duplicate_penalty_std": 0.0031709817703813314, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.997565746307373, "reward_distinct_2_std": 0.006885172799229622, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.18729378283023834, "reward_total_composite_std": 0.1243356391787529} {"timestamp_utc": "2026-04-12T11:21:42Z", "mode": "train", "global_step": 163, "epoch": 0.006546973530947504, "loss": 0.0867, "grad_norm": 15.229354858398438, "learning_rate": 9.50909090909091e-06, "num_tokens": 345639.0, "completions/mean_length": 42.875, "completions/min_length": 37.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.605192244052887, "rewards/meter/std": 0.34179389476776123, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9881524443626404, "rewards/lexical_plausibility/std": 0.01754402369260788, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.9992201328277588, "rewards/repeat_penalty/std": 0.0022057765163481236, "rewards/near_duplicate_penalty/mean": 0.9992201328277588, "rewards/near_duplicate_penalty/std": 0.0022057765163481236, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2018437683582306, "rewards/total_composite/std": 0.16896285116672516, "reward": 0.2018437683582306, "reward_std": 0.16896285116672516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23416592180728912, "sampling/sampling_logp_difference/max": 1.3484859466552734, "sampling/importance_sampling_ratio/min": 0.25963306427001953, "sampling/importance_sampling_ratio/mean": 1.040067195892334, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.308599442243576, "clip_ratio/low_mean": 0.10402058809995651, "clip_ratio/low_min": 0.10402058809995651, "clip_ratio/high_mean": 0.1089235981926322, "clip_ratio/high_max": 0.1089235981926322, "clip_ratio/region_mean": 0.2129441862925887, "reward_total_mean": 0.2018437683582306, "reward_meter_mean": 0.605192244052887, "reward_meter_std": 0.34179389476776123, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9881524443626404, "reward_lexical_plausibility_std": 0.01754402369260788, "reward_repeat_penalty_mean": 0.9992201328277588, "reward_repeat_penalty_std": 0.0022057765163481236, "reward_near_duplicate_penalty_mean": 0.9992201328277588, "reward_near_duplicate_penalty_std": 0.0022057765163481236, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.2018437683582306, "reward_total_composite_std": 0.16896285116672516} {"timestamp_utc": "2026-04-12T11:21:52Z", "mode": "train", "global_step": 164, "epoch": 0.006587139012732458, "loss": 0.0515, "grad_norm": 16.58517837524414, "learning_rate": 9.506060606060606e-06, "num_tokens": 347431.0, "completions/mean_length": 47.0, "completions/min_length": 34.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.3476116955280304, "rewards/meter/std": 0.31187713146209717, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9825247526168823, "rewards/lexical_plausibility/std": 0.028884755447506905, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9899319410324097, "rewards/repeat_penalty/std": 0.015661869198083878, "rewards/near_duplicate_penalty/mean": 0.9899319410324097, "rewards/near_duplicate_penalty/std": 0.015661869198083878, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21823325753211975, "rewards/total_composite/std": 0.23379917442798615, "reward": 0.21823325753211975, "reward_std": 0.23379915952682495, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23287346959114075, "sampling/sampling_logp_difference/max": 1.274601936340332, "sampling/importance_sampling_ratio/min": 0.2795422077178955, "sampling/importance_sampling_ratio/mean": 1.0410550832748413, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.10340116918087, "clip_ratio/low_mean": 0.12830465659499168, "clip_ratio/low_min": 0.12830465659499168, "clip_ratio/high_mean": 0.07553191483020782, "clip_ratio/high_max": 0.07553191483020782, "clip_ratio/region_mean": 0.2038365714251995, "reward_total_mean": 0.21823325753211975, "reward_meter_mean": 0.3476116955280304, "reward_meter_std": 0.31187713146209717, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9825247526168823, "reward_lexical_plausibility_std": 0.028884755447506905, "reward_repeat_penalty_mean": 0.9899319410324097, "reward_repeat_penalty_std": 0.015661869198083878, "reward_near_duplicate_penalty_mean": 0.9899319410324097, "reward_near_duplicate_penalty_std": 0.015661869198083878, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.21823325753211975, "reward_total_composite_std": 0.23379917442798615} {"timestamp_utc": "2026-04-12T11:22:03Z", "mode": "train", "global_step": 165, "epoch": 0.006627304494517412, "loss": 0.1233, "grad_norm": 8.282011032104492, "learning_rate": 9.503030303030303e-06, "num_tokens": 349894.0, "completions/mean_length": 130.875, "completions/min_length": 110.0, "completions/max_length": 231.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 130.875, "completions/min_terminated_length": 110.0, "completions/max_terminated_length": 231.0, "rewards/meter/mean": 0.7863786816596985, "rewards/meter/std": 0.2986995279788971, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9920691251754761, "rewards/lexical_plausibility/std": 0.018583906814455986, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9819804430007935, "rewards/repeat_penalty/std": 0.02719215303659439, "rewards/near_duplicate_penalty/mean": 0.9935469627380371, "rewards/near_duplicate_penalty/std": 0.006173244211822748, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9882498979568481, "rewards/distinct_2/std": 0.02176465094089508, "rewards/total_composite/mean": 0.22972571849822998, "rewards/total_composite/std": 0.15144440531730652, "reward": 0.22972571849822998, "reward_std": 0.15144439041614532, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23464597761631012, "sampling/sampling_logp_difference/max": 1.9085321426391602, "sampling/importance_sampling_ratio/min": 0.14829790592193604, "sampling/importance_sampling_ratio/mean": 1.055251955986023, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.7573797404766083, "clip_ratio/low_mean": 0.08293617330491543, "clip_ratio/low_min": 0.08293617330491543, "clip_ratio/high_mean": 0.09958924725651741, "clip_ratio/high_max": 0.09958924725651741, "clip_ratio/region_mean": 0.18252542056143284, "reward_total_mean": 0.22972571849822998, "reward_meter_mean": 0.7863786816596985, "reward_meter_std": 0.2986995279788971, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9920691251754761, "reward_lexical_plausibility_std": 0.018583906814455986, "reward_repeat_penalty_mean": 0.9819804430007935, "reward_repeat_penalty_std": 0.02719215303659439, "reward_near_duplicate_penalty_mean": 0.9935469627380371, "reward_near_duplicate_penalty_std": 0.006173244211822748, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9882498979568481, "reward_distinct_2_std": 0.02176465094089508, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.22972571849822998, "reward_total_composite_std": 0.15144440531730652} {"timestamp_utc": "2026-04-12T11:22:12Z", "mode": "train", "global_step": 166, "epoch": 0.006667469976302366, "loss": -0.1163, "grad_norm": 24.627695083618164, "learning_rate": 9.5e-06, "num_tokens": 351254.0, "completions/mean_length": 22.0, "completions/min_length": 14.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.4842112064361572, "rewards/meter/std": 0.49465081095695496, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8803104162216187, "rewards/lexical_plausibility/std": 0.18854932487010956, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.36792856454849243, "rewards/repeat_penalty/mean": 0.7131342887878418, "rewards/repeat_penalty/std": 0.07621722668409348, "rewards/near_duplicate_penalty/mean": 0.9508456587791443, "rewards/near_duplicate_penalty/std": 0.10162296891212463, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3042754530906677, "rewards/total_composite/std": 0.4045744836330414, "reward": 0.3042754530906677, "reward_std": 0.40457454323768616, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24987587332725525, "sampling/sampling_logp_difference/max": 1.772230625152588, "sampling/importance_sampling_ratio/min": 0.16995346546173096, "sampling/importance_sampling_ratio/mean": 0.9767836332321167, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.409932479262352, "clip_ratio/low_mean": 0.10937500186264515, "clip_ratio/low_min": 0.10937500186264515, "clip_ratio/high_mean": 0.0972222238779068, "clip_ratio/high_max": 0.0972222238779068, "clip_ratio/region_mean": 0.20659722574055195, "reward_total_mean": 0.3042754530906677, "reward_meter_mean": 0.4842112064361572, "reward_meter_std": 0.49465081095695496, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8803104162216187, "reward_lexical_plausibility_std": 0.18854932487010956, "reward_repeat_penalty_mean": 0.7131342887878418, "reward_repeat_penalty_std": 0.07621722668409348, "reward_near_duplicate_penalty_mean": 0.9508456587791443, "reward_near_duplicate_penalty_std": 0.10162296891212463, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.36792856454849243, "reward_total_composite_mean": 0.3042754530906677, "reward_total_composite_std": 0.4045744836330414} {"timestamp_utc": "2026-04-12T11:22:21Z", "mode": "train", "global_step": 167, "epoch": 0.00670763545808732, "loss": -0.0226, "grad_norm": 25.09771156311035, "learning_rate": 9.496969696969698e-06, "num_tokens": 352590.0, "completions/mean_length": 20.0, "completions/min_length": 17.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.5989440679550171, "rewards/meter/std": 0.47300752997398376, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.936274528503418, "rewards/lexical_plausibility/std": 0.11984409391880035, "rewards/judge_quality/mean": 0.5637499690055847, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.41322803497314453, "rewards/total_composite/std": 0.3877599239349365, "reward": 0.41322803497314453, "reward_std": 0.3877599239349365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20672015845775604, "sampling/sampling_logp_difference/max": 2.3006649017333984, "sampling/importance_sampling_ratio/min": 0.10019221156835556, "sampling/importance_sampling_ratio/mean": 0.9889694452285767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1633053570985794, "clip_ratio/low_mean": 0.07804738450795412, "clip_ratio/low_min": 0.07804738450795412, "clip_ratio/high_mean": 0.09561966173350811, "clip_ratio/high_max": 0.09561966173350811, "clip_ratio/region_mean": 0.17366704624146223, "reward_total_mean": 0.41322803497314453, "reward_meter_mean": 0.5989440679550171, "reward_meter_std": 0.47300752997398376, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.936274528503418, "reward_lexical_plausibility_std": 0.11984409391880035, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637499690055847, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.41322803497314453, "reward_total_composite_std": 0.3877599239349365} {"timestamp_utc": "2026-04-12T11:22:30Z", "mode": "train", "global_step": 168, "epoch": 0.006747800939872274, "loss": 0.0315, "grad_norm": 12.210685729980469, "learning_rate": 9.493939393939395e-06, "num_tokens": 354230.0, "completions/mean_length": 58.0, "completions/min_length": 49.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.0, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.3453054130077362, "rewards/meter/std": 0.21523037552833557, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9944852590560913, "rewards/lexical_plausibility/std": 0.015597938559949398, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9783644676208496, "rewards/repeat_penalty/std": 0.031180918216705322, "rewards/near_duplicate_penalty/mean": 0.9897348284721375, "rewards/near_duplicate_penalty/std": 0.011738686822354794, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9883342981338501, "rewards/distinct_2/std": 0.021613944321870804, "rewards/total_composite/mean": 0.1511130928993225, "rewards/total_composite/std": 0.08983789384365082, "reward": 0.1511130928993225, "reward_std": 0.08983788639307022, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21704605221748352, "sampling/sampling_logp_difference/max": 1.178271770477295, "sampling/importance_sampling_ratio/min": 0.3078102469444275, "sampling/importance_sampling_ratio/mean": 1.0729085206985474, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.014581650495529, "clip_ratio/low_mean": 0.1251058243215084, "clip_ratio/low_min": 0.1251058243215084, "clip_ratio/high_mean": 0.07275232020765543, "clip_ratio/high_max": 0.07275232020765543, "clip_ratio/region_mean": 0.19785814452916384, "reward_total_mean": 0.1511130928993225, "reward_meter_mean": 0.3453054130077362, "reward_meter_std": 0.21523037552833557, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9944852590560913, "reward_lexical_plausibility_std": 0.015597938559949398, "reward_repeat_penalty_mean": 0.9783644676208496, "reward_repeat_penalty_std": 0.031180918216705322, "reward_near_duplicate_penalty_mean": 0.9897348284721375, "reward_near_duplicate_penalty_std": 0.011738686822354794, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9883342981338501, "reward_distinct_2_std": 0.021613944321870804, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.1511130928993225, "reward_total_composite_std": 0.08983789384365082} {"timestamp_utc": "2026-04-12T11:22:39Z", "mode": "train", "global_step": 169, "epoch": 0.006787966421657228, "loss": 0.0824, "grad_norm": 25.170482635498047, "learning_rate": 9.490909090909092e-06, "num_tokens": 355742.0, "completions/mean_length": 30.0, "completions/min_length": 25.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.0, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.7387362718582153, "rewards/meter/std": 0.3245859742164612, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7762500047683716, "rewards/judge_quality/std": 0.30500292778015137, "rewards/repeat_penalty/mean": 0.999159038066864, "rewards/repeat_penalty/std": 0.0021877859253436327, "rewards/near_duplicate_penalty/mean": 0.999159038066864, "rewards/near_duplicate_penalty/std": 0.0021877859253436327, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5715652108192444, "rewards/total_composite/std": 0.4069288671016693, "reward": 0.5715652108192444, "reward_std": 0.4069288671016693, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24306611716747284, "sampling/sampling_logp_difference/max": 2.233613967895508, "sampling/importance_sampling_ratio/min": 0.10714053362607956, "sampling/importance_sampling_ratio/mean": 1.0054264068603516, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1133714690804482, "clip_ratio/low_mean": 0.05826154723763466, "clip_ratio/low_min": 0.05826154723763466, "clip_ratio/high_mean": 0.10700204130262136, "clip_ratio/high_max": 0.10700204130262136, "clip_ratio/region_mean": 0.16526358854025602, "reward_total_mean": 0.5715652108192444, "reward_meter_mean": 0.7387362718582153, "reward_meter_std": 0.3245859742164612, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.999159038066864, "reward_repeat_penalty_std": 0.0021877859253436327, "reward_near_duplicate_penalty_mean": 0.999159038066864, "reward_near_duplicate_penalty_std": 0.0021877859253436327, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7762500047683716, "reward_judge_quality_std": 0.30500292778015137, "reward_total_composite_mean": 0.5715652108192444, "reward_total_composite_std": 0.4069288671016693} {"timestamp_utc": "2026-04-12T11:22:50Z", "mode": "train", "global_step": 170, "epoch": 0.006828131903442182, "loss": 0.0779, "grad_norm": 9.174952507019043, "learning_rate": 9.487878787878788e-06, "num_tokens": 358497.0, "completions/mean_length": 137.375, "completions/min_length": 114.0, "completions/max_length": 199.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 137.375, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 199.0, "rewards/meter/mean": 0.6350411176681519, "rewards/meter/std": 0.2673247158527374, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.0890870913863182, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9683523774147034, "rewards/lexical_plausibility/std": 0.05798772722482681, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9900543689727783, "rewards/repeat_penalty/std": 0.011428109370172024, "rewards/near_duplicate_penalty/mean": 0.9962649345397949, "rewards/near_duplicate_penalty/std": 0.0027726679109036922, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9937705993652344, "rewards/distinct_2/std": 0.01156657189130783, "rewards/total_composite/mean": 0.1064797192811966, "rewards/total_composite/std": 0.07059706747531891, "reward": 0.1064797192811966, "reward_std": 0.07059706002473831, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23334676027297974, "sampling/sampling_logp_difference/max": 1.7164735794067383, "sampling/importance_sampling_ratio/min": 0.17969873547554016, "sampling/importance_sampling_ratio/mean": 1.0611952543258667, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.4087454676628113, "clip_ratio/low_mean": 0.08591734897345304, "clip_ratio/low_min": 0.08591734897345304, "clip_ratio/high_mean": 0.10519460588693619, "clip_ratio/high_max": 0.10519460588693619, "clip_ratio/region_mean": 0.19111195486038923, "reward_total_mean": 0.1064797192811966, "reward_meter_mean": 0.6350411176681519, "reward_meter_std": 0.2673247158527374, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.0890870913863182, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9683523774147034, "reward_lexical_plausibility_std": 0.05798772722482681, "reward_repeat_penalty_mean": 0.9900543689727783, "reward_repeat_penalty_std": 0.011428109370172024, "reward_near_duplicate_penalty_mean": 0.9962649345397949, "reward_near_duplicate_penalty_std": 0.0027726679109036922, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9937705993652344, "reward_distinct_2_std": 0.01156657189130783, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.1064797192811966, "reward_total_composite_std": 0.07059706747531891} {"timestamp_utc": "2026-04-12T11:22:59Z", "mode": "train", "global_step": 171, "epoch": 0.0068682973852271356, "loss": 0.0581, "grad_norm": 20.94089126586914, "learning_rate": 9.484848484848485e-06, "num_tokens": 360021.0, "completions/mean_length": 25.5, "completions/min_length": 20.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.3693656325340271, "rewards/meter/std": 0.3645670413970947, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7475000023841858, "rewards/judge_quality/std": 0.24656209349632263, "rewards/repeat_penalty/mean": 0.8291299939155579, "rewards/repeat_penalty/std": 0.10013485699892044, "rewards/near_duplicate_penalty/mean": 0.8717963695526123, "rewards/near_duplicate_penalty/std": 0.08751071989536285, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9516989588737488, "rewards/distinct_2/std": 0.06690994650125504, "rewards/total_composite/mean": 0.24836450815200806, "rewards/total_composite/std": 0.2758057117462158, "reward": 0.24836450815200806, "reward_std": 0.27580568194389343, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20083513855934143, "sampling/sampling_logp_difference/max": 2.0092697143554688, "sampling/importance_sampling_ratio/min": 0.13408656418323517, "sampling/importance_sampling_ratio/mean": 0.984898030757904, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.083882451057434, "clip_ratio/low_mean": 0.11245199851691723, "clip_ratio/low_min": 0.11245199851691723, "clip_ratio/high_mean": 0.053392261266708374, "clip_ratio/high_max": 0.053392261266708374, "clip_ratio/region_mean": 0.1658442597836256, "reward_total_mean": 0.24836450815200806, "reward_meter_mean": 0.3693656325340271, "reward_meter_std": 0.3645670413970947, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8291299939155579, "reward_repeat_penalty_std": 0.10013485699892044, "reward_near_duplicate_penalty_mean": 0.8717963695526123, "reward_near_duplicate_penalty_std": 0.08751071989536285, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9516989588737488, "reward_distinct_2_std": 0.06690994650125504, "reward_judge_quality_mean": 0.7475000023841858, "reward_judge_quality_std": 0.24656209349632263, "reward_total_composite_mean": 0.24836450815200806, "reward_total_composite_std": 0.2758057117462158} {"timestamp_utc": "2026-04-12T11:23:08Z", "mode": "train", "global_step": 172, "epoch": 0.0069084628670120895, "loss": 0.0456, "grad_norm": 22.703914642333984, "learning_rate": 9.481818181818182e-06, "num_tokens": 361689.0, "completions/mean_length": 31.5, "completions/min_length": 26.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.5, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.08846498280763626, "rewards/meter/std": 0.07687108963727951, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9858841896057129, "rewards/repeat_penalty/std": 0.02502317726612091, "rewards/near_duplicate_penalty/mean": 0.9858841896057129, "rewards/near_duplicate_penalty/std": 0.02502317726612091, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0392117016017437, "rewards/total_composite/std": 0.03517558053135872, "reward": 0.0392117016017437, "reward_std": 0.03517558053135872, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22029566764831543, "sampling/sampling_logp_difference/max": 1.6291742324829102, "sampling/importance_sampling_ratio/min": 0.196091428399086, "sampling/importance_sampling_ratio/mean": 1.0678179264068604, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4302738904953003, "clip_ratio/low_mean": 0.08146736770868301, "clip_ratio/low_min": 0.08146736770868301, "clip_ratio/high_mean": 0.07291666977107525, "clip_ratio/high_max": 0.07291666977107525, "clip_ratio/region_mean": 0.15438403747975826, "reward_total_mean": 0.0392117016017437, "reward_meter_mean": 0.08846498280763626, "reward_meter_std": 0.07687108963727951, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9858841896057129, "reward_repeat_penalty_std": 0.02502317726612091, "reward_near_duplicate_penalty_mean": 0.9858841896057129, "reward_near_duplicate_penalty_std": 0.02502317726612091, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.0392117016017437, "reward_total_composite_std": 0.03517558053135872} {"timestamp_utc": "2026-04-12T11:23:19Z", "mode": "train", "global_step": 173, "epoch": 0.006948628348797043, "loss": 0.0196, "grad_norm": 8.485453605651855, "learning_rate": 9.47878787878788e-06, "num_tokens": 364128.0, "completions/mean_length": 105.875, "completions/min_length": 75.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 105.875, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 140.0, "rewards/meter/mean": 0.9131350517272949, "rewards/meter/std": 0.19232678413391113, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9669399857521057, "rewards/lexical_plausibility/std": 0.06768521666526794, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9855475425720215, "rewards/repeat_penalty/std": 0.01551891304552555, "rewards/near_duplicate_penalty/mean": 0.9928019642829895, "rewards/near_duplicate_penalty/std": 0.004954707808792591, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926779270172119, "rewards/distinct_2/std": 0.013638022355735302, "rewards/total_composite/mean": 0.2092924267053604, "rewards/total_composite/std": 0.08456514775753021, "reward": 0.2092924267053604, "reward_std": 0.08456514775753021, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2264847457408905, "sampling/sampling_logp_difference/max": 1.2399978637695312, "sampling/importance_sampling_ratio/min": 0.2893848419189453, "sampling/importance_sampling_ratio/mean": 1.0586601495742798, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.2237583100795746, "clip_ratio/low_mean": 0.11364763416349888, "clip_ratio/low_min": 0.11364763416349888, "clip_ratio/high_mean": 0.08463040925562382, "clip_ratio/high_max": 0.08463040925562382, "clip_ratio/region_mean": 0.1982780434191227, "reward_total_mean": 0.2092924267053604, "reward_meter_mean": 0.9131350517272949, "reward_meter_std": 0.19232678413391113, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9669399857521057, "reward_lexical_plausibility_std": 0.06768521666526794, "reward_repeat_penalty_mean": 0.9855475425720215, "reward_repeat_penalty_std": 0.01551891304552555, "reward_near_duplicate_penalty_mean": 0.9928019642829895, "reward_near_duplicate_penalty_std": 0.004954707808792591, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926779270172119, "reward_distinct_2_std": 0.013638022355735302, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.2092924267053604, "reward_total_composite_std": 0.08456514775753021} {"timestamp_utc": "2026-04-12T11:23:29Z", "mode": "train", "global_step": 174, "epoch": 0.006988793830581998, "loss": 0.0219, "grad_norm": 15.158143043518066, "learning_rate": 9.475757575757577e-06, "num_tokens": 366174.0, "completions/mean_length": 74.75, "completions/min_length": 64.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.75, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.7601040601730347, "rewards/meter/std": 0.3118656575679779, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.528749942779541, "rewards/judge_quality/std": 0.15824371576309204, "rewards/repeat_penalty/mean": 0.9680019021034241, "rewards/repeat_penalty/std": 0.04557621479034424, "rewards/near_duplicate_penalty/mean": 0.9833802580833435, "rewards/near_duplicate_penalty/std": 0.016271071508526802, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839502573013306, "rewards/distinct_2/std": 0.03230852633714676, "rewards/total_composite/mean": 0.33249223232269287, "rewards/total_composite/std": 0.21956424415111542, "reward": 0.33249223232269287, "reward_std": 0.2195642590522766, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21080315113067627, "sampling/sampling_logp_difference/max": 1.8717031478881836, "sampling/importance_sampling_ratio/min": 0.1538613885641098, "sampling/importance_sampling_ratio/mean": 1.0346046686172485, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0482437312602997, "clip_ratio/low_mean": 0.061938654631376266, "clip_ratio/low_min": 0.061938654631376266, "clip_ratio/high_mean": 0.13117137737572193, "clip_ratio/high_max": 0.13117137737572193, "clip_ratio/region_mean": 0.1931100320070982, "reward_total_mean": 0.33249223232269287, "reward_meter_mean": 0.7601040601730347, "reward_meter_std": 0.3118656575679779, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9680019021034241, "reward_repeat_penalty_std": 0.04557621479034424, "reward_near_duplicate_penalty_mean": 0.9833802580833435, "reward_near_duplicate_penalty_std": 0.016271071508526802, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839502573013306, "reward_distinct_2_std": 0.03230852633714676, "reward_judge_quality_mean": 0.528749942779541, "reward_judge_quality_std": 0.15824371576309204, "reward_total_composite_mean": 0.33249223232269287, "reward_total_composite_std": 0.21956424415111542} {"timestamp_utc": "2026-04-12T11:23:39Z", "mode": "train", "global_step": 175, "epoch": 0.007028959312366952, "loss": -0.0079, "grad_norm": 18.586265563964844, "learning_rate": 9.472727272727274e-06, "num_tokens": 367733.0, "completions/mean_length": 38.875, "completions/min_length": 31.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5412830114364624, "rewards/meter/std": 0.41530048847198486, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9761029481887817, "rewards/lexical_plausibility/std": 0.067591093480587, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9654839038848877, "rewards/repeat_penalty/std": 0.025515692308545113, "rewards/near_duplicate_penalty/mean": 0.9654839038848877, "rewards/near_duplicate_penalty/std": 0.025515692308545113, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19817006587982178, "rewards/total_composite/std": 0.18958911299705505, "reward": 0.19817006587982178, "reward_std": 0.18958912789821625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2097066193819046, "sampling/sampling_logp_difference/max": 1.918522834777832, "sampling/importance_sampling_ratio/min": 0.1468236893415451, "sampling/importance_sampling_ratio/mean": 1.0218008756637573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6516703888773918, "clip_ratio/low_mean": 0.10428987257182598, "clip_ratio/low_min": 0.10428987257182598, "clip_ratio/high_mean": 0.12269819341599941, "clip_ratio/high_max": 0.12269819341599941, "clip_ratio/region_mean": 0.2269880659878254, "reward_total_mean": 0.19817006587982178, "reward_meter_mean": 0.5412830114364624, "reward_meter_std": 0.41530048847198486, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9761029481887817, "reward_lexical_plausibility_std": 0.067591093480587, "reward_repeat_penalty_mean": 0.9654839038848877, "reward_repeat_penalty_std": 0.025515692308545113, "reward_near_duplicate_penalty_mean": 0.9654839038848877, "reward_near_duplicate_penalty_std": 0.025515692308545113, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.19817006587982178, "reward_total_composite_std": 0.18958911299705505} {"timestamp_utc": "2026-04-12T11:23:52Z", "mode": "train", "global_step": 176, "epoch": 0.007069124794151906, "loss": -0.0022, "grad_norm": 5.116064548492432, "learning_rate": 9.469696969696971e-06, "num_tokens": 371605.0, "completions/mean_length": 277.0, "completions/min_length": 253.0, "completions/max_length": 325.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 277.0, "completions/min_terminated_length": 253.0, "completions/max_terminated_length": 325.0, "rewards/meter/mean": 0.6602240800857544, "rewards/meter/std": 0.23572297394275665, "rewards/count_adherence/mean": 0.9230769276618958, "rewards/count_adherence/std": 0.07121692597866058, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9989809989929199, "rewards/lexical_plausibility/std": 0.00288223335519433, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.07559289038181305, "rewards/repeat_penalty/mean": 0.980717122554779, "rewards/repeat_penalty/std": 0.018925588577985764, "rewards/near_duplicate_penalty/mean": 0.9932653903961182, "rewards/near_duplicate_penalty/std": 0.0036780915688723326, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.987325131893158, "rewards/distinct_2/std": 0.016033917665481567, "rewards/total_composite/mean": 0.11684560030698776, "rewards/total_composite/std": 0.08322425931692123, "reward": 0.11684560030698776, "reward_std": 0.08322425931692123, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.235348641872406, "sampling/sampling_logp_difference/max": 2.1670923233032227, "sampling/importance_sampling_ratio/min": 0.11451008915901184, "sampling/importance_sampling_ratio/mean": 1.0630502700805664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.109456360340118, "clip_ratio/low_mean": 0.08097132854163647, "clip_ratio/low_min": 0.08097132854163647, "clip_ratio/high_mean": 0.10114516504108906, "clip_ratio/high_max": 0.10114516504108906, "clip_ratio/region_mean": 0.18211649358272552, "reward_total_mean": 0.11684560030698776, "reward_meter_mean": 0.6602240800857544, "reward_meter_std": 0.23572297394275665, "reward_count_adherence_mean": 0.9230769276618958, "reward_count_adherence_std": 0.07121692597866058, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9989809989929199, "reward_lexical_plausibility_std": 0.00288223335519433, "reward_repeat_penalty_mean": 0.980717122554779, "reward_repeat_penalty_std": 0.018925588577985764, "reward_near_duplicate_penalty_mean": 0.9932653903961182, "reward_near_duplicate_penalty_std": 0.0036780915688723326, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.987325131893158, "reward_distinct_2_std": 0.016033917665481567, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.07559289038181305, "reward_total_composite_mean": 0.11684560030698776, "reward_total_composite_std": 0.08322425931692123} {"timestamp_utc": "2026-04-12T11:24:06Z", "mode": "train", "global_step": 177, "epoch": 0.00710929027593686, "loss": 0.1403, "grad_norm": 6.402902603149414, "learning_rate": 9.466666666666667e-06, "num_tokens": 375200.0, "completions/mean_length": 233.375, "completions/min_length": 161.0, "completions/max_length": 359.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 233.375, "completions/min_terminated_length": 161.0, "completions/max_terminated_length": 359.0, "rewards/meter/mean": 0.4629499018192291, "rewards/meter/std": 0.28422310948371887, "rewards/count_adherence/mean": 0.824999988079071, "rewards/count_adherence/std": 0.11649646610021591, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9468951225280762, "rewards/lexical_plausibility/std": 0.06595577299594879, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.996282696723938, "rewards/repeat_penalty/std": 0.003457123413681984, "rewards/near_duplicate_penalty/mean": 0.9974746108055115, "rewards/near_duplicate_penalty/std": 0.0012659269850701094, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9988055229187012, "rewards/distinct_2/std": 0.0033784282859414816, "rewards/total_composite/mean": 0.055360257625579834, "rewards/total_composite/std": 0.04187962785363197, "reward": 0.055360257625579834, "reward_std": 0.04187962785363197, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23183801770210266, "sampling/sampling_logp_difference/max": 1.3596258163452148, "sampling/importance_sampling_ratio/min": 0.25675684213638306, "sampling/importance_sampling_ratio/mean": 1.0723868608474731, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.344330847263336, "clip_ratio/low_mean": 0.08006827719509602, "clip_ratio/low_min": 0.08006827719509602, "clip_ratio/high_mean": 0.09986113384366035, "clip_ratio/high_max": 0.09986113384366035, "clip_ratio/region_mean": 0.17992941103875637, "reward_total_mean": 0.055360257625579834, "reward_meter_mean": 0.4629499018192291, "reward_meter_std": 0.28422310948371887, "reward_count_adherence_mean": 0.824999988079071, "reward_count_adherence_std": 0.11649646610021591, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9468951225280762, "reward_lexical_plausibility_std": 0.06595577299594879, "reward_repeat_penalty_mean": 0.996282696723938, "reward_repeat_penalty_std": 0.003457123413681984, "reward_near_duplicate_penalty_mean": 0.9974746108055115, "reward_near_duplicate_penalty_std": 0.0012659269850701094, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9988055229187012, "reward_distinct_2_std": 0.0033784282859414816, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.055360257625579834, "reward_total_composite_std": 0.04187962785363197} {"timestamp_utc": "2026-04-12T11:24:15Z", "mode": "train", "global_step": 178, "epoch": 0.007149455757721814, "loss": 0.0505, "grad_norm": 14.922652244567871, "learning_rate": 9.463636363636364e-06, "num_tokens": 376912.0, "completions/mean_length": 43.0, "completions/min_length": 34.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.7356902956962585, "rewards/meter/std": 0.37158194184303284, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9743161201477051, "rewards/lexical_plausibility/std": 0.05866875872015953, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9899815917015076, "rewards/repeat_penalty/std": 0.025666886940598488, "rewards/near_duplicate_penalty/mean": 0.999139130115509, "rewards/near_duplicate_penalty/std": 0.002434949856251478, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.2536138892173767, "rewards/total_composite/std": 0.17918303608894348, "reward": 0.2536138892173767, "reward_std": 0.17918303608894348, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22188541293144226, "sampling/sampling_logp_difference/max": 1.4895896911621094, "sampling/importance_sampling_ratio/min": 0.22546514868736267, "sampling/importance_sampling_ratio/mean": 1.0171048641204834, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2047335356473923, "clip_ratio/low_mean": 0.1056149760261178, "clip_ratio/low_min": 0.1056149760261178, "clip_ratio/high_mean": 0.12168767675757408, "clip_ratio/high_max": 0.12168767675757408, "clip_ratio/region_mean": 0.22730265278369188, "reward_total_mean": 0.2536138892173767, "reward_meter_mean": 0.7356902956962585, "reward_meter_std": 0.37158194184303284, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9743161201477051, "reward_lexical_plausibility_std": 0.05866875872015953, "reward_repeat_penalty_mean": 0.9899815917015076, "reward_repeat_penalty_std": 0.025666886940598488, "reward_near_duplicate_penalty_mean": 0.999139130115509, "reward_near_duplicate_penalty_std": 0.002434949856251478, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.2536138892173767, "reward_total_composite_std": 0.17918303608894348} {"timestamp_utc": "2026-04-12T11:24:25Z", "mode": "train", "global_step": 179, "epoch": 0.007189621239506768, "loss": 0.0648, "grad_norm": 16.850215911865234, "learning_rate": 9.460606060606061e-06, "num_tokens": 378408.0, "completions/mean_length": 38.0, "completions/min_length": 33.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.41254815459251404, "rewards/meter/std": 0.44692495465278625, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9485032558441162, "rewards/lexical_plausibility/std": 0.08522287011146545, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9899126291275024, "rewards/repeat_penalty/std": 0.02286543883383274, "rewards/near_duplicate_penalty/mean": 0.9899126291275024, "rewards/near_duplicate_penalty/std": 0.02286543883383274, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16204196214675903, "rewards/total_composite/std": 0.19023385643959045, "reward": 0.16204196214675903, "reward_std": 0.19023385643959045, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24171759188175201, "sampling/sampling_logp_difference/max": 1.396334171295166, "sampling/importance_sampling_ratio/min": 0.24750261008739471, "sampling/importance_sampling_ratio/mean": 1.0306048393249512, "sampling/importance_sampling_ratio/max": 1.823089838027954, "entropy": 2.6068559288978577, "clip_ratio/low_mean": 0.11815614067018032, "clip_ratio/low_min": 0.11815614067018032, "clip_ratio/high_mean": 0.06796252168715, "clip_ratio/high_max": 0.06796252168715, "clip_ratio/region_mean": 0.18611866235733032, "reward_total_mean": 0.16204196214675903, "reward_meter_mean": 0.41254815459251404, "reward_meter_std": 0.44692495465278625, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9485032558441162, "reward_lexical_plausibility_std": 0.08522287011146545, "reward_repeat_penalty_mean": 0.9899126291275024, "reward_repeat_penalty_std": 0.02286543883383274, "reward_near_duplicate_penalty_mean": 0.9899126291275024, "reward_near_duplicate_penalty_std": 0.02286543883383274, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.16204196214675903, "reward_total_composite_std": 0.19023385643959045} {"timestamp_utc": "2026-04-12T11:24:34Z", "mode": "train", "global_step": 180, "epoch": 0.007229786721291722, "loss": 0.1504, "grad_norm": 19.240222930908203, "learning_rate": 9.457575757575759e-06, "num_tokens": 380440.0, "completions/mean_length": 71.0, "completions/min_length": 55.0, "completions/max_length": 85.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.0, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.42972785234451294, "rewards/meter/std": 0.28869742155075073, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9831730723381042, "rewards/lexical_plausibility/std": 0.04759372025728226, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2745385766029358, "rewards/repeat_penalty/mean": 0.9570775032043457, "rewards/repeat_penalty/std": 0.06302423775196075, "rewards/near_duplicate_penalty/mean": 0.9806978702545166, "rewards/near_duplicate_penalty/std": 0.01663300208747387, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9753398299217224, "rewards/distinct_2/std": 0.05175751447677612, "rewards/total_composite/mean": 0.1683695912361145, "rewards/total_composite/std": 0.10020577907562256, "reward": 0.1683695912361145, "reward_std": 0.10020577907562256, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23795141279697418, "sampling/sampling_logp_difference/max": 2.5275683403015137, "sampling/importance_sampling_ratio/min": 0.07985296100378036, "sampling/importance_sampling_ratio/mean": 1.0296127796173096, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8202795684337616, "clip_ratio/low_mean": 0.09395610727369785, "clip_ratio/low_min": 0.09395610727369785, "clip_ratio/high_mean": 0.12110170815140009, "clip_ratio/high_max": 0.12110170815140009, "clip_ratio/region_mean": 0.21505781542509794, "reward_total_mean": 0.1683695912361145, "reward_meter_mean": 0.42972785234451294, "reward_meter_std": 0.28869742155075073, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9831730723381042, "reward_lexical_plausibility_std": 0.04759372025728226, "reward_repeat_penalty_mean": 0.9570775032043457, "reward_repeat_penalty_std": 0.06302423775196075, "reward_near_duplicate_penalty_mean": 0.9806978702545166, "reward_near_duplicate_penalty_std": 0.01663300208747387, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9753398299217224, "reward_distinct_2_std": 0.05175751447677612, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2745385766029358, "reward_total_composite_mean": 0.1683695912361145, "reward_total_composite_std": 0.10020577907562256} {"timestamp_utc": "2026-04-12T11:24:43Z", "mode": "train", "global_step": 181, "epoch": 0.007269952203076676, "loss": -0.0253, "grad_norm": 17.628551483154297, "learning_rate": 9.454545454545456e-06, "num_tokens": 382191.0, "completions/mean_length": 43.875, "completions/min_length": 31.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.2817838191986084, "rewards/meter/std": 0.34548836946487427, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9958004355430603, "rewards/repeat_penalty/std": 0.004529349971562624, "rewards/near_duplicate_penalty/mean": 0.9958004355430603, "rewards/near_duplicate_penalty/std": 0.004529349971562624, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12685979902744293, "rewards/total_composite/std": 0.13998359441757202, "reward": 0.12685979902744293, "reward_std": 0.13998357951641083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1864061951637268, "sampling/sampling_logp_difference/max": 1.9987711906433105, "sampling/importance_sampling_ratio/min": 0.1355016976594925, "sampling/importance_sampling_ratio/mean": 1.0109132528305054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5137614160776138, "clip_ratio/low_mean": 0.09676664415746927, "clip_ratio/low_min": 0.09676664415746927, "clip_ratio/high_mean": 0.05401897616684437, "clip_ratio/high_max": 0.05401897616684437, "clip_ratio/region_mean": 0.15078562032431364, "reward_total_mean": 0.12685979902744293, "reward_meter_mean": 0.2817838191986084, "reward_meter_std": 0.34548836946487427, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9958004355430603, "reward_repeat_penalty_std": 0.004529349971562624, "reward_near_duplicate_penalty_mean": 0.9958004355430603, "reward_near_duplicate_penalty_std": 0.004529349971562624, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.12685979902744293, "reward_total_composite_std": 0.13998359441757202} {"timestamp_utc": "2026-04-12T11:24:53Z", "mode": "train", "global_step": 182, "epoch": 0.00731011768486163, "loss": 0.0259, "grad_norm": 8.540081977844238, "learning_rate": 9.451515151515153e-06, "num_tokens": 384769.0, "completions/mean_length": 118.25, "completions/min_length": 95.0, "completions/max_length": 164.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 118.25, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 164.0, "rewards/meter/mean": 0.4592788517475128, "rewards/meter/std": 0.267805814743042, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9770813584327698, "rewards/repeat_penalty/std": 0.033471085131168365, "rewards/near_duplicate_penalty/mean": 0.9907737970352173, "rewards/near_duplicate_penalty/std": 0.010123512707650661, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9860093593597412, "rewards/distinct_2/std": 0.025911342352628708, "rewards/total_composite/mean": 0.12077900767326355, "rewards/total_composite/std": 0.11277022957801819, "reward": 0.12077900767326355, "reward_std": 0.11277022957801819, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22959047555923462, "sampling/sampling_logp_difference/max": 2.329220771789551, "sampling/importance_sampling_ratio/min": 0.09737159311771393, "sampling/importance_sampling_ratio/mean": 1.045446753501892, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.243285685777664, "clip_ratio/low_mean": 0.09601961821317673, "clip_ratio/low_min": 0.09601961821317673, "clip_ratio/high_mean": 0.07793585769832134, "clip_ratio/high_max": 0.07793585769832134, "clip_ratio/region_mean": 0.17395547591149807, "reward_total_mean": 0.12077900767326355, "reward_meter_mean": 0.4592788517475128, "reward_meter_std": 0.267805814743042, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9770813584327698, "reward_repeat_penalty_std": 0.033471085131168365, "reward_near_duplicate_penalty_mean": 0.9907737970352173, "reward_near_duplicate_penalty_std": 0.010123512707650661, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9860093593597412, "reward_distinct_2_std": 0.025911342352628708, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.12077900767326355, "reward_total_composite_std": 0.11277022957801819} {"timestamp_utc": "2026-04-12T11:25:05Z", "mode": "train", "global_step": 183, "epoch": 0.007350283166646584, "loss": 0.0137, "grad_norm": 6.802778244018555, "learning_rate": 9.448484848484849e-06, "num_tokens": 387736.0, "completions/mean_length": 169.875, "completions/min_length": 145.0, "completions/max_length": 203.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 169.875, "completions/min_terminated_length": 145.0, "completions/max_terminated_length": 203.0, "rewards/meter/mean": 0.6901034116744995, "rewards/meter/std": 0.2485126554965973, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9692424535751343, "rewards/lexical_plausibility/std": 0.04459897801280022, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9947319030761719, "rewards/repeat_penalty/std": 0.009320467710494995, "rewards/near_duplicate_penalty/mean": 0.9968446493148804, "rewards/near_duplicate_penalty/std": 0.0034918736200779676, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.997863233089447, "rewards/distinct_2/std": 0.006043647415935993, "rewards/total_composite/mean": 0.08977998793125153, "rewards/total_composite/std": 0.07316060364246368, "reward": 0.08977998793125153, "reward_std": 0.07316060364246368, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.251144677400589, "sampling/sampling_logp_difference/max": 1.471531867980957, "sampling/importance_sampling_ratio/min": 0.22957353293895721, "sampling/importance_sampling_ratio/mean": 1.0808608531951904, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.208578437566757, "clip_ratio/low_mean": 0.08524911105632782, "clip_ratio/low_min": 0.08524911105632782, "clip_ratio/high_mean": 0.09699354693293571, "clip_ratio/high_max": 0.09699354693293571, "clip_ratio/region_mean": 0.18224265798926353, "reward_total_mean": 0.08977998793125153, "reward_meter_mean": 0.6901034116744995, "reward_meter_std": 0.2485126554965973, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9692424535751343, "reward_lexical_plausibility_std": 0.04459897801280022, "reward_repeat_penalty_mean": 0.9947319030761719, "reward_repeat_penalty_std": 0.009320467710494995, "reward_near_duplicate_penalty_mean": 0.9968446493148804, "reward_near_duplicate_penalty_std": 0.0034918736200779676, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.997863233089447, "reward_distinct_2_std": 0.006043647415935993, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.08977998793125153, "reward_total_composite_std": 0.07316060364246368} {"timestamp_utc": "2026-04-12T11:25:15Z", "mode": "train", "global_step": 184, "epoch": 0.007390448648431538, "loss": 0.0123, "grad_norm": 13.832329750061035, "learning_rate": 9.445454545454546e-06, "num_tokens": 389307.0, "completions/mean_length": 39.375, "completions/min_length": 32.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7828742265701294, "rewards/meter/std": 0.3550904393196106, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7549999952316284, "rewards/judge_quality/std": 0.25286927819252014, "rewards/repeat_penalty/mean": 0.9965667724609375, "rewards/repeat_penalty/std": 0.006824270356446505, "rewards/near_duplicate_penalty/mean": 0.9965667724609375, "rewards/near_duplicate_penalty/std": 0.006824270356446505, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5553215742111206, "rewards/total_composite/std": 0.3137626647949219, "reward": 0.5553215742111206, "reward_std": 0.31376269459724426, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19523799419403076, "sampling/sampling_logp_difference/max": 1.07771635055542, "sampling/importance_sampling_ratio/min": 0.34545567631721497, "sampling/importance_sampling_ratio/mean": 1.0603926181793213, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.899738535284996, "clip_ratio/low_mean": 0.1065289827529341, "clip_ratio/low_min": 0.1065289827529341, "clip_ratio/high_mean": 0.0513355010189116, "clip_ratio/high_max": 0.0513355010189116, "clip_ratio/region_mean": 0.1578644837718457, "reward_total_mean": 0.5553215742111206, "reward_meter_mean": 0.7828742265701294, "reward_meter_std": 0.3550904393196106, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9965667724609375, "reward_repeat_penalty_std": 0.006824270356446505, "reward_near_duplicate_penalty_mean": 0.9965667724609375, "reward_near_duplicate_penalty_std": 0.006824270356446505, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7549999952316284, "reward_judge_quality_std": 0.25286927819252014, "reward_total_composite_mean": 0.5553215742111206, "reward_total_composite_std": 0.3137626647949219} {"timestamp_utc": "2026-04-12T11:25:23Z", "mode": "train", "global_step": 185, "epoch": 0.0074306141302164916, "loss": 0.0331, "grad_norm": 21.2224063873291, "learning_rate": 9.442424242424243e-06, "num_tokens": 390703.0, "completions/mean_length": 19.5, "completions/min_length": 10.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 10.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.015161988325417042, "rewards/meter/std": 0.03626592084765434, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.47486287355422974, "rewards/lexical_plausibility/std": 0.29278481006622314, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.07905694097280502, "rewards/repeat_penalty/mean": 0.8109553456306458, "rewards/repeat_penalty/std": 0.26090797781944275, "rewards/near_duplicate_penalty/mean": 0.9229865074157715, "rewards/near_duplicate_penalty/std": 0.2145070880651474, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.002280371030792594, "rewards/total_composite/std": 0.005437059327960014, "reward": 0.002280371030792594, "reward_std": 0.005437058862298727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18426287174224854, "sampling/sampling_logp_difference/max": 1.4179484844207764, "sampling/importance_sampling_ratio/min": 0.24221040308475494, "sampling/importance_sampling_ratio/mean": 1.037623643875122, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.565277323126793, "clip_ratio/low_mean": 0.13158263638615608, "clip_ratio/low_min": 0.13158263638615608, "clip_ratio/high_mean": 0.007352941203862429, "clip_ratio/high_max": 0.007352941203862429, "clip_ratio/region_mean": 0.1389355775900185, "reward_total_mean": 0.002280371030792594, "reward_meter_mean": 0.015161988325417042, "reward_meter_std": 0.03626592084765434, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.47486287355422974, "reward_lexical_plausibility_std": 0.29278481006622314, "reward_repeat_penalty_mean": 0.8109553456306458, "reward_repeat_penalty_std": 0.26090797781944275, "reward_near_duplicate_penalty_mean": 0.9229865074157715, "reward_near_duplicate_penalty_std": 0.2145070880651474, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.07905694097280502, "reward_total_composite_mean": 0.002280371030792594, "reward_total_composite_std": 0.005437059327960014} {"timestamp_utc": "2026-04-12T11:25:35Z", "mode": "train", "global_step": 186, "epoch": 0.007470779612001446, "loss": 0.0882, "grad_norm": 9.80618953704834, "learning_rate": 9.43939393939394e-06, "num_tokens": 393278.0, "completions/mean_length": 136.875, "completions/min_length": 118.0, "completions/max_length": 160.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 136.875, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 160.0, "rewards/meter/mean": 0.5913933515548706, "rewards/meter/std": 0.39986154437065125, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9899776577949524, "rewards/lexical_plausibility/std": 0.02834748476743698, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9453206062316895, "rewards/repeat_penalty/std": 0.10422060638666153, "rewards/near_duplicate_penalty/mean": 0.9900493621826172, "rewards/near_duplicate_penalty/std": 0.01023941021412611, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.96144700050354, "rewards/distinct_2/std": 0.07747188210487366, "rewards/total_composite/mean": 0.1846718043088913, "rewards/total_composite/std": 0.12800109386444092, "reward": 0.1846718043088913, "reward_std": 0.12800109386444092, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23754943907260895, "sampling/sampling_logp_difference/max": 1.767012357711792, "sampling/importance_sampling_ratio/min": 0.17084264755249023, "sampling/importance_sampling_ratio/mean": 1.0489275455474854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.7036547362804413, "clip_ratio/low_mean": 0.09044165164232254, "clip_ratio/low_min": 0.09044165164232254, "clip_ratio/high_mean": 0.09846928715705872, "clip_ratio/high_max": 0.09846928715705872, "clip_ratio/region_mean": 0.18891093879938126, "reward_total_mean": 0.1846718043088913, "reward_meter_mean": 0.5913933515548706, "reward_meter_std": 0.39986154437065125, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9899776577949524, "reward_lexical_plausibility_std": 0.02834748476743698, "reward_repeat_penalty_mean": 0.9453206062316895, "reward_repeat_penalty_std": 0.10422060638666153, "reward_near_duplicate_penalty_mean": 0.9900493621826172, "reward_near_duplicate_penalty_std": 0.01023941021412611, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.96144700050354, "reward_distinct_2_std": 0.07747188210487366, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1846718043088913, "reward_total_composite_std": 0.12800109386444092} {"timestamp_utc": "2026-04-12T11:25:44Z", "mode": "train", "global_step": 187, "epoch": 0.0075109450937864, "loss": -0.0556, "grad_norm": 16.716724395751953, "learning_rate": 9.436363636363636e-06, "num_tokens": 394835.0, "completions/mean_length": 36.625, "completions/min_length": 28.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.4389100670814514, "rewards/meter/std": 0.3943783938884735, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9256715774536133, "rewards/repeat_penalty/std": 0.16142699122428894, "rewards/near_duplicate_penalty/mean": 0.9672102928161621, "rewards/near_duplicate_penalty/std": 0.04706943780183792, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9773755669593811, "rewards/distinct_2/std": 0.06399156153202057, "rewards/total_composite/mean": 0.19750946760177612, "rewards/total_composite/std": 0.1774703711271286, "reward": 0.19750946760177612, "reward_std": 0.1774703711271286, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19253911077976227, "sampling/sampling_logp_difference/max": 2.2758216857910156, "sampling/importance_sampling_ratio/min": 0.1027124747633934, "sampling/importance_sampling_ratio/mean": 1.0290716886520386, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8666294813156128, "clip_ratio/low_mean": 0.08704298455268145, "clip_ratio/low_min": 0.08704298455268145, "clip_ratio/high_mean": 0.051872119307518005, "clip_ratio/high_max": 0.051872119307518005, "clip_ratio/region_mean": 0.13891510386019945, "reward_total_mean": 0.19750946760177612, "reward_meter_mean": 0.4389100670814514, "reward_meter_std": 0.3943783938884735, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9256715774536133, "reward_repeat_penalty_std": 0.16142699122428894, "reward_near_duplicate_penalty_mean": 0.9672102928161621, "reward_near_duplicate_penalty_std": 0.04706943780183792, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9773755669593811, "reward_distinct_2_std": 0.06399156153202057, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.19750946760177612, "reward_total_composite_std": 0.1774703711271286} {"timestamp_utc": "2026-04-12T11:25:54Z", "mode": "train", "global_step": 188, "epoch": 0.007551110575571354, "loss": -0.0403, "grad_norm": 11.473904609680176, "learning_rate": 9.433333333333335e-06, "num_tokens": 396671.0, "completions/mean_length": 68.5, "completions/min_length": 50.0, "completions/max_length": 83.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.5, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.48370596766471863, "rewards/meter/std": 0.41808390617370605, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9972826242446899, "rewards/lexical_plausibility/std": 0.007685941644012928, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.9845765829086304, "rewards/repeat_penalty/std": 0.01943829655647278, "rewards/near_duplicate_penalty/mean": 0.9938940405845642, "rewards/near_duplicate_penalty/std": 0.003942488227039576, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9905967712402344, "rewards/distinct_2/std": 0.017439009621739388, "rewards/total_composite/mean": 0.23267492651939392, "rewards/total_composite/std": 0.21246552467346191, "reward": 0.23267492651939392, "reward_std": 0.21246552467346191, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20715653896331787, "sampling/sampling_logp_difference/max": 1.215444564819336, "sampling/importance_sampling_ratio/min": 0.29657813906669617, "sampling/importance_sampling_ratio/mean": 1.0435240268707275, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.596053183078766, "clip_ratio/low_mean": 0.07777901645749807, "clip_ratio/low_min": 0.07777901645749807, "clip_ratio/high_mean": 0.1069975420832634, "clip_ratio/high_max": 0.1069975420832634, "clip_ratio/region_mean": 0.18477655854076147, "reward_total_mean": 0.23267492651939392, "reward_meter_mean": 0.48370596766471863, "reward_meter_std": 0.41808390617370605, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9972826242446899, "reward_lexical_plausibility_std": 0.007685941644012928, "reward_repeat_penalty_mean": 0.9845765829086304, "reward_repeat_penalty_std": 0.01943829655647278, "reward_near_duplicate_penalty_mean": 0.9938940405845642, "reward_near_duplicate_penalty_std": 0.003942488227039576, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9905967712402344, "reward_distinct_2_std": 0.017439009621739388, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.23267492651939392, "reward_total_composite_std": 0.21246552467346191} {"timestamp_utc": "2026-04-12T11:26:06Z", "mode": "train", "global_step": 189, "epoch": 0.007591276057356308, "loss": 0.024, "grad_norm": 13.126042366027832, "learning_rate": 9.43030303030303e-06, "num_tokens": 398385.0, "completions/mean_length": 58.25, "completions/min_length": 53.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.25, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.5347265005111694, "rewards/meter/std": 0.34641000628471375, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47874999046325684, "rewards/judge_quality/std": 0.1683056354522705, "rewards/repeat_penalty/mean": 0.9957600831985474, "rewards/repeat_penalty/std": 0.0037746031302958727, "rewards/near_duplicate_penalty/mean": 0.9957600831985474, "rewards/near_duplicate_penalty/std": 0.0037746031302958727, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20895373821258545, "rewards/total_composite/std": 0.17416755855083466, "reward": 0.20895373821258545, "reward_std": 0.17416755855083466, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1976327896118164, "sampling/sampling_logp_difference/max": 1.7564430236816406, "sampling/importance_sampling_ratio/min": 0.17265790700912476, "sampling/importance_sampling_ratio/mean": 1.0394078493118286, "sampling/importance_sampling_ratio/max": 1.98775053024292, "entropy": 2.3172446340322495, "clip_ratio/low_mean": 0.08750543650239706, "clip_ratio/low_min": 0.08750543650239706, "clip_ratio/high_mean": 0.0921156071126461, "clip_ratio/high_max": 0.0921156071126461, "clip_ratio/region_mean": 0.17962104361504316, "reward_total_mean": 0.20895373821258545, "reward_meter_mean": 0.5347265005111694, "reward_meter_std": 0.34641000628471375, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9957600831985474, "reward_repeat_penalty_std": 0.0037746031302958727, "reward_near_duplicate_penalty_mean": 0.9957600831985474, "reward_near_duplicate_penalty_std": 0.0037746031302958727, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.47874999046325684, "reward_judge_quality_std": 0.1683056354522705, "reward_total_composite_mean": 0.20895373821258545, "reward_total_composite_std": 0.17416755855083466} {"timestamp_utc": "2026-04-12T11:26:19Z", "mode": "train", "global_step": 190, "epoch": 0.007631441539141262, "loss": 0.0626, "grad_norm": 8.389774322509766, "learning_rate": 9.427272727272728e-06, "num_tokens": 401256.0, "completions/mean_length": 140.875, "completions/min_length": 112.0, "completions/max_length": 181.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 140.875, "completions/min_terminated_length": 112.0, "completions/max_terminated_length": 181.0, "rewards/meter/mean": 0.26289302110671997, "rewards/meter/std": 0.16595962643623352, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9588995575904846, "rewards/lexical_plausibility/std": 0.06422513723373413, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.993451714515686, "rewards/repeat_penalty/std": 0.013639457523822784, "rewards/near_duplicate_penalty/mean": 0.9976036548614502, "rewards/near_duplicate_penalty/std": 0.0023936352226883173, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9958193898200989, "rewards/distinct_2/std": 0.0118245305493474, "rewards/total_composite/mean": 0.06927891075611115, "rewards/total_composite/std": 0.06271076202392578, "reward": 0.06927891075611115, "reward_std": 0.06271075457334518, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2442931979894638, "sampling/sampling_logp_difference/max": 1.2616536617279053, "sampling/importance_sampling_ratio/min": 0.28318536281585693, "sampling/importance_sampling_ratio/mean": 1.0808517932891846, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.8979704678058624, "clip_ratio/low_mean": 0.12465440481901169, "clip_ratio/low_min": 0.12465440481901169, "clip_ratio/high_mean": 0.07201832346618176, "clip_ratio/high_max": 0.07201832346618176, "clip_ratio/region_mean": 0.19667272828519344, "reward_total_mean": 0.06927891075611115, "reward_meter_mean": 0.26289302110671997, "reward_meter_std": 0.16595962643623352, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9588995575904846, "reward_lexical_plausibility_std": 0.06422513723373413, "reward_repeat_penalty_mean": 0.993451714515686, "reward_repeat_penalty_std": 0.013639457523822784, "reward_near_duplicate_penalty_mean": 0.9976036548614502, "reward_near_duplicate_penalty_std": 0.0023936352226883173, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9958193898200989, "reward_distinct_2_std": 0.0118245305493474, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.06927891075611115, "reward_total_composite_std": 0.06271076202392578} {"timestamp_utc": "2026-04-12T11:26:31Z", "mode": "train", "global_step": 191, "epoch": 0.007671607020926216, "loss": 0.073, "grad_norm": 11.953428268432617, "learning_rate": 9.424242424242425e-06, "num_tokens": 403246.0, "completions/mean_length": 67.75, "completions/min_length": 63.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.75, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.4731566905975342, "rewards/meter/std": 0.4082699120044708, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4374999701976776, "rewards/judge_quality/std": 0.1642080396413803, "rewards/repeat_penalty/mean": 0.9625617265701294, "rewards/repeat_penalty/std": 0.04136313870549202, "rewards/near_duplicate_penalty/mean": 0.9850481748580933, "rewards/near_duplicate_penalty/std": 0.01034289225935936, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9771062135696411, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.2468075454235077, "rewards/total_composite/std": 0.26338961720466614, "reward": 0.2468075454235077, "reward_std": 0.26338958740234375, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23241984844207764, "sampling/sampling_logp_difference/max": 1.9645910263061523, "sampling/importance_sampling_ratio/min": 0.1402132213115692, "sampling/importance_sampling_ratio/mean": 1.0427559614181519, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.699978247284889, "clip_ratio/low_mean": 0.10380714759230614, "clip_ratio/low_min": 0.10380714759230614, "clip_ratio/high_mean": 0.07659748196601868, "clip_ratio/high_max": 0.07659748196601868, "clip_ratio/region_mean": 0.1804046295583248, "reward_total_mean": 0.2468075454235077, "reward_meter_mean": 0.4731566905975342, "reward_meter_std": 0.4082699120044708, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9625617265701294, "reward_repeat_penalty_std": 0.04136313870549202, "reward_near_duplicate_penalty_mean": 0.9850481748580933, "reward_near_duplicate_penalty_std": 0.01034289225935936, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9771062135696411, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.4374999701976776, "reward_judge_quality_std": 0.1642080396413803, "reward_total_composite_mean": 0.2468075454235077, "reward_total_composite_std": 0.26338961720466614} {"timestamp_utc": "2026-04-12T11:26:45Z", "mode": "train", "global_step": 192, "epoch": 0.00771177250271117, "loss": 0.0741, "grad_norm": 8.319887161254883, "learning_rate": 9.421212121212122e-06, "num_tokens": 405928.0, "completions/mean_length": 149.25, "completions/min_length": 117.0, "completions/max_length": 186.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 149.25, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 186.0, "rewards/meter/mean": 0.6476424336433411, "rewards/meter/std": 0.2817014753818512, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9902408123016357, "rewards/repeat_penalty/std": 0.011109532788395882, "rewards/near_duplicate_penalty/mean": 0.9966154098510742, "rewards/near_duplicate_penalty/std": 0.003634650958701968, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9935892224311829, "rewards/distinct_2/std": 0.008848296478390694, "rewards/total_composite/mean": 0.18223273754119873, "rewards/total_composite/std": 0.11901077628135681, "reward": 0.18223273754119873, "reward_std": 0.11901078373193741, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2439643144607544, "sampling/sampling_logp_difference/max": 1.388969898223877, "sampling/importance_sampling_ratio/min": 0.2493320107460022, "sampling/importance_sampling_ratio/mean": 1.0756523609161377, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.0335632264614105, "clip_ratio/low_mean": 0.09023445472121239, "clip_ratio/low_min": 0.09023445472121239, "clip_ratio/high_mean": 0.12000403553247452, "clip_ratio/high_max": 0.12000403553247452, "clip_ratio/region_mean": 0.2102384902536869, "reward_total_mean": 0.18223273754119873, "reward_meter_mean": 0.6476424336433411, "reward_meter_std": 0.2817014753818512, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9902408123016357, "reward_repeat_penalty_std": 0.011109532788395882, "reward_near_duplicate_penalty_mean": 0.9966154098510742, "reward_near_duplicate_penalty_std": 0.003634650958701968, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9935892224311829, "reward_distinct_2_std": 0.008848296478390694, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.18223273754119873, "reward_total_composite_std": 0.11901077628135681} {"timestamp_utc": "2026-04-12T11:26:56Z", "mode": "train", "global_step": 193, "epoch": 0.007751937984496124, "loss": -0.0772, "grad_norm": 16.670808792114258, "learning_rate": 9.418181818181818e-06, "num_tokens": 407423.0, "completions/mean_length": 39.875, "completions/min_length": 32.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.38676023483276367, "rewards/meter/std": 0.40895742177963257, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9810949563980103, "rewards/repeat_penalty/std": 0.046554312109947205, "rewards/near_duplicate_penalty/mean": 0.99781733751297, "rewards/near_duplicate_penalty/std": 0.00369036546908319, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.15096087753772736, "rewards/total_composite/std": 0.1640724241733551, "reward": 0.15096087753772736, "reward_std": 0.1640724241733551, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25328776240348816, "sampling/sampling_logp_difference/max": 1.7909431457519531, "sampling/importance_sampling_ratio/min": 0.166802778840065, "sampling/importance_sampling_ratio/mean": 1.0317927598953247, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5228359401226044, "clip_ratio/low_mean": 0.12745822221040726, "clip_ratio/low_min": 0.12745822221040726, "clip_ratio/high_mean": 0.0722408052533865, "clip_ratio/high_max": 0.0722408052533865, "clip_ratio/region_mean": 0.19969902746379375, "reward_total_mean": 0.15096087753772736, "reward_meter_mean": 0.38676023483276367, "reward_meter_std": 0.40895742177963257, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9810949563980103, "reward_repeat_penalty_std": 0.046554312109947205, "reward_near_duplicate_penalty_mean": 0.99781733751297, "reward_near_duplicate_penalty_std": 0.00369036546908319, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.15096087753772736, "reward_total_composite_std": 0.1640724241733551} {"timestamp_utc": "2026-04-12T11:27:07Z", "mode": "train", "global_step": 194, "epoch": 0.007792103466281078, "loss": 0.0542, "grad_norm": 7.748849868774414, "learning_rate": 9.415151515151515e-06, "num_tokens": 410166.0, "completions/mean_length": 148.875, "completions/min_length": 129.0, "completions/max_length": 177.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 148.875, "completions/min_terminated_length": 129.0, "completions/max_terminated_length": 177.0, "rewards/meter/mean": 0.46342623233795166, "rewards/meter/std": 0.29466667771339417, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.10101525485515594, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9451513886451721, "rewards/lexical_plausibility/std": 0.08803725242614746, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.993679404258728, "rewards/repeat_penalty/std": 0.008588011376559734, "rewards/near_duplicate_penalty/mean": 0.996414065361023, "rewards/near_duplicate_penalty/std": 0.002788442187011242, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9972527623176575, "rewards/distinct_2/std": 0.007770403753966093, "rewards/total_composite/mean": 0.09386736899614334, "rewards/total_composite/std": 0.1131976842880249, "reward": 0.09386736899614334, "reward_std": 0.1131976842880249, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25746795535087585, "sampling/sampling_logp_difference/max": 2.3538103103637695, "sampling/importance_sampling_ratio/min": 0.09500646591186523, "sampling/importance_sampling_ratio/mean": 1.0607352256774902, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.6030998826026917, "clip_ratio/low_mean": 0.16044802591204643, "clip_ratio/low_min": 0.16044802591204643, "clip_ratio/high_mean": 0.05099865794181824, "clip_ratio/high_max": 0.05099865794181824, "clip_ratio/region_mean": 0.21144668385386467, "reward_total_mean": 0.09386736899614334, "reward_meter_mean": 0.46342623233795166, "reward_meter_std": 0.29466667771339417, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.10101525485515594, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9451513886451721, "reward_lexical_plausibility_std": 0.08803725242614746, "reward_repeat_penalty_mean": 0.993679404258728, "reward_repeat_penalty_std": 0.008588011376559734, "reward_near_duplicate_penalty_mean": 0.996414065361023, "reward_near_duplicate_penalty_std": 0.002788442187011242, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9972527623176575, "reward_distinct_2_std": 0.007770403753966093, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.09386736899614334, "reward_total_composite_std": 0.1131976842880249} {"timestamp_utc": "2026-04-12T11:27:17Z", "mode": "train", "global_step": 195, "epoch": 0.007832268948066032, "loss": 0.0599, "grad_norm": 11.657549858093262, "learning_rate": 9.412121212121212e-06, "num_tokens": 412182.0, "completions/mean_length": 76.0, "completions/min_length": 68.0, "completions/max_length": 83.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 76.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.4964779317378998, "rewards/meter/std": 0.23041903972625732, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9986978769302368, "rewards/lexical_plausibility/std": 0.0036828548181802034, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9933637976646423, "rewards/repeat_penalty/std": 0.005556311458349228, "rewards/near_duplicate_penalty/mean": 0.9933637976646423, "rewards/near_duplicate_penalty/std": 0.005556311458349228, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20080244541168213, "rewards/total_composite/std": 0.10564137250185013, "reward": 0.20080244541168213, "reward_std": 0.10564136505126953, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22843697667121887, "sampling/sampling_logp_difference/max": 1.997262954711914, "sampling/importance_sampling_ratio/min": 0.13570620119571686, "sampling/importance_sampling_ratio/mean": 1.049808144569397, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.66208553314209, "clip_ratio/low_mean": 0.09703397192060947, "clip_ratio/low_min": 0.09703397192060947, "clip_ratio/high_mean": 0.08621727302670479, "clip_ratio/high_max": 0.08621727302670479, "clip_ratio/region_mean": 0.18325124494731426, "reward_total_mean": 0.20080244541168213, "reward_meter_mean": 0.4964779317378998, "reward_meter_std": 0.23041903972625732, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9986978769302368, "reward_lexical_plausibility_std": 0.0036828548181802034, "reward_repeat_penalty_mean": 0.9933637976646423, "reward_repeat_penalty_std": 0.005556311458349228, "reward_near_duplicate_penalty_mean": 0.9933637976646423, "reward_near_duplicate_penalty_std": 0.005556311458349228, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.20080244541168213, "reward_total_composite_std": 0.10564137250185013} {"timestamp_utc": "2026-04-12T11:27:26Z", "mode": "train", "global_step": 196, "epoch": 0.007872434429850986, "loss": 0.0102, "grad_norm": 15.35546588897705, "learning_rate": 9.40909090909091e-06, "num_tokens": 413508.0, "completions/mean_length": 15.75, "completions/min_length": 14.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.75, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.9720182418823242, "rewards/meter/std": 0.018872657790780067, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7775000333786011, "rewards/judge_quality/std": 0.26385873556137085, "rewards/repeat_penalty/mean": 0.6641231775283813, "rewards/repeat_penalty/std": 0.09269300103187561, "rewards/near_duplicate_penalty/mean": 0.8854975700378418, "rewards/near_duplicate_penalty/std": 0.12359067052602768, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7585351467132568, "rewards/total_composite/std": 0.26263073086738586, "reward": 0.7585351467132568, "reward_std": 0.26263073086738586, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15669620037078857, "sampling/sampling_logp_difference/max": 1.0087833404541016, "sampling/importance_sampling_ratio/min": 0.36466237902641296, "sampling/importance_sampling_ratio/mean": 1.0573863983154297, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0078484639525414, "clip_ratio/low_mean": 0.033333334140479565, "clip_ratio/low_min": 0.033333334140479565, "clip_ratio/high_mean": 0.07552760001271963, "clip_ratio/high_max": 0.07552760001271963, "clip_ratio/region_mean": 0.1088609341531992, "reward_total_mean": 0.7585351467132568, "reward_meter_mean": 0.9720182418823242, "reward_meter_std": 0.018872657790780067, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6641231775283813, "reward_repeat_penalty_std": 0.09269300103187561, "reward_near_duplicate_penalty_mean": 0.8854975700378418, "reward_near_duplicate_penalty_std": 0.12359067052602768, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7775000333786011, "reward_judge_quality_std": 0.26385873556137085, "reward_total_composite_mean": 0.7585351467132568, "reward_total_composite_std": 0.26263073086738586} {"timestamp_utc": "2026-04-12T11:27:44Z", "mode": "train", "global_step": 197, "epoch": 0.00791259991163594, "loss": -0.0622, "grad_norm": 7.669545650482178, "learning_rate": 9.406060606060607e-06, "num_tokens": 416069.0, "completions/mean_length": 197.125, "completions/min_length": 122.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 152.1428680419922, "completions/min_terminated_length": 122.0, "completions/max_terminated_length": 173.0, "rewards/meter/mean": 0.2418033331632614, "rewards/meter/std": 0.10072522610425949, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.9564472436904907, "rewards/lexical_plausibility/std": 0.11238300800323486, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9782454371452332, "rewards/repeat_penalty/std": 0.025253357365727425, "rewards/near_duplicate_penalty/mean": 0.9932018518447876, "rewards/near_duplicate_penalty/std": 0.0027052685618400574, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.984892725944519, "rewards/distinct_2/std": 0.023083476349711418, "rewards/total_composite/mean": 0.04156244173645973, "rewards/total_composite/std": 0.057584863156080246, "reward": 0.04156244173645973, "reward_std": 0.05758485570549965, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23801890015602112, "sampling/sampling_logp_difference/max": 1.5554094314575195, "sampling/importance_sampling_ratio/min": 0.2111029326915741, "sampling/importance_sampling_ratio/mean": 1.0642399787902832, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8230305314064026, "clip_ratio/low_mean": 0.10472686402499676, "clip_ratio/low_min": 0.10472686402499676, "clip_ratio/high_mean": 0.0750449001789093, "clip_ratio/high_max": 0.0750449001789093, "clip_ratio/region_mean": 0.17977176420390606, "reward_total_mean": 0.04156244173645973, "reward_meter_mean": 0.2418033331632614, "reward_meter_std": 0.10072522610425949, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.9564472436904907, "reward_lexical_plausibility_std": 0.11238300800323486, "reward_repeat_penalty_mean": 0.9782454371452332, "reward_repeat_penalty_std": 0.025253357365727425, "reward_near_duplicate_penalty_mean": 0.9932018518447876, "reward_near_duplicate_penalty_std": 0.0027052685618400574, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.984892725944519, "reward_distinct_2_std": 0.023083476349711418, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.04156244173645973, "reward_total_composite_std": 0.057584863156080246} {"timestamp_utc": "2026-04-12T11:27:55Z", "mode": "train", "global_step": 198, "epoch": 0.007952765393420894, "loss": 0.075, "grad_norm": 15.811528205871582, "learning_rate": 9.403030303030304e-06, "num_tokens": 417835.0, "completions/mean_length": 52.75, "completions/min_length": 45.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.75, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.44315749406814575, "rewards/meter/std": 0.33838579058647156, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.4662500023841858, "rewards/judge_quality/std": 0.2180391401052475, "rewards/repeat_penalty/mean": 0.9951223134994507, "rewards/repeat_penalty/std": 0.010539373382925987, "rewards/near_duplicate_penalty/mean": 0.9951223134994507, "rewards/near_duplicate_penalty/std": 0.010539373382925987, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16395926475524902, "rewards/total_composite/std": 0.1340993195772171, "reward": 0.16395926475524902, "reward_std": 0.1340993195772171, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2545931339263916, "sampling/sampling_logp_difference/max": 2.2817153930664062, "sampling/importance_sampling_ratio/min": 0.102108895778656, "sampling/importance_sampling_ratio/mean": 1.0445752143859863, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5573186725378036, "clip_ratio/low_mean": 0.10163934528827667, "clip_ratio/low_min": 0.10163934528827667, "clip_ratio/high_mean": 0.08619281370192766, "clip_ratio/high_max": 0.08619281370192766, "clip_ratio/region_mean": 0.18783215899020433, "reward_total_mean": 0.16395926475524902, "reward_meter_mean": 0.44315749406814575, "reward_meter_std": 0.33838579058647156, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9951223134994507, "reward_repeat_penalty_std": 0.010539373382925987, "reward_near_duplicate_penalty_mean": 0.9951223134994507, "reward_near_duplicate_penalty_std": 0.010539373382925987, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4662500023841858, "reward_judge_quality_std": 0.2180391401052475, "reward_total_composite_mean": 0.16395926475524902, "reward_total_composite_std": 0.1340993195772171} {"timestamp_utc": "2026-04-12T11:28:05Z", "mode": "train", "global_step": 199, "epoch": 0.007992930875205848, "loss": 0.0383, "grad_norm": 17.07819175720215, "learning_rate": 9.4e-06, "num_tokens": 419442.0, "completions/mean_length": 37.875, "completions/min_length": 35.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8455114364624023, "rewards/meter/std": 0.33083054423332214, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9853488206863403, "rewards/lexical_plausibility/std": 0.034790314733982086, "rewards/judge_quality/mean": 0.4412499964237213, "rewards/judge_quality/std": 0.1829470992088318, "rewards/repeat_penalty/mean": 0.9876461029052734, "rewards/repeat_penalty/std": 0.018724631518125534, "rewards/near_duplicate_penalty/mean": 0.9876461029052734, "rewards/near_duplicate_penalty/std": 0.018724631518125534, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3867346942424774, "rewards/total_composite/std": 0.23983639478683472, "reward": 0.3867346942424774, "reward_std": 0.23983637988567352, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22389063239097595, "sampling/sampling_logp_difference/max": 1.426994800567627, "sampling/importance_sampling_ratio/min": 0.24002918601036072, "sampling/importance_sampling_ratio/mean": 1.045613408088684, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.696754664182663, "clip_ratio/low_mean": 0.10653246194124222, "clip_ratio/low_min": 0.10653246194124222, "clip_ratio/high_mean": 0.06676681339740753, "clip_ratio/high_max": 0.06676681339740753, "clip_ratio/region_mean": 0.17329927533864975, "reward_total_mean": 0.3867346942424774, "reward_meter_mean": 0.8455114364624023, "reward_meter_std": 0.33083054423332214, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9853488206863403, "reward_lexical_plausibility_std": 0.034790314733982086, "reward_repeat_penalty_mean": 0.9876461029052734, "reward_repeat_penalty_std": 0.018724631518125534, "reward_near_duplicate_penalty_mean": 0.9876461029052734, "reward_near_duplicate_penalty_std": 0.018724631518125534, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4412499964237213, "reward_judge_quality_std": 0.1829470992088318, "reward_total_composite_mean": 0.3867346942424774, "reward_total_composite_std": 0.23983639478683472} {"timestamp_utc": "2026-04-12T11:28:14Z", "mode": "train", "global_step": 200, "epoch": 0.008033096356990801, "loss": -0.002, "grad_norm": 12.940689086914062, "learning_rate": 9.396969696969697e-06, "num_tokens": 420952.0, "completions/mean_length": 27.75, "completions/min_length": 26.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.75, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.8510260581970215, "rewards/meter/std": 0.3145773410797119, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9624999761581421, "rewards/judge_quality/std": 0.023145509883761406, "rewards/repeat_penalty/mean": 0.9975649118423462, "rewards/repeat_penalty/std": 0.006887406576424837, "rewards/near_duplicate_penalty/mean": 0.9975649118423462, "rewards/near_duplicate_penalty/std": 0.006887406576424837, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.820294201374054, "rewards/total_composite/std": 0.3036881983280182, "reward": 0.820294201374054, "reward_std": 0.3036881983280182, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06326823681592941, "sampling/sampling_logp_difference/max": 0.9554257392883301, "sampling/importance_sampling_ratio/min": 0.3846483826637268, "sampling/importance_sampling_ratio/mean": 1.0123517513275146, "sampling/importance_sampling_ratio/max": 1.8747886419296265, "entropy": 0.29799419827759266, "clip_ratio/low_mean": 0.008928571827709675, "clip_ratio/low_min": 0.008928571827709675, "clip_ratio/high_mean": 0.04856243031099439, "clip_ratio/high_max": 0.04856243031099439, "clip_ratio/region_mean": 0.05749100213870406, "reward_total_mean": 0.820294201374054, "reward_meter_mean": 0.8510260581970215, "reward_meter_std": 0.3145773410797119, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9975649118423462, "reward_repeat_penalty_std": 0.006887406576424837, "reward_near_duplicate_penalty_mean": 0.9975649118423462, "reward_near_duplicate_penalty_std": 0.006887406576424837, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9624999761581421, "reward_judge_quality_std": 0.023145509883761406, "reward_total_composite_mean": 0.820294201374054, "reward_total_composite_std": 0.3036881983280182} {"timestamp_utc": "2026-04-12T11:30:29Z", "mode": "eval", "global_step": 200, "epoch": 0.008033096356990801, "eval_loss": NaN, "eval_runtime": 135.1266, "eval_samples_per_second": 0.77, "eval_steps_per_second": 0.096, "eval_num_tokens": 420952.0, "eval_completions/mean_length": 136.65384615384616, "eval_completions/min_length": 34.07692307692308, "eval_completions/max_length": 326.2307692307692, "eval_completions/clipped_ratio": 0.009615384615384616, "eval_completions/mean_terminated_length": 132.82005544809195, "eval_completions/min_terminated_length": 34.07692307692308, "eval_completions/max_terminated_length": 317.15384615384613, "eval_rewards/meter/mean": 0.30902680640037244, "eval_rewards/meter/std": 0.3418757256407004, "eval_rewards/count_adherence/mean": 0.9369382766576914, "eval_rewards/count_adherence/std": 0.1166658506083947, "eval_rewards/arabic_clean/mean": 0.8461538461538461, "eval_rewards/arabic_clean/std": 0.314018373305981, "eval_rewards/lexical_plausibility/mean": 0.9651182614839994, "eval_rewards/lexical_plausibility/std": 0.07399109987398753, "eval_rewards/judge_quality/mean": 0.3369230765562791, "eval_rewards/judge_quality/std": 0.1494664383622316, "eval_rewards/repeat_penalty/mean": 0.9602930866754972, "eval_rewards/repeat_penalty/std": 0.06996360016413607, "eval_rewards/near_duplicate_penalty/mean": 0.9855904900110685, "eval_rewards/near_duplicate_penalty/std": 0.025130621175496623, "eval_rewards/opening_diversity/mean": 0.9879807692307693, "eval_rewards/opening_diversity/std": 0.03399551774446781, "eval_rewards/distinct_2/mean": 0.9864450830679673, "eval_rewards/distinct_2/std": 0.02632404539662485, "eval_rewards/total_composite/mean": 0.09235788251344974, "eval_rewards/total_composite/std": 0.12527622626377985, "eval_reward": 0.09235788251344974, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.17638242817842043, "eval_sampling/sampling_logp_difference/max": 1.21868713085468, "eval_sampling/importance_sampling_ratio/min": 0.2973355467502887, "eval_sampling/importance_sampling_ratio/mean": 1.058694784457867, "eval_sampling/importance_sampling_ratio/max": 1.7514545642412627, "eval_entropy": 3.374564317556528, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.09235788251344974, "eval_reward_meter_mean": 0.30902680640037244, "eval_reward_meter_std": 0.3418757256407004, "eval_reward_count_adherence_mean": 0.9369382766576914, "eval_reward_count_adherence_std": 0.1166658506083947, "eval_reward_arabic_clean_mean": 0.8461538461538461, "eval_reward_arabic_clean_std": 0.314018373305981, "eval_reward_lexical_plausibility_mean": 0.9651182614839994, "eval_reward_lexical_plausibility_std": 0.07399109987398753, "eval_reward_repeat_penalty_mean": 0.9602930866754972, "eval_reward_repeat_penalty_std": 0.06996360016413607, "eval_reward_near_duplicate_penalty_mean": 0.9855904900110685, "eval_reward_near_duplicate_penalty_std": 0.025130621175496623, "eval_reward_opening_diversity_mean": 0.9879807692307693, "eval_reward_opening_diversity_std": 0.03399551774446781, "eval_reward_distinct_2_mean": 0.9864450830679673, "eval_reward_distinct_2_std": 0.02632404539662485, "eval_reward_judge_quality_mean": 0.3369230765562791, "eval_reward_judge_quality_std": 0.1494664383622316, "eval_reward_total_composite_mean": 0.09235788251344974, "eval_reward_total_composite_std": 0.12527622626377985} {"timestamp_utc": "2026-04-12T11:30:41Z", "mode": "train", "global_step": 201, "epoch": 0.008073261838775755, "loss": 0.0372, "grad_norm": 25.896852493286133, "learning_rate": 9.393939393939396e-06, "num_tokens": 422224.0, "completions/mean_length": 15.0, "completions/min_length": 13.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.0, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.12249067425727844, "rewards/meter/std": 0.34225091338157654, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.8237500190734863, "rewards/judge_quality/std": 0.2722361385822296, "rewards/repeat_penalty/mean": 0.875, "rewards/repeat_penalty/std": 0.13363061845302582, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11268244683742523, "rewards/total_composite/std": 0.3148745000362396, "reward": 0.11268244683742523, "reward_std": 0.3148745000362396, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.266227126121521, "sampling/sampling_logp_difference/max": 1.3496150970458984, "sampling/importance_sampling_ratio/min": 0.2593400478363037, "sampling/importance_sampling_ratio/mean": 1.0251189470291138, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0586407631635666, "clip_ratio/low_mean": 0.23556076735258102, "clip_ratio/low_min": 0.23556076735258102, "clip_ratio/high_mean": 0.03333333507180214, "clip_ratio/high_max": 0.03333333507180214, "clip_ratio/region_mean": 0.26889410242438316, "reward_total_mean": 0.11268244683742523, "reward_meter_mean": 0.12249067425727844, "reward_meter_std": 0.34225091338157654, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.875, "reward_repeat_penalty_std": 0.13363061845302582, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8237500190734863, "reward_judge_quality_std": 0.2722361385822296, "reward_total_composite_mean": 0.11268244683742523, "reward_total_composite_std": 0.3148745000362396} {"timestamp_utc": "2026-04-12T11:30:52Z", "mode": "train", "global_step": 202, "epoch": 0.00811342732056071, "loss": 0.0907, "grad_norm": 19.980554580688477, "learning_rate": 9.390909090909092e-06, "num_tokens": 424013.0, "completions/mean_length": 58.625, "completions/min_length": 41.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.625, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.48397544026374817, "rewards/meter/std": 0.2964073717594147, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9771234393119812, "rewards/repeat_penalty/std": 0.026555240154266357, "rewards/near_duplicate_penalty/mean": 0.9825642704963684, "rewards/near_duplicate_penalty/std": 0.014555198140442371, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9943438768386841, "rewards/distinct_2/std": 0.015997890383005142, "rewards/total_composite/mean": 0.20144273340702057, "rewards/total_composite/std": 0.13822034001350403, "reward": 0.20144273340702057, "reward_std": 0.13822034001350403, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.26058104634284973, "sampling/sampling_logp_difference/max": 2.380445957183838, "sampling/importance_sampling_ratio/min": 0.09250931441783905, "sampling/importance_sampling_ratio/mean": 0.9931546449661255, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1785653233528137, "clip_ratio/low_mean": 0.09098550211638212, "clip_ratio/low_min": 0.09098550211638212, "clip_ratio/high_mean": 0.11108248308300972, "clip_ratio/high_max": 0.11108248308300972, "clip_ratio/region_mean": 0.20206798519939184, "reward_total_mean": 0.20144273340702057, "reward_meter_mean": 0.48397544026374817, "reward_meter_std": 0.2964073717594147, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9771234393119812, "reward_repeat_penalty_std": 0.026555240154266357, "reward_near_duplicate_penalty_mean": 0.9825642704963684, "reward_near_duplicate_penalty_std": 0.014555198140442371, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9943438768386841, "reward_distinct_2_std": 0.015997890383005142, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.20144273340702057, "reward_total_composite_std": 0.13822034001350403} {"timestamp_utc": "2026-04-12T11:31:03Z", "mode": "train", "global_step": 203, "epoch": 0.008153592802345663, "loss": 0.0833, "grad_norm": 13.165058135986328, "learning_rate": 9.387878787878789e-06, "num_tokens": 425960.0, "completions/mean_length": 63.375, "completions/min_length": 47.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.375, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.6267312169075012, "rewards/meter/std": 0.348740816116333, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9877314567565918, "rewards/repeat_penalty/std": 0.01641863025724888, "rewards/near_duplicate_penalty/mean": 0.9877314567565918, "rewards/near_duplicate_penalty/std": 0.01641863025724888, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2830621600151062, "rewards/total_composite/std": 0.1662304848432541, "reward": 0.2830621600151062, "reward_std": 0.1662304699420929, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22839851677417755, "sampling/sampling_logp_difference/max": 1.754427433013916, "sampling/importance_sampling_ratio/min": 0.17300626635551453, "sampling/importance_sampling_ratio/mean": 1.0571361780166626, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7351140081882477, "clip_ratio/low_mean": 0.07908606342971325, "clip_ratio/low_min": 0.07908606342971325, "clip_ratio/high_mean": 0.14272558316588402, "clip_ratio/high_max": 0.14272558316588402, "clip_ratio/region_mean": 0.22181164659559727, "reward_total_mean": 0.2830621600151062, "reward_meter_mean": 0.6267312169075012, "reward_meter_std": 0.348740816116333, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9877314567565918, "reward_repeat_penalty_std": 0.01641863025724888, "reward_near_duplicate_penalty_mean": 0.9877314567565918, "reward_near_duplicate_penalty_std": 0.01641863025724888, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.2830621600151062, "reward_total_composite_std": 0.1662304848432541} {"timestamp_utc": "2026-04-12T11:31:15Z", "mode": "train", "global_step": 204, "epoch": 0.008193758284130619, "loss": 0.086, "grad_norm": 9.738399505615234, "learning_rate": 9.384848484848486e-06, "num_tokens": 428504.0, "completions/mean_length": 118.0, "completions/min_length": 98.0, "completions/max_length": 177.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 118.0, "completions/min_terminated_length": 98.0, "completions/max_terminated_length": 177.0, "rewards/meter/mean": 0.42173734307289124, "rewards/meter/std": 0.3321233093738556, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9744639992713928, "rewards/lexical_plausibility/std": 0.04792870581150055, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.13024701178073883, "rewards/repeat_penalty/mean": 0.9906821846961975, "rewards/repeat_penalty/std": 0.011881274171173573, "rewards/near_duplicate_penalty/mean": 0.9938464760780334, "rewards/near_duplicate_penalty/std": 0.003660287708044052, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9967948794364929, "rewards/distinct_2/std": 0.009065471589565277, "rewards/total_composite/mean": 0.13917693495750427, "rewards/total_composite/std": 0.1455865055322647, "reward": 0.13917693495750427, "reward_std": 0.1455865055322647, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22692568600177765, "sampling/sampling_logp_difference/max": 1.8165950775146484, "sampling/importance_sampling_ratio/min": 0.16257837414741516, "sampling/importance_sampling_ratio/mean": 1.043134093284607, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9794090688228607, "clip_ratio/low_mean": 0.11748682335019112, "clip_ratio/low_min": 0.11748682335019112, "clip_ratio/high_mean": 0.09248615801334381, "clip_ratio/high_max": 0.09248615801334381, "clip_ratio/region_mean": 0.20997298136353493, "reward_total_mean": 0.13917693495750427, "reward_meter_mean": 0.42173734307289124, "reward_meter_std": 0.3321233093738556, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9744639992713928, "reward_lexical_plausibility_std": 0.04792870581150055, "reward_repeat_penalty_mean": 0.9906821846961975, "reward_repeat_penalty_std": 0.011881274171173573, "reward_near_duplicate_penalty_mean": 0.9938464760780334, "reward_near_duplicate_penalty_std": 0.003660287708044052, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9967948794364929, "reward_distinct_2_std": 0.009065471589565277, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.13024701178073883, "reward_total_composite_mean": 0.13917693495750427, "reward_total_composite_std": 0.1455865055322647} {"timestamp_utc": "2026-04-12T11:31:25Z", "mode": "train", "global_step": 205, "epoch": 0.008233923765915573, "loss": -0.0142, "grad_norm": 20.657299041748047, "learning_rate": 9.381818181818183e-06, "num_tokens": 429834.0, "completions/mean_length": 19.25, "completions/min_length": 14.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.25, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.2705998122692108, "rewards/meter/std": 0.4059388041496277, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.7417961359024048, "rewards/repeat_penalty/std": 0.019032426178455353, "rewards/near_duplicate_penalty/mean": 0.9890615344047546, "rewards/near_duplicate_penalty/std": 0.025376567617058754, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13873904943466187, "rewards/total_composite/std": 0.1813613921403885, "reward": 0.13873904943466187, "reward_std": 0.1813613772392273, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21271474659442902, "sampling/sampling_logp_difference/max": 2.7158546447753906, "sampling/importance_sampling_ratio/min": 0.06614840030670166, "sampling/importance_sampling_ratio/mean": 1.0115232467651367, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6228943169116974, "clip_ratio/low_mean": 0.11069627152755857, "clip_ratio/low_min": 0.11069627152755857, "clip_ratio/high_mean": 0.10267857275903225, "clip_ratio/high_max": 0.10267857275903225, "clip_ratio/region_mean": 0.21337484428659081, "reward_total_mean": 0.13873904943466187, "reward_meter_mean": 0.2705998122692108, "reward_meter_std": 0.4059388041496277, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7417961359024048, "reward_repeat_penalty_std": 0.019032426178455353, "reward_near_duplicate_penalty_mean": 0.9890615344047546, "reward_near_duplicate_penalty_std": 0.025376567617058754, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.13873904943466187, "reward_total_composite_std": 0.1813613921403885} {"timestamp_utc": "2026-04-12T11:31:37Z", "mode": "train", "global_step": 206, "epoch": 0.008274089247700527, "loss": 0.0229, "grad_norm": 9.159485816955566, "learning_rate": 9.378787878787879e-06, "num_tokens": 432181.0, "completions/mean_length": 113.375, "completions/min_length": 105.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.375, "completions/min_terminated_length": 105.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.5422508716583252, "rewards/meter/std": 0.2832096219062805, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9863553047180176, "rewards/lexical_plausibility/std": 0.030255554243922234, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.994197428226471, "rewards/repeat_penalty/std": 0.0035559621173888445, "rewards/near_duplicate_penalty/mean": 0.994197428226471, "rewards/near_duplicate_penalty/std": 0.0035559621173888445, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19081418216228485, "rewards/total_composite/std": 0.1504496932029724, "reward": 0.19081418216228485, "reward_std": 0.1504496932029724, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24501466751098633, "sampling/sampling_logp_difference/max": 1.6380634307861328, "sampling/importance_sampling_ratio/min": 0.1943560689687729, "sampling/importance_sampling_ratio/mean": 1.0631917715072632, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.452824503183365, "clip_ratio/low_mean": 0.08842740207910538, "clip_ratio/low_min": 0.08842740207910538, "clip_ratio/high_mean": 0.10499803721904755, "clip_ratio/high_max": 0.10499803721904755, "clip_ratio/region_mean": 0.19342543929815292, "reward_total_mean": 0.19081418216228485, "reward_meter_mean": 0.5422508716583252, "reward_meter_std": 0.2832096219062805, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9863553047180176, "reward_lexical_plausibility_std": 0.030255554243922234, "reward_repeat_penalty_mean": 0.994197428226471, "reward_repeat_penalty_std": 0.0035559621173888445, "reward_near_duplicate_penalty_mean": 0.994197428226471, "reward_near_duplicate_penalty_std": 0.0035559621173888445, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.19081418216228485, "reward_total_composite_std": 0.1504496932029724} {"timestamp_utc": "2026-04-12T11:31:46Z", "mode": "train", "global_step": 207, "epoch": 0.00831425472948548, "loss": 0.1455, "grad_norm": 12.16246509552002, "learning_rate": 9.375757575757576e-06, "num_tokens": 434091.0, "completions/mean_length": 65.75, "completions/min_length": 34.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.75, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.2150837779045105, "rewards/meter/std": 0.20138275623321533, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8963750600814819, "rewards/lexical_plausibility/std": 0.15007846057415009, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.11952286213636398, "rewards/repeat_penalty/mean": 0.9773169755935669, "rewards/repeat_penalty/std": 0.028806151822209358, "rewards/near_duplicate_penalty/mean": 0.9923085570335388, "rewards/near_duplicate_penalty/std": 0.012803086079657078, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9847860336303711, "rewards/distinct_2/std": 0.021188830956816673, "rewards/total_composite/mean": 0.027725128456950188, "rewards/total_composite/std": 0.023525994271039963, "reward": 0.027725128456950188, "reward_std": 0.023525994271039963, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2611384391784668, "sampling/sampling_logp_difference/max": 1.3508033752441406, "sampling/importance_sampling_ratio/min": 0.25903207063674927, "sampling/importance_sampling_ratio/mean": 1.0614619255065918, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.64569291472435, "clip_ratio/low_mean": 0.1289540696889162, "clip_ratio/low_min": 0.1289540696889162, "clip_ratio/high_mean": 0.07995899952948093, "clip_ratio/high_max": 0.07995899952948093, "clip_ratio/region_mean": 0.20891306921839714, "reward_total_mean": 0.027725128456950188, "reward_meter_mean": 0.2150837779045105, "reward_meter_std": 0.20138275623321533, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8963750600814819, "reward_lexical_plausibility_std": 0.15007846057415009, "reward_repeat_penalty_mean": 0.9773169755935669, "reward_repeat_penalty_std": 0.028806151822209358, "reward_near_duplicate_penalty_mean": 0.9923085570335388, "reward_near_duplicate_penalty_std": 0.012803086079657078, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9847860336303711, "reward_distinct_2_std": 0.021188830956816673, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.11952286213636398, "reward_total_composite_mean": 0.027725128456950188, "reward_total_composite_std": 0.023525994271039963} {"timestamp_utc": "2026-04-12T11:31:57Z", "mode": "train", "global_step": 208, "epoch": 0.008354420211270435, "loss": 0.1053, "grad_norm": 16.431283950805664, "learning_rate": 9.372727272727273e-06, "num_tokens": 435753.0, "completions/mean_length": 38.75, "completions/min_length": 31.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.75, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.5914057493209839, "rewards/meter/std": 0.413548082113266, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9763509035110474, "rewards/repeat_penalty/std": 0.01747816801071167, "rewards/near_duplicate_penalty/mean": 0.9763509035110474, "rewards/near_duplicate_penalty/std": 0.01747816801071167, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33764782547950745, "rewards/total_composite/std": 0.263327956199646, "reward": 0.33764782547950745, "reward_std": 0.263327956199646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1850842535495758, "sampling/sampling_logp_difference/max": 1.4391326904296875, "sampling/importance_sampling_ratio/min": 0.23713333904743195, "sampling/importance_sampling_ratio/mean": 1.0372931957244873, "sampling/importance_sampling_ratio/max": 1.936633825302124, "entropy": 1.8904611021280289, "clip_ratio/low_mean": 0.08714842796325684, "clip_ratio/low_min": 0.08714842796325684, "clip_ratio/high_mean": 0.07172770705074072, "clip_ratio/high_max": 0.07172770705074072, "clip_ratio/region_mean": 0.15887613501399755, "reward_total_mean": 0.33764782547950745, "reward_meter_mean": 0.5914057493209839, "reward_meter_std": 0.413548082113266, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9763509035110474, "reward_repeat_penalty_std": 0.01747816801071167, "reward_near_duplicate_penalty_mean": 0.9763509035110474, "reward_near_duplicate_penalty_std": 0.01747816801071167, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.33764782547950745, "reward_total_composite_std": 0.263327956199646} {"timestamp_utc": "2026-04-12T11:32:07Z", "mode": "train", "global_step": 209, "epoch": 0.008394585693055389, "loss": 0.0735, "grad_norm": 14.297948837280273, "learning_rate": 9.36969696969697e-06, "num_tokens": 437344.0, "completions/mean_length": 36.875, "completions/min_length": 30.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.17486268281936646, "rewards/meter/std": 0.34384360909461975, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9022783637046814, "rewards/repeat_penalty/std": 0.12628450989723206, "rewards/near_duplicate_penalty/mean": 0.9960283637046814, "rewards/near_duplicate_penalty/std": 0.007600844372063875, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.06744881719350815, "rewards/total_composite/std": 0.11959356814622879, "reward": 0.06744881719350815, "reward_std": 0.11959356814622879, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21043027937412262, "sampling/sampling_logp_difference/max": 1.7506370544433594, "sampling/importance_sampling_ratio/min": 0.17366325855255127, "sampling/importance_sampling_ratio/mean": 1.046602725982666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.123324006795883, "clip_ratio/low_mean": 0.08261993806809187, "clip_ratio/low_min": 0.08261993806809187, "clip_ratio/high_mean": 0.0787318553775549, "clip_ratio/high_max": 0.0787318553775549, "clip_ratio/region_mean": 0.16135179344564676, "reward_total_mean": 0.06744881719350815, "reward_meter_mean": 0.17486268281936646, "reward_meter_std": 0.34384360909461975, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9022783637046814, "reward_repeat_penalty_std": 0.12628450989723206, "reward_near_duplicate_penalty_mean": 0.9960283637046814, "reward_near_duplicate_penalty_std": 0.007600844372063875, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.06744881719350815, "reward_total_composite_std": 0.11959356814622879} {"timestamp_utc": "2026-04-12T11:32:18Z", "mode": "train", "global_step": 210, "epoch": 0.008434751174840343, "loss": 0.0118, "grad_norm": 11.766057014465332, "learning_rate": 9.366666666666668e-06, "num_tokens": 439282.0, "completions/mean_length": 70.25, "completions/min_length": 61.0, "completions/max_length": 89.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.25, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.28878700733184814, "rewards/meter/std": 0.4075119197368622, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9284815192222595, "rewards/repeat_penalty/std": 0.14472460746765137, "rewards/near_duplicate_penalty/mean": 0.9761557579040527, "rewards/near_duplicate_penalty/std": 0.02489008754491806, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9613729119300842, "rewards/distinct_2/std": 0.0950038805603981, "rewards/total_composite/mean": 0.06665698438882828, "rewards/total_composite/std": 0.13737748563289642, "reward": 0.06665698438882828, "reward_std": 0.13737748563289642, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23840616643428802, "sampling/sampling_logp_difference/max": 1.4764100313186646, "sampling/importance_sampling_ratio/min": 0.22845637798309326, "sampling/importance_sampling_ratio/mean": 1.0464091300964355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9943851232528687, "clip_ratio/low_mean": 0.1300221085548401, "clip_ratio/low_min": 0.1300221085548401, "clip_ratio/high_mean": 0.0685396883636713, "clip_ratio/high_max": 0.0685396883636713, "clip_ratio/region_mean": 0.1985617969185114, "reward_total_mean": 0.06665698438882828, "reward_meter_mean": 0.28878700733184814, "reward_meter_std": 0.4075119197368622, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9284815192222595, "reward_repeat_penalty_std": 0.14472460746765137, "reward_near_duplicate_penalty_mean": 0.9761557579040527, "reward_near_duplicate_penalty_std": 0.02489008754491806, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9613729119300842, "reward_distinct_2_std": 0.0950038805603981, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.06665698438882828, "reward_total_composite_std": 0.13737748563289642} {"timestamp_utc": "2026-04-12T11:32:28Z", "mode": "train", "global_step": 211, "epoch": 0.008474916656625297, "loss": -0.0371, "grad_norm": 10.741786003112793, "learning_rate": 9.363636363636365e-06, "num_tokens": 441558.0, "completions/mean_length": 87.5, "completions/min_length": 77.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.5, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.5041914582252502, "rewards/meter/std": 0.3094952702522278, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9887020587921143, "rewards/lexical_plausibility/std": 0.025517085567116737, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9968490600585938, "rewards/repeat_penalty/std": 0.0037891643587499857, "rewards/near_duplicate_penalty/mean": 0.9968490600585938, "rewards/near_duplicate_penalty/std": 0.0037891643587499857, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13640481233596802, "rewards/total_composite/std": 0.1014382466673851, "reward": 0.13640481233596802, "reward_std": 0.1014382466673851, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2291981279850006, "sampling/sampling_logp_difference/max": 1.4337005615234375, "sampling/importance_sampling_ratio/min": 0.23842500150203705, "sampling/importance_sampling_ratio/mean": 1.0694539546966553, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.521673172712326, "clip_ratio/low_mean": 0.1282580867409706, "clip_ratio/low_min": 0.1282580867409706, "clip_ratio/high_mean": 0.080580810084939, "clip_ratio/high_max": 0.080580810084939, "clip_ratio/region_mean": 0.20883889682590961, "reward_total_mean": 0.13640481233596802, "reward_meter_mean": 0.5041914582252502, "reward_meter_std": 0.3094952702522278, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9887020587921143, "reward_lexical_plausibility_std": 0.025517085567116737, "reward_repeat_penalty_mean": 0.9968490600585938, "reward_repeat_penalty_std": 0.0037891643587499857, "reward_near_duplicate_penalty_mean": 0.9968490600585938, "reward_near_duplicate_penalty_std": 0.0037891643587499857, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.13640481233596802, "reward_total_composite_std": 0.1014382466673851} {"timestamp_utc": "2026-04-12T11:32:37Z", "mode": "train", "global_step": 212, "epoch": 0.00851508213841025, "loss": 0.0301, "grad_norm": 18.575624465942383, "learning_rate": 9.36060606060606e-06, "num_tokens": 443146.0, "completions/mean_length": 38.5, "completions/min_length": 33.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.5946434736251831, "rewards/meter/std": 0.4882367253303528, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.9368149638175964, "rewards/repeat_penalty/std": 0.11532019823789597, "rewards/near_duplicate_penalty/mean": 0.9993149638175964, "rewards/near_duplicate_penalty/std": 0.0019375960109755397, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49817895889282227, "rewards/total_composite/std": 0.448115736246109, "reward": 0.49817895889282227, "reward_std": 0.44811567664146423, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19288630783557892, "sampling/sampling_logp_difference/max": 1.7310380935668945, "sampling/importance_sampling_ratio/min": 0.17710046470165253, "sampling/importance_sampling_ratio/mean": 1.0244054794311523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.718473881483078, "clip_ratio/low_mean": 0.10665038600564003, "clip_ratio/low_min": 0.10665038600564003, "clip_ratio/high_mean": 0.07521865144371986, "clip_ratio/high_max": 0.07521865144371986, "clip_ratio/region_mean": 0.1818690374493599, "reward_total_mean": 0.49817895889282227, "reward_meter_mean": 0.5946434736251831, "reward_meter_std": 0.4882367253303528, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9368149638175964, "reward_repeat_penalty_std": 0.11532019823789597, "reward_near_duplicate_penalty_mean": 0.9993149638175964, "reward_near_duplicate_penalty_std": 0.0019375960109755397, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.49817895889282227, "reward_total_composite_std": 0.448115736246109} {"timestamp_utc": "2026-04-12T11:32:48Z", "mode": "train", "global_step": 213, "epoch": 0.008555247620195204, "loss": -0.0341, "grad_norm": 13.296220779418945, "learning_rate": 9.357575757575758e-06, "num_tokens": 445305.0, "completions/mean_length": 76.875, "completions/min_length": 66.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 76.875, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.7125569581985474, "rewards/meter/std": 0.31757718324661255, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9858448505401611, "rewards/repeat_penalty/std": 0.01981234923005104, "rewards/near_duplicate_penalty/mean": 0.9906812906265259, "rewards/near_duplicate_penalty/std": 0.009823467582464218, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9950690269470215, "rewards/distinct_2/std": 0.013946877792477608, "rewards/total_composite/mean": 0.3205989599227905, "rewards/total_composite/std": 0.16013184189796448, "reward": 0.3205989599227905, "reward_std": 0.16013184189796448, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23128631711006165, "sampling/sampling_logp_difference/max": 1.755228042602539, "sampling/importance_sampling_ratio/min": 0.1728678196668625, "sampling/importance_sampling_ratio/mean": 1.0455572605133057, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6935992538928986, "clip_ratio/low_mean": 0.0612958949059248, "clip_ratio/low_min": 0.0612958949059248, "clip_ratio/high_mean": 0.13209493644535542, "clip_ratio/high_max": 0.13209493644535542, "clip_ratio/region_mean": 0.1933908313512802, "reward_total_mean": 0.3205989599227905, "reward_meter_mean": 0.7125569581985474, "reward_meter_std": 0.31757718324661255, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9858448505401611, "reward_repeat_penalty_std": 0.01981234923005104, "reward_near_duplicate_penalty_mean": 0.9906812906265259, "reward_near_duplicate_penalty_std": 0.009823467582464218, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9950690269470215, "reward_distinct_2_std": 0.013946877792477608, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.3205989599227905, "reward_total_composite_std": 0.16013184189796448} {"timestamp_utc": "2026-04-12T11:32:59Z", "mode": "train", "global_step": 214, "epoch": 0.008595413101980158, "loss": -0.1236, "grad_norm": 17.280521392822266, "learning_rate": 9.354545454545455e-06, "num_tokens": 446842.0, "completions/mean_length": 28.125, "completions/min_length": 19.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.125, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.4867746829986572, "rewards/meter/std": 0.34936103224754333, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.821280837059021, "rewards/lexical_plausibility/std": 0.22418732941150665, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.40896865725517273, "rewards/repeat_penalty/mean": 0.7469173073768616, "rewards/repeat_penalty/std": 0.00871915090829134, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21777765452861786, "rewards/total_composite/std": 0.30124431848526, "reward": 0.21777765452861786, "reward_std": 0.30124431848526, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19614949822425842, "sampling/sampling_logp_difference/max": 1.2957849502563477, "sampling/importance_sampling_ratio/min": 0.27368295192718506, "sampling/importance_sampling_ratio/mean": 1.036525011062622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5247266441583633, "clip_ratio/low_mean": 0.15370856132358313, "clip_ratio/low_min": 0.15370856132358313, "clip_ratio/high_mean": 0.053542179986834526, "clip_ratio/high_max": 0.053542179986834526, "clip_ratio/region_mean": 0.20725074131041765, "reward_total_mean": 0.21777765452861786, "reward_meter_mean": 0.4867746829986572, "reward_meter_std": 0.34936103224754333, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.821280837059021, "reward_lexical_plausibility_std": 0.22418732941150665, "reward_repeat_penalty_mean": 0.7469173073768616, "reward_repeat_penalty_std": 0.00871915090829134, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.40896865725517273, "reward_total_composite_mean": 0.21777765452861786, "reward_total_composite_std": 0.30124431848526} {"timestamp_utc": "2026-04-12T11:33:09Z", "mode": "train", "global_step": 215, "epoch": 0.008635578583765112, "loss": -0.0037, "grad_norm": 18.812461853027344, "learning_rate": 9.351515151515152e-06, "num_tokens": 448296.0, "completions/mean_length": 32.75, "completions/min_length": 27.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.75, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7190053462982178, "rewards/meter/std": 0.38506612181663513, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9549033641815186, "rewards/repeat_penalty/std": 0.06095125898718834, "rewards/near_duplicate_penalty/mean": 0.9763610363006592, "rewards/near_duplicate_penalty/std": 0.02465181238949299, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9772970080375671, "rewards/distinct_2/std": 0.04213463515043259, "rewards/total_composite/mean": 0.4101389944553375, "rewards/total_composite/std": 0.2677665948867798, "reward": 0.4101389944553375, "reward_std": 0.2677665948867798, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18426816165447235, "sampling/sampling_logp_difference/max": 1.6734638214111328, "sampling/importance_sampling_ratio/min": 0.1875961273908615, "sampling/importance_sampling_ratio/mean": 1.0101020336151123, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3771517127752304, "clip_ratio/low_mean": 0.06315710954368114, "clip_ratio/low_min": 0.06315710954368114, "clip_ratio/high_mean": 0.07150485645979643, "clip_ratio/high_max": 0.07150485645979643, "clip_ratio/region_mean": 0.13466196600347757, "reward_total_mean": 0.4101389944553375, "reward_meter_mean": 0.7190053462982178, "reward_meter_std": 0.38506612181663513, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9549033641815186, "reward_repeat_penalty_std": 0.06095125898718834, "reward_near_duplicate_penalty_mean": 0.9763610363006592, "reward_near_duplicate_penalty_std": 0.02465181238949299, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9772970080375671, "reward_distinct_2_std": 0.04213463515043259, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.4101389944553375, "reward_total_composite_std": 0.2677665948867798} {"timestamp_utc": "2026-04-12T11:33:17Z", "mode": "train", "global_step": 216, "epoch": 0.008675744065550066, "loss": -0.0106, "grad_norm": 22.502124786376953, "learning_rate": 9.34848484848485e-06, "num_tokens": 449620.0, "completions/mean_length": 17.5, "completions/min_length": 14.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.5, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.9235381484031677, "rewards/meter/std": 0.10606560856103897, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7762500047683716, "rewards/judge_quality/std": 0.30500292778015137, "rewards/repeat_penalty/mean": 0.7335008978843689, "rewards/repeat_penalty/std": 0.04226246103644371, "rewards/near_duplicate_penalty/mean": 0.9780011773109436, "rewards/near_duplicate_penalty/std": 0.05634994059801102, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7379944920539856, "rewards/total_composite/std": 0.302329957485199, "reward": 0.7379944920539856, "reward_std": 0.302329957485199, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17037364840507507, "sampling/sampling_logp_difference/max": 1.2017364501953125, "sampling/importance_sampling_ratio/min": 0.30067166686058044, "sampling/importance_sampling_ratio/mean": 1.0505744218826294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4617980793118477, "clip_ratio/low_mean": 0.0546875, "clip_ratio/low_min": 0.0546875, "clip_ratio/high_mean": 0.07439980236813426, "clip_ratio/high_max": 0.07439980236813426, "clip_ratio/region_mean": 0.12908730236813426, "reward_total_mean": 0.7379944920539856, "reward_meter_mean": 0.9235381484031677, "reward_meter_std": 0.10606560856103897, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7335008978843689, "reward_repeat_penalty_std": 0.04226246103644371, "reward_near_duplicate_penalty_mean": 0.9780011773109436, "reward_near_duplicate_penalty_std": 0.05634994059801102, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7762500047683716, "reward_judge_quality_std": 0.30500292778015137, "reward_total_composite_mean": 0.7379944920539856, "reward_total_composite_std": 0.302329957485199} {"timestamp_utc": "2026-04-12T11:33:26Z", "mode": "train", "global_step": 217, "epoch": 0.00871590954733502, "loss": 0.1211, "grad_norm": 23.88068199157715, "learning_rate": 9.345454545454547e-06, "num_tokens": 451255.0, "completions/mean_length": 40.375, "completions/min_length": 24.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.3083277940750122, "rewards/meter/std": 0.33922672271728516, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.936546802520752, "rewards/lexical_plausibility/std": 0.1613805890083313, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.9800436496734619, "rewards/repeat_penalty/std": 0.03134879842400551, "rewards/near_duplicate_penalty/mean": 0.9800436496734619, "rewards/near_duplicate_penalty/std": 0.03134879842400551, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1443057507276535, "rewards/total_composite/std": 0.19835418462753296, "reward": 0.1443057507276535, "reward_std": 0.19835416972637177, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23465116322040558, "sampling/sampling_logp_difference/max": 1.6458568572998047, "sampling/importance_sampling_ratio/min": 0.19284723699092865, "sampling/importance_sampling_ratio/mean": 1.0250104665756226, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7267180606722832, "clip_ratio/low_mean": 0.17233465798199177, "clip_ratio/low_min": 0.17233465798199177, "clip_ratio/high_mean": 0.04647871479392052, "clip_ratio/high_max": 0.04647871479392052, "clip_ratio/region_mean": 0.21881337277591228, "reward_total_mean": 0.1443057507276535, "reward_meter_mean": 0.3083277940750122, "reward_meter_std": 0.33922672271728516, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.936546802520752, "reward_lexical_plausibility_std": 0.1613805890083313, "reward_repeat_penalty_mean": 0.9800436496734619, "reward_repeat_penalty_std": 0.03134879842400551, "reward_near_duplicate_penalty_mean": 0.9800436496734619, "reward_near_duplicate_penalty_std": 0.03134879842400551, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.1443057507276535, "reward_total_composite_std": 0.19835418462753296} {"timestamp_utc": "2026-04-12T11:33:40Z", "mode": "train", "global_step": 218, "epoch": 0.008756075029119974, "loss": -0.03, "grad_norm": 5.2542500495910645, "learning_rate": 9.342424242424243e-06, "num_tokens": 452699.0, "completions/mean_length": 88.5, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 28.000001907348633, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.39811187982559204, "rewards/meter/std": 0.47108978033065796, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.7219630479812622, "rewards/lexical_plausibility/std": 0.3385985791683197, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.4051785171031952, "rewards/repeat_penalty/mean": 0.7355536818504333, "rewards/repeat_penalty/std": 0.14165730774402618, "rewards/near_duplicate_penalty/mean": 0.939071536064148, "rewards/near_duplicate_penalty/std": 0.1264227032661438, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2630048096179962, "rewards/total_composite/std": 0.38137587904930115, "reward": 0.2630048096179962, "reward_std": 0.38137587904930115, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19810828566551208, "sampling/sampling_logp_difference/max": 1.0608623027801514, "sampling/importance_sampling_ratio/min": 0.3461571931838989, "sampling/importance_sampling_ratio/mean": 1.0527364015579224, "sampling/importance_sampling_ratio/max": 1.7826459407806396, "entropy": 1.8758389204740524, "clip_ratio/low_mean": 0.12835511937737465, "clip_ratio/low_min": 0.12835511937737465, "clip_ratio/high_mean": 0.047413794323801994, "clip_ratio/high_max": 0.047413794323801994, "clip_ratio/region_mean": 0.17576891370117664, "reward_total_mean": 0.2630048096179962, "reward_meter_mean": 0.39811187982559204, "reward_meter_std": 0.47108978033065796, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.7219630479812622, "reward_lexical_plausibility_std": 0.3385985791683197, "reward_repeat_penalty_mean": 0.7355536818504333, "reward_repeat_penalty_std": 0.14165730774402618, "reward_near_duplicate_penalty_mean": 0.939071536064148, "reward_near_duplicate_penalty_std": 0.1264227032661438, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.4051785171031952, "reward_total_composite_mean": 0.2630048096179962, "reward_total_composite_std": 0.38137587904930115} {"timestamp_utc": "2026-04-12T11:33:50Z", "mode": "train", "global_step": 219, "epoch": 0.008796240510904928, "loss": 0.0847, "grad_norm": 14.841551780700684, "learning_rate": 9.33939393939394e-06, "num_tokens": 454143.0, "completions/mean_length": 38.5, "completions/min_length": 32.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.7012842297554016, "rewards/meter/std": 0.4026435315608978, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8919566869735718, "rewards/lexical_plausibility/std": 0.11086653172969818, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9982781410217285, "rewards/repeat_penalty/std": 0.004219908732920885, "rewards/near_duplicate_penalty/mean": 0.9982781410217285, "rewards/near_duplicate_penalty/std": 0.004219908732920885, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16786515712738037, "rewards/total_composite/std": 0.1504647135734558, "reward": 0.16786515712738037, "reward_std": 0.1504647135734558, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2631381154060364, "sampling/sampling_logp_difference/max": 1.5028114318847656, "sampling/importance_sampling_ratio/min": 0.22250373661518097, "sampling/importance_sampling_ratio/mean": 1.0572354793548584, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.5383233726024628, "clip_ratio/low_mean": 0.15453205537050962, "clip_ratio/low_min": 0.15453205537050962, "clip_ratio/high_mean": 0.0546875, "clip_ratio/high_max": 0.0546875, "clip_ratio/region_mean": 0.20921955537050962, "reward_total_mean": 0.16786515712738037, "reward_meter_mean": 0.7012842297554016, "reward_meter_std": 0.4026435315608978, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8919566869735718, "reward_lexical_plausibility_std": 0.11086653172969818, "reward_repeat_penalty_mean": 0.9982781410217285, "reward_repeat_penalty_std": 0.004219908732920885, "reward_near_duplicate_penalty_mean": 0.9982781410217285, "reward_near_duplicate_penalty_std": 0.004219908732920885, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.16786515712738037, "reward_total_composite_std": 0.1504647135734558} {"timestamp_utc": "2026-04-12T11:34:01Z", "mode": "train", "global_step": 220, "epoch": 0.008836405992689882, "loss": 0.0005, "grad_norm": 18.605060577392578, "learning_rate": 9.336363636363637e-06, "num_tokens": 455853.0, "completions/mean_length": 33.75, "completions/min_length": 29.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.75, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.6623882055282593, "rewards/meter/std": 0.25034192204475403, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6475000381469727, "rewards/judge_quality/std": 0.30742016434669495, "rewards/repeat_penalty/mean": 0.9004184007644653, "rewards/repeat_penalty/std": 0.11043259501457214, "rewards/near_duplicate_penalty/mean": 0.9357359409332275, "rewards/near_duplicate_penalty/std": 0.0423009991645813, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9595141410827637, "rewards/distinct_2/std": 0.08656234294176102, "rewards/total_composite/mean": 0.4125654101371765, "rewards/total_composite/std": 0.2729375958442688, "reward": 0.4125654101371765, "reward_std": 0.2729375958442688, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18542027473449707, "sampling/sampling_logp_difference/max": 1.2532129287719727, "sampling/importance_sampling_ratio/min": 0.28558576107025146, "sampling/importance_sampling_ratio/mean": 1.0390307903289795, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.536943256855011, "clip_ratio/low_mean": 0.11440100893378258, "clip_ratio/low_min": 0.11440100893378258, "clip_ratio/high_mean": 0.05537925707176328, "clip_ratio/high_max": 0.05537925707176328, "clip_ratio/region_mean": 0.16978026600554585, "reward_total_mean": 0.4125654101371765, "reward_meter_mean": 0.6623882055282593, "reward_meter_std": 0.25034192204475403, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9004184007644653, "reward_repeat_penalty_std": 0.11043259501457214, "reward_near_duplicate_penalty_mean": 0.9357359409332275, "reward_near_duplicate_penalty_std": 0.0423009991645813, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9595141410827637, "reward_distinct_2_std": 0.08656234294176102, "reward_judge_quality_mean": 0.6475000381469727, "reward_judge_quality_std": 0.30742016434669495, "reward_total_composite_mean": 0.4125654101371765, "reward_total_composite_std": 0.2729375958442688} {"timestamp_utc": "2026-04-12T11:34:12Z", "mode": "train", "global_step": 221, "epoch": 0.008876571474474836, "loss": 0.0028, "grad_norm": 15.065362930297852, "learning_rate": 9.333333333333334e-06, "num_tokens": 457426.0, "completions/mean_length": 39.625, "completions/min_length": 33.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.625, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7895299196243286, "rewards/meter/std": 0.30216193199157715, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9877232313156128, "rewards/lexical_plausibility/std": 0.0218378733843565, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9831031560897827, "rewards/repeat_penalty/std": 0.0362558476626873, "rewards/near_duplicate_penalty/mean": 0.9915370941162109, "rewards/near_duplicate_penalty/std": 0.015189937315881252, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.2931957542896271, "rewards/total_composite/std": 0.13758660852909088, "reward": 0.2931957542896271, "reward_std": 0.13758662343025208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21733666956424713, "sampling/sampling_logp_difference/max": 1.1337356567382812, "sampling/importance_sampling_ratio/min": 0.3218287527561188, "sampling/importance_sampling_ratio/mean": 1.0576497316360474, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.408338636159897, "clip_ratio/low_mean": 0.07987845689058304, "clip_ratio/low_min": 0.07987845689058304, "clip_ratio/high_mean": 0.12823371216654778, "clip_ratio/high_max": 0.12823371216654778, "clip_ratio/region_mean": 0.2081121690571308, "reward_total_mean": 0.2931957542896271, "reward_meter_mean": 0.7895299196243286, "reward_meter_std": 0.30216193199157715, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9877232313156128, "reward_lexical_plausibility_std": 0.0218378733843565, "reward_repeat_penalty_mean": 0.9831031560897827, "reward_repeat_penalty_std": 0.0362558476626873, "reward_near_duplicate_penalty_mean": 0.9915370941162109, "reward_near_duplicate_penalty_std": 0.015189937315881252, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.2931957542896271, "reward_total_composite_std": 0.13758660852909088} {"timestamp_utc": "2026-04-12T11:34:22Z", "mode": "train", "global_step": 222, "epoch": 0.00891673695625979, "loss": 0.1503, "grad_norm": 15.068031311035156, "learning_rate": 9.33030303030303e-06, "num_tokens": 459061.0, "completions/mean_length": 43.375, "completions/min_length": 31.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.45734867453575134, "rewards/meter/std": 0.46583592891693115, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9592617154121399, "rewards/lexical_plausibility/std": 0.10445455461740494, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9037517309188843, "rewards/repeat_penalty/std": 0.17451131343841553, "rewards/near_duplicate_penalty/mean": 0.9594180583953857, "rewards/near_duplicate_penalty/std": 0.06871283054351807, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9622253179550171, "rewards/distinct_2/std": 0.07333158701658249, "rewards/total_composite/mean": 0.1565871685743332, "rewards/total_composite/std": 0.20494528114795685, "reward": 0.1565871685743332, "reward_std": 0.20494528114795685, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23400035500526428, "sampling/sampling_logp_difference/max": 2.14304780960083, "sampling/importance_sampling_ratio/min": 0.11729680001735687, "sampling/importance_sampling_ratio/mean": 1.0372645854949951, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6688247323036194, "clip_ratio/low_mean": 0.0942892930470407, "clip_ratio/low_min": 0.0942892930470407, "clip_ratio/high_mean": 0.08344548381865025, "clip_ratio/high_max": 0.08344548381865025, "clip_ratio/region_mean": 0.17773477686569095, "reward_total_mean": 0.1565871685743332, "reward_meter_mean": 0.45734867453575134, "reward_meter_std": 0.46583592891693115, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9592617154121399, "reward_lexical_plausibility_std": 0.10445455461740494, "reward_repeat_penalty_mean": 0.9037517309188843, "reward_repeat_penalty_std": 0.17451131343841553, "reward_near_duplicate_penalty_mean": 0.9594180583953857, "reward_near_duplicate_penalty_std": 0.06871283054351807, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9622253179550171, "reward_distinct_2_std": 0.07333158701658249, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.1565871685743332, "reward_total_composite_std": 0.20494528114795685} {"timestamp_utc": "2026-04-12T11:34:32Z", "mode": "train", "global_step": 223, "epoch": 0.008956902438044744, "loss": -0.0877, "grad_norm": 13.039738655090332, "learning_rate": 9.327272727272729e-06, "num_tokens": 460900.0, "completions/mean_length": 55.875, "completions/min_length": 47.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.875, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.1726960837841034, "rewards/meter/std": 0.2386988401412964, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9042977094650269, "rewards/lexical_plausibility/std": 0.2067929059267044, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9787956476211548, "rewards/repeat_penalty/std": 0.03732248768210411, "rewards/near_duplicate_penalty/mean": 0.9852607250213623, "rewards/near_duplicate_penalty/std": 0.020230863243341446, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.05157750844955444, "rewards/total_composite/std": 0.0837271586060524, "reward": 0.05157750844955444, "reward_std": 0.0837271437048912, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23287220299243927, "sampling/sampling_logp_difference/max": 1.4589438438415527, "sampling/importance_sampling_ratio/min": 0.24223922193050385, "sampling/importance_sampling_ratio/mean": 1.0731515884399414, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.2244983911514282, "clip_ratio/low_mean": 0.15650768764317036, "clip_ratio/low_min": 0.15650768764317036, "clip_ratio/high_mean": 0.05032467655837536, "clip_ratio/high_max": 0.05032467655837536, "clip_ratio/region_mean": 0.20683236420154572, "reward_total_mean": 0.05157750844955444, "reward_meter_mean": 0.1726960837841034, "reward_meter_std": 0.2386988401412964, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9042977094650269, "reward_lexical_plausibility_std": 0.2067929059267044, "reward_repeat_penalty_mean": 0.9787956476211548, "reward_repeat_penalty_std": 0.03732248768210411, "reward_near_duplicate_penalty_mean": 0.9852607250213623, "reward_near_duplicate_penalty_std": 0.020230863243341446, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.05157750844955444, "reward_total_composite_std": 0.0837271586060524} {"timestamp_utc": "2026-04-12T11:34:41Z", "mode": "train", "global_step": 224, "epoch": 0.008997067919829698, "loss": 0.1064, "grad_norm": 12.024731636047363, "learning_rate": 9.324242424242424e-06, "num_tokens": 462771.0, "completions/mean_length": 52.875, "completions/min_length": 39.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.5638595223426819, "rewards/meter/std": 0.43769386410713196, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8443635702133179, "rewards/lexical_plausibility/std": 0.16386772692203522, "rewards/judge_quality/mean": 0.48875001072883606, "rewards/judge_quality/std": 0.3665841519832611, "rewards/repeat_penalty/mean": 0.9855141639709473, "rewards/repeat_penalty/std": 0.01785101927816868, "rewards/near_duplicate_penalty/mean": 0.9855141639709473, "rewards/near_duplicate_penalty/std": 0.01785101927816868, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2302250862121582, "rewards/total_composite/std": 0.2972378134727478, "reward": 0.2302250862121582, "reward_std": 0.2972378134727478, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20806123316287994, "sampling/sampling_logp_difference/max": 1.2408835887908936, "sampling/importance_sampling_ratio/min": 0.33881494402885437, "sampling/importance_sampling_ratio/mean": 1.0378979444503784, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6758073568344116, "clip_ratio/low_mean": 0.12764441035687923, "clip_ratio/low_min": 0.12764441035687923, "clip_ratio/high_mean": 0.08768994174897671, "clip_ratio/high_max": 0.08768994174897671, "clip_ratio/region_mean": 0.21533435210585594, "reward_total_mean": 0.2302250862121582, "reward_meter_mean": 0.5638595223426819, "reward_meter_std": 0.43769386410713196, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8443635702133179, "reward_lexical_plausibility_std": 0.16386772692203522, "reward_repeat_penalty_mean": 0.9855141639709473, "reward_repeat_penalty_std": 0.01785101927816868, "reward_near_duplicate_penalty_mean": 0.9855141639709473, "reward_near_duplicate_penalty_std": 0.01785101927816868, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48875001072883606, "reward_judge_quality_std": 0.3665841519832611, "reward_total_composite_mean": 0.2302250862121582, "reward_total_composite_std": 0.2972378134727478} {"timestamp_utc": "2026-04-12T11:34:54Z", "mode": "train", "global_step": 225, "epoch": 0.009037233401614652, "loss": 0.2284, "grad_norm": 8.010241508483887, "learning_rate": 9.321212121212122e-06, "num_tokens": 465156.0, "completions/mean_length": 115.125, "completions/min_length": 66.0, "completions/max_length": 328.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.125, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 328.0, "rewards/meter/mean": 0.23720678687095642, "rewards/meter/std": 0.33528557419776917, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8585575819015503, "rewards/lexical_plausibility/std": 0.23015759885311127, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9812591075897217, "rewards/repeat_penalty/std": 0.043902330100536346, "rewards/near_duplicate_penalty/mean": 0.9906070232391357, "rewards/near_duplicate_penalty/std": 0.017759235575795174, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990138053894043, "rewards/distinct_2/std": 0.027893755584955215, "rewards/total_composite/mean": 0.03885792940855026, "rewards/total_composite/std": 0.04952066391706467, "reward": 0.03885792940855026, "reward_std": 0.04952066019177437, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2218947559595108, "sampling/sampling_logp_difference/max": 1.4545669555664062, "sampling/importance_sampling_ratio/min": 0.23350146412849426, "sampling/importance_sampling_ratio/mean": 1.040709137916565, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.6402252316474915, "clip_ratio/low_mean": 0.09260035492479801, "clip_ratio/low_min": 0.09260035492479801, "clip_ratio/high_mean": 0.08005536161363125, "clip_ratio/high_max": 0.08005536161363125, "clip_ratio/region_mean": 0.17265571653842926, "reward_total_mean": 0.03885792940855026, "reward_meter_mean": 0.23720678687095642, "reward_meter_std": 0.33528557419776917, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8585575819015503, "reward_lexical_plausibility_std": 0.23015759885311127, "reward_repeat_penalty_mean": 0.9812591075897217, "reward_repeat_penalty_std": 0.043902330100536346, "reward_near_duplicate_penalty_mean": 0.9906070232391357, "reward_near_duplicate_penalty_std": 0.017759235575795174, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990138053894043, "reward_distinct_2_std": 0.027893755584955215, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.03885792940855026, "reward_total_composite_std": 0.04952066391706467} {"timestamp_utc": "2026-04-12T11:35:04Z", "mode": "train", "global_step": 226, "epoch": 0.009077398883399606, "loss": 0.0539, "grad_norm": 8.86965560913086, "learning_rate": 9.318181818181819e-06, "num_tokens": 467685.0, "completions/mean_length": 113.125, "completions/min_length": 85.0, "completions/max_length": 141.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.125, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.5976791977882385, "rewards/meter/std": 0.35980021953582764, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.1259881556034088, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9270759224891663, "rewards/lexical_plausibility/std": 0.13093377649784088, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.985623836517334, "rewards/repeat_penalty/std": 0.02347756177186966, "rewards/near_duplicate_penalty/mean": 0.9952421188354492, "rewards/near_duplicate_penalty/std": 0.00500070583075285, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9902669787406921, "rewards/distinct_2/std": 0.019538307562470436, "rewards/total_composite/mean": 0.10001139342784882, "rewards/total_composite/std": 0.11458198726177216, "reward": 0.10001139342784882, "reward_std": 0.11458198726177216, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2474474012851715, "sampling/sampling_logp_difference/max": 1.7313833236694336, "sampling/importance_sampling_ratio/min": 0.17703934013843536, "sampling/importance_sampling_ratio/mean": 1.0650231838226318, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.06893390417099, "clip_ratio/low_mean": 0.11227107793092728, "clip_ratio/low_min": 0.11227107793092728, "clip_ratio/high_mean": 0.08465197682380676, "clip_ratio/high_max": 0.08465197682380676, "clip_ratio/region_mean": 0.19692305475473404, "reward_total_mean": 0.10001139342784882, "reward_meter_mean": 0.5976791977882385, "reward_meter_std": 0.35980021953582764, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.1259881556034088, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9270759224891663, "reward_lexical_plausibility_std": 0.13093377649784088, "reward_repeat_penalty_mean": 0.985623836517334, "reward_repeat_penalty_std": 0.02347756177186966, "reward_near_duplicate_penalty_mean": 0.9952421188354492, "reward_near_duplicate_penalty_std": 0.00500070583075285, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9902669787406921, "reward_distinct_2_std": 0.019538307562470436, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.10001139342784882, "reward_total_composite_std": 0.11458198726177216} {"timestamp_utc": "2026-04-12T11:35:13Z", "mode": "train", "global_step": 227, "epoch": 0.00911756436518456, "loss": 0.1287, "grad_norm": 16.40882682800293, "learning_rate": 9.315151515151516e-06, "num_tokens": 469261.0, "completions/mean_length": 39.0, "completions/min_length": 30.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.6159238815307617, "rewards/meter/std": 0.41157564520835876, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9756944179534912, "rewards/lexical_plausibility/std": 0.058338064700365067, "rewards/judge_quality/mean": 0.5387500524520874, "rewards/judge_quality/std": 0.3228638768196106, "rewards/repeat_penalty/mean": 0.9763433933258057, "rewards/repeat_penalty/std": 0.044303566217422485, "rewards/near_duplicate_penalty/mean": 0.9861366748809814, "rewards/near_duplicate_penalty/std": 0.027932431548833847, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.3676019310951233, "rewards/total_composite/std": 0.3981827199459076, "reward": 0.3676019310951233, "reward_std": 0.3981827199459076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2086174041032791, "sampling/sampling_logp_difference/max": 1.6819677352905273, "sampling/importance_sampling_ratio/min": 0.18600760400295258, "sampling/importance_sampling_ratio/mean": 1.0399211645126343, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1516895294189453, "clip_ratio/low_mean": 0.1118665412068367, "clip_ratio/low_min": 0.1118665412068367, "clip_ratio/high_mean": 0.0500331218354404, "clip_ratio/high_max": 0.0500331218354404, "clip_ratio/region_mean": 0.1618996630422771, "reward_total_mean": 0.3676019310951233, "reward_meter_mean": 0.6159238815307617, "reward_meter_std": 0.41157564520835876, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9756944179534912, "reward_lexical_plausibility_std": 0.058338064700365067, "reward_repeat_penalty_mean": 0.9763433933258057, "reward_repeat_penalty_std": 0.044303566217422485, "reward_near_duplicate_penalty_mean": 0.9861366748809814, "reward_near_duplicate_penalty_std": 0.027932431548833847, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.5387500524520874, "reward_judge_quality_std": 0.3228638768196106, "reward_total_composite_mean": 0.3676019310951233, "reward_total_composite_std": 0.3981827199459076} {"timestamp_utc": "2026-04-12T11:35:22Z", "mode": "train", "global_step": 228, "epoch": 0.009157729846969515, "loss": -0.0375, "grad_norm": 28.835786819458008, "learning_rate": 9.312121212121212e-06, "num_tokens": 470879.0, "completions/mean_length": 29.25, "completions/min_length": 23.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.25, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.28039538860321045, "rewards/meter/std": 0.25342094898223877, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9708828330039978, "rewards/lexical_plausibility/std": 0.06114698573946953, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.19956651329994202, "rewards/repeat_penalty/mean": 0.9233226180076599, "rewards/repeat_penalty/std": 0.17184801399707794, "rewards/near_duplicate_penalty/mean": 0.9658033847808838, "rewards/near_duplicate_penalty/std": 0.055021733045578, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9743589758872986, "rewards/distinct_2/std": 0.07252377271652222, "rewards/total_composite/mean": 0.11529844254255295, "rewards/total_composite/std": 0.09825806319713593, "reward": 0.11529844254255295, "reward_std": 0.09825806319713593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20324234664440155, "sampling/sampling_logp_difference/max": 2.6962225437164307, "sampling/importance_sampling_ratio/min": 0.06745985895395279, "sampling/importance_sampling_ratio/mean": 1.0252653360366821, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.840165987610817, "clip_ratio/low_mean": 0.10353380255401134, "clip_ratio/low_min": 0.10353380255401134, "clip_ratio/high_mean": 0.08810030948370695, "clip_ratio/high_max": 0.08810030948370695, "clip_ratio/region_mean": 0.1916341120377183, "reward_total_mean": 0.11529844254255295, "reward_meter_mean": 0.28039538860321045, "reward_meter_std": 0.25342094898223877, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9708828330039978, "reward_lexical_plausibility_std": 0.06114698573946953, "reward_repeat_penalty_mean": 0.9233226180076599, "reward_repeat_penalty_std": 0.17184801399707794, "reward_near_duplicate_penalty_mean": 0.9658033847808838, "reward_near_duplicate_penalty_std": 0.055021733045578, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9743589758872986, "reward_distinct_2_std": 0.07252377271652222, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.19956651329994202, "reward_total_composite_mean": 0.11529844254255295, "reward_total_composite_std": 0.09825806319713593} {"timestamp_utc": "2026-04-12T11:35:31Z", "mode": "train", "global_step": 229, "epoch": 0.00919789532875447, "loss": 0.0833, "grad_norm": 19.24261474609375, "learning_rate": 9.30909090909091e-06, "num_tokens": 472231.0, "completions/mean_length": 24.0, "completions/min_length": 18.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.48322755098342896, "rewards/meter/std": 0.4733370840549469, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9752674102783203, "rewards/lexical_plausibility/std": 0.06995441019535065, "rewards/judge_quality/mean": 0.5087499618530273, "rewards/judge_quality/std": 0.2861786484718323, "rewards/repeat_penalty/mean": 0.7130681872367859, "rewards/repeat_penalty/std": 0.10445895045995712, "rewards/near_duplicate_penalty/mean": 0.9507575631141663, "rewards/near_duplicate_penalty/std": 0.1392786055803299, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20232832431793213, "rewards/total_composite/std": 0.1917257457971573, "reward": 0.20232832431793213, "reward_std": 0.1917257308959961, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21530920267105103, "sampling/sampling_logp_difference/max": 1.189661979675293, "sampling/importance_sampling_ratio/min": 0.30432412028312683, "sampling/importance_sampling_ratio/mean": 1.0869141817092896, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9509296268224716, "clip_ratio/low_mean": 0.11066515184938908, "clip_ratio/low_min": 0.11066515184938908, "clip_ratio/high_mean": 0.08464077021926641, "clip_ratio/high_max": 0.08464077021926641, "clip_ratio/region_mean": 0.1953059220686555, "reward_total_mean": 0.20232832431793213, "reward_meter_mean": 0.48322755098342896, "reward_meter_std": 0.4733370840549469, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9752674102783203, "reward_lexical_plausibility_std": 0.06995441019535065, "reward_repeat_penalty_mean": 0.7130681872367859, "reward_repeat_penalty_std": 0.10445895045995712, "reward_near_duplicate_penalty_mean": 0.9507575631141663, "reward_near_duplicate_penalty_std": 0.1392786055803299, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5087499618530273, "reward_judge_quality_std": 0.2861786484718323, "reward_total_composite_mean": 0.20232832431793213, "reward_total_composite_std": 0.1917257457971573} {"timestamp_utc": "2026-04-12T11:35:41Z", "mode": "train", "global_step": 230, "epoch": 0.009238060810539423, "loss": 0.0721, "grad_norm": 8.41430950164795, "learning_rate": 9.306060606060608e-06, "num_tokens": 474661.0, "completions/mean_length": 102.75, "completions/min_length": 80.0, "completions/max_length": 141.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.75, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.41917771100997925, "rewards/meter/std": 0.31770917773246765, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9525266289710999, "rewards/lexical_plausibility/std": 0.10706377774477005, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9959983229637146, "rewards/repeat_penalty/std": 0.004256305750459433, "rewards/near_duplicate_penalty/mean": 0.9959983229637146, "rewards/near_duplicate_penalty/std": 0.004256305750459433, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1410641372203827, "rewards/total_composite/std": 0.13569699227809906, "reward": 0.1410641372203827, "reward_std": 0.13569699227809906, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24845126271247864, "sampling/sampling_logp_difference/max": 1.806035041809082, "sampling/importance_sampling_ratio/min": 0.16430431604385376, "sampling/importance_sampling_ratio/mean": 1.0583014488220215, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.6665093302726746, "clip_ratio/low_mean": 0.09639752097427845, "clip_ratio/low_min": 0.09639752097427845, "clip_ratio/high_mean": 0.08284858800470829, "clip_ratio/high_max": 0.08284858800470829, "clip_ratio/region_mean": 0.17924610897898674, "reward_total_mean": 0.1410641372203827, "reward_meter_mean": 0.41917771100997925, "reward_meter_std": 0.31770917773246765, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9525266289710999, "reward_lexical_plausibility_std": 0.10706377774477005, "reward_repeat_penalty_mean": 0.9959983229637146, "reward_repeat_penalty_std": 0.004256305750459433, "reward_near_duplicate_penalty_mean": 0.9959983229637146, "reward_near_duplicate_penalty_std": 0.004256305750459433, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.1410641372203827, "reward_total_composite_std": 0.13569699227809906} {"timestamp_utc": "2026-04-12T11:35:50Z", "mode": "train", "global_step": 231, "epoch": 0.009278226292324377, "loss": 0.016, "grad_norm": 10.604702949523926, "learning_rate": 9.303030303030303e-06, "num_tokens": 476493.0, "completions/mean_length": 73.0, "completions/min_length": 60.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.0, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.39129316806793213, "rewards/meter/std": 0.26790088415145874, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9722594022750854, "rewards/lexical_plausibility/std": 0.07774464040994644, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9915815591812134, "rewards/repeat_penalty/std": 0.006199967116117477, "rewards/near_duplicate_penalty/mean": 0.9915815591812134, "rewards/near_duplicate_penalty/std": 0.006199967116117477, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11387395858764648, "rewards/total_composite/std": 0.11799918860197067, "reward": 0.11387395858764648, "reward_std": 0.11799918860197067, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2647823393344879, "sampling/sampling_logp_difference/max": 1.5168256759643555, "sampling/importance_sampling_ratio/min": 0.21940726041793823, "sampling/importance_sampling_ratio/mean": 1.0522475242614746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.499101161956787, "clip_ratio/low_mean": 0.12810280360281467, "clip_ratio/low_min": 0.12810280360281467, "clip_ratio/high_mean": 0.0863079372793436, "clip_ratio/high_max": 0.0863079372793436, "clip_ratio/region_mean": 0.21441074088215828, "reward_total_mean": 0.11387395858764648, "reward_meter_mean": 0.39129316806793213, "reward_meter_std": 0.26790088415145874, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9722594022750854, "reward_lexical_plausibility_std": 0.07774464040994644, "reward_repeat_penalty_mean": 0.9915815591812134, "reward_repeat_penalty_std": 0.006199967116117477, "reward_near_duplicate_penalty_mean": 0.9915815591812134, "reward_near_duplicate_penalty_std": 0.006199967116117477, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.11387395858764648, "reward_total_composite_std": 0.11799918860197067} {"timestamp_utc": "2026-04-12T11:36:05Z", "mode": "train", "global_step": 232, "epoch": 0.009318391774109331, "loss": -0.0352, "grad_norm": 5.134120941162109, "learning_rate": 9.3e-06, "num_tokens": 478782.0, "completions/mean_length": 165.125, "completions/min_length": 99.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 115.5714340209961, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 130.0, "rewards/meter/mean": 0.5854902267456055, "rewards/meter/std": 0.2812030017375946, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.883344829082489, "rewards/lexical_plausibility/std": 0.1693534404039383, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9939590692520142, "rewards/repeat_penalty/std": 0.009112166240811348, "rewards/near_duplicate_penalty/mean": 0.9969067573547363, "rewards/near_duplicate_penalty/std": 0.003100398927927017, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9970414042472839, "rewards/distinct_2/std": 0.008368130773305893, "rewards/total_composite/mean": 0.12124696373939514, "rewards/total_composite/std": 0.1220458373427391, "reward": 0.12124696373939514, "reward_std": 0.1220458373427391, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24998222291469574, "sampling/sampling_logp_difference/max": 1.5013141632080078, "sampling/importance_sampling_ratio/min": 0.22283713519573212, "sampling/importance_sampling_ratio/mean": 1.0617833137512207, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.9537555873394012, "clip_ratio/low_mean": 0.052912636660039425, "clip_ratio/low_min": 0.052912636660039425, "clip_ratio/high_mean": 0.11284627206623554, "clip_ratio/high_max": 0.11284627206623554, "clip_ratio/region_mean": 0.16575890872627497, "reward_total_mean": 0.12124696373939514, "reward_meter_mean": 0.5854902267456055, "reward_meter_std": 0.2812030017375946, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.883344829082489, "reward_lexical_plausibility_std": 0.1693534404039383, "reward_repeat_penalty_mean": 0.9939590692520142, "reward_repeat_penalty_std": 0.009112166240811348, "reward_near_duplicate_penalty_mean": 0.9969067573547363, "reward_near_duplicate_penalty_std": 0.003100398927927017, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9970414042472839, "reward_distinct_2_std": 0.008368130773305893, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.12124696373939514, "reward_total_composite_std": 0.1220458373427391} {"timestamp_utc": "2026-04-12T11:36:20Z", "mode": "train", "global_step": 233, "epoch": 0.009358557255894285, "loss": -0.0257, "grad_norm": 4.961449146270752, "learning_rate": 9.296969696969698e-06, "num_tokens": 481089.0, "completions/mean_length": 176.375, "completions/min_length": 95.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 128.42857360839844, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 169.0, "rewards/meter/mean": 0.49392178654670715, "rewards/meter/std": 0.4410583972930908, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8732752799987793, "rewards/lexical_plausibility/std": 0.2317531555891037, "rewards/judge_quality/mean": 0.19999998807907104, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9971146583557129, "rewards/repeat_penalty/std": 0.0030275366734713316, "rewards/near_duplicate_penalty/mean": 0.9971146583557129, "rewards/near_duplicate_penalty/std": 0.0030275366734713316, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12325656414031982, "rewards/total_composite/std": 0.1587062031030655, "reward": 0.12325656414031982, "reward_std": 0.1587061882019043, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24637077748775482, "sampling/sampling_logp_difference/max": 1.6192541122436523, "sampling/importance_sampling_ratio/min": 0.19804635643959045, "sampling/importance_sampling_ratio/mean": 1.0744915008544922, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.3490015864372253, "clip_ratio/low_mean": 0.062875647097826, "clip_ratio/low_min": 0.062875647097826, "clip_ratio/high_mean": 0.09082281030714512, "clip_ratio/high_max": 0.09082281030714512, "clip_ratio/region_mean": 0.15369845740497112, "reward_total_mean": 0.12325656414031982, "reward_meter_mean": 0.49392178654670715, "reward_meter_std": 0.4410583972930908, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8732752799987793, "reward_lexical_plausibility_std": 0.2317531555891037, "reward_repeat_penalty_mean": 0.9971146583557129, "reward_repeat_penalty_std": 0.0030275366734713316, "reward_near_duplicate_penalty_mean": 0.9971146583557129, "reward_near_duplicate_penalty_std": 0.0030275366734713316, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.19999998807907104, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.12325656414031982, "reward_total_composite_std": 0.1587062031030655} {"timestamp_utc": "2026-04-12T11:36:30Z", "mode": "train", "global_step": 234, "epoch": 0.009398722737679239, "loss": 0.1393, "grad_norm": 16.711183547973633, "learning_rate": 9.293939393939395e-06, "num_tokens": 482720.0, "completions/mean_length": 39.875, "completions/min_length": 33.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.8442812561988831, "rewards/meter/std": 0.22092205286026, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1927248239517212, "rewards/repeat_penalty/mean": 0.9821171164512634, "rewards/repeat_penalty/std": 0.027723101899027824, "rewards/near_duplicate_penalty/mean": 0.9911913871765137, "rewards/near_duplicate_penalty/std": 0.010196942836046219, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.2744794189929962, "rewards/total_composite/std": 0.18476887047290802, "reward": 0.2744794189929962, "reward_std": 0.18476885557174683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22389782965183258, "sampling/sampling_logp_difference/max": 1.702122688293457, "sampling/importance_sampling_ratio/min": 0.18229615688323975, "sampling/importance_sampling_ratio/mean": 1.0627580881118774, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.865033984184265, "clip_ratio/low_mean": 0.07573607377707958, "clip_ratio/low_min": 0.07573607377707958, "clip_ratio/high_mean": 0.08506254758685827, "clip_ratio/high_max": 0.08506254758685827, "clip_ratio/region_mean": 0.16079862136393785, "reward_total_mean": 0.2744794189929962, "reward_meter_mean": 0.8442812561988831, "reward_meter_std": 0.22092205286026, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9821171164512634, "reward_repeat_penalty_std": 0.027723101899027824, "reward_near_duplicate_penalty_mean": 0.9911913871765137, "reward_near_duplicate_penalty_std": 0.010196942836046219, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1927248239517212, "reward_total_composite_mean": 0.2744794189929962, "reward_total_composite_std": 0.18476887047290802} {"timestamp_utc": "2026-04-12T11:36:42Z", "mode": "train", "global_step": 235, "epoch": 0.009438888219464193, "loss": 0.2869, "grad_norm": 10.497565269470215, "learning_rate": 9.29090909090909e-06, "num_tokens": 484440.0, "completions/mean_length": 68.0, "completions/min_length": 30.0, "completions/max_length": 261.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 261.0, "rewards/meter/mean": 0.25676068663597107, "rewards/meter/std": 0.31785857677459717, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9099849462509155, "rewards/lexical_plausibility/std": 0.2546009123325348, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9589519500732422, "rewards/repeat_penalty/std": 0.046857405453920364, "rewards/near_duplicate_penalty/mean": 0.9689867496490479, "rewards/near_duplicate_penalty/std": 0.04364578798413277, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.08154526352882385, "rewards/total_composite/std": 0.13823302090168, "reward": 0.08154526352882385, "reward_std": 0.13823302090168, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2429894357919693, "sampling/sampling_logp_difference/max": 1.8698291778564453, "sampling/importance_sampling_ratio/min": 0.15414999425411224, "sampling/importance_sampling_ratio/mean": 1.0274935960769653, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7454141974449158, "clip_ratio/low_mean": 0.13338296953588724, "clip_ratio/low_min": 0.13338296953588724, "clip_ratio/high_mean": 0.0690789483487606, "clip_ratio/high_max": 0.0690789483487606, "clip_ratio/region_mean": 0.20246191788464785, "reward_total_mean": 0.08154526352882385, "reward_meter_mean": 0.25676068663597107, "reward_meter_std": 0.31785857677459717, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9099849462509155, "reward_lexical_plausibility_std": 0.2546009123325348, "reward_repeat_penalty_mean": 0.9589519500732422, "reward_repeat_penalty_std": 0.046857405453920364, "reward_near_duplicate_penalty_mean": 0.9689867496490479, "reward_near_duplicate_penalty_std": 0.04364578798413277, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.08154526352882385, "reward_total_composite_std": 0.13823302090168} {"timestamp_utc": "2026-04-12T11:36:57Z", "mode": "train", "global_step": 236, "epoch": 0.009479053701249147, "loss": -0.0726, "grad_norm": 2.903174877166748, "learning_rate": 9.28787878787879e-06, "num_tokens": 487401.0, "completions/mean_length": 389.125, "completions/min_length": 186.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 266.25, "completions/min_terminated_length": 186.0, "completions/max_terminated_length": 466.0, "rewards/meter/mean": 0.4403528571128845, "rewards/meter/std": 0.3332734704017639, "rewards/count_adherence/mean": 0.762499988079071, "rewards/count_adherence/std": 0.2386719137430191, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.6608182191848755, "rewards/lexical_plausibility/std": 0.2512224018573761, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.10350984334945679, "rewards/repeat_penalty/mean": 0.9976162910461426, "rewards/repeat_penalty/std": 0.001307821017690003, "rewards/near_duplicate_penalty/mean": 0.9976162910461426, "rewards/near_duplicate_penalty/std": 0.001307821017690003, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.05369948223233223, "rewards/total_composite/std": 0.12017948925495148, "reward": 0.05369948223233223, "reward_std": 0.12017949670553207, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21965289115905762, "sampling/sampling_logp_difference/max": 1.0888519287109375, "sampling/importance_sampling_ratio/min": 0.33660271763801575, "sampling/importance_sampling_ratio/mean": 1.0608978271484375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7886303663253784, "clip_ratio/low_mean": 0.03072961326688528, "clip_ratio/low_min": 0.03072961326688528, "clip_ratio/high_mean": 0.05858132615685463, "clip_ratio/high_max": 0.05858132615685463, "clip_ratio/region_mean": 0.08931093942373991, "reward_total_mean": 0.05369948223233223, "reward_meter_mean": 0.4403528571128845, "reward_meter_std": 0.3332734704017639, "reward_count_adherence_mean": 0.762499988079071, "reward_count_adherence_std": 0.2386719137430191, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.6608182191848755, "reward_lexical_plausibility_std": 0.2512224018573761, "reward_repeat_penalty_mean": 0.9976162910461426, "reward_repeat_penalty_std": 0.001307821017690003, "reward_near_duplicate_penalty_mean": 0.9976162910461426, "reward_near_duplicate_penalty_std": 0.001307821017690003, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.10350984334945679, "reward_total_composite_mean": 0.05369948223233223, "reward_total_composite_std": 0.12017948925495148} {"timestamp_utc": "2026-04-12T11:37:14Z", "mode": "train", "global_step": 237, "epoch": 0.0095192191830341, "loss": 0.0256, "grad_norm": 7.149643421173096, "learning_rate": 9.284848484848485e-06, "num_tokens": 489016.0, "completions/mean_length": 98.875, "completions/min_length": 27.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.85714340209961, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.4038103222846985, "rewards/meter/std": 0.3540455400943756, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9055606722831726, "rewards/lexical_plausibility/std": 0.21432743966579437, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.9937461614608765, "rewards/repeat_penalty/std": 0.0076161217875778675, "rewards/near_duplicate_penalty/mean": 0.9962989091873169, "rewards/near_duplicate_penalty/std": 0.005241013132035732, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9974472522735596, "rewards/distinct_2/std": 0.007220282219350338, "rewards/total_composite/mean": 0.13621383905410767, "rewards/total_composite/std": 0.1638379842042923, "reward": 0.13621383905410767, "reward_std": 0.1638379842042923, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2056620866060257, "sampling/sampling_logp_difference/max": 1.485896348953247, "sampling/importance_sampling_ratio/min": 0.22629940509796143, "sampling/importance_sampling_ratio/mean": 1.0489250421524048, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8136246800422668, "clip_ratio/low_mean": 0.08420171681791544, "clip_ratio/low_min": 0.08420171681791544, "clip_ratio/high_mean": 0.08618157543241978, "clip_ratio/high_max": 0.08618157543241978, "clip_ratio/region_mean": 0.17038329225033522, "reward_total_mean": 0.13621383905410767, "reward_meter_mean": 0.4038103222846985, "reward_meter_std": 0.3540455400943756, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9055606722831726, "reward_lexical_plausibility_std": 0.21432743966579437, "reward_repeat_penalty_mean": 0.9937461614608765, "reward_repeat_penalty_std": 0.0076161217875778675, "reward_near_duplicate_penalty_mean": 0.9962989091873169, "reward_near_duplicate_penalty_std": 0.005241013132035732, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9974472522735596, "reward_distinct_2_std": 0.007220282219350338, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.13621383905410767, "reward_total_composite_std": 0.1638379842042923} {"timestamp_utc": "2026-04-12T11:37:25Z", "mode": "train", "global_step": 238, "epoch": 0.009559384664819055, "loss": 0.0505, "grad_norm": 16.314659118652344, "learning_rate": 9.281818181818183e-06, "num_tokens": 490652.0, "completions/mean_length": 52.5, "completions/min_length": 44.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.5, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6325927376747131, "rewards/meter/std": 0.2964901924133301, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9518710374832153, "rewards/lexical_plausibility/std": 0.09042418748140335, "rewards/judge_quality/mean": 0.5074999928474426, "rewards/judge_quality/std": 0.2516658902168274, "rewards/repeat_penalty/mean": 0.9930394887924194, "rewards/repeat_penalty/std": 0.010083186440169811, "rewards/near_duplicate_penalty/mean": 0.9930394887924194, "rewards/near_duplicate_penalty/std": 0.010083186440169811, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32204437255859375, "rewards/total_composite/std": 0.22403883934020996, "reward": 0.32204437255859375, "reward_std": 0.22403883934020996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22436624765396118, "sampling/sampling_logp_difference/max": 2.238736152648926, "sampling/importance_sampling_ratio/min": 0.10659313201904297, "sampling/importance_sampling_ratio/mean": 0.9726545214653015, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4239566251635551, "clip_ratio/low_mean": 0.08723804075270891, "clip_ratio/low_min": 0.08723804075270891, "clip_ratio/high_mean": 0.09302003309130669, "clip_ratio/high_max": 0.09302003309130669, "clip_ratio/region_mean": 0.1802580738440156, "reward_total_mean": 0.32204437255859375, "reward_meter_mean": 0.6325927376747131, "reward_meter_std": 0.2964901924133301, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9518710374832153, "reward_lexical_plausibility_std": 0.09042418748140335, "reward_repeat_penalty_mean": 0.9930394887924194, "reward_repeat_penalty_std": 0.010083186440169811, "reward_near_duplicate_penalty_mean": 0.9930394887924194, "reward_near_duplicate_penalty_std": 0.010083186440169811, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5074999928474426, "reward_judge_quality_std": 0.2516658902168274, "reward_total_composite_mean": 0.32204437255859375, "reward_total_composite_std": 0.22403883934020996} {"timestamp_utc": "2026-04-12T11:37:34Z", "mode": "train", "global_step": 239, "epoch": 0.009599550146604009, "loss": -0.024, "grad_norm": 14.57002067565918, "learning_rate": 9.27878787878788e-06, "num_tokens": 491955.0, "completions/mean_length": 16.875, "completions/min_length": 16.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.7849218845367432, "rewards/meter/std": 0.26776716113090515, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.76500004529953, "rewards/judge_quality/std": 0.28824594616889954, "rewards/repeat_penalty/mean": 0.6820960640907288, "rewards/repeat_penalty/std": 0.019698383286595345, "rewards/near_duplicate_penalty/mean": 0.909461498260498, "rewards/near_duplicate_penalty/std": 0.02626452036201954, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5813707709312439, "rewards/total_composite/std": 0.3000923693180084, "reward": 0.5813707709312439, "reward_std": 0.3000923991203308, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07100889086723328, "sampling/sampling_logp_difference/max": 0.8280153274536133, "sampling/importance_sampling_ratio/min": 0.4369155764579773, "sampling/importance_sampling_ratio/mean": 1.0254554748535156, "sampling/importance_sampling_ratio/max": 1.6485719680786133, "entropy": 0.497576754540205, "clip_ratio/low_mean": 0.02083333395421505, "clip_ratio/low_min": 0.02083333395421505, "clip_ratio/high_mean": 0.014705882407724857, "clip_ratio/high_max": 0.014705882407724857, "clip_ratio/region_mean": 0.03553921636193991, "reward_total_mean": 0.5813707709312439, "reward_meter_mean": 0.7849218845367432, "reward_meter_std": 0.26776716113090515, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6820960640907288, "reward_repeat_penalty_std": 0.019698383286595345, "reward_near_duplicate_penalty_mean": 0.909461498260498, "reward_near_duplicate_penalty_std": 0.02626452036201954, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.76500004529953, "reward_judge_quality_std": 0.28824594616889954, "reward_total_composite_mean": 0.5813707709312439, "reward_total_composite_std": 0.3000923693180084} {"timestamp_utc": "2026-04-12T11:37:44Z", "mode": "train", "global_step": 240, "epoch": 0.009639715628388962, "loss": 0.0513, "grad_norm": 20.61700439453125, "learning_rate": 9.275757575757577e-06, "num_tokens": 493473.0, "completions/mean_length": 21.75, "completions/min_length": 16.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.6308422684669495, "rewards/meter/std": 0.48971638083457947, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9771242141723633, "rewards/lexical_plausibility/std": 0.0647025778889656, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3269261121749878, "rewards/total_composite/std": 0.30889177322387695, "reward": 0.3269261121749878, "reward_std": 0.30889180302619934, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2429298758506775, "sampling/sampling_logp_difference/max": 1.5405826568603516, "sampling/importance_sampling_ratio/min": 0.21425624191761017, "sampling/importance_sampling_ratio/mean": 1.0725314617156982, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5414575040340424, "clip_ratio/low_mean": 0.04205827065743506, "clip_ratio/low_min": 0.04205827065743506, "clip_ratio/high_mean": 0.12063401564955711, "clip_ratio/high_max": 0.12063401564955711, "clip_ratio/region_mean": 0.16269228630699217, "reward_total_mean": 0.3269261121749878, "reward_meter_mean": 0.6308422684669495, "reward_meter_std": 0.48971638083457947, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9771242141723633, "reward_lexical_plausibility_std": 0.0647025778889656, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.3269261121749878, "reward_total_composite_std": 0.30889177322387695} {"timestamp_utc": "2026-04-12T11:37:59Z", "mode": "train", "global_step": 241, "epoch": 0.009679881110173916, "loss": -0.047, "grad_norm": 3.39906644821167, "learning_rate": 9.272727272727273e-06, "num_tokens": 495972.0, "completions/mean_length": 383.375, "completions/min_length": 164.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 254.75, "completions/min_terminated_length": 164.0, "completions/max_terminated_length": 429.0, "rewards/meter/mean": 0.23733344674110413, "rewards/meter/std": 0.3067074418067932, "rewards/count_adherence/mean": 0.828125, "rewards/count_adherence/std": 0.22097088396549225, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.5411629676818848, "rewards/lexical_plausibility/std": 0.2671348750591278, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.10350984334945679, "rewards/repeat_penalty/mean": 0.9860943555831909, "rewards/repeat_penalty/std": 0.01868544891476631, "rewards/near_duplicate_penalty/mean": 0.9923439025878906, "rewards/near_duplicate_penalty/std": 0.006741866935044527, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9936693906784058, "rewards/distinct_2/std": 0.015382092446088791, "rewards/total_composite/mean": 0.02013734169304371, "rewards/total_composite/std": 0.050523772835731506, "reward": 0.02013734169304371, "reward_std": 0.05052376911044121, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22711551189422607, "sampling/sampling_logp_difference/max": 1.206812858581543, "sampling/importance_sampling_ratio/min": 0.29914918541908264, "sampling/importance_sampling_ratio/mean": 1.0702348947525024, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.358061909675598, "clip_ratio/low_mean": 0.059528362937271595, "clip_ratio/low_min": 0.059528362937271595, "clip_ratio/high_mean": 0.02049180306494236, "clip_ratio/high_max": 0.02049180306494236, "clip_ratio/region_mean": 0.08002016600221395, "reward_total_mean": 0.02013734169304371, "reward_meter_mean": 0.23733344674110413, "reward_meter_std": 0.3067074418067932, "reward_count_adherence_mean": 0.828125, "reward_count_adherence_std": 0.22097088396549225, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.5411629676818848, "reward_lexical_plausibility_std": 0.2671348750591278, "reward_repeat_penalty_mean": 0.9860943555831909, "reward_repeat_penalty_std": 0.01868544891476631, "reward_near_duplicate_penalty_mean": 0.9923439025878906, "reward_near_duplicate_penalty_std": 0.006741866935044527, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9936693906784058, "reward_distinct_2_std": 0.015382092446088791, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.10350984334945679, "reward_total_composite_mean": 0.02013734169304371, "reward_total_composite_std": 0.050523772835731506} {"timestamp_utc": "2026-04-12T11:38:13Z", "mode": "train", "global_step": 242, "epoch": 0.00972004659195887, "loss": -0.0496, "grad_norm": 3.1483123302459717, "learning_rate": 9.26969696969697e-06, "num_tokens": 497703.0, "completions/mean_length": 176.375, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 64.5, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.4226337671279907, "rewards/meter/std": 0.3670276403427124, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8753880858421326, "rewards/lexical_plausibility/std": 0.2329125553369522, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9990401268005371, "rewards/repeat_penalty/std": 0.0017859900835901499, "rewards/near_duplicate_penalty/mean": 0.9990401268005371, "rewards/near_duplicate_penalty/std": 0.0017859900835901499, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12034481018781662, "rewards/total_composite/std": 0.11232835054397583, "reward": 0.12034481018781662, "reward_std": 0.11232834309339523, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23007968068122864, "sampling/sampling_logp_difference/max": 1.430654525756836, "sampling/importance_sampling_ratio/min": 0.23915234208106995, "sampling/importance_sampling_ratio/mean": 1.0516321659088135, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.193782091140747, "clip_ratio/low_mean": 0.05039931274950504, "clip_ratio/low_min": 0.05039931274950504, "clip_ratio/high_mean": 0.10164953395724297, "clip_ratio/high_max": 0.10164953395724297, "clip_ratio/region_mean": 0.152048846706748, "reward_total_mean": 0.12034481018781662, "reward_meter_mean": 0.4226337671279907, "reward_meter_std": 0.3670276403427124, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8753880858421326, "reward_lexical_plausibility_std": 0.2329125553369522, "reward_repeat_penalty_mean": 0.9990401268005371, "reward_repeat_penalty_std": 0.0017859900835901499, "reward_near_duplicate_penalty_mean": 0.9990401268005371, "reward_near_duplicate_penalty_std": 0.0017859900835901499, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.12034481018781662, "reward_total_composite_std": 0.11232835054397583} {"timestamp_utc": "2026-04-12T11:38:24Z", "mode": "train", "global_step": 243, "epoch": 0.009760212073743824, "loss": 0.1906, "grad_norm": 8.332919120788574, "learning_rate": 9.266666666666667e-06, "num_tokens": 499880.0, "completions/mean_length": 94.125, "completions/min_length": 71.0, "completions/max_length": 171.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.125, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 171.0, "rewards/meter/mean": 0.8360825777053833, "rewards/meter/std": 0.2390476018190384, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9280816316604614, "rewards/lexical_plausibility/std": 0.1122690737247467, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9910176396369934, "rewards/repeat_penalty/std": 0.011688623577356339, "rewards/near_duplicate_penalty/mean": 0.9951965808868408, "rewards/near_duplicate_penalty/std": 0.006244110409170389, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9958193898200989, "rewards/distinct_2/std": 0.0118245305493474, "rewards/total_composite/mean": 0.14266464114189148, "rewards/total_composite/std": 0.16596995294094086, "reward": 0.14266464114189148, "reward_std": 0.16596995294094086, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23228609561920166, "sampling/sampling_logp_difference/max": 1.2347612380981445, "sampling/importance_sampling_ratio/min": 0.2909041941165924, "sampling/importance_sampling_ratio/mean": 1.0778019428253174, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.365996211767197, "clip_ratio/low_mean": 0.11267116665840149, "clip_ratio/low_min": 0.11267116665840149, "clip_ratio/high_mean": 0.08230546861886978, "clip_ratio/high_max": 0.08230546861886978, "clip_ratio/region_mean": 0.19497663527727127, "reward_total_mean": 0.14266464114189148, "reward_meter_mean": 0.8360825777053833, "reward_meter_std": 0.2390476018190384, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9280816316604614, "reward_lexical_plausibility_std": 0.1122690737247467, "reward_repeat_penalty_mean": 0.9910176396369934, "reward_repeat_penalty_std": 0.011688623577356339, "reward_near_duplicate_penalty_mean": 0.9951965808868408, "reward_near_duplicate_penalty_std": 0.006244110409170389, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9958193898200989, "reward_distinct_2_std": 0.0118245305493474, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.14266464114189148, "reward_total_composite_std": 0.16596995294094086} {"timestamp_utc": "2026-04-12T11:38:38Z", "mode": "train", "global_step": 244, "epoch": 0.009800377555528778, "loss": -0.1369, "grad_norm": 2.5369458198547363, "learning_rate": 9.263636363636364e-06, "num_tokens": 502091.0, "completions/mean_length": 385.375, "completions/min_length": 157.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 174.33334350585938, "completions/min_terminated_length": 157.0, "completions/max_terminated_length": 190.0, "rewards/meter/mean": 0.3597410321235657, "rewards/meter/std": 0.2850934565067291, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.3894554078578949, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.6828522682189941, "rewards/lexical_plausibility/std": 0.32094618678092957, "rewards/judge_quality/mean": 0.11249999701976776, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9637818336486816, "rewards/repeat_penalty/std": 0.08662346750497818, "rewards/near_duplicate_penalty/mean": 0.997008204460144, "rewards/near_duplicate_penalty/std": 0.00376549712382257, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.998017430305481, "rewards/distinct_2/std": 0.0056075118482112885, "rewards/total_composite/mean": 0.048523180186748505, "rewards/total_composite/std": 0.10372652858495712, "reward": 0.048523180186748505, "reward_std": 0.10372653603553772, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23052774369716644, "sampling/sampling_logp_difference/max": 1.1155242919921875, "sampling/importance_sampling_ratio/min": 0.3924805223941803, "sampling/importance_sampling_ratio/mean": 1.0815635919570923, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.857869267463684, "clip_ratio/low_mean": 0.02229299396276474, "clip_ratio/low_min": 0.02229299396276474, "clip_ratio/high_mean": 0.04635914973914623, "clip_ratio/high_max": 0.04635914973914623, "clip_ratio/region_mean": 0.06865214370191097, "reward_total_mean": 0.048523180186748505, "reward_meter_mean": 0.3597410321235657, "reward_meter_std": 0.2850934565067291, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.3894554078578949, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.6828522682189941, "reward_lexical_plausibility_std": 0.32094618678092957, "reward_repeat_penalty_mean": 0.9637818336486816, "reward_repeat_penalty_std": 0.08662346750497818, "reward_near_duplicate_penalty_mean": 0.997008204460144, "reward_near_duplicate_penalty_std": 0.00376549712382257, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.998017430305481, "reward_distinct_2_std": 0.0056075118482112885, "reward_judge_quality_mean": 0.11249999701976776, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.048523180186748505, "reward_total_composite_std": 0.10372652858495712} {"timestamp_utc": "2026-04-12T11:38:53Z", "mode": "train", "global_step": 245, "epoch": 0.009840543037313732, "loss": -0.1572, "grad_norm": 2.6573731899261475, "learning_rate": 9.260606060606062e-06, "num_tokens": 504886.0, "completions/mean_length": 368.375, "completions/min_length": 184.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 224.75, "completions/min_terminated_length": 184.0, "completions/max_terminated_length": 306.0, "rewards/meter/mean": 0.4802515506744385, "rewards/meter/std": 0.18266919255256653, "rewards/count_adherence/mean": 0.7625000476837158, "rewards/count_adherence/std": 0.29246488213539124, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.741745114326477, "rewards/lexical_plausibility/std": 0.2308400571346283, "rewards/judge_quality/mean": 0.10000000149011612, "rewards/judge_quality/std": 0.053452253341674805, "rewards/repeat_penalty/mean": 0.9661213755607605, "rewards/repeat_penalty/std": 0.08737920969724655, "rewards/near_duplicate_penalty/mean": 0.9980625510215759, "rewards/near_duplicate_penalty/std": 0.0016265929443761706, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9993057250976562, "rewards/distinct_2/std": 0.00196364289149642, "rewards/total_composite/mean": 0.028423260897397995, "rewards/total_composite/std": 0.042994480580091476, "reward": 0.028423260897397995, "reward_std": 0.042994480580091476, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2215947061777115, "sampling/sampling_logp_difference/max": 1.366511344909668, "sampling/importance_sampling_ratio/min": 0.2549950182437897, "sampling/importance_sampling_ratio/mean": 1.059888243675232, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8231218457221985, "clip_ratio/low_mean": 0.015931373462080956, "clip_ratio/low_min": 0.015931373462080956, "clip_ratio/high_mean": 0.07494353130459785, "clip_ratio/high_max": 0.07494353130459785, "clip_ratio/region_mean": 0.09087490476667881, "reward_total_mean": 0.028423260897397995, "reward_meter_mean": 0.4802515506744385, "reward_meter_std": 0.18266919255256653, "reward_count_adherence_mean": 0.7625000476837158, "reward_count_adherence_std": 0.29246488213539124, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.741745114326477, "reward_lexical_plausibility_std": 0.2308400571346283, "reward_repeat_penalty_mean": 0.9661213755607605, "reward_repeat_penalty_std": 0.08737920969724655, "reward_near_duplicate_penalty_mean": 0.9980625510215759, "reward_near_duplicate_penalty_std": 0.0016265929443761706, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9993057250976562, "reward_distinct_2_std": 0.00196364289149642, "reward_judge_quality_mean": 0.10000000149011612, "reward_judge_quality_std": 0.053452253341674805, "reward_total_composite_mean": 0.028423260897397995, "reward_total_composite_std": 0.042994480580091476} {"timestamp_utc": "2026-04-12T11:39:03Z", "mode": "train", "global_step": 246, "epoch": 0.009880708519098686, "loss": 0.0746, "grad_norm": 13.963288307189941, "learning_rate": 9.257575757575759e-06, "num_tokens": 506583.0, "completions/mean_length": 54.125, "completions/min_length": 45.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.125, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.6155509352684021, "rewards/meter/std": 0.3467852473258972, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9943249225616455, "rewards/lexical_plausibility/std": 0.010853094980120659, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9779219627380371, "rewards/repeat_penalty/std": 0.03843917325139046, "rewards/near_duplicate_penalty/mean": 0.9846223592758179, "rewards/near_duplicate_penalty/std": 0.02112414687871933, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.20216278731822968, "rewards/total_composite/std": 0.1850358545780182, "reward": 0.20216278731822968, "reward_std": 0.185035839676857, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2559899687767029, "sampling/sampling_logp_difference/max": 1.5820841789245605, "sampling/importance_sampling_ratio/min": 0.20554624497890472, "sampling/importance_sampling_ratio/mean": 1.0648609399795532, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.505162835121155, "clip_ratio/low_mean": 0.09598811622709036, "clip_ratio/low_min": 0.09598811622709036, "clip_ratio/high_mean": 0.06708754226565361, "clip_ratio/high_max": 0.06708754226565361, "clip_ratio/region_mean": 0.16307565849274397, "reward_total_mean": 0.20216278731822968, "reward_meter_mean": 0.6155509352684021, "reward_meter_std": 0.3467852473258972, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9943249225616455, "reward_lexical_plausibility_std": 0.010853094980120659, "reward_repeat_penalty_mean": 0.9779219627380371, "reward_repeat_penalty_std": 0.03843917325139046, "reward_near_duplicate_penalty_mean": 0.9846223592758179, "reward_near_duplicate_penalty_std": 0.02112414687871933, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.20216278731822968, "reward_total_composite_std": 0.1850358545780182} {"timestamp_utc": "2026-04-12T11:39:17Z", "mode": "train", "global_step": 247, "epoch": 0.00992087400088364, "loss": -0.0168, "grad_norm": 4.635673522949219, "learning_rate": 9.254545454545454e-06, "num_tokens": 508157.0, "completions/mean_length": 93.75, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.38106468319892883, "rewards/meter/std": 0.3492964208126068, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9063384532928467, "rewards/lexical_plausibility/std": 0.1857299953699112, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.907705545425415, "rewards/repeat_penalty/std": 0.15060622990131378, "rewards/near_duplicate_penalty/mean": 0.9728717803955078, "rewards/near_duplicate_penalty/std": 0.04505414515733719, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9896363019943237, "rewards/distinct_2/std": 0.026975518092513084, "rewards/total_composite/mean": 0.14492686092853546, "rewards/total_composite/std": 0.16703473031520844, "reward": 0.14492686092853546, "reward_std": 0.16703473031520844, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19871190190315247, "sampling/sampling_logp_difference/max": 1.8816604614257812, "sampling/importance_sampling_ratio/min": 0.1523369401693344, "sampling/importance_sampling_ratio/mean": 0.9977893233299255, "sampling/importance_sampling_ratio/max": 1.8797191381454468, "entropy": 1.7135359048843384, "clip_ratio/low_mean": 0.06776629760861397, "clip_ratio/low_min": 0.06776629760861397, "clip_ratio/high_mean": 0.12760251387953758, "clip_ratio/high_max": 0.12760251387953758, "clip_ratio/region_mean": 0.19536881148815155, "reward_total_mean": 0.14492686092853546, "reward_meter_mean": 0.38106468319892883, "reward_meter_std": 0.3492964208126068, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9063384532928467, "reward_lexical_plausibility_std": 0.1857299953699112, "reward_repeat_penalty_mean": 0.907705545425415, "reward_repeat_penalty_std": 0.15060622990131378, "reward_near_duplicate_penalty_mean": 0.9728717803955078, "reward_near_duplicate_penalty_std": 0.04505414515733719, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9896363019943237, "reward_distinct_2_std": 0.026975518092513084, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.14492686092853546, "reward_total_composite_std": 0.16703473031520844} {"timestamp_utc": "2026-04-12T11:39:27Z", "mode": "train", "global_step": 248, "epoch": 0.009961039482668594, "loss": 0.0127, "grad_norm": 12.676898002624512, "learning_rate": 9.251515151515152e-06, "num_tokens": 509902.0, "completions/mean_length": 59.125, "completions/min_length": 47.0, "completions/max_length": 75.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.125, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.6911441087722778, "rewards/meter/std": 0.385056734085083, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9953168630599976, "rewards/lexical_plausibility/std": 0.008684071712195873, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9910987615585327, "rewards/repeat_penalty/std": 0.009570775553584099, "rewards/near_duplicate_penalty/mean": 0.9910987615585327, "rewards/near_duplicate_penalty/std": 0.009570775553584099, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20069202780723572, "rewards/total_composite/std": 0.14950935542583466, "reward": 0.20069202780723572, "reward_std": 0.14950934052467346, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23086237907409668, "sampling/sampling_logp_difference/max": 1.3593578338623047, "sampling/importance_sampling_ratio/min": 0.25682565569877625, "sampling/importance_sampling_ratio/mean": 1.037505865097046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.641067147254944, "clip_ratio/low_mean": 0.07672099955379963, "clip_ratio/low_min": 0.07672099955379963, "clip_ratio/high_mean": 0.10969330742955208, "clip_ratio/high_max": 0.10969330742955208, "clip_ratio/region_mean": 0.1864143069833517, "reward_total_mean": 0.20069202780723572, "reward_meter_mean": 0.6911441087722778, "reward_meter_std": 0.385056734085083, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9953168630599976, "reward_lexical_plausibility_std": 0.008684071712195873, "reward_repeat_penalty_mean": 0.9910987615585327, "reward_repeat_penalty_std": 0.009570775553584099, "reward_near_duplicate_penalty_mean": 0.9910987615585327, "reward_near_duplicate_penalty_std": 0.009570775553584099, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.20069202780723572, "reward_total_composite_std": 0.14950935542583466} {"timestamp_utc": "2026-04-12T11:39:42Z", "mode": "train", "global_step": 249, "epoch": 0.010001204964453548, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 9.248484848484849e-06, "num_tokens": 513006.0, "completions/mean_length": 410.0, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 308.0, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 491.0, "rewards/meter/mean": 0.5463802218437195, "rewards/meter/std": 0.3094373643398285, "rewards/count_adherence/mean": 0.4375, "rewards/count_adherence/std": 0.27125275135040283, "rewards/arabic_clean/mean": 0.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.6930003762245178, "rewards/lexical_plausibility/std": 0.2002602368593216, "rewards/judge_quality/mean": 0.0625, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9972835183143616, "rewards/repeat_penalty/std": 0.0019352545496076345, "rewards/near_duplicate_penalty/mean": 0.9972835183143616, "rewards/near_duplicate_penalty/std": 0.0019352545496076345, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0, "rewards/total_composite/std": 0.0, "reward": 0.0, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.19660653173923492, "sampling/sampling_logp_difference/max": 1.0296039581298828, "sampling/importance_sampling_ratio/min": 0.3571484088897705, "sampling/importance_sampling_ratio/mean": 1.045520305633545, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.4071234464645386, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.0, "reward_meter_mean": 0.5463802218437195, "reward_meter_std": 0.3094373643398285, "reward_count_adherence_mean": 0.4375, "reward_count_adherence_std": 0.27125275135040283, "reward_arabic_clean_mean": 0.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.6930003762245178, "reward_lexical_plausibility_std": 0.2002602368593216, "reward_repeat_penalty_mean": 0.9972835183143616, "reward_repeat_penalty_std": 0.0019352545496076345, "reward_near_duplicate_penalty_mean": 0.9972835183143616, "reward_near_duplicate_penalty_std": 0.0019352545496076345, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.0625, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.0, "reward_total_composite_std": 0.0} {"timestamp_utc": "2026-04-12T11:39:52Z", "mode": "train", "global_step": 250, "epoch": 0.010041370446238502, "loss": 0.026, "grad_norm": 14.034645080566406, "learning_rate": 9.245454545454546e-06, "num_tokens": 514633.0, "completions/mean_length": 50.375, "completions/min_length": 46.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.375, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.37017858028411865, "rewards/meter/std": 0.2679588198661804, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.9731531143188477, "rewards/repeat_penalty/std": 0.02014872431755066, "rewards/near_duplicate_penalty/mean": 0.9810901880264282, "rewards/near_duplicate_penalty/std": 0.008582751266658306, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.15338610112667084, "rewards/total_composite/std": 0.10794755816459656, "reward": 0.15338610112667084, "reward_std": 0.10794755071401596, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23086252808570862, "sampling/sampling_logp_difference/max": 3.903805732727051, "sampling/importance_sampling_ratio/min": 0.02016502246260643, "sampling/importance_sampling_ratio/mean": 1.0236157178878784, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3722375631332397, "clip_ratio/low_mean": 0.09338569827377796, "clip_ratio/low_min": 0.09338569827377796, "clip_ratio/high_mean": 0.10044643003493547, "clip_ratio/high_max": 0.10044643003493547, "clip_ratio/region_mean": 0.19383212830871344, "reward_total_mean": 0.15338610112667084, "reward_meter_mean": 0.37017858028411865, "reward_meter_std": 0.2679588198661804, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.9731531143188477, "reward_repeat_penalty_std": 0.02014872431755066, "reward_near_duplicate_penalty_mean": 0.9810901880264282, "reward_near_duplicate_penalty_std": 0.008582751266658306, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.15338610112667084, "reward_total_composite_std": 0.10794755816459656} {"timestamp_utc": "2026-04-12T11:42:35Z", "mode": "eval", "global_step": 250, "epoch": 0.010041370446238502, "eval_loss": NaN, "eval_runtime": 163.0871, "eval_samples_per_second": 0.638, "eval_steps_per_second": 0.08, "eval_num_tokens": 514633.0, "eval_completions/mean_length": 190.29807692307693, "eval_completions/min_length": 41.07692307692308, "eval_completions/max_length": 459.84615384615387, "eval_completions/clipped_ratio": 0.18269230769230768, "eval_completions/mean_terminated_length": 120.03590158315805, "eval_completions/min_terminated_length": 41.07692307692308, "eval_completions/max_terminated_length": 247.30769230769232, "eval_rewards/meter/mean": 0.35175654177482313, "eval_rewards/meter/std": 0.33574836070720965, "eval_rewards/count_adherence/mean": 0.9094114349438593, "eval_rewards/count_adherence/std": 0.15080647428448385, "eval_rewards/arabic_clean/mean": 0.7403846153846154, "eval_rewards/arabic_clean/std": 0.3887776663670173, "eval_rewards/lexical_plausibility/mean": 0.9016158397381122, "eval_rewards/lexical_plausibility/std": 0.1482962743880657, "eval_rewards/judge_quality/mean": 0.319519233245116, "eval_rewards/judge_quality/std": 0.20452269395956627, "eval_rewards/repeat_penalty/mean": 0.9738312730422387, "eval_rewards/repeat_penalty/std": 0.04887550560614237, "eval_rewards/near_duplicate_penalty/mean": 0.9904315425799444, "eval_rewards/near_duplicate_penalty/std": 0.01207644809395648, "eval_rewards/opening_diversity/mean": 0.9927884615384616, "eval_rewards/opening_diversity/std": 0.020397310646680687, "eval_rewards/distinct_2/mean": 0.9907622520740216, "eval_rewards/distinct_2/std": 0.020605855603487447, "eval_rewards/total_composite/mean": 0.11678541100655611, "eval_rewards/total_composite/std": 0.14927118780234686, "eval_reward": 0.11678541100655611, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.1658907303443322, "eval_sampling/sampling_logp_difference/max": 1.1860259129450872, "eval_sampling/importance_sampling_ratio/min": 0.3094748098116655, "eval_sampling/importance_sampling_ratio/mean": 1.0527949975087092, "eval_sampling/importance_sampling_ratio/max": 1.7494422655839186, "eval_entropy": 3.38864253117488, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.11678541100655611, "eval_reward_meter_mean": 0.35175654177482313, "eval_reward_meter_std": 0.33574836070720965, "eval_reward_count_adherence_mean": 0.9094114349438593, "eval_reward_count_adherence_std": 0.15080647428448385, "eval_reward_arabic_clean_mean": 0.7403846153846154, "eval_reward_arabic_clean_std": 0.3887776663670173, "eval_reward_lexical_plausibility_mean": 0.9016158397381122, "eval_reward_lexical_plausibility_std": 0.1482962743880657, "eval_reward_repeat_penalty_mean": 0.9738312730422387, "eval_reward_repeat_penalty_std": 0.04887550560614237, "eval_reward_near_duplicate_penalty_mean": 0.9904315425799444, "eval_reward_near_duplicate_penalty_std": 0.01207644809395648, "eval_reward_opening_diversity_mean": 0.9927884615384616, "eval_reward_opening_diversity_std": 0.020397310646680687, "eval_reward_distinct_2_mean": 0.9907622520740216, "eval_reward_distinct_2_std": 0.020605855603487447, "eval_reward_judge_quality_mean": 0.319519233245116, "eval_reward_judge_quality_std": 0.20452269395956627, "eval_reward_total_composite_mean": 0.11678541100655611, "eval_reward_total_composite_std": 0.14927118780234686} {"timestamp_utc": "2026-04-12T11:42:47Z", "mode": "train", "global_step": 251, "epoch": 0.010081535928023456, "loss": 0.1223, "grad_norm": 15.447683334350586, "learning_rate": 9.242424242424244e-06, "num_tokens": 516312.0, "completions/mean_length": 42.875, "completions/min_length": 36.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.9646941423416138, "rewards/meter/std": 0.036442022770643234, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9295889139175415, "rewards/lexical_plausibility/std": 0.12642835080623627, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.2585087716579437, "rewards/repeat_penalty/mean": 0.9976711273193359, "rewards/repeat_penalty/std": 0.004313847981393337, "rewards/near_duplicate_penalty/mean": 0.9976711273193359, "rewards/near_duplicate_penalty/std": 0.004313847981393337, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3644532263278961, "rewards/total_composite/std": 0.27539464831352234, "reward": 0.3644532263278961, "reward_std": 0.27539464831352234, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22599036991596222, "sampling/sampling_logp_difference/max": 1.4986276626586914, "sampling/importance_sampling_ratio/min": 0.22343659400939941, "sampling/importance_sampling_ratio/mean": 1.043885350227356, "sampling/importance_sampling_ratio/max": 1.9157660007476807, "entropy": 3.080083429813385, "clip_ratio/low_mean": 0.07370169088244438, "clip_ratio/low_min": 0.07370169088244438, "clip_ratio/high_mean": 0.14847705326974392, "clip_ratio/high_max": 0.14847705326974392, "clip_ratio/region_mean": 0.2221787441521883, "reward_total_mean": 0.3644532263278961, "reward_meter_mean": 0.9646941423416138, "reward_meter_std": 0.036442022770643234, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9295889139175415, "reward_lexical_plausibility_std": 0.12642835080623627, "reward_repeat_penalty_mean": 0.9976711273193359, "reward_repeat_penalty_std": 0.004313847981393337, "reward_near_duplicate_penalty_mean": 0.9976711273193359, "reward_near_duplicate_penalty_std": 0.004313847981393337, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.2585087716579437, "reward_total_composite_mean": 0.3644532263278961, "reward_total_composite_std": 0.27539464831352234} {"timestamp_utc": "2026-04-12T11:42:56Z", "mode": "train", "global_step": 252, "epoch": 0.010121701409808411, "loss": 0.1343, "grad_norm": 13.339502334594727, "learning_rate": 9.23939393939394e-06, "num_tokens": 517916.0, "completions/mean_length": 47.5, "completions/min_length": 40.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.7088395953178406, "rewards/meter/std": 0.34888893365859985, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9529064893722534, "rewards/lexical_plausibility/std": 0.09228985756635666, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.23260942101478577, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24300158023834229, "rewards/total_composite/std": 0.26558998227119446, "reward": 0.24300158023834229, "reward_std": 0.26558998227119446, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22465598583221436, "sampling/sampling_logp_difference/max": 1.2926592826843262, "sampling/importance_sampling_ratio/min": 0.2745397090911865, "sampling/importance_sampling_ratio/mean": 1.0339922904968262, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0143211483955383, "clip_ratio/low_mean": 0.10859714634716511, "clip_ratio/low_min": 0.10859714634716511, "clip_ratio/high_mean": 0.08645833656191826, "clip_ratio/high_max": 0.08645833656191826, "clip_ratio/region_mean": 0.19505548290908337, "reward_total_mean": 0.24300158023834229, "reward_meter_mean": 0.7088395953178406, "reward_meter_std": 0.34888893365859985, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9529064893722534, "reward_lexical_plausibility_std": 0.09228985756635666, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.23260942101478577, "reward_total_composite_mean": 0.24300158023834229, "reward_total_composite_std": 0.26558998227119446} {"timestamp_utc": "2026-04-12T11:43:11Z", "mode": "train", "global_step": 253, "epoch": 0.010161866891593365, "loss": -0.073, "grad_norm": 2.8028078079223633, "learning_rate": 9.236363636363636e-06, "num_tokens": 519973.0, "completions/mean_length": 271.125, "completions/min_length": 98.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 126.5999984741211, "completions/min_terminated_length": 98.0, "completions/max_terminated_length": 215.0, "rewards/meter/mean": 0.44935062527656555, "rewards/meter/std": 0.3874340057373047, "rewards/count_adherence/mean": 0.8958333134651184, "rewards/count_adherence/std": 0.12400396913290024, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8119495511054993, "rewards/lexical_plausibility/std": 0.2038293480873108, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.20310096442699432, "rewards/repeat_penalty/mean": 0.9870443344116211, "rewards/repeat_penalty/std": 0.018468057736754417, "rewards/near_duplicate_penalty/mean": 0.9940108060836792, "rewards/near_duplicate_penalty/std": 0.007382832467556, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9929375052452087, "rewards/distinct_2/std": 0.013083843514323235, "rewards/total_composite/mean": 0.1686832755804062, "rewards/total_composite/std": 0.19913244247436523, "reward": 0.1686832755804062, "reward_std": 0.19913245737552643, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20941412448883057, "sampling/sampling_logp_difference/max": 1.2020454406738281, "sampling/importance_sampling_ratio/min": 0.300578773021698, "sampling/importance_sampling_ratio/mean": 1.0455708503723145, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6216647922992706, "clip_ratio/low_mean": 0.030135659500956535, "clip_ratio/low_min": 0.030135659500956535, "clip_ratio/high_mean": 0.08487984724342823, "clip_ratio/high_max": 0.08487984724342823, "clip_ratio/region_mean": 0.11501550674438477, "reward_total_mean": 0.1686832755804062, "reward_meter_mean": 0.44935062527656555, "reward_meter_std": 0.3874340057373047, "reward_count_adherence_mean": 0.8958333134651184, "reward_count_adherence_std": 0.12400396913290024, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8119495511054993, "reward_lexical_plausibility_std": 0.2038293480873108, "reward_repeat_penalty_mean": 0.9870443344116211, "reward_repeat_penalty_std": 0.018468057736754417, "reward_near_duplicate_penalty_mean": 0.9940108060836792, "reward_near_duplicate_penalty_std": 0.007382832467556, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9929375052452087, "reward_distinct_2_std": 0.013083843514323235, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.20310096442699432, "reward_total_composite_mean": 0.1686832755804062, "reward_total_composite_std": 0.19913244247436523} {"timestamp_utc": "2026-04-12T11:43:21Z", "mode": "train", "global_step": 254, "epoch": 0.01020203237337832, "loss": 0.1091, "grad_norm": 22.059316635131836, "learning_rate": 9.233333333333334e-06, "num_tokens": 521365.0, "completions/mean_length": 25.0, "completions/min_length": 21.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.4769478440284729, "rewards/meter/std": 0.37168920040130615, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9941449165344238, "rewards/lexical_plausibility/std": 0.016560783609747887, "rewards/judge_quality/mean": 0.5337499976158142, "rewards/judge_quality/std": 0.17104199528694153, "rewards/repeat_penalty/mean": 0.9345779418945312, "rewards/repeat_penalty/std": 0.14903269708156586, "rewards/near_duplicate_penalty/mean": 0.9735829830169678, "rewards/near_duplicate_penalty/std": 0.04036236181855202, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.25110459327697754, "rewards/total_composite/std": 0.2017320841550827, "reward": 0.25110459327697754, "reward_std": 0.2017320990562439, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17039695382118225, "sampling/sampling_logp_difference/max": 1.5042152404785156, "sampling/importance_sampling_ratio/min": 0.22219161689281464, "sampling/importance_sampling_ratio/mean": 1.0191543102264404, "sampling/importance_sampling_ratio/max": 1.8768799304962158, "entropy": 1.199865683913231, "clip_ratio/low_mean": 0.09119006153196096, "clip_ratio/low_min": 0.09119006153196096, "clip_ratio/high_mean": 0.08217719849199057, "clip_ratio/high_max": 0.08217719849199057, "clip_ratio/region_mean": 0.17336726002395153, "reward_total_mean": 0.25110459327697754, "reward_meter_mean": 0.4769478440284729, "reward_meter_std": 0.37168920040130615, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9941449165344238, "reward_lexical_plausibility_std": 0.016560783609747887, "reward_repeat_penalty_mean": 0.9345779418945312, "reward_repeat_penalty_std": 0.14903269708156586, "reward_near_duplicate_penalty_mean": 0.9735829830169678, "reward_near_duplicate_penalty_std": 0.04036236181855202, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.5337499976158142, "reward_judge_quality_std": 0.17104199528694153, "reward_total_composite_mean": 0.25110459327697754, "reward_total_composite_std": 0.2017320841550827} {"timestamp_utc": "2026-04-12T11:43:36Z", "mode": "train", "global_step": 255, "epoch": 0.010242197855163273, "loss": -0.1652, "grad_norm": 3.5489718914031982, "learning_rate": 9.23030303030303e-06, "num_tokens": 524589.0, "completions/mean_length": 308.0, "completions/min_length": 213.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 240.0, "completions/min_terminated_length": 213.0, "completions/max_terminated_length": 284.0, "rewards/meter/mean": 0.6008556485176086, "rewards/meter/std": 0.15912260115146637, "rewards/count_adherence/mean": 0.8541666269302368, "rewards/count_adherence/std": 0.16517187654972076, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8297012448310852, "rewards/lexical_plausibility/std": 0.1053345650434494, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.9708657264709473, "rewards/repeat_penalty/std": 0.024701109156012535, "rewards/near_duplicate_penalty/mean": 0.9894903898239136, "rewards/near_duplicate_penalty/std": 0.007003883831202984, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9811153411865234, "rewards/distinct_2/std": 0.020878588780760765, "rewards/total_composite/mean": 0.0616358257830143, "rewards/total_composite/std": 0.06312758475542068, "reward": 0.0616358257830143, "reward_std": 0.06312758475542068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21726159751415253, "sampling/sampling_logp_difference/max": 1.3737688064575195, "sampling/importance_sampling_ratio/min": 0.2531510591506958, "sampling/importance_sampling_ratio/mean": 1.0538618564605713, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.8067986369132996, "clip_ratio/low_mean": 0.027880338951945305, "clip_ratio/low_min": 0.027880338951945305, "clip_ratio/high_mean": 0.08326276205480099, "clip_ratio/high_max": 0.08326276205480099, "clip_ratio/region_mean": 0.11114310100674629, "reward_total_mean": 0.0616358257830143, "reward_meter_mean": 0.6008556485176086, "reward_meter_std": 0.15912260115146637, "reward_count_adherence_mean": 0.8541666269302368, "reward_count_adherence_std": 0.16517187654972076, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8297012448310852, "reward_lexical_plausibility_std": 0.1053345650434494, "reward_repeat_penalty_mean": 0.9708657264709473, "reward_repeat_penalty_std": 0.024701109156012535, "reward_near_duplicate_penalty_mean": 0.9894903898239136, "reward_near_duplicate_penalty_std": 0.007003883831202984, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9811153411865234, "reward_distinct_2_std": 0.020878588780760765, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.0616358257830143, "reward_total_composite_std": 0.06312758475542068} {"timestamp_utc": "2026-04-12T11:43:46Z", "mode": "train", "global_step": 256, "epoch": 0.010282363336948227, "loss": 0.0754, "grad_norm": 27.22827911376953, "learning_rate": 9.227272727272728e-06, "num_tokens": 525915.0, "completions/mean_length": 17.75, "completions/min_length": 15.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.7467088103294373, "rewards/meter/std": 0.3884599804878235, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8452818393707275, "rewards/lexical_plausibility/std": 0.18745341897010803, "rewards/judge_quality/mean": 0.3800000250339508, "rewards/judge_quality/std": 0.3489985764026642, "rewards/repeat_penalty/mean": 0.729301929473877, "rewards/repeat_penalty/std": 0.058542944490909576, "rewards/near_duplicate_penalty/mean": 0.9724025726318359, "rewards/near_duplicate_penalty/std": 0.07805725187063217, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22989892959594727, "rewards/total_composite/std": 0.2969686985015869, "reward": 0.22989892959594727, "reward_std": 0.2969686686992645, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23513489961624146, "sampling/sampling_logp_difference/max": 1.5084762573242188, "sampling/importance_sampling_ratio/min": 0.2212468534708023, "sampling/importance_sampling_ratio/mean": 1.0271424055099487, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3353227227926254, "clip_ratio/low_mean": 0.15449346834793687, "clip_ratio/low_min": 0.15449346834793687, "clip_ratio/high_mean": 0.05964912474155426, "clip_ratio/high_max": 0.05964912474155426, "clip_ratio/region_mean": 0.21414259308949113, "reward_total_mean": 0.22989892959594727, "reward_meter_mean": 0.7467088103294373, "reward_meter_std": 0.3884599804878235, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8452818393707275, "reward_lexical_plausibility_std": 0.18745341897010803, "reward_repeat_penalty_mean": 0.729301929473877, "reward_repeat_penalty_std": 0.058542944490909576, "reward_near_duplicate_penalty_mean": 0.9724025726318359, "reward_near_duplicate_penalty_std": 0.07805725187063217, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3800000250339508, "reward_judge_quality_std": 0.3489985764026642, "reward_total_composite_mean": 0.22989892959594727, "reward_total_composite_std": 0.2969686985015869} {"timestamp_utc": "2026-04-12T11:44:01Z", "mode": "train", "global_step": 257, "epoch": 0.010322528818733181, "loss": -0.0162, "grad_norm": 5.925915718078613, "learning_rate": 9.224242424242424e-06, "num_tokens": 527771.0, "completions/mean_length": 118.0, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.71428680419922, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.5321698188781738, "rewards/meter/std": 0.3322257101535797, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9015945196151733, "rewards/lexical_plausibility/std": 0.2712819278240204, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.9819114208221436, "rewards/repeat_penalty/std": 0.017748935148119926, "rewards/near_duplicate_penalty/mean": 0.9819114208221436, "rewards/near_duplicate_penalty/std": 0.017748935148119926, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22129103541374207, "rewards/total_composite/std": 0.2818167209625244, "reward": 0.22129103541374207, "reward_std": 0.2818167209625244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22934019565582275, "sampling/sampling_logp_difference/max": 1.6250391006469727, "sampling/importance_sampling_ratio/min": 0.19690397381782532, "sampling/importance_sampling_ratio/mean": 1.0515106916427612, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2498981803655624, "clip_ratio/low_mean": 0.09621335752308369, "clip_ratio/low_min": 0.09621335752308369, "clip_ratio/high_mean": 0.07149841822683811, "clip_ratio/high_max": 0.07149841822683811, "clip_ratio/region_mean": 0.1677117757499218, "reward_total_mean": 0.22129103541374207, "reward_meter_mean": 0.5321698188781738, "reward_meter_std": 0.3322257101535797, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9015945196151733, "reward_lexical_plausibility_std": 0.2712819278240204, "reward_repeat_penalty_mean": 0.9819114208221436, "reward_repeat_penalty_std": 0.017748935148119926, "reward_near_duplicate_penalty_mean": 0.9819114208221436, "reward_near_duplicate_penalty_std": 0.017748935148119926, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.22129103541374207, "reward_total_composite_std": 0.2818167209625244} {"timestamp_utc": "2026-04-12T11:44:16Z", "mode": "train", "global_step": 258, "epoch": 0.010362694300518135, "loss": -0.0621, "grad_norm": 5.228208541870117, "learning_rate": 9.221212121212123e-06, "num_tokens": 529270.0, "completions/mean_length": 95.375, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 35.85714340209961, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.530077338218689, "rewards/meter/std": 0.4401782155036926, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9359341859817505, "rewards/lexical_plausibility/std": 0.18120546638965607, "rewards/judge_quality/mean": 0.5087500214576721, "rewards/judge_quality/std": 0.2959941029548645, "rewards/repeat_penalty/mean": 0.9931499361991882, "rewards/repeat_penalty/std": 0.016404850408434868, "rewards/near_duplicate_penalty/mean": 0.9931499361991882, "rewards/near_duplicate_penalty/std": 0.016404850408434868, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3076081871986389, "rewards/total_composite/std": 0.2989545464515686, "reward": 0.3076081871986389, "reward_std": 0.2989545464515686, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21388907730579376, "sampling/sampling_logp_difference/max": 1.5502357482910156, "sampling/importance_sampling_ratio/min": 0.212197944521904, "sampling/importance_sampling_ratio/mean": 1.0432251691818237, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9004587233066559, "clip_ratio/low_mean": 0.04779411852359772, "clip_ratio/low_min": 0.04779411852359772, "clip_ratio/high_mean": 0.1295657865703106, "clip_ratio/high_max": 0.1295657865703106, "clip_ratio/region_mean": 0.1773599050939083, "reward_total_mean": 0.3076081871986389, "reward_meter_mean": 0.530077338218689, "reward_meter_std": 0.4401782155036926, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9359341859817505, "reward_lexical_plausibility_std": 0.18120546638965607, "reward_repeat_penalty_mean": 0.9931499361991882, "reward_repeat_penalty_std": 0.016404850408434868, "reward_near_duplicate_penalty_mean": 0.9931499361991882, "reward_near_duplicate_penalty_std": 0.016404850408434868, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5087500214576721, "reward_judge_quality_std": 0.2959941029548645, "reward_total_composite_mean": 0.3076081871986389, "reward_total_composite_std": 0.2989545464515686} {"timestamp_utc": "2026-04-12T11:44:26Z", "mode": "train", "global_step": 259, "epoch": 0.010402859782303089, "loss": 0.0289, "grad_norm": 12.575897216796875, "learning_rate": 9.21818181818182e-06, "num_tokens": 531301.0, "completions/mean_length": 88.875, "completions/min_length": 75.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 88.875, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.5499953031539917, "rewards/meter/std": 0.39406150579452515, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.983332633972168, "rewards/repeat_penalty/std": 0.021853748708963394, "rewards/near_duplicate_penalty/mean": 0.9898728728294373, "rewards/near_duplicate_penalty/std": 0.009024342522025108, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.26504188776016235, "rewards/total_composite/std": 0.25803911685943604, "reward": 0.26504188776016235, "reward_std": 0.25803911685943604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16319558024406433, "sampling/sampling_logp_difference/max": 2.4158849716186523, "sampling/importance_sampling_ratio/min": 0.08928828686475754, "sampling/importance_sampling_ratio/mean": 1.011214017868042, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9410185590386391, "clip_ratio/low_mean": 0.06891975738108158, "clip_ratio/low_min": 0.06891975738108158, "clip_ratio/high_mean": 0.053794910199940205, "clip_ratio/high_max": 0.053794910199940205, "clip_ratio/region_mean": 0.12271466758102179, "reward_total_mean": 0.26504188776016235, "reward_meter_mean": 0.5499953031539917, "reward_meter_std": 0.39406150579452515, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.983332633972168, "reward_repeat_penalty_std": 0.021853748708963394, "reward_near_duplicate_penalty_mean": 0.9898728728294373, "reward_near_duplicate_penalty_std": 0.009024342522025108, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.26504188776016235, "reward_total_composite_std": 0.25803911685943604} {"timestamp_utc": "2026-04-12T11:44:36Z", "mode": "train", "global_step": 260, "epoch": 0.010443025264088043, "loss": -0.0745, "grad_norm": 14.188420295715332, "learning_rate": 9.215151515151515e-06, "num_tokens": 532931.0, "completions/mean_length": 37.75, "completions/min_length": 22.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.75, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6892690658569336, "rewards/meter/std": 0.3877565860748291, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.97265625, "rewards/lexical_plausibility/std": 0.07733980566263199, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9641187191009521, "rewards/repeat_penalty/std": 0.08692087978124619, "rewards/near_duplicate_penalty/mean": 0.9953687191009521, "rewards/near_duplicate_penalty/std": 0.008575868792831898, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21461795270442963, "rewards/total_composite/std": 0.16348567605018616, "reward": 0.21461795270442963, "reward_std": 0.16348569095134735, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22446295619010925, "sampling/sampling_logp_difference/max": 1.6275043487548828, "sampling/importance_sampling_ratio/min": 0.1964191496372223, "sampling/importance_sampling_ratio/mean": 1.0513017177581787, "sampling/importance_sampling_ratio/max": 1.9789457321166992, "entropy": 2.5972491651773453, "clip_ratio/low_mean": 0.06940420810133219, "clip_ratio/low_min": 0.06940420810133219, "clip_ratio/high_mean": 0.08271594252437353, "clip_ratio/high_max": 0.08271594252437353, "clip_ratio/region_mean": 0.15212015062570572, "reward_total_mean": 0.21461795270442963, "reward_meter_mean": 0.6892690658569336, "reward_meter_std": 0.3877565860748291, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.97265625, "reward_lexical_plausibility_std": 0.07733980566263199, "reward_repeat_penalty_mean": 0.9641187191009521, "reward_repeat_penalty_std": 0.08692087978124619, "reward_near_duplicate_penalty_mean": 0.9953687191009521, "reward_near_duplicate_penalty_std": 0.008575868792831898, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.21461795270442963, "reward_total_composite_std": 0.16348567605018616} {"timestamp_utc": "2026-04-12T11:44:45Z", "mode": "train", "global_step": 261, "epoch": 0.010483190745872997, "loss": 0.0094, "grad_norm": 29.37902069091797, "learning_rate": 9.212121212121213e-06, "num_tokens": 534267.0, "completions/mean_length": 21.0, "completions/min_length": 16.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.7790894508361816, "rewards/meter/std": 0.3281017243862152, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9209558963775635, "rewards/lexical_plausibility/std": 0.22357052564620972, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23637709021568298, "rewards/total_composite/std": 0.11187026649713516, "reward": 0.23637709021568298, "reward_std": 0.11187026649713516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21879105269908905, "sampling/sampling_logp_difference/max": 1.655721664428711, "sampling/importance_sampling_ratio/min": 0.19095420837402344, "sampling/importance_sampling_ratio/mean": 1.0388354063034058, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8359774500131607, "clip_ratio/low_mean": 0.04009103728458285, "clip_ratio/low_min": 0.04009103728458285, "clip_ratio/high_mean": 0.1419555712491274, "clip_ratio/high_max": 0.1419555712491274, "clip_ratio/region_mean": 0.18204660853371024, "reward_total_mean": 0.23637709021568298, "reward_meter_mean": 0.7790894508361816, "reward_meter_std": 0.3281017243862152, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9209558963775635, "reward_lexical_plausibility_std": 0.22357052564620972, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.23637709021568298, "reward_total_composite_std": 0.11187026649713516} {"timestamp_utc": "2026-04-12T11:44:56Z", "mode": "train", "global_step": 262, "epoch": 0.01052335622765795, "loss": 0.0591, "grad_norm": 12.937562942504883, "learning_rate": 9.20909090909091e-06, "num_tokens": 536511.0, "completions/mean_length": 85.5, "completions/min_length": 74.0, "completions/max_length": 93.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.5, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.5915085673332214, "rewards/meter/std": 0.37578529119491577, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9946610331535339, "rewards/lexical_plausibility/std": 0.012002813629806042, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.985454797744751, "rewards/repeat_penalty/std": 0.01338482741266489, "rewards/near_duplicate_penalty/mean": 0.9898806810379028, "rewards/near_duplicate_penalty/std": 0.004475778434425592, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9955277442932129, "rewards/distinct_2/std": 0.012649492360651493, "rewards/total_composite/mean": 0.2553885281085968, "rewards/total_composite/std": 0.16473935544490814, "reward": 0.2553885281085968, "reward_std": 0.16473934054374695, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18291543424129486, "sampling/sampling_logp_difference/max": 1.422365665435791, "sampling/importance_sampling_ratio/min": 0.2411428987979889, "sampling/importance_sampling_ratio/mean": 1.0286941528320312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8144361525774002, "clip_ratio/low_mean": 0.06164874602109194, "clip_ratio/low_min": 0.06164874602109194, "clip_ratio/high_mean": 0.1036654431372881, "clip_ratio/high_max": 0.1036654431372881, "clip_ratio/region_mean": 0.16531418915838003, "reward_total_mean": 0.2553885281085968, "reward_meter_mean": 0.5915085673332214, "reward_meter_std": 0.37578529119491577, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9946610331535339, "reward_lexical_plausibility_std": 0.012002813629806042, "reward_repeat_penalty_mean": 0.985454797744751, "reward_repeat_penalty_std": 0.01338482741266489, "reward_near_duplicate_penalty_mean": 0.9898806810379028, "reward_near_duplicate_penalty_std": 0.004475778434425592, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9955277442932129, "reward_distinct_2_std": 0.012649492360651493, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2553885281085968, "reward_total_composite_std": 0.16473935544490814} {"timestamp_utc": "2026-04-12T11:45:07Z", "mode": "train", "global_step": 263, "epoch": 0.010563521709442905, "loss": 0.0377, "grad_norm": 23.47962760925293, "learning_rate": 9.206060606060607e-06, "num_tokens": 538274.0, "completions/mean_length": 48.375, "completions/min_length": 46.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7191702127456665, "rewards/meter/std": 0.3571155369281769, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.97345370054245, "rewards/repeat_penalty/std": 0.027753889560699463, "rewards/near_duplicate_penalty/mean": 0.9798084497451782, "rewards/near_duplicate_penalty/std": 0.011606940999627113, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.24807783961296082, "rewards/total_composite/std": 0.1624012291431427, "reward": 0.24807783961296082, "reward_std": 0.1624012291431427, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1425853669643402, "sampling/sampling_logp_difference/max": 2.7772879600524902, "sampling/importance_sampling_ratio/min": 0.06220698729157448, "sampling/importance_sampling_ratio/mean": 0.9902973175048828, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5828147940337658, "clip_ratio/low_mean": 0.04684942774474621, "clip_ratio/low_min": 0.04684942774474621, "clip_ratio/high_mean": 0.07390000717714429, "clip_ratio/high_max": 0.07390000717714429, "clip_ratio/region_mean": 0.1207494349218905, "reward_total_mean": 0.24807783961296082, "reward_meter_mean": 0.7191702127456665, "reward_meter_std": 0.3571155369281769, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.97345370054245, "reward_repeat_penalty_std": 0.027753889560699463, "reward_near_duplicate_penalty_mean": 0.9798084497451782, "reward_near_duplicate_penalty_std": 0.011606940999627113, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.24807783961296082, "reward_total_composite_std": 0.1624012291431427} {"timestamp_utc": "2026-04-12T11:45:17Z", "mode": "train", "global_step": 264, "epoch": 0.010603687191227859, "loss": 0.0832, "grad_norm": 15.381331443786621, "learning_rate": 9.203030303030304e-06, "num_tokens": 539903.0, "completions/mean_length": 44.625, "completions/min_length": 37.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.48013317584991455, "rewards/meter/std": 0.38423803448677063, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.997526228427887, "rewards/repeat_penalty/std": 0.004690530244261026, "rewards/near_duplicate_penalty/mean": 0.997526228427887, "rewards/near_duplicate_penalty/std": 0.004690530244261026, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19194018840789795, "rewards/total_composite/std": 0.15907663106918335, "reward": 0.19194018840789795, "reward_std": 0.15907663106918335, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1822473108768463, "sampling/sampling_logp_difference/max": 1.3917350769042969, "sampling/importance_sampling_ratio/min": 0.24864351749420166, "sampling/importance_sampling_ratio/mean": 1.0437666177749634, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8692835420370102, "clip_ratio/low_mean": 0.052580203395336866, "clip_ratio/low_min": 0.052580203395336866, "clip_ratio/high_mean": 0.08467308338731527, "clip_ratio/high_max": 0.08467308338731527, "clip_ratio/region_mean": 0.13725328678265214, "reward_total_mean": 0.19194018840789795, "reward_meter_mean": 0.48013317584991455, "reward_meter_std": 0.38423803448677063, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.997526228427887, "reward_repeat_penalty_std": 0.004690530244261026, "reward_near_duplicate_penalty_mean": 0.997526228427887, "reward_near_duplicate_penalty_std": 0.004690530244261026, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.19194018840789795, "reward_total_composite_std": 0.15907663106918335} {"timestamp_utc": "2026-04-12T11:45:28Z", "mode": "train", "global_step": 265, "epoch": 0.010643852673012813, "loss": -0.0039, "grad_norm": 9.906608581542969, "learning_rate": 9.200000000000002e-06, "num_tokens": 542069.0, "completions/mean_length": 97.75, "completions/min_length": 88.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 97.75, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.8352808952331543, "rewards/meter/std": 0.27949875593185425, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9836615324020386, "rewards/lexical_plausibility/std": 0.046212125569581985, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9923805594444275, "rewards/repeat_penalty/std": 0.005976299289613962, "rewards/near_duplicate_penalty/mean": 0.9923805594444275, "rewards/near_duplicate_penalty/std": 0.005976299289613962, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30081719160079956, "rewards/total_composite/std": 0.17533625662326813, "reward": 0.30081719160079956, "reward_std": 0.17533625662326813, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2217099666595459, "sampling/sampling_logp_difference/max": 1.699728012084961, "sampling/importance_sampling_ratio/min": 0.1827332228422165, "sampling/importance_sampling_ratio/mean": 1.0484706163406372, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.641939789056778, "clip_ratio/low_mean": 0.06033318303525448, "clip_ratio/low_min": 0.06033318303525448, "clip_ratio/high_mean": 0.12125750444829464, "clip_ratio/high_max": 0.12125750444829464, "clip_ratio/region_mean": 0.18159068748354912, "reward_total_mean": 0.30081719160079956, "reward_meter_mean": 0.8352808952331543, "reward_meter_std": 0.27949875593185425, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9836615324020386, "reward_lexical_plausibility_std": 0.046212125569581985, "reward_repeat_penalty_mean": 0.9923805594444275, "reward_repeat_penalty_std": 0.005976299289613962, "reward_near_duplicate_penalty_mean": 0.9923805594444275, "reward_near_duplicate_penalty_std": 0.005976299289613962, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.30081719160079956, "reward_total_composite_std": 0.17533625662326813} {"timestamp_utc": "2026-04-12T11:45:42Z", "mode": "train", "global_step": 266, "epoch": 0.010684018154797767, "loss": -0.0148, "grad_norm": 5.331240653991699, "learning_rate": 9.196969696969697e-06, "num_tokens": 543768.0, "completions/mean_length": 114.375, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.57143020629883, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.5551073551177979, "rewards/meter/std": 0.4633782207965851, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9571831226348877, "rewards/lexical_plausibility/std": 0.12110446393489838, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.35419678688049316, "rewards/repeat_penalty/mean": 0.9510653018951416, "rewards/repeat_penalty/std": 0.07683956623077393, "rewards/near_duplicate_penalty/mean": 0.9874784350395203, "rewards/near_duplicate_penalty/std": 0.01600700430572033, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9826526641845703, "rewards/distinct_2/std": 0.02612888813018799, "rewards/total_composite/mean": 0.3820602595806122, "rewards/total_composite/std": 0.36878228187561035, "reward": 0.3820602595806122, "reward_std": 0.36878228187561035, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18259519338607788, "sampling/sampling_logp_difference/max": 1.6422357559204102, "sampling/importance_sampling_ratio/min": 0.1935468316078186, "sampling/importance_sampling_ratio/mean": 1.0315132141113281, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6832698434591293, "clip_ratio/low_mean": 0.05894501693546772, "clip_ratio/low_min": 0.05894501693546772, "clip_ratio/high_mean": 0.106868801638484, "clip_ratio/high_max": 0.106868801638484, "clip_ratio/region_mean": 0.16581381857395172, "reward_total_mean": 0.3820602595806122, "reward_meter_mean": 0.5551073551177979, "reward_meter_std": 0.4633782207965851, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9571831226348877, "reward_lexical_plausibility_std": 0.12110446393489838, "reward_repeat_penalty_mean": 0.9510653018951416, "reward_repeat_penalty_std": 0.07683956623077393, "reward_near_duplicate_penalty_mean": 0.9874784350395203, "reward_near_duplicate_penalty_std": 0.01600700430572033, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9826526641845703, "reward_distinct_2_std": 0.02612888813018799, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.35419678688049316, "reward_total_composite_mean": 0.3820602595806122, "reward_total_composite_std": 0.36878228187561035} {"timestamp_utc": "2026-04-12T11:45:52Z", "mode": "train", "global_step": 267, "epoch": 0.01072418363658272, "loss": 0.0651, "grad_norm": 17.208410263061523, "learning_rate": 9.193939393939395e-06, "num_tokens": 545491.0, "completions/mean_length": 51.375, "completions/min_length": 42.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.375, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7053698301315308, "rewards/meter/std": 0.29308009147644043, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.9101802110671997, "rewards/repeat_penalty/std": 0.09514571726322174, "rewards/near_duplicate_penalty/mean": 0.9639840126037598, "rewards/near_duplicate_penalty/std": 0.023830551654100418, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9425992369651794, "rewards/distinct_2/std": 0.07865434885025024, "rewards/total_composite/mean": 0.29284989833831787, "rewards/total_composite/std": 0.1237848550081253, "reward": 0.29284989833831787, "reward_std": 0.1237848550081253, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2132163792848587, "sampling/sampling_logp_difference/max": 2.403627395629883, "sampling/importance_sampling_ratio/min": 0.09038948267698288, "sampling/importance_sampling_ratio/mean": 1.025562047958374, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6964064985513687, "clip_ratio/low_mean": 0.058897243812680244, "clip_ratio/low_min": 0.058897243812680244, "clip_ratio/high_mean": 0.11307246051728725, "clip_ratio/high_max": 0.11307246051728725, "clip_ratio/region_mean": 0.1719697043299675, "reward_total_mean": 0.29284989833831787, "reward_meter_mean": 0.7053698301315308, "reward_meter_std": 0.29308009147644043, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9101802110671997, "reward_repeat_penalty_std": 0.09514571726322174, "reward_near_duplicate_penalty_mean": 0.9639840126037598, "reward_near_duplicate_penalty_std": 0.023830551654100418, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9425992369651794, "reward_distinct_2_std": 0.07865434885025024, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.29284989833831787, "reward_total_composite_std": 0.1237848550081253} {"timestamp_utc": "2026-04-12T11:46:03Z", "mode": "train", "global_step": 268, "epoch": 0.010764349118367674, "loss": 0.0295, "grad_norm": 13.87683391571045, "learning_rate": 9.190909090909092e-06, "num_tokens": 547163.0, "completions/mean_length": 44.0, "completions/min_length": 37.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7814483046531677, "rewards/meter/std": 0.31845104694366455, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9923516511917114, "rewards/lexical_plausibility/std": 0.021632861346006393, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.29729434847831726, "rewards/repeat_penalty/mean": 0.9803469777107239, "rewards/repeat_penalty/std": 0.04630345478653908, "rewards/near_duplicate_penalty/mean": 0.9893733263015747, "rewards/near_duplicate_penalty/std": 0.02115357294678688, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.5334149599075317, "rewards/total_composite/std": 0.3403143286705017, "reward": 0.5334149599075317, "reward_std": 0.3403143584728241, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18669942021369934, "sampling/sampling_logp_difference/max": 1.2455625534057617, "sampling/importance_sampling_ratio/min": 0.28777897357940674, "sampling/importance_sampling_ratio/mean": 1.0561602115631104, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4229229390621185, "clip_ratio/low_mean": 0.10011645220220089, "clip_ratio/low_min": 0.10011645220220089, "clip_ratio/high_mean": 0.09112740121781826, "clip_ratio/high_max": 0.09112740121781826, "clip_ratio/region_mean": 0.19124385342001915, "reward_total_mean": 0.5334149599075317, "reward_meter_mean": 0.7814483046531677, "reward_meter_std": 0.31845104694366455, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9923516511917114, "reward_lexical_plausibility_std": 0.021632861346006393, "reward_repeat_penalty_mean": 0.9803469777107239, "reward_repeat_penalty_std": 0.04630345478653908, "reward_near_duplicate_penalty_mean": 0.9893733263015747, "reward_near_duplicate_penalty_std": 0.02115357294678688, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.29729434847831726, "reward_total_composite_mean": 0.5334149599075317, "reward_total_composite_std": 0.3403143286705017} {"timestamp_utc": "2026-04-12T11:46:14Z", "mode": "train", "global_step": 269, "epoch": 0.010804514600152628, "loss": 0.0004, "grad_norm": 14.237889289855957, "learning_rate": 9.187878787878789e-06, "num_tokens": 549102.0, "completions/mean_length": 55.375, "completions/min_length": 48.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.375, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5242666006088257, "rewards/meter/std": 0.3175433874130249, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9946484565734863, "rewards/lexical_plausibility/std": 0.015136471949517727, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.2290625423192978, "rewards/repeat_penalty/mean": 0.9948704242706299, "rewards/repeat_penalty/std": 0.006906564813107252, "rewards/near_duplicate_penalty/mean": 0.9948704242706299, "rewards/near_duplicate_penalty/std": 0.006906564813107252, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24220727384090424, "rewards/total_composite/std": 0.2698229253292084, "reward": 0.24220727384090424, "reward_std": 0.2698229253292084, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23273269832134247, "sampling/sampling_logp_difference/max": 1.811131477355957, "sampling/importance_sampling_ratio/min": 0.1634690761566162, "sampling/importance_sampling_ratio/mean": 1.033265471458435, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2616512775421143, "clip_ratio/low_mean": 0.1406971076503396, "clip_ratio/low_min": 0.1406971076503396, "clip_ratio/high_mean": 0.051724137738347054, "clip_ratio/high_max": 0.051724137738347054, "clip_ratio/region_mean": 0.19242124538868666, "reward_total_mean": 0.24220727384090424, "reward_meter_mean": 0.5242666006088257, "reward_meter_std": 0.3175433874130249, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9946484565734863, "reward_lexical_plausibility_std": 0.015136471949517727, "reward_repeat_penalty_mean": 0.9948704242706299, "reward_repeat_penalty_std": 0.006906564813107252, "reward_near_duplicate_penalty_mean": 0.9948704242706299, "reward_near_duplicate_penalty_std": 0.006906564813107252, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.2290625423192978, "reward_total_composite_mean": 0.24220727384090424, "reward_total_composite_std": 0.2698229253292084} {"timestamp_utc": "2026-04-12T11:46:24Z", "mode": "train", "global_step": 270, "epoch": 0.010844680081937582, "loss": -0.0026, "grad_norm": 16.44281578063965, "learning_rate": 9.184848484848485e-06, "num_tokens": 550687.0, "completions/mean_length": 37.125, "completions/min_length": 30.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6374124884605408, "rewards/meter/std": 0.41362813115119934, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.9680814743041992, "rewards/repeat_penalty/std": 0.038764070719480515, "rewards/near_duplicate_penalty/mean": 0.9784848690032959, "rewards/near_duplicate_penalty/std": 0.022901805117726326, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.37814244627952576, "rewards/total_composite/std": 0.3563656806945801, "reward": 0.37814244627952576, "reward_std": 0.3563656508922577, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2343471497297287, "sampling/sampling_logp_difference/max": 2.7769792079925537, "sampling/importance_sampling_ratio/min": 0.06222619488835335, "sampling/importance_sampling_ratio/mean": 1.0300768613815308, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.157850459218025, "clip_ratio/low_mean": 0.12842075154185295, "clip_ratio/low_min": 0.12842075154185295, "clip_ratio/high_mean": 0.06644042395055294, "clip_ratio/high_max": 0.06644042395055294, "clip_ratio/region_mean": 0.1948611754924059, "reward_total_mean": 0.37814244627952576, "reward_meter_mean": 0.6374124884605408, "reward_meter_std": 0.41362813115119934, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9680814743041992, "reward_repeat_penalty_std": 0.038764070719480515, "reward_near_duplicate_penalty_mean": 0.9784848690032959, "reward_near_duplicate_penalty_std": 0.022901805117726326, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.37814244627952576, "reward_total_composite_std": 0.3563656806945801} {"timestamp_utc": "2026-04-12T11:46:36Z", "mode": "train", "global_step": 271, "epoch": 0.010884845563722536, "loss": -0.0001, "grad_norm": 8.314339637756348, "learning_rate": 9.181818181818184e-06, "num_tokens": 553329.0, "completions/mean_length": 148.25, "completions/min_length": 130.0, "completions/max_length": 164.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 148.25, "completions/min_terminated_length": 130.0, "completions/max_terminated_length": 164.0, "rewards/meter/mean": 0.6872155666351318, "rewards/meter/std": 0.23664095997810364, "rewards/count_adherence/mean": 0.9861111044883728, "rewards/count_adherence/std": 0.03928370773792267, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9092499017715454, "rewards/repeat_penalty/std": 0.05258341133594513, "rewards/near_duplicate_penalty/mean": 0.9709391593933105, "rewards/near_duplicate_penalty/std": 0.012902768328785896, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9420429468154907, "rewards/distinct_2/std": 0.03494768589735031, "rewards/total_composite/mean": 0.2294485718011856, "rewards/total_composite/std": 0.07033482939004898, "reward": 0.2294485718011856, "reward_std": 0.07033482939004898, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21237437427043915, "sampling/sampling_logp_difference/max": 1.4601354598999023, "sampling/importance_sampling_ratio/min": 0.23220482468605042, "sampling/importance_sampling_ratio/mean": 1.0503811836242676, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7127927243709564, "clip_ratio/low_mean": 0.08896524831652641, "clip_ratio/low_min": 0.08896524831652641, "clip_ratio/high_mean": 0.09131458215415478, "clip_ratio/high_max": 0.09131458215415478, "clip_ratio/region_mean": 0.1802798304706812, "reward_total_mean": 0.2294485718011856, "reward_meter_mean": 0.6872155666351318, "reward_meter_std": 0.23664095997810364, "reward_count_adherence_mean": 0.9861111044883728, "reward_count_adherence_std": 0.03928370773792267, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9092499017715454, "reward_repeat_penalty_std": 0.05258341133594513, "reward_near_duplicate_penalty_mean": 0.9709391593933105, "reward_near_duplicate_penalty_std": 0.012902768328785896, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9420429468154907, "reward_distinct_2_std": 0.03494768589735031, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.2294485718011856, "reward_total_composite_std": 0.07033482939004898} {"timestamp_utc": "2026-04-12T11:46:51Z", "mode": "train", "global_step": 272, "epoch": 0.01092501104550749, "loss": -0.0299, "grad_norm": 5.785467624664307, "learning_rate": 9.178787878787879e-06, "num_tokens": 555113.0, "completions/mean_length": 117.0, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.57143020629883, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.5180156230926514, "rewards/meter/std": 0.37577399611473083, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9780136346817017, "rewards/lexical_plausibility/std": 0.062186747789382935, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9848737716674805, "rewards/repeat_penalty/std": 0.02308453619480133, "rewards/near_duplicate_penalty/mean": 0.9916267991065979, "rewards/near_duplicate_penalty/std": 0.006215302739292383, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.1737125664949417, "rewards/total_composite/std": 0.16292732954025269, "reward": 0.1737125664949417, "reward_std": 0.16292732954025269, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21715766191482544, "sampling/sampling_logp_difference/max": 1.4731264114379883, "sampling/importance_sampling_ratio/min": 0.22920776903629303, "sampling/importance_sampling_ratio/mean": 1.0494691133499146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3031804263591766, "clip_ratio/low_mean": 0.08485276810824871, "clip_ratio/low_min": 0.08485276810824871, "clip_ratio/high_mean": 0.07458556443452835, "clip_ratio/high_max": 0.07458556443452835, "clip_ratio/region_mean": 0.15943833254277706, "reward_total_mean": 0.1737125664949417, "reward_meter_mean": 0.5180156230926514, "reward_meter_std": 0.37577399611473083, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9780136346817017, "reward_lexical_plausibility_std": 0.062186747789382935, "reward_repeat_penalty_mean": 0.9848737716674805, "reward_repeat_penalty_std": 0.02308453619480133, "reward_near_duplicate_penalty_mean": 0.9916267991065979, "reward_near_duplicate_penalty_std": 0.006215302739292383, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.1737125664949417, "reward_total_composite_std": 0.16292732954025269} {"timestamp_utc": "2026-04-12T11:47:02Z", "mode": "train", "global_step": 273, "epoch": 0.010965176527292444, "loss": 0.015, "grad_norm": 14.045431137084961, "learning_rate": 9.175757575757576e-06, "num_tokens": 556988.0, "completions/mean_length": 68.375, "completions/min_length": 62.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.375, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.7588969469070435, "rewards/meter/std": 0.30399003624916077, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.14078858494758606, "rewards/repeat_penalty/mean": 0.9785246849060059, "rewards/repeat_penalty/std": 0.019320843741297722, "rewards/near_duplicate_penalty/mean": 0.983896017074585, "rewards/near_duplicate_penalty/std": 0.008063814602792263, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9945055246353149, "rewards/distinct_2/std": 0.015540807507932186, "rewards/total_composite/mean": 0.2500878572463989, "rewards/total_composite/std": 0.18566662073135376, "reward": 0.2500878572463989, "reward_std": 0.18566662073135376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22594274580478668, "sampling/sampling_logp_difference/max": 1.8401718139648438, "sampling/importance_sampling_ratio/min": 0.15879014134407043, "sampling/importance_sampling_ratio/mean": 1.0287742614746094, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.28461155295372, "clip_ratio/low_mean": 0.06879750732332468, "clip_ratio/low_min": 0.06879750732332468, "clip_ratio/high_mean": 0.12860195897519588, "clip_ratio/high_max": 0.12860195897519588, "clip_ratio/region_mean": 0.19739946629852057, "reward_total_mean": 0.2500878572463989, "reward_meter_mean": 0.7588969469070435, "reward_meter_std": 0.30399003624916077, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9785246849060059, "reward_repeat_penalty_std": 0.019320843741297722, "reward_near_duplicate_penalty_mean": 0.983896017074585, "reward_near_duplicate_penalty_std": 0.008063814602792263, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9945055246353149, "reward_distinct_2_std": 0.015540807507932186, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.14078858494758606, "reward_total_composite_mean": 0.2500878572463989, "reward_total_composite_std": 0.18566662073135376} {"timestamp_utc": "2026-04-12T11:47:11Z", "mode": "train", "global_step": 274, "epoch": 0.011005342009077398, "loss": 0.0594, "grad_norm": 16.172096252441406, "learning_rate": 9.172727272727274e-06, "num_tokens": 558491.0, "completions/mean_length": 33.875, "completions/min_length": 29.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.16012103855609894, "rewards/meter/std": 0.20767202973365784, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.9954314231872559, "rewards/repeat_penalty/std": 0.006199869327247143, "rewards/near_duplicate_penalty/mean": 0.9954314231872559, "rewards/near_duplicate_penalty/std": 0.006199869327247143, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10493992269039154, "rewards/total_composite/std": 0.14338107407093048, "reward": 0.10493992269039154, "reward_std": 0.14338107407093048, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15259678661823273, "sampling/sampling_logp_difference/max": 0.9395370483398438, "sampling/importance_sampling_ratio/min": 0.39080873131752014, "sampling/importance_sampling_ratio/mean": 1.0381031036376953, "sampling/importance_sampling_ratio/max": 1.980162501335144, "entropy": 1.3856611251831055, "clip_ratio/low_mean": 0.09356303326785564, "clip_ratio/low_min": 0.09356303326785564, "clip_ratio/high_mean": 0.0356602817773819, "clip_ratio/high_max": 0.0356602817773819, "clip_ratio/region_mean": 0.12922331504523754, "reward_total_mean": 0.10493992269039154, "reward_meter_mean": 0.16012103855609894, "reward_meter_std": 0.20767202973365784, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9954314231872559, "reward_repeat_penalty_std": 0.006199869327247143, "reward_near_duplicate_penalty_mean": 0.9954314231872559, "reward_near_duplicate_penalty_std": 0.006199869327247143, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.10493992269039154, "reward_total_composite_std": 0.14338107407093048} {"timestamp_utc": "2026-04-12T11:47:22Z", "mode": "train", "global_step": 275, "epoch": 0.011045507490862352, "loss": -0.0001, "grad_norm": 24.670743942260742, "learning_rate": 9.169696969696971e-06, "num_tokens": 559879.0, "completions/mean_length": 19.5, "completions/min_length": 16.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.5803689956665039, "rewards/meter/std": 0.4811611473560333, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9275000095367432, "rewards/judge_quality/std": 0.013887288980185986, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5340473651885986, "rewards/total_composite/std": 0.44252634048461914, "reward": 0.5340473651885986, "reward_std": 0.44252628087997437, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1774034947156906, "sampling/sampling_logp_difference/max": 1.35701322555542, "sampling/importance_sampling_ratio/min": 0.25742852687835693, "sampling/importance_sampling_ratio/mean": 0.9812389612197876, "sampling/importance_sampling_ratio/max": 1.9948524236679077, "entropy": 0.9840481281280518, "clip_ratio/low_mean": 0.04843750037252903, "clip_ratio/low_min": 0.04843750037252903, "clip_ratio/high_mean": 0.10638116486370564, "clip_ratio/high_max": 0.10638116486370564, "clip_ratio/region_mean": 0.15481866523623466, "reward_total_mean": 0.5340473651885986, "reward_meter_mean": 0.5803689956665039, "reward_meter_std": 0.4811611473560333, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9275000095367432, "reward_judge_quality_std": 0.013887288980185986, "reward_total_composite_mean": 0.5340473651885986, "reward_total_composite_std": 0.44252634048461914} {"timestamp_utc": "2026-04-12T11:47:31Z", "mode": "train", "global_step": 276, "epoch": 0.011085672972647308, "loss": 0.0308, "grad_norm": 16.561555862426758, "learning_rate": 9.166666666666666e-06, "num_tokens": 561403.0, "completions/mean_length": 35.5, "completions/min_length": 27.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.7875629663467407, "rewards/meter/std": 0.3175351321697235, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9809887409210205, "rewards/lexical_plausibility/std": 0.03529678285121918, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.25616681575775146, "rewards/repeat_penalty/mean": 0.9985479712486267, "rewards/repeat_penalty/std": 0.004106936510652304, "rewards/near_duplicate_penalty/mean": 0.9985479712486267, "rewards/near_duplicate_penalty/std": 0.004106936510652304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.47072842717170715, "rewards/total_composite/std": 0.26268860697746277, "reward": 0.47072842717170715, "reward_std": 0.26268860697746277, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2040463089942932, "sampling/sampling_logp_difference/max": 1.1129522323608398, "sampling/importance_sampling_ratio/min": 0.32858747243881226, "sampling/importance_sampling_ratio/mean": 1.0465922355651855, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2738792449235916, "clip_ratio/low_mean": 0.12270412687212229, "clip_ratio/low_min": 0.12270412687212229, "clip_ratio/high_mean": 0.03329741326160729, "clip_ratio/high_max": 0.03329741326160729, "clip_ratio/region_mean": 0.15600154013372958, "reward_total_mean": 0.47072842717170715, "reward_meter_mean": 0.7875629663467407, "reward_meter_std": 0.3175351321697235, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9809887409210205, "reward_lexical_plausibility_std": 0.03529678285121918, "reward_repeat_penalty_mean": 0.9985479712486267, "reward_repeat_penalty_std": 0.004106936510652304, "reward_near_duplicate_penalty_mean": 0.9985479712486267, "reward_near_duplicate_penalty_std": 0.004106936510652304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.25616681575775146, "reward_total_composite_mean": 0.47072842717170715, "reward_total_composite_std": 0.26268860697746277} {"timestamp_utc": "2026-04-12T11:47:41Z", "mode": "train", "global_step": 277, "epoch": 0.011125838454432262, "loss": 0.0254, "grad_norm": 17.2047176361084, "learning_rate": 9.163636363636365e-06, "num_tokens": 562973.0, "completions/mean_length": 38.25, "completions/min_length": 32.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.25, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6869758367538452, "rewards/meter/std": 0.25142180919647217, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9735127091407776, "rewards/lexical_plausibility/std": 0.050842247903347015, "rewards/judge_quality/mean": 0.4674999713897705, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.9868708848953247, "rewards/repeat_penalty/std": 0.013884245418012142, "rewards/near_duplicate_penalty/mean": 0.9868708848953247, "rewards/near_duplicate_penalty/std": 0.013884245418012142, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3224276900291443, "rewards/total_composite/std": 0.19744513928890228, "reward": 0.3224276900291443, "reward_std": 0.1974451243877411, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21477508544921875, "sampling/sampling_logp_difference/max": 1.3630951642990112, "sampling/importance_sampling_ratio/min": 0.255867600440979, "sampling/importance_sampling_ratio/mean": 1.020378828048706, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9873829185962677, "clip_ratio/low_mean": 0.07072368264198303, "clip_ratio/low_min": 0.07072368264198303, "clip_ratio/high_mean": 0.12641051225364208, "clip_ratio/high_max": 0.12641051225364208, "clip_ratio/region_mean": 0.19713419489562511, "reward_total_mean": 0.3224276900291443, "reward_meter_mean": 0.6869758367538452, "reward_meter_std": 0.25142180919647217, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9735127091407776, "reward_lexical_plausibility_std": 0.050842247903347015, "reward_repeat_penalty_mean": 0.9868708848953247, "reward_repeat_penalty_std": 0.013884245418012142, "reward_near_duplicate_penalty_mean": 0.9868708848953247, "reward_near_duplicate_penalty_std": 0.013884245418012142, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4674999713897705, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.3224276900291443, "reward_total_composite_std": 0.19744513928890228} {"timestamp_utc": "2026-04-12T11:47:55Z", "mode": "train", "global_step": 278, "epoch": 0.011166003936217216, "loss": -0.0731, "grad_norm": 5.712137222290039, "learning_rate": 9.160606060606061e-06, "num_tokens": 565192.0, "completions/mean_length": 129.375, "completions/min_length": 70.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 74.71428680419922, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.42275065183639526, "rewards/meter/std": 0.3581748306751251, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9331144094467163, "rewards/lexical_plausibility/std": 0.18918108940124512, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9734548330307007, "rewards/repeat_penalty/std": 0.02831222303211689, "rewards/near_duplicate_penalty/mean": 0.9855933785438538, "rewards/near_duplicate_penalty/std": 0.010175898671150208, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9876323938369751, "rewards/distinct_2/std": 0.024720855057239532, "rewards/total_composite/mean": 0.16008594632148743, "rewards/total_composite/std": 0.14973433315753937, "reward": 0.16008594632148743, "reward_std": 0.14973431825637817, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2065655142068863, "sampling/sampling_logp_difference/max": 1.6586599349975586, "sampling/importance_sampling_ratio/min": 0.19039395451545715, "sampling/importance_sampling_ratio/mean": 1.0514785051345825, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1411995738744736, "clip_ratio/low_mean": 0.07053152285516262, "clip_ratio/low_min": 0.07053152285516262, "clip_ratio/high_mean": 0.10142524167895317, "clip_ratio/high_max": 0.10142524167895317, "clip_ratio/region_mean": 0.1719567645341158, "reward_total_mean": 0.16008594632148743, "reward_meter_mean": 0.42275065183639526, "reward_meter_std": 0.3581748306751251, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9331144094467163, "reward_lexical_plausibility_std": 0.18918108940124512, "reward_repeat_penalty_mean": 0.9734548330307007, "reward_repeat_penalty_std": 0.02831222303211689, "reward_near_duplicate_penalty_mean": 0.9855933785438538, "reward_near_duplicate_penalty_std": 0.010175898671150208, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9876323938369751, "reward_distinct_2_std": 0.024720855057239532, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.16008594632148743, "reward_total_composite_std": 0.14973433315753937} {"timestamp_utc": "2026-04-12T11:48:05Z", "mode": "train", "global_step": 279, "epoch": 0.01120616941800217, "loss": 0.0602, "grad_norm": 14.327668190002441, "learning_rate": 9.157575757575758e-06, "num_tokens": 566867.0, "completions/mean_length": 39.375, "completions/min_length": 36.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.4885554015636444, "rewards/meter/std": 0.35893380641937256, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9716670513153076, "rewards/lexical_plausibility/std": 0.04987131431698799, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.12817399203777313, "rewards/repeat_penalty/mean": 0.9859256148338318, "rewards/repeat_penalty/std": 0.015522838570177555, "rewards/near_duplicate_penalty/mean": 0.9859256148338318, "rewards/near_duplicate_penalty/std": 0.015522838570177555, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.149361714720726, "rewards/total_composite/std": 0.1351163685321808, "reward": 0.149361714720726, "reward_std": 0.1351163536310196, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21950620412826538, "sampling/sampling_logp_difference/max": 1.5779914855957031, "sampling/importance_sampling_ratio/min": 0.20638921856880188, "sampling/importance_sampling_ratio/mean": 1.0627535581588745, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8971462845802307, "clip_ratio/low_mean": 0.11658370168879628, "clip_ratio/low_min": 0.11658370168879628, "clip_ratio/high_mean": 0.048769925720989704, "clip_ratio/high_max": 0.048769925720989704, "clip_ratio/region_mean": 0.16535362740978599, "reward_total_mean": 0.149361714720726, "reward_meter_mean": 0.4885554015636444, "reward_meter_std": 0.35893380641937256, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9716670513153076, "reward_lexical_plausibility_std": 0.04987131431698799, "reward_repeat_penalty_mean": 0.9859256148338318, "reward_repeat_penalty_std": 0.015522838570177555, "reward_near_duplicate_penalty_mean": 0.9859256148338318, "reward_near_duplicate_penalty_std": 0.015522838570177555, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.12817399203777313, "reward_total_composite_mean": 0.149361714720726, "reward_total_composite_std": 0.1351163685321808} {"timestamp_utc": "2026-04-12T11:48:20Z", "mode": "train", "global_step": 280, "epoch": 0.011246334899787123, "loss": -0.0629, "grad_norm": 3.3239665031433105, "learning_rate": 9.154545454545455e-06, "num_tokens": 569347.0, "completions/mean_length": 378.0, "completions/min_length": 173.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 244.0, "completions/min_terminated_length": 173.0, "completions/max_terminated_length": 405.0, "rewards/meter/mean": 0.2254655510187149, "rewards/meter/std": 0.3117845058441162, "rewards/count_adherence/mean": 0.7954545617103577, "rewards/count_adherence/std": 0.2047257423400879, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8675926923751831, "rewards/lexical_plausibility/std": 0.1524505615234375, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.10350984334945679, "rewards/repeat_penalty/mean": 0.9927418828010559, "rewards/repeat_penalty/std": 0.0131080849096179, "rewards/near_duplicate_penalty/mean": 0.9970248937606812, "rewards/near_duplicate_penalty/std": 0.0018173862481489778, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.995694637298584, "rewards/distinct_2/std": 0.012177488766610622, "rewards/total_composite/mean": 0.04525914043188095, "rewards/total_composite/std": 0.10281477868556976, "reward": 0.04525914043188095, "reward_std": 0.10281477868556976, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21117115020751953, "sampling/sampling_logp_difference/max": 1.3579626083374023, "sampling/importance_sampling_ratio/min": 0.257184237241745, "sampling/importance_sampling_ratio/mean": 1.0500564575195312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6696673035621643, "clip_ratio/low_mean": 0.044871481135487556, "clip_ratio/low_min": 0.044871481135487556, "clip_ratio/high_mean": 0.023843931034207344, "clip_ratio/high_max": 0.023843931034207344, "clip_ratio/region_mean": 0.0687154121696949, "reward_total_mean": 0.04525914043188095, "reward_meter_mean": 0.2254655510187149, "reward_meter_std": 0.3117845058441162, "reward_count_adherence_mean": 0.7954545617103577, "reward_count_adherence_std": 0.2047257423400879, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8675926923751831, "reward_lexical_plausibility_std": 0.1524505615234375, "reward_repeat_penalty_mean": 0.9927418828010559, "reward_repeat_penalty_std": 0.0131080849096179, "reward_near_duplicate_penalty_mean": 0.9970248937606812, "reward_near_duplicate_penalty_std": 0.0018173862481489778, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.995694637298584, "reward_distinct_2_std": 0.012177488766610622, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.10350984334945679, "reward_total_composite_mean": 0.04525914043188095, "reward_total_composite_std": 0.10281477868556976} {"timestamp_utc": "2026-04-12T11:48:34Z", "mode": "train", "global_step": 281, "epoch": 0.011286500381572077, "loss": -0.082, "grad_norm": 4.286274433135986, "learning_rate": 9.151515151515153e-06, "num_tokens": 571827.0, "completions/mean_length": 240.0, "completions/min_length": 137.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 149.33334350585938, "completions/min_terminated_length": 137.0, "completions/max_terminated_length": 169.0, "rewards/meter/mean": 0.3047613501548767, "rewards/meter/std": 0.18122979998588562, "rewards/count_adherence/mean": 0.921875, "rewards/count_adherence/std": 0.14846687018871307, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8990951180458069, "rewards/lexical_plausibility/std": 0.1883811503648758, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9925594329833984, "rewards/repeat_penalty/std": 0.009130585938692093, "rewards/near_duplicate_penalty/mean": 0.9951066374778748, "rewards/near_duplicate_penalty/std": 0.004642870277166367, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9974359273910522, "rewards/distinct_2/std": 0.007252376992255449, "rewards/total_composite/mean": 0.07877501100301743, "rewards/total_composite/std": 0.10420332103967667, "reward": 0.07877501100301743, "reward_std": 0.10420332103967667, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21506674587726593, "sampling/sampling_logp_difference/max": 1.690638542175293, "sampling/importance_sampling_ratio/min": 0.184401735663414, "sampling/importance_sampling_ratio/mean": 1.0699589252471924, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.61429500579834, "clip_ratio/low_mean": 0.050243156030774117, "clip_ratio/low_min": 0.050243156030774117, "clip_ratio/high_mean": 0.05922095663845539, "clip_ratio/high_max": 0.05922095663845539, "clip_ratio/region_mean": 0.10946411266922951, "reward_total_mean": 0.07877501100301743, "reward_meter_mean": 0.3047613501548767, "reward_meter_std": 0.18122979998588562, "reward_count_adherence_mean": 0.921875, "reward_count_adherence_std": 0.14846687018871307, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8990951180458069, "reward_lexical_plausibility_std": 0.1883811503648758, "reward_repeat_penalty_mean": 0.9925594329833984, "reward_repeat_penalty_std": 0.009130585938692093, "reward_near_duplicate_penalty_mean": 0.9951066374778748, "reward_near_duplicate_penalty_std": 0.004642870277166367, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9974359273910522, "reward_distinct_2_std": 0.007252376992255449, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.07877501100301743, "reward_total_composite_std": 0.10420332103967667} {"timestamp_utc": "2026-04-12T11:48:45Z", "mode": "train", "global_step": 282, "epoch": 0.011326665863357031, "loss": 0.0418, "grad_norm": 14.189026832580566, "learning_rate": 9.148484848484848e-06, "num_tokens": 573417.0, "completions/mean_length": 40.75, "completions/min_length": 33.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6186550855636597, "rewards/meter/std": 0.3575173020362854, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9828431606292725, "rewards/lexical_plausibility/std": 0.048526935279369354, "rewards/judge_quality/mean": 0.4000000059604645, "rewards/judge_quality/std": 0.2507132589817047, "rewards/repeat_penalty/mean": 0.9958095550537109, "rewards/repeat_penalty/std": 0.00820265430957079, "rewards/near_duplicate_penalty/mean": 0.9958095550537109, "rewards/near_duplicate_penalty/std": 0.00820265430957079, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.28705093264579773, "rewards/total_composite/std": 0.30884861946105957, "reward": 0.28705093264579773, "reward_std": 0.3088485896587372, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21589459478855133, "sampling/sampling_logp_difference/max": 1.5428733825683594, "sampling/importance_sampling_ratio/min": 0.21376599371433258, "sampling/importance_sampling_ratio/mean": 1.046050786972046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9327259361743927, "clip_ratio/low_mean": 0.08831252250820398, "clip_ratio/low_min": 0.08831252250820398, "clip_ratio/high_mean": 0.09627193212509155, "clip_ratio/high_max": 0.09627193212509155, "clip_ratio/region_mean": 0.18458445463329554, "reward_total_mean": 0.28705093264579773, "reward_meter_mean": 0.6186550855636597, "reward_meter_std": 0.3575173020362854, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9828431606292725, "reward_lexical_plausibility_std": 0.048526935279369354, "reward_repeat_penalty_mean": 0.9958095550537109, "reward_repeat_penalty_std": 0.00820265430957079, "reward_near_duplicate_penalty_mean": 0.9958095550537109, "reward_near_duplicate_penalty_std": 0.00820265430957079, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4000000059604645, "reward_judge_quality_std": 0.2507132589817047, "reward_total_composite_mean": 0.28705093264579773, "reward_total_composite_std": 0.30884861946105957} {"timestamp_utc": "2026-04-12T11:48:54Z", "mode": "train", "global_step": 283, "epoch": 0.011366831345141985, "loss": 0.0456, "grad_norm": 16.365924835205078, "learning_rate": 9.145454545454546e-06, "num_tokens": 574999.0, "completions/mean_length": 34.75, "completions/min_length": 29.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.75, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.5847836136817932, "rewards/meter/std": 0.3397683799266815, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9473914504051208, "rewards/lexical_plausibility/std": 0.11197065562009811, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.9861968755722046, "rewards/repeat_penalty/std": 0.0151191595941782, "rewards/near_duplicate_penalty/mean": 0.9861968755722046, "rewards/near_duplicate_penalty/std": 0.0151191595941782, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33177411556243896, "rewards/total_composite/std": 0.2660835385322571, "reward": 0.33177411556243896, "reward_std": 0.2660835385322571, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19750948250293732, "sampling/sampling_logp_difference/max": 1.4663281440734863, "sampling/importance_sampling_ratio/min": 0.2307712882757187, "sampling/importance_sampling_ratio/mean": 1.0142182111740112, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8664885610342026, "clip_ratio/low_mean": 0.11185344774276018, "clip_ratio/low_min": 0.11185344774276018, "clip_ratio/high_mean": 0.08955628052353859, "clip_ratio/high_max": 0.08955628052353859, "clip_ratio/region_mean": 0.20140972826629877, "reward_total_mean": 0.33177411556243896, "reward_meter_mean": 0.5847836136817932, "reward_meter_std": 0.3397683799266815, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9473914504051208, "reward_lexical_plausibility_std": 0.11197065562009811, "reward_repeat_penalty_mean": 0.9861968755722046, "reward_repeat_penalty_std": 0.0151191595941782, "reward_near_duplicate_penalty_mean": 0.9861968755722046, "reward_near_duplicate_penalty_std": 0.0151191595941782, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.33177411556243896, "reward_total_composite_std": 0.2660835385322571} {"timestamp_utc": "2026-04-12T11:49:04Z", "mode": "train", "global_step": 284, "epoch": 0.01140699682692694, "loss": -0.1131, "grad_norm": 17.70599365234375, "learning_rate": 9.142424242424243e-06, "num_tokens": 576534.0, "completions/mean_length": 37.875, "completions/min_length": 17.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.8286744356155396, "rewards/meter/std": 0.25950509309768677, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3184336721897125, "rewards/repeat_penalty/mean": 0.9552540183067322, "rewards/repeat_penalty/std": 0.08507763594388962, "rewards/near_duplicate_penalty/mean": 0.9865040183067322, "rewards/near_duplicate_penalty/std": 0.019740888848900795, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5359276533126831, "rewards/total_composite/std": 0.3210074007511139, "reward": 0.5359276533126831, "reward_std": 0.3210074007511139, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19028252363204956, "sampling/sampling_logp_difference/max": 1.4491653442382812, "sampling/importance_sampling_ratio/min": 0.2347661703824997, "sampling/importance_sampling_ratio/mean": 1.0386948585510254, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1328279227018356, "clip_ratio/low_mean": 0.07423878833651543, "clip_ratio/low_min": 0.07423878833651543, "clip_ratio/high_mean": 0.07039508409798145, "clip_ratio/high_max": 0.07039508409798145, "clip_ratio/region_mean": 0.14463387243449688, "reward_total_mean": 0.5359276533126831, "reward_meter_mean": 0.8286744356155396, "reward_meter_std": 0.25950509309768677, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9552540183067322, "reward_repeat_penalty_std": 0.08507763594388962, "reward_near_duplicate_penalty_mean": 0.9865040183067322, "reward_near_duplicate_penalty_std": 0.019740888848900795, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3184336721897125, "reward_total_composite_mean": 0.5359276533126831, "reward_total_composite_std": 0.3210074007511139} {"timestamp_utc": "2026-04-12T11:49:19Z", "mode": "train", "global_step": 285, "epoch": 0.011447162308711893, "loss": 0.0174, "grad_norm": 6.271496295928955, "learning_rate": 9.13939393939394e-06, "num_tokens": 578739.0, "completions/mean_length": 155.625, "completions/min_length": 85.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 104.71428680419922, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 152.0, "rewards/meter/mean": 0.5152211785316467, "rewards/meter/std": 0.41637036204338074, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9600174427032471, "rewards/lexical_plausibility/std": 0.11308781057596207, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9688326120376587, "rewards/repeat_penalty/std": 0.0667465478181839, "rewards/near_duplicate_penalty/mean": 0.986682653427124, "rewards/near_duplicate_penalty/std": 0.0166612658649683, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9811463356018066, "rewards/distinct_2/std": 0.05332630127668381, "rewards/total_composite/mean": 0.17838908731937408, "rewards/total_composite/std": 0.17776593565940857, "reward": 0.17838908731937408, "reward_std": 0.17776595056056976, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24316740036010742, "sampling/sampling_logp_difference/max": 1.9065160751342773, "sampling/importance_sampling_ratio/min": 0.14859719574451447, "sampling/importance_sampling_ratio/mean": 1.0452635288238525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9215979874134064, "clip_ratio/low_mean": 0.06691965274512768, "clip_ratio/low_min": 0.06691965274512768, "clip_ratio/high_mean": 0.1029907874763012, "clip_ratio/high_max": 0.1029907874763012, "clip_ratio/region_mean": 0.16991044022142887, "reward_total_mean": 0.17838908731937408, "reward_meter_mean": 0.5152211785316467, "reward_meter_std": 0.41637036204338074, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9600174427032471, "reward_lexical_plausibility_std": 0.11308781057596207, "reward_repeat_penalty_mean": 0.9688326120376587, "reward_repeat_penalty_std": 0.0667465478181839, "reward_near_duplicate_penalty_mean": 0.986682653427124, "reward_near_duplicate_penalty_std": 0.0166612658649683, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9811463356018066, "reward_distinct_2_std": 0.05332630127668381, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.17838908731937408, "reward_total_composite_std": 0.17776593565940857} {"timestamp_utc": "2026-04-12T11:49:30Z", "mode": "train", "global_step": 286, "epoch": 0.011487327790496847, "loss": 0.0581, "grad_norm": 15.162145614624023, "learning_rate": 9.136363636363637e-06, "num_tokens": 580363.0, "completions/mean_length": 42.0, "completions/min_length": 38.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.48164448142051697, "rewards/meter/std": 0.4154931604862213, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9786953330039978, "rewards/lexical_plausibility/std": 0.06025872007012367, "rewards/judge_quality/mean": 0.7137500047683716, "rewards/judge_quality/std": 0.3153654634952545, "rewards/repeat_penalty/mean": 0.9602888822555542, "rewards/repeat_penalty/std": 0.03600199520587921, "rewards/near_duplicate_penalty/mean": 0.9602888822555542, "rewards/near_duplicate_penalty/std": 0.03600199520587921, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3208795189857483, "rewards/total_composite/std": 0.33511683344841003, "reward": 0.3208795189857483, "reward_std": 0.33511683344841003, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1690378487110138, "sampling/sampling_logp_difference/max": 1.516463279724121, "sampling/importance_sampling_ratio/min": 0.2194867730140686, "sampling/importance_sampling_ratio/mean": 1.0076239109039307, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1047745794057846, "clip_ratio/low_mean": 0.09368273802101612, "clip_ratio/low_min": 0.09368273802101612, "clip_ratio/high_mean": 0.07388168945908546, "clip_ratio/high_max": 0.07388168945908546, "clip_ratio/region_mean": 0.16756442748010159, "reward_total_mean": 0.3208795189857483, "reward_meter_mean": 0.48164448142051697, "reward_meter_std": 0.4154931604862213, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9786953330039978, "reward_lexical_plausibility_std": 0.06025872007012367, "reward_repeat_penalty_mean": 0.9602888822555542, "reward_repeat_penalty_std": 0.03600199520587921, "reward_near_duplicate_penalty_mean": 0.9602888822555542, "reward_near_duplicate_penalty_std": 0.03600199520587921, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7137500047683716, "reward_judge_quality_std": 0.3153654634952545, "reward_total_composite_mean": 0.3208795189857483, "reward_total_composite_std": 0.33511683344841003} {"timestamp_utc": "2026-04-12T11:49:41Z", "mode": "train", "global_step": 287, "epoch": 0.011527493272281801, "loss": -0.0182, "grad_norm": 11.2236909866333, "learning_rate": 9.133333333333335e-06, "num_tokens": 582422.0, "completions/mean_length": 72.375, "completions/min_length": 66.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.375, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.9523226618766785, "rewards/meter/std": 0.0559941865503788, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9989224076271057, "rewards/lexical_plausibility/std": 0.0030478707049041986, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9817270040512085, "rewards/repeat_penalty/std": 0.038069162517786026, "rewards/near_duplicate_penalty/mean": 0.9909766912460327, "rewards/near_duplicate_penalty/std": 0.01231041457504034, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.33471256494522095, "rewards/total_composite/std": 0.09357573091983795, "reward": 0.33471256494522095, "reward_std": 0.09357573837041855, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22217997908592224, "sampling/sampling_logp_difference/max": 1.4019737243652344, "sampling/importance_sampling_ratio/min": 0.246110737323761, "sampling/importance_sampling_ratio/mean": 1.0443822145462036, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.1826703250408173, "clip_ratio/low_mean": 0.04497929662466049, "clip_ratio/low_min": 0.04497929662466049, "clip_ratio/high_mean": 0.14329812116920948, "clip_ratio/high_max": 0.14329812116920948, "clip_ratio/region_mean": 0.18827741779386997, "reward_total_mean": 0.33471256494522095, "reward_meter_mean": 0.9523226618766785, "reward_meter_std": 0.0559941865503788, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9989224076271057, "reward_lexical_plausibility_std": 0.0030478707049041986, "reward_repeat_penalty_mean": 0.9817270040512085, "reward_repeat_penalty_std": 0.038069162517786026, "reward_near_duplicate_penalty_mean": 0.9909766912460327, "reward_near_duplicate_penalty_std": 0.01231041457504034, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.33471256494522095, "reward_total_composite_std": 0.09357573091983795} {"timestamp_utc": "2026-04-12T11:49:50Z", "mode": "train", "global_step": 288, "epoch": 0.011567658754066755, "loss": -0.0021, "grad_norm": 19.423803329467773, "learning_rate": 9.130303030303032e-06, "num_tokens": 583983.0, "completions/mean_length": 33.125, "completions/min_length": 29.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.9544972777366638, "rewards/meter/std": 0.08394472301006317, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9978380799293518, "rewards/repeat_penalty/std": 0.004205068573355675, "rewards/near_duplicate_penalty/mean": 0.9978380799293518, "rewards/near_duplicate_penalty/std": 0.004205068573355675, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3095497488975525, "rewards/total_composite/std": 0.07180063426494598, "reward": 0.3095497488975525, "reward_std": 0.07180062681436539, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10447724163532257, "sampling/sampling_logp_difference/max": 2.5271964073181152, "sampling/importance_sampling_ratio/min": 0.0798826664686203, "sampling/importance_sampling_ratio/mean": 1.0091947317123413, "sampling/importance_sampling_ratio/max": 1.7457364797592163, "entropy": 0.4501609206199646, "clip_ratio/low_mean": 0.02982292603701353, "clip_ratio/low_min": 0.02982292603701353, "clip_ratio/high_mean": 0.04191037290729582, "clip_ratio/high_max": 0.04191037290729582, "clip_ratio/region_mean": 0.07173329894430935, "reward_total_mean": 0.3095497488975525, "reward_meter_mean": 0.9544972777366638, "reward_meter_std": 0.08394472301006317, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9978380799293518, "reward_repeat_penalty_std": 0.004205068573355675, "reward_near_duplicate_penalty_mean": 0.9978380799293518, "reward_near_duplicate_penalty_std": 0.004205068573355675, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.3095497488975525, "reward_total_composite_std": 0.07180063426494598} {"timestamp_utc": "2026-04-12T11:50:00Z", "mode": "train", "global_step": 289, "epoch": 0.011607824235851709, "loss": 0.0271, "grad_norm": 17.322498321533203, "learning_rate": 9.127272727272727e-06, "num_tokens": 585554.0, "completions/mean_length": 35.375, "completions/min_length": 27.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.375, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7997351884841919, "rewards/meter/std": 0.3051901161670685, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.36286312341690063, "rewards/repeat_penalty/mean": 0.9882843494415283, "rewards/repeat_penalty/std": 0.015018452890217304, "rewards/near_duplicate_penalty/mean": 0.9882843494415283, "rewards/near_duplicate_penalty/std": 0.015018452890217304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4522401690483093, "rewards/total_composite/std": 0.37616705894470215, "reward": 0.4522401690483093, "reward_std": 0.37616702914237976, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20104411244392395, "sampling/sampling_logp_difference/max": 1.4658613204956055, "sampling/importance_sampling_ratio/min": 0.2308790385723114, "sampling/importance_sampling_ratio/mean": 1.013503074645996, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4743967205286026, "clip_ratio/low_mean": 0.11661775130778551, "clip_ratio/low_min": 0.11661775130778551, "clip_ratio/high_mean": 0.07630914449691772, "clip_ratio/high_max": 0.07630914449691772, "clip_ratio/region_mean": 0.19292689580470324, "reward_total_mean": 0.4522401690483093, "reward_meter_mean": 0.7997351884841919, "reward_meter_std": 0.3051901161670685, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9882843494415283, "reward_repeat_penalty_std": 0.015018452890217304, "reward_near_duplicate_penalty_mean": 0.9882843494415283, "reward_near_duplicate_penalty_std": 0.015018452890217304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.36286312341690063, "reward_total_composite_mean": 0.4522401690483093, "reward_total_composite_std": 0.37616705894470215} {"timestamp_utc": "2026-04-12T11:50:11Z", "mode": "train", "global_step": 290, "epoch": 0.011647989717636663, "loss": 0.0015, "grad_norm": 15.765957832336426, "learning_rate": 9.124242424242425e-06, "num_tokens": 587475.0, "completions/mean_length": 57.125, "completions/min_length": 54.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.125, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6953085660934448, "rewards/meter/std": 0.38268086314201355, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9712885022163391, "rewards/lexical_plausibility/std": 0.08120834082365036, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9866654276847839, "rewards/repeat_penalty/std": 0.027135929092764854, "rewards/near_duplicate_penalty/mean": 0.9919589161872864, "rewards/near_duplicate_penalty/std": 0.012913516722619534, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9945055246353149, "rewards/distinct_2/std": 0.015540807507932186, "rewards/total_composite/mean": 0.20763850212097168, "rewards/total_composite/std": 0.18367838859558105, "reward": 0.20763850212097168, "reward_std": 0.18367838859558105, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22305156290531158, "sampling/sampling_logp_difference/max": 1.2211408615112305, "sampling/importance_sampling_ratio/min": 0.2948935329914093, "sampling/importance_sampling_ratio/mean": 1.0478311777114868, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9298156797885895, "clip_ratio/low_mean": 0.09555976465344429, "clip_ratio/low_min": 0.09555976465344429, "clip_ratio/high_mean": 0.10091807879507542, "clip_ratio/high_max": 0.10091807879507542, "clip_ratio/region_mean": 0.1964778434485197, "reward_total_mean": 0.20763850212097168, "reward_meter_mean": 0.6953085660934448, "reward_meter_std": 0.38268086314201355, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9712885022163391, "reward_lexical_plausibility_std": 0.08120834082365036, "reward_repeat_penalty_mean": 0.9866654276847839, "reward_repeat_penalty_std": 0.027135929092764854, "reward_near_duplicate_penalty_mean": 0.9919589161872864, "reward_near_duplicate_penalty_std": 0.012913516722619534, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9945055246353149, "reward_distinct_2_std": 0.015540807507932186, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.20763850212097168, "reward_total_composite_std": 0.18367838859558105} {"timestamp_utc": "2026-04-12T11:50:22Z", "mode": "train", "global_step": 291, "epoch": 0.011688155199421617, "loss": 0.0553, "grad_norm": 25.532514572143555, "learning_rate": 9.121212121212122e-06, "num_tokens": 589009.0, "completions/mean_length": 36.75, "completions/min_length": 33.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6063839197158813, "rewards/meter/std": 0.4344141185283661, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.3123185336589813, "rewards/repeat_penalty/mean": 0.9811705350875854, "rewards/repeat_penalty/std": 0.044920410960912704, "rewards/near_duplicate_penalty/mean": 0.9946225881576538, "rewards/near_duplicate_penalty/std": 0.009966662153601646, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.43089666962623596, "rewards/total_composite/std": 0.3954765498638153, "reward": 0.43089666962623596, "reward_std": 0.3954765498638153, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2248818725347519, "sampling/sampling_logp_difference/max": 2.0057125091552734, "sampling/importance_sampling_ratio/min": 0.1345643848180771, "sampling/importance_sampling_ratio/mean": 0.9709168076515198, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2025741189718246, "clip_ratio/low_mean": 0.11072261445224285, "clip_ratio/low_min": 0.11072261445224285, "clip_ratio/high_mean": 0.08179810643196106, "clip_ratio/high_max": 0.08179810643196106, "clip_ratio/region_mean": 0.1925207208842039, "reward_total_mean": 0.43089666962623596, "reward_meter_mean": 0.6063839197158813, "reward_meter_std": 0.4344141185283661, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9811705350875854, "reward_repeat_penalty_std": 0.044920410960912704, "reward_near_duplicate_penalty_mean": 0.9946225881576538, "reward_near_duplicate_penalty_std": 0.009966662153601646, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.3123185336589813, "reward_total_composite_mean": 0.43089666962623596, "reward_total_composite_std": 0.3954765498638153} {"timestamp_utc": "2026-04-12T11:50:33Z", "mode": "train", "global_step": 292, "epoch": 0.01172832068120657, "loss": 0.012, "grad_norm": 8.342798233032227, "learning_rate": 9.118181818181819e-06, "num_tokens": 591660.0, "completions/mean_length": 117.375, "completions/min_length": 109.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 117.375, "completions/min_terminated_length": 109.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.8820005059242249, "rewards/meter/std": 0.24240130186080933, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9748523235321045, "rewards/repeat_penalty/std": 0.033441174775362015, "rewards/near_duplicate_penalty/mean": 0.9887571334838867, "rewards/near_duplicate_penalty/std": 0.01039181649684906, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9857282638549805, "rewards/distinct_2/std": 0.024325896054506302, "rewards/total_composite/mean": 0.24187153577804565, "rewards/total_composite/std": 0.13933728635311127, "reward": 0.24187153577804565, "reward_std": 0.13933728635311127, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22239527106285095, "sampling/sampling_logp_difference/max": 1.9674361944198608, "sampling/importance_sampling_ratio/min": 0.1398148536682129, "sampling/importance_sampling_ratio/mean": 1.0495963096618652, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.499325841665268, "clip_ratio/low_mean": 0.04573502764105797, "clip_ratio/low_min": 0.04573502764105797, "clip_ratio/high_mean": 0.11654209718108177, "clip_ratio/high_max": 0.11654209718108177, "clip_ratio/region_mean": 0.16227712482213974, "reward_total_mean": 0.24187153577804565, "reward_meter_mean": 0.8820005059242249, "reward_meter_std": 0.24240130186080933, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9748523235321045, "reward_repeat_penalty_std": 0.033441174775362015, "reward_near_duplicate_penalty_mean": 0.9887571334838867, "reward_near_duplicate_penalty_std": 0.01039181649684906, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9857282638549805, "reward_distinct_2_std": 0.024325896054506302, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.24187153577804565, "reward_total_composite_std": 0.13933728635311127} {"timestamp_utc": "2026-04-12T11:50:48Z", "mode": "train", "global_step": 293, "epoch": 0.011768486162991525, "loss": -0.0571, "grad_norm": 2.7340917587280273, "learning_rate": 9.115151515151516e-06, "num_tokens": 593283.0, "completions/mean_length": 161.875, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 45.16666793823242, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.77762371301651, "rewards/meter/std": 0.3516334593296051, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8469035625457764, "rewards/lexical_plausibility/std": 0.23500525951385498, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3871484696865082, "rewards/repeat_penalty/mean": 0.994547426700592, "rewards/repeat_penalty/std": 0.008622530847787857, "rewards/near_duplicate_penalty/mean": 0.994547426700592, "rewards/near_duplicate_penalty/std": 0.008622530847787857, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4651144742965698, "rewards/total_composite/std": 0.39441993832588196, "reward": 0.4651144742965698, "reward_std": 0.39441990852355957, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20372723042964935, "sampling/sampling_logp_difference/max": 1.4653916358947754, "sampling/importance_sampling_ratio/min": 0.2309875190258026, "sampling/importance_sampling_ratio/mean": 1.0500022172927856, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5260865688323975, "clip_ratio/low_mean": 0.050378479063510895, "clip_ratio/low_min": 0.050378479063510895, "clip_ratio/high_mean": 0.06681599840521812, "clip_ratio/high_max": 0.06681599840521812, "clip_ratio/region_mean": 0.11719447746872902, "reward_total_mean": 0.4651144742965698, "reward_meter_mean": 0.77762371301651, "reward_meter_std": 0.3516334593296051, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8469035625457764, "reward_lexical_plausibility_std": 0.23500525951385498, "reward_repeat_penalty_mean": 0.994547426700592, "reward_repeat_penalty_std": 0.008622530847787857, "reward_near_duplicate_penalty_mean": 0.994547426700592, "reward_near_duplicate_penalty_std": 0.008622530847787857, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3871484696865082, "reward_total_composite_mean": 0.4651144742965698, "reward_total_composite_std": 0.39441993832588196} {"timestamp_utc": "2026-04-12T11:51:03Z", "mode": "train", "global_step": 294, "epoch": 0.011808651644776479, "loss": -0.0628, "grad_norm": 5.737674713134766, "learning_rate": 9.112121212121214e-06, "num_tokens": 594913.0, "completions/mean_length": 97.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.57143020629883, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.5892068147659302, "rewards/meter/std": 0.4092927575111389, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.861744225025177, "rewards/lexical_plausibility/std": 0.2673322260379791, "rewards/judge_quality/mean": 0.45499998331069946, "rewards/judge_quality/std": 0.31883716583251953, "rewards/repeat_penalty/mean": 0.968208909034729, "rewards/repeat_penalty/std": 0.0881827101111412, "rewards/near_duplicate_penalty/mean": 0.999458909034729, "rewards/near_duplicate_penalty/std": 0.0015305416891351342, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2709839642047882, "rewards/total_composite/std": 0.2503100633621216, "reward": 0.2709839642047882, "reward_std": 0.2503100335597992, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1945735514163971, "sampling/sampling_logp_difference/max": 1.0185413360595703, "sampling/importance_sampling_ratio/min": 0.3611213266849518, "sampling/importance_sampling_ratio/mean": 1.0450493097305298, "sampling/importance_sampling_ratio/max": 1.8643429279327393, "entropy": 1.9573396891355515, "clip_ratio/low_mean": 0.0683183167129755, "clip_ratio/low_min": 0.0683183167129755, "clip_ratio/high_mean": 0.08630233816802502, "clip_ratio/high_max": 0.08630233816802502, "clip_ratio/region_mean": 0.15462065488100052, "reward_total_mean": 0.2709839642047882, "reward_meter_mean": 0.5892068147659302, "reward_meter_std": 0.4092927575111389, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.861744225025177, "reward_lexical_plausibility_std": 0.2673322260379791, "reward_repeat_penalty_mean": 0.968208909034729, "reward_repeat_penalty_std": 0.0881827101111412, "reward_near_duplicate_penalty_mean": 0.999458909034729, "reward_near_duplicate_penalty_std": 0.0015305416891351342, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45499998331069946, "reward_judge_quality_std": 0.31883716583251953, "reward_total_composite_mean": 0.2709839642047882, "reward_total_composite_std": 0.2503100633621216} {"timestamp_utc": "2026-04-12T11:51:17Z", "mode": "train", "global_step": 295, "epoch": 0.011848817126561433, "loss": -0.0126, "grad_norm": 5.329678535461426, "learning_rate": 9.10909090909091e-06, "num_tokens": 596280.0, "completions/mean_length": 80.875, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 19.285715103149414, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.7221282720565796, "rewards/meter/std": 0.4450470209121704, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.903509259223938, "rewards/lexical_plausibility/std": 0.16369616985321045, "rewards/judge_quality/mean": 0.5475000143051147, "rewards/judge_quality/std": 0.4066500961780548, "rewards/repeat_penalty/mean": 0.7480332255363464, "rewards/repeat_penalty/std": 0.005562899634242058, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4099704623222351, "rewards/total_composite/std": 0.4066827595233917, "reward": 0.4099704623222351, "reward_std": 0.4066827595233917, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19901323318481445, "sampling/sampling_logp_difference/max": 0.7967100143432617, "sampling/importance_sampling_ratio/min": 0.45080968737602234, "sampling/importance_sampling_ratio/mean": 1.0342069864273071, "sampling/importance_sampling_ratio/max": 1.895004391670227, "entropy": 2.027714654803276, "clip_ratio/low_mean": 0.08847841061651707, "clip_ratio/low_min": 0.08847841061651707, "clip_ratio/high_mean": 0.06477591255679727, "clip_ratio/high_max": 0.06477591255679727, "clip_ratio/region_mean": 0.15325432317331433, "reward_total_mean": 0.4099704623222351, "reward_meter_mean": 0.7221282720565796, "reward_meter_std": 0.4450470209121704, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.903509259223938, "reward_lexical_plausibility_std": 0.16369616985321045, "reward_repeat_penalty_mean": 0.7480332255363464, "reward_repeat_penalty_std": 0.005562899634242058, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5475000143051147, "reward_judge_quality_std": 0.4066500961780548, "reward_total_composite_mean": 0.4099704623222351, "reward_total_composite_std": 0.4066827595233917} {"timestamp_utc": "2026-04-12T11:51:26Z", "mode": "train", "global_step": 296, "epoch": 0.011888982608346386, "loss": 0.0344, "grad_norm": 21.586929321289062, "learning_rate": 9.106060606060606e-06, "num_tokens": 597767.0, "completions/mean_length": 23.875, "completions/min_length": 19.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.875, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.4130640923976898, "rewards/meter/std": 0.4726019501686096, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.0289318785071373, "rewards/judge_quality/mean": 0.8424999713897705, "rewards/judge_quality/std": 0.28014031052589417, "rewards/repeat_penalty/mean": 0.7448863983154297, "rewards/repeat_penalty/std": 0.014463555067777634, "rewards/near_duplicate_penalty/mean": 0.9931818246841431, "rewards/near_duplicate_penalty/std": 0.01928473263978958, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29227522015571594, "rewards/total_composite/std": 0.39396294951438904, "reward": 0.29227522015571594, "reward_std": 0.39396294951438904, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21043173968791962, "sampling/sampling_logp_difference/max": 1.9541807174682617, "sampling/importance_sampling_ratio/min": 0.1416804939508438, "sampling/importance_sampling_ratio/mean": 1.0021095275878906, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8546439111232758, "clip_ratio/low_mean": 0.12120436877012253, "clip_ratio/low_min": 0.12120436877012253, "clip_ratio/high_mean": 0.030869564972817898, "clip_ratio/high_max": 0.030869564972817898, "clip_ratio/region_mean": 0.15207393374294043, "reward_total_mean": 0.29227522015571594, "reward_meter_mean": 0.4130640923976898, "reward_meter_std": 0.4726019501686096, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.0289318785071373, "reward_repeat_penalty_mean": 0.7448863983154297, "reward_repeat_penalty_std": 0.014463555067777634, "reward_near_duplicate_penalty_mean": 0.9931818246841431, "reward_near_duplicate_penalty_std": 0.01928473263978958, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8424999713897705, "reward_judge_quality_std": 0.28014031052589417, "reward_total_composite_mean": 0.29227522015571594, "reward_total_composite_std": 0.39396294951438904} {"timestamp_utc": "2026-04-12T11:51:35Z", "mode": "train", "global_step": 297, "epoch": 0.01192914809013134, "loss": -0.0373, "grad_norm": 15.426389694213867, "learning_rate": 9.103030303030304e-06, "num_tokens": 599328.0, "completions/mean_length": 38.125, "completions/min_length": 34.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.76540607213974, "rewards/meter/std": 0.23013561964035034, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.9947516322135925, "rewards/repeat_penalty/std": 0.008241748437285423, "rewards/near_duplicate_penalty/mean": 0.9947516322135925, "rewards/near_duplicate_penalty/std": 0.008241748437285423, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.34635573625564575, "rewards/total_composite/std": 0.23247207701206207, "reward": 0.34635573625564575, "reward_std": 0.23247207701206207, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2140551656484604, "sampling/sampling_logp_difference/max": 1.916731357574463, "sampling/importance_sampling_ratio/min": 0.1470869481563568, "sampling/importance_sampling_ratio/mean": 1.0367729663848877, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0692486613988876, "clip_ratio/low_mean": 0.12777711264789104, "clip_ratio/low_min": 0.12777711264789104, "clip_ratio/high_mean": 0.06627468205988407, "clip_ratio/high_max": 0.06627468205988407, "clip_ratio/region_mean": 0.19405179470777512, "reward_total_mean": 0.34635573625564575, "reward_meter_mean": 0.76540607213974, "reward_meter_std": 0.23013561964035034, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9947516322135925, "reward_repeat_penalty_std": 0.008241748437285423, "reward_near_duplicate_penalty_mean": 0.9947516322135925, "reward_near_duplicate_penalty_std": 0.008241748437285423, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.34635573625564575, "reward_total_composite_std": 0.23247207701206207} {"timestamp_utc": "2026-04-12T11:51:44Z", "mode": "train", "global_step": 298, "epoch": 0.011969313571916294, "loss": -0.0198, "grad_norm": 15.232839584350586, "learning_rate": 9.100000000000001e-06, "num_tokens": 600785.0, "completions/mean_length": 33.125, "completions/min_length": 28.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.3792986273765564, "rewards/meter/std": 0.30770623683929443, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9464869499206543, "rewards/lexical_plausibility/std": 0.15135782957077026, "rewards/judge_quality/mean": 0.6637499928474426, "rewards/judge_quality/std": 0.28465205430984497, "rewards/repeat_penalty/mean": 0.9954763650894165, "rewards/repeat_penalty/std": 0.006409325636923313, "rewards/near_duplicate_penalty/mean": 0.9954763650894165, "rewards/near_duplicate_penalty/std": 0.006409325636923313, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26781579852104187, "rewards/total_composite/std": 0.2779422402381897, "reward": 0.26781579852104187, "reward_std": 0.2779422402381897, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23376497626304626, "sampling/sampling_logp_difference/max": 1.7966036796569824, "sampling/importance_sampling_ratio/min": 0.16586124897003174, "sampling/importance_sampling_ratio/mean": 0.9879671931266785, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7423544377088547, "clip_ratio/low_mean": 0.07093166094273329, "clip_ratio/low_min": 0.07093166094273329, "clip_ratio/high_mean": 0.08968173898756504, "clip_ratio/high_max": 0.08968173898756504, "clip_ratio/region_mean": 0.16061339993029833, "reward_total_mean": 0.26781579852104187, "reward_meter_mean": 0.3792986273765564, "reward_meter_std": 0.30770623683929443, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9464869499206543, "reward_lexical_plausibility_std": 0.15135782957077026, "reward_repeat_penalty_mean": 0.9954763650894165, "reward_repeat_penalty_std": 0.006409325636923313, "reward_near_duplicate_penalty_mean": 0.9954763650894165, "reward_near_duplicate_penalty_std": 0.006409325636923313, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6637499928474426, "reward_judge_quality_std": 0.28465205430984497, "reward_total_composite_mean": 0.26781579852104187, "reward_total_composite_std": 0.2779422402381897} {"timestamp_utc": "2026-04-12T11:51:54Z", "mode": "train", "global_step": 299, "epoch": 0.012009479053701248, "loss": -0.0217, "grad_norm": 12.565971374511719, "learning_rate": 9.096969696969698e-06, "num_tokens": 602675.0, "completions/mean_length": 65.25, "completions/min_length": 56.0, "completions/max_length": 75.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.25, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.3651045262813568, "rewards/meter/std": 0.26593083143234253, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9940476417541504, "rewards/lexical_plausibility/std": 0.016835875809192657, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.9899188876152039, "rewards/repeat_penalty/std": 0.017242584377527237, "rewards/near_duplicate_penalty/mean": 0.9952132701873779, "rewards/near_duplicate_penalty/std": 0.004840857349336147, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9946581125259399, "rewards/distinct_2/std": 0.01510911900550127, "rewards/total_composite/mean": 0.16748185455799103, "rewards/total_composite/std": 0.1259952336549759, "reward": 0.16748185455799103, "reward_std": 0.1259952336549759, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2156853824853897, "sampling/sampling_logp_difference/max": 1.4517087936401367, "sampling/importance_sampling_ratio/min": 0.23416979610919952, "sampling/importance_sampling_ratio/mean": 1.0100153684616089, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.418099120259285, "clip_ratio/low_mean": 0.0630058366805315, "clip_ratio/low_min": 0.0630058366805315, "clip_ratio/high_mean": 0.1380710806697607, "clip_ratio/high_max": 0.1380710806697607, "clip_ratio/region_mean": 0.2010769173502922, "reward_total_mean": 0.16748185455799103, "reward_meter_mean": 0.3651045262813568, "reward_meter_std": 0.26593083143234253, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9940476417541504, "reward_lexical_plausibility_std": 0.016835875809192657, "reward_repeat_penalty_mean": 0.9899188876152039, "reward_repeat_penalty_std": 0.017242584377527237, "reward_near_duplicate_penalty_mean": 0.9952132701873779, "reward_near_duplicate_penalty_std": 0.004840857349336147, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9946581125259399, "reward_distinct_2_std": 0.01510911900550127, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.16748185455799103, "reward_total_composite_std": 0.1259952336549759} {"timestamp_utc": "2026-04-12T11:52:09Z", "mode": "train", "global_step": 300, "epoch": 0.012049644535486204, "loss": -0.0387, "grad_norm": 5.960353374481201, "learning_rate": 9.093939393939395e-06, "num_tokens": 604355.0, "completions/mean_length": 112.0, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.857147216796875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6109622716903687, "rewards/meter/std": 0.3946131765842438, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9230944514274597, "rewards/lexical_plausibility/std": 0.21752171218395233, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.3223324716091156, "rewards/repeat_penalty/mean": 0.9986394643783569, "rewards/repeat_penalty/std": 0.0025408314540982246, "rewards/near_duplicate_penalty/mean": 0.9986394643783569, "rewards/near_duplicate_penalty/std": 0.0025408314540982246, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27971965074539185, "rewards/total_composite/std": 0.27698031067848206, "reward": 0.27971965074539185, "reward_std": 0.27698028087615967, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21483492851257324, "sampling/sampling_logp_difference/max": 1.8838939666748047, "sampling/importance_sampling_ratio/min": 0.15199707448482513, "sampling/importance_sampling_ratio/mean": 1.0404177904129028, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3810570687055588, "clip_ratio/low_mean": 0.061070866882801056, "clip_ratio/low_min": 0.061070866882801056, "clip_ratio/high_mean": 0.09348621964454651, "clip_ratio/high_max": 0.09348621964454651, "clip_ratio/region_mean": 0.15455708652734756, "reward_total_mean": 0.27971965074539185, "reward_meter_mean": 0.6109622716903687, "reward_meter_std": 0.3946131765842438, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9230944514274597, "reward_lexical_plausibility_std": 0.21752171218395233, "reward_repeat_penalty_mean": 0.9986394643783569, "reward_repeat_penalty_std": 0.0025408314540982246, "reward_near_duplicate_penalty_mean": 0.9986394643783569, "reward_near_duplicate_penalty_std": 0.0025408314540982246, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.3223324716091156, "reward_total_composite_mean": 0.27971965074539185, "reward_total_composite_std": 0.27698031067848206} {"timestamp_utc": "2026-04-12T11:54:20Z", "mode": "eval", "global_step": 300, "epoch": 0.012049644535486204, "eval_loss": NaN, "eval_runtime": 131.0085, "eval_samples_per_second": 0.794, "eval_steps_per_second": 0.099, "eval_num_tokens": 604355.0, "eval_completions/mean_length": 147.91346153846155, "eval_completions/min_length": 32.92307692307692, "eval_completions/max_length": 354.0, "eval_completions/clipped_ratio": 0.0673076923076923, "eval_completions/mean_terminated_length": 121.22445267897386, "eval_completions/min_terminated_length": 32.92307692307692, "eval_completions/max_terminated_length": 257.53846153846155, "eval_rewards/meter/mean": 0.45110395092230576, "eval_rewards/meter/std": 0.38209012150764465, "eval_rewards/count_adherence/mean": 0.9236263220126812, "eval_rewards/count_adherence/std": 0.12292832809572037, "eval_rewards/arabic_clean/mean": 0.8365384615384616, "eval_rewards/arabic_clean/std": 0.2923306066256303, "eval_rewards/lexical_plausibility/mean": 0.9571945438018212, "eval_rewards/lexical_plausibility/std": 0.09503344768801561, "eval_rewards/judge_quality/mean": 0.365769230402433, "eval_rewards/judge_quality/std": 0.2133815953364739, "eval_rewards/repeat_penalty/mean": 0.9364584180024954, "eval_rewards/repeat_penalty/std": 0.10855107381939888, "eval_rewards/near_duplicate_penalty/mean": 0.9848691683549148, "eval_rewards/near_duplicate_penalty/std": 0.019361631479114294, "eval_rewards/opening_diversity/mean": 0.9926382211538461, "eval_rewards/opening_diversity/std": 0.02082225461848653, "eval_rewards/distinct_2/mean": 0.9587259521851172, "eval_rewards/distinct_2/std": 0.08783535759609479, "eval_rewards/total_composite/mean": 0.15561715857340738, "eval_rewards/total_composite/std": 0.1566895954310894, "eval_reward": 0.15561715857340738, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.15180421677919534, "eval_sampling/sampling_logp_difference/max": 1.1537190950833833, "eval_sampling/importance_sampling_ratio/min": 0.31711981617487395, "eval_sampling/importance_sampling_ratio/mean": 1.0492328772178063, "eval_sampling/importance_sampling_ratio/max": 1.7163617610931396, "eval_entropy": 2.512108170069181, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.15561715857340738, "eval_reward_meter_mean": 0.45110395092230576, "eval_reward_meter_std": 0.38209012150764465, "eval_reward_count_adherence_mean": 0.9236263220126812, "eval_reward_count_adherence_std": 0.12292832809572037, "eval_reward_arabic_clean_mean": 0.8365384615384616, "eval_reward_arabic_clean_std": 0.2923306066256303, "eval_reward_lexical_plausibility_mean": 0.9571945438018212, "eval_reward_lexical_plausibility_std": 0.09503344768801561, "eval_reward_repeat_penalty_mean": 0.9364584180024954, "eval_reward_repeat_penalty_std": 0.10855107381939888, "eval_reward_near_duplicate_penalty_mean": 0.9848691683549148, "eval_reward_near_duplicate_penalty_std": 0.019361631479114294, "eval_reward_opening_diversity_mean": 0.9926382211538461, "eval_reward_opening_diversity_std": 0.02082225461848653, "eval_reward_distinct_2_mean": 0.9587259521851172, "eval_reward_distinct_2_std": 0.08783535759609479, "eval_reward_judge_quality_mean": 0.365769230402433, "eval_reward_judge_quality_std": 0.2133815953364739, "eval_reward_total_composite_mean": 0.15561715857340738, "eval_reward_total_composite_std": 0.1566895954310894} {"timestamp_utc": "2026-04-12T11:54:33Z", "mode": "train", "global_step": 301, "epoch": 0.012089810017271158, "loss": 0.0362, "grad_norm": 15.899238586425781, "learning_rate": 9.090909090909091e-06, "num_tokens": 605887.0, "completions/mean_length": 36.5, "completions/min_length": 28.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.5, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5783378481864929, "rewards/meter/std": 0.4569213092327118, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47874999046325684, "rewards/judge_quality/std": 0.1683056354522705, "rewards/repeat_penalty/mean": 0.9830946922302246, "rewards/repeat_penalty/std": 0.02091960422694683, "rewards/near_duplicate_penalty/mean": 0.9830946922302246, "rewards/near_duplicate_penalty/std": 0.02091960422694683, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2994975745677948, "rewards/total_composite/std": 0.27936550974845886, "reward": 0.2994975745677948, "reward_std": 0.2793654799461365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1651681810617447, "sampling/sampling_logp_difference/max": 0.998927116394043, "sampling/importance_sampling_ratio/min": 0.36827436089515686, "sampling/importance_sampling_ratio/mean": 1.0356861352920532, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0033613443374634, "clip_ratio/low_mean": 0.09417487867176533, "clip_ratio/low_min": 0.09417487867176533, "clip_ratio/high_mean": 0.0902948398143053, "clip_ratio/high_max": 0.0902948398143053, "clip_ratio/region_mean": 0.18446971848607063, "reward_total_mean": 0.2994975745677948, "reward_meter_mean": 0.5783378481864929, "reward_meter_std": 0.4569213092327118, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9830946922302246, "reward_repeat_penalty_std": 0.02091960422694683, "reward_near_duplicate_penalty_mean": 0.9830946922302246, "reward_near_duplicate_penalty_std": 0.02091960422694683, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.47874999046325684, "reward_judge_quality_std": 0.1683056354522705, "reward_total_composite_mean": 0.2994975745677948, "reward_total_composite_std": 0.27936550974845886} {"timestamp_utc": "2026-04-12T11:54:42Z", "mode": "train", "global_step": 302, "epoch": 0.012129975499056112, "loss": -0.0167, "grad_norm": 15.26990032196045, "learning_rate": 9.087878787878788e-06, "num_tokens": 607692.0, "completions/mean_length": 55.625, "completions/min_length": 47.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.625, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.7832177877426147, "rewards/meter/std": 0.3151888847351074, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.41624999046325684, "rewards/judge_quality/std": 0.20900700986385345, "rewards/repeat_penalty/mean": 0.938164234161377, "rewards/repeat_penalty/std": 0.07573452591896057, "rewards/near_duplicate_penalty/mean": 0.958517849445343, "rewards/near_duplicate_penalty/std": 0.040154967457056046, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9774928689002991, "rewards/distinct_2/std": 0.04526444524526596, "rewards/total_composite/mean": 0.36066925525665283, "rewards/total_composite/std": 0.24422086775302887, "reward": 0.36066925525665283, "reward_std": 0.24422085285186768, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2266959547996521, "sampling/sampling_logp_difference/max": 1.6513595581054688, "sampling/importance_sampling_ratio/min": 0.19178898632526398, "sampling/importance_sampling_ratio/mean": 1.0588935613632202, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1657568216323853, "clip_ratio/low_mean": 0.13119650445878506, "clip_ratio/low_min": 0.13119650445878506, "clip_ratio/high_mean": 0.06655014585703611, "clip_ratio/high_max": 0.06655014585703611, "clip_ratio/region_mean": 0.19774665031582117, "reward_total_mean": 0.36066925525665283, "reward_meter_mean": 0.7832177877426147, "reward_meter_std": 0.3151888847351074, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.938164234161377, "reward_repeat_penalty_std": 0.07573452591896057, "reward_near_duplicate_penalty_mean": 0.958517849445343, "reward_near_duplicate_penalty_std": 0.040154967457056046, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9774928689002991, "reward_distinct_2_std": 0.04526444524526596, "reward_judge_quality_mean": 0.41624999046325684, "reward_judge_quality_std": 0.20900700986385345, "reward_total_composite_mean": 0.36066925525665283, "reward_total_composite_std": 0.24422086775302887} {"timestamp_utc": "2026-04-12T11:54:56Z", "mode": "train", "global_step": 303, "epoch": 0.012170140980841066, "loss": 0.0061, "grad_norm": 4.482475280761719, "learning_rate": 9.084848484848486e-06, "num_tokens": 609013.0, "completions/mean_length": 85.125, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.142858505249023, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.5166142582893372, "rewards/meter/std": 0.5072239637374878, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9274661540985107, "rewards/lexical_plausibility/std": 0.13499270379543304, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.32262319326400757, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27508029341697693, "rewards/total_composite/std": 0.40899473428726196, "reward": 0.27508029341697693, "reward_std": 0.40899476408958435, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2104078233242035, "sampling/sampling_logp_difference/max": 1.2070770263671875, "sampling/importance_sampling_ratio/min": 0.29907017946243286, "sampling/importance_sampling_ratio/mean": 1.0715430974960327, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.986671194434166, "clip_ratio/low_mean": 0.11303419061005116, "clip_ratio/low_min": 0.11303419061005116, "clip_ratio/high_mean": 0.07534373831003904, "clip_ratio/high_max": 0.07534373831003904, "clip_ratio/region_mean": 0.1883779289200902, "reward_total_mean": 0.27508029341697693, "reward_meter_mean": 0.5166142582893372, "reward_meter_std": 0.5072239637374878, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9274661540985107, "reward_lexical_plausibility_std": 0.13499270379543304, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.32262319326400757, "reward_total_composite_mean": 0.27508029341697693, "reward_total_composite_std": 0.40899473428726196} {"timestamp_utc": "2026-04-12T11:55:06Z", "mode": "train", "global_step": 304, "epoch": 0.01221030646262602, "loss": 0.0822, "grad_norm": 8.455896377563477, "learning_rate": 9.081818181818183e-06, "num_tokens": 611509.0, "completions/mean_length": 134.0, "completions/min_length": 114.0, "completions/max_length": 149.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 134.0, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.5805405378341675, "rewards/meter/std": 0.2993761897087097, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.998106062412262, "rewards/lexical_plausibility/std": 0.005356864538043737, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.8322775363922119, "rewards/repeat_penalty/std": 0.15659010410308838, "rewards/near_duplicate_penalty/mean": 0.9583142399787903, "rewards/near_duplicate_penalty/std": 0.030610177665948868, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.881321132183075, "rewards/distinct_2/std": 0.10168742388486862, "rewards/total_composite/mean": 0.21507972478866577, "rewards/total_composite/std": 0.1228046640753746, "reward": 0.21507972478866577, "reward_std": 0.122804656624794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20804409682750702, "sampling/sampling_logp_difference/max": 1.6914610862731934, "sampling/importance_sampling_ratio/min": 0.1842501312494278, "sampling/importance_sampling_ratio/mean": 1.0556303262710571, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4510658532381058, "clip_ratio/low_mean": 0.06107951141893864, "clip_ratio/low_min": 0.06107951141893864, "clip_ratio/high_mean": 0.1182973887771368, "clip_ratio/high_max": 0.1182973887771368, "clip_ratio/region_mean": 0.17937690019607544, "reward_total_mean": 0.21507972478866577, "reward_meter_mean": 0.5805405378341675, "reward_meter_std": 0.2993761897087097, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.998106062412262, "reward_lexical_plausibility_std": 0.005356864538043737, "reward_repeat_penalty_mean": 0.8322775363922119, "reward_repeat_penalty_std": 0.15659010410308838, "reward_near_duplicate_penalty_mean": 0.9583142399787903, "reward_near_duplicate_penalty_std": 0.030610177665948868, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.881321132183075, "reward_distinct_2_std": 0.10168742388486862, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.21507972478866577, "reward_total_composite_std": 0.1228046640753746} {"timestamp_utc": "2026-04-12T11:55:16Z", "mode": "train", "global_step": 305, "epoch": 0.012250471944410974, "loss": 0.0182, "grad_norm": 9.742971420288086, "learning_rate": 9.078787878787878e-06, "num_tokens": 613414.0, "completions/mean_length": 73.125, "completions/min_length": 68.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.39772510528564453, "rewards/meter/std": 0.2838525176048279, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9150548577308655, "rewards/lexical_plausibility/std": 0.10696487873792648, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9957312345504761, "rewards/repeat_penalty/std": 0.0034778863191604614, "rewards/near_duplicate_penalty/mean": 0.9957312345504761, "rewards/near_duplicate_penalty/std": 0.0034778863191604614, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12142910063266754, "rewards/total_composite/std": 0.10667760670185089, "reward": 0.12142910063266754, "reward_std": 0.10667760670185089, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22550351917743683, "sampling/sampling_logp_difference/max": 1.464259147644043, "sampling/importance_sampling_ratio/min": 0.23124924302101135, "sampling/importance_sampling_ratio/mean": 1.054365873336792, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.6886763870716095, "clip_ratio/low_mean": 0.0966362003237009, "clip_ratio/low_min": 0.0966362003237009, "clip_ratio/high_mean": 0.08360382542014122, "clip_ratio/high_max": 0.08360382542014122, "clip_ratio/region_mean": 0.18024002574384212, "reward_total_mean": 0.12142910063266754, "reward_meter_mean": 0.39772510528564453, "reward_meter_std": 0.2838525176048279, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9150548577308655, "reward_lexical_plausibility_std": 0.10696487873792648, "reward_repeat_penalty_mean": 0.9957312345504761, "reward_repeat_penalty_std": 0.0034778863191604614, "reward_near_duplicate_penalty_mean": 0.9957312345504761, "reward_near_duplicate_penalty_std": 0.0034778863191604614, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.12142910063266754, "reward_total_composite_std": 0.10667760670185089} {"timestamp_utc": "2026-04-12T11:55:25Z", "mode": "train", "global_step": 306, "epoch": 0.012290637426195928, "loss": 0.096, "grad_norm": 15.95866584777832, "learning_rate": 9.075757575757577e-06, "num_tokens": 614926.0, "completions/mean_length": 37.0, "completions/min_length": 27.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.9003474116325378, "rewards/meter/std": 0.13265357911586761, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5375000238418579, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.9292006492614746, "rewards/repeat_penalty/std": 0.12348253279924393, "rewards/near_duplicate_penalty/mean": 0.9654132127761841, "rewards/near_duplicate_penalty/std": 0.034489717334508896, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.4877563714981079, "rewards/total_composite/std": 0.1906237006187439, "reward": 0.4877563714981079, "reward_std": 0.1906237006187439, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2088146060705185, "sampling/sampling_logp_difference/max": 1.240828037261963, "sampling/importance_sampling_ratio/min": 0.28914472460746765, "sampling/importance_sampling_ratio/mean": 1.029973030090332, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7366817593574524, "clip_ratio/low_mean": 0.09791644988581538, "clip_ratio/low_min": 0.09791644988581538, "clip_ratio/high_mean": 0.07956166565418243, "clip_ratio/high_max": 0.07956166565418243, "clip_ratio/region_mean": 0.17747811553999782, "reward_total_mean": 0.4877563714981079, "reward_meter_mean": 0.9003474116325378, "reward_meter_std": 0.13265357911586761, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9292006492614746, "reward_repeat_penalty_std": 0.12348253279924393, "reward_near_duplicate_penalty_mean": 0.9654132127761841, "reward_near_duplicate_penalty_std": 0.034489717334508896, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.5375000238418579, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.4877563714981079, "reward_total_composite_std": 0.1906237006187439} {"timestamp_utc": "2026-04-12T11:55:34Z", "mode": "train", "global_step": 307, "epoch": 0.012330802907980882, "loss": 0.036, "grad_norm": 19.920801162719727, "learning_rate": 9.072727272727273e-06, "num_tokens": 616250.0, "completions/mean_length": 21.5, "completions/min_length": 17.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.830586314201355, "rewards/meter/std": 0.3387489318847656, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.34087073802948, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4118979275226593, "rewards/total_composite/std": 0.3443230390548706, "reward": 0.4118979275226593, "reward_std": 0.3443230390548706, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20045839250087738, "sampling/sampling_logp_difference/max": 1.885471224784851, "sampling/importance_sampling_ratio/min": 0.15175753831863403, "sampling/importance_sampling_ratio/mean": 1.0101442337036133, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5795673578977585, "clip_ratio/low_mean": 0.08071046741679311, "clip_ratio/low_min": 0.08071046741679311, "clip_ratio/high_mean": 0.06173687521368265, "clip_ratio/high_max": 0.06173687521368265, "clip_ratio/region_mean": 0.14244734263047576, "reward_total_mean": 0.4118979275226593, "reward_meter_mean": 0.830586314201355, "reward_meter_std": 0.3387489318847656, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.34087073802948, "reward_total_composite_mean": 0.4118979275226593, "reward_total_composite_std": 0.3443230390548706} {"timestamp_utc": "2026-04-12T11:55:49Z", "mode": "train", "global_step": 308, "epoch": 0.012370968389765835, "loss": -0.1, "grad_norm": 3.589592933654785, "learning_rate": 9.06969696969697e-06, "num_tokens": 619110.0, "completions/mean_length": 452.5, "completions/min_length": 311.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 353.3333435058594, "completions/min_terminated_length": 311.0, "completions/max_terminated_length": 421.0, "rewards/meter/mean": 0.4821336269378662, "rewards/meter/std": 0.270393431186676, "rewards/count_adherence/mean": 0.6736111640930176, "rewards/count_adherence/std": 0.24386203289031982, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8378704190254211, "rewards/lexical_plausibility/std": 0.13672730326652527, "rewards/judge_quality/mean": 0.11249999701976776, "rewards/judge_quality/std": 0.051754921674728394, "rewards/repeat_penalty/mean": 0.9791123867034912, "rewards/repeat_penalty/std": 0.022714849561452866, "rewards/near_duplicate_penalty/mean": 0.9937890768051147, "rewards/near_duplicate_penalty/std": 0.004387399181723595, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9851706624031067, "rewards/distinct_2/std": 0.019177502021193504, "rewards/total_composite/mean": 0.019215591251850128, "rewards/total_composite/std": 0.04168100655078888, "reward": 0.019215591251850128, "reward_std": 0.04168100282549858, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21137875318527222, "sampling/sampling_logp_difference/max": 1.6428661346435547, "sampling/importance_sampling_ratio/min": 0.19342486560344696, "sampling/importance_sampling_ratio/mean": 1.0538774728775024, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9971690475940704, "clip_ratio/low_mean": 0.028733489103615284, "clip_ratio/low_min": 0.028733489103615284, "clip_ratio/high_mean": 0.021704180166125298, "clip_ratio/high_max": 0.021704180166125298, "clip_ratio/region_mean": 0.05043766926974058, "reward_total_mean": 0.019215591251850128, "reward_meter_mean": 0.4821336269378662, "reward_meter_std": 0.270393431186676, "reward_count_adherence_mean": 0.6736111640930176, "reward_count_adherence_std": 0.24386203289031982, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8378704190254211, "reward_lexical_plausibility_std": 0.13672730326652527, "reward_repeat_penalty_mean": 0.9791123867034912, "reward_repeat_penalty_std": 0.022714849561452866, "reward_near_duplicate_penalty_mean": 0.9937890768051147, "reward_near_duplicate_penalty_std": 0.004387399181723595, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9851706624031067, "reward_distinct_2_std": 0.019177502021193504, "reward_judge_quality_mean": 0.11249999701976776, "reward_judge_quality_std": 0.051754921674728394, "reward_total_composite_mean": 0.019215591251850128, "reward_total_composite_std": 0.04168100655078888} {"timestamp_utc": "2026-04-12T11:56:04Z", "mode": "train", "global_step": 309, "epoch": 0.01241113387155079, "loss": -0.0789, "grad_norm": 4.695291519165039, "learning_rate": 9.066666666666667e-06, "num_tokens": 621724.0, "completions/mean_length": 244.75, "completions/min_length": 131.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 155.6666717529297, "completions/min_terminated_length": 131.0, "completions/max_terminated_length": 179.0, "rewards/meter/mean": 0.4317730665206909, "rewards/meter/std": 0.4164171814918518, "rewards/count_adherence/mean": 0.890625, "rewards/count_adherence/std": 0.14074896275997162, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9328837394714355, "rewards/lexical_plausibility/std": 0.12524037063121796, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.9769273996353149, "rewards/repeat_penalty/std": 0.03193797543644905, "rewards/near_duplicate_penalty/mean": 0.9913658499717712, "rewards/near_duplicate_penalty/std": 0.005720204208046198, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9853183627128601, "rewards/distinct_2/std": 0.027391478419303894, "rewards/total_composite/mean": 0.14949725568294525, "rewards/total_composite/std": 0.18220500648021698, "reward": 0.14949725568294525, "reward_std": 0.18220500648021698, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2315247803926468, "sampling/sampling_logp_difference/max": 1.192319631576538, "sampling/importance_sampling_ratio/min": 0.34306013584136963, "sampling/importance_sampling_ratio/mean": 1.0498822927474976, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3267560601234436, "clip_ratio/low_mean": 0.0709469635039568, "clip_ratio/low_min": 0.0709469635039568, "clip_ratio/high_mean": 0.07881752587854862, "clip_ratio/high_max": 0.07881752587854862, "clip_ratio/region_mean": 0.14976448938250542, "reward_total_mean": 0.14949725568294525, "reward_meter_mean": 0.4317730665206909, "reward_meter_std": 0.4164171814918518, "reward_count_adherence_mean": 0.890625, "reward_count_adherence_std": 0.14074896275997162, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9328837394714355, "reward_lexical_plausibility_std": 0.12524037063121796, "reward_repeat_penalty_mean": 0.9769273996353149, "reward_repeat_penalty_std": 0.03193797543644905, "reward_near_duplicate_penalty_mean": 0.9913658499717712, "reward_near_duplicate_penalty_std": 0.005720204208046198, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9853183627128601, "reward_distinct_2_std": 0.027391478419303894, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.14949725568294525, "reward_total_composite_std": 0.18220500648021698} {"timestamp_utc": "2026-04-12T11:56:14Z", "mode": "train", "global_step": 310, "epoch": 0.012451299353335743, "loss": -0.0056, "grad_norm": 14.204791069030762, "learning_rate": 9.063636363636365e-06, "num_tokens": 623684.0, "completions/mean_length": 57.0, "completions/min_length": 50.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.0, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.8325011730194092, "rewards/meter/std": 0.3362966775894165, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9944852590560913, "rewards/lexical_plausibility/std": 0.015597938559949398, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2745385766029358, "rewards/repeat_penalty/mean": 0.9572106599807739, "rewards/repeat_penalty/std": 0.038330599665641785, "rewards/near_duplicate_penalty/mean": 0.9769012928009033, "rewards/near_duplicate_penalty/std": 0.016843775287270546, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9796324372291565, "rewards/distinct_2/std": 0.02811598777770996, "rewards/total_composite/mean": 0.46715015172958374, "rewards/total_composite/std": 0.3051133453845978, "reward": 0.46715015172958374, "reward_std": 0.3051133453845978, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2098153829574585, "sampling/sampling_logp_difference/max": 1.2948904037475586, "sampling/importance_sampling_ratio/min": 0.2739278972148895, "sampling/importance_sampling_ratio/mean": 1.0542532205581665, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9368436485528946, "clip_ratio/low_mean": 0.13437646813690662, "clip_ratio/low_min": 0.13437646813690662, "clip_ratio/high_mean": 0.034722222946584225, "clip_ratio/high_max": 0.034722222946584225, "clip_ratio/region_mean": 0.16909869108349085, "reward_total_mean": 0.46715015172958374, "reward_meter_mean": 0.8325011730194092, "reward_meter_std": 0.3362966775894165, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9944852590560913, "reward_lexical_plausibility_std": 0.015597938559949398, "reward_repeat_penalty_mean": 0.9572106599807739, "reward_repeat_penalty_std": 0.038330599665641785, "reward_near_duplicate_penalty_mean": 0.9769012928009033, "reward_near_duplicate_penalty_std": 0.016843775287270546, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9796324372291565, "reward_distinct_2_std": 0.02811598777770996, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2745385766029358, "reward_total_composite_mean": 0.46715015172958374, "reward_total_composite_std": 0.3051133453845978} {"timestamp_utc": "2026-04-12T11:56:24Z", "mode": "train", "global_step": 311, "epoch": 0.012491464835120697, "loss": 0.0685, "grad_norm": 13.525808334350586, "learning_rate": 9.06060606060606e-06, "num_tokens": 625707.0, "completions/mean_length": 79.875, "completions/min_length": 61.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.875, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.39014071226119995, "rewards/meter/std": 0.2583003640174866, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9834882020950317, "rewards/lexical_plausibility/std": 0.04670235514640808, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.974642276763916, "rewards/repeat_penalty/std": 0.029900040477514267, "rewards/near_duplicate_penalty/mean": 0.9878274202346802, "rewards/near_duplicate_penalty/std": 0.007417390588670969, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9865831732749939, "rewards/distinct_2/std": 0.0266198068857193, "rewards/total_composite/mean": 0.12803345918655396, "rewards/total_composite/std": 0.11432408541440964, "reward": 0.12803345918655396, "reward_std": 0.11432407051324844, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20194865763187408, "sampling/sampling_logp_difference/max": 2.013035774230957, "sampling/importance_sampling_ratio/min": 0.13358253240585327, "sampling/importance_sampling_ratio/mean": 1.0232917070388794, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5410507768392563, "clip_ratio/low_mean": 0.08136198483407497, "clip_ratio/low_min": 0.08136198483407497, "clip_ratio/high_mean": 0.09056342486292124, "clip_ratio/high_max": 0.09056342486292124, "clip_ratio/region_mean": 0.1719254096969962, "reward_total_mean": 0.12803345918655396, "reward_meter_mean": 0.39014071226119995, "reward_meter_std": 0.2583003640174866, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9834882020950317, "reward_lexical_plausibility_std": 0.04670235514640808, "reward_repeat_penalty_mean": 0.974642276763916, "reward_repeat_penalty_std": 0.029900040477514267, "reward_near_duplicate_penalty_mean": 0.9878274202346802, "reward_near_duplicate_penalty_std": 0.007417390588670969, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9865831732749939, "reward_distinct_2_std": 0.0266198068857193, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.12803345918655396, "reward_total_composite_std": 0.11432408541440964} {"timestamp_utc": "2026-04-12T11:56:39Z", "mode": "train", "global_step": 312, "epoch": 0.012531630316905651, "loss": -0.1229, "grad_norm": 5.748407363891602, "learning_rate": 9.057575757575759e-06, "num_tokens": 627468.0, "completions/mean_length": 111.125, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.85714340209961, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.827028214931488, "rewards/meter/std": 0.3209535777568817, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9249270558357239, "rewards/lexical_plausibility/std": 0.21233832836151123, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1922609955072403, "rewards/repeat_penalty/mean": 0.8958534002304077, "rewards/repeat_penalty/std": 0.15997065603733063, "rewards/near_duplicate_penalty/mean": 0.9642992615699768, "rewards/near_duplicate_penalty/std": 0.031497787684202194, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9450549483299255, "rewards/distinct_2/std": 0.10173846781253815, "rewards/total_composite/mean": 0.3584931492805481, "rewards/total_composite/std": 0.2006467878818512, "reward": 0.3584931492805481, "reward_std": 0.20064677298069, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23162570595741272, "sampling/sampling_logp_difference/max": 1.6000958681106567, "sampling/importance_sampling_ratio/min": 0.201877161860466, "sampling/importance_sampling_ratio/mean": 1.0524348020553589, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8471671640872955, "clip_ratio/low_mean": 0.1423076931387186, "clip_ratio/low_min": 0.1423076931387186, "clip_ratio/high_mean": 0.04150943458080292, "clip_ratio/high_max": 0.04150943458080292, "clip_ratio/region_mean": 0.18381712771952152, "reward_total_mean": 0.3584931492805481, "reward_meter_mean": 0.827028214931488, "reward_meter_std": 0.3209535777568817, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9249270558357239, "reward_lexical_plausibility_std": 0.21233832836151123, "reward_repeat_penalty_mean": 0.8958534002304077, "reward_repeat_penalty_std": 0.15997065603733063, "reward_near_duplicate_penalty_mean": 0.9642992615699768, "reward_near_duplicate_penalty_std": 0.031497787684202194, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9450549483299255, "reward_distinct_2_std": 0.10173846781253815, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1922609955072403, "reward_total_composite_mean": 0.3584931492805481, "reward_total_composite_std": 0.2006467878818512} {"timestamp_utc": "2026-04-12T11:56:49Z", "mode": "train", "global_step": 313, "epoch": 0.012571795798690605, "loss": 0.0259, "grad_norm": 14.188372611999512, "learning_rate": 9.054545454545455e-06, "num_tokens": 629439.0, "completions/mean_length": 79.375, "completions/min_length": 68.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.375, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.7856276035308838, "rewards/meter/std": 0.3154408931732178, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9707048535346985, "rewards/repeat_penalty/std": 0.031784094870090485, "rewards/near_duplicate_penalty/mean": 0.9863473773002625, "rewards/near_duplicate_penalty/std": 0.01276310719549656, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839661121368408, "rewards/distinct_2/std": 0.022137979045510292, "rewards/total_composite/mean": 0.3288583755493164, "rewards/total_composite/std": 0.130870059132576, "reward": 0.3288583755493164, "reward_std": 0.130870059132576, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17699967324733734, "sampling/sampling_logp_difference/max": 1.2040987014770508, "sampling/importance_sampling_ratio/min": 0.29996222257614136, "sampling/importance_sampling_ratio/mean": 1.0302438735961914, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6164602041244507, "clip_ratio/low_mean": 0.04212055169045925, "clip_ratio/low_min": 0.04212055169045925, "clip_ratio/high_mean": 0.12164961267262697, "clip_ratio/high_max": 0.12164961267262697, "clip_ratio/region_mean": 0.16377016436308622, "reward_total_mean": 0.3288583755493164, "reward_meter_mean": 0.7856276035308838, "reward_meter_std": 0.3154408931732178, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9707048535346985, "reward_repeat_penalty_std": 0.031784094870090485, "reward_near_duplicate_penalty_mean": 0.9863473773002625, "reward_near_duplicate_penalty_std": 0.01276310719549656, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839661121368408, "reward_distinct_2_std": 0.022137979045510292, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.3288583755493164, "reward_total_composite_std": 0.130870059132576} {"timestamp_utc": "2026-04-12T11:57:03Z", "mode": "train", "global_step": 314, "epoch": 0.012611961280475559, "loss": -0.1353, "grad_norm": 3.3886120319366455, "learning_rate": 9.051515151515152e-06, "num_tokens": 632135.0, "completions/mean_length": 306.0, "completions/min_length": 163.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 182.40000915527344, "completions/min_terminated_length": 163.0, "completions/max_terminated_length": 221.0, "rewards/meter/mean": 0.6670107841491699, "rewards/meter/std": 0.30283650755882263, "rewards/count_adherence/mean": 0.7777777910232544, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8064969778060913, "rewards/lexical_plausibility/std": 0.23627878725528717, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1597989797592163, "rewards/repeat_penalty/mean": 0.9876633882522583, "rewards/repeat_penalty/std": 0.014699472114443779, "rewards/near_duplicate_penalty/mean": 0.9937053322792053, "rewards/near_duplicate_penalty/std": 0.005136602092534304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.99388587474823, "rewards/distinct_2/std": 0.010835127905011177, "rewards/total_composite/mean": 0.0810789167881012, "rewards/total_composite/std": 0.13296110928058624, "reward": 0.0810789167881012, "reward_std": 0.13296109437942505, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20112429559230804, "sampling/sampling_logp_difference/max": 1.3474502563476562, "sampling/importance_sampling_ratio/min": 0.25990211963653564, "sampling/importance_sampling_ratio/mean": 1.0480228662490845, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0854735374450684, "clip_ratio/low_mean": 0.03859323728829622, "clip_ratio/low_min": 0.03859323728829622, "clip_ratio/high_mean": 0.06395599246025085, "clip_ratio/high_max": 0.06395599246025085, "clip_ratio/region_mean": 0.10254922974854708, "reward_total_mean": 0.0810789167881012, "reward_meter_mean": 0.6670107841491699, "reward_meter_std": 0.30283650755882263, "reward_count_adherence_mean": 0.7777777910232544, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8064969778060913, "reward_lexical_plausibility_std": 0.23627878725528717, "reward_repeat_penalty_mean": 0.9876633882522583, "reward_repeat_penalty_std": 0.014699472114443779, "reward_near_duplicate_penalty_mean": 0.9937053322792053, "reward_near_duplicate_penalty_std": 0.005136602092534304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.99388587474823, "reward_distinct_2_std": 0.010835127905011177, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1597989797592163, "reward_total_composite_mean": 0.0810789167881012, "reward_total_composite_std": 0.13296110928058624} {"timestamp_utc": "2026-04-12T11:57:13Z", "mode": "train", "global_step": 315, "epoch": 0.012652126762260513, "loss": 0.0604, "grad_norm": 14.44451904296875, "learning_rate": 9.04848484848485e-06, "num_tokens": 633894.0, "completions/mean_length": 52.875, "completions/min_length": 44.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.875, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.8267420530319214, "rewards/meter/std": 0.3160305619239807, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.90375816822052, "rewards/repeat_penalty/std": 0.08299682289361954, "rewards/near_duplicate_penalty/mean": 0.9495149254798889, "rewards/near_duplicate_penalty/std": 0.029489515349268913, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9513822197914124, "rewards/distinct_2/std": 0.07583235204219818, "rewards/total_composite/mean": 0.4872320294380188, "rewards/total_composite/std": 0.2897428274154663, "reward": 0.4872320294380188, "reward_std": 0.2897427976131439, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16570477187633514, "sampling/sampling_logp_difference/max": 2.175581932067871, "sampling/importance_sampling_ratio/min": 0.11354205757379532, "sampling/importance_sampling_ratio/mean": 1.0141010284423828, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1112485229969025, "clip_ratio/low_mean": 0.11848831083625555, "clip_ratio/low_min": 0.11848831083625555, "clip_ratio/high_mean": 0.04618818685412407, "clip_ratio/high_max": 0.04618818685412407, "clip_ratio/region_mean": 0.16467649769037962, "reward_total_mean": 0.4872320294380188, "reward_meter_mean": 0.8267420530319214, "reward_meter_std": 0.3160305619239807, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.90375816822052, "reward_repeat_penalty_std": 0.08299682289361954, "reward_near_duplicate_penalty_mean": 0.9495149254798889, "reward_near_duplicate_penalty_std": 0.029489515349268913, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9513822197914124, "reward_distinct_2_std": 0.07583235204219818, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.4872320294380188, "reward_total_composite_std": 0.2897428274154663} {"timestamp_utc": "2026-04-12T11:57:27Z", "mode": "train", "global_step": 316, "epoch": 0.012692292244045467, "loss": -0.1272, "grad_norm": 3.496385335922241, "learning_rate": 9.045454545454546e-06, "num_tokens": 636364.0, "completions/mean_length": 240.75, "completions/min_length": 120.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 150.33334350585938, "completions/min_terminated_length": 120.0, "completions/max_terminated_length": 221.0, "rewards/meter/mean": 0.6570875644683838, "rewards/meter/std": 0.3701251149177551, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.34503278136253357, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8570929169654846, "rewards/lexical_plausibility/std": 0.2655525207519531, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.9834110736846924, "rewards/repeat_penalty/std": 0.021247945725917816, "rewards/near_duplicate_penalty/mean": 0.9942145347595215, "rewards/near_duplicate_penalty/std": 0.004308826755732298, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9891218543052673, "rewards/distinct_2/std": 0.020289666950702667, "rewards/total_composite/mean": 0.21258118748664856, "rewards/total_composite/std": 0.17661871016025543, "reward": 0.21258118748664856, "reward_std": 0.17661871016025543, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20938053727149963, "sampling/sampling_logp_difference/max": 1.2175943851470947, "sampling/importance_sampling_ratio/min": 0.29594123363494873, "sampling/importance_sampling_ratio/mean": 1.0499805212020874, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6157505214214325, "clip_ratio/low_mean": 0.04339649248868227, "clip_ratio/low_min": 0.04339649248868227, "clip_ratio/high_mean": 0.10528704524040222, "clip_ratio/high_max": 0.10528704524040222, "clip_ratio/region_mean": 0.1486835377290845, "reward_total_mean": 0.21258118748664856, "reward_meter_mean": 0.6570875644683838, "reward_meter_std": 0.3701251149177551, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.34503278136253357, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8570929169654846, "reward_lexical_plausibility_std": 0.2655525207519531, "reward_repeat_penalty_mean": 0.9834110736846924, "reward_repeat_penalty_std": 0.021247945725917816, "reward_near_duplicate_penalty_mean": 0.9942145347595215, "reward_near_duplicate_penalty_std": 0.004308826755732298, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9891218543052673, "reward_distinct_2_std": 0.020289666950702667, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.21258118748664856, "reward_total_composite_std": 0.17661871016025543} {"timestamp_utc": "2026-04-12T11:57:36Z", "mode": "train", "global_step": 317, "epoch": 0.012732457725830421, "loss": -0.1125, "grad_norm": 17.743989944458008, "learning_rate": 9.042424242424244e-06, "num_tokens": 637907.0, "completions/mean_length": 20.875, "completions/min_length": 17.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.9689522981643677, "rewards/meter/std": 0.005783551372587681, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.7307312488555908, "rewards/repeat_penalty/std": 0.02059919387102127, "rewards/near_duplicate_penalty/mean": 0.9743083119392395, "rewards/near_duplicate_penalty/std": 0.027465570718050003, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5245275497436523, "rewards/total_composite/std": 0.31540247797966003, "reward": 0.5245275497436523, "reward_std": 0.31540247797966003, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1126757487654686, "sampling/sampling_logp_difference/max": 1.3009719848632812, "sampling/importance_sampling_ratio/min": 0.3247632384300232, "sampling/importance_sampling_ratio/mean": 1.033617615699768, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5779096521437168, "clip_ratio/low_mean": 0.08270369609817863, "clip_ratio/low_min": 0.08270369609817863, "clip_ratio/high_mean": 0.04456018563359976, "clip_ratio/high_max": 0.04456018563359976, "clip_ratio/region_mean": 0.12726388173177838, "reward_total_mean": 0.5245275497436523, "reward_meter_mean": 0.9689522981643677, "reward_meter_std": 0.005783551372587681, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7307312488555908, "reward_repeat_penalty_std": 0.02059919387102127, "reward_near_duplicate_penalty_mean": 0.9743083119392395, "reward_near_duplicate_penalty_std": 0.027465570718050003, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.5245275497436523, "reward_total_composite_std": 0.31540247797966003} {"timestamp_utc": "2026-04-12T11:57:45Z", "mode": "train", "global_step": 318, "epoch": 0.012772623207615375, "loss": 0.0252, "grad_norm": 17.594728469848633, "learning_rate": 9.03939393939394e-06, "num_tokens": 639659.0, "completions/mean_length": 44.0, "completions/min_length": 40.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5897473096847534, "rewards/meter/std": 0.3423965573310852, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.9881412386894226, "rewards/repeat_penalty/std": 0.01636464148759842, "rewards/near_duplicate_penalty/mean": 0.9881412386894226, "rewards/near_duplicate_penalty/std": 0.01636464148759842, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.37728744745254517, "rewards/total_composite/std": 0.30481475591659546, "reward": 0.37728744745254517, "reward_std": 0.30481472611427307, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1902374029159546, "sampling/sampling_logp_difference/max": 1.3638861179351807, "sampling/importance_sampling_ratio/min": 0.25566530227661133, "sampling/importance_sampling_ratio/mean": 1.0728695392608643, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7821234613656998, "clip_ratio/low_mean": 0.10526788979768753, "clip_ratio/low_min": 0.10526788979768753, "clip_ratio/high_mean": 0.08607660513371229, "clip_ratio/high_max": 0.08607660513371229, "clip_ratio/region_mean": 0.19134449493139982, "reward_total_mean": 0.37728744745254517, "reward_meter_mean": 0.5897473096847534, "reward_meter_std": 0.3423965573310852, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9881412386894226, "reward_repeat_penalty_std": 0.01636464148759842, "reward_near_duplicate_penalty_mean": 0.9881412386894226, "reward_near_duplicate_penalty_std": 0.01636464148759842, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.37728744745254517, "reward_total_composite_std": 0.30481475591659546} {"timestamp_utc": "2026-04-12T11:58:01Z", "mode": "train", "global_step": 319, "epoch": 0.012812788689400329, "loss": -0.081, "grad_norm": 4.2549848556518555, "learning_rate": 9.036363636363638e-06, "num_tokens": 641286.0, "completions/mean_length": 97.375, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.142860412597656, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.9505184888839722, "rewards/meter/std": 0.08344382047653198, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9379931092262268, "rewards/lexical_plausibility/std": 0.17538200318813324, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.1642080545425415, "rewards/repeat_penalty/mean": 0.9991400241851807, "rewards/repeat_penalty/std": 0.001592559041455388, "rewards/near_duplicate_penalty/mean": 0.9991400241851807, "rewards/near_duplicate_penalty/std": 0.001592559041455388, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33270570635795593, "rewards/total_composite/std": 0.20538638532161713, "reward": 0.33270570635795593, "reward_std": 0.20538638532161713, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21220289170742035, "sampling/sampling_logp_difference/max": 1.1251039505004883, "sampling/importance_sampling_ratio/min": 0.32461872696876526, "sampling/importance_sampling_ratio/mean": 1.0525115728378296, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9547057002782822, "clip_ratio/low_mean": 0.03928571566939354, "clip_ratio/low_min": 0.03928571566939354, "clip_ratio/high_mean": 0.15886845905333757, "clip_ratio/high_max": 0.15886845905333757, "clip_ratio/region_mean": 0.1981541747227311, "reward_total_mean": 0.33270570635795593, "reward_meter_mean": 0.9505184888839722, "reward_meter_std": 0.08344382047653198, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9379931092262268, "reward_lexical_plausibility_std": 0.17538200318813324, "reward_repeat_penalty_mean": 0.9991400241851807, "reward_repeat_penalty_std": 0.001592559041455388, "reward_near_duplicate_penalty_mean": 0.9991400241851807, "reward_near_duplicate_penalty_std": 0.001592559041455388, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.1642080545425415, "reward_total_composite_mean": 0.33270570635795593, "reward_total_composite_std": 0.20538638532161713} {"timestamp_utc": "2026-04-12T11:58:14Z", "mode": "train", "global_step": 320, "epoch": 0.012852954171185283, "loss": -0.0336, "grad_norm": 3.643080949783325, "learning_rate": 9.033333333333334e-06, "num_tokens": 642738.0, "completions/mean_length": 155.5, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 36.66666793823242, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.35714009404182434, "rewards/meter/std": 0.4069850742816925, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8637242317199707, "rewards/lexical_plausibility/std": 0.23499347269535065, "rewards/judge_quality/mean": 0.44875001907348633, "rewards/judge_quality/std": 0.3410671353340149, "rewards/repeat_penalty/mean": 0.98957359790802, "rewards/repeat_penalty/std": 0.019379448145627975, "rewards/near_duplicate_penalty/mean": 0.98957359790802, "rewards/near_duplicate_penalty/std": 0.019379448145627975, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19615322351455688, "rewards/total_composite/std": 0.2576081156730652, "reward": 0.19615322351455688, "reward_std": 0.2576081156730652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20727041363716125, "sampling/sampling_logp_difference/max": 2.490852117538452, "sampling/importance_sampling_ratio/min": 0.08283934742212296, "sampling/importance_sampling_ratio/mean": 1.0229649543762207, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5510234534740448, "clip_ratio/low_mean": 0.06580646149814129, "clip_ratio/low_min": 0.06580646149814129, "clip_ratio/high_mean": 0.06170794926583767, "clip_ratio/high_max": 0.06170794926583767, "clip_ratio/region_mean": 0.12751441076397896, "reward_total_mean": 0.19615322351455688, "reward_meter_mean": 0.35714009404182434, "reward_meter_std": 0.4069850742816925, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8637242317199707, "reward_lexical_plausibility_std": 0.23499347269535065, "reward_repeat_penalty_mean": 0.98957359790802, "reward_repeat_penalty_std": 0.019379448145627975, "reward_near_duplicate_penalty_mean": 0.98957359790802, "reward_near_duplicate_penalty_std": 0.019379448145627975, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44875001907348633, "reward_judge_quality_std": 0.3410671353340149, "reward_total_composite_mean": 0.19615322351455688, "reward_total_composite_std": 0.2576081156730652} {"timestamp_utc": "2026-04-12T11:58:22Z", "mode": "train", "global_step": 321, "epoch": 0.012893119652970237, "loss": 0.0769, "grad_norm": 22.280393600463867, "learning_rate": 9.030303030303031e-06, "num_tokens": 644240.0, "completions/mean_length": 34.75, "completions/min_length": 30.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.75, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6890154480934143, "rewards/meter/std": 0.4056783616542816, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8612500429153442, "rewards/judge_quality/std": 0.16617010533809662, "rewards/repeat_penalty/mean": 0.9721575379371643, "rewards/repeat_penalty/std": 0.044762156903743744, "rewards/near_duplicate_penalty/mean": 0.9817650318145752, "rewards/near_duplicate_penalty/std": 0.023463450372219086, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.5973183512687683, "rewards/total_composite/std": 0.4225291311740875, "reward": 0.5973183512687683, "reward_std": 0.42252910137176514, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.185963436961174, "sampling/sampling_logp_difference/max": 2.1489572525024414, "sampling/importance_sampling_ratio/min": 0.11660567671060562, "sampling/importance_sampling_ratio/mean": 1.0001929998397827, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2793263271450996, "clip_ratio/low_mean": 0.07067149505019188, "clip_ratio/low_min": 0.07067149505019188, "clip_ratio/high_mean": 0.15500398725271225, "clip_ratio/high_max": 0.15500398725271225, "clip_ratio/region_mean": 0.22567548230290413, "reward_total_mean": 0.5973183512687683, "reward_meter_mean": 0.6890154480934143, "reward_meter_std": 0.4056783616542816, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9721575379371643, "reward_repeat_penalty_std": 0.044762156903743744, "reward_near_duplicate_penalty_mean": 0.9817650318145752, "reward_near_duplicate_penalty_std": 0.023463450372219086, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.8612500429153442, "reward_judge_quality_std": 0.16617010533809662, "reward_total_composite_mean": 0.5973183512687683, "reward_total_composite_std": 0.4225291311740875} {"timestamp_utc": "2026-04-12T11:58:33Z", "mode": "train", "global_step": 322, "epoch": 0.01293328513475519, "loss": 0.0675, "grad_norm": 8.970571517944336, "learning_rate": 9.027272727272728e-06, "num_tokens": 646945.0, "completions/mean_length": 147.125, "completions/min_length": 120.0, "completions/max_length": 162.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 147.125, "completions/min_terminated_length": 120.0, "completions/max_terminated_length": 162.0, "rewards/meter/mean": 0.8744029402732849, "rewards/meter/std": 0.21563386917114258, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.7203657627105713, "rewards/repeat_penalty/std": 0.231900155544281, "rewards/near_duplicate_penalty/mean": 0.9471039772033691, "rewards/near_duplicate_penalty/std": 0.045894794166088104, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.7840245962142944, "rewards/distinct_2/std": 0.19440589845180511, "rewards/total_composite/mean": 0.31651216745376587, "rewards/total_composite/std": 0.08478568494319916, "reward": 0.31651216745376587, "reward_std": 0.08478567749261856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15659639239311218, "sampling/sampling_logp_difference/max": 2.8806912899017334, "sampling/importance_sampling_ratio/min": 0.056095968931913376, "sampling/importance_sampling_ratio/mean": 1.0231878757476807, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2355171293020248, "clip_ratio/low_mean": 0.043371642008423805, "clip_ratio/low_min": 0.043371642008423805, "clip_ratio/high_mean": 0.10302290134131908, "clip_ratio/high_max": 0.10302290134131908, "clip_ratio/region_mean": 0.1463945433497429, "reward_total_mean": 0.31651216745376587, "reward_meter_mean": 0.8744029402732849, "reward_meter_std": 0.21563386917114258, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7203657627105713, "reward_repeat_penalty_std": 0.231900155544281, "reward_near_duplicate_penalty_mean": 0.9471039772033691, "reward_near_duplicate_penalty_std": 0.045894794166088104, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.7840245962142944, "reward_distinct_2_std": 0.19440589845180511, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.31651216745376587, "reward_total_composite_std": 0.08478568494319916} {"timestamp_utc": "2026-04-12T11:58:43Z", "mode": "train", "global_step": 323, "epoch": 0.012973450616540145, "loss": 0.0283, "grad_norm": 14.265707969665527, "learning_rate": 9.024242424242426e-06, "num_tokens": 648538.0, "completions/mean_length": 46.125, "completions/min_length": 34.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.9333639144897461, "rewards/meter/std": 0.08309081941843033, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9833590984344482, "rewards/lexical_plausibility/std": 0.04706747457385063, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.9403373003005981, "rewards/repeat_penalty/std": 0.11561089009046555, "rewards/near_duplicate_penalty/mean": 0.9874398112297058, "rewards/near_duplicate_penalty/std": 0.013963574543595314, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9801586866378784, "rewards/distinct_2/std": 0.036883533000946045, "rewards/total_composite/mean": 0.6683478355407715, "rewards/total_composite/std": 0.3816838264465332, "reward": 0.6683478355407715, "reward_std": 0.3816838264465332, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16488775610923767, "sampling/sampling_logp_difference/max": 1.1753854751586914, "sampling/importance_sampling_ratio/min": 0.30869996547698975, "sampling/importance_sampling_ratio/mean": 1.0082929134368896, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1936316415667534, "clip_ratio/low_mean": 0.04910714365541935, "clip_ratio/low_min": 0.04910714365541935, "clip_ratio/high_mean": 0.13271064218133688, "clip_ratio/high_max": 0.13271064218133688, "clip_ratio/region_mean": 0.18181778583675623, "reward_total_mean": 0.6683478355407715, "reward_meter_mean": 0.9333639144897461, "reward_meter_std": 0.08309081941843033, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9833590984344482, "reward_lexical_plausibility_std": 0.04706747457385063, "reward_repeat_penalty_mean": 0.9403373003005981, "reward_repeat_penalty_std": 0.11561089009046555, "reward_near_duplicate_penalty_mean": 0.9874398112297058, "reward_near_duplicate_penalty_std": 0.013963574543595314, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9801586866378784, "reward_distinct_2_std": 0.036883533000946045, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.6683478355407715, "reward_total_composite_std": 0.3816838264465332} {"timestamp_utc": "2026-04-12T11:58:52Z", "mode": "train", "global_step": 324, "epoch": 0.0130136160983251, "loss": 0.1003, "grad_norm": 14.50818920135498, "learning_rate": 9.021212121212121e-06, "num_tokens": 650250.0, "completions/mean_length": 43.0, "completions/min_length": 37.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.8761793971061707, "rewards/meter/std": 0.18905195593833923, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5799999833106995, "rewards/judge_quality/std": 0.3062678575515747, "rewards/repeat_penalty/mean": 0.8346422910690308, "rewards/repeat_penalty/std": 0.20036998391151428, "rewards/near_duplicate_penalty/mean": 0.9579204320907593, "rewards/near_duplicate_penalty/std": 0.03285416588187218, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9467199444770813, "rewards/distinct_2/std": 0.07356218248605728, "rewards/total_composite/mean": 0.5224690437316895, "rewards/total_composite/std": 0.3168891966342926, "reward": 0.5224690437316895, "reward_std": 0.3168891668319702, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17705819010734558, "sampling/sampling_logp_difference/max": 1.4733824729919434, "sampling/importance_sampling_ratio/min": 0.22914908826351166, "sampling/importance_sampling_ratio/mean": 1.0063377618789673, "sampling/importance_sampling_ratio/max": 1.7909523248672485, "entropy": 1.6156812906265259, "clip_ratio/low_mean": 0.09179666079580784, "clip_ratio/low_min": 0.09179666079580784, "clip_ratio/high_mean": 0.06638756021857262, "clip_ratio/high_max": 0.06638756021857262, "clip_ratio/region_mean": 0.15818422101438046, "reward_total_mean": 0.5224690437316895, "reward_meter_mean": 0.8761793971061707, "reward_meter_std": 0.18905195593833923, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8346422910690308, "reward_repeat_penalty_std": 0.20036998391151428, "reward_near_duplicate_penalty_mean": 0.9579204320907593, "reward_near_duplicate_penalty_std": 0.03285416588187218, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9467199444770813, "reward_distinct_2_std": 0.07356218248605728, "reward_judge_quality_mean": 0.5799999833106995, "reward_judge_quality_std": 0.3062678575515747, "reward_total_composite_mean": 0.5224690437316895, "reward_total_composite_std": 0.3168891966342926} {"timestamp_utc": "2026-04-12T11:59:01Z", "mode": "train", "global_step": 325, "epoch": 0.013053781580110054, "loss": 0.1397, "grad_norm": 19.418914794921875, "learning_rate": 9.01818181818182e-06, "num_tokens": 651765.0, "completions/mean_length": 31.375, "completions/min_length": 26.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.375, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.5477038025856018, "rewards/meter/std": 0.3923529386520386, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9723190069198608, "rewards/lexical_plausibility/std": 0.053679849952459335, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.2620250880718231, "rewards/repeat_penalty/mean": 0.9527176022529602, "rewards/repeat_penalty/std": 0.07624279707670212, "rewards/near_duplicate_penalty/mean": 0.9670435190200806, "rewards/near_duplicate_penalty/std": 0.042158085852861404, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.2920708656311035, "rewards/total_composite/std": 0.2732466459274292, "reward": 0.2920708656311035, "reward_std": 0.2732466459274292, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1905587911605835, "sampling/sampling_logp_difference/max": 1.7138128280639648, "sampling/importance_sampling_ratio/min": 0.1857045441865921, "sampling/importance_sampling_ratio/mean": 0.9981018900871277, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0238747745752335, "clip_ratio/low_mean": 0.0926959328353405, "clip_ratio/low_min": 0.0926959328353405, "clip_ratio/high_mean": 0.10422523971647024, "clip_ratio/high_max": 0.10422523971647024, "clip_ratio/region_mean": 0.19692117255181074, "reward_total_mean": 0.2920708656311035, "reward_meter_mean": 0.5477038025856018, "reward_meter_std": 0.3923529386520386, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9723190069198608, "reward_lexical_plausibility_std": 0.053679849952459335, "reward_repeat_penalty_mean": 0.9527176022529602, "reward_repeat_penalty_std": 0.07624279707670212, "reward_near_duplicate_penalty_mean": 0.9670435190200806, "reward_near_duplicate_penalty_std": 0.042158085852861404, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.2620250880718231, "reward_total_composite_mean": 0.2920708656311035, "reward_total_composite_std": 0.2732466459274292} {"timestamp_utc": "2026-04-12T11:59:12Z", "mode": "train", "global_step": 326, "epoch": 0.013093947061895008, "loss": 0.0514, "grad_norm": 11.1260347366333, "learning_rate": 9.015151515151516e-06, "num_tokens": 654269.0, "completions/mean_length": 106.0, "completions/min_length": 97.0, "completions/max_length": 117.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.0, "completions/min_terminated_length": 97.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.7726120948791504, "rewards/meter/std": 0.20258751511573792, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45375001430511475, "rewards/judge_quality/std": 0.2017025649547577, "rewards/repeat_penalty/mean": 0.9547241926193237, "rewards/repeat_penalty/std": 0.04348671808838844, "rewards/near_duplicate_penalty/mean": 0.9809917211532593, "rewards/near_duplicate_penalty/std": 0.014647293835878372, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9729844331741333, "rewards/distinct_2/std": 0.03536618500947952, "rewards/total_composite/mean": 0.3555184602737427, "rewards/total_composite/std": 0.2539959251880646, "reward": 0.3555184602737427, "reward_std": 0.25399595499038696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17879047989845276, "sampling/sampling_logp_difference/max": 1.7244796752929688, "sampling/importance_sampling_ratio/min": 0.178265780210495, "sampling/importance_sampling_ratio/mean": 1.0196211338043213, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2573939859867096, "clip_ratio/low_mean": 0.07513099908828735, "clip_ratio/low_min": 0.07513099908828735, "clip_ratio/high_mean": 0.08608340192586184, "clip_ratio/high_max": 0.08608340192586184, "clip_ratio/region_mean": 0.1612144010141492, "reward_total_mean": 0.3555184602737427, "reward_meter_mean": 0.7726120948791504, "reward_meter_std": 0.20258751511573792, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9547241926193237, "reward_repeat_penalty_std": 0.04348671808838844, "reward_near_duplicate_penalty_mean": 0.9809917211532593, "reward_near_duplicate_penalty_std": 0.014647293835878372, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9729844331741333, "reward_distinct_2_std": 0.03536618500947952, "reward_judge_quality_mean": 0.45375001430511475, "reward_judge_quality_std": 0.2017025649547577, "reward_total_composite_mean": 0.3555184602737427, "reward_total_composite_std": 0.2539959251880646} {"timestamp_utc": "2026-04-12T11:59:23Z", "mode": "train", "global_step": 327, "epoch": 0.013134112543679962, "loss": 0.0412, "grad_norm": 10.849813461303711, "learning_rate": 9.012121212121213e-06, "num_tokens": 656438.0, "completions/mean_length": 86.125, "completions/min_length": 70.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.125, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.46337997913360596, "rewards/meter/std": 0.41804268956184387, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9759442806243896, "rewards/lexical_plausibility/std": 0.06393492966890335, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9893356561660767, "rewards/repeat_penalty/std": 0.009329397231340408, "rewards/near_duplicate_penalty/mean": 0.9893356561660767, "rewards/near_duplicate_penalty/std": 0.009329397231340408, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18874692916870117, "rewards/total_composite/std": 0.20599262416362762, "reward": 0.18874692916870117, "reward_std": 0.20599260926246643, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19893057644367218, "sampling/sampling_logp_difference/max": 2.3641104698181152, "sampling/importance_sampling_ratio/min": 0.0940329059958458, "sampling/importance_sampling_ratio/mean": 1.0144124031066895, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7814104706048965, "clip_ratio/low_mean": 0.10946587286889553, "clip_ratio/low_min": 0.10946587286889553, "clip_ratio/high_mean": 0.06408843956887722, "clip_ratio/high_max": 0.06408843956887722, "clip_ratio/region_mean": 0.17355431243777275, "reward_total_mean": 0.18874692916870117, "reward_meter_mean": 0.46337997913360596, "reward_meter_std": 0.41804268956184387, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9759442806243896, "reward_lexical_plausibility_std": 0.06393492966890335, "reward_repeat_penalty_mean": 0.9893356561660767, "reward_repeat_penalty_std": 0.009329397231340408, "reward_near_duplicate_penalty_mean": 0.9893356561660767, "reward_near_duplicate_penalty_std": 0.009329397231340408, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.18874692916870117, "reward_total_composite_std": 0.20599262416362762} {"timestamp_utc": "2026-04-12T11:59:32Z", "mode": "train", "global_step": 328, "epoch": 0.013174278025464916, "loss": 0.0357, "grad_norm": 15.33153247833252, "learning_rate": 9.00909090909091e-06, "num_tokens": 658067.0, "completions/mean_length": 42.625, "completions/min_length": 39.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.625, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.8394543528556824, "rewards/meter/std": 0.18441522121429443, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9975490570068359, "rewards/lexical_plausibility/std": 0.006932419259101152, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.2826785147190094, "rewards/repeat_penalty/mean": 0.9824215173721313, "rewards/repeat_penalty/std": 0.038053613156080246, "rewards/near_duplicate_penalty/mean": 0.99280846118927, "rewards/near_duplicate_penalty/std": 0.009808567352592945, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.5059125423431396, "rewards/total_composite/std": 0.2705124616622925, "reward": 0.5059125423431396, "reward_std": 0.2705124318599701, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20159591734409332, "sampling/sampling_logp_difference/max": 2.097471237182617, "sampling/importance_sampling_ratio/min": 0.12276648730039597, "sampling/importance_sampling_ratio/mean": 1.0197023153305054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6125789731740952, "clip_ratio/low_mean": 0.08208791399374604, "clip_ratio/low_min": 0.08208791399374604, "clip_ratio/high_mean": 0.058680555783212185, "clip_ratio/high_max": 0.058680555783212185, "clip_ratio/region_mean": 0.14076846977695823, "reward_total_mean": 0.5059125423431396, "reward_meter_mean": 0.8394543528556824, "reward_meter_std": 0.18441522121429443, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9975490570068359, "reward_lexical_plausibility_std": 0.006932419259101152, "reward_repeat_penalty_mean": 0.9824215173721313, "reward_repeat_penalty_std": 0.038053613156080246, "reward_near_duplicate_penalty_mean": 0.99280846118927, "reward_near_duplicate_penalty_std": 0.009808567352592945, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.2826785147190094, "reward_total_composite_mean": 0.5059125423431396, "reward_total_composite_std": 0.2705124616622925} {"timestamp_utc": "2026-04-12T11:59:48Z", "mode": "train", "global_step": 329, "epoch": 0.01321444350724987, "loss": -0.0013, "grad_norm": 20.749210357666016, "learning_rate": 9.006060606060607e-06, "num_tokens": 659889.0, "completions/mean_length": 53.75, "completions/min_length": 42.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.75, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.7675898671150208, "rewards/meter/std": 0.28336668014526367, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9789375066757202, "rewards/repeat_penalty/std": 0.025010893121361732, "rewards/near_duplicate_penalty/mean": 0.9855164885520935, "rewards/near_duplicate_penalty/std": 0.01945226453244686, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.32441213726997375, "rewards/total_composite/std": 0.19854216277599335, "reward": 0.32441213726997375, "reward_std": 0.19854217767715454, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19944681227207184, "sampling/sampling_logp_difference/max": 2.3446524143218994, "sampling/importance_sampling_ratio/min": 0.09588052332401276, "sampling/importance_sampling_ratio/mean": 1.0091361999511719, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.358233705163002, "clip_ratio/low_mean": 0.05262103583663702, "clip_ratio/low_min": 0.05262103583663702, "clip_ratio/high_mean": 0.1366305872797966, "clip_ratio/high_max": 0.1366305872797966, "clip_ratio/region_mean": 0.18925162311643362, "reward_total_mean": 0.32441213726997375, "reward_meter_mean": 0.7675898671150208, "reward_meter_std": 0.28336668014526367, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9789375066757202, "reward_repeat_penalty_std": 0.025010893121361732, "reward_near_duplicate_penalty_mean": 0.9855164885520935, "reward_near_duplicate_penalty_std": 0.01945226453244686, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.32441213726997375, "reward_total_composite_std": 0.19854216277599335} {"timestamp_utc": "2026-04-12T11:59:56Z", "mode": "train", "global_step": 330, "epoch": 0.013254608989034824, "loss": 0.0453, "grad_norm": 30.89763641357422, "learning_rate": 9.003030303030303e-06, "num_tokens": 661208.0, "completions/mean_length": 20.875, "completions/min_length": 16.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.5376095771789551, "rewards/meter/std": 0.46839410066604614, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9678649306297302, "rewards/lexical_plausibility/std": 0.0832521840929985, "rewards/judge_quality/mean": 0.856249988079071, "rewards/judge_quality/std": 0.20500436425209045, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4762023091316223, "rewards/total_composite/std": 0.45164650678634644, "reward": 0.4762023091316223, "reward_std": 0.4516465365886688, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18910905718803406, "sampling/sampling_logp_difference/max": 1.443068265914917, "sampling/importance_sampling_ratio/min": 0.2362019270658493, "sampling/importance_sampling_ratio/mean": 1.0119171142578125, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0632958114147186, "clip_ratio/low_mean": 0.0888278391212225, "clip_ratio/low_min": 0.0888278391212225, "clip_ratio/high_mean": 0.08376920688897371, "clip_ratio/high_max": 0.08376920688897371, "clip_ratio/region_mean": 0.1725970460101962, "reward_total_mean": 0.4762023091316223, "reward_meter_mean": 0.5376095771789551, "reward_meter_std": 0.46839410066604614, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9678649306297302, "reward_lexical_plausibility_std": 0.0832521840929985, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.856249988079071, "reward_judge_quality_std": 0.20500436425209045, "reward_total_composite_mean": 0.4762023091316223, "reward_total_composite_std": 0.45164650678634644} {"timestamp_utc": "2026-04-12T12:00:05Z", "mode": "train", "global_step": 331, "epoch": 0.013294774470819778, "loss": 0.0328, "grad_norm": 14.322080612182617, "learning_rate": 9e-06, "num_tokens": 662936.0, "completions/mean_length": 51.0, "completions/min_length": 45.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.0, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.9821078777313232, "rewards/meter/std": 0.007363711483776569, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6887500286102295, "rewards/judge_quality/std": 0.21931307017803192, "rewards/repeat_penalty/mean": 0.9847339987754822, "rewards/repeat_penalty/std": 0.029361864551901817, "rewards/near_duplicate_penalty/mean": 0.9905010461807251, "rewards/near_duplicate_penalty/std": 0.013753361068665981, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.993990421295166, "rewards/distinct_2/std": 0.01699776202440262, "rewards/total_composite/mean": 0.6761473417282104, "rewards/total_composite/std": 0.21439439058303833, "reward": 0.6761473417282104, "reward_std": 0.21439439058303833, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17805902659893036, "sampling/sampling_logp_difference/max": 1.5896856784820557, "sampling/importance_sampling_ratio/min": 0.20398969948291779, "sampling/importance_sampling_ratio/mean": 0.988623857498169, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2775887846946716, "clip_ratio/low_mean": 0.07430227100849152, "clip_ratio/low_min": 0.07430227100849152, "clip_ratio/high_mean": 0.10629522148519754, "clip_ratio/high_max": 0.10629522148519754, "clip_ratio/region_mean": 0.18059749249368906, "reward_total_mean": 0.6761473417282104, "reward_meter_mean": 0.9821078777313232, "reward_meter_std": 0.007363711483776569, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9847339987754822, "reward_repeat_penalty_std": 0.029361864551901817, "reward_near_duplicate_penalty_mean": 0.9905010461807251, "reward_near_duplicate_penalty_std": 0.013753361068665981, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.993990421295166, "reward_distinct_2_std": 0.01699776202440262, "reward_judge_quality_mean": 0.6887500286102295, "reward_judge_quality_std": 0.21931307017803192, "reward_total_composite_mean": 0.6761473417282104, "reward_total_composite_std": 0.21439439058303833} {"timestamp_utc": "2026-04-12T12:00:17Z", "mode": "train", "global_step": 332, "epoch": 0.013334939952604732, "loss": 0.0437, "grad_norm": 7.670846939086914, "learning_rate": 8.996969696969697e-06, "num_tokens": 665598.0, "completions/mean_length": 142.75, "completions/min_length": 125.0, "completions/max_length": 170.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.75, "completions/min_terminated_length": 125.0, "completions/max_terminated_length": 170.0, "rewards/meter/mean": 0.9802846908569336, "rewards/meter/std": 0.014032049104571342, "rewards/count_adherence/mean": 0.9642857313156128, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.6013822555541992, "rewards/repeat_penalty/std": 0.3235849440097809, "rewards/near_duplicate_penalty/mean": 0.8782009482383728, "rewards/near_duplicate_penalty/std": 0.10271628946065903, "rewards/opening_diversity/mean": 0.91796875, "rewards/opening_diversity/std": 0.09048737585544586, "rewards/distinct_2/mean": 0.7143831253051758, "rewards/distinct_2/std": 0.25908181071281433, "rewards/total_composite/mean": 0.33073657751083374, "rewards/total_composite/std": 0.09400331228971481, "reward": 0.33073657751083374, "reward_std": 0.09400329738855362, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16719898581504822, "sampling/sampling_logp_difference/max": 1.2782707214355469, "sampling/importance_sampling_ratio/min": 0.27851852774620056, "sampling/importance_sampling_ratio/mean": 1.027553677558899, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9752332866191864, "clip_ratio/low_mean": 0.04905758146196604, "clip_ratio/low_min": 0.04905758146196604, "clip_ratio/high_mean": 0.09387998469173908, "clip_ratio/high_max": 0.09387998469173908, "clip_ratio/region_mean": 0.14293756615370512, "reward_total_mean": 0.33073657751083374, "reward_meter_mean": 0.9802846908569336, "reward_meter_std": 0.014032049104571342, "reward_count_adherence_mean": 0.9642857313156128, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6013822555541992, "reward_repeat_penalty_std": 0.3235849440097809, "reward_near_duplicate_penalty_mean": 0.8782009482383728, "reward_near_duplicate_penalty_std": 0.10271628946065903, "reward_opening_diversity_mean": 0.91796875, "reward_opening_diversity_std": 0.09048737585544586, "reward_distinct_2_mean": 0.7143831253051758, "reward_distinct_2_std": 0.25908181071281433, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.33073657751083374, "reward_total_composite_std": 0.09400331228971481} {"timestamp_utc": "2026-04-12T12:00:26Z", "mode": "train", "global_step": 333, "epoch": 0.013375105434389686, "loss": 0.1484, "grad_norm": 13.981661796569824, "learning_rate": 8.993939393939395e-06, "num_tokens": 667304.0, "completions/mean_length": 47.25, "completions/min_length": 35.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.9113978147506714, "rewards/meter/std": 0.20103241503238678, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.7387499809265137, "rewards/judge_quality/std": 0.2687770128250122, "rewards/repeat_penalty/mean": 0.9563689231872559, "rewards/repeat_penalty/std": 0.041896235197782516, "rewards/near_duplicate_penalty/mean": 0.9773430824279785, "rewards/near_duplicate_penalty/std": 0.017977163195610046, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9785662889480591, "rewards/distinct_2/std": 0.03976903110742569, "rewards/total_composite/mean": 0.635800838470459, "rewards/total_composite/std": 0.30263829231262207, "reward": 0.635800838470459, "reward_std": 0.30263829231262207, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14866073429584503, "sampling/sampling_logp_difference/max": 1.5793867111206055, "sampling/importance_sampling_ratio/min": 0.2061014622449875, "sampling/importance_sampling_ratio/mean": 1.0088062286376953, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1610790491104126, "clip_ratio/low_mean": 0.06341799814254045, "clip_ratio/low_min": 0.06341799814254045, "clip_ratio/high_mean": 0.06228313175961375, "clip_ratio/high_max": 0.06228313175961375, "clip_ratio/region_mean": 0.1257011299021542, "reward_total_mean": 0.635800838470459, "reward_meter_mean": 0.9113978147506714, "reward_meter_std": 0.20103241503238678, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9563689231872559, "reward_repeat_penalty_std": 0.041896235197782516, "reward_near_duplicate_penalty_mean": 0.9773430824279785, "reward_near_duplicate_penalty_std": 0.017977163195610046, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9785662889480591, "reward_distinct_2_std": 0.03976903110742569, "reward_judge_quality_mean": 0.7387499809265137, "reward_judge_quality_std": 0.2687770128250122, "reward_total_composite_mean": 0.635800838470459, "reward_total_composite_std": 0.30263829231262207} {"timestamp_utc": "2026-04-12T12:00:44Z", "mode": "train", "global_step": 334, "epoch": 0.01341527091617464, "loss": -0.1468, "grad_norm": 4.256762981414795, "learning_rate": 8.990909090909092e-06, "num_tokens": 670580.0, "completions/mean_length": 249.5, "completions/min_length": 194.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 212.00001525878906, "completions/min_terminated_length": 194.0, "completions/max_terminated_length": 249.0, "rewards/meter/mean": 0.8910650014877319, "rewards/meter/std": 0.2547892928123474, "rewards/count_adherence/mean": 0.8624999523162842, "rewards/count_adherence/std": 0.07440237700939178, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9741270542144775, "rewards/lexical_plausibility/std": 0.07317972183227539, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.7558687329292297, "rewards/repeat_penalty/std": 0.299955278635025, "rewards/near_duplicate_penalty/mean": 0.9519389867782593, "rewards/near_duplicate_penalty/std": 0.05630122125148773, "rewards/opening_diversity/mean": 0.9261363744735718, "rewards/opening_diversity/std": 0.20891793072223663, "rewards/distinct_2/mean": 0.8294985294342041, "rewards/distinct_2/std": 0.19569948315620422, "rewards/total_composite/mean": 0.2373369038105011, "rewards/total_composite/std": 0.13343991339206696, "reward": 0.2373369038105011, "reward_std": 0.13343991339206696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18489407002925873, "sampling/sampling_logp_difference/max": 1.5506134033203125, "sampling/importance_sampling_ratio/min": 0.21211782097816467, "sampling/importance_sampling_ratio/mean": 1.037339687347412, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7812134623527527, "clip_ratio/low_mean": 0.03522298112511635, "clip_ratio/low_min": 0.03522298112511635, "clip_ratio/high_mean": 0.09229760803282261, "clip_ratio/high_max": 0.09229760803282261, "clip_ratio/region_mean": 0.12752058915793896, "reward_total_mean": 0.2373369038105011, "reward_meter_mean": 0.8910650014877319, "reward_meter_std": 0.2547892928123474, "reward_count_adherence_mean": 0.8624999523162842, "reward_count_adherence_std": 0.07440237700939178, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9741270542144775, "reward_lexical_plausibility_std": 0.07317972183227539, "reward_repeat_penalty_mean": 0.7558687329292297, "reward_repeat_penalty_std": 0.299955278635025, "reward_near_duplicate_penalty_mean": 0.9519389867782593, "reward_near_duplicate_penalty_std": 0.05630122125148773, "reward_opening_diversity_mean": 0.9261363744735718, "reward_opening_diversity_std": 0.20891793072223663, "reward_distinct_2_mean": 0.8294985294342041, "reward_distinct_2_std": 0.19569948315620422, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.2373369038105011, "reward_total_composite_std": 0.13343991339206696} {"timestamp_utc": "2026-04-12T12:00:55Z", "mode": "train", "global_step": 335, "epoch": 0.013455436397959594, "loss": -0.03, "grad_norm": 20.10825538635254, "learning_rate": 8.98787878787879e-06, "num_tokens": 672044.0, "completions/mean_length": 23.0, "completions/min_length": 16.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.5148899555206299, "rewards/meter/std": 0.41198641061782837, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.7461690902709961, "rewards/lexical_plausibility/std": 0.26617443561553955, "rewards/judge_quality/mean": 0.7300000190734863, "rewards/judge_quality/std": 0.3899816870689392, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.40092235803604126, "rewards/total_composite/std": 0.382964164018631, "reward": 0.40092235803604126, "reward_std": 0.3829641342163086, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.190692737698555, "sampling/sampling_logp_difference/max": 1.3405847549438477, "sampling/importance_sampling_ratio/min": 0.261692613363266, "sampling/importance_sampling_ratio/mean": 1.0392323732376099, "sampling/importance_sampling_ratio/max": 1.9872056245803833, "entropy": 2.044335350394249, "clip_ratio/low_mean": 0.09232696797698736, "clip_ratio/low_min": 0.09232696797698736, "clip_ratio/high_mean": 0.07881728745996952, "clip_ratio/high_max": 0.07881728745996952, "clip_ratio/region_mean": 0.17114425543695688, "reward_total_mean": 0.40092235803604126, "reward_meter_mean": 0.5148899555206299, "reward_meter_std": 0.41198641061782837, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.7461690902709961, "reward_lexical_plausibility_std": 0.26617443561553955, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7300000190734863, "reward_judge_quality_std": 0.3899816870689392, "reward_total_composite_mean": 0.40092235803604126, "reward_total_composite_std": 0.382964164018631} {"timestamp_utc": "2026-04-12T12:01:07Z", "mode": "train", "global_step": 336, "epoch": 0.013495601879744547, "loss": 0.0497, "grad_norm": 11.71253490447998, "learning_rate": 8.984848484848485e-06, "num_tokens": 673663.0, "completions/mean_length": 38.375, "completions/min_length": 32.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.4177127480506897, "rewards/meter/std": 0.2962014079093933, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7975000143051147, "rewards/judge_quality/std": 0.2471408098936081, "rewards/repeat_penalty/mean": 0.965746283531189, "rewards/repeat_penalty/std": 0.09504672139883041, "rewards/near_duplicate_penalty/mean": 0.9845749139785767, "rewards/near_duplicate_penalty/std": 0.041808515787124634, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.31122303009033203, "rewards/total_composite/std": 0.23601660132408142, "reward": 0.31122303009033203, "reward_std": 0.23601660132408142, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15965794026851654, "sampling/sampling_logp_difference/max": 1.514892578125, "sampling/importance_sampling_ratio/min": 0.21983179450035095, "sampling/importance_sampling_ratio/mean": 1.0127167701721191, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7997074276208878, "clip_ratio/low_mean": 0.08659902401268482, "clip_ratio/low_min": 0.08659902401268482, "clip_ratio/high_mean": 0.05541834328323603, "clip_ratio/high_max": 0.05541834328323603, "clip_ratio/region_mean": 0.14201736729592085, "reward_total_mean": 0.31122303009033203, "reward_meter_mean": 0.4177127480506897, "reward_meter_std": 0.2962014079093933, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.965746283531189, "reward_repeat_penalty_std": 0.09504672139883041, "reward_near_duplicate_penalty_mean": 0.9845749139785767, "reward_near_duplicate_penalty_std": 0.041808515787124634, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.7975000143051147, "reward_judge_quality_std": 0.2471408098936081, "reward_total_composite_mean": 0.31122303009033203, "reward_total_composite_std": 0.23601660132408142} {"timestamp_utc": "2026-04-12T12:01:17Z", "mode": "train", "global_step": 337, "epoch": 0.013535767361529501, "loss": 0.1152, "grad_norm": 16.95784568786621, "learning_rate": 8.981818181818182e-06, "num_tokens": 675144.0, "completions/mean_length": 35.125, "completions/min_length": 28.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.49531427025794983, "rewards/meter/std": 0.41725823283195496, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637499690055847, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9841508865356445, "rewards/repeat_penalty/std": 0.019338395446538925, "rewards/near_duplicate_penalty/mean": 0.9841508865356445, "rewards/near_duplicate_penalty/std": 0.019338395446538925, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3064648509025574, "rewards/total_composite/std": 0.3691054582595825, "reward": 0.3064648509025574, "reward_std": 0.3691054582595825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19438858330249786, "sampling/sampling_logp_difference/max": 2.089127540588379, "sampling/importance_sampling_ratio/min": 0.12379509955644608, "sampling/importance_sampling_ratio/mean": 0.991215705871582, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0955918431282043, "clip_ratio/low_mean": 0.12712144292891026, "clip_ratio/low_min": 0.12712144292891026, "clip_ratio/high_mean": 0.04520089365541935, "clip_ratio/high_max": 0.04520089365541935, "clip_ratio/region_mean": 0.1723223365843296, "reward_total_mean": 0.3064648509025574, "reward_meter_mean": 0.49531427025794983, "reward_meter_std": 0.41725823283195496, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9841508865356445, "reward_repeat_penalty_std": 0.019338395446538925, "reward_near_duplicate_penalty_mean": 0.9841508865356445, "reward_near_duplicate_penalty_std": 0.019338395446538925, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637499690055847, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.3064648509025574, "reward_total_composite_std": 0.3691054582595825} {"timestamp_utc": "2026-04-12T12:01:26Z", "mode": "train", "global_step": 338, "epoch": 0.013575932843314455, "loss": -0.0405, "grad_norm": 16.093406677246094, "learning_rate": 8.97878787878788e-06, "num_tokens": 676659.0, "completions/mean_length": 35.375, "completions/min_length": 30.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.8954558372497559, "rewards/meter/std": 0.23072436451911926, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.8931442499160767, "rewards/repeat_penalty/std": 0.15029844641685486, "rewards/near_duplicate_penalty/mean": 0.9661966562271118, "rewards/near_duplicate_penalty/std": 0.038574304431676865, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9477058053016663, "rewards/distinct_2/std": 0.07641414552927017, "rewards/total_composite/mean": 0.6326240301132202, "rewards/total_composite/std": 0.30069440603256226, "reward": 0.6326240301132202, "reward_std": 0.30069440603256226, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1786806881427765, "sampling/sampling_logp_difference/max": 1.7570123672485352, "sampling/importance_sampling_ratio/min": 0.17255963385105133, "sampling/importance_sampling_ratio/mean": 1.0094597339630127, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.328508049249649, "clip_ratio/low_mean": 0.08336466364562511, "clip_ratio/low_min": 0.08336466364562511, "clip_ratio/high_mean": 0.12179983593523502, "clip_ratio/high_max": 0.12179983593523502, "clip_ratio/region_mean": 0.20516449958086014, "reward_total_mean": 0.6326240301132202, "reward_meter_mean": 0.8954558372497559, "reward_meter_std": 0.23072436451911926, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8931442499160767, "reward_repeat_penalty_std": 0.15029844641685486, "reward_near_duplicate_penalty_mean": 0.9661966562271118, "reward_near_duplicate_penalty_std": 0.038574304431676865, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9477058053016663, "reward_distinct_2_std": 0.07641414552927017, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.6326240301132202, "reward_total_composite_std": 0.30069440603256226} {"timestamp_utc": "2026-04-12T12:01:36Z", "mode": "train", "global_step": 339, "epoch": 0.01361609832509941, "loss": -0.0032, "grad_norm": 8.856263160705566, "learning_rate": 8.975757575757577e-06, "num_tokens": 679299.0, "completions/mean_length": 127.0, "completions/min_length": 117.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.0, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.9636448621749878, "rewards/meter/std": 0.0717000663280487, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.4897316098213196, "rewards/repeat_penalty/std": 0.3254680037498474, "rewards/near_duplicate_penalty/mean": 0.8693605065345764, "rewards/near_duplicate_penalty/std": 0.0926419049501419, "rewards/opening_diversity/mean": 0.9603365659713745, "rewards/opening_diversity/std": 0.07561343163251877, "rewards/distinct_2/mean": 0.5852110385894775, "rewards/distinct_2/std": 0.2783803343772888, "rewards/total_composite/mean": 0.25445759296417236, "rewards/total_composite/std": 0.14898806810379028, "reward": 0.25445759296417236, "reward_std": 0.1489880532026291, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1530618965625763, "sampling/sampling_logp_difference/max": 1.951028823852539, "sampling/importance_sampling_ratio/min": 0.14212776720523834, "sampling/importance_sampling_ratio/mean": 1.027160406112671, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3738272562623024, "clip_ratio/low_mean": 0.04581594280898571, "clip_ratio/low_min": 0.04581594280898571, "clip_ratio/high_mean": 0.09792396426200867, "clip_ratio/high_max": 0.09792396426200867, "clip_ratio/region_mean": 0.14373990707099438, "reward_total_mean": 0.25445759296417236, "reward_meter_mean": 0.9636448621749878, "reward_meter_std": 0.0717000663280487, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4897316098213196, "reward_repeat_penalty_std": 0.3254680037498474, "reward_near_duplicate_penalty_mean": 0.8693605065345764, "reward_near_duplicate_penalty_std": 0.0926419049501419, "reward_opening_diversity_mean": 0.9603365659713745, "reward_opening_diversity_std": 0.07561343163251877, "reward_distinct_2_mean": 0.5852110385894775, "reward_distinct_2_std": 0.2783803343772888, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.25445759296417236, "reward_total_composite_std": 0.14898806810379028} {"timestamp_utc": "2026-04-12T12:01:48Z", "mode": "train", "global_step": 340, "epoch": 0.013656263806884363, "loss": 0.1851, "grad_norm": 10.916351318359375, "learning_rate": 8.972727272727272e-06, "num_tokens": 681516.0, "completions/mean_length": 96.125, "completions/min_length": 82.0, "completions/max_length": 139.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.125, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 139.0, "rewards/meter/mean": 0.8985081911087036, "rewards/meter/std": 0.16623960435390472, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.8063184022903442, "rewards/repeat_penalty/std": 0.28554925322532654, "rewards/near_duplicate_penalty/mean": 0.9560104608535767, "rewards/near_duplicate_penalty/std": 0.04691820591688156, "rewards/opening_diversity/mean": 0.949999988079071, "rewards/opening_diversity/std": 0.1414213478565216, "rewards/distinct_2/mean": 0.8740012049674988, "rewards/distinct_2/std": 0.20042245090007782, "rewards/total_composite/mean": 0.3324708938598633, "rewards/total_composite/std": 0.1486913114786148, "reward": 0.3324708938598633, "reward_std": 0.1486913114786148, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19740067422389984, "sampling/sampling_logp_difference/max": 1.6764140129089355, "sampling/importance_sampling_ratio/min": 0.18704351782798767, "sampling/importance_sampling_ratio/mean": 1.018814206123352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8450011909008026, "clip_ratio/low_mean": 0.055041538551449776, "clip_ratio/low_min": 0.055041538551449776, "clip_ratio/high_mean": 0.15035482496023178, "clip_ratio/high_max": 0.15035482496023178, "clip_ratio/region_mean": 0.20539636351168156, "reward_total_mean": 0.3324708938598633, "reward_meter_mean": 0.8985081911087036, "reward_meter_std": 0.16623960435390472, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8063184022903442, "reward_repeat_penalty_std": 0.28554925322532654, "reward_near_duplicate_penalty_mean": 0.9560104608535767, "reward_near_duplicate_penalty_std": 0.04691820591688156, "reward_opening_diversity_mean": 0.949999988079071, "reward_opening_diversity_std": 0.1414213478565216, "reward_distinct_2_mean": 0.8740012049674988, "reward_distinct_2_std": 0.20042245090007782, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.3324708938598633, "reward_total_composite_std": 0.1486913114786148} {"timestamp_utc": "2026-04-12T12:02:05Z", "mode": "train", "global_step": 341, "epoch": 0.013696429288669317, "loss": -0.1113, "grad_norm": 3.631061315536499, "learning_rate": 8.969696969696971e-06, "num_tokens": 685947.0, "completions/mean_length": 359.875, "completions/min_length": 280.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 338.14288330078125, "completions/min_terminated_length": 280.0, "completions/max_terminated_length": 415.0, "rewards/meter/mean": 0.7854980230331421, "rewards/meter/std": 0.36010047793388367, "rewards/count_adherence/mean": 0.7980769276618958, "rewards/count_adherence/std": 0.2134033739566803, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9390830993652344, "rewards/lexical_plausibility/std": 0.17229899764060974, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.13024701178073883, "rewards/repeat_penalty/mean": 0.3892909288406372, "rewards/repeat_penalty/std": 0.4289466440677643, "rewards/near_duplicate_penalty/mean": 0.7990989685058594, "rewards/near_duplicate_penalty/std": 0.19495080411434174, "rewards/opening_diversity/mean": 0.8870849013328552, "rewards/opening_diversity/std": 0.20291320979595184, "rewards/distinct_2/mean": 0.4373234510421753, "rewards/distinct_2/std": 0.424831748008728, "rewards/total_composite/mean": 0.11135604977607727, "rewards/total_composite/std": 0.10392560809850693, "reward": 0.11135604977607727, "reward_std": 0.10392560809850693, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10169584304094315, "sampling/sampling_logp_difference/max": 1.721909999847412, "sampling/importance_sampling_ratio/min": 0.178724467754364, "sampling/importance_sampling_ratio/mean": 1.0194363594055176, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9587608352303505, "clip_ratio/low_mean": 0.02962994109839201, "clip_ratio/low_min": 0.02962994109839201, "clip_ratio/high_mean": 0.059364788699895144, "clip_ratio/high_max": 0.059364788699895144, "clip_ratio/region_mean": 0.08899472979828715, "reward_total_mean": 0.11135604977607727, "reward_meter_mean": 0.7854980230331421, "reward_meter_std": 0.36010047793388367, "reward_count_adherence_mean": 0.7980769276618958, "reward_count_adherence_std": 0.2134033739566803, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9390830993652344, "reward_lexical_plausibility_std": 0.17229899764060974, "reward_repeat_penalty_mean": 0.3892909288406372, "reward_repeat_penalty_std": 0.4289466440677643, "reward_near_duplicate_penalty_mean": 0.7990989685058594, "reward_near_duplicate_penalty_std": 0.19495080411434174, "reward_opening_diversity_mean": 0.8870849013328552, "reward_opening_diversity_std": 0.20291320979595184, "reward_distinct_2_mean": 0.4373234510421753, "reward_distinct_2_std": 0.424831748008728, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.13024701178073883, "reward_total_composite_mean": 0.11135604977607727, "reward_total_composite_std": 0.10392560809850693} {"timestamp_utc": "2026-04-12T12:02:13Z", "mode": "train", "global_step": 342, "epoch": 0.013736594770454271, "loss": -0.0229, "grad_norm": 12.50191593170166, "learning_rate": 8.966666666666667e-06, "num_tokens": 687799.0, "completions/mean_length": 61.5, "completions/min_length": 46.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.5, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.29511725902557373, "rewards/meter/std": 0.3623807728290558, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977971315383911, "rewards/lexical_plausibility/std": 0.006230758503079414, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.9774243235588074, "rewards/repeat_penalty/std": 0.020903760567307472, "rewards/near_duplicate_penalty/mean": 0.9774243235588074, "rewards/near_duplicate_penalty/std": 0.020903760567307472, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14046093821525574, "rewards/total_composite/std": 0.13782621920108795, "reward": 0.14046093821525574, "reward_std": 0.13782620429992676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18585516512393951, "sampling/sampling_logp_difference/max": 1.7113144397735596, "sampling/importance_sampling_ratio/min": 0.1806282103061676, "sampling/importance_sampling_ratio/mean": 1.0404918193817139, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7546063512563705, "clip_ratio/low_mean": 0.10133026633411646, "clip_ratio/low_min": 0.10133026633411646, "clip_ratio/high_mean": 0.0722538661211729, "clip_ratio/high_max": 0.0722538661211729, "clip_ratio/region_mean": 0.17358413245528936, "reward_total_mean": 0.14046093821525574, "reward_meter_mean": 0.29511725902557373, "reward_meter_std": 0.3623807728290558, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9977971315383911, "reward_lexical_plausibility_std": 0.006230758503079414, "reward_repeat_penalty_mean": 0.9774243235588074, "reward_repeat_penalty_std": 0.020903760567307472, "reward_near_duplicate_penalty_mean": 0.9774243235588074, "reward_near_duplicate_penalty_std": 0.020903760567307472, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.14046093821525574, "reward_total_composite_std": 0.13782621920108795} {"timestamp_utc": "2026-04-12T12:02:27Z", "mode": "train", "global_step": 343, "epoch": 0.013776760252239225, "loss": -0.0237, "grad_norm": 5.930196762084961, "learning_rate": 8.963636363636364e-06, "num_tokens": 689356.0, "completions/mean_length": 96.625, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.28571701049805, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.3506585359573364, "rewards/meter/std": 0.4087865650653839, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9431853294372559, "rewards/lexical_plausibility/std": 0.1606961339712143, "rewards/judge_quality/mean": 0.3400000035762787, "rewards/judge_quality/std": 0.2768702805042267, "rewards/repeat_penalty/mean": 0.9897685647010803, "rewards/repeat_penalty/std": 0.014945391565561295, "rewards/near_duplicate_penalty/mean": 0.9897685647010803, "rewards/near_duplicate_penalty/std": 0.014945391565561295, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1779477298259735, "rewards/total_composite/std": 0.3148679733276367, "reward": 0.1779477298259735, "reward_std": 0.31486794352531433, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21920634806156158, "sampling/sampling_logp_difference/max": 1.681375503540039, "sampling/importance_sampling_ratio/min": 0.18611779808998108, "sampling/importance_sampling_ratio/mean": 1.0393905639648438, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.838468760251999, "clip_ratio/low_mean": 0.11618281900882721, "clip_ratio/low_min": 0.11618281900882721, "clip_ratio/high_mean": 0.0432076808065176, "clip_ratio/high_max": 0.0432076808065176, "clip_ratio/region_mean": 0.1593904998153448, "reward_total_mean": 0.1779477298259735, "reward_meter_mean": 0.3506585359573364, "reward_meter_std": 0.4087865650653839, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9431853294372559, "reward_lexical_plausibility_std": 0.1606961339712143, "reward_repeat_penalty_mean": 0.9897685647010803, "reward_repeat_penalty_std": 0.014945391565561295, "reward_near_duplicate_penalty_mean": 0.9897685647010803, "reward_near_duplicate_penalty_std": 0.014945391565561295, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3400000035762787, "reward_judge_quality_std": 0.2768702805042267, "reward_total_composite_mean": 0.1779477298259735, "reward_total_composite_std": 0.3148679733276367} {"timestamp_utc": "2026-04-12T12:02:35Z", "mode": "train", "global_step": 344, "epoch": 0.013816925734024179, "loss": 0.0856, "grad_norm": 28.26715087890625, "learning_rate": 8.960606060606061e-06, "num_tokens": 690706.0, "completions/mean_length": 22.75, "completions/min_length": 20.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.75, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.5608992576599121, "rewards/meter/std": 0.42065587639808655, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8341332674026489, "rewards/lexical_plausibility/std": 0.16632896661758423, "rewards/judge_quality/mean": 0.8350000381469727, "rewards/judge_quality/std": 0.27717968821525574, "rewards/repeat_penalty/mean": 0.7769063115119934, "rewards/repeat_penalty/std": 0.1433175951242447, "rewards/near_duplicate_penalty/mean": 0.952541708946228, "rewards/near_duplicate_penalty/std": 0.06054948642849922, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49674567580223083, "rewards/total_composite/std": 0.41812607645988464, "reward": 0.49674567580223083, "reward_std": 0.41812607645988464, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2103598564863205, "sampling/sampling_logp_difference/max": 1.5652546882629395, "sampling/importance_sampling_ratio/min": 0.2090347558259964, "sampling/importance_sampling_ratio/mean": 1.0092546939849854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.388786643743515, "clip_ratio/low_mean": 0.07365959882736206, "clip_ratio/low_min": 0.07365959882736206, "clip_ratio/high_mean": 0.09747023973613977, "clip_ratio/high_max": 0.09747023973613977, "clip_ratio/region_mean": 0.17112983856350183, "reward_total_mean": 0.49674567580223083, "reward_meter_mean": 0.5608992576599121, "reward_meter_std": 0.42065587639808655, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8341332674026489, "reward_lexical_plausibility_std": 0.16632896661758423, "reward_repeat_penalty_mean": 0.7769063115119934, "reward_repeat_penalty_std": 0.1433175951242447, "reward_near_duplicate_penalty_mean": 0.952541708946228, "reward_near_duplicate_penalty_std": 0.06054948642849922, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8350000381469727, "reward_judge_quality_std": 0.27717968821525574, "reward_total_composite_mean": 0.49674567580223083, "reward_total_composite_std": 0.41812607645988464} {"timestamp_utc": "2026-04-12T12:02:50Z", "mode": "train", "global_step": 345, "epoch": 0.013857091215809133, "loss": -0.0807, "grad_norm": 1.9718246459960938, "learning_rate": 8.957575757575758e-06, "num_tokens": 694508.0, "completions/mean_length": 478.25, "completions/min_length": 303.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 444.5, "completions/min_terminated_length": 303.0, "completions/max_terminated_length": 511.0, "rewards/meter/mean": 0.8270421624183655, "rewards/meter/std": 0.27804070711135864, "rewards/count_adherence/mean": 0.6312499642372131, "rewards/count_adherence/std": 0.18310320377349854, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9499764442443848, "rewards/lexical_plausibility/std": 0.09777331352233887, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.26956379413604736, "rewards/repeat_penalty/std": 0.44275808334350586, "rewards/near_duplicate_penalty/mean": 0.7016512751579285, "rewards/near_duplicate_penalty/std": 0.22374014556407928, "rewards/opening_diversity/mean": 0.6996302008628845, "rewards/opening_diversity/std": 0.3217163383960724, "rewards/distinct_2/mean": 0.3010595738887787, "rewards/distinct_2/std": 0.4387643337249756, "rewards/total_composite/mean": 0.07686956971883774, "rewards/total_composite/std": 0.049842629581689835, "reward": 0.07686956971883774, "reward_std": 0.049842629581689835, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12953819334506989, "sampling/sampling_logp_difference/max": 1.0903377532958984, "sampling/importance_sampling_ratio/min": 0.3361029624938965, "sampling/importance_sampling_ratio/mean": 1.0332744121551514, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.354970782995224, "clip_ratio/low_mean": 0.013613861054182053, "clip_ratio/low_min": 0.013613861054182053, "clip_ratio/high_mean": 0.037701843306422234, "clip_ratio/high_max": 0.037701843306422234, "clip_ratio/region_mean": 0.051315704360604286, "reward_total_mean": 0.07686956971883774, "reward_meter_mean": 0.8270421624183655, "reward_meter_std": 0.27804070711135864, "reward_count_adherence_mean": 0.6312499642372131, "reward_count_adherence_std": 0.18310320377349854, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9499764442443848, "reward_lexical_plausibility_std": 0.09777331352233887, "reward_repeat_penalty_mean": 0.26956379413604736, "reward_repeat_penalty_std": 0.44275808334350586, "reward_near_duplicate_penalty_mean": 0.7016512751579285, "reward_near_duplicate_penalty_std": 0.22374014556407928, "reward_opening_diversity_mean": 0.6996302008628845, "reward_opening_diversity_std": 0.3217163383960724, "reward_distinct_2_mean": 0.3010595738887787, "reward_distinct_2_std": 0.4387643337249756, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.07686956971883774, "reward_total_composite_std": 0.049842629581689835} {"timestamp_utc": "2026-04-12T12:03:00Z", "mode": "train", "global_step": 346, "epoch": 0.013897256697594087, "loss": 0.0856, "grad_norm": 19.72292709350586, "learning_rate": 8.954545454545456e-06, "num_tokens": 696232.0, "completions/mean_length": 32.5, "completions/min_length": 22.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.5, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.493013471364975, "rewards/meter/std": 0.4109993875026703, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9787946343421936, "rewards/lexical_plausibility/std": 0.04103745147585869, "rewards/judge_quality/mean": 0.8100000023841858, "rewards/judge_quality/std": 0.22258225083351135, "rewards/repeat_penalty/mean": 0.9584251642227173, "rewards/repeat_penalty/std": 0.03874953091144562, "rewards/near_duplicate_penalty/mean": 0.9584251642227173, "rewards/near_duplicate_penalty/std": 0.03874953091144562, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38943254947662354, "rewards/total_composite/std": 0.3704363703727722, "reward": 0.38943254947662354, "reward_std": 0.3704363703727722, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18848317861557007, "sampling/sampling_logp_difference/max": 1.496908187866211, "sampling/importance_sampling_ratio/min": 0.22382111847400665, "sampling/importance_sampling_ratio/mean": 0.9938216209411621, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9225008711218834, "clip_ratio/low_mean": 0.10501706041395664, "clip_ratio/low_min": 0.10501706041395664, "clip_ratio/high_mean": 0.08121081627905369, "clip_ratio/high_max": 0.08121081627905369, "clip_ratio/region_mean": 0.18622787669301033, "reward_total_mean": 0.38943254947662354, "reward_meter_mean": 0.493013471364975, "reward_meter_std": 0.4109993875026703, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9787946343421936, "reward_lexical_plausibility_std": 0.04103745147585869, "reward_repeat_penalty_mean": 0.9584251642227173, "reward_repeat_penalty_std": 0.03874953091144562, "reward_near_duplicate_penalty_mean": 0.9584251642227173, "reward_near_duplicate_penalty_std": 0.03874953091144562, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8100000023841858, "reward_judge_quality_std": 0.22258225083351135, "reward_total_composite_mean": 0.38943254947662354, "reward_total_composite_std": 0.3704363703727722} {"timestamp_utc": "2026-04-12T12:03:09Z", "mode": "train", "global_step": 347, "epoch": 0.01393742217937904, "loss": -0.0015, "grad_norm": 19.128320693969727, "learning_rate": 8.951515151515153e-06, "num_tokens": 697917.0, "completions/mean_length": 36.625, "completions/min_length": 35.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.9164797067642212, "rewards/meter/std": 0.021714089438319206, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8487499952316284, "rewards/judge_quality/std": 0.20152544975280762, "rewards/repeat_penalty/mean": 0.977634608745575, "rewards/repeat_penalty/std": 0.009986236691474915, "rewards/near_duplicate_penalty/mean": 0.977634608745575, "rewards/near_duplicate_penalty/std": 0.009986236691474915, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7809033989906311, "rewards/total_composite/std": 0.1923426240682602, "reward": 0.7809033989906311, "reward_std": 0.1923426389694214, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0485701709985733, "sampling/sampling_logp_difference/max": 1.2289419174194336, "sampling/importance_sampling_ratio/min": 0.292602002620697, "sampling/importance_sampling_ratio/mean": 1.0018235445022583, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.23541058972477913, "clip_ratio/low_mean": 0.0035714285913854837, "clip_ratio/low_min": 0.0035714285913854837, "clip_ratio/high_mean": 0.04377159010618925, "clip_ratio/high_max": 0.04377159010618925, "clip_ratio/region_mean": 0.047343018697574735, "reward_total_mean": 0.7809033989906311, "reward_meter_mean": 0.9164797067642212, "reward_meter_std": 0.021714089438319206, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.977634608745575, "reward_repeat_penalty_std": 0.009986236691474915, "reward_near_duplicate_penalty_mean": 0.977634608745575, "reward_near_duplicate_penalty_std": 0.009986236691474915, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8487499952316284, "reward_judge_quality_std": 0.20152544975280762, "reward_total_composite_mean": 0.7809033989906311, "reward_total_composite_std": 0.1923426240682602} {"timestamp_utc": "2026-04-12T12:03:22Z", "mode": "train", "global_step": 348, "epoch": 0.013977587661163996, "loss": -0.0082, "grad_norm": 4.4145355224609375, "learning_rate": 8.94848484848485e-06, "num_tokens": 699408.0, "completions/mean_length": 140.375, "completions/min_length": 13.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 16.5, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.48432457447052, "rewards/meter/std": 0.4321945607662201, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.6881680488586426, "rewards/lexical_plausibility/std": 0.3234315514564514, "rewards/judge_quality/mean": 0.3500000238418579, "rewards/judge_quality/std": 0.38172540068626404, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23884817957878113, "rewards/total_composite/std": 0.3289749026298523, "reward": 0.23884817957878113, "reward_std": 0.3289748728275299, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2495972216129303, "sampling/sampling_logp_difference/max": 2.0360565185546875, "sampling/importance_sampling_ratio/min": 0.13054250180721283, "sampling/importance_sampling_ratio/mean": 0.9614812731742859, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8264362886548042, "clip_ratio/low_mean": 0.07211538683623075, "clip_ratio/low_min": 0.07211538683623075, "clip_ratio/high_mean": 0.037593984976410866, "clip_ratio/high_max": 0.037593984976410866, "clip_ratio/region_mean": 0.10970937181264162, "reward_total_mean": 0.23884817957878113, "reward_meter_mean": 0.48432457447052, "reward_meter_std": 0.4321945607662201, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.6881680488586426, "reward_lexical_plausibility_std": 0.3234315514564514, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3500000238418579, "reward_judge_quality_std": 0.38172540068626404, "reward_total_composite_mean": 0.23884817957878113, "reward_total_composite_std": 0.3289749026298523} {"timestamp_utc": "2026-04-12T12:03:33Z", "mode": "train", "global_step": 349, "epoch": 0.01401775314294895, "loss": 0.0046, "grad_norm": 19.863420486450195, "learning_rate": 8.945454545454546e-06, "num_tokens": 700881.0, "completions/mean_length": 40.125, "completions/min_length": 35.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.125, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.8773584365844727, "rewards/meter/std": 0.268604040145874, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9785360097885132, "rewards/repeat_penalty/std": 0.02966911718249321, "rewards/near_duplicate_penalty/mean": 0.9785360097885132, "rewards/near_duplicate_penalty/std": 0.02966911718249321, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30248257517814636, "rewards/total_composite/std": 0.14327864348888397, "reward": 0.30248257517814636, "reward_std": 0.14327865839004517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22356478869915009, "sampling/sampling_logp_difference/max": 1.9981352090835571, "sampling/importance_sampling_ratio/min": 0.1355878859758377, "sampling/importance_sampling_ratio/mean": 1.017527461051941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.713050052523613, "clip_ratio/low_mean": 0.05018796864897013, "clip_ratio/low_min": 0.05018796864897013, "clip_ratio/high_mean": 0.15774736367166042, "clip_ratio/high_max": 0.15774736367166042, "clip_ratio/region_mean": 0.20793533232063055, "reward_total_mean": 0.30248257517814636, "reward_meter_mean": 0.8773584365844727, "reward_meter_std": 0.268604040145874, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9785360097885132, "reward_repeat_penalty_std": 0.02966911718249321, "reward_near_duplicate_penalty_mean": 0.9785360097885132, "reward_near_duplicate_penalty_std": 0.02966911718249321, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.30248257517814636, "reward_total_composite_std": 0.14327864348888397} {"timestamp_utc": "2026-04-12T12:03:43Z", "mode": "train", "global_step": 350, "epoch": 0.014057918624733904, "loss": 0.0112, "grad_norm": 13.340145111083984, "learning_rate": 8.942424242424243e-06, "num_tokens": 702881.0, "completions/mean_length": 63.0, "completions/min_length": 56.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.0, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.47328752279281616, "rewards/meter/std": 0.2505057752132416, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5587499737739563, "rewards/judge_quality/std": 0.1950412094593048, "rewards/repeat_penalty/mean": 0.9850226640701294, "rewards/repeat_penalty/std": 0.026346338912844658, "rewards/near_duplicate_penalty/mean": 0.9914755821228027, "rewards/near_duplicate_penalty/std": 0.009483331814408302, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.25895702838897705, "rewards/total_composite/std": 0.1825934201478958, "reward": 0.25895702838897705, "reward_std": 0.18259340524673462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1714884489774704, "sampling/sampling_logp_difference/max": 2.6210365295410156, "sampling/importance_sampling_ratio/min": 0.07272743433713913, "sampling/importance_sampling_ratio/mean": 1.0101772546768188, "sampling/importance_sampling_ratio/max": 1.8387874364852905, "entropy": 1.3653811067342758, "clip_ratio/low_mean": 0.10327029973268509, "clip_ratio/low_min": 0.10327029973268509, "clip_ratio/high_mean": 0.049912177957594395, "clip_ratio/high_max": 0.049912177957594395, "clip_ratio/region_mean": 0.15318247769027948, "reward_total_mean": 0.25895702838897705, "reward_meter_mean": 0.47328752279281616, "reward_meter_std": 0.2505057752132416, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9850226640701294, "reward_repeat_penalty_std": 0.026346338912844658, "reward_near_duplicate_penalty_mean": 0.9914755821228027, "reward_near_duplicate_penalty_std": 0.009483331814408302, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.5587499737739563, "reward_judge_quality_std": 0.1950412094593048, "reward_total_composite_mean": 0.25895702838897705, "reward_total_composite_std": 0.1825934201478958} {"timestamp_utc": "2026-04-12T12:06:10Z", "mode": "eval", "global_step": 350, "epoch": 0.014057918624733904, "eval_loss": NaN, "eval_runtime": 147.5508, "eval_samples_per_second": 0.705, "eval_steps_per_second": 0.088, "eval_num_tokens": 702881.0, "eval_completions/mean_length": 174.0, "eval_completions/min_length": 37.76923076923077, "eval_completions/max_length": 442.15384615384613, "eval_completions/clipped_ratio": 0.08653846153846154, "eval_completions/mean_terminated_length": 143.735353910006, "eval_completions/min_terminated_length": 37.76923076923077, "eval_completions/max_terminated_length": 317.84615384615387, "eval_rewards/meter/mean": 0.5232180540378277, "eval_rewards/meter/std": 0.36077991357216466, "eval_rewards/count_adherence/mean": 0.8760176025904142, "eval_rewards/count_adherence/std": 0.18586662010504648, "eval_rewards/arabic_clean/mean": 0.7980769230769231, "eval_rewards/arabic_clean/std": 0.3748629941390111, "eval_rewards/lexical_plausibility/mean": 0.9659633957422696, "eval_rewards/lexical_plausibility/std": 0.08558803060217403, "eval_rewards/judge_quality/mean": 0.3753846058478722, "eval_rewards/judge_quality/std": 0.19862179859326437, "eval_rewards/repeat_penalty/mean": 0.805566246692951, "eval_rewards/repeat_penalty/std": 0.28434896383147973, "eval_rewards/near_duplicate_penalty/mean": 0.9476043581962585, "eval_rewards/near_duplicate_penalty/std": 0.07918187882751226, "eval_rewards/opening_diversity/mean": 0.9578615381167486, "eval_rewards/opening_diversity/std": 0.08810311040053001, "eval_rewards/distinct_2/mean": 0.8504216487591083, "eval_rewards/distinct_2/std": 0.2567940211066833, "eval_rewards/total_composite/mean": 0.1699994899905645, "eval_rewards/total_composite/std": 0.17776415267815956, "eval_reward": 0.1699994899905645, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.10092502030042502, "eval_sampling/sampling_logp_difference/max": 1.2269824834970326, "eval_sampling/importance_sampling_ratio/min": 0.2992986383346411, "eval_sampling/importance_sampling_ratio/mean": 1.0261076780465932, "eval_sampling/importance_sampling_ratio/max": 1.6199309734197764, "eval_entropy": 1.4563191212140596, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1699994899905645, "eval_reward_meter_mean": 0.5232180540378277, "eval_reward_meter_std": 0.36077991357216466, "eval_reward_count_adherence_mean": 0.8760176025904142, "eval_reward_count_adherence_std": 0.18586662010504648, "eval_reward_arabic_clean_mean": 0.7980769230769231, "eval_reward_arabic_clean_std": 0.3748629941390111, "eval_reward_lexical_plausibility_mean": 0.9659633957422696, "eval_reward_lexical_plausibility_std": 0.08558803060217403, "eval_reward_repeat_penalty_mean": 0.805566246692951, "eval_reward_repeat_penalty_std": 0.28434896383147973, "eval_reward_near_duplicate_penalty_mean": 0.9476043581962585, "eval_reward_near_duplicate_penalty_std": 0.07918187882751226, "eval_reward_opening_diversity_mean": 0.9578615381167486, "eval_reward_opening_diversity_std": 0.08810311040053001, "eval_reward_distinct_2_mean": 0.8504216487591083, "eval_reward_distinct_2_std": 0.2567940211066833, "eval_reward_judge_quality_mean": 0.3753846058478722, "eval_reward_judge_quality_std": 0.19862179859326437, "eval_reward_total_composite_mean": 0.1699994899905645, "eval_reward_total_composite_std": 0.17776415267815956} {"timestamp_utc": "2026-04-12T12:06:23Z", "mode": "train", "global_step": 351, "epoch": 0.014098084106518858, "loss": 0.0526, "grad_norm": 17.655532836914062, "learning_rate": 8.93939393939394e-06, "num_tokens": 704403.0, "completions/mean_length": 37.25, "completions/min_length": 35.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7530195713043213, "rewards/meter/std": 0.3564686179161072, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5424999594688416, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.952635645866394, "rewards/repeat_penalty/std": 0.1334109902381897, "rewards/near_duplicate_penalty/mean": 0.987712025642395, "rewards/near_duplicate_penalty/std": 0.034202586859464645, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.3259601593017578, "rewards/total_composite/std": 0.2837991416454315, "reward": 0.3259601593017578, "reward_std": 0.2837991416454315, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1677749752998352, "sampling/sampling_logp_difference/max": 1.7785744667053223, "sampling/importance_sampling_ratio/min": 0.1688787192106247, "sampling/importance_sampling_ratio/mean": 1.0243333578109741, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.269610472023487, "clip_ratio/low_mean": 0.09796366095542908, "clip_ratio/low_min": 0.09796366095542908, "clip_ratio/high_mean": 0.10337301949039102, "clip_ratio/high_max": 0.10337301949039102, "clip_ratio/region_mean": 0.2013366804458201, "reward_total_mean": 0.3259601593017578, "reward_meter_mean": 0.7530195713043213, "reward_meter_std": 0.3564686179161072, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.952635645866394, "reward_repeat_penalty_std": 0.1334109902381897, "reward_near_duplicate_penalty_mean": 0.987712025642395, "reward_near_duplicate_penalty_std": 0.034202586859464645, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.5424999594688416, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.3259601593017578, "reward_total_composite_std": 0.2837991416454315} {"timestamp_utc": "2026-04-12T12:06:32Z", "mode": "train", "global_step": 352, "epoch": 0.014138249588303812, "loss": 0.0318, "grad_norm": 22.35120391845703, "learning_rate": 8.936363636363638e-06, "num_tokens": 705882.0, "completions/mean_length": 24.875, "completions/min_length": 23.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.875, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.6298954486846924, "rewards/meter/std": 0.44862452149391174, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8594306707382202, "rewards/lexical_plausibility/std": 0.2082936316728592, "rewards/judge_quality/mean": 0.9237500429153442, "rewards/judge_quality/std": 0.01060659158974886, "rewards/repeat_penalty/mean": 0.7451828122138977, "rewards/repeat_penalty/std": 0.013625085353851318, "rewards/near_duplicate_penalty/mean": 0.9935770630836487, "rewards/near_duplicate_penalty/std": 0.018166767433285713, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5832383036613464, "rewards/total_composite/std": 0.4163356423377991, "reward": 0.5832383036613464, "reward_std": 0.4163356125354767, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15111209452152252, "sampling/sampling_logp_difference/max": 1.638291835784912, "sampling/importance_sampling_ratio/min": 0.19431167840957642, "sampling/importance_sampling_ratio/mean": 0.9999074935913086, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7193644717335701, "clip_ratio/low_mean": 0.04527243738994002, "clip_ratio/low_min": 0.04527243738994002, "clip_ratio/high_mean": 0.07821557903662324, "clip_ratio/high_max": 0.07821557903662324, "clip_ratio/region_mean": 0.12348801642656326, "reward_total_mean": 0.5832383036613464, "reward_meter_mean": 0.6298954486846924, "reward_meter_std": 0.44862452149391174, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8594306707382202, "reward_lexical_plausibility_std": 0.2082936316728592, "reward_repeat_penalty_mean": 0.7451828122138977, "reward_repeat_penalty_std": 0.013625085353851318, "reward_near_duplicate_penalty_mean": 0.9935770630836487, "reward_near_duplicate_penalty_std": 0.018166767433285713, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9237500429153442, "reward_judge_quality_std": 0.01060659158974886, "reward_total_composite_mean": 0.5832383036613464, "reward_total_composite_std": 0.4163356423377991} {"timestamp_utc": "2026-04-12T12:06:42Z", "mode": "train", "global_step": 353, "epoch": 0.014178415070088766, "loss": 0.0458, "grad_norm": 13.888103485107422, "learning_rate": 8.933333333333333e-06, "num_tokens": 707532.0, "completions/mean_length": 45.25, "completions/min_length": 39.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.9776734113693237, "rewards/meter/std": 0.027861593291163445, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7712500095367432, "rewards/judge_quality/std": 0.17771868407726288, "rewards/repeat_penalty/mean": 0.9923610687255859, "rewards/repeat_penalty/std": 0.014222200959920883, "rewards/near_duplicate_penalty/mean": 0.9923610687255859, "rewards/near_duplicate_penalty/std": 0.014222200959920883, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7533683180809021, "rewards/total_composite/std": 0.1725199967622757, "reward": 0.7533683180809021, "reward_std": 0.1725199818611145, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13646160066127777, "sampling/sampling_logp_difference/max": 1.8458527326583862, "sampling/importance_sampling_ratio/min": 0.15789063274860382, "sampling/importance_sampling_ratio/mean": 1.0241644382476807, "sampling/importance_sampling_ratio/max": 1.8805228471755981, "entropy": 1.111404150724411, "clip_ratio/low_mean": 0.054421061649918556, "clip_ratio/low_min": 0.054421061649918556, "clip_ratio/high_mean": 0.06493578106164932, "clip_ratio/high_max": 0.06493578106164932, "clip_ratio/region_mean": 0.11935684271156788, "reward_total_mean": 0.7533683180809021, "reward_meter_mean": 0.9776734113693237, "reward_meter_std": 0.027861593291163445, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9923610687255859, "reward_repeat_penalty_std": 0.014222200959920883, "reward_near_duplicate_penalty_mean": 0.9923610687255859, "reward_near_duplicate_penalty_std": 0.014222200959920883, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7712500095367432, "reward_judge_quality_std": 0.17771868407726288, "reward_total_composite_mean": 0.7533683180809021, "reward_total_composite_std": 0.1725199967622757} {"timestamp_utc": "2026-04-12T12:06:52Z", "mode": "train", "global_step": 354, "epoch": 0.01421858055187372, "loss": 0.1136, "grad_norm": 25.065343856811523, "learning_rate": 8.930303030303032e-06, "num_tokens": 709092.0, "completions/mean_length": 32.0, "completions/min_length": 27.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.8254019021987915, "rewards/meter/std": 0.2102869600057602, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7574999928474426, "rewards/judge_quality/std": 0.35025501251220703, "rewards/repeat_penalty/mean": 0.9536963701248169, "rewards/repeat_penalty/std": 0.059854354709386826, "rewards/near_duplicate_penalty/mean": 0.9725993871688843, "rewards/near_duplicate_penalty/std": 0.026196924969553947, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.03748259320855141, "rewards/total_composite/mean": 0.6245007514953613, "rewards/total_composite/std": 0.3574490249156952, "reward": 0.6245007514953613, "reward_std": 0.3574490249156952, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16634072363376617, "sampling/sampling_logp_difference/max": 2.130660057067871, "sampling/importance_sampling_ratio/min": 0.11875887960195541, "sampling/importance_sampling_ratio/mean": 0.9993553161621094, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9455316439270973, "clip_ratio/low_mean": 0.06103830598294735, "clip_ratio/low_min": 0.06103830598294735, "clip_ratio/high_mean": 0.11087634321302176, "clip_ratio/high_max": 0.11087634321302176, "clip_ratio/region_mean": 0.1719146491959691, "reward_total_mean": 0.6245007514953613, "reward_meter_mean": 0.8254019021987915, "reward_meter_std": 0.2102869600057602, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9536963701248169, "reward_repeat_penalty_std": 0.059854354709386826, "reward_near_duplicate_penalty_mean": 0.9725993871688843, "reward_near_duplicate_penalty_std": 0.026196924969553947, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.03748259320855141, "reward_judge_quality_mean": 0.7574999928474426, "reward_judge_quality_std": 0.35025501251220703, "reward_total_composite_mean": 0.6245007514953613, "reward_total_composite_std": 0.3574490249156952} {"timestamp_utc": "2026-04-12T12:07:01Z", "mode": "train", "global_step": 355, "epoch": 0.014258746033658674, "loss": 0.0524, "grad_norm": 16.550546646118164, "learning_rate": 8.927272727272728e-06, "num_tokens": 710833.0, "completions/mean_length": 56.625, "completions/min_length": 51.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.625, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.742302656173706, "rewards/meter/std": 0.3499872088432312, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5625, "rewards/judge_quality/std": 0.20858368277549744, "rewards/repeat_penalty/mean": 0.9596279263496399, "rewards/repeat_penalty/std": 0.032838139683008194, "rewards/near_duplicate_penalty/mean": 0.9820369482040405, "rewards/near_duplicate_penalty/std": 0.012260795570909977, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9771942496299744, "rewards/distinct_2/std": 0.031511660665273666, "rewards/total_composite/mean": 0.3991848826408386, "rewards/total_composite/std": 0.23031742870807648, "reward": 0.3991848826408386, "reward_std": 0.23031742870807648, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17098252475261688, "sampling/sampling_logp_difference/max": 1.5343976020812988, "sampling/importance_sampling_ratio/min": 0.21558551490306854, "sampling/importance_sampling_ratio/mean": 1.0290696620941162, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1870462223887444, "clip_ratio/low_mean": 0.07203947380185127, "clip_ratio/low_min": 0.07203947380185127, "clip_ratio/high_mean": 0.1046310905367136, "clip_ratio/high_max": 0.1046310905367136, "clip_ratio/region_mean": 0.17667056433856487, "reward_total_mean": 0.3991848826408386, "reward_meter_mean": 0.742302656173706, "reward_meter_std": 0.3499872088432312, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9596279263496399, "reward_repeat_penalty_std": 0.032838139683008194, "reward_near_duplicate_penalty_mean": 0.9820369482040405, "reward_near_duplicate_penalty_std": 0.012260795570909977, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9771942496299744, "reward_distinct_2_std": 0.031511660665273666, "reward_judge_quality_mean": 0.5625, "reward_judge_quality_std": 0.20858368277549744, "reward_total_composite_mean": 0.3991848826408386, "reward_total_composite_std": 0.23031742870807648} {"timestamp_utc": "2026-04-12T12:07:11Z", "mode": "train", "global_step": 356, "epoch": 0.014298911515443628, "loss": -0.0019, "grad_norm": 11.859844207763672, "learning_rate": 8.924242424242425e-06, "num_tokens": 712869.0, "completions/mean_length": 65.5, "completions/min_length": 59.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.5, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.5503519177436829, "rewards/meter/std": 0.3842824101448059, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5975000262260437, "rewards/judge_quality/std": 0.35847896337509155, "rewards/repeat_penalty/mean": 0.9002127051353455, "rewards/repeat_penalty/std": 0.14802417159080505, "rewards/near_duplicate_penalty/mean": 0.9710186123847961, "rewards/near_duplicate_penalty/std": 0.027042049914598465, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9426940679550171, "rewards/distinct_2/std": 0.08425553143024445, "rewards/total_composite/mean": 0.2679823637008667, "rewards/total_composite/std": 0.2850530445575714, "reward": 0.2679823637008667, "reward_std": 0.2850530445575714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20014044642448425, "sampling/sampling_logp_difference/max": 2.0784482955932617, "sampling/importance_sampling_ratio/min": 0.12512421607971191, "sampling/importance_sampling_ratio/mean": 1.0154919624328613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6726450473070145, "clip_ratio/low_mean": 0.14197781309485435, "clip_ratio/low_min": 0.14197781309485435, "clip_ratio/high_mean": 0.03549066372215748, "clip_ratio/high_max": 0.03549066372215748, "clip_ratio/region_mean": 0.17746847681701183, "reward_total_mean": 0.2679823637008667, "reward_meter_mean": 0.5503519177436829, "reward_meter_std": 0.3842824101448059, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9002127051353455, "reward_repeat_penalty_std": 0.14802417159080505, "reward_near_duplicate_penalty_mean": 0.9710186123847961, "reward_near_duplicate_penalty_std": 0.027042049914598465, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9426940679550171, "reward_distinct_2_std": 0.08425553143024445, "reward_judge_quality_mean": 0.5975000262260437, "reward_judge_quality_std": 0.35847896337509155, "reward_total_composite_mean": 0.2679823637008667, "reward_total_composite_std": 0.2850530445575714} {"timestamp_utc": "2026-04-12T12:07:20Z", "mode": "train", "global_step": 357, "epoch": 0.014339076997228582, "loss": 0.0511, "grad_norm": 16.52701759338379, "learning_rate": 8.921212121212122e-06, "num_tokens": 714417.0, "completions/mean_length": 38.5, "completions/min_length": 31.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6863381266593933, "rewards/meter/std": 0.37964722514152527, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.1642080545425415, "rewards/repeat_penalty/mean": 0.9445874691009521, "rewards/repeat_penalty/std": 0.12602415680885315, "rewards/near_duplicate_penalty/mean": 0.9799796342849731, "rewards/near_duplicate_penalty/std": 0.032015178352594376, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.2688857913017273, "rewards/total_composite/std": 0.15353192389011383, "reward": 0.2688857913017273, "reward_std": 0.15353190898895264, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18544301390647888, "sampling/sampling_logp_difference/max": 1.2146453857421875, "sampling/importance_sampling_ratio/min": 0.29681524634361267, "sampling/importance_sampling_ratio/mean": 1.0298609733581543, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.602674126625061, "clip_ratio/low_mean": 0.060824490152299404, "clip_ratio/low_min": 0.060824490152299404, "clip_ratio/high_mean": 0.08745280560106039, "clip_ratio/high_max": 0.08745280560106039, "clip_ratio/region_mean": 0.1482772957533598, "reward_total_mean": 0.2688857913017273, "reward_meter_mean": 0.6863381266593933, "reward_meter_std": 0.37964722514152527, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9445874691009521, "reward_repeat_penalty_std": 0.12602415680885315, "reward_near_duplicate_penalty_mean": 0.9799796342849731, "reward_near_duplicate_penalty_std": 0.032015178352594376, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.1642080545425415, "reward_total_composite_mean": 0.2688857913017273, "reward_total_composite_std": 0.15353192389011383} {"timestamp_utc": "2026-04-12T12:07:35Z", "mode": "train", "global_step": 358, "epoch": 0.014379242479013536, "loss": -0.1287, "grad_norm": 2.8922390937805176, "learning_rate": 8.91818181818182e-06, "num_tokens": 717142.0, "completions/mean_length": 287.625, "completions/min_length": 179.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 212.83334350585938, "completions/min_terminated_length": 179.0, "completions/max_terminated_length": 254.0, "rewards/meter/mean": 0.7647531032562256, "rewards/meter/std": 0.3117305040359497, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.22519831359386444, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8589385151863098, "rewards/lexical_plausibility/std": 0.2416151463985443, "rewards/judge_quality/mean": 0.17499999701976776, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.4069833755493164, "rewards/repeat_penalty/std": 0.48276934027671814, "rewards/near_duplicate_penalty/mean": 0.7356517314910889, "rewards/near_duplicate_penalty/std": 0.2831598222255707, "rewards/opening_diversity/mean": 0.576880693435669, "rewards/opening_diversity/std": 0.38802570104599, "rewards/distinct_2/mean": 0.4962750971317291, "rewards/distinct_2/std": 0.4343658685684204, "rewards/total_composite/mean": 0.0865609273314476, "rewards/total_composite/std": 0.09177654981613159, "reward": 0.0865609273314476, "reward_std": 0.09177655726671219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12771281599998474, "sampling/sampling_logp_difference/max": 1.4083313941955566, "sampling/importance_sampling_ratio/min": 0.27567747235298157, "sampling/importance_sampling_ratio/mean": 1.0258456468582153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1412059031426907, "clip_ratio/low_mean": 0.01427165325731039, "clip_ratio/low_min": 0.01427165325731039, "clip_ratio/high_mean": 0.0731547859031707, "clip_ratio/high_max": 0.0731547859031707, "clip_ratio/region_mean": 0.0874264391604811, "reward_total_mean": 0.0865609273314476, "reward_meter_mean": 0.7647531032562256, "reward_meter_std": 0.3117305040359497, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.22519831359386444, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8589385151863098, "reward_lexical_plausibility_std": 0.2416151463985443, "reward_repeat_penalty_mean": 0.4069833755493164, "reward_repeat_penalty_std": 0.48276934027671814, "reward_near_duplicate_penalty_mean": 0.7356517314910889, "reward_near_duplicate_penalty_std": 0.2831598222255707, "reward_opening_diversity_mean": 0.576880693435669, "reward_opening_diversity_std": 0.38802570104599, "reward_distinct_2_mean": 0.4962750971317291, "reward_distinct_2_std": 0.4343658685684204, "reward_judge_quality_mean": 0.17499999701976776, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.0865609273314476, "reward_total_composite_std": 0.09177654981613159} {"timestamp_utc": "2026-04-12T12:07:44Z", "mode": "train", "global_step": 359, "epoch": 0.01441940796079849, "loss": 0.0992, "grad_norm": 17.17350196838379, "learning_rate": 8.915151515151515e-06, "num_tokens": 718665.0, "completions/mean_length": 43.375, "completions/min_length": 36.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7345317006111145, "rewards/meter/std": 0.4362199902534485, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.30861154198646545, "rewards/repeat_penalty/mean": 0.9529265761375427, "rewards/repeat_penalty/std": 0.086003378033638, "rewards/near_duplicate_penalty/mean": 0.9837132692337036, "rewards/near_duplicate_penalty/std": 0.028064828366041183, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9673202633857727, "rewards/distinct_2/std": 0.06421688199043274, "rewards/total_composite/mean": 0.5463916063308716, "rewards/total_composite/std": 0.43483734130859375, "reward": 0.5463916063308716, "reward_std": 0.43483734130859375, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15922391414642334, "sampling/sampling_logp_difference/max": 1.474926471710205, "sampling/importance_sampling_ratio/min": 0.22879555821418762, "sampling/importance_sampling_ratio/mean": 0.9957095980644226, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0501817166805267, "clip_ratio/low_mean": 0.05403903219848871, "clip_ratio/low_min": 0.05403903219848871, "clip_ratio/high_mean": 0.0999431386590004, "clip_ratio/high_max": 0.0999431386590004, "clip_ratio/region_mean": 0.1539821708574891, "reward_total_mean": 0.5463916063308716, "reward_meter_mean": 0.7345317006111145, "reward_meter_std": 0.4362199902534485, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9529265761375427, "reward_repeat_penalty_std": 0.086003378033638, "reward_near_duplicate_penalty_mean": 0.9837132692337036, "reward_near_duplicate_penalty_std": 0.028064828366041183, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9673202633857727, "reward_distinct_2_std": 0.06421688199043274, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.30861154198646545, "reward_total_composite_mean": 0.5463916063308716, "reward_total_composite_std": 0.43483734130859375} {"timestamp_utc": "2026-04-12T12:07:52Z", "mode": "train", "global_step": 360, "epoch": 0.014459573442583444, "loss": 0.1043, "grad_norm": 28.60000991821289, "learning_rate": 8.912121212121214e-06, "num_tokens": 720341.0, "completions/mean_length": 27.5, "completions/min_length": 21.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.8417450785636902, "rewards/meter/std": 0.28884682059288025, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.7730119824409485, "rewards/lexical_plausibility/std": 0.2859584093093872, "rewards/judge_quality/mean": 0.7725000381469727, "rewards/judge_quality/std": 0.3027375340461731, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6335079669952393, "rewards/total_composite/std": 0.3517366945743561, "reward": 0.6335079669952393, "reward_std": 0.3517366945743561, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1633785367012024, "sampling/sampling_logp_difference/max": 1.6580560207366943, "sampling/importance_sampling_ratio/min": 0.19050897657871246, "sampling/importance_sampling_ratio/mean": 1.0053507089614868, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9615290611982346, "clip_ratio/low_mean": 0.055898270569741726, "clip_ratio/low_min": 0.055898270569741726, "clip_ratio/high_mean": 0.11156580876559019, "clip_ratio/high_max": 0.11156580876559019, "clip_ratio/region_mean": 0.16746407933533192, "reward_total_mean": 0.6335079669952393, "reward_meter_mean": 0.8417450785636902, "reward_meter_std": 0.28884682059288025, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.7730119824409485, "reward_lexical_plausibility_std": 0.2859584093093872, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7725000381469727, "reward_judge_quality_std": 0.3027375340461731, "reward_total_composite_mean": 0.6335079669952393, "reward_total_composite_std": 0.3517366945743561} {"timestamp_utc": "2026-04-12T12:08:03Z", "mode": "train", "global_step": 361, "epoch": 0.014499738924368398, "loss": 0.0668, "grad_norm": 12.647197723388672, "learning_rate": 8.90909090909091e-06, "num_tokens": 722153.0, "completions/mean_length": 63.5, "completions/min_length": 58.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.5, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.6334871053695679, "rewards/meter/std": 0.3794703781604767, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9894030690193176, "rewards/repeat_penalty/std": 0.01291202288120985, "rewards/near_duplicate_penalty/mean": 0.9894030690193176, "rewards/near_duplicate_penalty/std": 0.01291202288120985, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2501254081726074, "rewards/total_composite/std": 0.18298527598381042, "reward": 0.2501254081726074, "reward_std": 0.18298527598381042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19529755413532257, "sampling/sampling_logp_difference/max": 1.879929542541504, "sampling/importance_sampling_ratio/min": 0.15260085463523865, "sampling/importance_sampling_ratio/mean": 1.057754397392273, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.251577615737915, "clip_ratio/low_mean": 0.11461598798632622, "clip_ratio/low_min": 0.11461598798632622, "clip_ratio/high_mean": 0.07472979836165905, "clip_ratio/high_max": 0.07472979836165905, "clip_ratio/region_mean": 0.18934578634798527, "reward_total_mean": 0.2501254081726074, "reward_meter_mean": 0.6334871053695679, "reward_meter_std": 0.3794703781604767, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9894030690193176, "reward_repeat_penalty_std": 0.01291202288120985, "reward_near_duplicate_penalty_mean": 0.9894030690193176, "reward_near_duplicate_penalty_std": 0.01291202288120985, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2501254081726074, "reward_total_composite_std": 0.18298527598381042} {"timestamp_utc": "2026-04-12T12:08:12Z", "mode": "train", "global_step": 362, "epoch": 0.014539904406153352, "loss": 0.079, "grad_norm": 12.049482345581055, "learning_rate": 8.906060606060607e-06, "num_tokens": 723753.0, "completions/mean_length": 41.0, "completions/min_length": 37.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.9270881414413452, "rewards/meter/std": 0.05334731563925743, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6225000023841858, "rewards/judge_quality/std": 0.3285357356071472, "rewards/repeat_penalty/mean": 0.854789137840271, "rewards/repeat_penalty/std": 0.16840942203998566, "rewards/near_duplicate_penalty/mean": 0.9022011160850525, "rewards/near_duplicate_penalty/std": 0.09423723071813583, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.966063380241394, "rewards/distinct_2/std": 0.04683702811598778, "rewards/total_composite/mean": 0.5747998356819153, "rewards/total_composite/std": 0.29921311140060425, "reward": 0.5747998356819153, "reward_std": 0.29921311140060425, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15688970685005188, "sampling/sampling_logp_difference/max": 2.671311855316162, "sampling/importance_sampling_ratio/min": 0.06916143745183945, "sampling/importance_sampling_ratio/mean": 1.0157854557037354, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.014362320303917, "clip_ratio/low_mean": 0.06113460287451744, "clip_ratio/low_min": 0.06113460287451744, "clip_ratio/high_mean": 0.10501393862068653, "clip_ratio/high_max": 0.10501393862068653, "clip_ratio/region_mean": 0.16614854149520397, "reward_total_mean": 0.5747998356819153, "reward_meter_mean": 0.9270881414413452, "reward_meter_std": 0.05334731563925743, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.854789137840271, "reward_repeat_penalty_std": 0.16840942203998566, "reward_near_duplicate_penalty_mean": 0.9022011160850525, "reward_near_duplicate_penalty_std": 0.09423723071813583, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.966063380241394, "reward_distinct_2_std": 0.04683702811598778, "reward_judge_quality_mean": 0.6225000023841858, "reward_judge_quality_std": 0.3285357356071472, "reward_total_composite_mean": 0.5747998356819153, "reward_total_composite_std": 0.29921311140060425} {"timestamp_utc": "2026-04-12T12:08:27Z", "mode": "train", "global_step": 363, "epoch": 0.014580069887938306, "loss": -0.1432, "grad_norm": 3.6705923080444336, "learning_rate": 8.903030303030304e-06, "num_tokens": 725791.0, "completions/mean_length": 202.75, "completions/min_length": 82.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 99.66667175292969, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.45061933994293213, "rewards/meter/std": 0.3779248297214508, "rewards/count_adherence/mean": 0.7999999523162842, "rewards/count_adherence/std": 0.33806172013282776, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9334577322006226, "rewards/lexical_plausibility/std": 0.14861370623111725, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.9784387350082397, "rewards/repeat_penalty/std": 0.020184149965643883, "rewards/near_duplicate_penalty/mean": 0.9864121675491333, "rewards/near_duplicate_penalty/std": 0.012301817536354065, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.991870105266571, "rewards/distinct_2/std": 0.012649363838136196, "rewards/total_composite/mean": 0.164620041847229, "rewards/total_composite/std": 0.158761665225029, "reward": 0.164620041847229, "reward_std": 0.1587616503238678, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1910051852464676, "sampling/sampling_logp_difference/max": 1.5631217956542969, "sampling/importance_sampling_ratio/min": 0.20948109030723572, "sampling/importance_sampling_ratio/mean": 1.030908465385437, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5991112738847733, "clip_ratio/low_mean": 0.027108434587717056, "clip_ratio/low_min": 0.027108434587717056, "clip_ratio/high_mean": 0.1284009926021099, "clip_ratio/high_max": 0.1284009926021099, "clip_ratio/region_mean": 0.15550942718982697, "reward_total_mean": 0.164620041847229, "reward_meter_mean": 0.45061933994293213, "reward_meter_std": 0.3779248297214508, "reward_count_adherence_mean": 0.7999999523162842, "reward_count_adherence_std": 0.33806172013282776, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9334577322006226, "reward_lexical_plausibility_std": 0.14861370623111725, "reward_repeat_penalty_mean": 0.9784387350082397, "reward_repeat_penalty_std": 0.020184149965643883, "reward_near_duplicate_penalty_mean": 0.9864121675491333, "reward_near_duplicate_penalty_std": 0.012301817536354065, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.991870105266571, "reward_distinct_2_std": 0.012649363838136196, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.164620041847229, "reward_total_composite_std": 0.158761665225029} {"timestamp_utc": "2026-04-12T12:08:38Z", "mode": "train", "global_step": 364, "epoch": 0.01462023536972326, "loss": 0.0242, "grad_norm": 15.96010971069336, "learning_rate": 8.900000000000001e-06, "num_tokens": 727337.0, "completions/mean_length": 36.25, "completions/min_length": 31.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.5769586563110352, "rewards/meter/std": 0.3881268799304962, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9822304248809814, "rewards/lexical_plausibility/std": 0.0502600334584713, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1685018092393875, "rewards/repeat_penalty/mean": 0.9903969168663025, "rewards/repeat_penalty/std": 0.015086086466908455, "rewards/near_duplicate_penalty/mean": 0.9903969168663025, "rewards/near_duplicate_penalty/std": 0.015086086466908455, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.236695796251297, "rewards/total_composite/std": 0.24888162314891815, "reward": 0.236695796251297, "reward_std": 0.24888163805007935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2014869749546051, "sampling/sampling_logp_difference/max": 1.3099784851074219, "sampling/importance_sampling_ratio/min": 0.26982587575912476, "sampling/importance_sampling_ratio/mean": 1.034716010093689, "sampling/importance_sampling_ratio/max": 1.9667059183120728, "entropy": 1.6048991158604622, "clip_ratio/low_mean": 0.07555138133466244, "clip_ratio/low_min": 0.07555138133466244, "clip_ratio/high_mean": 0.06635742541402578, "clip_ratio/high_max": 0.06635742541402578, "clip_ratio/region_mean": 0.14190880674868822, "reward_total_mean": 0.236695796251297, "reward_meter_mean": 0.5769586563110352, "reward_meter_std": 0.3881268799304962, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9822304248809814, "reward_lexical_plausibility_std": 0.0502600334584713, "reward_repeat_penalty_mean": 0.9903969168663025, "reward_repeat_penalty_std": 0.015086086466908455, "reward_near_duplicate_penalty_mean": 0.9903969168663025, "reward_near_duplicate_penalty_std": 0.015086086466908455, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1685018092393875, "reward_total_composite_mean": 0.236695796251297, "reward_total_composite_std": 0.24888162314891815} {"timestamp_utc": "2026-04-12T12:08:46Z", "mode": "train", "global_step": 365, "epoch": 0.014660400851508213, "loss": 0.0671, "grad_norm": 17.79912757873535, "learning_rate": 8.896969696969697e-06, "num_tokens": 728700.0, "completions/mean_length": 36.375, "completions/min_length": 33.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.375, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.9167230725288391, "rewards/meter/std": 0.14205153286457062, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5537500381469727, "rewards/judge_quality/std": 0.18469570577144623, "rewards/repeat_penalty/mean": 0.8419625759124756, "rewards/repeat_penalty/std": 0.2098531872034073, "rewards/near_duplicate_penalty/mean": 0.9634506702423096, "rewards/near_duplicate_penalty/std": 0.04839060828089714, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9482118487358093, "rewards/distinct_2/std": 0.09005054086446762, "rewards/total_composite/mean": 0.5047616958618164, "rewards/total_composite/std": 0.19028246402740479, "reward": 0.5047616958618164, "reward_std": 0.19028246402740479, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1717405915260315, "sampling/sampling_logp_difference/max": 2.181375503540039, "sampling/importance_sampling_ratio/min": 0.11288614571094513, "sampling/importance_sampling_ratio/mean": 1.0314292907714844, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.60911326110363, "clip_ratio/low_mean": 0.10354327782988548, "clip_ratio/low_min": 0.10354327782988548, "clip_ratio/high_mean": 0.054306723177433014, "clip_ratio/high_max": 0.054306723177433014, "clip_ratio/region_mean": 0.1578500010073185, "reward_total_mean": 0.5047616958618164, "reward_meter_mean": 0.9167230725288391, "reward_meter_std": 0.14205153286457062, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8419625759124756, "reward_repeat_penalty_std": 0.2098531872034073, "reward_near_duplicate_penalty_mean": 0.9634506702423096, "reward_near_duplicate_penalty_std": 0.04839060828089714, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9482118487358093, "reward_distinct_2_std": 0.09005054086446762, "reward_judge_quality_mean": 0.5537500381469727, "reward_judge_quality_std": 0.18469570577144623, "reward_total_composite_mean": 0.5047616958618164, "reward_total_composite_std": 0.19028246402740479} {"timestamp_utc": "2026-04-12T12:09:00Z", "mode": "train", "global_step": 366, "epoch": 0.014700566333293167, "loss": -0.0659, "grad_norm": 2.6969549655914307, "learning_rate": 8.893939393939394e-06, "num_tokens": 730246.0, "completions/mean_length": 164.25, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 48.333335876464844, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.6664940118789673, "rewards/meter/std": 0.4521222710609436, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8626080751419067, "rewards/lexical_plausibility/std": 0.2585444450378418, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.38101136684417725, "rewards/repeat_penalty/mean": 0.9925903081893921, "rewards/repeat_penalty/std": 0.01526072807610035, "rewards/near_duplicate_penalty/mean": 0.9925903081893921, "rewards/near_duplicate_penalty/std": 0.01526072807610035, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.28297725319862366, "rewards/total_composite/std": 0.35254907608032227, "reward": 0.28297725319862366, "reward_std": 0.3525490462779999, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20700275897979736, "sampling/sampling_logp_difference/max": 1.6284193992614746, "sampling/importance_sampling_ratio/min": 0.19623950123786926, "sampling/importance_sampling_ratio/mean": 0.998453676700592, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2886315882205963, "clip_ratio/low_mean": 0.06262258999049664, "clip_ratio/low_min": 0.06262258999049664, "clip_ratio/high_mean": 0.07659623958170414, "clip_ratio/high_max": 0.07659623958170414, "clip_ratio/region_mean": 0.13921882957220078, "reward_total_mean": 0.28297725319862366, "reward_meter_mean": 0.6664940118789673, "reward_meter_std": 0.4521222710609436, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8626080751419067, "reward_lexical_plausibility_std": 0.2585444450378418, "reward_repeat_penalty_mean": 0.9925903081893921, "reward_repeat_penalty_std": 0.01526072807610035, "reward_near_duplicate_penalty_mean": 0.9925903081893921, "reward_near_duplicate_penalty_std": 0.01526072807610035, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.38101136684417725, "reward_total_composite_mean": 0.28297725319862366, "reward_total_composite_std": 0.35254907608032227} {"timestamp_utc": "2026-04-12T12:09:14Z", "mode": "train", "global_step": 367, "epoch": 0.014740731815078121, "loss": -0.025, "grad_norm": 6.268082141876221, "learning_rate": 8.890909090909091e-06, "num_tokens": 731992.0, "completions/mean_length": 117.25, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.857147216796875, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.356907457113266, "rewards/meter/std": 0.3961610794067383, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9265891909599304, "rewards/lexical_plausibility/std": 0.20763714611530304, "rewards/judge_quality/mean": 0.48375001549720764, "rewards/judge_quality/std": 0.3717886507511139, "rewards/repeat_penalty/mean": 0.9814070463180542, "rewards/repeat_penalty/std": 0.012411732226610184, "rewards/near_duplicate_penalty/mean": 0.9814070463180542, "rewards/near_duplicate_penalty/std": 0.012411732226610184, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27941232919692993, "rewards/total_composite/std": 0.354913592338562, "reward": 0.27941232919692993, "reward_std": 0.354913592338562, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20100927352905273, "sampling/sampling_logp_difference/max": 1.6287550926208496, "sampling/importance_sampling_ratio/min": 0.19617362320423126, "sampling/importance_sampling_ratio/mean": 1.0245027542114258, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6056828796863556, "clip_ratio/low_mean": 0.09891764167696238, "clip_ratio/low_min": 0.09891764167696238, "clip_ratio/high_mean": 0.0677736010402441, "clip_ratio/high_max": 0.0677736010402441, "clip_ratio/region_mean": 0.16669124271720648, "reward_total_mean": 0.27941232919692993, "reward_meter_mean": 0.356907457113266, "reward_meter_std": 0.3961610794067383, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9265891909599304, "reward_lexical_plausibility_std": 0.20763714611530304, "reward_repeat_penalty_mean": 0.9814070463180542, "reward_repeat_penalty_std": 0.012411732226610184, "reward_near_duplicate_penalty_mean": 0.9814070463180542, "reward_near_duplicate_penalty_std": 0.012411732226610184, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48375001549720764, "reward_judge_quality_std": 0.3717886507511139, "reward_total_composite_mean": 0.27941232919692993, "reward_total_composite_std": 0.354913592338562} {"timestamp_utc": "2026-04-12T12:09:23Z", "mode": "train", "global_step": 368, "epoch": 0.014780897296863075, "loss": 0.1164, "grad_norm": 21.416719436645508, "learning_rate": 8.887878787878789e-06, "num_tokens": 733654.0, "completions/mean_length": 38.75, "completions/min_length": 34.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.75, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7224254012107849, "rewards/meter/std": 0.34737133979797363, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9940342903137207, "rewards/repeat_penalty/std": 0.008988606743514538, "rewards/near_duplicate_penalty/mean": 0.9940342903137207, "rewards/near_duplicate_penalty/std": 0.008988606743514538, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2602403461933136, "rewards/total_composite/std": 0.18446087837219238, "reward": 0.2602403461933136, "reward_std": 0.18446087837219238, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18854431807994843, "sampling/sampling_logp_difference/max": 1.5036060810089111, "sampling/importance_sampling_ratio/min": 0.22232699394226074, "sampling/importance_sampling_ratio/mean": 0.9972913265228271, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5983603745698929, "clip_ratio/low_mean": 0.04927333444356918, "clip_ratio/low_min": 0.04927333444356918, "clip_ratio/high_mean": 0.11093856766819954, "clip_ratio/high_max": 0.11093856766819954, "clip_ratio/region_mean": 0.16021190211176872, "reward_total_mean": 0.2602403461933136, "reward_meter_mean": 0.7224254012107849, "reward_meter_std": 0.34737133979797363, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9940342903137207, "reward_repeat_penalty_std": 0.008988606743514538, "reward_near_duplicate_penalty_mean": 0.9940342903137207, "reward_near_duplicate_penalty_std": 0.008988606743514538, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.2602403461933136, "reward_total_composite_std": 0.18446087837219238} {"timestamp_utc": "2026-04-12T12:09:33Z", "mode": "train", "global_step": 369, "epoch": 0.01482106277864803, "loss": 0.003, "grad_norm": 11.890995025634766, "learning_rate": 8.884848484848486e-06, "num_tokens": 735556.0, "completions/mean_length": 66.75, "completions/min_length": 57.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.75, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.7550082206726074, "rewards/meter/std": 0.34770846366882324, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9890648722648621, "rewards/lexical_plausibility/std": 0.03092925436794758, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.887050986289978, "rewards/repeat_penalty/std": 0.21987536549568176, "rewards/near_duplicate_penalty/mean": 0.9636750221252441, "rewards/near_duplicate_penalty/std": 0.04604289308190346, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9254437685012817, "rewards/distinct_2/std": 0.16680213809013367, "rewards/total_composite/mean": 0.32750314474105835, "rewards/total_composite/std": 0.15115393698215485, "reward": 0.32750314474105835, "reward_std": 0.15115393698215485, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14748868346214294, "sampling/sampling_logp_difference/max": 1.5324044227600098, "sampling/importance_sampling_ratio/min": 0.21601565182209015, "sampling/importance_sampling_ratio/mean": 1.0249985456466675, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.081573411822319, "clip_ratio/low_mean": 0.029146634973585606, "clip_ratio/low_min": 0.029146634973585606, "clip_ratio/high_mean": 0.0987002206966281, "clip_ratio/high_max": 0.0987002206966281, "clip_ratio/region_mean": 0.1278468556702137, "reward_total_mean": 0.32750314474105835, "reward_meter_mean": 0.7550082206726074, "reward_meter_std": 0.34770846366882324, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9890648722648621, "reward_lexical_plausibility_std": 0.03092925436794758, "reward_repeat_penalty_mean": 0.887050986289978, "reward_repeat_penalty_std": 0.21987536549568176, "reward_near_duplicate_penalty_mean": 0.9636750221252441, "reward_near_duplicate_penalty_std": 0.04604289308190346, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9254437685012817, "reward_distinct_2_std": 0.16680213809013367, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.32750314474105835, "reward_total_composite_std": 0.15115393698215485} {"timestamp_utc": "2026-04-12T12:09:46Z", "mode": "train", "global_step": 370, "epoch": 0.014861228260432983, "loss": -0.073, "grad_norm": 3.1572275161743164, "learning_rate": 8.881818181818183e-06, "num_tokens": 737047.0, "completions/mean_length": 158.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.8391140699386597, "rewards/meter/std": 0.3399761915206909, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.7502424716949463, "rewards/lexical_plausibility/std": 0.26979056000709534, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.7485777735710144, "rewards/repeat_penalty/std": 0.36676982045173645, "rewards/near_duplicate_penalty/mean": 0.9593077301979065, "rewards/near_duplicate_penalty/std": 0.04626181349158287, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.3471825420856476, "rewards/distinct_2/mean": 0.9055330753326416, "rewards/distinct_2/std": 0.1304432600736618, "rewards/total_composite/mean": 0.23798933625221252, "rewards/total_composite/std": 0.18960289657115936, "reward": 0.23798933625221252, "reward_std": 0.18960291147232056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2261786013841629, "sampling/sampling_logp_difference/max": 1.7096266746520996, "sampling/importance_sampling_ratio/min": 0.18093332648277283, "sampling/importance_sampling_ratio/mean": 1.053892970085144, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4391814470291138, "clip_ratio/low_mean": 0.04377736151218414, "clip_ratio/low_min": 0.04377736151218414, "clip_ratio/high_mean": 0.06570638995617628, "clip_ratio/high_max": 0.06570638995617628, "clip_ratio/region_mean": 0.10948375146836042, "reward_total_mean": 0.23798933625221252, "reward_meter_mean": 0.8391140699386597, "reward_meter_std": 0.3399761915206909, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.7502424716949463, "reward_lexical_plausibility_std": 0.26979056000709534, "reward_repeat_penalty_mean": 0.7485777735710144, "reward_repeat_penalty_std": 0.36676982045173645, "reward_near_duplicate_penalty_mean": 0.9593077301979065, "reward_near_duplicate_penalty_std": 0.04626181349158287, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.3471825420856476, "reward_distinct_2_mean": 0.9055330753326416, "reward_distinct_2_std": 0.1304432600736618, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.23798933625221252, "reward_total_composite_std": 0.18960289657115936} {"timestamp_utc": "2026-04-12T12:10:01Z", "mode": "train", "global_step": 371, "epoch": 0.014901393742217937, "loss": -0.1166, "grad_norm": 2.637321710586548, "learning_rate": 8.87878787878788e-06, "num_tokens": 740804.0, "completions/mean_length": 311.625, "completions/min_length": 232.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 283.0, "completions/min_terminated_length": 232.0, "completions/max_terminated_length": 337.0, "rewards/meter/mean": 0.7757177948951721, "rewards/meter/std": 0.344845712184906, "rewards/count_adherence/mean": 0.7604166269302368, "rewards/count_adherence/std": 0.05340581759810448, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9530562162399292, "rewards/lexical_plausibility/std": 0.1327771246433258, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.22648166120052338, "rewards/repeat_penalty/std": 0.34410199522972107, "rewards/near_duplicate_penalty/mean": 0.7649456262588501, "rewards/near_duplicate_penalty/std": 0.14382021129131317, "rewards/opening_diversity/mean": 0.8883928656578064, "rewards/opening_diversity/std": 0.1704024374485016, "rewards/distinct_2/mean": 0.2804200053215027, "rewards/distinct_2/std": 0.3543919622898102, "rewards/total_composite/mean": 0.13439007103443146, "rewards/total_composite/std": 0.08367897570133209, "reward": 0.13439007103443146, "reward_std": 0.08367897570133209, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0919528529047966, "sampling/sampling_logp_difference/max": 2.24222469329834, "sampling/importance_sampling_ratio/min": 0.10622192919254303, "sampling/importance_sampling_ratio/mean": 1.019260287284851, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6797917410731316, "clip_ratio/low_mean": 0.02716411859728396, "clip_ratio/low_min": 0.02716411859728396, "clip_ratio/high_mean": 0.04265493992716074, "clip_ratio/high_max": 0.04265493992716074, "clip_ratio/region_mean": 0.0698190585244447, "reward_total_mean": 0.13439007103443146, "reward_meter_mean": 0.7757177948951721, "reward_meter_std": 0.344845712184906, "reward_count_adherence_mean": 0.7604166269302368, "reward_count_adherence_std": 0.05340581759810448, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9530562162399292, "reward_lexical_plausibility_std": 0.1327771246433258, "reward_repeat_penalty_mean": 0.22648166120052338, "reward_repeat_penalty_std": 0.34410199522972107, "reward_near_duplicate_penalty_mean": 0.7649456262588501, "reward_near_duplicate_penalty_std": 0.14382021129131317, "reward_opening_diversity_mean": 0.8883928656578064, "reward_opening_diversity_std": 0.1704024374485016, "reward_distinct_2_mean": 0.2804200053215027, "reward_distinct_2_std": 0.3543919622898102, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.13439007103443146, "reward_total_composite_std": 0.08367897570133209} {"timestamp_utc": "2026-04-12T12:10:12Z", "mode": "train", "global_step": 372, "epoch": 0.014941559224002893, "loss": 0.0657, "grad_norm": 7.444216728210449, "learning_rate": 8.875757575757576e-06, "num_tokens": 743324.0, "completions/mean_length": 111.0, "completions/min_length": 103.0, "completions/max_length": 137.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.0, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 137.0, "rewards/meter/mean": 0.7907493114471436, "rewards/meter/std": 0.28211304545402527, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.2547512948513031, "rewards/repeat_penalty/mean": 0.7878605723381042, "rewards/repeat_penalty/std": 0.3069226145744324, "rewards/near_duplicate_penalty/mean": 0.9179651141166687, "rewards/near_duplicate_penalty/std": 0.13240814208984375, "rewards/opening_diversity/mean": 0.8999999761581421, "rewards/opening_diversity/std": 0.24494896829128265, "rewards/distinct_2/mean": 0.8616527318954468, "rewards/distinct_2/std": 0.2173728346824646, "rewards/total_composite/mean": 0.29524925351142883, "rewards/total_composite/std": 0.27520182728767395, "reward": 0.29524925351142883, "reward_std": 0.27520182728767395, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16958843171596527, "sampling/sampling_logp_difference/max": 1.742572546005249, "sampling/importance_sampling_ratio/min": 0.17506945133209229, "sampling/importance_sampling_ratio/mean": 1.0220175981521606, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2887337058782578, "clip_ratio/low_mean": 0.06503461673855782, "clip_ratio/low_min": 0.06503461673855782, "clip_ratio/high_mean": 0.07919359020888805, "clip_ratio/high_max": 0.07919359020888805, "clip_ratio/region_mean": 0.14422820694744587, "reward_total_mean": 0.29524925351142883, "reward_meter_mean": 0.7907493114471436, "reward_meter_std": 0.28211304545402527, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7878605723381042, "reward_repeat_penalty_std": 0.3069226145744324, "reward_near_duplicate_penalty_mean": 0.9179651141166687, "reward_near_duplicate_penalty_std": 0.13240814208984375, "reward_opening_diversity_mean": 0.8999999761581421, "reward_opening_diversity_std": 0.24494896829128265, "reward_distinct_2_mean": 0.8616527318954468, "reward_distinct_2_std": 0.2173728346824646, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.2547512948513031, "reward_total_composite_mean": 0.29524925351142883, "reward_total_composite_std": 0.27520182728767395} {"timestamp_utc": "2026-04-12T12:10:27Z", "mode": "train", "global_step": 373, "epoch": 0.014981724705787847, "loss": -0.1954, "grad_norm": 4.453275680541992, "learning_rate": 8.872727272727275e-06, "num_tokens": 745846.0, "completions/mean_length": 190.25, "completions/min_length": 121.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 144.2857208251953, "completions/min_terminated_length": 121.0, "completions/max_terminated_length": 175.0, "rewards/meter/mean": 0.7178395986557007, "rewards/meter/std": 0.31169822812080383, "rewards/count_adherence/mean": 0.8214285373687744, "rewards/count_adherence/std": 0.10101524740457535, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9609147310256958, "rewards/lexical_plausibility/std": 0.11054975539445877, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.053452249616384506, "rewards/repeat_penalty/mean": 0.2428719401359558, "rewards/repeat_penalty/std": 0.325005441904068, "rewards/near_duplicate_penalty/mean": 0.7483271360397339, "rewards/near_duplicate_penalty/std": 0.13887473940849304, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.0708683431148529, "rewards/distinct_2/mean": 0.3178720474243164, "rewards/distinct_2/std": 0.32134172320365906, "rewards/total_composite/mean": 0.0996420755982399, "rewards/total_composite/std": 0.06269153207540512, "reward": 0.0996420755982399, "reward_std": 0.06269153207540512, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10872436314821243, "sampling/sampling_logp_difference/max": 2.3243393898010254, "sampling/importance_sampling_ratio/min": 0.09784805774688721, "sampling/importance_sampling_ratio/mean": 1.013803243637085, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7211753651499748, "clip_ratio/low_mean": 0.03993580583482981, "clip_ratio/low_min": 0.03993580583482981, "clip_ratio/high_mean": 0.04232870461419225, "clip_ratio/high_max": 0.04232870461419225, "clip_ratio/region_mean": 0.08226451044902205, "reward_total_mean": 0.0996420755982399, "reward_meter_mean": 0.7178395986557007, "reward_meter_std": 0.31169822812080383, "reward_count_adherence_mean": 0.8214285373687744, "reward_count_adherence_std": 0.10101524740457535, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9609147310256958, "reward_lexical_plausibility_std": 0.11054975539445877, "reward_repeat_penalty_mean": 0.2428719401359558, "reward_repeat_penalty_std": 0.325005441904068, "reward_near_duplicate_penalty_mean": 0.7483271360397339, "reward_near_duplicate_penalty_std": 0.13887473940849304, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.0708683431148529, "reward_distinct_2_mean": 0.3178720474243164, "reward_distinct_2_std": 0.32134172320365906, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.053452249616384506, "reward_total_composite_mean": 0.0996420755982399, "reward_total_composite_std": 0.06269153207540512} {"timestamp_utc": "2026-04-12T12:10:36Z", "mode": "train", "global_step": 374, "epoch": 0.0150218901875728, "loss": 0.1091, "grad_norm": 41.12314224243164, "learning_rate": 8.86969696969697e-06, "num_tokens": 747377.0, "completions/mean_length": 36.375, "completions/min_length": 31.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.2555834650993347, "rewards/meter/std": 0.29624059796333313, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9736520051956177, "rewards/lexical_plausibility/std": 0.06404155492782593, "rewards/judge_quality/mean": 0.6387499570846558, "rewards/judge_quality/std": 0.24718055129051208, "rewards/repeat_penalty/mean": 0.9591344594955444, "rewards/repeat_penalty/std": 0.09540197253227234, "rewards/near_duplicate_penalty/mean": 0.9807000756263733, "rewards/near_duplicate_penalty/std": 0.035517483949661255, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9759615659713745, "rewards/distinct_2/std": 0.06799104809761047, "rewards/total_composite/mean": 0.1528775990009308, "rewards/total_composite/std": 0.2018582969903946, "reward": 0.1528775990009308, "reward_std": 0.2018582969903946, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21097850799560547, "sampling/sampling_logp_difference/max": 3.235154628753662, "sampling/importance_sampling_ratio/min": 0.0393541194498539, "sampling/importance_sampling_ratio/mean": 0.9728639125823975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.014286793768406, "clip_ratio/low_mean": 0.12410887982696295, "clip_ratio/low_min": 0.12410887982696295, "clip_ratio/high_mean": 0.04423564113676548, "clip_ratio/high_max": 0.04423564113676548, "clip_ratio/region_mean": 0.16834452096372843, "reward_total_mean": 0.1528775990009308, "reward_meter_mean": 0.2555834650993347, "reward_meter_std": 0.29624059796333313, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9736520051956177, "reward_lexical_plausibility_std": 0.06404155492782593, "reward_repeat_penalty_mean": 0.9591344594955444, "reward_repeat_penalty_std": 0.09540197253227234, "reward_near_duplicate_penalty_mean": 0.9807000756263733, "reward_near_duplicate_penalty_std": 0.035517483949661255, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9759615659713745, "reward_distinct_2_std": 0.06799104809761047, "reward_judge_quality_mean": 0.6387499570846558, "reward_judge_quality_std": 0.24718055129051208, "reward_total_composite_mean": 0.1528775990009308, "reward_total_composite_std": 0.2018582969903946} {"timestamp_utc": "2026-04-12T12:10:51Z", "mode": "train", "global_step": 375, "epoch": 0.015062055669357755, "loss": -0.0953, "grad_norm": 5.994908332824707, "learning_rate": 8.866666666666668e-06, "num_tokens": 749572.0, "completions/mean_length": 149.375, "completions/min_length": 81.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 97.5714340209961, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 126.0, "rewards/meter/mean": 0.5356355905532837, "rewards/meter/std": 0.4026618003845215, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9289287328720093, "rewards/lexical_plausibility/std": 0.16733857989311218, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.9829912781715393, "rewards/repeat_penalty/std": 0.025840558111667633, "rewards/near_duplicate_penalty/mean": 0.9910508990287781, "rewards/near_duplicate_penalty/std": 0.005874638445675373, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9918166995048523, "rewards/distinct_2/std": 0.02314588986337185, "rewards/total_composite/mean": 0.14762334525585175, "rewards/total_composite/std": 0.16437840461730957, "reward": 0.14762334525585175, "reward_std": 0.16437838971614838, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19908767938613892, "sampling/sampling_logp_difference/max": 1.4282140731811523, "sampling/importance_sampling_ratio/min": 0.23973669111728668, "sampling/importance_sampling_ratio/mean": 1.054633378982544, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2022953629493713, "clip_ratio/low_mean": 0.09793355409055948, "clip_ratio/low_min": 0.09793355409055948, "clip_ratio/high_mean": 0.057337455451488495, "clip_ratio/high_max": 0.057337455451488495, "clip_ratio/region_mean": 0.15527100954204798, "reward_total_mean": 0.14762334525585175, "reward_meter_mean": 0.5356355905532837, "reward_meter_std": 0.4026618003845215, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9289287328720093, "reward_lexical_plausibility_std": 0.16733857989311218, "reward_repeat_penalty_mean": 0.9829912781715393, "reward_repeat_penalty_std": 0.025840558111667633, "reward_near_duplicate_penalty_mean": 0.9910508990287781, "reward_near_duplicate_penalty_std": 0.005874638445675373, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9918166995048523, "reward_distinct_2_std": 0.02314588986337185, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.14762334525585175, "reward_total_composite_std": 0.16437840461730957} {"timestamp_utc": "2026-04-12T12:11:00Z", "mode": "train", "global_step": 376, "epoch": 0.015102221151142708, "loss": 0.0492, "grad_norm": 14.439682960510254, "learning_rate": 8.863636363636365e-06, "num_tokens": 751219.0, "completions/mean_length": 42.875, "completions/min_length": 35.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8486638069152832, "rewards/meter/std": 0.3000448942184448, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6050000190734863, "rewards/judge_quality/std": 0.2562365233898163, "rewards/repeat_penalty/mean": 0.9722264409065247, "rewards/repeat_penalty/std": 0.032479945570230484, "rewards/near_duplicate_penalty/mean": 0.9722264409065247, "rewards/near_duplicate_penalty/std": 0.032479945570230484, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5369139909744263, "rewards/total_composite/std": 0.3224915564060211, "reward": 0.5369139909744263, "reward_std": 0.3224915564060211, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19373628497123718, "sampling/sampling_logp_difference/max": 1.5680522918701172, "sampling/importance_sampling_ratio/min": 0.2084507793188095, "sampling/importance_sampling_ratio/mean": 1.0286318063735962, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.440964788198471, "clip_ratio/low_mean": 0.07526303362101316, "clip_ratio/low_min": 0.07526303362101316, "clip_ratio/high_mean": 0.09555895812809467, "clip_ratio/high_max": 0.09555895812809467, "clip_ratio/region_mean": 0.17082199174910784, "reward_total_mean": 0.5369139909744263, "reward_meter_mean": 0.8486638069152832, "reward_meter_std": 0.3000448942184448, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9722264409065247, "reward_repeat_penalty_std": 0.032479945570230484, "reward_near_duplicate_penalty_mean": 0.9722264409065247, "reward_near_duplicate_penalty_std": 0.032479945570230484, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6050000190734863, "reward_judge_quality_std": 0.2562365233898163, "reward_total_composite_mean": 0.5369139909744263, "reward_total_composite_std": 0.3224915564060211} {"timestamp_utc": "2026-04-12T12:11:09Z", "mode": "train", "global_step": 377, "epoch": 0.015142386632927662, "loss": 0.0307, "grad_norm": 14.737468719482422, "learning_rate": 8.860606060606062e-06, "num_tokens": 752985.0, "completions/mean_length": 55.75, "completions/min_length": 45.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.75, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.6870785355567932, "rewards/meter/std": 0.3609475791454315, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9819004535675049, "rewards/lexical_plausibility/std": 0.051193248480558395, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9524993896484375, "rewards/repeat_penalty/std": 0.03423053398728371, "rewards/near_duplicate_penalty/mean": 0.9809752702713013, "rewards/near_duplicate_penalty/std": 0.01396517176181078, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.970942497253418, "rewards/distinct_2/std": 0.03109455294907093, "rewards/total_composite/mean": 0.27244529128074646, "rewards/total_composite/std": 0.198111429810524, "reward": 0.27244529128074646, "reward_std": 0.1981114149093628, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18403708934783936, "sampling/sampling_logp_difference/max": 1.1885719299316406, "sampling/importance_sampling_ratio/min": 0.3046560287475586, "sampling/importance_sampling_ratio/mean": 1.0245411396026611, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4230965971946716, "clip_ratio/low_mean": 0.06366641912609339, "clip_ratio/low_min": 0.06366641912609339, "clip_ratio/high_mean": 0.11802011355757713, "clip_ratio/high_max": 0.11802011355757713, "clip_ratio/region_mean": 0.18168653268367052, "reward_total_mean": 0.27244529128074646, "reward_meter_mean": 0.6870785355567932, "reward_meter_std": 0.3609475791454315, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9819004535675049, "reward_lexical_plausibility_std": 0.051193248480558395, "reward_repeat_penalty_mean": 0.9524993896484375, "reward_repeat_penalty_std": 0.03423053398728371, "reward_near_duplicate_penalty_mean": 0.9809752702713013, "reward_near_duplicate_penalty_std": 0.01396517176181078, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.970942497253418, "reward_distinct_2_std": 0.03109455294907093, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.27244529128074646, "reward_total_composite_std": 0.198111429810524} {"timestamp_utc": "2026-04-12T12:11:17Z", "mode": "train", "global_step": 378, "epoch": 0.015182552114712616, "loss": 0.0757, "grad_norm": 10.974468231201172, "learning_rate": 8.857575757575758e-06, "num_tokens": 754475.0, "completions/mean_length": 38.25, "completions/min_length": 28.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.25, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.8403074145317078, "rewards/meter/std": 0.29901474714279175, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9424999952316284, "rewards/judge_quality/std": 0.013887288980185986, "rewards/repeat_penalty/mean": 0.9988548159599304, "rewards/repeat_penalty/std": 0.0021204412914812565, "rewards/near_duplicate_penalty/mean": 0.9988548159599304, "rewards/near_duplicate_penalty/std": 0.0021204412914812565, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7942900657653809, "rewards/total_composite/std": 0.28384438157081604, "reward": 0.7942900657653809, "reward_std": 0.28384435176849365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09076273441314697, "sampling/sampling_logp_difference/max": 1.290827751159668, "sampling/importance_sampling_ratio/min": 0.2750430107116699, "sampling/importance_sampling_ratio/mean": 1.006481647491455, "sampling/importance_sampling_ratio/max": 1.91322660446167, "entropy": 0.5385432429611683, "clip_ratio/low_mean": 0.023403679952025414, "clip_ratio/low_min": 0.023403679952025414, "clip_ratio/high_mean": 0.07889919588342309, "clip_ratio/high_max": 0.07889919588342309, "clip_ratio/region_mean": 0.1023028758354485, "reward_total_mean": 0.7942900657653809, "reward_meter_mean": 0.8403074145317078, "reward_meter_std": 0.29901474714279175, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9988548159599304, "reward_repeat_penalty_std": 0.0021204412914812565, "reward_near_duplicate_penalty_mean": 0.9988548159599304, "reward_near_duplicate_penalty_std": 0.0021204412914812565, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9424999952316284, "reward_judge_quality_std": 0.013887288980185986, "reward_total_composite_mean": 0.7942900657653809, "reward_total_composite_std": 0.28384438157081604} {"timestamp_utc": "2026-04-12T12:11:26Z", "mode": "train", "global_step": 379, "epoch": 0.01522271759649757, "loss": 0.0397, "grad_norm": 18.5172119140625, "learning_rate": 8.854545454545455e-06, "num_tokens": 755762.0, "completions/mean_length": 21.875, "completions/min_length": 17.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.6731079816818237, "rewards/meter/std": 0.4193631112575531, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9007352590560913, "rewards/lexical_plausibility/std": 0.13948148488998413, "rewards/judge_quality/mean": 0.7549999952316284, "rewards/judge_quality/std": 0.25286927819252014, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5350714325904846, "rewards/total_composite/std": 0.4054333567619324, "reward": 0.5350714325904846, "reward_std": 0.40543332695961, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1621473729610443, "sampling/sampling_logp_difference/max": 1.5050764083862305, "sampling/importance_sampling_ratio/min": 0.2220003455877304, "sampling/importance_sampling_ratio/mean": 1.0216091871261597, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3622380644083023, "clip_ratio/low_mean": 0.1026265425607562, "clip_ratio/low_min": 0.1026265425607562, "clip_ratio/high_mean": 0.05757147399708629, "clip_ratio/high_max": 0.05757147399708629, "clip_ratio/region_mean": 0.1601980165578425, "reward_total_mean": 0.5350714325904846, "reward_meter_mean": 0.6731079816818237, "reward_meter_std": 0.4193631112575531, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9007352590560913, "reward_lexical_plausibility_std": 0.13948148488998413, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7549999952316284, "reward_judge_quality_std": 0.25286927819252014, "reward_total_composite_mean": 0.5350714325904846, "reward_total_composite_std": 0.4054333567619324} {"timestamp_utc": "2026-04-12T12:11:37Z", "mode": "train", "global_step": 380, "epoch": 0.015262883078282524, "loss": 0.0575, "grad_norm": 11.882780075073242, "learning_rate": 8.851515151515152e-06, "num_tokens": 757708.0, "completions/mean_length": 79.25, "completions/min_length": 64.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.25, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.6264046430587769, "rewards/meter/std": 0.3158259689807892, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.8990840315818787, "rewards/repeat_penalty/std": 0.11603206396102905, "rewards/near_duplicate_penalty/mean": 0.9785974025726318, "rewards/near_duplicate_penalty/std": 0.00721503421664238, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9187901020050049, "rewards/distinct_2/std": 0.11846604943275452, "rewards/total_composite/mean": 0.16143256425857544, "rewards/total_composite/std": 0.1607261598110199, "reward": 0.16143256425857544, "reward_std": 0.1607261449098587, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18200050294399261, "sampling/sampling_logp_difference/max": 1.4343328475952148, "sampling/importance_sampling_ratio/min": 0.23827427625656128, "sampling/importance_sampling_ratio/mean": 1.0386003255844116, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3949623852968216, "clip_ratio/low_mean": 0.11346772685647011, "clip_ratio/low_min": 0.11346772685647011, "clip_ratio/high_mean": 0.062230393290519714, "clip_ratio/high_max": 0.062230393290519714, "clip_ratio/region_mean": 0.17569812014698982, "reward_total_mean": 0.16143256425857544, "reward_meter_mean": 0.6264046430587769, "reward_meter_std": 0.3158259689807892, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8990840315818787, "reward_repeat_penalty_std": 0.11603206396102905, "reward_near_duplicate_penalty_mean": 0.9785974025726318, "reward_near_duplicate_penalty_std": 0.00721503421664238, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9187901020050049, "reward_distinct_2_std": 0.11846604943275452, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.16143256425857544, "reward_total_composite_std": 0.1607261598110199} {"timestamp_utc": "2026-04-12T12:11:52Z", "mode": "train", "global_step": 381, "epoch": 0.015303048560067478, "loss": -0.0713, "grad_norm": 5.488112926483154, "learning_rate": 8.84848484848485e-06, "num_tokens": 759306.0, "completions/mean_length": 101.75, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.142860412597656, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5872917175292969, "rewards/meter/std": 0.45493966341018677, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9488881230354309, "rewards/lexical_plausibility/std": 0.14456620812416077, "rewards/judge_quality/mean": 0.5249999761581421, "rewards/judge_quality/std": 0.30019041895866394, "rewards/repeat_penalty/mean": 0.929169774055481, "rewards/repeat_penalty/std": 0.1116023063659668, "rewards/near_duplicate_penalty/mean": 0.991669774055481, "rewards/near_duplicate_penalty/std": 0.015882477164268494, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3641815185546875, "rewards/total_composite/std": 0.36358609795570374, "reward": 0.3641815185546875, "reward_std": 0.36358609795570374, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17417752742767334, "sampling/sampling_logp_difference/max": 1.2228634357452393, "sampling/importance_sampling_ratio/min": 0.29438599944114685, "sampling/importance_sampling_ratio/mean": 1.01909601688385, "sampling/importance_sampling_ratio/max": 1.985019326210022, "entropy": 1.4191492050886154, "clip_ratio/low_mean": 0.07792874425649643, "clip_ratio/low_min": 0.07792874425649643, "clip_ratio/high_mean": 0.09363781986758113, "clip_ratio/high_max": 0.09363781986758113, "clip_ratio/region_mean": 0.17156656412407756, "reward_total_mean": 0.3641815185546875, "reward_meter_mean": 0.5872917175292969, "reward_meter_std": 0.45493966341018677, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9488881230354309, "reward_lexical_plausibility_std": 0.14456620812416077, "reward_repeat_penalty_mean": 0.929169774055481, "reward_repeat_penalty_std": 0.1116023063659668, "reward_near_duplicate_penalty_mean": 0.991669774055481, "reward_near_duplicate_penalty_std": 0.015882477164268494, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5249999761581421, "reward_judge_quality_std": 0.30019041895866394, "reward_total_composite_mean": 0.3641815185546875, "reward_total_composite_std": 0.36358609795570374} {"timestamp_utc": "2026-04-12T12:12:06Z", "mode": "train", "global_step": 382, "epoch": 0.015343214041852432, "loss": -0.0402, "grad_norm": 2.7200467586517334, "learning_rate": 8.845454545454547e-06, "num_tokens": 760702.0, "completions/mean_length": 155.5, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 36.66666793823242, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.4661267101764679, "rewards/meter/std": 0.4470050632953644, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8494057655334473, "rewards/lexical_plausibility/std": 0.2792769968509674, "rewards/judge_quality/mean": 0.6312500238418579, "rewards/judge_quality/std": 0.40912583470344543, "rewards/repeat_penalty/mean": 0.9924811124801636, "rewards/repeat_penalty/std": 0.010740749537944794, "rewards/near_duplicate_penalty/mean": 0.9924811124801636, "rewards/near_duplicate_penalty/std": 0.010740749537944794, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.35822466015815735, "rewards/total_composite/std": 0.37213534116744995, "reward": 0.35822466015815735, "reward_std": 0.37213531136512756, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1962714046239853, "sampling/sampling_logp_difference/max": 1.5085039138793945, "sampling/importance_sampling_ratio/min": 0.22124072909355164, "sampling/importance_sampling_ratio/mean": 1.04746675491333, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4118845611810684, "clip_ratio/low_mean": 0.062454101629555225, "clip_ratio/low_min": 0.062454101629555225, "clip_ratio/high_mean": 0.08005218207836151, "clip_ratio/high_max": 0.08005218207836151, "clip_ratio/region_mean": 0.14250628370791674, "reward_total_mean": 0.35822466015815735, "reward_meter_mean": 0.4661267101764679, "reward_meter_std": 0.4470050632953644, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8494057655334473, "reward_lexical_plausibility_std": 0.2792769968509674, "reward_repeat_penalty_mean": 0.9924811124801636, "reward_repeat_penalty_std": 0.010740749537944794, "reward_near_duplicate_penalty_mean": 0.9924811124801636, "reward_near_duplicate_penalty_std": 0.010740749537944794, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6312500238418579, "reward_judge_quality_std": 0.40912583470344543, "reward_total_composite_mean": 0.35822466015815735, "reward_total_composite_std": 0.37213534116744995} {"timestamp_utc": "2026-04-12T12:12:20Z", "mode": "train", "global_step": 383, "epoch": 0.015383379523637386, "loss": -0.1226, "grad_norm": 3.965210199356079, "learning_rate": 8.842424242424244e-06, "num_tokens": 763085.0, "completions/mean_length": 216.875, "completions/min_length": 114.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 118.5, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.8149964809417725, "rewards/meter/std": 0.2945411205291748, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9053611159324646, "rewards/lexical_plausibility/std": 0.186506986618042, "rewards/judge_quality/mean": 0.35374999046325684, "rewards/judge_quality/std": 0.25933638215065, "rewards/repeat_penalty/mean": 0.9663739800453186, "rewards/repeat_penalty/std": 0.0157057773321867, "rewards/near_duplicate_penalty/mean": 0.9774044752120972, "rewards/near_duplicate_penalty/std": 0.014795432798564434, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9887775182723999, "rewards/distinct_2/std": 0.013228368945419788, "rewards/total_composite/mean": 0.30963075160980225, "rewards/total_composite/std": 0.29092901945114136, "reward": 0.30963075160980225, "reward_std": 0.29092898964881897, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17502562701702118, "sampling/sampling_logp_difference/max": 1.551018238067627, "sampling/importance_sampling_ratio/min": 0.21203197538852692, "sampling/importance_sampling_ratio/mean": 1.0135414600372314, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0135677829384804, "clip_ratio/low_mean": 0.013888888992369175, "clip_ratio/low_min": 0.013888888992369175, "clip_ratio/high_mean": 0.10714712552726269, "clip_ratio/high_max": 0.10714712552726269, "clip_ratio/region_mean": 0.12103601451963186, "reward_total_mean": 0.30963075160980225, "reward_meter_mean": 0.8149964809417725, "reward_meter_std": 0.2945411205291748, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9053611159324646, "reward_lexical_plausibility_std": 0.186506986618042, "reward_repeat_penalty_mean": 0.9663739800453186, "reward_repeat_penalty_std": 0.0157057773321867, "reward_near_duplicate_penalty_mean": 0.9774044752120972, "reward_near_duplicate_penalty_std": 0.014795432798564434, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9887775182723999, "reward_distinct_2_std": 0.013228368945419788, "reward_judge_quality_mean": 0.35374999046325684, "reward_judge_quality_std": 0.25933638215065, "reward_total_composite_mean": 0.30963075160980225, "reward_total_composite_std": 0.29092901945114136} {"timestamp_utc": "2026-04-12T12:12:29Z", "mode": "train", "global_step": 384, "epoch": 0.01542354500542234, "loss": 0.0435, "grad_norm": 12.701199531555176, "learning_rate": 8.83939393939394e-06, "num_tokens": 764932.0, "completions/mean_length": 49.875, "completions/min_length": 44.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.875, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6360716819763184, "rewards/meter/std": 0.4111797511577606, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9864082336425781, "rewards/lexical_plausibility/std": 0.0384434312582016, "rewards/judge_quality/mean": 0.7850000262260437, "rewards/judge_quality/std": 0.26880690455436707, "rewards/repeat_penalty/mean": 0.9830220937728882, "rewards/repeat_penalty/std": 0.022771036252379417, "rewards/near_duplicate_penalty/mean": 0.9913833141326904, "rewards/near_duplicate_penalty/std": 0.011131873354315758, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.5121535062789917, "rewards/total_composite/std": 0.3908560574054718, "reward": 0.5121535062789917, "reward_std": 0.3908560574054718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13641001284122467, "sampling/sampling_logp_difference/max": 1.4167276620864868, "sampling/importance_sampling_ratio/min": 0.24250628054141998, "sampling/importance_sampling_ratio/mean": 1.0251556634902954, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0516512989997864, "clip_ratio/low_mean": 0.054174209013581276, "clip_ratio/low_min": 0.054174209013581276, "clip_ratio/high_mean": 0.057848403230309486, "clip_ratio/high_max": 0.057848403230309486, "clip_ratio/region_mean": 0.11202261224389076, "reward_total_mean": 0.5121535062789917, "reward_meter_mean": 0.6360716819763184, "reward_meter_std": 0.4111797511577606, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9864082336425781, "reward_lexical_plausibility_std": 0.0384434312582016, "reward_repeat_penalty_mean": 0.9830220937728882, "reward_repeat_penalty_std": 0.022771036252379417, "reward_near_duplicate_penalty_mean": 0.9913833141326904, "reward_near_duplicate_penalty_std": 0.011131873354315758, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.7850000262260437, "reward_judge_quality_std": 0.26880690455436707, "reward_total_composite_mean": 0.5121535062789917, "reward_total_composite_std": 0.3908560574054718} {"timestamp_utc": "2026-04-12T12:12:44Z", "mode": "train", "global_step": 385, "epoch": 0.015463710487207294, "loss": -0.0398, "grad_norm": 4.453365325927734, "learning_rate": 8.836363636363637e-06, "num_tokens": 766536.0, "completions/mean_length": 87.5, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 26.85714340209961, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.5383661985397339, "rewards/meter/std": 0.4269161522388458, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.7755584716796875, "rewards/lexical_plausibility/std": 0.22294670343399048, "rewards/judge_quality/mean": 0.7437500357627869, "rewards/judge_quality/std": 0.3452095687389374, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.42758840322494507, "rewards/total_composite/std": 0.3589273989200592, "reward": 0.42758840322494507, "reward_std": 0.3589273989200592, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16211320459842682, "sampling/sampling_logp_difference/max": 1.229848861694336, "sampling/importance_sampling_ratio/min": 0.29233676195144653, "sampling/importance_sampling_ratio/mean": 1.0205551385879517, "sampling/importance_sampling_ratio/max": 1.9664716720581055, "entropy": 1.1866639107465744, "clip_ratio/low_mean": 0.03215939225628972, "clip_ratio/low_min": 0.03215939225628972, "clip_ratio/high_mean": 0.08019467163830996, "clip_ratio/high_max": 0.08019467163830996, "clip_ratio/region_mean": 0.11235406389459968, "reward_total_mean": 0.42758840322494507, "reward_meter_mean": 0.5383661985397339, "reward_meter_std": 0.4269161522388458, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.7755584716796875, "reward_lexical_plausibility_std": 0.22294670343399048, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437500357627869, "reward_judge_quality_std": 0.3452095687389374, "reward_total_composite_mean": 0.42758840322494507, "reward_total_composite_std": 0.3589273989200592} {"timestamp_utc": "2026-04-12T12:12:54Z", "mode": "train", "global_step": 386, "epoch": 0.015503875968992248, "loss": -0.0063, "grad_norm": 13.448062896728516, "learning_rate": 8.833333333333334e-06, "num_tokens": 768075.0, "completions/mean_length": 39.375, "completions/min_length": 36.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8317387700080872, "rewards/meter/std": 0.20346671342849731, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9910990595817566, "rewards/lexical_plausibility/std": 0.02517561987042427, "rewards/judge_quality/mean": 0.6637499928474426, "rewards/judge_quality/std": 0.28465205430984497, "rewards/repeat_penalty/mean": 0.9798574447631836, "rewards/repeat_penalty/std": 0.041568104177713394, "rewards/near_duplicate_penalty/mean": 0.9901480674743652, "rewards/near_duplicate_penalty/std": 0.015714745968580246, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.5324898958206177, "rewards/total_composite/std": 0.2541130781173706, "reward": 0.5324898958206177, "reward_std": 0.2541130781173706, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1548158973455429, "sampling/sampling_logp_difference/max": 1.1048154830932617, "sampling/importance_sampling_ratio/min": 0.38023486733436584, "sampling/importance_sampling_ratio/mean": 1.0520660877227783, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3426322862505913, "clip_ratio/low_mean": 0.0852726970333606, "clip_ratio/low_min": 0.0852726970333606, "clip_ratio/high_mean": 0.04587095510214567, "clip_ratio/high_max": 0.04587095510214567, "clip_ratio/region_mean": 0.13114365213550627, "reward_total_mean": 0.5324898958206177, "reward_meter_mean": 0.8317387700080872, "reward_meter_std": 0.20346671342849731, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9910990595817566, "reward_lexical_plausibility_std": 0.02517561987042427, "reward_repeat_penalty_mean": 0.9798574447631836, "reward_repeat_penalty_std": 0.041568104177713394, "reward_near_duplicate_penalty_mean": 0.9901480674743652, "reward_near_duplicate_penalty_std": 0.015714745968580246, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.6637499928474426, "reward_judge_quality_std": 0.28465205430984497, "reward_total_composite_mean": 0.5324898958206177, "reward_total_composite_std": 0.2541130781173706} {"timestamp_utc": "2026-04-12T12:13:08Z", "mode": "train", "global_step": 387, "epoch": 0.015544041450777202, "loss": -0.0227, "grad_norm": 4.439444065093994, "learning_rate": 8.830303030303031e-06, "num_tokens": 769497.0, "completions/mean_length": 88.75, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 28.285715103149414, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.8510254621505737, "rewards/meter/std": 0.34386804699897766, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8292478322982788, "rewards/lexical_plausibility/std": 0.26898396015167236, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.34801220893859863, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3792494535446167, "rewards/total_composite/std": 0.34440329670906067, "reward": 0.3792494535446167, "reward_std": 0.3444032669067383, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2064886838197708, "sampling/sampling_logp_difference/max": 1.001784324645996, "sampling/importance_sampling_ratio/min": 0.3672236204147339, "sampling/importance_sampling_ratio/mean": 1.0405688285827637, "sampling/importance_sampling_ratio/max": 1.8839207887649536, "entropy": 1.7930859327316284, "clip_ratio/low_mean": 0.13832499645650387, "clip_ratio/low_min": 0.13832499645650387, "clip_ratio/high_mean": 0.04479166679084301, "clip_ratio/high_max": 0.04479166679084301, "clip_ratio/region_mean": 0.18311666324734688, "reward_total_mean": 0.3792494535446167, "reward_meter_mean": 0.8510254621505737, "reward_meter_std": 0.34386804699897766, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8292478322982788, "reward_lexical_plausibility_std": 0.26898396015167236, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.34801220893859863, "reward_total_composite_mean": 0.3792494535446167, "reward_total_composite_std": 0.34440329670906067} {"timestamp_utc": "2026-04-12T12:13:17Z", "mode": "train", "global_step": 388, "epoch": 0.015584206932562156, "loss": 0.0682, "grad_norm": 13.040472984313965, "learning_rate": 8.827272727272727e-06, "num_tokens": 771251.0, "completions/mean_length": 60.25, "completions/min_length": 53.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.25, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.5014908313751221, "rewards/meter/std": 0.36363595724105835, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.528749942779541, "rewards/judge_quality/std": 0.15824371576309204, "rewards/repeat_penalty/mean": 0.9748153686523438, "rewards/repeat_penalty/std": 0.03493955358862877, "rewards/near_duplicate_penalty/mean": 0.9871870279312134, "rewards/near_duplicate_penalty/std": 0.015612704679369926, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9872616529464722, "rewards/distinct_2/std": 0.0239923894405365, "rewards/total_composite/mean": 0.24782469868659973, "rewards/total_composite/std": 0.1842014640569687, "reward": 0.24782469868659973, "reward_std": 0.1842014491558075, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1843993216753006, "sampling/sampling_logp_difference/max": 1.505722999572754, "sampling/importance_sampling_ratio/min": 0.22185683250427246, "sampling/importance_sampling_ratio/mean": 1.0240330696105957, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1352952420711517, "clip_ratio/low_mean": 0.0759481405839324, "clip_ratio/low_min": 0.0759481405839324, "clip_ratio/high_mean": 0.06730315182358027, "clip_ratio/high_max": 0.06730315182358027, "clip_ratio/region_mean": 0.14325129240751266, "reward_total_mean": 0.24782469868659973, "reward_meter_mean": 0.5014908313751221, "reward_meter_std": 0.36363595724105835, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9748153686523438, "reward_repeat_penalty_std": 0.03493955358862877, "reward_near_duplicate_penalty_mean": 0.9871870279312134, "reward_near_duplicate_penalty_std": 0.015612704679369926, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9872616529464722, "reward_distinct_2_std": 0.0239923894405365, "reward_judge_quality_mean": 0.528749942779541, "reward_judge_quality_std": 0.15824371576309204, "reward_total_composite_mean": 0.24782469868659973, "reward_total_composite_std": 0.1842014640569687} {"timestamp_utc": "2026-04-12T12:13:25Z", "mode": "train", "global_step": 389, "epoch": 0.01562437241434711, "loss": 0.0988, "grad_norm": 24.313623428344727, "learning_rate": 8.824242424242426e-06, "num_tokens": 772631.0, "completions/mean_length": 19.5, "completions/min_length": 17.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.804509162902832, "rewards/meter/std": 0.3564189076423645, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9361213445663452, "rewards/lexical_plausibility/std": 0.1569535881280899, "rewards/judge_quality/mean": 0.9200000166893005, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.7480332255363464, "rewards/repeat_penalty/std": 0.005562899634242058, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7401484847068787, "rewards/total_composite/std": 0.3279053866863251, "reward": 0.7401484847068787, "reward_std": 0.3279053866863251, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1738765388727188, "sampling/sampling_logp_difference/max": 1.1999459266662598, "sampling/importance_sampling_ratio/min": 0.30121049284935, "sampling/importance_sampling_ratio/mean": 1.0502216815948486, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3886692970991135, "clip_ratio/low_mean": 0.04375000111758709, "clip_ratio/low_min": 0.04375000111758709, "clip_ratio/high_mean": 0.10645459638908505, "clip_ratio/high_max": 0.10645459638908505, "clip_ratio/region_mean": 0.15020459750667214, "reward_total_mean": 0.7401484847068787, "reward_meter_mean": 0.804509162902832, "reward_meter_std": 0.3564189076423645, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9361213445663452, "reward_lexical_plausibility_std": 0.1569535881280899, "reward_repeat_penalty_mean": 0.7480332255363464, "reward_repeat_penalty_std": 0.005562899634242058, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9200000166893005, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.7401484847068787, "reward_total_composite_std": 0.3279053866863251} {"timestamp_utc": "2026-04-12T12:13:39Z", "mode": "train", "global_step": 390, "epoch": 0.015664537896132064, "loss": -0.0391, "grad_norm": 2.26735520362854, "learning_rate": 8.821212121212121e-06, "num_tokens": 774335.0, "completions/mean_length": 295.0, "completions/min_length": 67.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 78.0, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.42222124338150024, "rewards/meter/std": 0.4066350758075714, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.37533053755760193, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.601567804813385, "rewards/lexical_plausibility/std": 0.3263372778892517, "rewards/judge_quality/mean": 0.29249998927116394, "rewards/judge_quality/std": 0.38975268602371216, "rewards/repeat_penalty/mean": 0.9427352547645569, "rewards/repeat_penalty/std": 0.09331945329904556, "rewards/near_duplicate_penalty/mean": 0.9914441108703613, "rewards/near_duplicate_penalty/std": 0.020643942058086395, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9818196296691895, "rewards/distinct_2/std": 0.03497876599431038, "rewards/total_composite/mean": 0.14455711841583252, "rewards/total_composite/std": 0.3151821792125702, "reward": 0.14455711841583252, "reward_std": 0.3151821494102478, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21467247605323792, "sampling/sampling_logp_difference/max": 1.9102625846862793, "sampling/importance_sampling_ratio/min": 0.1480415165424347, "sampling/importance_sampling_ratio/mean": 1.051853060722351, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.929746150970459, "clip_ratio/low_mean": 0.06571061722934246, "clip_ratio/low_min": 0.06571061722934246, "clip_ratio/high_mean": 0.020522387698292732, "clip_ratio/high_max": 0.020522387698292732, "clip_ratio/region_mean": 0.08623300492763519, "reward_total_mean": 0.14455711841583252, "reward_meter_mean": 0.42222124338150024, "reward_meter_std": 0.4066350758075714, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.37533053755760193, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.601567804813385, "reward_lexical_plausibility_std": 0.3263372778892517, "reward_repeat_penalty_mean": 0.9427352547645569, "reward_repeat_penalty_std": 0.09331945329904556, "reward_near_duplicate_penalty_mean": 0.9914441108703613, "reward_near_duplicate_penalty_std": 0.020643942058086395, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9818196296691895, "reward_distinct_2_std": 0.03497876599431038, "reward_judge_quality_mean": 0.29249998927116394, "reward_judge_quality_std": 0.38975268602371216, "reward_total_composite_mean": 0.14455711841583252, "reward_total_composite_std": 0.3151821792125702} {"timestamp_utc": "2026-04-12T12:13:53Z", "mode": "train", "global_step": 391, "epoch": 0.015704703377917018, "loss": 0.1176, "grad_norm": 2.996407985687256, "learning_rate": 8.818181818181819e-06, "num_tokens": 775988.0, "completions/mean_length": 168.625, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 54.16666793823242, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 211.0, "rewards/meter/mean": 0.7190061807632446, "rewards/meter/std": 0.44676926732063293, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.6776604056358337, "rewards/lexical_plausibility/std": 0.39427605271339417, "rewards/judge_quality/mean": 0.4975000023841858, "rewards/judge_quality/std": 0.45285600423812866, "rewards/repeat_penalty/mean": 0.7781673073768616, "rewards/repeat_penalty/std": 0.0900484099984169, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4701194763183594, "rewards/total_composite/std": 0.4655492305755615, "reward": 0.4701194763183594, "reward_std": 0.4655492305755615, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16584241390228271, "sampling/sampling_logp_difference/max": 1.244649887084961, "sampling/importance_sampling_ratio/min": 0.28804174065589905, "sampling/importance_sampling_ratio/mean": 1.035207986831665, "sampling/importance_sampling_ratio/max": 1.648921012878418, "entropy": 2.0549472272396088, "clip_ratio/low_mean": 0.015608902089297771, "clip_ratio/low_min": 0.015608902089297771, "clip_ratio/high_mean": 0.0672911899164319, "clip_ratio/high_max": 0.0672911899164319, "clip_ratio/region_mean": 0.08290009200572968, "reward_total_mean": 0.4701194763183594, "reward_meter_mean": 0.7190061807632446, "reward_meter_std": 0.44676926732063293, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.6776604056358337, "reward_lexical_plausibility_std": 0.39427605271339417, "reward_repeat_penalty_mean": 0.7781673073768616, "reward_repeat_penalty_std": 0.0900484099984169, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4975000023841858, "reward_judge_quality_std": 0.45285600423812866, "reward_total_composite_mean": 0.4701194763183594, "reward_total_composite_std": 0.4655492305755615} {"timestamp_utc": "2026-04-12T12:14:03Z", "mode": "train", "global_step": 392, "epoch": 0.01574486885970197, "loss": 0.095, "grad_norm": 16.90131950378418, "learning_rate": 8.815151515151516e-06, "num_tokens": 777546.0, "completions/mean_length": 42.75, "completions/min_length": 34.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.75, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7961781024932861, "rewards/meter/std": 0.33177298307418823, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9956271648406982, "rewards/repeat_penalty/std": 0.008242162875831127, "rewards/near_duplicate_penalty/mean": 0.9956271648406982, "rewards/near_duplicate_penalty/std": 0.008242162875831127, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4092037081718445, "rewards/total_composite/std": 0.23701132833957672, "reward": 0.4092037081718445, "reward_std": 0.23701131343841553, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20144127309322357, "sampling/sampling_logp_difference/max": 1.7225580215454102, "sampling/importance_sampling_ratio/min": 0.17860867083072662, "sampling/importance_sampling_ratio/mean": 1.0382312536239624, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.946122795343399, "clip_ratio/low_mean": 0.08899091929197311, "clip_ratio/low_min": 0.08899091929197311, "clip_ratio/high_mean": 0.06624577008187771, "clip_ratio/high_max": 0.06624577008187771, "clip_ratio/region_mean": 0.15523668937385082, "reward_total_mean": 0.4092037081718445, "reward_meter_mean": 0.7961781024932861, "reward_meter_std": 0.33177298307418823, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9956271648406982, "reward_repeat_penalty_std": 0.008242162875831127, "reward_near_duplicate_penalty_mean": 0.9956271648406982, "reward_near_duplicate_penalty_std": 0.008242162875831127, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.4092037081718445, "reward_total_composite_std": 0.23701132833957672} {"timestamp_utc": "2026-04-12T12:14:18Z", "mode": "train", "global_step": 393, "epoch": 0.015785034341486925, "loss": -0.1054, "grad_norm": 1.9112484455108643, "learning_rate": 8.812121212121213e-06, "num_tokens": 779489.0, "completions/mean_length": 410.875, "completions/min_length": 106.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 107.5, "completions/min_terminated_length": 106.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.6407234072685242, "rewards/meter/std": 0.3280641436576843, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.37533053755760193, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.7479768395423889, "rewards/lexical_plausibility/std": 0.18183663487434387, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.9357457160949707, "rewards/repeat_penalty/std": 0.1146545335650444, "rewards/near_duplicate_penalty/mean": 0.9982457160949707, "rewards/near_duplicate_penalty/std": 0.0018473644740879536, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09551124274730682, "rewards/total_composite/std": 0.17697452008724213, "reward": 0.09551124274730682, "reward_std": 0.17697452008724213, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1864493042230606, "sampling/sampling_logp_difference/max": 1.5367060899734497, "sampling/importance_sampling_ratio/min": 0.21508842706680298, "sampling/importance_sampling_ratio/mean": 1.0050638914108276, "sampling/importance_sampling_ratio/max": 1.7277193069458008, "entropy": 0.5865364372730255, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.05926519073545933, "clip_ratio/high_max": 0.05926519073545933, "clip_ratio/region_mean": 0.05926519073545933, "reward_total_mean": 0.09551124274730682, "reward_meter_mean": 0.6407234072685242, "reward_meter_std": 0.3280641436576843, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.37533053755760193, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.7479768395423889, "reward_lexical_plausibility_std": 0.18183663487434387, "reward_repeat_penalty_mean": 0.9357457160949707, "reward_repeat_penalty_std": 0.1146545335650444, "reward_near_duplicate_penalty_mean": 0.9982457160949707, "reward_near_duplicate_penalty_std": 0.0018473644740879536, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.09551124274730682, "reward_total_composite_std": 0.17697452008724213} {"timestamp_utc": "2026-04-12T12:14:33Z", "mode": "train", "global_step": 394, "epoch": 0.01582519982327188, "loss": -0.0653, "grad_norm": 1.706504464149475, "learning_rate": 8.809090909090909e-06, "num_tokens": 780953.0, "completions/mean_length": 277.0, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.7082880735397339, "rewards/meter/std": 0.41883644461631775, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8141652941703796, "rewards/lexical_plausibility/std": 0.20943991839885712, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9827629923820496, "rewards/repeat_penalty/std": 0.03876803442835808, "rewards/near_duplicate_penalty/mean": 0.991126537322998, "rewards/near_duplicate_penalty/std": 0.016940193250775337, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.14978958666324615, "rewards/total_composite/std": 0.1784851849079132, "reward": 0.14978958666324615, "reward_std": 0.1784851849079132, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19560293853282928, "sampling/sampling_logp_difference/max": 1.159276008605957, "sampling/importance_sampling_ratio/min": 0.3137132227420807, "sampling/importance_sampling_ratio/mean": 1.1072908639907837, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4723319709300995, "clip_ratio/low_mean": 0.01785714365541935, "clip_ratio/low_min": 0.01785714365541935, "clip_ratio/high_mean": 0.05713332165032625, "clip_ratio/high_max": 0.05713332165032625, "clip_ratio/region_mean": 0.0749904653057456, "reward_total_mean": 0.14978958666324615, "reward_meter_mean": 0.7082880735397339, "reward_meter_std": 0.41883644461631775, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8141652941703796, "reward_lexical_plausibility_std": 0.20943991839885712, "reward_repeat_penalty_mean": 0.9827629923820496, "reward_repeat_penalty_std": 0.03876803442835808, "reward_near_duplicate_penalty_mean": 0.991126537322998, "reward_near_duplicate_penalty_std": 0.016940193250775337, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.14978958666324615, "reward_total_composite_std": 0.1784851849079132} {"timestamp_utc": "2026-04-12T12:14:48Z", "mode": "train", "global_step": 395, "epoch": 0.015865365305056833, "loss": -0.0927, "grad_norm": 2.346163272857666, "learning_rate": 8.806060606060608e-06, "num_tokens": 782715.0, "completions/mean_length": 292.25, "completions/min_length": 63.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 72.5, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.2800147533416748, "rewards/meter/std": 0.36569374799728394, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.41052016615867615, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8489526510238647, "rewards/lexical_plausibility/std": 0.16889598965644836, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.20310096442699432, "rewards/repeat_penalty/mean": 0.958864152431488, "rewards/repeat_penalty/std": 0.08593212068080902, "rewards/near_duplicate_penalty/mean": 0.9951285123825073, "rewards/near_duplicate_penalty/std": 0.0052598933689296246, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9949392676353455, "rewards/distinct_2/std": 0.014313912950456142, "rewards/total_composite/mean": 0.11484209448099136, "rewards/total_composite/std": 0.17118561267852783, "reward": 0.11484209448099136, "reward_std": 0.17118561267852783, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2058657705783844, "sampling/sampling_logp_difference/max": 0.9940671920776367, "sampling/importance_sampling_ratio/min": 0.3700684905052185, "sampling/importance_sampling_ratio/mean": 1.0406041145324707, "sampling/importance_sampling_ratio/max": 1.8877012729644775, "entropy": 1.1349950581789017, "clip_ratio/low_mean": 0.03252242971211672, "clip_ratio/low_min": 0.03252242971211672, "clip_ratio/high_mean": 0.04944284074008465, "clip_ratio/high_max": 0.04944284074008465, "clip_ratio/region_mean": 0.08196527045220137, "reward_total_mean": 0.11484209448099136, "reward_meter_mean": 0.2800147533416748, "reward_meter_std": 0.36569374799728394, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.41052016615867615, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8489526510238647, "reward_lexical_plausibility_std": 0.16889598965644836, "reward_repeat_penalty_mean": 0.958864152431488, "reward_repeat_penalty_std": 0.08593212068080902, "reward_near_duplicate_penalty_mean": 0.9951285123825073, "reward_near_duplicate_penalty_std": 0.0052598933689296246, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9949392676353455, "reward_distinct_2_std": 0.014313912950456142, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.20310096442699432, "reward_total_composite_mean": 0.11484209448099136, "reward_total_composite_std": 0.17118561267852783} {"timestamp_utc": "2026-04-12T12:15:03Z", "mode": "train", "global_step": 396, "epoch": 0.015905530786841787, "loss": -0.0659, "grad_norm": 1.8078728914260864, "learning_rate": 8.803030303030303e-06, "num_tokens": 784240.0, "completions/mean_length": 276.625, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 41.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5899513363838196, "rewards/meter/std": 0.4457658529281616, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8389207124710083, "rewards/lexical_plausibility/std": 0.17937442660331726, "rewards/judge_quality/mean": 0.3037499785423279, "rewards/judge_quality/std": 0.31932684779167175, "rewards/repeat_penalty/mean": 0.9569582939147949, "rewards/repeat_penalty/std": 0.08557416498661041, "rewards/near_duplicate_penalty/mean": 0.9882082939147949, "rewards/near_duplicate_penalty/std": 0.018780311569571495, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2743593156337738, "rewards/total_composite/std": 0.3373644948005676, "reward": 0.2743593156337738, "reward_std": 0.33736446499824524, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19765162467956543, "sampling/sampling_logp_difference/max": 1.1794836521148682, "sampling/importance_sampling_ratio/min": 0.3074374496936798, "sampling/importance_sampling_ratio/mean": 1.073563575744629, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2199176847934723, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.10002384521067142, "clip_ratio/high_max": 0.10002384521067142, "clip_ratio/region_mean": 0.10002384521067142, "reward_total_mean": 0.2743593156337738, "reward_meter_mean": 0.5899513363838196, "reward_meter_std": 0.4457658529281616, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8389207124710083, "reward_lexical_plausibility_std": 0.17937442660331726, "reward_repeat_penalty_mean": 0.9569582939147949, "reward_repeat_penalty_std": 0.08557416498661041, "reward_near_duplicate_penalty_mean": 0.9882082939147949, "reward_near_duplicate_penalty_std": 0.018780311569571495, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3037499785423279, "reward_judge_quality_std": 0.31932684779167175, "reward_total_composite_mean": 0.2743593156337738, "reward_total_composite_std": 0.3373644948005676} {"timestamp_utc": "2026-04-12T12:15:17Z", "mode": "train", "global_step": 397, "epoch": 0.01594569626862674, "loss": -0.1881, "grad_norm": 3.925553321838379, "learning_rate": 8.8e-06, "num_tokens": 786473.0, "completions/mean_length": 214.125, "completions/min_length": 95.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 114.83333587646484, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 123.0, "rewards/meter/mean": 0.6472233533859253, "rewards/meter/std": 0.41604840755462646, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9404333829879761, "rewards/lexical_plausibility/std": 0.11923659592866898, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.8763377070426941, "rewards/repeat_penalty/std": 0.14084605872631073, "rewards/near_duplicate_penalty/mean": 0.9682947397232056, "rewards/near_duplicate_penalty/std": 0.026189858093857765, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9296720027923584, "rewards/distinct_2/std": 0.08126077055931091, "rewards/total_composite/mean": 0.2649061381816864, "rewards/total_composite/std": 0.19800522923469543, "reward": 0.2649061381816864, "reward_std": 0.19800524413585663, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18909059464931488, "sampling/sampling_logp_difference/max": 3.081735134124756, "sampling/importance_sampling_ratio/min": 0.045879580080509186, "sampling/importance_sampling_ratio/mean": 1.037859320640564, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.005484364926815, "clip_ratio/low_mean": 0.02631578966975212, "clip_ratio/low_min": 0.02631578966975212, "clip_ratio/high_mean": 0.11029411852359772, "clip_ratio/high_max": 0.11029411852359772, "clip_ratio/region_mean": 0.13660990819334984, "reward_total_mean": 0.2649061381816864, "reward_meter_mean": 0.6472233533859253, "reward_meter_std": 0.41604840755462646, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9404333829879761, "reward_lexical_plausibility_std": 0.11923659592866898, "reward_repeat_penalty_mean": 0.8763377070426941, "reward_repeat_penalty_std": 0.14084605872631073, "reward_near_duplicate_penalty_mean": 0.9682947397232056, "reward_near_duplicate_penalty_std": 0.026189858093857765, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9296720027923584, "reward_distinct_2_std": 0.08126077055931091, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.2649061381816864, "reward_total_composite_std": 0.19800522923469543} {"timestamp_utc": "2026-04-12T12:15:32Z", "mode": "train", "global_step": 398, "epoch": 0.015985861750411695, "loss": -0.1388, "grad_norm": 2.3553307056427, "learning_rate": 8.796969696969698e-06, "num_tokens": 788533.0, "completions/mean_length": 370.5, "completions/min_length": 129.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 134.6666717529297, "completions/min_terminated_length": 129.0, "completions/max_terminated_length": 138.0, "rewards/meter/mean": 0.3942521810531616, "rewards/meter/std": 0.36259716749191284, "rewards/count_adherence/mean": 0.5535714626312256, "rewards/count_adherence/std": 0.36967799067497253, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8397576212882996, "rewards/lexical_plausibility/std": 0.1545770764350891, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.9140479564666748, "rewards/repeat_penalty/std": 0.2199569195508957, "rewards/near_duplicate_penalty/mean": 0.9818993806838989, "rewards/near_duplicate_penalty/std": 0.03753954544663429, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9321063756942749, "rewards/distinct_2/std": 0.18265652656555176, "rewards/total_composite/mean": 0.10109606385231018, "rewards/total_composite/std": 0.1619570106267929, "reward": 0.10109606385231018, "reward_std": 0.1619569957256317, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18112711608409882, "sampling/sampling_logp_difference/max": 1.2439486980438232, "sampling/importance_sampling_ratio/min": 0.2882438004016876, "sampling/importance_sampling_ratio/mean": 1.0341545343399048, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6858463287353516, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.065457409247756, "clip_ratio/high_max": 0.065457409247756, "clip_ratio/region_mean": 0.065457409247756, "reward_total_mean": 0.10109606385231018, "reward_meter_mean": 0.3942521810531616, "reward_meter_std": 0.36259716749191284, "reward_count_adherence_mean": 0.5535714626312256, "reward_count_adherence_std": 0.36967799067497253, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8397576212882996, "reward_lexical_plausibility_std": 0.1545770764350891, "reward_repeat_penalty_mean": 0.9140479564666748, "reward_repeat_penalty_std": 0.2199569195508957, "reward_near_duplicate_penalty_mean": 0.9818993806838989, "reward_near_duplicate_penalty_std": 0.03753954544663429, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9321063756942749, "reward_distinct_2_std": 0.18265652656555176, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.10109606385231018, "reward_total_composite_std": 0.1619570106267929} {"timestamp_utc": "2026-04-12T12:15:41Z", "mode": "train", "global_step": 399, "epoch": 0.01602602723219665, "loss": 0.0055, "grad_norm": 15.326539039611816, "learning_rate": 8.793939393939395e-06, "num_tokens": 790239.0, "completions/mean_length": 41.25, "completions/min_length": 36.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.25, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.9389407634735107, "rewards/meter/std": 0.11409443616867065, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.2794605791568756, "rewards/repeat_penalty/mean": 0.9888359308242798, "rewards/repeat_penalty/std": 0.014076457358896732, "rewards/near_duplicate_penalty/mean": 0.9888359308242798, "rewards/near_duplicate_penalty/std": 0.014076457358896732, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6672719717025757, "rewards/total_composite/std": 0.26418986916542053, "reward": 0.6672719717025757, "reward_std": 0.26418986916542053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1759723275899887, "sampling/sampling_logp_difference/max": 2.0261192321777344, "sampling/importance_sampling_ratio/min": 0.13184620440006256, "sampling/importance_sampling_ratio/mean": 1.0538458824157715, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5416480898857117, "clip_ratio/low_mean": 0.06201437674462795, "clip_ratio/low_min": 0.06201437674462795, "clip_ratio/high_mean": 0.08641835395246744, "clip_ratio/high_max": 0.08641835395246744, "clip_ratio/region_mean": 0.1484327306970954, "reward_total_mean": 0.6672719717025757, "reward_meter_mean": 0.9389407634735107, "reward_meter_std": 0.11409443616867065, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9888359308242798, "reward_repeat_penalty_std": 0.014076457358896732, "reward_near_duplicate_penalty_mean": 0.9888359308242798, "reward_near_duplicate_penalty_std": 0.014076457358896732, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.2794605791568756, "reward_total_composite_mean": 0.6672719717025757, "reward_total_composite_std": 0.26418986916542053} {"timestamp_utc": "2026-04-12T12:15:51Z", "mode": "train", "global_step": 400, "epoch": 0.016066192713981603, "loss": -0.0154, "grad_norm": 12.646838188171387, "learning_rate": 8.790909090909092e-06, "num_tokens": 792163.0, "completions/mean_length": 63.5, "completions/min_length": 51.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.5, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.8272651433944702, "rewards/meter/std": 0.3097221553325653, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.2711220383644104, "rewards/repeat_penalty/mean": 0.9963112473487854, "rewards/repeat_penalty/std": 0.004177942406386137, "rewards/near_duplicate_penalty/mean": 0.9963112473487854, "rewards/near_duplicate_penalty/std": 0.004177942406386137, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4300561845302582, "rewards/total_composite/std": 0.31272780895233154, "reward": 0.4300561845302582, "reward_std": 0.31272780895233154, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18742048740386963, "sampling/sampling_logp_difference/max": 1.7906854152679443, "sampling/importance_sampling_ratio/min": 0.16684576869010925, "sampling/importance_sampling_ratio/mean": 1.019217848777771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6776831150054932, "clip_ratio/low_mean": 0.13417689688503742, "clip_ratio/low_min": 0.13417689688503742, "clip_ratio/high_mean": 0.026569634675979614, "clip_ratio/high_max": 0.026569634675979614, "clip_ratio/region_mean": 0.16074653156101704, "reward_total_mean": 0.4300561845302582, "reward_meter_mean": 0.8272651433944702, "reward_meter_std": 0.3097221553325653, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9963112473487854, "reward_repeat_penalty_std": 0.004177942406386137, "reward_near_duplicate_penalty_mean": 0.9963112473487854, "reward_near_duplicate_penalty_std": 0.004177942406386137, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.2711220383644104, "reward_total_composite_mean": 0.4300561845302582, "reward_total_composite_std": 0.31272780895233154} {"timestamp_utc": "2026-04-12T12:18:25Z", "mode": "eval", "global_step": 400, "epoch": 0.016066192713981603, "eval_loss": NaN, "eval_runtime": 154.2168, "eval_samples_per_second": 0.674, "eval_steps_per_second": 0.084, "eval_num_tokens": 792163.0, "eval_completions/mean_length": 187.70192307692307, "eval_completions/min_length": 38.23076923076923, "eval_completions/max_length": 471.9230769230769, "eval_completions/clipped_ratio": 0.14423076923076922, "eval_completions/mean_terminated_length": 132.26016822228064, "eval_completions/min_terminated_length": 38.23076923076923, "eval_completions/max_terminated_length": 286.15384615384613, "eval_rewards/meter/mean": 0.5420474341282477, "eval_rewards/meter/std": 0.3766455558630136, "eval_rewards/count_adherence/mean": 0.8512307313772348, "eval_rewards/count_adherence/std": 0.2499035453567138, "eval_rewards/arabic_clean/mean": 0.7788461538461539, "eval_rewards/arabic_clean/std": 0.38037164165423465, "eval_rewards/lexical_plausibility/mean": 0.9559404253959656, "eval_rewards/lexical_plausibility/std": 0.08785561610084887, "eval_rewards/judge_quality/mean": 0.3762499965154208, "eval_rewards/judge_quality/std": 0.2364156165948281, "eval_rewards/repeat_penalty/mean": 0.8230979901093703, "eval_rewards/repeat_penalty/std": 0.2612293680699972, "eval_rewards/near_duplicate_penalty/mean": 0.9467151898604172, "eval_rewards/near_duplicate_penalty/std": 0.08159351735734023, "eval_rewards/opening_diversity/mean": 0.9554265416585482, "eval_rewards/opening_diversity/std": 0.0883646491341866, "eval_rewards/distinct_2/mean": 0.8715694730098431, "eval_rewards/distinct_2/std": 0.226575913767402, "eval_rewards/total_composite/mean": 0.190441376887835, "eval_rewards/total_composite/std": 0.17775888225206962, "eval_reward": 0.190441376887835, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.10218952195002483, "eval_sampling/sampling_logp_difference/max": 1.2410474190345178, "eval_sampling/importance_sampling_ratio/min": 0.2915732367680623, "eval_sampling/importance_sampling_ratio/mean": 1.0252403112558217, "eval_sampling/importance_sampling_ratio/max": 1.5982536994493926, "eval_entropy": 1.3140468368163476, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.190441376887835, "eval_reward_meter_mean": 0.5420474341282477, "eval_reward_meter_std": 0.3766455558630136, "eval_reward_count_adherence_mean": 0.8512307313772348, "eval_reward_count_adherence_std": 0.2499035453567138, "eval_reward_arabic_clean_mean": 0.7788461538461539, "eval_reward_arabic_clean_std": 0.38037164165423465, "eval_reward_lexical_plausibility_mean": 0.9559404253959656, "eval_reward_lexical_plausibility_std": 0.08785561610084887, "eval_reward_repeat_penalty_mean": 0.8230979901093703, "eval_reward_repeat_penalty_std": 0.2612293680699972, "eval_reward_near_duplicate_penalty_mean": 0.9467151898604172, "eval_reward_near_duplicate_penalty_std": 0.08159351735734023, "eval_reward_opening_diversity_mean": 0.9554265416585482, "eval_reward_opening_diversity_std": 0.0883646491341866, "eval_reward_distinct_2_mean": 0.8715694730098431, "eval_reward_distinct_2_std": 0.226575913767402, "eval_reward_judge_quality_mean": 0.3762499965154208, "eval_reward_judge_quality_std": 0.2364156165948281, "eval_reward_total_composite_mean": 0.190441376887835, "eval_reward_total_composite_std": 0.17775888225206962} {"timestamp_utc": "2026-04-12T12:18:37Z", "mode": "train", "global_step": 401, "epoch": 0.016106358195766557, "loss": -0.0296, "grad_norm": 16.03925895690918, "learning_rate": 8.787878787878788e-06, "num_tokens": 793759.0, "completions/mean_length": 42.5, "completions/min_length": 38.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.8769299983978271, "rewards/meter/std": 0.30164098739624023, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7512500286102295, "rewards/judge_quality/std": 0.24976776540279388, "rewards/repeat_penalty/mean": 0.9924679398536682, "rewards/repeat_penalty/std": 0.00984637625515461, "rewards/near_duplicate_penalty/mean": 0.9924679398536682, "rewards/near_duplicate_penalty/std": 0.00984637625515461, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6401259899139404, "rewards/total_composite/std": 0.3147824704647064, "reward": 0.6401259899139404, "reward_std": 0.3147824704647064, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1906818002462387, "sampling/sampling_logp_difference/max": 2.0528461933135986, "sampling/importance_sampling_ratio/min": 0.1283690184354782, "sampling/importance_sampling_ratio/mean": 1.0127277374267578, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4589977413415909, "clip_ratio/low_mean": 0.06584052927792072, "clip_ratio/low_min": 0.06584052927792072, "clip_ratio/high_mean": 0.08660051599144936, "clip_ratio/high_max": 0.08660051599144936, "clip_ratio/region_mean": 0.15244104526937008, "reward_total_mean": 0.6401259899139404, "reward_meter_mean": 0.8769299983978271, "reward_meter_std": 0.30164098739624023, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9924679398536682, "reward_repeat_penalty_std": 0.00984637625515461, "reward_near_duplicate_penalty_mean": 0.9924679398536682, "reward_near_duplicate_penalty_std": 0.00984637625515461, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7512500286102295, "reward_judge_quality_std": 0.24976776540279388, "reward_total_composite_mean": 0.6401259899139404, "reward_total_composite_std": 0.3147824704647064} {"timestamp_utc": "2026-04-12T12:18:52Z", "mode": "train", "global_step": 402, "epoch": 0.01614652367755151, "loss": -0.0929, "grad_norm": 5.5130510330200195, "learning_rate": 8.784848484848487e-06, "num_tokens": 795630.0, "completions/mean_length": 125.875, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 70.71428680419922, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.7937238216400146, "rewards/meter/std": 0.3507080078125, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3471825420856476, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9805421829223633, "rewards/lexical_plausibility/std": 0.049931079149246216, "rewards/judge_quality/mean": 0.4050000309944153, "rewards/judge_quality/std": 0.33713075518608093, "rewards/repeat_penalty/mean": 0.9519250988960266, "rewards/repeat_penalty/std": 0.07706359773874283, "rewards/near_duplicate_penalty/mean": 0.9747341871261597, "rewards/near_duplicate_penalty/std": 0.03452078998088837, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9751819372177124, "rewards/distinct_2/std": 0.04675424471497536, "rewards/total_composite/mean": 0.319842666387558, "rewards/total_composite/std": 0.2840674817562103, "reward": 0.319842666387558, "reward_std": 0.2840674817562103, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19560658931732178, "sampling/sampling_logp_difference/max": 1.263073205947876, "sampling/importance_sampling_ratio/min": 0.2827836275100708, "sampling/importance_sampling_ratio/mean": 1.041720986366272, "sampling/importance_sampling_ratio/max": 1.9923841953277588, "entropy": 1.898254171013832, "clip_ratio/low_mean": 0.10888747870922089, "clip_ratio/low_min": 0.10888747870922089, "clip_ratio/high_mean": 0.07550730556249619, "clip_ratio/high_max": 0.07550730556249619, "clip_ratio/region_mean": 0.18439478427171707, "reward_total_mean": 0.319842666387558, "reward_meter_mean": 0.7937238216400146, "reward_meter_std": 0.3507080078125, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3471825420856476, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9805421829223633, "reward_lexical_plausibility_std": 0.049931079149246216, "reward_repeat_penalty_mean": 0.9519250988960266, "reward_repeat_penalty_std": 0.07706359773874283, "reward_near_duplicate_penalty_mean": 0.9747341871261597, "reward_near_duplicate_penalty_std": 0.03452078998088837, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9751819372177124, "reward_distinct_2_std": 0.04675424471497536, "reward_judge_quality_mean": 0.4050000309944153, "reward_judge_quality_std": 0.33713075518608093, "reward_total_composite_mean": 0.319842666387558, "reward_total_composite_std": 0.2840674817562103} {"timestamp_utc": "2026-04-12T12:19:08Z", "mode": "train", "global_step": 403, "epoch": 0.016186689159336465, "loss": -0.0867, "grad_norm": 5.634540557861328, "learning_rate": 8.781818181818182e-06, "num_tokens": 797499.0, "completions/mean_length": 139.625, "completions/min_length": 75.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 86.42857360839844, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.7045705914497375, "rewards/meter/std": 0.36760589480400085, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.959592878818512, "rewards/lexical_plausibility/std": 0.09168154746294022, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.8338491916656494, "rewards/repeat_penalty/std": 0.1686556488275528, "rewards/near_duplicate_penalty/mean": 0.9704387784004211, "rewards/near_duplicate_penalty/std": 0.020224422216415405, "rewards/opening_diversity/mean": 0.9453125, "rewards/opening_diversity/std": 0.08476267009973526, "rewards/distinct_2/mean": 0.9160425662994385, "rewards/distinct_2/std": 0.08388027548789978, "rewards/total_composite/mean": 0.25078490376472473, "rewards/total_composite/std": 0.1559588611125946, "reward": 0.25078490376472473, "reward_std": 0.1559588611125946, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16822002828121185, "sampling/sampling_logp_difference/max": 1.9854364395141602, "sampling/importance_sampling_ratio/min": 0.13732066750526428, "sampling/importance_sampling_ratio/mean": 1.022871971130371, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2079317420721054, "clip_ratio/low_mean": 0.04398762248456478, "clip_ratio/low_min": 0.04398762248456478, "clip_ratio/high_mean": 0.1001646718941629, "clip_ratio/high_max": 0.1001646718941629, "clip_ratio/region_mean": 0.14415229437872767, "reward_total_mean": 0.25078490376472473, "reward_meter_mean": 0.7045705914497375, "reward_meter_std": 0.36760589480400085, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.959592878818512, "reward_lexical_plausibility_std": 0.09168154746294022, "reward_repeat_penalty_mean": 0.8338491916656494, "reward_repeat_penalty_std": 0.1686556488275528, "reward_near_duplicate_penalty_mean": 0.9704387784004211, "reward_near_duplicate_penalty_std": 0.020224422216415405, "reward_opening_diversity_mean": 0.9453125, "reward_opening_diversity_std": 0.08476267009973526, "reward_distinct_2_mean": 0.9160425662994385, "reward_distinct_2_std": 0.08388027548789978, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.25078490376472473, "reward_total_composite_std": 0.1559588611125946} {"timestamp_utc": "2026-04-12T12:19:24Z", "mode": "train", "global_step": 404, "epoch": 0.01622685464112142, "loss": -0.0718, "grad_norm": 1.6249110698699951, "learning_rate": 8.77878787878788e-06, "num_tokens": 799057.0, "completions/mean_length": 279.75, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.9419029355049133, "rewards/meter/std": 0.1101876050233841, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8911904096603394, "rewards/lexical_plausibility/std": 0.10423477739095688, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.3165184557437897, "rewards/repeat_penalty/mean": 0.9617950916290283, "rewards/repeat_penalty/std": 0.08661969751119614, "rewards/near_duplicate_penalty/mean": 0.9935762882232666, "rewards/near_duplicate_penalty/std": 0.013885052874684334, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9994688034057617, "rewards/distinct_2/std": 0.00150255614425987, "rewards/total_composite/mean": 0.27821362018585205, "rewards/total_composite/std": 0.3338005840778351, "reward": 0.27821362018585205, "reward_std": 0.3338005840778351, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19768500328063965, "sampling/sampling_logp_difference/max": 1.7469000816345215, "sampling/importance_sampling_ratio/min": 0.17431345582008362, "sampling/importance_sampling_ratio/mean": 1.0551173686981201, "sampling/importance_sampling_ratio/max": 1.8611770868301392, "entropy": 1.2844100147485733, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.07779906783252954, "clip_ratio/high_max": 0.07779906783252954, "clip_ratio/region_mean": 0.07779906783252954, "reward_total_mean": 0.27821362018585205, "reward_meter_mean": 0.9419029355049133, "reward_meter_std": 0.1101876050233841, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8911904096603394, "reward_lexical_plausibility_std": 0.10423477739095688, "reward_repeat_penalty_mean": 0.9617950916290283, "reward_repeat_penalty_std": 0.08661969751119614, "reward_near_duplicate_penalty_mean": 0.9935762882232666, "reward_near_duplicate_penalty_std": 0.013885052874684334, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9994688034057617, "reward_distinct_2_std": 0.00150255614425987, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.3165184557437897, "reward_total_composite_mean": 0.27821362018585205, "reward_total_composite_std": 0.3338005840778351} {"timestamp_utc": "2026-04-12T12:19:33Z", "mode": "train", "global_step": 405, "epoch": 0.016267020122906373, "loss": 0.0602, "grad_norm": 21.173933029174805, "learning_rate": 8.775757575757577e-06, "num_tokens": 800562.0, "completions/mean_length": 21.125, "completions/min_length": 18.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.9415585994720459, "rewards/meter/std": 0.09394428133964539, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9387500286102295, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.7492251992225647, "rewards/repeat_penalty/std": 0.002191446488723159, "rewards/near_duplicate_penalty/mean": 0.9989669322967529, "rewards/near_duplicate_penalty/std": 0.002921935636550188, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.883629322052002, "rewards/total_composite/std": 0.087247833609581, "reward": 0.883629322052002, "reward_std": 0.0872478261590004, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13938158750534058, "sampling/sampling_logp_difference/max": 1.0163929462432861, "sampling/importance_sampling_ratio/min": 0.3618979752063751, "sampling/importance_sampling_ratio/mean": 1.0382153987884521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9832390174269676, "clip_ratio/low_mean": 0.060132576152682304, "clip_ratio/low_min": 0.060132576152682304, "clip_ratio/high_mean": 0.10510136000812054, "clip_ratio/high_max": 0.10510136000812054, "clip_ratio/region_mean": 0.16523393616080284, "reward_total_mean": 0.883629322052002, "reward_meter_mean": 0.9415585994720459, "reward_meter_std": 0.09394428133964539, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7492251992225647, "reward_repeat_penalty_std": 0.002191446488723159, "reward_near_duplicate_penalty_mean": 0.9989669322967529, "reward_near_duplicate_penalty_std": 0.002921935636550188, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9387500286102295, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.883629322052002, "reward_total_composite_std": 0.087247833609581} {"timestamp_utc": "2026-04-12T12:19:42Z", "mode": "train", "global_step": 406, "epoch": 0.016307185604691327, "loss": 0.057, "grad_norm": 22.811269760131836, "learning_rate": 8.772727272727274e-06, "num_tokens": 801864.0, "completions/mean_length": 21.75, "completions/min_length": 20.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.75, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.7749293446540833, "rewards/meter/std": 0.3158000111579895, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.8612500429153442, "rewards/judge_quality/std": 0.16617010533809662, "rewards/repeat_penalty/mean": 0.7400568127632141, "rewards/repeat_penalty/std": 0.02386556752026081, "rewards/near_duplicate_penalty/mean": 0.9867424368858337, "rewards/near_duplicate_penalty/std": 0.03182074800133705, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6544976234436035, "rewards/total_composite/std": 0.2910785675048828, "reward": 0.6544976234436035, "reward_std": 0.2910785377025604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14497463405132294, "sampling/sampling_logp_difference/max": 1.519446849822998, "sampling/importance_sampling_ratio/min": 0.21883292496204376, "sampling/importance_sampling_ratio/mean": 0.9946885108947754, "sampling/importance_sampling_ratio/max": 1.9460806846618652, "entropy": 0.8249792009592056, "clip_ratio/low_mean": 0.05614389292895794, "clip_ratio/low_min": 0.05614389292895794, "clip_ratio/high_mean": 0.0941381985321641, "clip_ratio/high_max": 0.0941381985321641, "clip_ratio/region_mean": 0.15028209146112204, "reward_total_mean": 0.6544976234436035, "reward_meter_mean": 0.7749293446540833, "reward_meter_std": 0.3158000111579895, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.7400568127632141, "reward_repeat_penalty_std": 0.02386556752026081, "reward_near_duplicate_penalty_mean": 0.9867424368858337, "reward_near_duplicate_penalty_std": 0.03182074800133705, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8612500429153442, "reward_judge_quality_std": 0.16617010533809662, "reward_total_composite_mean": 0.6544976234436035, "reward_total_composite_std": 0.2910785675048828} {"timestamp_utc": "2026-04-12T12:19:51Z", "mode": "train", "global_step": 407, "epoch": 0.016347351086476284, "loss": 0.0167, "grad_norm": 15.969156265258789, "learning_rate": 8.76969696969697e-06, "num_tokens": 803547.0, "completions/mean_length": 40.375, "completions/min_length": 32.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.5834869146347046, "rewards/meter/std": 0.38459333777427673, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.7012500166893005, "rewards/judge_quality/std": 0.21963852643966675, "rewards/repeat_penalty/mean": 0.9848974943161011, "rewards/repeat_penalty/std": 0.01567939855158329, "rewards/near_duplicate_penalty/mean": 0.9848974943161011, "rewards/near_duplicate_penalty/std": 0.01567939855158329, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.349627822637558, "rewards/total_composite/std": 0.17711110413074493, "reward": 0.349627822637558, "reward_std": 0.17711110413074493, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18548497557640076, "sampling/sampling_logp_difference/max": 1.9679288864135742, "sampling/importance_sampling_ratio/min": 0.13974598050117493, "sampling/importance_sampling_ratio/mean": 1.0032404661178589, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9753029942512512, "clip_ratio/low_mean": 0.05670153442770243, "clip_ratio/low_min": 0.05670153442770243, "clip_ratio/high_mean": 0.10682980204001069, "clip_ratio/high_max": 0.10682980204001069, "clip_ratio/region_mean": 0.16353133646771312, "reward_total_mean": 0.349627822637558, "reward_meter_mean": 0.5834869146347046, "reward_meter_std": 0.38459333777427673, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9848974943161011, "reward_repeat_penalty_std": 0.01567939855158329, "reward_near_duplicate_penalty_mean": 0.9848974943161011, "reward_near_duplicate_penalty_std": 0.01567939855158329, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7012500166893005, "reward_judge_quality_std": 0.21963852643966675, "reward_total_composite_mean": 0.349627822637558, "reward_total_composite_std": 0.17711110413074493} {"timestamp_utc": "2026-04-12T12:20:01Z", "mode": "train", "global_step": 408, "epoch": 0.016387516568261238, "loss": 0.0098, "grad_norm": 23.339908599853516, "learning_rate": 8.766666666666669e-06, "num_tokens": 805135.0, "completions/mean_length": 39.5, "completions/min_length": 31.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.745948314666748, "rewards/meter/std": 0.36162394285202026, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9822304248809814, "rewards/lexical_plausibility/std": 0.0502600334584713, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101404666900635, "rewards/repeat_penalty/mean": 0.9928247928619385, "rewards/repeat_penalty/std": 0.009688506834208965, "rewards/near_duplicate_penalty/mean": 0.9928247928619385, "rewards/near_duplicate_penalty/std": 0.009688506834208965, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3352487087249756, "rewards/total_composite/std": 0.38816389441490173, "reward": 0.3352487087249756, "reward_std": 0.38816389441490173, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1757953017950058, "sampling/sampling_logp_difference/max": 2.326653242111206, "sampling/importance_sampling_ratio/min": 0.09762191027402878, "sampling/importance_sampling_ratio/mean": 1.0229308605194092, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1553932651877403, "clip_ratio/low_mean": 0.08606366440653801, "clip_ratio/low_min": 0.08606366440653801, "clip_ratio/high_mean": 0.0677096527069807, "clip_ratio/high_max": 0.0677096527069807, "clip_ratio/region_mean": 0.15377331711351871, "reward_total_mean": 0.3352487087249756, "reward_meter_mean": 0.745948314666748, "reward_meter_std": 0.36162394285202026, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9822304248809814, "reward_lexical_plausibility_std": 0.0502600334584713, "reward_repeat_penalty_mean": 0.9928247928619385, "reward_repeat_penalty_std": 0.009688506834208965, "reward_near_duplicate_penalty_mean": 0.9928247928619385, "reward_near_duplicate_penalty_std": 0.009688506834208965, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101404666900635, "reward_total_composite_mean": 0.3352487087249756, "reward_total_composite_std": 0.38816389441490173} {"timestamp_utc": "2026-04-12T12:20:10Z", "mode": "train", "global_step": 409, "epoch": 0.016427682050046192, "loss": 0.1073, "grad_norm": 12.45975399017334, "learning_rate": 8.763636363636364e-06, "num_tokens": 806699.0, "completions/mean_length": 44.5, "completions/min_length": 35.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.8550735712051392, "rewards/meter/std": 0.2305542677640915, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6262499690055847, "rewards/judge_quality/std": 0.3325631022453308, "rewards/repeat_penalty/mean": 0.9285362958908081, "rewards/repeat_penalty/std": 0.09516895562410355, "rewards/near_duplicate_penalty/mean": 0.9433305263519287, "rewards/near_duplicate_penalty/std": 0.06342414021492004, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.492623895406723, "rewards/total_composite/std": 0.3794953525066376, "reward": 0.492623895406723, "reward_std": 0.3794953525066376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16851359605789185, "sampling/sampling_logp_difference/max": 1.8270151615142822, "sampling/importance_sampling_ratio/min": 0.16089309751987457, "sampling/importance_sampling_ratio/mean": 1.0132133960723877, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4425849094986916, "clip_ratio/low_mean": 0.09101798571646214, "clip_ratio/low_min": 0.09101798571646214, "clip_ratio/high_mean": 0.05231028236448765, "clip_ratio/high_max": 0.05231028236448765, "clip_ratio/region_mean": 0.14332826808094978, "reward_total_mean": 0.492623895406723, "reward_meter_mean": 0.8550735712051392, "reward_meter_std": 0.2305542677640915, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9285362958908081, "reward_repeat_penalty_std": 0.09516895562410355, "reward_near_duplicate_penalty_mean": 0.9433305263519287, "reward_near_duplicate_penalty_std": 0.06342414021492004, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.6262499690055847, "reward_judge_quality_std": 0.3325631022453308, "reward_total_composite_mean": 0.492623895406723, "reward_total_composite_std": 0.3794953525066376} {"timestamp_utc": "2026-04-12T12:20:20Z", "mode": "train", "global_step": 410, "epoch": 0.016467847531831146, "loss": 0.0009, "grad_norm": 12.330366134643555, "learning_rate": 8.760606060606061e-06, "num_tokens": 808932.0, "completions/mean_length": 87.125, "completions/min_length": 80.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.125, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.6178456544876099, "rewards/meter/std": 0.32561543583869934, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9310047626495361, "rewards/repeat_penalty/std": 0.07493745535612106, "rewards/near_duplicate_penalty/mean": 0.9718864560127258, "rewards/near_duplicate_penalty/std": 0.022444119676947594, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9568679928779602, "rewards/distinct_2/std": 0.05820569396018982, "rewards/total_composite/mean": 0.2374134659767151, "rewards/total_composite/std": 0.1463068127632141, "reward": 0.2374134659767151, "reward_std": 0.1463068127632141, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1925693303346634, "sampling/sampling_logp_difference/max": 3.0074214935302734, "sampling/importance_sampling_ratio/min": 0.049418944865465164, "sampling/importance_sampling_ratio/mean": 1.0061984062194824, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5813437700271606, "clip_ratio/low_mean": 0.07369900029152632, "clip_ratio/low_min": 0.07369900029152632, "clip_ratio/high_mean": 0.08327173069119453, "clip_ratio/high_max": 0.08327173069119453, "clip_ratio/region_mean": 0.15697073098272085, "reward_total_mean": 0.2374134659767151, "reward_meter_mean": 0.6178456544876099, "reward_meter_std": 0.32561543583869934, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9310047626495361, "reward_repeat_penalty_std": 0.07493745535612106, "reward_near_duplicate_penalty_mean": 0.9718864560127258, "reward_near_duplicate_penalty_std": 0.022444119676947594, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9568679928779602, "reward_distinct_2_std": 0.05820569396018982, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.2374134659767151, "reward_total_composite_std": 0.1463068127632141} {"timestamp_utc": "2026-04-12T12:20:29Z", "mode": "train", "global_step": 411, "epoch": 0.0165080130136161, "loss": 0.0698, "grad_norm": 19.95772361755371, "learning_rate": 8.757575757575759e-06, "num_tokens": 810595.0, "completions/mean_length": 39.875, "completions/min_length": 36.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6561762094497681, "rewards/meter/std": 0.3643706738948822, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.2620250880718231, "rewards/repeat_penalty/mean": 0.7450039982795715, "rewards/repeat_penalty/std": 0.27974092960357666, "rewards/near_duplicate_penalty/mean": 0.919653058052063, "rewards/near_duplicate_penalty/std": 0.06324919313192368, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8795064687728882, "rewards/distinct_2/std": 0.16224141418933868, "rewards/total_composite/mean": 0.3312518000602722, "rewards/total_composite/std": 0.2662372589111328, "reward": 0.3312518000602722, "reward_std": 0.2662372589111328, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1578971892595291, "sampling/sampling_logp_difference/max": 1.4733262062072754, "sampling/importance_sampling_ratio/min": 0.22916197776794434, "sampling/importance_sampling_ratio/mean": 1.0007827281951904, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0910021141171455, "clip_ratio/low_mean": 0.05578818405047059, "clip_ratio/low_min": 0.05578818405047059, "clip_ratio/high_mean": 0.07909977715462446, "clip_ratio/high_max": 0.07909977715462446, "clip_ratio/region_mean": 0.13488796120509505, "reward_total_mean": 0.3312518000602722, "reward_meter_mean": 0.6561762094497681, "reward_meter_std": 0.3643706738948822, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7450039982795715, "reward_repeat_penalty_std": 0.27974092960357666, "reward_near_duplicate_penalty_mean": 0.919653058052063, "reward_near_duplicate_penalty_std": 0.06324919313192368, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8795064687728882, "reward_distinct_2_std": 0.16224141418933868, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.2620250880718231, "reward_total_composite_mean": 0.3312518000602722, "reward_total_composite_std": 0.2662372589111328} {"timestamp_utc": "2026-04-12T12:20:39Z", "mode": "train", "global_step": 412, "epoch": 0.016548178495401054, "loss": 0.1063, "grad_norm": 15.938389778137207, "learning_rate": 8.754545454545456e-06, "num_tokens": 812424.0, "completions/mean_length": 59.625, "completions/min_length": 54.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.625, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.7961858510971069, "rewards/meter/std": 0.29951679706573486, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5837500095367432, "rewards/judge_quality/std": 0.19190306961536407, "rewards/repeat_penalty/mean": 0.9583498239517212, "rewards/repeat_penalty/std": 0.05034941807389259, "rewards/near_duplicate_penalty/mean": 0.9699505567550659, "rewards/near_duplicate_penalty/std": 0.023068485781550407, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9875930547714233, "rewards/distinct_2/std": 0.03509214147925377, "rewards/total_composite/mean": 0.4376469850540161, "rewards/total_composite/std": 0.17945703864097595, "reward": 0.4376469850540161, "reward_std": 0.17945702373981476, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1549452245235443, "sampling/sampling_logp_difference/max": 2.3777527809143066, "sampling/importance_sampling_ratio/min": 0.09275878965854645, "sampling/importance_sampling_ratio/mean": 1.0314337015151978, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8387546688318253, "clip_ratio/low_mean": 0.06667183618992567, "clip_ratio/low_min": 0.06667183618992567, "clip_ratio/high_mean": 0.062450396828353405, "clip_ratio/high_max": 0.062450396828353405, "clip_ratio/region_mean": 0.12912223301827908, "reward_total_mean": 0.4376469850540161, "reward_meter_mean": 0.7961858510971069, "reward_meter_std": 0.29951679706573486, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9583498239517212, "reward_repeat_penalty_std": 0.05034941807389259, "reward_near_duplicate_penalty_mean": 0.9699505567550659, "reward_near_duplicate_penalty_std": 0.023068485781550407, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9875930547714233, "reward_distinct_2_std": 0.03509214147925377, "reward_judge_quality_mean": 0.5837500095367432, "reward_judge_quality_std": 0.19190306961536407, "reward_total_composite_mean": 0.4376469850540161, "reward_total_composite_std": 0.17945703864097595} {"timestamp_utc": "2026-04-12T12:20:48Z", "mode": "train", "global_step": 413, "epoch": 0.016588343977186008, "loss": 0.0653, "grad_norm": 14.789229393005371, "learning_rate": 8.751515151515151e-06, "num_tokens": 814096.0, "completions/mean_length": 51.0, "completions/min_length": 46.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.0, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.602146565914154, "rewards/meter/std": 0.3833732306957245, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.9620596170425415, "rewards/repeat_penalty/std": 0.03415054455399513, "rewards/near_duplicate_penalty/mean": 0.9830785989761353, "rewards/near_duplicate_penalty/std": 0.013511762022972107, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9785538911819458, "rewards/distinct_2/std": 0.02968541905283928, "rewards/total_composite/mean": 0.5035417079925537, "rewards/total_composite/std": 0.3415467441082001, "reward": 0.5035417079925537, "reward_std": 0.3415467143058777, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1885005086660385, "sampling/sampling_logp_difference/max": 1.6356555223464966, "sampling/importance_sampling_ratio/min": 0.19482462108135223, "sampling/importance_sampling_ratio/mean": 1.021082878112793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2148092314600945, "clip_ratio/low_mean": 0.07938603404909372, "clip_ratio/low_min": 0.07938603404909372, "clip_ratio/high_mean": 0.10323066264390945, "clip_ratio/high_max": 0.10323066264390945, "clip_ratio/region_mean": 0.18261669669300318, "reward_total_mean": 0.5035417079925537, "reward_meter_mean": 0.602146565914154, "reward_meter_std": 0.3833732306957245, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9620596170425415, "reward_repeat_penalty_std": 0.03415054455399513, "reward_near_duplicate_penalty_mean": 0.9830785989761353, "reward_near_duplicate_penalty_std": 0.013511762022972107, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9785538911819458, "reward_distinct_2_std": 0.02968541905283928, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.5035417079925537, "reward_total_composite_std": 0.3415467441082001} {"timestamp_utc": "2026-04-12T12:20:56Z", "mode": "train", "global_step": 414, "epoch": 0.01662850945897096, "loss": 0.0331, "grad_norm": 19.247013092041016, "learning_rate": 8.748484848484849e-06, "num_tokens": 815686.0, "completions/mean_length": 42.75, "completions/min_length": 39.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.75, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.9652136564254761, "rewards/meter/std": 0.05562176927924156, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5949999690055847, "rewards/judge_quality/std": 0.2424871176481247, "rewards/repeat_penalty/mean": 0.9602253437042236, "rewards/repeat_penalty/std": 0.03530919924378395, "rewards/near_duplicate_penalty/mean": 0.9695789813995361, "rewards/near_duplicate_penalty/std": 0.02480248548090458, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.5271258354187012, "rewards/total_composite/std": 0.29934781789779663, "reward": 0.5271258354187012, "reward_std": 0.29934781789779663, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17100238800048828, "sampling/sampling_logp_difference/max": 1.5007429122924805, "sampling/importance_sampling_ratio/min": 0.22296446561813354, "sampling/importance_sampling_ratio/mean": 1.0069575309753418, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3524346947669983, "clip_ratio/low_mean": 0.06838395539671183, "clip_ratio/low_min": 0.06838395539671183, "clip_ratio/high_mean": 0.08870341815054417, "clip_ratio/high_max": 0.08870341815054417, "clip_ratio/region_mean": 0.157087373547256, "reward_total_mean": 0.5271258354187012, "reward_meter_mean": 0.9652136564254761, "reward_meter_std": 0.05562176927924156, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9602253437042236, "reward_repeat_penalty_std": 0.03530919924378395, "reward_near_duplicate_penalty_mean": 0.9695789813995361, "reward_near_duplicate_penalty_std": 0.02480248548090458, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.5949999690055847, "reward_judge_quality_std": 0.2424871176481247, "reward_total_composite_mean": 0.5271258354187012, "reward_total_composite_std": 0.29934781789779663} {"timestamp_utc": "2026-04-12T12:21:05Z", "mode": "train", "global_step": 415, "epoch": 0.016668674940755916, "loss": 0.0468, "grad_norm": 24.992507934570312, "learning_rate": 8.745454545454546e-06, "num_tokens": 817352.0, "completions/mean_length": 42.25, "completions/min_length": 38.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.8995040655136108, "rewards/meter/std": 0.18367518484592438, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.8719308972358704, "rewards/repeat_penalty/std": 0.17576731741428375, "rewards/near_duplicate_penalty/mean": 0.9603519439697266, "rewards/near_duplicate_penalty/std": 0.0411485992372036, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9578272104263306, "rewards/distinct_2/std": 0.06420254707336426, "rewards/total_composite/mean": 0.35629498958587646, "rewards/total_composite/std": 0.0774129331111908, "reward": 0.35629498958587646, "reward_std": 0.0774129331111908, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1832866072654724, "sampling/sampling_logp_difference/max": 2.9659318923950195, "sampling/importance_sampling_ratio/min": 0.05151244252920151, "sampling/importance_sampling_ratio/mean": 1.0329174995422363, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2682984620332718, "clip_ratio/low_mean": 0.1089435750618577, "clip_ratio/low_min": 0.1089435750618577, "clip_ratio/high_mean": 0.06746562011539936, "clip_ratio/high_max": 0.06746562011539936, "clip_ratio/region_mean": 0.17640919517725706, "reward_total_mean": 0.35629498958587646, "reward_meter_mean": 0.8995040655136108, "reward_meter_std": 0.18367518484592438, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8719308972358704, "reward_repeat_penalty_std": 0.17576731741428375, "reward_near_duplicate_penalty_mean": 0.9603519439697266, "reward_near_duplicate_penalty_std": 0.0411485992372036, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9578272104263306, "reward_distinct_2_std": 0.06420254707336426, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.35629498958587646, "reward_total_composite_std": 0.0774129331111908} {"timestamp_utc": "2026-04-12T12:21:14Z", "mode": "train", "global_step": 416, "epoch": 0.01670884042254087, "loss": 0.0143, "grad_norm": 21.97481918334961, "learning_rate": 8.742424242424243e-06, "num_tokens": 818755.0, "completions/mean_length": 23.375, "completions/min_length": 20.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.375, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.778793454170227, "rewards/meter/std": 0.3742762506008148, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9730392098426819, "rewards/lexical_plausibility/std": 0.07625661045312881, "rewards/judge_quality/mean": 0.65625, "rewards/judge_quality/std": 0.3692052662372589, "rewards/repeat_penalty/mean": 0.7336001992225647, "rewards/repeat_penalty/std": 0.04393468424677849, "rewards/near_duplicate_penalty/mean": 0.9781335592269897, "rewards/near_duplicate_penalty/std": 0.05857957899570465, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4568037986755371, "rewards/total_composite/std": 0.37264272570610046, "reward": 0.4568037986755371, "reward_std": 0.37264275550842285, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18755678832530975, "sampling/sampling_logp_difference/max": 1.2476906776428223, "sampling/importance_sampling_ratio/min": 0.28716719150543213, "sampling/importance_sampling_ratio/mean": 1.0562388896942139, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.339102678000927, "clip_ratio/low_mean": 0.11233766470104456, "clip_ratio/low_min": 0.11233766470104456, "clip_ratio/high_mean": 0.06971153896301985, "clip_ratio/high_max": 0.06971153896301985, "clip_ratio/region_mean": 0.1820492036640644, "reward_total_mean": 0.4568037986755371, "reward_meter_mean": 0.778793454170227, "reward_meter_std": 0.3742762506008148, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9730392098426819, "reward_lexical_plausibility_std": 0.07625661045312881, "reward_repeat_penalty_mean": 0.7336001992225647, "reward_repeat_penalty_std": 0.04393468424677849, "reward_near_duplicate_penalty_mean": 0.9781335592269897, "reward_near_duplicate_penalty_std": 0.05857957899570465, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.65625, "reward_judge_quality_std": 0.3692052662372589, "reward_total_composite_mean": 0.4568037986755371, "reward_total_composite_std": 0.37264272570610046} {"timestamp_utc": "2026-04-12T12:21:22Z", "mode": "train", "global_step": 417, "epoch": 0.016749005904325823, "loss": -0.0742, "grad_norm": 28.410341262817383, "learning_rate": 8.73939393939394e-06, "num_tokens": 820087.0, "completions/mean_length": 24.5, "completions/min_length": 18.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.9048581719398499, "rewards/meter/std": 0.21377499401569366, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8487499952316284, "rewards/judge_quality/std": 0.20152544975280762, "rewards/repeat_penalty/mean": 0.7361706495285034, "rewards/repeat_penalty/std": 0.037580110132694244, "rewards/near_duplicate_penalty/mean": 0.9815608859062195, "rewards/near_duplicate_penalty/std": 0.050106823444366455, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.8056210279464722, "rewards/total_composite/std": 0.27250534296035767, "reward": 0.8056210279464722, "reward_std": 0.27250534296035767, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16542938351631165, "sampling/sampling_logp_difference/max": 1.246114730834961, "sampling/importance_sampling_ratio/min": 0.2876201272010803, "sampling/importance_sampling_ratio/mean": 1.018161416053772, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3629020899534225, "clip_ratio/low_mean": 0.013888888992369175, "clip_ratio/low_min": 0.013888888992369175, "clip_ratio/high_mean": 0.10890915151685476, "clip_ratio/high_max": 0.10890915151685476, "clip_ratio/region_mean": 0.12279804050922394, "reward_total_mean": 0.8056210279464722, "reward_meter_mean": 0.9048581719398499, "reward_meter_std": 0.21377499401569366, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7361706495285034, "reward_repeat_penalty_std": 0.037580110132694244, "reward_near_duplicate_penalty_mean": 0.9815608859062195, "reward_near_duplicate_penalty_std": 0.050106823444366455, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8487499952316284, "reward_judge_quality_std": 0.20152544975280762, "reward_total_composite_mean": 0.8056210279464722, "reward_total_composite_std": 0.27250534296035767} {"timestamp_utc": "2026-04-12T12:21:35Z", "mode": "train", "global_step": 418, "epoch": 0.016789171386110777, "loss": 0.0564, "grad_norm": 5.44776725769043, "learning_rate": 8.736363636363638e-06, "num_tokens": 823579.0, "completions/mean_length": 226.5, "completions/min_length": 178.0, "completions/max_length": 290.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 226.5, "completions/min_terminated_length": 178.0, "completions/max_terminated_length": 290.0, "rewards/meter/mean": 0.8244215250015259, "rewards/meter/std": 0.18453948199748993, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.06408698856830597, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.3136889338493347, "rewards/repeat_penalty/std": 0.24498972296714783, "rewards/near_duplicate_penalty/mean": 0.8750845193862915, "rewards/near_duplicate_penalty/std": 0.07377022504806519, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.38020312786102295, "rewards/distinct_2/std": 0.26061731576919556, "rewards/total_composite/mean": 0.21593712270259857, "rewards/total_composite/std": 0.07038213312625885, "reward": 0.21593712270259857, "reward_std": 0.07038213312625885, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10993286967277527, "sampling/sampling_logp_difference/max": 3.2446558475494385, "sampling/importance_sampling_ratio/min": 0.038981977850198746, "sampling/importance_sampling_ratio/mean": 1.012296199798584, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7208620756864548, "clip_ratio/low_mean": 0.048527393490076065, "clip_ratio/low_min": 0.048527393490076065, "clip_ratio/high_mean": 0.05202482547610998, "clip_ratio/high_max": 0.05202482547610998, "clip_ratio/region_mean": 0.10055221896618605, "reward_total_mean": 0.21593712270259857, "reward_meter_mean": 0.8244215250015259, "reward_meter_std": 0.18453948199748993, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.06408698856830597, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3136889338493347, "reward_repeat_penalty_std": 0.24498972296714783, "reward_near_duplicate_penalty_mean": 0.8750845193862915, "reward_near_duplicate_penalty_std": 0.07377022504806519, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.38020312786102295, "reward_distinct_2_std": 0.26061731576919556, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.21593712270259857, "reward_total_composite_std": 0.07038213312625885} {"timestamp_utc": "2026-04-12T12:21:45Z", "mode": "train", "global_step": 419, "epoch": 0.01682933686789573, "loss": 0.1044, "grad_norm": 14.743124961853027, "learning_rate": 8.733333333333333e-06, "num_tokens": 825519.0, "completions/mean_length": 73.5, "completions/min_length": 66.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.5, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.7742084860801697, "rewards/meter/std": 0.32632309198379517, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9682209491729736, "rewards/repeat_penalty/std": 0.05635341256856918, "rewards/near_duplicate_penalty/mean": 0.9899640083312988, "rewards/near_duplicate_penalty/std": 0.015279407612979412, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9775148034095764, "rewards/distinct_2/std": 0.04431609809398651, "rewards/total_composite/mean": 0.32289206981658936, "rewards/total_composite/std": 0.15256617963314056, "reward": 0.32289206981658936, "reward_std": 0.15256617963314056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1922486424446106, "sampling/sampling_logp_difference/max": 3.628664493560791, "sampling/importance_sampling_ratio/min": 0.0265516210347414, "sampling/importance_sampling_ratio/mean": 1.0239447355270386, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7284061163663864, "clip_ratio/low_mean": 0.07383543532341719, "clip_ratio/low_min": 0.07383543532341719, "clip_ratio/high_mean": 0.07525335624814034, "clip_ratio/high_max": 0.07525335624814034, "clip_ratio/region_mean": 0.14908879157155752, "reward_total_mean": 0.32289206981658936, "reward_meter_mean": 0.7742084860801697, "reward_meter_std": 0.32632309198379517, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9682209491729736, "reward_repeat_penalty_std": 0.05635341256856918, "reward_near_duplicate_penalty_mean": 0.9899640083312988, "reward_near_duplicate_penalty_std": 0.015279407612979412, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9775148034095764, "reward_distinct_2_std": 0.04431609809398651, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.32289206981658936, "reward_total_composite_std": 0.15256617963314056} {"timestamp_utc": "2026-04-12T12:21:54Z", "mode": "train", "global_step": 420, "epoch": 0.016869502349680685, "loss": 0.0388, "grad_norm": 15.905547142028809, "learning_rate": 8.73030303030303e-06, "num_tokens": 827197.0, "completions/mean_length": 29.75, "completions/min_length": 28.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.75, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.5912508964538574, "rewards/meter/std": 0.28881779313087463, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6262500286102295, "rewards/judge_quality/std": 0.3325631320476532, "rewards/repeat_penalty/mean": 0.8878109455108643, "rewards/repeat_penalty/std": 0.10816412419080734, "rewards/near_duplicate_penalty/mean": 0.9284840822219849, "rewards/near_duplicate_penalty/std": 0.07428260147571564, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9542124271392822, "rewards/distinct_2/std": 0.063445083796978, "rewards/total_composite/mean": 0.32871633768081665, "rewards/total_composite/std": 0.25182682275772095, "reward": 0.32871633768081665, "reward_std": 0.25182679295539856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1979738175868988, "sampling/sampling_logp_difference/max": 2.9579548835754395, "sampling/importance_sampling_ratio/min": 0.05192500352859497, "sampling/importance_sampling_ratio/mean": 1.0083683729171753, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7957288324832916, "clip_ratio/low_mean": 0.118675597012043, "clip_ratio/low_min": 0.118675597012043, "clip_ratio/high_mean": 0.020312500186264515, "clip_ratio/high_max": 0.020312500186264515, "clip_ratio/region_mean": 0.13898809719830751, "reward_total_mean": 0.32871633768081665, "reward_meter_mean": 0.5912508964538574, "reward_meter_std": 0.28881779313087463, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8878109455108643, "reward_repeat_penalty_std": 0.10816412419080734, "reward_near_duplicate_penalty_mean": 0.9284840822219849, "reward_near_duplicate_penalty_std": 0.07428260147571564, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9542124271392822, "reward_distinct_2_std": 0.063445083796978, "reward_judge_quality_mean": 0.6262500286102295, "reward_judge_quality_std": 0.3325631320476532, "reward_total_composite_mean": 0.32871633768081665, "reward_total_composite_std": 0.25182682275772095} {"timestamp_utc": "2026-04-12T12:22:04Z", "mode": "train", "global_step": 421, "epoch": 0.01690966783146564, "loss": 0.0307, "grad_norm": 13.426562309265137, "learning_rate": 8.727272727272728e-06, "num_tokens": 828886.0, "completions/mean_length": 49.125, "completions/min_length": 46.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.125, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.9775240421295166, "rewards/meter/std": 0.01793941855430603, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4412500262260437, "rewards/judge_quality/std": 0.1829470992088318, "rewards/repeat_penalty/mean": 0.9458363056182861, "rewards/repeat_penalty/std": 0.0516032837331295, "rewards/near_duplicate_penalty/mean": 0.9621745347976685, "rewards/near_duplicate_penalty/std": 0.026803744956851006, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.03237133473157883, "rewards/total_composite/mean": 0.4323609471321106, "rewards/total_composite/std": 0.1838994324207306, "reward": 0.4323609471321106, "reward_std": 0.1838994324207306, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14373093843460083, "sampling/sampling_logp_difference/max": 1.046630859375, "sampling/importance_sampling_ratio/min": 0.35111871361732483, "sampling/importance_sampling_ratio/mean": 1.027567744255066, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.535805955529213, "clip_ratio/low_mean": 0.07628573989495635, "clip_ratio/low_min": 0.07628573989495635, "clip_ratio/high_mean": 0.04864583257585764, "clip_ratio/high_max": 0.04864583257585764, "clip_ratio/region_mean": 0.12493157247081399, "reward_total_mean": 0.4323609471321106, "reward_meter_mean": 0.9775240421295166, "reward_meter_std": 0.01793941855430603, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9458363056182861, "reward_repeat_penalty_std": 0.0516032837331295, "reward_near_duplicate_penalty_mean": 0.9621745347976685, "reward_near_duplicate_penalty_std": 0.026803744956851006, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.03237133473157883, "reward_judge_quality_mean": 0.4412500262260437, "reward_judge_quality_std": 0.1829470992088318, "reward_total_composite_mean": 0.4323609471321106, "reward_total_composite_std": 0.1838994324207306} {"timestamp_utc": "2026-04-12T12:22:13Z", "mode": "train", "global_step": 422, "epoch": 0.016949833313250593, "loss": 0.0263, "grad_norm": 13.846668243408203, "learning_rate": 8.724242424242425e-06, "num_tokens": 830568.0, "completions/mean_length": 45.25, "completions/min_length": 42.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.754814088344574, "rewards/meter/std": 0.3215979337692261, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8487499952316284, "rewards/judge_quality/std": 0.20152544975280762, "rewards/repeat_penalty/mean": 0.9346069693565369, "rewards/repeat_penalty/std": 0.18275511264801025, "rewards/near_duplicate_penalty/mean": 0.9788210988044739, "rewards/near_duplicate_penalty/std": 0.057720430195331573, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9711538553237915, "rewards/distinct_2/std": 0.0815892368555069, "rewards/total_composite/mean": 0.6270456910133362, "rewards/total_composite/std": 0.3111444413661957, "reward": 0.6270456910133362, "reward_std": 0.3111444115638733, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13949206471443176, "sampling/sampling_logp_difference/max": 2.811610221862793, "sampling/importance_sampling_ratio/min": 0.06010812893509865, "sampling/importance_sampling_ratio/mean": 1.0061589479446411, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7933690845966339, "clip_ratio/low_mean": 0.04892857186496258, "clip_ratio/low_min": 0.04892857186496258, "clip_ratio/high_mean": 0.07165032811462879, "clip_ratio/high_max": 0.07165032811462879, "clip_ratio/region_mean": 0.12057889997959137, "reward_total_mean": 0.6270456910133362, "reward_meter_mean": 0.754814088344574, "reward_meter_std": 0.3215979337692261, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9346069693565369, "reward_repeat_penalty_std": 0.18275511264801025, "reward_near_duplicate_penalty_mean": 0.9788210988044739, "reward_near_duplicate_penalty_std": 0.057720430195331573, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9711538553237915, "reward_distinct_2_std": 0.0815892368555069, "reward_judge_quality_mean": 0.8487499952316284, "reward_judge_quality_std": 0.20152544975280762, "reward_total_composite_mean": 0.6270456910133362, "reward_total_composite_std": 0.3111444413661957} {"timestamp_utc": "2026-04-12T12:22:22Z", "mode": "train", "global_step": 423, "epoch": 0.016989998795035547, "loss": 0.041, "grad_norm": 10.513765335083008, "learning_rate": 8.72121212121212e-06, "num_tokens": 832063.0, "completions/mean_length": 41.875, "completions/min_length": 38.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.437856525182724, "rewards/meter/std": 0.42093050479888916, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5387499928474426, "rewards/judge_quality/std": 0.3358757197856903, "rewards/repeat_penalty/mean": 0.971872091293335, "rewards/repeat_penalty/std": 0.06182078272104263, "rewards/near_duplicate_penalty/mean": 0.9835901856422424, "rewards/near_duplicate_penalty/std": 0.029320599511265755, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.20321273803710938, "rewards/total_composite/std": 0.27882811427116394, "reward": 0.20321273803710938, "reward_std": 0.27882811427116394, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1514754593372345, "sampling/sampling_logp_difference/max": 2.110161781311035, "sampling/importance_sampling_ratio/min": 0.12121835350990295, "sampling/importance_sampling_ratio/mean": 1.0200660228729248, "sampling/importance_sampling_ratio/max": 1.8916045427322388, "entropy": 1.2396974563598633, "clip_ratio/low_mean": 0.09915817994624376, "clip_ratio/low_min": 0.09915817994624376, "clip_ratio/high_mean": 0.02738095261156559, "clip_ratio/high_max": 0.02738095261156559, "clip_ratio/region_mean": 0.12653913255780935, "reward_total_mean": 0.20321273803710938, "reward_meter_mean": 0.437856525182724, "reward_meter_std": 0.42093050479888916, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.971872091293335, "reward_repeat_penalty_std": 0.06182078272104263, "reward_near_duplicate_penalty_mean": 0.9835901856422424, "reward_near_duplicate_penalty_std": 0.029320599511265755, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.5387499928474426, "reward_judge_quality_std": 0.3358757197856903, "reward_total_composite_mean": 0.20321273803710938, "reward_total_composite_std": 0.27882811427116394} {"timestamp_utc": "2026-04-12T12:22:32Z", "mode": "train", "global_step": 424, "epoch": 0.0170301642768205, "loss": 0.0594, "grad_norm": 14.94465160369873, "learning_rate": 8.71818181818182e-06, "num_tokens": 833716.0, "completions/mean_length": 56.625, "completions/min_length": 48.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.625, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.8263965249061584, "rewards/meter/std": 0.17918136715888977, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9450795650482178, "rewards/repeat_penalty/std": 0.07274159044027328, "rewards/near_duplicate_penalty/mean": 0.970674991607666, "rewards/near_duplicate_penalty/std": 0.027759015560150146, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9725275039672852, "rewards/distinct_2/std": 0.050869233906269073, "rewards/total_composite/mean": 0.3288799226284027, "rewards/total_composite/std": 0.08168979734182358, "reward": 0.3288799226284027, "reward_std": 0.08168978989124298, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20187003910541534, "sampling/sampling_logp_difference/max": 1.8711872100830078, "sampling/importance_sampling_ratio/min": 0.15394079685211182, "sampling/importance_sampling_ratio/mean": 1.0487182140350342, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1094235479831696, "clip_ratio/low_mean": 0.0804588831961155, "clip_ratio/low_min": 0.0804588831961155, "clip_ratio/high_mean": 0.08976180106401443, "clip_ratio/high_max": 0.08976180106401443, "clip_ratio/region_mean": 0.17022068426012993, "reward_total_mean": 0.3288799226284027, "reward_meter_mean": 0.8263965249061584, "reward_meter_std": 0.17918136715888977, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9450795650482178, "reward_repeat_penalty_std": 0.07274159044027328, "reward_near_duplicate_penalty_mean": 0.970674991607666, "reward_near_duplicate_penalty_std": 0.027759015560150146, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9725275039672852, "reward_distinct_2_std": 0.050869233906269073, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.3288799226284027, "reward_total_composite_std": 0.08168979734182358} {"timestamp_utc": "2026-04-12T12:22:40Z", "mode": "train", "global_step": 425, "epoch": 0.017070329758605455, "loss": 0.1842, "grad_norm": 21.431835174560547, "learning_rate": 8.715151515151515e-06, "num_tokens": 835093.0, "completions/mean_length": 26.125, "completions/min_length": 21.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.125, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.8926048278808594, "rewards/meter/std": 0.26264405250549316, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.22677867114543915, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3880215287208557, "rewards/total_composite/std": 0.273574560880661, "reward": 0.3880215287208557, "reward_std": 0.273574560880661, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1933649182319641, "sampling/sampling_logp_difference/max": 1.5909218788146973, "sampling/importance_sampling_ratio/min": 0.20373770594596863, "sampling/importance_sampling_ratio/mean": 0.9922532439231873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4773532301187515, "clip_ratio/low_mean": 0.06284489994868636, "clip_ratio/low_min": 0.06284489994868636, "clip_ratio/high_mean": 0.10304631106555462, "clip_ratio/high_max": 0.10304631106555462, "clip_ratio/region_mean": 0.16589121101424098, "reward_total_mean": 0.3880215287208557, "reward_meter_mean": 0.8926048278808594, "reward_meter_std": 0.26264405250549316, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.22677867114543915, "reward_total_composite_mean": 0.3880215287208557, "reward_total_composite_std": 0.273574560880661} {"timestamp_utc": "2026-04-12T12:22:50Z", "mode": "train", "global_step": 426, "epoch": 0.01711049524039041, "loss": 0.0542, "grad_norm": 14.11231517791748, "learning_rate": 8.712121212121212e-06, "num_tokens": 836620.0, "completions/mean_length": 41.875, "completions/min_length": 30.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6287662386894226, "rewards/meter/std": 0.38475966453552246, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5625, "rewards/judge_quality/std": 0.2282073199748993, "rewards/repeat_penalty/mean": 0.9871855974197388, "rewards/repeat_penalty/std": 0.02491079457104206, "rewards/near_duplicate_penalty/mean": 0.9963431358337402, "rewards/near_duplicate_penalty/std": 0.005119704641401768, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.3885602355003357, "rewards/total_composite/std": 0.33843523263931274, "reward": 0.3885602355003357, "reward_std": 0.33843523263931274, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17799237370491028, "sampling/sampling_logp_difference/max": 1.22430419921875, "sampling/importance_sampling_ratio/min": 0.29396215081214905, "sampling/importance_sampling_ratio/mean": 1.0474486351013184, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9032953679561615, "clip_ratio/low_mean": 0.10399044491350651, "clip_ratio/low_min": 0.10399044491350651, "clip_ratio/high_mean": 0.09663469530642033, "clip_ratio/high_max": 0.09663469530642033, "clip_ratio/region_mean": 0.20062514021992683, "reward_total_mean": 0.3885602355003357, "reward_meter_mean": 0.6287662386894226, "reward_meter_std": 0.38475966453552246, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9871855974197388, "reward_repeat_penalty_std": 0.02491079457104206, "reward_near_duplicate_penalty_mean": 0.9963431358337402, "reward_near_duplicate_penalty_std": 0.005119704641401768, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.5625, "reward_judge_quality_std": 0.2282073199748993, "reward_total_composite_mean": 0.3885602355003357, "reward_total_composite_std": 0.33843523263931274} {"timestamp_utc": "2026-04-12T12:23:04Z", "mode": "train", "global_step": 427, "epoch": 0.017150660722175363, "loss": -0.1547, "grad_norm": 3.417048215866089, "learning_rate": 8.70909090909091e-06, "num_tokens": 838759.0, "completions/mean_length": 212.375, "completions/min_length": 102.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 112.5, "completions/min_terminated_length": 102.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.6894584894180298, "rewards/meter/std": 0.3203989267349243, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9561769366264343, "rewards/lexical_plausibility/std": 0.12395032495260239, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.8323366045951843, "rewards/repeat_penalty/std": 0.24232245981693268, "rewards/near_duplicate_penalty/mean": 0.9581027626991272, "rewards/near_duplicate_penalty/std": 0.07691756635904312, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9047919511795044, "rewards/distinct_2/std": 0.18057399988174438, "rewards/total_composite/mean": 0.14915218949317932, "rewards/total_composite/std": 0.12537094950675964, "reward": 0.14915218949317932, "reward_std": 0.12537094950675964, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1877783089876175, "sampling/sampling_logp_difference/max": 1.2086000442504883, "sampling/importance_sampling_ratio/min": 0.298615038394928, "sampling/importance_sampling_ratio/mean": 1.037097692489624, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.444474697113037, "clip_ratio/low_mean": 0.046176095493137836, "clip_ratio/low_min": 0.046176095493137836, "clip_ratio/high_mean": 0.0699781347066164, "clip_ratio/high_max": 0.0699781347066164, "clip_ratio/region_mean": 0.11615423019975424, "reward_total_mean": 0.14915218949317932, "reward_meter_mean": 0.6894584894180298, "reward_meter_std": 0.3203989267349243, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9561769366264343, "reward_lexical_plausibility_std": 0.12395032495260239, "reward_repeat_penalty_mean": 0.8323366045951843, "reward_repeat_penalty_std": 0.24232245981693268, "reward_near_duplicate_penalty_mean": 0.9581027626991272, "reward_near_duplicate_penalty_std": 0.07691756635904312, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9047919511795044, "reward_distinct_2_std": 0.18057399988174438, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.14915218949317932, "reward_total_composite_std": 0.12537094950675964} {"timestamp_utc": "2026-04-12T12:23:14Z", "mode": "train", "global_step": 428, "epoch": 0.017190826203960317, "loss": 0.0198, "grad_norm": 17.723371505737305, "learning_rate": 8.706060606060607e-06, "num_tokens": 840302.0, "completions/mean_length": 29.875, "completions/min_length": 27.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.875, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.6467967629432678, "rewards/meter/std": 0.32505813241004944, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45499998331069946, "rewards/judge_quality/std": 0.3050995171070099, "rewards/repeat_penalty/mean": 0.9818909764289856, "rewards/repeat_penalty/std": 0.029357997700572014, "rewards/near_duplicate_penalty/mean": 0.9818909764289856, "rewards/near_duplicate_penalty/std": 0.029357997700572014, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29642394185066223, "rewards/total_composite/std": 0.17340131103992462, "reward": 0.29642394185066223, "reward_std": 0.17340131103992462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1463174819946289, "sampling/sampling_logp_difference/max": 1.5079574584960938, "sampling/importance_sampling_ratio/min": 0.2213616520166397, "sampling/importance_sampling_ratio/mean": 1.028766393661499, "sampling/importance_sampling_ratio/max": 1.8806463479995728, "entropy": 1.010727547109127, "clip_ratio/low_mean": 0.020978009328246117, "clip_ratio/low_min": 0.020978009328246117, "clip_ratio/high_mean": 0.10347975790500641, "clip_ratio/high_max": 0.10347975790500641, "clip_ratio/region_mean": 0.12445776723325253, "reward_total_mean": 0.29642394185066223, "reward_meter_mean": 0.6467967629432678, "reward_meter_std": 0.32505813241004944, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9818909764289856, "reward_repeat_penalty_std": 0.029357997700572014, "reward_near_duplicate_penalty_mean": 0.9818909764289856, "reward_near_duplicate_penalty_std": 0.029357997700572014, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45499998331069946, "reward_judge_quality_std": 0.3050995171070099, "reward_total_composite_mean": 0.29642394185066223, "reward_total_composite_std": 0.17340131103992462} {"timestamp_utc": "2026-04-12T12:23:23Z", "mode": "train", "global_step": 429, "epoch": 0.01723099168574527, "loss": 0.0388, "grad_norm": 19.33844566345215, "learning_rate": 8.703030303030304e-06, "num_tokens": 841669.0, "completions/mean_length": 19.875, "completions/min_length": 18.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.737424373626709, "rewards/meter/std": 0.4435030221939087, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8652982115745544, "rewards/lexical_plausibility/std": 0.15936560928821564, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.3481789529323578, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3620902895927429, "rewards/total_composite/std": 0.39068546891212463, "reward": 0.3620902895927429, "reward_std": 0.39068543910980225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16863738000392914, "sampling/sampling_logp_difference/max": 1.6787558794021606, "sampling/importance_sampling_ratio/min": 0.18660598993301392, "sampling/importance_sampling_ratio/mean": 1.0252758264541626, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8704716861248016, "clip_ratio/low_mean": 0.13951545860618353, "clip_ratio/low_min": 0.13951545860618353, "clip_ratio/high_mean": 0.054464287124574184, "clip_ratio/high_max": 0.054464287124574184, "clip_ratio/region_mean": 0.1939797457307577, "reward_total_mean": 0.3620902895927429, "reward_meter_mean": 0.737424373626709, "reward_meter_std": 0.4435030221939087, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8652982115745544, "reward_lexical_plausibility_std": 0.15936560928821564, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.3481789529323578, "reward_total_composite_mean": 0.3620902895927429, "reward_total_composite_std": 0.39068546891212463} {"timestamp_utc": "2026-04-12T12:23:33Z", "mode": "train", "global_step": 430, "epoch": 0.017271157167530225, "loss": 0.1789, "grad_norm": 17.62770652770996, "learning_rate": 8.700000000000001e-06, "num_tokens": 843436.0, "completions/mean_length": 56.875, "completions/min_length": 50.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.875, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.5594629049301147, "rewards/meter/std": 0.3411722183227539, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9628264307975769, "rewards/repeat_penalty/std": 0.03612314537167549, "rewards/near_duplicate_penalty/mean": 0.9628264307975769, "rewards/near_duplicate_penalty/std": 0.03612314537167549, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3280724287033081, "rewards/total_composite/std": 0.22638551890850067, "reward": 0.3280724287033081, "reward_std": 0.22638550400733948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18308889865875244, "sampling/sampling_logp_difference/max": 2.3320999145507812, "sampling/importance_sampling_ratio/min": 0.09709165245294571, "sampling/importance_sampling_ratio/mean": 1.0079594850540161, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0582946464419365, "clip_ratio/low_mean": 0.08709927462041378, "clip_ratio/low_min": 0.08709927462041378, "clip_ratio/high_mean": 0.053845726884901524, "clip_ratio/high_max": 0.053845726884901524, "clip_ratio/region_mean": 0.1409450015053153, "reward_total_mean": 0.3280724287033081, "reward_meter_mean": 0.5594629049301147, "reward_meter_std": 0.3411722183227539, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9628264307975769, "reward_repeat_penalty_std": 0.03612314537167549, "reward_near_duplicate_penalty_mean": 0.9628264307975769, "reward_near_duplicate_penalty_std": 0.03612314537167549, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.3280724287033081, "reward_total_composite_std": 0.22638551890850067} {"timestamp_utc": "2026-04-12T12:23:47Z", "mode": "train", "global_step": 431, "epoch": 0.01731132264931518, "loss": -0.1857, "grad_norm": 3.314324140548706, "learning_rate": 8.696969696969699e-06, "num_tokens": 846166.0, "completions/mean_length": 279.25, "completions/min_length": 179.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 201.6666717529297, "completions/min_terminated_length": 179.0, "completions/max_terminated_length": 231.0, "rewards/meter/mean": 0.7354225516319275, "rewards/meter/std": 0.42297622561454773, "rewards/count_adherence/mean": 0.8611111044883728, "rewards/count_adherence/std": 0.17568209767341614, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9780093431472778, "rewards/lexical_plausibility/std": 0.04118134826421738, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.09910312294960022, "rewards/repeat_penalty/mean": 0.4406975507736206, "rewards/repeat_penalty/std": 0.4031829237937927, "rewards/near_duplicate_penalty/mean": 0.8388845920562744, "rewards/near_duplicate_penalty/std": 0.16234926879405975, "rewards/opening_diversity/mean": 0.8854166865348816, "rewards/opening_diversity/std": 0.205226868391037, "rewards/distinct_2/mean": 0.5116329193115234, "rewards/distinct_2/std": 0.39123836159706116, "rewards/total_composite/mean": 0.10899841785430908, "rewards/total_composite/std": 0.09921231120824814, "reward": 0.10899841785430908, "reward_std": 0.09921231120824814, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10823307186365128, "sampling/sampling_logp_difference/max": 1.6192960739135742, "sampling/importance_sampling_ratio/min": 0.1980380415916443, "sampling/importance_sampling_ratio/mean": 1.0231510400772095, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8005856201052666, "clip_ratio/low_mean": 0.008207070641219616, "clip_ratio/low_min": 0.008207070641219616, "clip_ratio/high_mean": 0.07269664574414492, "clip_ratio/high_max": 0.07269664574414492, "clip_ratio/region_mean": 0.08090371638536453, "reward_total_mean": 0.10899841785430908, "reward_meter_mean": 0.7354225516319275, "reward_meter_std": 0.42297622561454773, "reward_count_adherence_mean": 0.8611111044883728, "reward_count_adherence_std": 0.17568209767341614, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9780093431472778, "reward_lexical_plausibility_std": 0.04118134826421738, "reward_repeat_penalty_mean": 0.4406975507736206, "reward_repeat_penalty_std": 0.4031829237937927, "reward_near_duplicate_penalty_mean": 0.8388845920562744, "reward_near_duplicate_penalty_std": 0.16234926879405975, "reward_opening_diversity_mean": 0.8854166865348816, "reward_opening_diversity_std": 0.205226868391037, "reward_distinct_2_mean": 0.5116329193115234, "reward_distinct_2_std": 0.39123836159706116, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.09910312294960022, "reward_total_composite_mean": 0.10899841785430908, "reward_total_composite_std": 0.09921231120824814} {"timestamp_utc": "2026-04-12T12:24:01Z", "mode": "train", "global_step": 432, "epoch": 0.017351488131100132, "loss": -0.0278, "grad_norm": 1.1596909761428833, "learning_rate": 8.693939393939394e-06, "num_tokens": 847706.0, "completions/mean_length": 329.5, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 25.33333396911621, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.3426334261894226, "rewards/meter/std": 0.46065592765808105, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.810083270072937, "rewards/lexical_plausibility/std": 0.218026265501976, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08040358871221542, "rewards/total_composite/std": 0.1297454982995987, "reward": 0.08040358871221542, "reward_std": 0.1297454982995987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.26203233003616333, "sampling/sampling_logp_difference/max": 1.2051019668579102, "sampling/importance_sampling_ratio/min": 0.29966145753860474, "sampling/importance_sampling_ratio/mean": 1.066463589668274, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0534523129463196, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.06335227377712727, "clip_ratio/high_max": 0.06335227377712727, "clip_ratio/region_mean": 0.06335227377712727, "reward_total_mean": 0.08040358871221542, "reward_meter_mean": 0.3426334261894226, "reward_meter_std": 0.46065592765808105, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.810083270072937, "reward_lexical_plausibility_std": 0.218026265501976, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.08040358871221542, "reward_total_composite_std": 0.1297454982995987} {"timestamp_utc": "2026-04-12T12:24:11Z", "mode": "train", "global_step": 433, "epoch": 0.017391653612885086, "loss": 0.0604, "grad_norm": 13.389408111572266, "learning_rate": 8.690909090909091e-06, "num_tokens": 849480.0, "completions/mean_length": 41.75, "completions/min_length": 36.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.75, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.9307582378387451, "rewards/meter/std": 0.09821143746376038, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.9533466696739197, "rewards/repeat_penalty/std": 0.11704007536172867, "rewards/near_duplicate_penalty/mean": 0.9920774698257446, "rewards/near_duplicate_penalty/std": 0.012791228480637074, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.399087131023407, "rewards/total_composite/std": 0.10525088757276535, "reward": 0.399087131023407, "reward_std": 0.10525088757276535, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14620551466941833, "sampling/sampling_logp_difference/max": 2.6977453231811523, "sampling/importance_sampling_ratio/min": 0.06735721230506897, "sampling/importance_sampling_ratio/mean": 1.0105962753295898, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9248259142041206, "clip_ratio/low_mean": 0.0850168839097023, "clip_ratio/low_min": 0.0850168839097023, "clip_ratio/high_mean": 0.05247699562460184, "clip_ratio/high_max": 0.05247699562460184, "clip_ratio/region_mean": 0.13749387953430414, "reward_total_mean": 0.399087131023407, "reward_meter_mean": 0.9307582378387451, "reward_meter_std": 0.09821143746376038, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9533466696739197, "reward_repeat_penalty_std": 0.11704007536172867, "reward_near_duplicate_penalty_mean": 0.9920774698257446, "reward_near_duplicate_penalty_std": 0.012791228480637074, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.399087131023407, "reward_total_composite_std": 0.10525088757276535} {"timestamp_utc": "2026-04-12T12:24:24Z", "mode": "train", "global_step": 434, "epoch": 0.01743181909467004, "loss": -0.0701, "grad_norm": 5.030261993408203, "learning_rate": 8.687878787878789e-06, "num_tokens": 851100.0, "completions/mean_length": 105.5, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.42857360839844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8845380544662476, "rewards/meter/std": 0.16779212653636932, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9858478307723999, "rewards/lexical_plausibility/std": 0.0400284007191658, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.25961166620254517, "rewards/repeat_penalty/mean": 0.9307153224945068, "rewards/repeat_penalty/std": 0.08318975567817688, "rewards/near_duplicate_penalty/mean": 0.9793448448181152, "rewards/near_duplicate_penalty/std": 0.03710789978504181, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.03237133473157883, "rewards/total_composite/mean": 0.40029793977737427, "rewards/total_composite/std": 0.31994324922561646, "reward": 0.40029793977737427, "reward_std": 0.31994324922561646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16955596208572388, "sampling/sampling_logp_difference/max": 1.5196118354797363, "sampling/importance_sampling_ratio/min": 0.21879681944847107, "sampling/importance_sampling_ratio/mean": 1.0280218124389648, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.387006402015686, "clip_ratio/low_mean": 0.058102767914533615, "clip_ratio/low_min": 0.058102767914533615, "clip_ratio/high_mean": 0.0664657149463892, "clip_ratio/high_max": 0.0664657149463892, "clip_ratio/region_mean": 0.12456848286092281, "reward_total_mean": 0.40029793977737427, "reward_meter_mean": 0.8845380544662476, "reward_meter_std": 0.16779212653636932, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9858478307723999, "reward_lexical_plausibility_std": 0.0400284007191658, "reward_repeat_penalty_mean": 0.9307153224945068, "reward_repeat_penalty_std": 0.08318975567817688, "reward_near_duplicate_penalty_mean": 0.9793448448181152, "reward_near_duplicate_penalty_std": 0.03710789978504181, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.03237133473157883, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.25961166620254517, "reward_total_composite_mean": 0.40029793977737427, "reward_total_composite_std": 0.31994324922561646} {"timestamp_utc": "2026-04-12T12:24:38Z", "mode": "train", "global_step": 435, "epoch": 0.017471984576454994, "loss": -0.0125, "grad_norm": 5.3134379386901855, "learning_rate": 8.684848484848486e-06, "num_tokens": 852750.0, "completions/mean_length": 105.25, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.142860412597656, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.40984004735946655, "rewards/meter/std": 0.35261011123657227, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9995675086975098, "rewards/lexical_plausibility/std": 0.0012233754387125373, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.39617595076560974, "rewards/repeat_penalty/mean": 0.9522122144699097, "rewards/repeat_penalty/std": 0.11480019986629486, "rewards/near_duplicate_penalty/mean": 0.9674084186553955, "rewards/near_duplicate_penalty/std": 0.07194847613573074, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.31701648235321045, "rewards/total_composite/std": 0.36174580454826355, "reward": 0.31701648235321045, "reward_std": 0.36174577474594116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15765489637851715, "sampling/sampling_logp_difference/max": 1.686666488647461, "sampling/importance_sampling_ratio/min": 0.1851356476545334, "sampling/importance_sampling_ratio/mean": 1.0341609716415405, "sampling/importance_sampling_ratio/max": 1.6873053312301636, "entropy": 1.1073570996522903, "clip_ratio/low_mean": 0.07283596880733967, "clip_ratio/low_min": 0.07283596880733967, "clip_ratio/high_mean": 0.058390771970152855, "clip_ratio/high_max": 0.058390771970152855, "clip_ratio/region_mean": 0.13122674077749252, "reward_total_mean": 0.31701648235321045, "reward_meter_mean": 0.40984004735946655, "reward_meter_std": 0.35261011123657227, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9995675086975098, "reward_lexical_plausibility_std": 0.0012233754387125373, "reward_repeat_penalty_mean": 0.9522122144699097, "reward_repeat_penalty_std": 0.11480019986629486, "reward_near_duplicate_penalty_mean": 0.9674084186553955, "reward_near_duplicate_penalty_std": 0.07194847613573074, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.39617595076560974, "reward_total_composite_mean": 0.31701648235321045, "reward_total_composite_std": 0.36174580454826355} {"timestamp_utc": "2026-04-12T12:24:53Z", "mode": "train", "global_step": 436, "epoch": 0.017512150058239948, "loss": -0.1395, "grad_norm": 2.650196075439453, "learning_rate": 8.681818181818182e-06, "num_tokens": 854758.0, "completions/mean_length": 260.0, "completions/min_length": 99.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 108.80000305175781, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.7064166069030762, "rewards/meter/std": 0.3930877447128296, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9454888105392456, "rewards/lexical_plausibility/std": 0.08788902312517166, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.8705521821975708, "rewards/repeat_penalty/std": 0.18051165342330933, "rewards/near_duplicate_penalty/mean": 0.9721640944480896, "rewards/near_duplicate_penalty/std": 0.0354461669921875, "rewards/opening_diversity/mean": 0.979687511920929, "rewards/opening_diversity/std": 0.03892386704683304, "rewards/distinct_2/mean": 0.9269729852676392, "rewards/distinct_2/std": 0.10987544804811478, "rewards/total_composite/mean": 0.13720133900642395, "rewards/total_composite/std": 0.15049776434898376, "reward": 0.13720133900642395, "reward_std": 0.15049777925014496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18098576366901398, "sampling/sampling_logp_difference/max": 1.8638801574707031, "sampling/importance_sampling_ratio/min": 0.1550697684288025, "sampling/importance_sampling_ratio/mean": 1.0196309089660645, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0312328487634659, "clip_ratio/low_mean": 0.03150034788995981, "clip_ratio/low_min": 0.03150034788995981, "clip_ratio/high_mean": 0.05556563567370176, "clip_ratio/high_max": 0.05556563567370176, "clip_ratio/region_mean": 0.08706598356366158, "reward_total_mean": 0.13720133900642395, "reward_meter_mean": 0.7064166069030762, "reward_meter_std": 0.3930877447128296, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9454888105392456, "reward_lexical_plausibility_std": 0.08788902312517166, "reward_repeat_penalty_mean": 0.8705521821975708, "reward_repeat_penalty_std": 0.18051165342330933, "reward_near_duplicate_penalty_mean": 0.9721640944480896, "reward_near_duplicate_penalty_std": 0.0354461669921875, "reward_opening_diversity_mean": 0.979687511920929, "reward_opening_diversity_std": 0.03892386704683304, "reward_distinct_2_mean": 0.9269729852676392, "reward_distinct_2_std": 0.10987544804811478, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.13720133900642395, "reward_total_composite_std": 0.15049776434898376} {"timestamp_utc": "2026-04-12T12:25:08Z", "mode": "train", "global_step": 437, "epoch": 0.017552315540024902, "loss": -0.0699, "grad_norm": 3.9052555561065674, "learning_rate": 8.67878787878788e-06, "num_tokens": 856167.0, "completions/mean_length": 160.125, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 42.833335876464844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5357563495635986, "rewards/meter/std": 0.4217534363269806, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9192672967910767, "rewards/lexical_plausibility/std": 0.13289739191532135, "rewards/judge_quality/mean": 0.47999998927116394, "rewards/judge_quality/std": 0.33903223276138306, "rewards/repeat_penalty/mean": 0.9827923774719238, "rewards/repeat_penalty/std": 0.033745668828487396, "rewards/near_duplicate_penalty/mean": 0.9921927452087402, "rewards/near_duplicate_penalty/std": 0.01090940646827221, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.3074667453765869, "rewards/total_composite/std": 0.2921159267425537, "reward": 0.3074667453765869, "reward_std": 0.2921159267425537, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16886970400810242, "sampling/sampling_logp_difference/max": 1.2983119487762451, "sampling/importance_sampling_ratio/min": 0.27299225330352783, "sampling/importance_sampling_ratio/mean": 0.9962414503097534, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8901057541370392, "clip_ratio/low_mean": 0.033630953170359135, "clip_ratio/low_min": 0.033630953170359135, "clip_ratio/high_mean": 0.0971474926918745, "clip_ratio/high_max": 0.0971474926918745, "clip_ratio/region_mean": 0.13077844586223364, "reward_total_mean": 0.3074667453765869, "reward_meter_mean": 0.5357563495635986, "reward_meter_std": 0.4217534363269806, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9192672967910767, "reward_lexical_plausibility_std": 0.13289739191532135, "reward_repeat_penalty_mean": 0.9827923774719238, "reward_repeat_penalty_std": 0.033745668828487396, "reward_near_duplicate_penalty_mean": 0.9921927452087402, "reward_near_duplicate_penalty_std": 0.01090940646827221, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.47999998927116394, "reward_judge_quality_std": 0.33903223276138306, "reward_total_composite_mean": 0.3074667453765869, "reward_total_composite_std": 0.2921159267425537} {"timestamp_utc": "2026-04-12T12:25:24Z", "mode": "train", "global_step": 438, "epoch": 0.017592481021809856, "loss": -0.1876, "grad_norm": 3.350242853164673, "learning_rate": 8.675757575757576e-06, "num_tokens": 859289.0, "completions/mean_length": 349.25, "completions/min_length": 232.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 251.60000610351562, "completions/min_terminated_length": 232.0, "completions/max_terminated_length": 288.0, "rewards/meter/mean": 0.5100666284561157, "rewards/meter/std": 0.3364863097667694, "rewards/count_adherence/mean": 0.6625000238418579, "rewards/count_adherence/std": 0.2825268507003784, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.9547035694122314, "rewards/lexical_plausibility/std": 0.0760425329208374, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.7465248107910156, "rewards/repeat_penalty/std": 0.31817758083343506, "rewards/near_duplicate_penalty/mean": 0.9175324440002441, "rewards/near_duplicate_penalty/std": 0.10367850214242935, "rewards/opening_diversity/mean": 0.9545454382896423, "rewards/opening_diversity/std": 0.0917171910405159, "rewards/distinct_2/mean": 0.8109216690063477, "rewards/distinct_2/std": 0.25177526473999023, "rewards/total_composite/mean": 0.06108936667442322, "rewards/total_composite/std": 0.08259936422109604, "reward": 0.06108936667442322, "reward_std": 0.08259936422109604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11463236063718796, "sampling/sampling_logp_difference/max": 2.060795783996582, "sampling/importance_sampling_ratio/min": 0.12735258042812347, "sampling/importance_sampling_ratio/mean": 1.0202183723449707, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5843771174550056, "clip_ratio/low_mean": 0.025493130087852478, "clip_ratio/low_min": 0.025493130087852478, "clip_ratio/high_mean": 0.0423896973952651, "clip_ratio/high_max": 0.0423896973952651, "clip_ratio/region_mean": 0.06788282748311758, "reward_total_mean": 0.06108936667442322, "reward_meter_mean": 0.5100666284561157, "reward_meter_std": 0.3364863097667694, "reward_count_adherence_mean": 0.6625000238418579, "reward_count_adherence_std": 0.2825268507003784, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.9547035694122314, "reward_lexical_plausibility_std": 0.0760425329208374, "reward_repeat_penalty_mean": 0.7465248107910156, "reward_repeat_penalty_std": 0.31817758083343506, "reward_near_duplicate_penalty_mean": 0.9175324440002441, "reward_near_duplicate_penalty_std": 0.10367850214242935, "reward_opening_diversity_mean": 0.9545454382896423, "reward_opening_diversity_std": 0.0917171910405159, "reward_distinct_2_mean": 0.8109216690063477, "reward_distinct_2_std": 0.25177526473999023, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.06108936667442322, "reward_total_composite_std": 0.08259936422109604} {"timestamp_utc": "2026-04-12T12:25:43Z", "mode": "train", "global_step": 439, "epoch": 0.01763264650359481, "loss": -0.099, "grad_norm": 4.8546142578125, "learning_rate": 8.672727272727273e-06, "num_tokens": 860998.0, "completions/mean_length": 108.625, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.000003814697266, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.789451003074646, "rewards/meter/std": 0.35648372769355774, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9670825004577637, "rewards/lexical_plausibility/std": 0.0931047722697258, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.23868316411972046, "rewards/repeat_penalty/mean": 0.8674712181091309, "rewards/repeat_penalty/std": 0.17557385563850403, "rewards/near_duplicate_penalty/mean": 0.9874880313873291, "rewards/near_duplicate_penalty/std": 0.017842702567577362, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9610019326210022, "rewards/distinct_2/std": 0.05533240735530853, "rewards/total_composite/mean": 0.3033324182033539, "rewards/total_composite/std": 0.19120368361473083, "reward": 0.3033324182033539, "reward_std": 0.19120366871356964, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15717534720897675, "sampling/sampling_logp_difference/max": 1.75221848487854, "sampling/importance_sampling_ratio/min": 0.17338885366916656, "sampling/importance_sampling_ratio/mean": 1.0023897886276245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2545001059770584, "clip_ratio/low_mean": 0.015625, "clip_ratio/low_min": 0.015625, "clip_ratio/high_mean": 0.12267677020281553, "clip_ratio/high_max": 0.12267677020281553, "clip_ratio/region_mean": 0.13830177020281553, "reward_total_mean": 0.3033324182033539, "reward_meter_mean": 0.789451003074646, "reward_meter_std": 0.35648372769355774, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9670825004577637, "reward_lexical_plausibility_std": 0.0931047722697258, "reward_repeat_penalty_mean": 0.8674712181091309, "reward_repeat_penalty_std": 0.17557385563850403, "reward_near_duplicate_penalty_mean": 0.9874880313873291, "reward_near_duplicate_penalty_std": 0.017842702567577362, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9610019326210022, "reward_distinct_2_std": 0.05533240735530853, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.23868316411972046, "reward_total_composite_mean": 0.3033324182033539, "reward_total_composite_std": 0.19120368361473083} {"timestamp_utc": "2026-04-12T12:25:56Z", "mode": "train", "global_step": 440, "epoch": 0.017672811985379764, "loss": -0.0349, "grad_norm": 7.668520927429199, "learning_rate": 8.66969696969697e-06, "num_tokens": 862982.0, "completions/mean_length": 137.0, "completions/min_length": 73.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 83.42857360839844, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.447530061006546, "rewards/meter/std": 0.29448914527893066, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9737329483032227, "rewards/lexical_plausibility/std": 0.07429433614015579, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.35379326343536377, "rewards/repeat_penalty/mean": 0.9485679864883423, "rewards/repeat_penalty/std": 0.04207950457930565, "rewards/near_duplicate_penalty/mean": 0.9766952991485596, "rewards/near_duplicate_penalty/std": 0.014643006958067417, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9709049463272095, "rewards/distinct_2/std": 0.03147156536579132, "rewards/total_composite/mean": 0.26080653071403503, "rewards/total_composite/std": 0.23689928650856018, "reward": 0.26080653071403503, "reward_std": 0.236899271607399, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20429247617721558, "sampling/sampling_logp_difference/max": 1.795257568359375, "sampling/importance_sampling_ratio/min": 0.1982724815607071, "sampling/importance_sampling_ratio/mean": 0.9991369247436523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8635646998882294, "clip_ratio/low_mean": 0.06671988312155008, "clip_ratio/low_min": 0.06671988312155008, "clip_ratio/high_mean": 0.09525706991553307, "clip_ratio/high_max": 0.09525706991553307, "clip_ratio/region_mean": 0.16197695303708315, "reward_total_mean": 0.26080653071403503, "reward_meter_mean": 0.447530061006546, "reward_meter_std": 0.29448914527893066, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9737329483032227, "reward_lexical_plausibility_std": 0.07429433614015579, "reward_repeat_penalty_mean": 0.9485679864883423, "reward_repeat_penalty_std": 0.04207950457930565, "reward_near_duplicate_penalty_mean": 0.9766952991485596, "reward_near_duplicate_penalty_std": 0.014643006958067417, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9709049463272095, "reward_distinct_2_std": 0.03147156536579132, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.35379326343536377, "reward_total_composite_mean": 0.26080653071403503, "reward_total_composite_std": 0.23689928650856018} {"timestamp_utc": "2026-04-12T12:26:11Z", "mode": "train", "global_step": 441, "epoch": 0.017712977467164718, "loss": -0.0458, "grad_norm": 2.6527109146118164, "learning_rate": 8.666666666666668e-06, "num_tokens": 864646.0, "completions/mean_length": 219.0, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 43.20000076293945, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7206135988235474, "rewards/meter/std": 0.34103232622146606, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8617742657661438, "rewards/lexical_plausibility/std": 0.12996774911880493, "rewards/judge_quality/mean": 0.2837499976158142, "rewards/judge_quality/std": 0.29271817207336426, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20175716280937195, "rewards/total_composite/std": 0.2930894196033478, "reward": 0.20175716280937195, "reward_std": 0.29308944940567017, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22974267601966858, "sampling/sampling_logp_difference/max": 1.2344341278076172, "sampling/importance_sampling_ratio/min": 0.2909993827342987, "sampling/importance_sampling_ratio/mean": 1.0705015659332275, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3769593685865402, "clip_ratio/low_mean": 0.07727272901684046, "clip_ratio/low_min": 0.07727272901684046, "clip_ratio/high_mean": 0.05633075162768364, "clip_ratio/high_max": 0.05633075162768364, "clip_ratio/region_mean": 0.1336034806445241, "reward_total_mean": 0.20175716280937195, "reward_meter_mean": 0.7206135988235474, "reward_meter_std": 0.34103232622146606, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8617742657661438, "reward_lexical_plausibility_std": 0.12996774911880493, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2837499976158142, "reward_judge_quality_std": 0.29271817207336426, "reward_total_composite_mean": 0.20175716280937195, "reward_total_composite_std": 0.2930894196033478} {"timestamp_utc": "2026-04-12T12:26:26Z", "mode": "train", "global_step": 442, "epoch": 0.017753142948949672, "loss": -0.0639, "grad_norm": 5.3352203369140625, "learning_rate": 8.663636363636363e-06, "num_tokens": 866691.0, "completions/mean_length": 157.625, "completions/min_length": 91.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 107.00000762939453, "completions/min_terminated_length": 91.0, "completions/max_terminated_length": 122.0, "rewards/meter/mean": 0.5009660720825195, "rewards/meter/std": 0.30664175748825073, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.24775780737400055, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9654681086540222, "rewards/lexical_plausibility/std": 0.09767089784145355, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1922609806060791, "rewards/repeat_penalty/mean": 0.7729740738868713, "rewards/repeat_penalty/std": 0.31112799048423767, "rewards/near_duplicate_penalty/mean": 0.9449348449707031, "rewards/near_duplicate_penalty/std": 0.07965335249900818, "rewards/opening_diversity/mean": 0.9354166984558105, "rewards/opening_diversity/std": 0.09776775538921356, "rewards/distinct_2/mean": 0.8676998615264893, "rewards/distinct_2/std": 0.2325456142425537, "rewards/total_composite/mean": 0.12077479064464569, "rewards/total_composite/std": 0.10433389246463776, "reward": 0.12077479064464569, "reward_std": 0.10433388501405716, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1649058312177658, "sampling/sampling_logp_difference/max": 1.564957618713379, "sampling/importance_sampling_ratio/min": 0.20909686386585236, "sampling/importance_sampling_ratio/mean": 1.0242584943771362, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.209015041589737, "clip_ratio/low_mean": 0.09367187134921551, "clip_ratio/low_min": 0.09367187134921551, "clip_ratio/high_mean": 0.03636094927787781, "clip_ratio/high_max": 0.03636094927787781, "clip_ratio/region_mean": 0.13003282062709332, "reward_total_mean": 0.12077479064464569, "reward_meter_mean": 0.5009660720825195, "reward_meter_std": 0.30664175748825073, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.24775780737400055, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9654681086540222, "reward_lexical_plausibility_std": 0.09767089784145355, "reward_repeat_penalty_mean": 0.7729740738868713, "reward_repeat_penalty_std": 0.31112799048423767, "reward_near_duplicate_penalty_mean": 0.9449348449707031, "reward_near_duplicate_penalty_std": 0.07965335249900818, "reward_opening_diversity_mean": 0.9354166984558105, "reward_opening_diversity_std": 0.09776775538921356, "reward_distinct_2_mean": 0.8676998615264893, "reward_distinct_2_std": 0.2325456142425537, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1922609806060791, "reward_total_composite_mean": 0.12077479064464569, "reward_total_composite_std": 0.10433389246463776} {"timestamp_utc": "2026-04-12T12:26:40Z", "mode": "train", "global_step": 443, "epoch": 0.017793308430734626, "loss": -0.2596, "grad_norm": 1.8034101724624634, "learning_rate": 8.660606060606062e-06, "num_tokens": 869181.0, "completions/mean_length": 356.25, "completions/min_length": 160.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 200.5, "completions/min_terminated_length": 160.0, "completions/max_terminated_length": 238.0, "rewards/meter/mean": 0.6916443109512329, "rewards/meter/std": 0.43410831689834595, "rewards/count_adherence/mean": 0.5535714626312256, "rewards/count_adherence/std": 0.3095892369747162, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9266760349273682, "rewards/lexical_plausibility/std": 0.10037942975759506, "rewards/judge_quality/mean": 0.10000000149011612, "rewards/judge_quality/std": 0.053452253341674805, "rewards/repeat_penalty/mean": 0.47961631417274475, "rewards/repeat_penalty/std": 0.47854146361351013, "rewards/near_duplicate_penalty/mean": 0.8452885150909424, "rewards/near_duplicate_penalty/std": 0.1606728583574295, "rewards/opening_diversity/mean": 0.9388021230697632, "rewards/opening_diversity/std": 0.0955413281917572, "rewards/distinct_2/mean": 0.5390807390213013, "rewards/distinct_2/std": 0.4962080419063568, "rewards/total_composite/mean": 0.05557997524738312, "rewards/total_composite/std": 0.05952258035540581, "reward": 0.05557997524738312, "reward_std": 0.05952257663011551, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.077547587454319, "sampling/sampling_logp_difference/max": 2.1262025833129883, "sampling/importance_sampling_ratio/min": 0.11928942799568176, "sampling/importance_sampling_ratio/mean": 1.0103402137756348, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.36730458214879036, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.03248908510431647, "clip_ratio/high_max": 0.03248908510431647, "clip_ratio/region_mean": 0.03248908510431647, "reward_total_mean": 0.05557997524738312, "reward_meter_mean": 0.6916443109512329, "reward_meter_std": 0.43410831689834595, "reward_count_adherence_mean": 0.5535714626312256, "reward_count_adherence_std": 0.3095892369747162, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9266760349273682, "reward_lexical_plausibility_std": 0.10037942975759506, "reward_repeat_penalty_mean": 0.47961631417274475, "reward_repeat_penalty_std": 0.47854146361351013, "reward_near_duplicate_penalty_mean": 0.8452885150909424, "reward_near_duplicate_penalty_std": 0.1606728583574295, "reward_opening_diversity_mean": 0.9388021230697632, "reward_opening_diversity_std": 0.0955413281917572, "reward_distinct_2_mean": 0.5390807390213013, "reward_distinct_2_std": 0.4962080419063568, "reward_judge_quality_mean": 0.10000000149011612, "reward_judge_quality_std": 0.053452253341674805, "reward_total_composite_mean": 0.05557997524738312, "reward_total_composite_std": 0.05952258035540581} {"timestamp_utc": "2026-04-12T12:26:55Z", "mode": "train", "global_step": 444, "epoch": 0.01783347391251958, "loss": -0.0573, "grad_norm": 4.504018306732178, "learning_rate": 8.657575757575758e-06, "num_tokens": 871493.0, "completions/mean_length": 179.0, "completions/min_length": 108.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 131.42857360839844, "completions/min_terminated_length": 108.0, "completions/max_terminated_length": 183.0, "rewards/meter/mean": 0.7618038654327393, "rewards/meter/std": 0.3433324694633484, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.974048376083374, "rewards/lexical_plausibility/std": 0.07340221107006073, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.6010661125183105, "rewards/repeat_penalty/std": 0.3114267885684967, "rewards/near_duplicate_penalty/mean": 0.8809487223625183, "rewards/near_duplicate_penalty/std": 0.16103245317935944, "rewards/opening_diversity/mean": 0.9261363744735718, "rewards/opening_diversity/std": 0.20891793072223663, "rewards/distinct_2/mean": 0.6647645235061646, "rewards/distinct_2/std": 0.31705909967422485, "rewards/total_composite/mean": 0.19647744297981262, "rewards/total_composite/std": 0.13350331783294678, "reward": 0.19647744297981262, "reward_std": 0.13350333273410797, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1287020742893219, "sampling/sampling_logp_difference/max": 2.543274164199829, "sampling/importance_sampling_ratio/min": 0.07860860228538513, "sampling/importance_sampling_ratio/mean": 1.0116922855377197, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7886410430073738, "clip_ratio/low_mean": 0.01476200157776475, "clip_ratio/low_min": 0.01476200157776475, "clip_ratio/high_mean": 0.09079050365835428, "clip_ratio/high_max": 0.09079050365835428, "clip_ratio/region_mean": 0.10555250523611903, "reward_total_mean": 0.19647744297981262, "reward_meter_mean": 0.7618038654327393, "reward_meter_std": 0.3433324694633484, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.974048376083374, "reward_lexical_plausibility_std": 0.07340221107006073, "reward_repeat_penalty_mean": 0.6010661125183105, "reward_repeat_penalty_std": 0.3114267885684967, "reward_near_duplicate_penalty_mean": 0.8809487223625183, "reward_near_duplicate_penalty_std": 0.16103245317935944, "reward_opening_diversity_mean": 0.9261363744735718, "reward_opening_diversity_std": 0.20891793072223663, "reward_distinct_2_mean": 0.6647645235061646, "reward_distinct_2_std": 0.31705909967422485, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.19647744297981262, "reward_total_composite_std": 0.13350331783294678} {"timestamp_utc": "2026-04-12T12:27:09Z", "mode": "train", "global_step": 445, "epoch": 0.017873639394304534, "loss": -0.159, "grad_norm": 2.706441879272461, "learning_rate": 8.654545454545455e-06, "num_tokens": 873899.0, "completions/mean_length": 190.75, "completions/min_length": 129.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 144.85714721679688, "completions/min_terminated_length": 129.0, "completions/max_terminated_length": 156.0, "rewards/meter/mean": 0.9669731855392456, "rewards/meter/std": 0.028420019894838333, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2357022613286972, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9743486046791077, "rewards/lexical_plausibility/std": 0.07255306839942932, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.22924906015396118, "rewards/repeat_penalty/std": 0.3353690207004547, "rewards/near_duplicate_penalty/mean": 0.7837797403335571, "rewards/near_duplicate_penalty/std": 0.14415282011032104, "rewards/opening_diversity/mean": 0.8776785135269165, "rewards/opening_diversity/std": 0.10486959666013718, "rewards/distinct_2/mean": 0.2895064651966095, "rewards/distinct_2/std": 0.3314993977546692, "rewards/total_composite/mean": 0.20554478466510773, "rewards/total_composite/std": 0.11008559167385101, "reward": 0.20554478466510773, "reward_std": 0.11008559167385101, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0865015834569931, "sampling/sampling_logp_difference/max": 1.572070598602295, "sampling/importance_sampling_ratio/min": 0.20761485397815704, "sampling/importance_sampling_ratio/mean": 1.0027402639389038, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5501820705831051, "clip_ratio/low_mean": 0.015247253235429525, "clip_ratio/low_min": 0.015247253235429525, "clip_ratio/high_mean": 0.06887097377330065, "clip_ratio/high_max": 0.06887097377330065, "clip_ratio/region_mean": 0.08411822700873017, "reward_total_mean": 0.20554478466510773, "reward_meter_mean": 0.9669731855392456, "reward_meter_std": 0.028420019894838333, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2357022613286972, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9743486046791077, "reward_lexical_plausibility_std": 0.07255306839942932, "reward_repeat_penalty_mean": 0.22924906015396118, "reward_repeat_penalty_std": 0.3353690207004547, "reward_near_duplicate_penalty_mean": 0.7837797403335571, "reward_near_duplicate_penalty_std": 0.14415282011032104, "reward_opening_diversity_mean": 0.8776785135269165, "reward_opening_diversity_std": 0.10486959666013718, "reward_distinct_2_mean": 0.2895064651966095, "reward_distinct_2_std": 0.3314993977546692, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.20554478466510773, "reward_total_composite_std": 0.11008559167385101} {"timestamp_utc": "2026-04-12T12:27:25Z", "mode": "train", "global_step": 446, "epoch": 0.017913804876089488, "loss": -0.0779, "grad_norm": 5.328366756439209, "learning_rate": 8.651515151515152e-06, "num_tokens": 876208.0, "completions/mean_length": 163.625, "completions/min_length": 93.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 113.85714721679688, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.8344897031784058, "rewards/meter/std": 0.24713453650474548, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9974895715713501, "rewards/lexical_plausibility/std": 0.007100627291947603, "rewards/judge_quality/mean": 0.47999995946884155, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.9614061117172241, "rewards/repeat_penalty/std": 0.08976607024669647, "rewards/near_duplicate_penalty/mean": 0.9900728464126587, "rewards/near_duplicate_penalty/std": 0.009938557632267475, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9704141616821289, "rewards/distinct_2/std": 0.08368128538131714, "rewards/total_composite/mean": 0.316730797290802, "rewards/total_composite/std": 0.26133811473846436, "reward": 0.316730797290802, "reward_std": 0.26133811473846436, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1635666936635971, "sampling/sampling_logp_difference/max": 1.8835573196411133, "sampling/importance_sampling_ratio/min": 0.152048259973526, "sampling/importance_sampling_ratio/mean": 1.0204392671585083, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2078724652528763, "clip_ratio/low_mean": 0.09674250427633524, "clip_ratio/low_min": 0.09674250427633524, "clip_ratio/high_mean": 0.035340793430805206, "clip_ratio/high_max": 0.035340793430805206, "clip_ratio/region_mean": 0.13208329770714045, "reward_total_mean": 0.316730797290802, "reward_meter_mean": 0.8344897031784058, "reward_meter_std": 0.24713453650474548, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9974895715713501, "reward_lexical_plausibility_std": 0.007100627291947603, "reward_repeat_penalty_mean": 0.9614061117172241, "reward_repeat_penalty_std": 0.08976607024669647, "reward_near_duplicate_penalty_mean": 0.9900728464126587, "reward_near_duplicate_penalty_std": 0.009938557632267475, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9704141616821289, "reward_distinct_2_std": 0.08368128538131714, "reward_judge_quality_mean": 0.47999995946884155, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.316730797290802, "reward_total_composite_std": 0.26133811473846436} {"timestamp_utc": "2026-04-12T12:27:35Z", "mode": "train", "global_step": 447, "epoch": 0.01795397035787444, "loss": 0.0349, "grad_norm": 11.789586067199707, "learning_rate": 8.64848484848485e-06, "num_tokens": 878217.0, "completions/mean_length": 60.125, "completions/min_length": 54.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.125, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.7874279022216797, "rewards/meter/std": 0.31900274753570557, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9917200803756714, "rewards/lexical_plausibility/std": 0.015595059841871262, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.20310096442699432, "rewards/repeat_penalty/mean": 0.90325528383255, "rewards/repeat_penalty/std": 0.12485902011394501, "rewards/near_duplicate_penalty/mean": 0.9607804417610168, "rewards/near_duplicate_penalty/std": 0.043191585689783096, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9676003456115723, "rewards/distinct_2/std": 0.04872959107160568, "rewards/total_composite/mean": 0.37079668045043945, "rewards/total_composite/std": 0.2684282660484314, "reward": 0.37079668045043945, "reward_std": 0.268428236246109, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16090291738510132, "sampling/sampling_logp_difference/max": 1.4209400415420532, "sampling/importance_sampling_ratio/min": 0.3209053575992584, "sampling/importance_sampling_ratio/mean": 1.0293289422988892, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2205371633172035, "clip_ratio/low_mean": 0.08512650988996029, "clip_ratio/low_min": 0.08512650988996029, "clip_ratio/high_mean": 0.06675884500145912, "clip_ratio/high_max": 0.06675884500145912, "clip_ratio/region_mean": 0.1518853548914194, "reward_total_mean": 0.37079668045043945, "reward_meter_mean": 0.7874279022216797, "reward_meter_std": 0.31900274753570557, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9917200803756714, "reward_lexical_plausibility_std": 0.015595059841871262, "reward_repeat_penalty_mean": 0.90325528383255, "reward_repeat_penalty_std": 0.12485902011394501, "reward_near_duplicate_penalty_mean": 0.9607804417610168, "reward_near_duplicate_penalty_std": 0.043191585689783096, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9676003456115723, "reward_distinct_2_std": 0.04872959107160568, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.20310096442699432, "reward_total_composite_mean": 0.37079668045043945, "reward_total_composite_std": 0.2684282660484314} {"timestamp_utc": "2026-04-12T12:27:50Z", "mode": "train", "global_step": 448, "epoch": 0.017994135839659395, "loss": -0.0535, "grad_norm": 4.804816722869873, "learning_rate": 8.645454545454545e-06, "num_tokens": 879862.0, "completions/mean_length": 105.625, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.57143020629883, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5961958765983582, "rewards/meter/std": 0.3931199014186859, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9792802929878235, "rewards/lexical_plausibility/std": 0.0586041621863842, "rewards/judge_quality/mean": 0.5375000238418579, "rewards/judge_quality/std": 0.3347814083099365, "rewards/repeat_penalty/mean": 0.9795229434967041, "rewards/repeat_penalty/std": 0.020922917872667313, "rewards/near_duplicate_penalty/mean": 0.9795229434967041, "rewards/near_duplicate_penalty/std": 0.020922917872667313, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.36088132858276367, "rewards/total_composite/std": 0.33048778772354126, "reward": 0.36088132858276367, "reward_std": 0.33048778772354126, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1440524011850357, "sampling/sampling_logp_difference/max": 1.861936092376709, "sampling/importance_sampling_ratio/min": 0.1553715318441391, "sampling/importance_sampling_ratio/mean": 1.0400636196136475, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9928457960486412, "clip_ratio/low_mean": 0.08905484667047858, "clip_ratio/low_min": 0.08905484667047858, "clip_ratio/high_mean": 0.046394798904657364, "clip_ratio/high_max": 0.046394798904657364, "clip_ratio/region_mean": 0.13544964557513595, "reward_total_mean": 0.36088132858276367, "reward_meter_mean": 0.5961958765983582, "reward_meter_std": 0.3931199014186859, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9792802929878235, "reward_lexical_plausibility_std": 0.0586041621863842, "reward_repeat_penalty_mean": 0.9795229434967041, "reward_repeat_penalty_std": 0.020922917872667313, "reward_near_duplicate_penalty_mean": 0.9795229434967041, "reward_near_duplicate_penalty_std": 0.020922917872667313, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5375000238418579, "reward_judge_quality_std": 0.3347814083099365, "reward_total_composite_mean": 0.36088132858276367, "reward_total_composite_std": 0.33048778772354126} {"timestamp_utc": "2026-04-12T12:28:05Z", "mode": "train", "global_step": 449, "epoch": 0.01803430132144435, "loss": -0.3189, "grad_norm": 2.427307605743408, "learning_rate": 8.642424242424242e-06, "num_tokens": 882961.0, "completions/mean_length": 327.375, "completions/min_length": 233.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 265.8333435058594, "completions/min_terminated_length": 233.0, "completions/max_terminated_length": 340.0, "rewards/meter/mean": 0.8265117406845093, "rewards/meter/std": 0.33677634596824646, "rewards/count_adherence/mean": 0.7045454978942871, "rewards/count_adherence/std": 0.33224931359291077, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9413131475448608, "rewards/lexical_plausibility/std": 0.11571116000413895, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.06408699601888657, "rewards/repeat_penalty/mean": 0.21820887923240662, "rewards/repeat_penalty/std": 0.4093443751335144, "rewards/near_duplicate_penalty/mean": 0.6777788400650024, "rewards/near_duplicate_penalty/std": 0.2975876033306122, "rewards/opening_diversity/mean": 0.7090300917625427, "rewards/opening_diversity/std": 0.33719363808631897, "rewards/distinct_2/mean": 0.25, "rewards/distinct_2/std": 0.4629100561141968, "rewards/total_composite/mean": 0.10369314253330231, "rewards/total_composite/std": 0.06705006211996078, "reward": 0.10369314253330231, "reward_std": 0.06705006211996078, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05021149665117264, "sampling/sampling_logp_difference/max": 2.2314655780792236, "sampling/importance_sampling_ratio/min": 0.10737095773220062, "sampling/importance_sampling_ratio/mean": 1.0050650835037231, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2698381785303354, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.03363513865042478, "clip_ratio/high_max": 0.03363513865042478, "clip_ratio/region_mean": 0.03363513865042478, "reward_total_mean": 0.10369314253330231, "reward_meter_mean": 0.8265117406845093, "reward_meter_std": 0.33677634596824646, "reward_count_adherence_mean": 0.7045454978942871, "reward_count_adherence_std": 0.33224931359291077, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9413131475448608, "reward_lexical_plausibility_std": 0.11571116000413895, "reward_repeat_penalty_mean": 0.21820887923240662, "reward_repeat_penalty_std": 0.4093443751335144, "reward_near_duplicate_penalty_mean": 0.6777788400650024, "reward_near_duplicate_penalty_std": 0.2975876033306122, "reward_opening_diversity_mean": 0.7090300917625427, "reward_opening_diversity_std": 0.33719363808631897, "reward_distinct_2_mean": 0.25, "reward_distinct_2_std": 0.4629100561141968, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.06408699601888657, "reward_total_composite_mean": 0.10369314253330231, "reward_total_composite_std": 0.06705006211996078} {"timestamp_utc": "2026-04-12T12:28:20Z", "mode": "train", "global_step": 450, "epoch": 0.018074466803229303, "loss": -0.2385, "grad_norm": 2.4964518547058105, "learning_rate": 8.63939393939394e-06, "num_tokens": 887055.0, "completions/mean_length": 360.75, "completions/min_length": 326.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 339.14288330078125, "completions/min_terminated_length": 326.0, "completions/max_terminated_length": 352.0, "rewards/meter/mean": 0.8051550388336182, "rewards/meter/std": 0.3649185001850128, "rewards/count_adherence/mean": 0.6499999761581421, "rewards/count_adherence/std": 0.22677867114543915, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9714911580085754, "rewards/lexical_plausibility/std": 0.08063514530658722, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.2087945193052292, "rewards/repeat_penalty/std": 0.35941508412361145, "rewards/near_duplicate_penalty/mean": 0.7662945985794067, "rewards/near_duplicate_penalty/std": 0.16975484788417816, "rewards/opening_diversity/mean": 0.8149038553237915, "rewards/opening_diversity/std": 0.2093890756368637, "rewards/distinct_2/mean": 0.25672823190689087, "rewards/distinct_2/std": 0.4299718141555786, "rewards/total_composite/mean": 0.088001549243927, "rewards/total_composite/std": 0.04168659821152687, "reward": 0.088001549243927, "reward_std": 0.04168659821152687, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07258587330579758, "sampling/sampling_logp_difference/max": 2.150117874145508, "sampling/importance_sampling_ratio/min": 0.11647042632102966, "sampling/importance_sampling_ratio/mean": 1.0100191831588745, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7186020761728287, "clip_ratio/low_mean": 0.019396550953388214, "clip_ratio/low_min": 0.019396550953388214, "clip_ratio/high_mean": 0.040890860138460994, "clip_ratio/high_max": 0.040890860138460994, "clip_ratio/region_mean": 0.06028741109184921, "reward_total_mean": 0.088001549243927, "reward_meter_mean": 0.8051550388336182, "reward_meter_std": 0.3649185001850128, "reward_count_adherence_mean": 0.6499999761581421, "reward_count_adherence_std": 0.22677867114543915, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9714911580085754, "reward_lexical_plausibility_std": 0.08063514530658722, "reward_repeat_penalty_mean": 0.2087945193052292, "reward_repeat_penalty_std": 0.35941508412361145, "reward_near_duplicate_penalty_mean": 0.7662945985794067, "reward_near_duplicate_penalty_std": 0.16975484788417816, "reward_opening_diversity_mean": 0.8149038553237915, "reward_opening_diversity_std": 0.2093890756368637, "reward_distinct_2_mean": 0.25672823190689087, "reward_distinct_2_std": 0.4299718141555786, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.088001549243927, "reward_total_composite_std": 0.04168659821152687} {"timestamp_utc": "2026-04-12T12:30:52Z", "mode": "eval", "global_step": 450, "epoch": 0.018074466803229303, "eval_loss": NaN, "eval_runtime": 151.4077, "eval_samples_per_second": 0.687, "eval_steps_per_second": 0.086, "eval_num_tokens": 887055.0, "eval_completions/mean_length": 210.3653846153846, "eval_completions/min_length": 46.69230769230769, "eval_completions/max_length": 458.15384615384613, "eval_completions/clipped_ratio": 0.1346153846153846, "eval_completions/mean_terminated_length": 162.63773228571966, "eval_completions/min_terminated_length": 46.69230769230769, "eval_completions/max_terminated_length": 336.0769230769231, "eval_rewards/meter/mean": 0.5266091227531433, "eval_rewards/meter/std": 0.38933635445741505, "eval_rewards/count_adherence/mean": 0.8129428441707904, "eval_rewards/count_adherence/std": 0.21615326289947218, "eval_rewards/arabic_clean/mean": 0.875, "eval_rewards/arabic_clean/std": 0.25542253255844116, "eval_rewards/lexical_plausibility/mean": 0.9771601878679715, "eval_rewards/lexical_plausibility/std": 0.03900533656661327, "eval_rewards/judge_quality/mean": 0.3425961480690883, "eval_rewards/judge_quality/std": 0.19757812240949044, "eval_rewards/repeat_penalty/mean": 0.6584883446876819, "eval_rewards/repeat_penalty/std": 0.3737167280453902, "eval_rewards/near_duplicate_penalty/mean": 0.905442462517665, "eval_rewards/near_duplicate_penalty/std": 0.13739756408792275, "eval_rewards/opening_diversity/mean": 0.9148693084716797, "eval_rewards/opening_diversity/std": 0.15748956054449081, "eval_rewards/distinct_2/mean": 0.7157056377484248, "eval_rewards/distinct_2/std": 0.3620255205493707, "eval_rewards/total_composite/mean": 0.15759526537014887, "eval_rewards/total_composite/std": 0.15852333089480034, "eval_reward": 0.15759526537014887, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06912292196200444, "eval_sampling/sampling_logp_difference/max": 1.1673028285686786, "eval_sampling/importance_sampling_ratio/min": 0.31652708466236407, "eval_sampling/importance_sampling_ratio/mean": 1.0160807646237886, "eval_sampling/importance_sampling_ratio/max": 1.53141293158898, "eval_entropy": 0.8395213943261367, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.15759526537014887, "eval_reward_meter_mean": 0.5266091227531433, "eval_reward_meter_std": 0.38933635445741505, "eval_reward_count_adherence_mean": 0.8129428441707904, "eval_reward_count_adherence_std": 0.21615326289947218, "eval_reward_arabic_clean_mean": 0.875, "eval_reward_arabic_clean_std": 0.25542253255844116, "eval_reward_lexical_plausibility_mean": 0.9771601878679715, "eval_reward_lexical_plausibility_std": 0.03900533656661327, "eval_reward_repeat_penalty_mean": 0.6584883446876819, "eval_reward_repeat_penalty_std": 0.3737167280453902, "eval_reward_near_duplicate_penalty_mean": 0.905442462517665, "eval_reward_near_duplicate_penalty_std": 0.13739756408792275, "eval_reward_opening_diversity_mean": 0.9148693084716797, "eval_reward_opening_diversity_std": 0.15748956054449081, "eval_reward_distinct_2_mean": 0.7157056377484248, "eval_reward_distinct_2_std": 0.3620255205493707, "eval_reward_judge_quality_mean": 0.3425961480690883, "eval_reward_judge_quality_std": 0.19757812240949044, "eval_reward_total_composite_mean": 0.15759526537014887, "eval_reward_total_composite_std": 0.15852333089480034} {"timestamp_utc": "2026-04-12T12:31:08Z", "mode": "train", "global_step": 451, "epoch": 0.018114632285014257, "loss": -0.0706, "grad_norm": 2.170783042907715, "learning_rate": 8.636363636363637e-06, "num_tokens": 888626.0, "completions/mean_length": 221.375, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6213947534561157, "rewards/meter/std": 0.4637322723865509, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8898974657058716, "rewards/lexical_plausibility/std": 0.15224117040634155, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.27998724579811096, "rewards/repeat_penalty/mean": 0.9076778888702393, "rewards/repeat_penalty/std": 0.16397406160831451, "rewards/near_duplicate_penalty/mean": 0.9776195883750916, "rewards/near_duplicate_penalty/std": 0.04622026905417442, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.25828826427459717, "rewards/total_composite/std": 0.2804103493690491, "reward": 0.25828826427459717, "reward_std": 0.28041037917137146, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18175174295902252, "sampling/sampling_logp_difference/max": 1.9918127059936523, "sampling/importance_sampling_ratio/min": 0.13644786179065704, "sampling/importance_sampling_ratio/mean": 1.00529944896698, "sampling/importance_sampling_ratio/max": 1.8992918729782104, "entropy": 0.8205755650997162, "clip_ratio/low_mean": 0.019886363297700882, "clip_ratio/low_min": 0.019886363297700882, "clip_ratio/high_mean": 0.08158301655203104, "clip_ratio/high_max": 0.08158301655203104, "clip_ratio/region_mean": 0.10146937984973192, "reward_total_mean": 0.25828826427459717, "reward_meter_mean": 0.6213947534561157, "reward_meter_std": 0.4637322723865509, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8898974657058716, "reward_lexical_plausibility_std": 0.15224117040634155, "reward_repeat_penalty_mean": 0.9076778888702393, "reward_repeat_penalty_std": 0.16397406160831451, "reward_near_duplicate_penalty_mean": 0.9776195883750916, "reward_near_duplicate_penalty_std": 0.04622026905417442, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.27998724579811096, "reward_total_composite_mean": 0.25828826427459717, "reward_total_composite_std": 0.2804103493690491} {"timestamp_utc": "2026-04-12T12:31:17Z", "mode": "train", "global_step": 452, "epoch": 0.01815479776679921, "loss": 0.0491, "grad_norm": 16.583702087402344, "learning_rate": 8.633333333333334e-06, "num_tokens": 890370.0, "completions/mean_length": 50.0, "completions/min_length": 43.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.0, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.8257185816764832, "rewards/meter/std": 0.2584497332572937, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9797744750976562, "rewards/repeat_penalty/std": 0.0284157395362854, "rewards/near_duplicate_penalty/mean": 0.9797744750976562, "rewards/near_duplicate_penalty/std": 0.0284157395362854, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4004746079444885, "rewards/total_composite/std": 0.14909245073795319, "reward": 0.4004746079444885, "reward_std": 0.149092435836792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17566032707691193, "sampling/sampling_logp_difference/max": 1.372208595275879, "sampling/importance_sampling_ratio/min": 0.2535463571548462, "sampling/importance_sampling_ratio/mean": 1.0329374074935913, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5124791264533997, "clip_ratio/low_mean": 0.07602121867239475, "clip_ratio/low_min": 0.07602121867239475, "clip_ratio/high_mean": 0.07484584953635931, "clip_ratio/high_max": 0.07484584953635931, "clip_ratio/region_mean": 0.15086706820875406, "reward_total_mean": 0.4004746079444885, "reward_meter_mean": 0.8257185816764832, "reward_meter_std": 0.2584497332572937, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9797744750976562, "reward_repeat_penalty_std": 0.0284157395362854, "reward_near_duplicate_penalty_mean": 0.9797744750976562, "reward_near_duplicate_penalty_std": 0.0284157395362854, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.4004746079444885, "reward_total_composite_std": 0.14909245073795319} {"timestamp_utc": "2026-04-12T12:31:28Z", "mode": "train", "global_step": 453, "epoch": 0.018194963248584165, "loss": 0.13, "grad_norm": 6.972647666931152, "learning_rate": 8.630303030303032e-06, "num_tokens": 892783.0, "completions/mean_length": 121.625, "completions/min_length": 99.0, "completions/max_length": 156.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 121.625, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 156.0, "rewards/meter/mean": 0.9071915149688721, "rewards/meter/std": 0.09999934583902359, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.4688087999820709, "rewards/repeat_penalty/std": 0.36062806844711304, "rewards/near_duplicate_penalty/mean": 0.8616430759429932, "rewards/near_duplicate_penalty/std": 0.14222761988639832, "rewards/opening_diversity/mean": 0.859375, "rewards/opening_diversity/std": 0.302057683467865, "rewards/distinct_2/mean": 0.5397911071777344, "rewards/distinct_2/std": 0.3427259922027588, "rewards/total_composite/mean": 0.2506418228149414, "rewards/total_composite/std": 0.06561446934938431, "reward": 0.2506418228149414, "reward_std": 0.06561446934938431, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11622463166713715, "sampling/sampling_logp_difference/max": 2.561680793762207, "sampling/importance_sampling_ratio/min": 0.07717491686344147, "sampling/importance_sampling_ratio/mean": 1.0179163217544556, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6076498217880726, "clip_ratio/low_mean": 0.03519226820208132, "clip_ratio/low_min": 0.03519226820208132, "clip_ratio/high_mean": 0.061575477942824364, "clip_ratio/high_max": 0.061575477942824364, "clip_ratio/region_mean": 0.09676774614490569, "reward_total_mean": 0.2506418228149414, "reward_meter_mean": 0.9071915149688721, "reward_meter_std": 0.09999934583902359, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4688087999820709, "reward_repeat_penalty_std": 0.36062806844711304, "reward_near_duplicate_penalty_mean": 0.8616430759429932, "reward_near_duplicate_penalty_std": 0.14222761988639832, "reward_opening_diversity_mean": 0.859375, "reward_opening_diversity_std": 0.302057683467865, "reward_distinct_2_mean": 0.5397911071777344, "reward_distinct_2_std": 0.3427259922027588, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.2506418228149414, "reward_total_composite_std": 0.06561446934938431} {"timestamp_utc": "2026-04-12T12:31:42Z", "mode": "train", "global_step": 454, "epoch": 0.01823512873036912, "loss": -0.0411, "grad_norm": 1.3595945835113525, "learning_rate": 8.627272727272727e-06, "num_tokens": 894238.0, "completions/mean_length": 139.875, "completions/min_length": 14.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 15.833333969116211, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.7350038290023804, "rewards/meter/std": 0.41689085960388184, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9627242088317871, "rewards/lexical_plausibility/std": 0.0736796110868454, "rewards/judge_quality/mean": 0.6312500238418579, "rewards/judge_quality/std": 0.40912583470344543, "rewards/repeat_penalty/mean": 0.5043357014656067, "rewards/repeat_penalty/std": 0.2692793905735016, "rewards/near_duplicate_penalty/mean": 0.6847714781761169, "rewards/near_duplicate_penalty/std": 0.2506482005119324, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8889120817184448, "rewards/distinct_2/std": 0.13700076937675476, "rewards/total_composite/mean": 0.5911006331443787, "rewards/total_composite/std": 0.41112080216407776, "reward": 0.5911006331443787, "reward_std": 0.41112077236175537, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.139166459441185, "sampling/sampling_logp_difference/max": 1.0971436500549316, "sampling/importance_sampling_ratio/min": 0.33382323384284973, "sampling/importance_sampling_ratio/mean": 0.9744467735290527, "sampling/importance_sampling_ratio/max": 1.6231614351272583, "entropy": 0.6575254499912262, "clip_ratio/low_mean": 0.008928571827709675, "clip_ratio/low_min": 0.008928571827709675, "clip_ratio/high_mean": 0.0935763893648982, "clip_ratio/high_max": 0.0935763893648982, "clip_ratio/region_mean": 0.10250496119260788, "reward_total_mean": 0.5911006331443787, "reward_meter_mean": 0.7350038290023804, "reward_meter_std": 0.41689085960388184, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9627242088317871, "reward_lexical_plausibility_std": 0.0736796110868454, "reward_repeat_penalty_mean": 0.5043357014656067, "reward_repeat_penalty_std": 0.2692793905735016, "reward_near_duplicate_penalty_mean": 0.6847714781761169, "reward_near_duplicate_penalty_std": 0.2506482005119324, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8889120817184448, "reward_distinct_2_std": 0.13700076937675476, "reward_judge_quality_mean": 0.6312500238418579, "reward_judge_quality_std": 0.40912583470344543, "reward_total_composite_mean": 0.5911006331443787, "reward_total_composite_std": 0.41112080216407776} {"timestamp_utc": "2026-04-12T12:31:55Z", "mode": "train", "global_step": 455, "epoch": 0.018275294212154077, "loss": -0.0013, "grad_norm": 6.438784122467041, "learning_rate": 8.624242424242424e-06, "num_tokens": 895717.0, "completions/mean_length": 101.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.28571701049805, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.8325039148330688, "rewards/meter/std": 0.2588021159172058, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9751418232917786, "rewards/lexical_plausibility/std": 0.070309579372406, "rewards/judge_quality/mean": 0.4675000309944153, "rewards/judge_quality/std": 0.3998839259147644, "rewards/repeat_penalty/mean": 0.9999389052391052, "rewards/repeat_penalty/std": 0.00017280207248404622, "rewards/near_duplicate_penalty/mean": 0.9999389052391052, "rewards/near_duplicate_penalty/std": 0.00017280207248404622, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3942283093929291, "rewards/total_composite/std": 0.35926198959350586, "reward": 0.3942283093929291, "reward_std": 0.35926195979118347, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17224042117595673, "sampling/sampling_logp_difference/max": 1.1990406513214111, "sampling/importance_sampling_ratio/min": 0.30148330330848694, "sampling/importance_sampling_ratio/mean": 1.0153626203536987, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1479218304157257, "clip_ratio/low_mean": 0.09406539052724838, "clip_ratio/low_min": 0.09406539052724838, "clip_ratio/high_mean": 0.08770995028316975, "clip_ratio/high_max": 0.08770995028316975, "clip_ratio/region_mean": 0.18177534081041813, "reward_total_mean": 0.3942283093929291, "reward_meter_mean": 0.8325039148330688, "reward_meter_std": 0.2588021159172058, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9751418232917786, "reward_lexical_plausibility_std": 0.070309579372406, "reward_repeat_penalty_mean": 0.9999389052391052, "reward_repeat_penalty_std": 0.00017280207248404622, "reward_near_duplicate_penalty_mean": 0.9999389052391052, "reward_near_duplicate_penalty_std": 0.00017280207248404622, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000309944153, "reward_judge_quality_std": 0.3998839259147644, "reward_total_composite_mean": 0.3942283093929291, "reward_total_composite_std": 0.35926198959350586} {"timestamp_utc": "2026-04-12T12:32:11Z", "mode": "train", "global_step": 456, "epoch": 0.01831545969393903, "loss": -0.1058, "grad_norm": 5.302556991577148, "learning_rate": 8.621212121212122e-06, "num_tokens": 898002.0, "completions/mean_length": 148.625, "completions/min_length": 85.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 96.71428680419922, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.611673891544342, "rewards/meter/std": 0.3498254418373108, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9578578472137451, "rewards/lexical_plausibility/std": 0.10840871930122375, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.8715651035308838, "rewards/repeat_penalty/std": 0.2136087566614151, "rewards/near_duplicate_penalty/mean": 0.9509821534156799, "rewards/near_duplicate_penalty/std": 0.06376034021377563, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.9321064949035645, "rewards/distinct_2/std": 0.137295663356781, "rewards/total_composite/mean": 0.2218300998210907, "rewards/total_composite/std": 0.14927150309085846, "reward": 0.2218300998210907, "reward_std": 0.14927148818969727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13501262664794922, "sampling/sampling_logp_difference/max": 2.1519289016723633, "sampling/importance_sampling_ratio/min": 0.11625968664884567, "sampling/importance_sampling_ratio/mean": 1.021620273590088, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8340182527899742, "clip_ratio/low_mean": 0.06189540959894657, "clip_ratio/low_min": 0.06189540959894657, "clip_ratio/high_mean": 0.05583109613507986, "clip_ratio/high_max": 0.05583109613507986, "clip_ratio/region_mean": 0.11772650573402643, "reward_total_mean": 0.2218300998210907, "reward_meter_mean": 0.611673891544342, "reward_meter_std": 0.3498254418373108, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9578578472137451, "reward_lexical_plausibility_std": 0.10840871930122375, "reward_repeat_penalty_mean": 0.8715651035308838, "reward_repeat_penalty_std": 0.2136087566614151, "reward_near_duplicate_penalty_mean": 0.9509821534156799, "reward_near_duplicate_penalty_std": 0.06376034021377563, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.9321064949035645, "reward_distinct_2_std": 0.137295663356781, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.2218300998210907, "reward_total_composite_std": 0.14927150309085846} {"timestamp_utc": "2026-04-12T12:32:23Z", "mode": "train", "global_step": 457, "epoch": 0.018355625175723984, "loss": 0.0642, "grad_norm": 5.847695827484131, "learning_rate": 8.618181818181819e-06, "num_tokens": 901340.0, "completions/mean_length": 188.25, "completions/min_length": 169.0, "completions/max_length": 240.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 188.25, "completions/min_terminated_length": 169.0, "completions/max_terminated_length": 240.0, "rewards/meter/mean": 0.9877897500991821, "rewards/meter/std": 0.006837547291070223, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.05892555043101311, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.297836571931839, "rewards/repeat_penalty/std": 0.29885193705558777, "rewards/near_duplicate_penalty/mean": 0.8359514474868774, "rewards/near_duplicate_penalty/std": 0.11799436062574387, "rewards/opening_diversity/mean": 0.9732142686843872, "rewards/opening_diversity/std": 0.04959750175476074, "rewards/distinct_2/mean": 0.35675370693206787, "rewards/distinct_2/std": 0.3196938633918762, "rewards/total_composite/mean": 0.14082619547843933, "rewards/total_composite/std": 0.05942106246948242, "reward": 0.14082619547843933, "reward_std": 0.05942106246948242, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09971191734075546, "sampling/sampling_logp_difference/max": 1.7250299453735352, "sampling/importance_sampling_ratio/min": 0.17816773056983948, "sampling/importance_sampling_ratio/mean": 1.0115858316421509, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6942291334271431, "clip_ratio/low_mean": 0.06989877298474312, "clip_ratio/low_min": 0.06989877298474312, "clip_ratio/high_mean": 0.02292899414896965, "clip_ratio/high_max": 0.02292899414896965, "clip_ratio/region_mean": 0.09282776713371277, "reward_total_mean": 0.14082619547843933, "reward_meter_mean": 0.9877897500991821, "reward_meter_std": 0.006837547291070223, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.05892555043101311, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.297836571931839, "reward_repeat_penalty_std": 0.29885193705558777, "reward_near_duplicate_penalty_mean": 0.8359514474868774, "reward_near_duplicate_penalty_std": 0.11799436062574387, "reward_opening_diversity_mean": 0.9732142686843872, "reward_opening_diversity_std": 0.04959750175476074, "reward_distinct_2_mean": 0.35675370693206787, "reward_distinct_2_std": 0.3196938633918762, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.14082619547843933, "reward_total_composite_std": 0.05942106246948242} {"timestamp_utc": "2026-04-12T12:32:37Z", "mode": "train", "global_step": 458, "epoch": 0.01839579065750894, "loss": -0.0538, "grad_norm": 3.4252231121063232, "learning_rate": 8.615151515151516e-06, "num_tokens": 902944.0, "completions/mean_length": 162.5, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 46.0, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.2845132350921631, "rewards/meter/std": 0.3603869676589966, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9401000738143921, "rewards/lexical_plausibility/std": 0.11121214181184769, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.3632394075393677, "rewards/repeat_penalty/mean": 0.9974934458732605, "rewards/repeat_penalty/std": 0.006550848484039307, "rewards/near_duplicate_penalty/mean": 0.9974934458732605, "rewards/near_duplicate_penalty/std": 0.006550848484039307, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18996964395046234, "rewards/total_composite/std": 0.23681482672691345, "reward": 0.18996964395046234, "reward_std": 0.23681481182575226, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17456616461277008, "sampling/sampling_logp_difference/max": 2.0782382488250732, "sampling/importance_sampling_ratio/min": 0.12515050172805786, "sampling/importance_sampling_ratio/mean": 1.03304123878479, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.010149508714676, "clip_ratio/low_mean": 0.0731565672904253, "clip_ratio/low_min": 0.0731565672904253, "clip_ratio/high_mean": 0.09311594255268574, "clip_ratio/high_max": 0.09311594255268574, "clip_ratio/region_mean": 0.16627250984311104, "reward_total_mean": 0.18996964395046234, "reward_meter_mean": 0.2845132350921631, "reward_meter_std": 0.3603869676589966, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9401000738143921, "reward_lexical_plausibility_std": 0.11121214181184769, "reward_repeat_penalty_mean": 0.9974934458732605, "reward_repeat_penalty_std": 0.006550848484039307, "reward_near_duplicate_penalty_mean": 0.9974934458732605, "reward_near_duplicate_penalty_std": 0.006550848484039307, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.3632394075393677, "reward_total_composite_mean": 0.18996964395046234, "reward_total_composite_std": 0.23681482672691345} {"timestamp_utc": "2026-04-12T12:32:51Z", "mode": "train", "global_step": 459, "epoch": 0.018435956139293892, "loss": 0.0085, "grad_norm": 1.7777029275894165, "learning_rate": 8.612121212121213e-06, "num_tokens": 904755.0, "completions/mean_length": 306.375, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 100.75, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 232.0, "rewards/meter/mean": 0.4911397695541382, "rewards/meter/std": 0.42764201760292053, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.4432026445865631, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8601722121238708, "rewards/lexical_plausibility/std": 0.12183038890361786, "rewards/judge_quality/mean": 0.2587500214576721, "rewards/judge_quality/std": 0.30898162722587585, "rewards/repeat_penalty/mean": 0.8600711822509766, "rewards/repeat_penalty/std": 0.34969615936279297, "rewards/near_duplicate_penalty/mean": 0.9648240804672241, "rewards/near_duplicate_penalty/std": 0.09662505984306335, "rewards/opening_diversity/mean": 0.9838235378265381, "rewards/opening_diversity/std": 0.03539901599287987, "rewards/distinct_2/mean": 0.873298168182373, "rewards/distinct_2/std": 0.35289791226387024, "rewards/total_composite/mean": 0.17820200324058533, "rewards/total_composite/std": 0.321745365858078, "reward": 0.17820200324058533, "reward_std": 0.3217453360557556, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11229118704795837, "sampling/sampling_logp_difference/max": 1.5878190994262695, "sampling/importance_sampling_ratio/min": 0.20437082648277283, "sampling/importance_sampling_ratio/mean": 0.9947002530097961, "sampling/importance_sampling_ratio/max": 1.7974423170089722, "entropy": 0.5010434947907925, "clip_ratio/low_mean": 0.028348806779831648, "clip_ratio/low_min": 0.028348806779831648, "clip_ratio/high_mean": 0.05631359852850437, "clip_ratio/high_max": 0.05631359852850437, "clip_ratio/region_mean": 0.08466240530833602, "reward_total_mean": 0.17820200324058533, "reward_meter_mean": 0.4911397695541382, "reward_meter_std": 0.42764201760292053, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.4432026445865631, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8601722121238708, "reward_lexical_plausibility_std": 0.12183038890361786, "reward_repeat_penalty_mean": 0.8600711822509766, "reward_repeat_penalty_std": 0.34969615936279297, "reward_near_duplicate_penalty_mean": 0.9648240804672241, "reward_near_duplicate_penalty_std": 0.09662505984306335, "reward_opening_diversity_mean": 0.9838235378265381, "reward_opening_diversity_std": 0.03539901599287987, "reward_distinct_2_mean": 0.873298168182373, "reward_distinct_2_std": 0.35289791226387024, "reward_judge_quality_mean": 0.2587500214576721, "reward_judge_quality_std": 0.30898162722587585, "reward_total_composite_mean": 0.17820200324058533, "reward_total_composite_std": 0.321745365858078} {"timestamp_utc": "2026-04-12T12:33:08Z", "mode": "train", "global_step": 460, "epoch": 0.018476121621078846, "loss": -0.0153, "grad_norm": 5.404685974121094, "learning_rate": 8.60909090909091e-06, "num_tokens": 906512.0, "completions/mean_length": 112.625, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 55.57143020629883, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6130282878875732, "rewards/meter/std": 0.406497985124588, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9545073509216309, "rewards/lexical_plausibility/std": 0.1286727488040924, "rewards/judge_quality/mean": 0.6474999785423279, "rewards/judge_quality/std": 0.3930739760398865, "rewards/repeat_penalty/mean": 0.9848916530609131, "rewards/repeat_penalty/std": 0.01518380269408226, "rewards/near_duplicate_penalty/mean": 0.9848916530609131, "rewards/near_duplicate_penalty/std": 0.01518380269408226, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3965218663215637, "rewards/total_composite/std": 0.4368768632411957, "reward": 0.3965218663215637, "reward_std": 0.43687689304351807, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16560642421245575, "sampling/sampling_logp_difference/max": 1.5658135414123535, "sampling/importance_sampling_ratio/min": 0.20891797542572021, "sampling/importance_sampling_ratio/mean": 1.0113576650619507, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.271149955689907, "clip_ratio/low_mean": 0.06828668527305126, "clip_ratio/low_min": 0.06828668527305126, "clip_ratio/high_mean": 0.05355507740750909, "clip_ratio/high_max": 0.05355507740750909, "clip_ratio/region_mean": 0.12184176268056035, "reward_total_mean": 0.3965218663215637, "reward_meter_mean": 0.6130282878875732, "reward_meter_std": 0.406497985124588, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9545073509216309, "reward_lexical_plausibility_std": 0.1286727488040924, "reward_repeat_penalty_mean": 0.9848916530609131, "reward_repeat_penalty_std": 0.01518380269408226, "reward_near_duplicate_penalty_mean": 0.9848916530609131, "reward_near_duplicate_penalty_std": 0.01518380269408226, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6474999785423279, "reward_judge_quality_std": 0.3930739760398865, "reward_total_composite_mean": 0.3965218663215637, "reward_total_composite_std": 0.4368768632411957} {"timestamp_utc": "2026-04-12T12:33:17Z", "mode": "train", "global_step": 461, "epoch": 0.0185162871028638, "loss": 0.0929, "grad_norm": 15.785818099975586, "learning_rate": 8.606060606060606e-06, "num_tokens": 908219.0, "completions/mean_length": 46.375, "completions/min_length": 40.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.375, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6502194404602051, "rewards/meter/std": 0.41814494132995605, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7637499570846558, "rewards/judge_quality/std": 0.2332955002784729, "rewards/repeat_penalty/mean": 0.9891205430030823, "rewards/repeat_penalty/std": 0.024065691977739334, "rewards/near_duplicate_penalty/mean": 0.9978618025779724, "rewards/near_duplicate_penalty/std": 0.0032560399267822504, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.49290597438812256, "rewards/total_composite/std": 0.36434832215309143, "reward": 0.49290597438812256, "reward_std": 0.36434832215309143, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17635053396224976, "sampling/sampling_logp_difference/max": 1.5859463214874268, "sampling/importance_sampling_ratio/min": 0.20475393533706665, "sampling/importance_sampling_ratio/mean": 1.0242173671722412, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4119069501757622, "clip_ratio/low_mean": 0.07350852247327566, "clip_ratio/low_min": 0.07350852247327566, "clip_ratio/high_mean": 0.07539495546370745, "clip_ratio/high_max": 0.07539495546370745, "clip_ratio/region_mean": 0.1489034779369831, "reward_total_mean": 0.49290597438812256, "reward_meter_mean": 0.6502194404602051, "reward_meter_std": 0.41814494132995605, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9891205430030823, "reward_repeat_penalty_std": 0.024065691977739334, "reward_near_duplicate_penalty_mean": 0.9978618025779724, "reward_near_duplicate_penalty_std": 0.0032560399267822504, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.7637499570846558, "reward_judge_quality_std": 0.2332955002784729, "reward_total_composite_mean": 0.49290597438812256, "reward_total_composite_std": 0.36434832215309143} {"timestamp_utc": "2026-04-12T12:33:31Z", "mode": "train", "global_step": 462, "epoch": 0.018556452584648754, "loss": -0.0128, "grad_norm": 5.457734107971191, "learning_rate": 8.603030303030303e-06, "num_tokens": 910084.0, "completions/mean_length": 139.125, "completions/min_length": 63.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 85.85714721679688, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 126.0, "rewards/meter/mean": 0.35627731680870056, "rewards/meter/std": 0.3022831678390503, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9872536659240723, "rewards/lexical_plausibility/std": 0.036052118986845016, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.258370578289032, "rewards/repeat_penalty/mean": 0.8636877536773682, "rewards/repeat_penalty/std": 0.347133994102478, "rewards/near_duplicate_penalty/mean": 0.929741621017456, "rewards/near_duplicate_penalty/std": 0.16045944392681122, "rewards/opening_diversity/mean": 0.9312499761581421, "rewards/opening_diversity/std": 0.1944543719291687, "rewards/distinct_2/mean": 0.8826597332954407, "rewards/distinct_2/std": 0.33188846707344055, "rewards/total_composite/mean": 0.10821406543254852, "rewards/total_composite/std": 0.12190105766057968, "reward": 0.10821406543254852, "reward_std": 0.12190105020999908, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1310155987739563, "sampling/sampling_logp_difference/max": 1.7909269332885742, "sampling/importance_sampling_ratio/min": 0.1668054759502411, "sampling/importance_sampling_ratio/mean": 1.0047672986984253, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.652204480022192, "clip_ratio/low_mean": 0.06669470248743892, "clip_ratio/low_min": 0.06669470248743892, "clip_ratio/high_mean": 0.0298466170206666, "clip_ratio/high_max": 0.0298466170206666, "clip_ratio/region_mean": 0.09654131950810552, "reward_total_mean": 0.10821406543254852, "reward_meter_mean": 0.35627731680870056, "reward_meter_std": 0.3022831678390503, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9872536659240723, "reward_lexical_plausibility_std": 0.036052118986845016, "reward_repeat_penalty_mean": 0.8636877536773682, "reward_repeat_penalty_std": 0.347133994102478, "reward_near_duplicate_penalty_mean": 0.929741621017456, "reward_near_duplicate_penalty_std": 0.16045944392681122, "reward_opening_diversity_mean": 0.9312499761581421, "reward_opening_diversity_std": 0.1944543719291687, "reward_distinct_2_mean": 0.8826597332954407, "reward_distinct_2_std": 0.33188846707344055, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.258370578289032, "reward_total_composite_mean": 0.10821406543254852, "reward_total_composite_std": 0.12190105766057968} {"timestamp_utc": "2026-04-12T12:33:46Z", "mode": "train", "global_step": 463, "epoch": 0.018596618066433708, "loss": -0.1033, "grad_norm": 1.9380801916122437, "learning_rate": 8.6e-06, "num_tokens": 912070.0, "completions/mean_length": 468.25, "completions/min_length": 162.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 162.0, "completions/min_terminated_length": 162.0, "completions/max_terminated_length": 162.0, "rewards/meter/mean": 0.48026472330093384, "rewards/meter/std": 0.3324054181575775, "rewards/count_adherence/mean": 0.550000011920929, "rewards/count_adherence/std": 0.3964124619960785, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.7741320133209229, "rewards/lexical_plausibility/std": 0.13840529322624207, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9630327224731445, "rewards/repeat_penalty/std": 0.08634717017412186, "rewards/near_duplicate_penalty/mean": 0.9947658777236938, "rewards/near_duplicate_penalty/std": 0.00745810242369771, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9995168447494507, "rewards/distinct_2/std": 0.0013666537124663591, "rewards/total_composite/mean": 0.021223342046141624, "rewards/total_composite/std": 0.06002867966890335, "reward": 0.021223342046141624, "reward_std": 0.06002867594361305, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14795254170894623, "sampling/sampling_logp_difference/max": 1.2214689254760742, "sampling/importance_sampling_ratio/min": 0.29479679465293884, "sampling/importance_sampling_ratio/mean": 1.0171161890029907, "sampling/importance_sampling_ratio/max": 1.8904085159301758, "entropy": 0.17437541484832764, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.014660493470728397, "clip_ratio/high_max": 0.014660493470728397, "clip_ratio/region_mean": 0.014660493470728397, "reward_total_mean": 0.021223342046141624, "reward_meter_mean": 0.48026472330093384, "reward_meter_std": 0.3324054181575775, "reward_count_adherence_mean": 0.550000011920929, "reward_count_adherence_std": 0.3964124619960785, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.7741320133209229, "reward_lexical_plausibility_std": 0.13840529322624207, "reward_repeat_penalty_mean": 0.9630327224731445, "reward_repeat_penalty_std": 0.08634717017412186, "reward_near_duplicate_penalty_mean": 0.9947658777236938, "reward_near_duplicate_penalty_std": 0.00745810242369771, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9995168447494507, "reward_distinct_2_std": 0.0013666537124663591, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.021223342046141624, "reward_total_composite_std": 0.06002867966890335} {"timestamp_utc": "2026-04-12T12:33:59Z", "mode": "train", "global_step": 464, "epoch": 0.018636783548218662, "loss": -0.0916, "grad_norm": 2.500302314758301, "learning_rate": 8.596969696969698e-06, "num_tokens": 913462.0, "completions/mean_length": 224.0, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 51.20000076293945, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.815238893032074, "rewards/meter/std": 0.3413713574409485, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8877477645874023, "rewards/lexical_plausibility/std": 0.15713438391685486, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3612182140350342, "rewards/repeat_penalty/mean": 0.9581383466720581, "rewards/repeat_penalty/std": 0.08907745778560638, "rewards/near_duplicate_penalty/mean": 0.9975959062576294, "rewards/near_duplicate_penalty/std": 0.006460277829319239, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.32244977355003357, "rewards/total_composite/std": 0.30975663661956787, "reward": 0.32244977355003357, "reward_std": 0.3097566068172455, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.167901411652565, "sampling/sampling_logp_difference/max": 1.6881446838378906, "sampling/importance_sampling_ratio/min": 0.1848621815443039, "sampling/importance_sampling_ratio/mean": 1.042559027671814, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0568195208907127, "clip_ratio/low_mean": 0.013888888992369175, "clip_ratio/low_min": 0.013888888992369175, "clip_ratio/high_mean": 0.08075993601232767, "clip_ratio/high_max": 0.08075993601232767, "clip_ratio/region_mean": 0.09464882500469685, "reward_total_mean": 0.32244977355003357, "reward_meter_mean": 0.815238893032074, "reward_meter_std": 0.3413713574409485, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8877477645874023, "reward_lexical_plausibility_std": 0.15713438391685486, "reward_repeat_penalty_mean": 0.9581383466720581, "reward_repeat_penalty_std": 0.08907745778560638, "reward_near_duplicate_penalty_mean": 0.9975959062576294, "reward_near_duplicate_penalty_std": 0.006460277829319239, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3612182140350342, "reward_total_composite_mean": 0.32244977355003357, "reward_total_composite_std": 0.30975663661956787} {"timestamp_utc": "2026-04-12T12:34:14Z", "mode": "train", "global_step": 465, "epoch": 0.018676949030003616, "loss": -0.0487, "grad_norm": 3.8521788120269775, "learning_rate": 8.593939393939395e-06, "num_tokens": 914959.0, "completions/mean_length": 160.125, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 42.833335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5718278288841248, "rewards/meter/std": 0.4065650701522827, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9053156971931458, "rewards/lexical_plausibility/std": 0.15994581580162048, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.9709079265594482, "rewards/repeat_penalty/std": 0.03222690522670746, "rewards/near_duplicate_penalty/mean": 0.9794907569885254, "rewards/near_duplicate_penalty/std": 0.022272756323218346, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.1988687515258789, "rewards/total_composite/std": 0.19370269775390625, "reward": 0.1988687515258789, "reward_std": 0.19370269775390625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17526750266551971, "sampling/sampling_logp_difference/max": 1.7957658767700195, "sampling/importance_sampling_ratio/min": 0.16600026190280914, "sampling/importance_sampling_ratio/mean": 1.0346271991729736, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.014502078294754, "clip_ratio/low_mean": 0.03730158880352974, "clip_ratio/low_min": 0.03730158880352974, "clip_ratio/high_mean": 0.10084797907620668, "clip_ratio/high_max": 0.10084797907620668, "clip_ratio/region_mean": 0.13814956787973642, "reward_total_mean": 0.1988687515258789, "reward_meter_mean": 0.5718278288841248, "reward_meter_std": 0.4065650701522827, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9053156971931458, "reward_lexical_plausibility_std": 0.15994581580162048, "reward_repeat_penalty_mean": 0.9709079265594482, "reward_repeat_penalty_std": 0.03222690522670746, "reward_near_duplicate_penalty_mean": 0.9794907569885254, "reward_near_duplicate_penalty_std": 0.022272756323218346, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.1988687515258789, "reward_total_composite_std": 0.19370269775390625} {"timestamp_utc": "2026-04-12T12:34:28Z", "mode": "train", "global_step": 466, "epoch": 0.01871711451178857, "loss": 0.0068, "grad_norm": 6.118508815765381, "learning_rate": 8.590909090909092e-06, "num_tokens": 917132.0, "completions/mean_length": 164.625, "completions/min_length": 95.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 115.00000762939453, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 130.0, "rewards/meter/mean": 0.6192550659179688, "rewards/meter/std": 0.3906235992908478, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.24775780737400055, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9633049964904785, "rewards/lexical_plausibility/std": 0.10378912091255188, "rewards/judge_quality/mean": 0.3412500023841858, "rewards/judge_quality/std": 0.2564280927181244, "rewards/repeat_penalty/mean": 0.7339690923690796, "rewards/repeat_penalty/std": 0.2971440255641937, "rewards/near_duplicate_penalty/mean": 0.936042308807373, "rewards/near_duplicate_penalty/std": 0.06508824229240417, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8219245076179504, "rewards/distinct_2/std": 0.21221967041492462, "rewards/total_composite/mean": 0.22211773693561554, "rewards/total_composite/std": 0.2933432161808014, "reward": 0.22211773693561554, "reward_std": 0.2933432161808014, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15400467813014984, "sampling/sampling_logp_difference/max": 2.870518207550049, "sampling/importance_sampling_ratio/min": 0.05666955187916756, "sampling/importance_sampling_ratio/mean": 1.0181410312652588, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9257434085011482, "clip_ratio/low_mean": 0.06992149259895086, "clip_ratio/low_min": 0.06992149259895086, "clip_ratio/high_mean": 0.06821741908788681, "clip_ratio/high_max": 0.06821741908788681, "clip_ratio/region_mean": 0.13813891168683767, "reward_total_mean": 0.22211773693561554, "reward_meter_mean": 0.6192550659179688, "reward_meter_std": 0.3906235992908478, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.24775780737400055, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9633049964904785, "reward_lexical_plausibility_std": 0.10378912091255188, "reward_repeat_penalty_mean": 0.7339690923690796, "reward_repeat_penalty_std": 0.2971440255641937, "reward_near_duplicate_penalty_mean": 0.936042308807373, "reward_near_duplicate_penalty_std": 0.06508824229240417, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8219245076179504, "reward_distinct_2_std": 0.21221967041492462, "reward_judge_quality_mean": 0.3412500023841858, "reward_judge_quality_std": 0.2564280927181244, "reward_total_composite_mean": 0.22211773693561554, "reward_total_composite_std": 0.2933432161808014} {"timestamp_utc": "2026-04-12T12:34:40Z", "mode": "train", "global_step": 467, "epoch": 0.018757279993573524, "loss": 0.0374, "grad_norm": 3.205953598022461, "learning_rate": 8.587878787878788e-06, "num_tokens": 921223.0, "completions/mean_length": 301.375, "completions/min_length": 264.0, "completions/max_length": 386.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 301.375, "completions/min_terminated_length": 264.0, "completions/max_terminated_length": 386.0, "rewards/meter/mean": 0.9814234972000122, "rewards/meter/std": 0.013453001156449318, "rewards/count_adherence/mean": 0.7222222089767456, "rewards/count_adherence/std": 0.11878278106451035, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.005827170331031084, "rewards/repeat_penalty/std": 0.016481727361679077, "rewards/near_duplicate_penalty/mean": 0.5068979263305664, "rewards/near_duplicate_penalty/std": 0.1939096450805664, "rewards/opening_diversity/mean": 0.589586615562439, "rewards/opening_diversity/std": 0.2773093581199646, "rewards/distinct_2/mean": 0.017191141843795776, "rewards/distinct_2/std": 0.04862389340996742, "rewards/total_composite/mean": 0.09664815664291382, "rewards/total_composite/std": 0.02899831160902977, "reward": 0.09664815664291382, "reward_std": 0.02899831160902977, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0416940413415432, "sampling/sampling_logp_difference/max": 2.6657280921936035, "sampling/importance_sampling_ratio/min": 0.06954869627952576, "sampling/importance_sampling_ratio/mean": 1.0035876035690308, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3000090792775154, "clip_ratio/low_mean": 0.00976654514670372, "clip_ratio/low_min": 0.00976654514670372, "clip_ratio/high_mean": 0.02837038761936128, "clip_ratio/high_max": 0.02837038761936128, "clip_ratio/region_mean": 0.038136932766065, "reward_total_mean": 0.09664815664291382, "reward_meter_mean": 0.9814234972000122, "reward_meter_std": 0.013453001156449318, "reward_count_adherence_mean": 0.7222222089767456, "reward_count_adherence_std": 0.11878278106451035, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.005827170331031084, "reward_repeat_penalty_std": 0.016481727361679077, "reward_near_duplicate_penalty_mean": 0.5068979263305664, "reward_near_duplicate_penalty_std": 0.1939096450805664, "reward_opening_diversity_mean": 0.589586615562439, "reward_opening_diversity_std": 0.2773093581199646, "reward_distinct_2_mean": 0.017191141843795776, "reward_distinct_2_std": 0.04862389340996742, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.09664815664291382, "reward_total_composite_std": 0.02899831160902977} {"timestamp_utc": "2026-04-12T12:34:50Z", "mode": "train", "global_step": 468, "epoch": 0.018797445475358478, "loss": 0.132, "grad_norm": 14.356237411499023, "learning_rate": 8.584848484848485e-06, "num_tokens": 923162.0, "completions/mean_length": 84.375, "completions/min_length": 58.0, "completions/max_length": 105.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.375, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.7646868824958801, "rewards/meter/std": 0.26857540011405945, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2357022613286972, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9935064911842346, "rewards/lexical_plausibility/std": 0.012782488018274307, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9549342393875122, "rewards/repeat_penalty/std": 0.03803550451993942, "rewards/near_duplicate_penalty/mean": 0.9848763346672058, "rewards/near_duplicate_penalty/std": 0.007629488594830036, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9694910645484924, "rewards/distinct_2/std": 0.03459250554442406, "rewards/total_composite/mean": 0.2837463915348053, "rewards/total_composite/std": 0.13871093094348907, "reward": 0.2837463915348053, "reward_std": 0.13871093094348907, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15805473923683167, "sampling/sampling_logp_difference/max": 1.5223498344421387, "sampling/importance_sampling_ratio/min": 0.21819856762886047, "sampling/importance_sampling_ratio/mean": 1.0121657848358154, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0732149854302406, "clip_ratio/low_mean": 0.03880208358168602, "clip_ratio/low_min": 0.03880208358168602, "clip_ratio/high_mean": 0.12570246774703264, "clip_ratio/high_max": 0.12570246774703264, "clip_ratio/region_mean": 0.16450455132871866, "reward_total_mean": 0.2837463915348053, "reward_meter_mean": 0.7646868824958801, "reward_meter_std": 0.26857540011405945, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2357022613286972, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9935064911842346, "reward_lexical_plausibility_std": 0.012782488018274307, "reward_repeat_penalty_mean": 0.9549342393875122, "reward_repeat_penalty_std": 0.03803550451993942, "reward_near_duplicate_penalty_mean": 0.9848763346672058, "reward_near_duplicate_penalty_std": 0.007629488594830036, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9694910645484924, "reward_distinct_2_std": 0.03459250554442406, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.2837463915348053, "reward_total_composite_std": 0.13871093094348907} {"timestamp_utc": "2026-04-12T12:35:04Z", "mode": "train", "global_step": 469, "epoch": 0.01883761095714343, "loss": -0.1855, "grad_norm": 2.868105411529541, "learning_rate": 8.581818181818183e-06, "num_tokens": 925255.0, "completions/mean_length": 281.625, "completions/min_length": 122.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 143.40000915527344, "completions/min_terminated_length": 122.0, "completions/max_terminated_length": 176.0, "rewards/meter/mean": 0.787610650062561, "rewards/meter/std": 0.3252897262573242, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.1602174937725067, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8840222358703613, "rewards/lexical_plausibility/std": 0.16291122138500214, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.2199837565422058, "rewards/repeat_penalty/mean": 0.8537392020225525, "rewards/repeat_penalty/std": 0.21768257021903992, "rewards/near_duplicate_penalty/mean": 0.9621591567993164, "rewards/near_duplicate_penalty/std": 0.04488173872232437, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.906207799911499, "rewards/distinct_2/std": 0.15854863822460175, "rewards/total_composite/mean": 0.12211199104785919, "rewards/total_composite/std": 0.13145306706428528, "reward": 0.12211199104785919, "reward_std": 0.13145306706428528, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12535236775875092, "sampling/sampling_logp_difference/max": 1.8409175872802734, "sampling/importance_sampling_ratio/min": 0.1586717665195465, "sampling/importance_sampling_ratio/mean": 1.0280526876449585, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5625474229454994, "clip_ratio/low_mean": 0.012295082211494446, "clip_ratio/low_min": 0.012295082211494446, "clip_ratio/high_mean": 0.06628303416073322, "clip_ratio/high_max": 0.06628303416073322, "clip_ratio/region_mean": 0.07857811637222767, "reward_total_mean": 0.12211199104785919, "reward_meter_mean": 0.787610650062561, "reward_meter_std": 0.3252897262573242, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.1602174937725067, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8840222358703613, "reward_lexical_plausibility_std": 0.16291122138500214, "reward_repeat_penalty_mean": 0.8537392020225525, "reward_repeat_penalty_std": 0.21768257021903992, "reward_near_duplicate_penalty_mean": 0.9621591567993164, "reward_near_duplicate_penalty_std": 0.04488173872232437, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.906207799911499, "reward_distinct_2_std": 0.15854863822460175, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.2199837565422058, "reward_total_composite_mean": 0.12211199104785919, "reward_total_composite_std": 0.13145306706428528} {"timestamp_utc": "2026-04-12T12:35:19Z", "mode": "train", "global_step": 470, "epoch": 0.018877776438928386, "loss": -0.1159, "grad_norm": 3.014456033706665, "learning_rate": 8.57878787878788e-06, "num_tokens": 928597.0, "completions/mean_length": 271.75, "completions/min_length": 210.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 237.4285888671875, "completions/min_terminated_length": 210.0, "completions/max_terminated_length": 251.0, "rewards/meter/mean": 0.941405177116394, "rewards/meter/std": 0.09066831320524216, "rewards/count_adherence/mean": 0.8035714030265808, "rewards/count_adherence/std": 0.10628911107778549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9671759605407715, "rewards/lexical_plausibility/std": 0.09284044802188873, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.12993720173835754, "rewards/repeat_penalty/std": 0.18206985294818878, "rewards/near_duplicate_penalty/mean": 0.7461811900138855, "rewards/near_duplicate_penalty/std": 0.12352963536977768, "rewards/opening_diversity/mean": 0.7981770634651184, "rewards/opening_diversity/std": 0.2740727663040161, "rewards/distinct_2/mean": 0.255423367023468, "rewards/distinct_2/std": 0.277616024017334, "rewards/total_composite/mean": 0.14619973301887512, "rewards/total_composite/std": 0.10242842882871628, "reward": 0.14619973301887512, "reward_std": 0.10242842137813568, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07308058440685272, "sampling/sampling_logp_difference/max": 1.3938860893249512, "sampling/importance_sampling_ratio/min": 0.24810925126075745, "sampling/importance_sampling_ratio/mean": 1.0120410919189453, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5316671617329121, "clip_ratio/low_mean": 0.03577795741148293, "clip_ratio/low_min": 0.03577795741148293, "clip_ratio/high_mean": 0.021479230374097824, "clip_ratio/high_max": 0.021479230374097824, "clip_ratio/region_mean": 0.057257187785580754, "reward_total_mean": 0.14619973301887512, "reward_meter_mean": 0.941405177116394, "reward_meter_std": 0.09066831320524216, "reward_count_adherence_mean": 0.8035714030265808, "reward_count_adherence_std": 0.10628911107778549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9671759605407715, "reward_lexical_plausibility_std": 0.09284044802188873, "reward_repeat_penalty_mean": 0.12993720173835754, "reward_repeat_penalty_std": 0.18206985294818878, "reward_near_duplicate_penalty_mean": 0.7461811900138855, "reward_near_duplicate_penalty_std": 0.12352963536977768, "reward_opening_diversity_mean": 0.7981770634651184, "reward_opening_diversity_std": 0.2740727663040161, "reward_distinct_2_mean": 0.255423367023468, "reward_distinct_2_std": 0.277616024017334, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.14619973301887512, "reward_total_composite_std": 0.10242842882871628} {"timestamp_utc": "2026-04-12T12:35:32Z", "mode": "train", "global_step": 471, "epoch": 0.01891794192071334, "loss": -0.02, "grad_norm": 3.8852856159210205, "learning_rate": 8.575757575757575e-06, "num_tokens": 930057.0, "completions/mean_length": 148.5, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 27.33333396911621, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5910894274711609, "rewards/meter/std": 0.4692842960357666, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8728610277175903, "rewards/lexical_plausibility/std": 0.19085237383842468, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.3744877576828003, "rewards/repeat_penalty/mean": 0.8007950782775879, "rewards/repeat_penalty/std": 0.11195925623178482, "rewards/near_duplicate_penalty/mean": 0.9861470460891724, "rewards/near_duplicate_penalty/std": 0.026621105149388313, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3510221242904663, "rewards/total_composite/std": 0.37824493646621704, "reward": 0.3510221242904663, "reward_std": 0.37824493646621704, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1798359453678131, "sampling/sampling_logp_difference/max": 1.9128549098968506, "sampling/importance_sampling_ratio/min": 0.14765822887420654, "sampling/importance_sampling_ratio/mean": 1.033026099205017, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0123971924185753, "clip_ratio/low_mean": 0.08714237529784441, "clip_ratio/low_min": 0.08714237529784441, "clip_ratio/high_mean": 0.0580357164144516, "clip_ratio/high_max": 0.0580357164144516, "clip_ratio/region_mean": 0.145178091712296, "reward_total_mean": 0.3510221242904663, "reward_meter_mean": 0.5910894274711609, "reward_meter_std": 0.4692842960357666, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8728610277175903, "reward_lexical_plausibility_std": 0.19085237383842468, "reward_repeat_penalty_mean": 0.8007950782775879, "reward_repeat_penalty_std": 0.11195925623178482, "reward_near_duplicate_penalty_mean": 0.9861470460891724, "reward_near_duplicate_penalty_std": 0.026621105149388313, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.3744877576828003, "reward_total_composite_mean": 0.3510221242904663, "reward_total_composite_std": 0.37824493646621704} {"timestamp_utc": "2026-04-12T12:35:41Z", "mode": "train", "global_step": 472, "epoch": 0.018958107402498293, "loss": 0.0709, "grad_norm": 17.05718231201172, "learning_rate": 8.572727272727274e-06, "num_tokens": 931810.0, "completions/mean_length": 58.125, "completions/min_length": 48.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.125, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.48700374364852905, "rewards/meter/std": 0.36860910058021545, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9787582159042358, "rewards/lexical_plausibility/std": 0.04981458932161331, "rewards/judge_quality/mean": 0.5087499618530273, "rewards/judge_quality/std": 0.23092593252658844, "rewards/repeat_penalty/mean": 0.9842442274093628, "rewards/repeat_penalty/std": 0.020871134474873543, "rewards/near_duplicate_penalty/mean": 0.9842442274093628, "rewards/near_duplicate_penalty/std": 0.020871134474873543, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23971016705036163, "rewards/total_composite/std": 0.19003631174564362, "reward": 0.23971016705036163, "reward_std": 0.19003631174564362, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18038438260555267, "sampling/sampling_logp_difference/max": 2.1869399547576904, "sampling/importance_sampling_ratio/min": 0.11225974559783936, "sampling/importance_sampling_ratio/mean": 1.0043736696243286, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9426776245236397, "clip_ratio/low_mean": 0.07151182740926743, "clip_ratio/low_min": 0.07151182740926743, "clip_ratio/high_mean": 0.09448559768497944, "clip_ratio/high_max": 0.09448559768497944, "clip_ratio/region_mean": 0.16599742509424686, "reward_total_mean": 0.23971016705036163, "reward_meter_mean": 0.48700374364852905, "reward_meter_std": 0.36860910058021545, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9787582159042358, "reward_lexical_plausibility_std": 0.04981458932161331, "reward_repeat_penalty_mean": 0.9842442274093628, "reward_repeat_penalty_std": 0.020871134474873543, "reward_near_duplicate_penalty_mean": 0.9842442274093628, "reward_near_duplicate_penalty_std": 0.020871134474873543, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5087499618530273, "reward_judge_quality_std": 0.23092593252658844, "reward_total_composite_mean": 0.23971016705036163, "reward_total_composite_std": 0.19003631174564362} {"timestamp_utc": "2026-04-12T12:35:49Z", "mode": "train", "global_step": 473, "epoch": 0.018998272884283247, "loss": 0.0744, "grad_norm": 22.04007339477539, "learning_rate": 8.56969696969697e-06, "num_tokens": 933337.0, "completions/mean_length": 22.875, "completions/min_length": 20.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.875, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.9542794227600098, "rewards/meter/std": 0.08132888376712799, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9632352590560913, "rewards/lexical_plausibility/std": 0.10398628562688828, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.717903733253479, "rewards/repeat_penalty/std": 0.09078184515237808, "rewards/near_duplicate_penalty/mean": 0.957205057144165, "rewards/near_duplicate_penalty/std": 0.12104246020317078, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5053606033325195, "rewards/total_composite/std": 0.2389005422592163, "reward": 0.5053606033325195, "reward_std": 0.2389005422592163, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19822415709495544, "sampling/sampling_logp_difference/max": 2.484585762023926, "sampling/importance_sampling_ratio/min": 0.08336007595062256, "sampling/importance_sampling_ratio/mean": 1.0645005702972412, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1023565083742142, "clip_ratio/low_mean": 0.14330357359722257, "clip_ratio/low_min": 0.14330357359722257, "clip_ratio/high_mean": 0.0535714291036129, "clip_ratio/high_max": 0.0535714291036129, "clip_ratio/region_mean": 0.19687500270083547, "reward_total_mean": 0.5053606033325195, "reward_meter_mean": 0.9542794227600098, "reward_meter_std": 0.08132888376712799, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9632352590560913, "reward_lexical_plausibility_std": 0.10398628562688828, "reward_repeat_penalty_mean": 0.717903733253479, "reward_repeat_penalty_std": 0.09078184515237808, "reward_near_duplicate_penalty_mean": 0.957205057144165, "reward_near_duplicate_penalty_std": 0.12104246020317078, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.5053606033325195, "reward_total_composite_std": 0.2389005422592163} {"timestamp_utc": "2026-04-12T12:36:04Z", "mode": "train", "global_step": 474, "epoch": 0.0190384383660682, "loss": -0.3999, "grad_norm": 2.3125405311584473, "learning_rate": 8.566666666666667e-06, "num_tokens": 937105.0, "completions/mean_length": 442.0, "completions/min_length": 333.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 400.0, "completions/min_terminated_length": 333.0, "completions/max_terminated_length": 424.0, "rewards/meter/mean": 0.7116121053695679, "rewards/meter/std": 0.4438537359237671, "rewards/count_adherence/mean": 0.4318181872367859, "rewards/count_adherence/std": 0.3392818570137024, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.915495753288269, "rewards/lexical_plausibility/std": 0.12496782839298248, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.0707106813788414, "rewards/repeat_penalty/mean": 0.37211185693740845, "rewards/repeat_penalty/std": 0.46044665575027466, "rewards/near_duplicate_penalty/mean": 0.8078860640525818, "rewards/near_duplicate_penalty/std": 0.21712858974933624, "rewards/opening_diversity/mean": 0.8451547026634216, "rewards/opening_diversity/std": 0.2363804429769516, "rewards/distinct_2/mean": 0.42280104756355286, "rewards/distinct_2/std": 0.48468995094299316, "rewards/total_composite/mean": 0.06848539412021637, "rewards/total_composite/std": 0.05783623829483986, "reward": 0.06848539412021637, "reward_std": 0.05783623456954956, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07168090343475342, "sampling/sampling_logp_difference/max": 1.3686151504516602, "sampling/importance_sampling_ratio/min": 0.25445911288261414, "sampling/importance_sampling_ratio/mean": 1.0107157230377197, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4093349613249302, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.039252737537026405, "clip_ratio/high_max": 0.039252737537026405, "clip_ratio/region_mean": 0.039252737537026405, "reward_total_mean": 0.06848539412021637, "reward_meter_mean": 0.7116121053695679, "reward_meter_std": 0.4438537359237671, "reward_count_adherence_mean": 0.4318181872367859, "reward_count_adherence_std": 0.3392818570137024, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.915495753288269, "reward_lexical_plausibility_std": 0.12496782839298248, "reward_repeat_penalty_mean": 0.37211185693740845, "reward_repeat_penalty_std": 0.46044665575027466, "reward_near_duplicate_penalty_mean": 0.8078860640525818, "reward_near_duplicate_penalty_std": 0.21712858974933624, "reward_opening_diversity_mean": 0.8451547026634216, "reward_opening_diversity_std": 0.2363804429769516, "reward_distinct_2_mean": 0.42280104756355286, "reward_distinct_2_std": 0.48468995094299316, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.0707106813788414, "reward_total_composite_mean": 0.06848539412021637, "reward_total_composite_std": 0.05783623829483986} {"timestamp_utc": "2026-04-12T12:36:18Z", "mode": "train", "global_step": 475, "epoch": 0.019078603847853155, "loss": -0.1654, "grad_norm": 2.6581056118011475, "learning_rate": 8.563636363636364e-06, "num_tokens": 939308.0, "completions/mean_length": 272.375, "completions/min_length": 114.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 128.60000610351562, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 152.0, "rewards/meter/mean": 0.6184227466583252, "rewards/meter/std": 0.4197257161140442, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.38816189765930176, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8906276226043701, "rewards/lexical_plausibility/std": 0.15246494114398956, "rewards/judge_quality/mean": 0.29374998807907104, "rewards/judge_quality/std": 0.19537052512168884, "rewards/repeat_penalty/mean": 0.9596143364906311, "rewards/repeat_penalty/std": 0.08553502708673477, "rewards/near_duplicate_penalty/mean": 0.9945335388183594, "rewards/near_duplicate_penalty/std": 0.00535243097692728, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9963017702102661, "rewards/distinct_2/std": 0.01046015229076147, "rewards/total_composite/mean": 0.19763284921646118, "rewards/total_composite/std": 0.18747515976428986, "reward": 0.19763284921646118, "reward_std": 0.18747515976428986, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17012016475200653, "sampling/sampling_logp_difference/max": 3.704521894454956, "sampling/importance_sampling_ratio/min": 0.024611981585621834, "sampling/importance_sampling_ratio/mean": 0.9970017075538635, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7514044344425201, "clip_ratio/low_mean": 0.014860140159726143, "clip_ratio/low_min": 0.014860140159726143, "clip_ratio/high_mean": 0.08834486082196236, "clip_ratio/high_max": 0.08834486082196236, "clip_ratio/region_mean": 0.1032050009816885, "reward_total_mean": 0.19763284921646118, "reward_meter_mean": 0.6184227466583252, "reward_meter_std": 0.4197257161140442, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.38816189765930176, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8906276226043701, "reward_lexical_plausibility_std": 0.15246494114398956, "reward_repeat_penalty_mean": 0.9596143364906311, "reward_repeat_penalty_std": 0.08553502708673477, "reward_near_duplicate_penalty_mean": 0.9945335388183594, "reward_near_duplicate_penalty_std": 0.00535243097692728, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9963017702102661, "reward_distinct_2_std": 0.01046015229076147, "reward_judge_quality_mean": 0.29374998807907104, "reward_judge_quality_std": 0.19537052512168884, "reward_total_composite_mean": 0.19763284921646118, "reward_total_composite_std": 0.18747515976428986} {"timestamp_utc": "2026-04-12T12:36:33Z", "mode": "train", "global_step": 476, "epoch": 0.01911876932963811, "loss": -0.1407, "grad_norm": 4.104028224945068, "learning_rate": 8.560606060606062e-06, "num_tokens": 941664.0, "completions/mean_length": 253.5, "completions/min_length": 145.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 167.33334350585938, "completions/min_terminated_length": 145.0, "completions/max_terminated_length": 188.0, "rewards/meter/mean": 0.6942492127418518, "rewards/meter/std": 0.43733933568000793, "rewards/count_adherence/mean": 0.7708333134651184, "rewards/count_adherence/std": 0.32043495774269104, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9109879732131958, "rewards/lexical_plausibility/std": 0.16487261652946472, "rewards/judge_quality/mean": 0.22500000894069672, "rewards/judge_quality/std": 0.12817399203777313, "rewards/repeat_penalty/mean": 0.4662206172943115, "rewards/repeat_penalty/std": 0.36342477798461914, "rewards/near_duplicate_penalty/mean": 0.8423084020614624, "rewards/near_duplicate_penalty/std": 0.12640371918678284, "rewards/opening_diversity/mean": 0.8956043720245361, "rewards/opening_diversity/std": 0.1995983123779297, "rewards/distinct_2/mean": 0.5765867233276367, "rewards/distinct_2/std": 0.33712494373321533, "rewards/total_composite/mean": 0.13432076573371887, "rewards/total_composite/std": 0.13123878836631775, "reward": 0.13432076573371887, "reward_std": 0.13123878836631775, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1319139301776886, "sampling/sampling_logp_difference/max": 2.1389307975769043, "sampling/importance_sampling_ratio/min": 0.174083411693573, "sampling/importance_sampling_ratio/mean": 1.0293654203414917, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7540062218904495, "clip_ratio/low_mean": 0.03421391034498811, "clip_ratio/low_min": 0.03421391034498811, "clip_ratio/high_mean": 0.04104610625654459, "clip_ratio/high_max": 0.04104610625654459, "clip_ratio/region_mean": 0.0752600166015327, "reward_total_mean": 0.13432076573371887, "reward_meter_mean": 0.6942492127418518, "reward_meter_std": 0.43733933568000793, "reward_count_adherence_mean": 0.7708333134651184, "reward_count_adherence_std": 0.32043495774269104, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9109879732131958, "reward_lexical_plausibility_std": 0.16487261652946472, "reward_repeat_penalty_mean": 0.4662206172943115, "reward_repeat_penalty_std": 0.36342477798461914, "reward_near_duplicate_penalty_mean": 0.8423084020614624, "reward_near_duplicate_penalty_std": 0.12640371918678284, "reward_opening_diversity_mean": 0.8956043720245361, "reward_opening_diversity_std": 0.1995983123779297, "reward_distinct_2_mean": 0.5765867233276367, "reward_distinct_2_std": 0.33712494373321533, "reward_judge_quality_mean": 0.22500000894069672, "reward_judge_quality_std": 0.12817399203777313, "reward_total_composite_mean": 0.13432076573371887, "reward_total_composite_std": 0.13123878836631775} {"timestamp_utc": "2026-04-12T12:36:46Z", "mode": "train", "global_step": 477, "epoch": 0.019158934811423063, "loss": -0.0733, "grad_norm": 5.797103404998779, "learning_rate": 8.557575757575757e-06, "num_tokens": 943334.0, "completions/mean_length": 104.75, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 46.57143020629883, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6526471376419067, "rewards/meter/std": 0.42295220494270325, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9645575284957886, "rewards/lexical_plausibility/std": 0.10024634003639221, "rewards/judge_quality/mean": 0.6837499737739563, "rewards/judge_quality/std": 0.3504257798194885, "rewards/repeat_penalty/mean": 0.9058270454406738, "rewards/repeat_penalty/std": 0.07923030108213425, "rewards/near_duplicate_penalty/mean": 0.9540822505950928, "rewards/near_duplicate_penalty/std": 0.029933732002973557, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9816433191299438, "rewards/distinct_2/std": 0.03404124453663826, "rewards/total_composite/mean": 0.47145703434944153, "rewards/total_composite/std": 0.3599887788295746, "reward": 0.47145703434944153, "reward_std": 0.3599887490272522, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13750328123569489, "sampling/sampling_logp_difference/max": 1.3178296089172363, "sampling/importance_sampling_ratio/min": 0.267715722322464, "sampling/importance_sampling_ratio/mean": 1.0084325075149536, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8614685535430908, "clip_ratio/low_mean": 0.07523171696811914, "clip_ratio/low_min": 0.07523171696811914, "clip_ratio/high_mean": 0.05596247687935829, "clip_ratio/high_max": 0.05596247687935829, "clip_ratio/region_mean": 0.13119419384747744, "reward_total_mean": 0.47145703434944153, "reward_meter_mean": 0.6526471376419067, "reward_meter_std": 0.42295220494270325, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9645575284957886, "reward_lexical_plausibility_std": 0.10024634003639221, "reward_repeat_penalty_mean": 0.9058270454406738, "reward_repeat_penalty_std": 0.07923030108213425, "reward_near_duplicate_penalty_mean": 0.9540822505950928, "reward_near_duplicate_penalty_std": 0.029933732002973557, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9816433191299438, "reward_distinct_2_std": 0.03404124453663826, "reward_judge_quality_mean": 0.6837499737739563, "reward_judge_quality_std": 0.3504257798194885, "reward_total_composite_mean": 0.47145703434944153, "reward_total_composite_std": 0.3599887788295746} {"timestamp_utc": "2026-04-12T12:37:00Z", "mode": "train", "global_step": 478, "epoch": 0.019199100293208017, "loss": 0.0476, "grad_norm": 3.7853403091430664, "learning_rate": 8.554545454545456e-06, "num_tokens": 947350.0, "completions/mean_length": 280.0, "completions/min_length": 207.0, "completions/max_length": 334.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 280.0, "completions/min_terminated_length": 207.0, "completions/max_terminated_length": 334.0, "rewards/meter/mean": 0.856927752494812, "rewards/meter/std": 0.15546144545078278, "rewards/count_adherence/mean": 0.8055555820465088, "rewards/count_adherence/std": 0.07856741547584534, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.05588521063327789, "rewards/repeat_penalty/std": 0.05279583856463432, "rewards/near_duplicate_penalty/mean": 0.7472454309463501, "rewards/near_duplicate_penalty/std": 0.06751756370067596, "rewards/opening_diversity/mean": 0.9114447832107544, "rewards/opening_diversity/std": 0.09489770978689194, "rewards/distinct_2/mean": 0.10221026837825775, "rewards/distinct_2/std": 0.09333431720733643, "rewards/total_composite/mean": 0.1349012851715088, "rewards/total_composite/std": 0.09084027260541916, "reward": 0.1349012851715088, "reward_std": 0.09084026515483856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07389570027589798, "sampling/sampling_logp_difference/max": 2.0485010147094727, "sampling/importance_sampling_ratio/min": 0.1289280205965042, "sampling/importance_sampling_ratio/mean": 1.0014927387237549, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5268245153129101, "clip_ratio/low_mean": 0.048272002255544066, "clip_ratio/low_min": 0.048272002255544066, "clip_ratio/high_mean": 0.021325896494090557, "clip_ratio/high_max": 0.021325896494090557, "clip_ratio/region_mean": 0.06959789874963462, "reward_total_mean": 0.1349012851715088, "reward_meter_mean": 0.856927752494812, "reward_meter_std": 0.15546144545078278, "reward_count_adherence_mean": 0.8055555820465088, "reward_count_adherence_std": 0.07856741547584534, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.05588521063327789, "reward_repeat_penalty_std": 0.05279583856463432, "reward_near_duplicate_penalty_mean": 0.7472454309463501, "reward_near_duplicate_penalty_std": 0.06751756370067596, "reward_opening_diversity_mean": 0.9114447832107544, "reward_opening_diversity_std": 0.09489770978689194, "reward_distinct_2_mean": 0.10221026837825775, "reward_distinct_2_std": 0.09333431720733643, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1349012851715088, "reward_total_composite_std": 0.09084027260541916} {"timestamp_utc": "2026-04-12T12:37:10Z", "mode": "train", "global_step": 479, "epoch": 0.01923926577499297, "loss": 0.1001, "grad_norm": 10.255093574523926, "learning_rate": 8.551515151515152e-06, "num_tokens": 949221.0, "completions/mean_length": 64.875, "completions/min_length": 51.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.875, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.852449357509613, "rewards/meter/std": 0.2823321223258972, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.8686116933822632, "rewards/repeat_penalty/std": 0.19355812668800354, "rewards/near_duplicate_penalty/mean": 0.9721012115478516, "rewards/near_duplicate_penalty/std": 0.047310709953308105, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9392306804656982, "rewards/distinct_2/std": 0.09503848105669022, "rewards/total_composite/mean": 0.3542850911617279, "rewards/total_composite/std": 0.24541117250919342, "reward": 0.3542850911617279, "reward_std": 0.24541117250919342, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17278730869293213, "sampling/sampling_logp_difference/max": 1.7193493843078613, "sampling/importance_sampling_ratio/min": 0.17918269336223602, "sampling/importance_sampling_ratio/mean": 1.0197672843933105, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3455843776464462, "clip_ratio/low_mean": 0.1048482395708561, "clip_ratio/low_min": 0.1048482395708561, "clip_ratio/high_mean": 0.038804637268185616, "clip_ratio/high_max": 0.038804637268185616, "clip_ratio/region_mean": 0.1436528768390417, "reward_total_mean": 0.3542850911617279, "reward_meter_mean": 0.852449357509613, "reward_meter_std": 0.2823321223258972, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.8686116933822632, "reward_repeat_penalty_std": 0.19355812668800354, "reward_near_duplicate_penalty_mean": 0.9721012115478516, "reward_near_duplicate_penalty_std": 0.047310709953308105, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9392306804656982, "reward_distinct_2_std": 0.09503848105669022, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.3542850911617279, "reward_total_composite_std": 0.24541117250919342} {"timestamp_utc": "2026-04-12T12:37:18Z", "mode": "train", "global_step": 480, "epoch": 0.019279431256777925, "loss": 0.1027, "grad_norm": 13.397278785705566, "learning_rate": 8.548484848484849e-06, "num_tokens": 950981.0, "completions/mean_length": 34.0, "completions/min_length": 25.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.0, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7225872278213501, "rewards/meter/std": 0.3653312027454376, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7275000214576721, "rewards/judge_quality/std": 0.3564407229423523, "rewards/repeat_penalty/mean": 0.533305287361145, "rewards/repeat_penalty/std": 0.32675471901893616, "rewards/near_duplicate_penalty/mean": 0.8415569067001343, "rewards/near_duplicate_penalty/std": 0.3418532907962799, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.7729215621948242, "rewards/distinct_2/std": 0.38492342829704285, "rewards/total_composite/mean": 0.4724855422973633, "rewards/total_composite/std": 0.357770711183548, "reward": 0.4724855422973633, "reward_std": 0.357770711183548, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11613781750202179, "sampling/sampling_logp_difference/max": 1.485879898071289, "sampling/importance_sampling_ratio/min": 0.22630314528942108, "sampling/importance_sampling_ratio/mean": 1.0460658073425293, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9398307651281357, "clip_ratio/low_mean": 0.08029270078986883, "clip_ratio/low_min": 0.08029270078986883, "clip_ratio/high_mean": 0.04545029904693365, "clip_ratio/high_max": 0.04545029904693365, "clip_ratio/region_mean": 0.12574299983680248, "reward_total_mean": 0.4724855422973633, "reward_meter_mean": 0.7225872278213501, "reward_meter_std": 0.3653312027454376, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.533305287361145, "reward_repeat_penalty_std": 0.32675471901893616, "reward_near_duplicate_penalty_mean": 0.8415569067001343, "reward_near_duplicate_penalty_std": 0.3418532907962799, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.7729215621948242, "reward_distinct_2_std": 0.38492342829704285, "reward_judge_quality_mean": 0.7275000214576721, "reward_judge_quality_std": 0.3564407229423523, "reward_total_composite_mean": 0.4724855422973633, "reward_total_composite_std": 0.357770711183548} {"timestamp_utc": "2026-04-12T12:37:31Z", "mode": "train", "global_step": 481, "epoch": 0.01931959673856288, "loss": -0.0464, "grad_norm": 6.054765701293945, "learning_rate": 8.545454545454546e-06, "num_tokens": 952501.0, "completions/mean_length": 92.0, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.7095160484313965, "rewards/meter/std": 0.4322298467159271, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9504179954528809, "rewards/lexical_plausibility/std": 0.08134390413761139, "rewards/judge_quality/mean": 0.6974999904632568, "rewards/judge_quality/std": 0.3388109505176544, "rewards/repeat_penalty/mean": 0.9867280721664429, "rewards/repeat_penalty/std": 0.01586657017469406, "rewards/near_duplicate_penalty/mean": 0.9872534871101379, "rewards/near_duplicate_penalty/std": 0.016274144873023033, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9994745850563049, "rewards/distinct_2/std": 0.0014861400704830885, "rewards/total_composite/mean": 0.5951536893844604, "rewards/total_composite/std": 0.39523252844810486, "reward": 0.5951536893844604, "reward_std": 0.39523252844810486, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15185675024986267, "sampling/sampling_logp_difference/max": 1.6311500072479248, "sampling/importance_sampling_ratio/min": 0.195704385638237, "sampling/importance_sampling_ratio/mean": 1.0125807523727417, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8218754008412361, "clip_ratio/low_mean": 0.04642857238650322, "clip_ratio/low_min": 0.04642857238650322, "clip_ratio/high_mean": 0.07045293226838112, "clip_ratio/high_max": 0.07045293226838112, "clip_ratio/region_mean": 0.11688150465488434, "reward_total_mean": 0.5951536893844604, "reward_meter_mean": 0.7095160484313965, "reward_meter_std": 0.4322298467159271, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9504179954528809, "reward_lexical_plausibility_std": 0.08134390413761139, "reward_repeat_penalty_mean": 0.9867280721664429, "reward_repeat_penalty_std": 0.01586657017469406, "reward_near_duplicate_penalty_mean": 0.9872534871101379, "reward_near_duplicate_penalty_std": 0.016274144873023033, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9994745850563049, "reward_distinct_2_std": 0.0014861400704830885, "reward_judge_quality_mean": 0.6974999904632568, "reward_judge_quality_std": 0.3388109505176544, "reward_total_composite_mean": 0.5951536893844604, "reward_total_composite_std": 0.39523252844810486} {"timestamp_utc": "2026-04-12T12:37:41Z", "mode": "train", "global_step": 482, "epoch": 0.019359762220347833, "loss": 0.0608, "grad_norm": 15.708717346191406, "learning_rate": 8.542424242424243e-06, "num_tokens": 954153.0, "completions/mean_length": 46.5, "completions/min_length": 42.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.5, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8546483516693115, "rewards/meter/std": 0.30196648836135864, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7512500286102295, "rewards/judge_quality/std": 0.25542333722114563, "rewards/repeat_penalty/mean": 0.985704779624939, "rewards/repeat_penalty/std": 0.014976373873651028, "rewards/near_duplicate_penalty/mean": 0.985704779624939, "rewards/near_duplicate_penalty/std": 0.014976373873651028, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6230180859565735, "rewards/total_composite/std": 0.3138609528541565, "reward": 0.6230180859565735, "reward_std": 0.3138609230518341, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14824171364307404, "sampling/sampling_logp_difference/max": 2.219102382659912, "sampling/importance_sampling_ratio/min": 0.10870664566755295, "sampling/importance_sampling_ratio/mean": 1.028839111328125, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9098098948597908, "clip_ratio/low_mean": 0.04341503418982029, "clip_ratio/low_min": 0.04341503418982029, "clip_ratio/high_mean": 0.07458710484206676, "clip_ratio/high_max": 0.07458710484206676, "clip_ratio/region_mean": 0.11800213903188705, "reward_total_mean": 0.6230180859565735, "reward_meter_mean": 0.8546483516693115, "reward_meter_std": 0.30196648836135864, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.985704779624939, "reward_repeat_penalty_std": 0.014976373873651028, "reward_near_duplicate_penalty_mean": 0.985704779624939, "reward_near_duplicate_penalty_std": 0.014976373873651028, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7512500286102295, "reward_judge_quality_std": 0.25542333722114563, "reward_total_composite_mean": 0.6230180859565735, "reward_total_composite_std": 0.3138609528541565} {"timestamp_utc": "2026-04-12T12:37:49Z", "mode": "train", "global_step": 483, "epoch": 0.019399927702132787, "loss": 0.0853, "grad_norm": 14.387272834777832, "learning_rate": 8.539393939393939e-06, "num_tokens": 955707.0, "completions/mean_length": 42.25, "completions/min_length": 37.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6656347513198853, "rewards/meter/std": 0.3080311417579651, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6887500286102295, "rewards/judge_quality/std": 0.31903597712516785, "rewards/repeat_penalty/mean": 0.9446030259132385, "rewards/repeat_penalty/std": 0.05046504735946655, "rewards/near_duplicate_penalty/mean": 0.9620427489280701, "rewards/near_duplicate_penalty/std": 0.03469841182231903, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9816849827766418, "rewards/distinct_2/std": 0.03391282260417938, "rewards/total_composite/mean": 0.3735358715057373, "rewards/total_composite/std": 0.3373759388923645, "reward": 0.3735358715057373, "reward_std": 0.3373759090900421, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15325802564620972, "sampling/sampling_logp_difference/max": 1.6850972175598145, "sampling/importance_sampling_ratio/min": 0.18542641401290894, "sampling/importance_sampling_ratio/mean": 1.0021201372146606, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0205260142683983, "clip_ratio/low_mean": 0.04210150986909866, "clip_ratio/low_min": 0.04210150986909866, "clip_ratio/high_mean": 0.08551118616014719, "clip_ratio/high_max": 0.08551118616014719, "clip_ratio/region_mean": 0.12761269602924585, "reward_total_mean": 0.3735358715057373, "reward_meter_mean": 0.6656347513198853, "reward_meter_std": 0.3080311417579651, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9446030259132385, "reward_repeat_penalty_std": 0.05046504735946655, "reward_near_duplicate_penalty_mean": 0.9620427489280701, "reward_near_duplicate_penalty_std": 0.03469841182231903, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9816849827766418, "reward_distinct_2_std": 0.03391282260417938, "reward_judge_quality_mean": 0.6887500286102295, "reward_judge_quality_std": 0.31903597712516785, "reward_total_composite_mean": 0.3735358715057373, "reward_total_composite_std": 0.3373759388923645} {"timestamp_utc": "2026-04-12T12:37:58Z", "mode": "train", "global_step": 484, "epoch": 0.01944009318391774, "loss": 0.1009, "grad_norm": 17.388076782226562, "learning_rate": 8.536363636363636e-06, "num_tokens": 957339.0, "completions/mean_length": 56.0, "completions/min_length": 49.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.0, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.659206748008728, "rewards/meter/std": 0.35508015751838684, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7887499928474426, "rewards/judge_quality/std": 0.27115821838378906, "rewards/repeat_penalty/mean": 0.9011809229850769, "rewards/repeat_penalty/std": 0.22922390699386597, "rewards/near_duplicate_penalty/mean": 0.9623961448669434, "rewards/near_duplicate_penalty/std": 0.07599963992834091, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9409211277961731, "rewards/distinct_2/std": 0.14684276282787323, "rewards/total_composite/mean": 0.5697370171546936, "rewards/total_composite/std": 0.3841080665588379, "reward": 0.5697370171546936, "reward_std": 0.3841080665588379, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1469540297985077, "sampling/sampling_logp_difference/max": 1.8108291625976562, "sampling/importance_sampling_ratio/min": 0.163518488407135, "sampling/importance_sampling_ratio/mean": 0.9772599339485168, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7122868299484253, "clip_ratio/low_mean": 0.03883105143904686, "clip_ratio/low_min": 0.03883105143904686, "clip_ratio/high_mean": 0.07303191209211946, "clip_ratio/high_max": 0.07303191209211946, "clip_ratio/region_mean": 0.11186296353116632, "reward_total_mean": 0.5697370171546936, "reward_meter_mean": 0.659206748008728, "reward_meter_std": 0.35508015751838684, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9011809229850769, "reward_repeat_penalty_std": 0.22922390699386597, "reward_near_duplicate_penalty_mean": 0.9623961448669434, "reward_near_duplicate_penalty_std": 0.07599963992834091, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9409211277961731, "reward_distinct_2_std": 0.14684276282787323, "reward_judge_quality_mean": 0.7887499928474426, "reward_judge_quality_std": 0.27115821838378906, "reward_total_composite_mean": 0.5697370171546936, "reward_total_composite_std": 0.3841080665588379} {"timestamp_utc": "2026-04-12T12:38:08Z", "mode": "train", "global_step": 485, "epoch": 0.019480258665702695, "loss": 0.0296, "grad_norm": 14.966595649719238, "learning_rate": 8.533333333333335e-06, "num_tokens": 959394.0, "completions/mean_length": 86.875, "completions/min_length": 77.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.875, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.3842068910598755, "rewards/meter/std": 0.3022935390472412, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6387499570846558, "rewards/judge_quality/std": 0.30884289741516113, "rewards/repeat_penalty/mean": 0.9969550967216492, "rewards/repeat_penalty/std": 0.005105931777507067, "rewards/near_duplicate_penalty/mean": 0.9969550967216492, "rewards/near_duplicate_penalty/std": 0.005105931777507067, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21432170271873474, "rewards/total_composite/std": 0.18373489379882812, "reward": 0.21432170271873474, "reward_std": 0.18373489379882812, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18125201761722565, "sampling/sampling_logp_difference/max": 3.1263813972473145, "sampling/importance_sampling_ratio/min": 0.0438762828707695, "sampling/importance_sampling_ratio/mean": 0.9934475421905518, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8047947511076927, "clip_ratio/low_mean": 0.09030736144632101, "clip_ratio/low_min": 0.09030736144632101, "clip_ratio/high_mean": 0.06894026137888432, "clip_ratio/high_max": 0.06894026137888432, "clip_ratio/region_mean": 0.15924762282520533, "reward_total_mean": 0.21432170271873474, "reward_meter_mean": 0.3842068910598755, "reward_meter_std": 0.3022935390472412, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9969550967216492, "reward_repeat_penalty_std": 0.005105931777507067, "reward_near_duplicate_penalty_mean": 0.9969550967216492, "reward_near_duplicate_penalty_std": 0.005105931777507067, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6387499570846558, "reward_judge_quality_std": 0.30884289741516113, "reward_total_composite_mean": 0.21432170271873474, "reward_total_composite_std": 0.18373489379882812} {"timestamp_utc": "2026-04-12T12:38:17Z", "mode": "train", "global_step": 486, "epoch": 0.01952042414748765, "loss": -0.0064, "grad_norm": 12.775290489196777, "learning_rate": 8.53030303030303e-06, "num_tokens": 961187.0, "completions/mean_length": 53.125, "completions/min_length": 48.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.125, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.984459400177002, "rewards/meter/std": 0.01069045253098011, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.4625000059604645, "rewards/judge_quality/std": 0.15526476502418518, "rewards/repeat_penalty/mean": 0.959327220916748, "rewards/repeat_penalty/std": 0.041978754103183746, "rewards/near_duplicate_penalty/mean": 0.9671092629432678, "rewards/near_duplicate_penalty/std": 0.02511446923017502, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.4558395743370056, "rewards/total_composite/std": 0.15499630570411682, "reward": 0.4558395743370056, "reward_std": 0.15499630570411682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1525525599718094, "sampling/sampling_logp_difference/max": 1.3094673156738281, "sampling/importance_sampling_ratio/min": 0.2699638307094574, "sampling/importance_sampling_ratio/mean": 1.0213919878005981, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.192850761115551, "clip_ratio/low_mean": 0.09158541914075613, "clip_ratio/low_min": 0.09158541914075613, "clip_ratio/high_mean": 0.03660714440047741, "clip_ratio/high_max": 0.03660714440047741, "clip_ratio/region_mean": 0.12819256354123354, "reward_total_mean": 0.4558395743370056, "reward_meter_mean": 0.984459400177002, "reward_meter_std": 0.01069045253098011, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.959327220916748, "reward_repeat_penalty_std": 0.041978754103183746, "reward_near_duplicate_penalty_mean": 0.9671092629432678, "reward_near_duplicate_penalty_std": 0.02511446923017502, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.4625000059604645, "reward_judge_quality_std": 0.15526476502418518, "reward_total_composite_mean": 0.4558395743370056, "reward_total_composite_std": 0.15499630570411682} {"timestamp_utc": "2026-04-12T12:38:27Z", "mode": "train", "global_step": 487, "epoch": 0.019560589629272603, "loss": 0.0688, "grad_norm": 11.830143928527832, "learning_rate": 8.527272727272728e-06, "num_tokens": 963008.0, "completions/mean_length": 66.625, "completions/min_length": 57.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.625, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.8934787511825562, "rewards/meter/std": 0.23271259665489197, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.13562028110027313, "rewards/repeat_penalty/mean": 0.5014407634735107, "rewards/repeat_penalty/std": 0.32434895634651184, "rewards/near_duplicate_penalty/mean": 0.8915968537330627, "rewards/near_duplicate_penalty/std": 0.08636351674795151, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.69657963514328, "rewards/distinct_2/std": 0.23540747165679932, "rewards/total_composite/mean": 0.390258252620697, "rewards/total_composite/std": 0.16791626811027527, "reward": 0.390258252620697, "reward_std": 0.16791626811027527, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1091838851571083, "sampling/sampling_logp_difference/max": 1.3491935729980469, "sampling/importance_sampling_ratio/min": 0.25944939255714417, "sampling/importance_sampling_ratio/mean": 1.0011334419250488, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7564239725470543, "clip_ratio/low_mean": 0.05169323552399874, "clip_ratio/low_min": 0.05169323552399874, "clip_ratio/high_mean": 0.042048532515764236, "clip_ratio/high_max": 0.042048532515764236, "clip_ratio/region_mean": 0.09374176803976297, "reward_total_mean": 0.390258252620697, "reward_meter_mean": 0.8934787511825562, "reward_meter_std": 0.23271259665489197, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5014407634735107, "reward_repeat_penalty_std": 0.32434895634651184, "reward_near_duplicate_penalty_mean": 0.8915968537330627, "reward_near_duplicate_penalty_std": 0.08636351674795151, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.69657963514328, "reward_distinct_2_std": 0.23540747165679932, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.13562028110027313, "reward_total_composite_mean": 0.390258252620697, "reward_total_composite_std": 0.16791626811027527} {"timestamp_utc": "2026-04-12T12:38:38Z", "mode": "train", "global_step": 488, "epoch": 0.019600755111057556, "loss": 0.062, "grad_norm": 8.0690336227417, "learning_rate": 8.524242424242425e-06, "num_tokens": 965669.0, "completions/mean_length": 144.625, "completions/min_length": 122.0, "completions/max_length": 168.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 144.625, "completions/min_terminated_length": 122.0, "completions/max_terminated_length": 168.0, "rewards/meter/mean": 0.8518550992012024, "rewards/meter/std": 0.2522626221179962, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.5154203176498413, "rewards/repeat_penalty/std": 0.4040014445781708, "rewards/near_duplicate_penalty/mean": 0.8473269939422607, "rewards/near_duplicate_penalty/std": 0.16172580420970917, "rewards/opening_diversity/mean": 0.8656250238418579, "rewards/opening_diversity/std": 0.24601738154888153, "rewards/distinct_2/mean": 0.606722354888916, "rewards/distinct_2/std": 0.3611520230770111, "rewards/total_composite/mean": 0.29777130484580994, "rewards/total_composite/std": 0.1329665184020996, "reward": 0.29777130484580994, "reward_std": 0.13296650350093842, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11718686670064926, "sampling/sampling_logp_difference/max": 2.008418083190918, "sampling/importance_sampling_ratio/min": 0.1342008113861084, "sampling/importance_sampling_ratio/mean": 1.0089386701583862, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7607554048299789, "clip_ratio/low_mean": 0.042041667737066746, "clip_ratio/low_min": 0.042041667737066746, "clip_ratio/high_mean": 0.07441166881471872, "clip_ratio/high_max": 0.07441166881471872, "clip_ratio/region_mean": 0.11645333655178547, "reward_total_mean": 0.29777130484580994, "reward_meter_mean": 0.8518550992012024, "reward_meter_std": 0.2522626221179962, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5154203176498413, "reward_repeat_penalty_std": 0.4040014445781708, "reward_near_duplicate_penalty_mean": 0.8473269939422607, "reward_near_duplicate_penalty_std": 0.16172580420970917, "reward_opening_diversity_mean": 0.8656250238418579, "reward_opening_diversity_std": 0.24601738154888153, "reward_distinct_2_mean": 0.606722354888916, "reward_distinct_2_std": 0.3611520230770111, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.29777130484580994, "reward_total_composite_std": 0.1329665184020996} {"timestamp_utc": "2026-04-12T12:38:48Z", "mode": "train", "global_step": 489, "epoch": 0.01964092059284251, "loss": 0.0272, "grad_norm": 10.402389526367188, "learning_rate": 8.521212121212123e-06, "num_tokens": 967710.0, "completions/mean_length": 81.125, "completions/min_length": 62.0, "completions/max_length": 109.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.125, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.3735775947570801, "rewards/meter/std": 0.4236741065979004, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.955470621585846, "rewards/lexical_plausibility/std": 0.08526492863893509, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.6183725595474243, "rewards/repeat_penalty/std": 0.318236380815506, "rewards/near_duplicate_penalty/mean": 0.8775686025619507, "rewards/near_duplicate_penalty/std": 0.10264322906732559, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.7508325576782227, "rewards/distinct_2/std": 0.23671065270900726, "rewards/total_composite/mean": 0.13460922241210938, "rewards/total_composite/std": 0.16504879295825958, "reward": 0.13460922241210938, "reward_std": 0.1650487780570984, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14535221457481384, "sampling/sampling_logp_difference/max": 1.6159615516662598, "sampling/importance_sampling_ratio/min": 0.19869951903820038, "sampling/importance_sampling_ratio/mean": 1.0160772800445557, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8481792211532593, "clip_ratio/low_mean": 0.07692583510652184, "clip_ratio/low_min": 0.07692583510652184, "clip_ratio/high_mean": 0.06324087642133236, "clip_ratio/high_max": 0.06324087642133236, "clip_ratio/region_mean": 0.1401667115278542, "reward_total_mean": 0.13460922241210938, "reward_meter_mean": 0.3735775947570801, "reward_meter_std": 0.4236741065979004, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.955470621585846, "reward_lexical_plausibility_std": 0.08526492863893509, "reward_repeat_penalty_mean": 0.6183725595474243, "reward_repeat_penalty_std": 0.318236380815506, "reward_near_duplicate_penalty_mean": 0.8775686025619507, "reward_near_duplicate_penalty_std": 0.10264322906732559, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.7508325576782227, "reward_distinct_2_std": 0.23671065270900726, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.13460922241210938, "reward_total_composite_std": 0.16504879295825958} {"timestamp_utc": "2026-04-12T12:38:59Z", "mode": "train", "global_step": 490, "epoch": 0.019681086074627464, "loss": 0.0677, "grad_norm": 6.43690299987793, "learning_rate": 8.518181818181818e-06, "num_tokens": 970834.0, "completions/mean_length": 164.5, "completions/min_length": 149.0, "completions/max_length": 198.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.5, "completions/min_terminated_length": 149.0, "completions/max_terminated_length": 198.0, "rewards/meter/mean": 0.561223030090332, "rewards/meter/std": 0.4072257876396179, "rewards/count_adherence/mean": 0.8958333134651184, "rewards/count_adherence/std": 0.08625820279121399, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.4765090346336365, "rewards/repeat_penalty/std": 0.38373279571533203, "rewards/near_duplicate_penalty/mean": 0.8363927602767944, "rewards/near_duplicate_penalty/std": 0.1408124417066574, "rewards/opening_diversity/mean": 0.9299107193946838, "rewards/opening_diversity/std": 0.14020416140556335, "rewards/distinct_2/mean": 0.5466804504394531, "rewards/distinct_2/std": 0.3601234257221222, "rewards/total_composite/mean": 0.12919865548610687, "rewards/total_composite/std": 0.1509620100259781, "reward": 0.12919865548610687, "reward_std": 0.1509620100259781, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11495618522167206, "sampling/sampling_logp_difference/max": 2.230985164642334, "sampling/importance_sampling_ratio/min": 0.10742254555225372, "sampling/importance_sampling_ratio/mean": 1.0070220232009888, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.661452479660511, "clip_ratio/low_mean": 0.06424165517091751, "clip_ratio/low_min": 0.06424165517091751, "clip_ratio/high_mean": 0.05556938424706459, "clip_ratio/high_max": 0.05556938424706459, "clip_ratio/region_mean": 0.1198110394179821, "reward_total_mean": 0.12919865548610687, "reward_meter_mean": 0.561223030090332, "reward_meter_std": 0.4072257876396179, "reward_count_adherence_mean": 0.8958333134651184, "reward_count_adherence_std": 0.08625820279121399, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4765090346336365, "reward_repeat_penalty_std": 0.38373279571533203, "reward_near_duplicate_penalty_mean": 0.8363927602767944, "reward_near_duplicate_penalty_std": 0.1408124417066574, "reward_opening_diversity_mean": 0.9299107193946838, "reward_opening_diversity_std": 0.14020416140556335, "reward_distinct_2_mean": 0.5466804504394531, "reward_distinct_2_std": 0.3601234257221222, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.12919865548610687, "reward_total_composite_std": 0.1509620100259781} {"timestamp_utc": "2026-04-12T12:39:14Z", "mode": "train", "global_step": 491, "epoch": 0.01972125155641242, "loss": -0.0577, "grad_norm": 6.091986179351807, "learning_rate": 8.515151515151517e-06, "num_tokens": 972321.0, "completions/mean_length": 102.875, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.42857360839844, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6568453907966614, "rewards/meter/std": 0.423616498708725, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9624043107032776, "rewards/lexical_plausibility/std": 0.10633666813373566, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.7982226014137268, "rewards/repeat_penalty/std": 0.2836403250694275, "rewards/near_duplicate_penalty/mean": 0.9203413128852844, "rewards/near_duplicate_penalty/std": 0.08349907398223877, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9157509207725525, "rewards/distinct_2/std": 0.13582074642181396, "rewards/total_composite/mean": 0.19255058467388153, "rewards/total_composite/std": 0.17068003118038177, "reward": 0.19255058467388153, "reward_std": 0.17068003118038177, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1475788652896881, "sampling/sampling_logp_difference/max": 1.4643404483795166, "sampling/importance_sampling_ratio/min": 0.2312304526567459, "sampling/importance_sampling_ratio/mean": 1.0223606824874878, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6598791852593422, "clip_ratio/low_mean": 0.0766980443149805, "clip_ratio/low_min": 0.0766980443149805, "clip_ratio/high_mean": 0.05172917549498379, "clip_ratio/high_max": 0.05172917549498379, "clip_ratio/region_mean": 0.1284272198099643, "reward_total_mean": 0.19255058467388153, "reward_meter_mean": 0.6568453907966614, "reward_meter_std": 0.423616498708725, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9624043107032776, "reward_lexical_plausibility_std": 0.10633666813373566, "reward_repeat_penalty_mean": 0.7982226014137268, "reward_repeat_penalty_std": 0.2836403250694275, "reward_near_duplicate_penalty_mean": 0.9203413128852844, "reward_near_duplicate_penalty_std": 0.08349907398223877, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9157509207725525, "reward_distinct_2_std": 0.13582074642181396, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.19255058467388153, "reward_total_composite_std": 0.17068003118038177} {"timestamp_utc": "2026-04-12T12:39:31Z", "mode": "train", "global_step": 492, "epoch": 0.019761417038197372, "loss": -0.056, "grad_norm": 5.773955821990967, "learning_rate": 8.512121212121213e-06, "num_tokens": 974065.0, "completions/mean_length": 102.0, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.42857360839844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.3973095118999481, "rewards/meter/std": 0.2902991771697998, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9618542194366455, "rewards/lexical_plausibility/std": 0.10789252072572708, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.9809025526046753, "rewards/repeat_penalty/std": 0.012960494495928288, "rewards/near_duplicate_penalty/mean": 0.9834362268447876, "rewards/near_duplicate_penalty/std": 0.010643698275089264, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9974221587181091, "rewards/distinct_2/std": 0.007291257381439209, "rewards/total_composite/mean": 0.19527246057987213, "rewards/total_composite/std": 0.2146981805562973, "reward": 0.19527246057987213, "reward_std": 0.2146981656551361, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11211026459932327, "sampling/sampling_logp_difference/max": 1.768599033355713, "sampling/importance_sampling_ratio/min": 0.17057178914546967, "sampling/importance_sampling_ratio/mean": 1.041520595550537, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6453075483441353, "clip_ratio/low_mean": 0.06031831633299589, "clip_ratio/low_min": 0.06031831633299589, "clip_ratio/high_mean": 0.03870355058461428, "clip_ratio/high_max": 0.03870355058461428, "clip_ratio/region_mean": 0.09902186691761017, "reward_total_mean": 0.19527246057987213, "reward_meter_mean": 0.3973095118999481, "reward_meter_std": 0.2902991771697998, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9618542194366455, "reward_lexical_plausibility_std": 0.10789252072572708, "reward_repeat_penalty_mean": 0.9809025526046753, "reward_repeat_penalty_std": 0.012960494495928288, "reward_near_duplicate_penalty_mean": 0.9834362268447876, "reward_near_duplicate_penalty_std": 0.010643698275089264, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9974221587181091, "reward_distinct_2_std": 0.007291257381439209, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.19527246057987213, "reward_total_composite_std": 0.2146981805562973} {"timestamp_utc": "2026-04-12T12:39:46Z", "mode": "train", "global_step": 493, "epoch": 0.019801582519982326, "loss": -0.1466, "grad_norm": 4.135079860687256, "learning_rate": 8.50909090909091e-06, "num_tokens": 976415.0, "completions/mean_length": 150.75, "completions/min_length": 88.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 99.14286041259766, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.927754282951355, "rewards/meter/std": 0.14324016869068146, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.787428617477417, "rewards/repeat_penalty/std": 0.27102622389793396, "rewards/near_duplicate_penalty/mean": 0.9316419363021851, "rewards/near_duplicate_penalty/std": 0.0827101320028305, "rewards/opening_diversity/mean": 0.9765625, "rewards/opening_diversity/std": 0.032346826046705246, "rewards/distinct_2/mean": 0.8527272343635559, "rewards/distinct_2/std": 0.23050810396671295, "rewards/total_composite/mean": 0.29784029722213745, "rewards/total_composite/std": 0.11790855973958969, "reward": 0.29784029722213745, "reward_std": 0.11790855973958969, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12336722016334534, "sampling/sampling_logp_difference/max": 1.796236515045166, "sampling/importance_sampling_ratio/min": 0.165922150015831, "sampling/importance_sampling_ratio/mean": 1.0029431581497192, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5936805307865143, "clip_ratio/low_mean": 0.009943181648850441, "clip_ratio/low_min": 0.009943181648850441, "clip_ratio/high_mean": 0.09094352554529905, "clip_ratio/high_max": 0.09094352554529905, "clip_ratio/region_mean": 0.1008867071941495, "reward_total_mean": 0.29784029722213745, "reward_meter_mean": 0.927754282951355, "reward_meter_std": 0.14324016869068146, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.787428617477417, "reward_repeat_penalty_std": 0.27102622389793396, "reward_near_duplicate_penalty_mean": 0.9316419363021851, "reward_near_duplicate_penalty_std": 0.0827101320028305, "reward_opening_diversity_mean": 0.9765625, "reward_opening_diversity_std": 0.032346826046705246, "reward_distinct_2_mean": 0.8527272343635559, "reward_distinct_2_std": 0.23050810396671295, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.29784029722213745, "reward_total_composite_std": 0.11790855973958969} {"timestamp_utc": "2026-04-12T12:40:00Z", "mode": "train", "global_step": 494, "epoch": 0.01984174800176728, "loss": -0.1774, "grad_norm": 2.5734379291534424, "learning_rate": 8.506060606060607e-06, "num_tokens": 979019.0, "completions/mean_length": 192.5, "completions/min_length": 123.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 146.85714721679688, "completions/min_terminated_length": 123.0, "completions/max_terminated_length": 165.0, "rewards/meter/mean": 0.8972945809364319, "rewards/meter/std": 0.24541336297988892, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9713812470436096, "rewards/lexical_plausibility/std": 0.08094610273838043, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.20878174901008606, "rewards/repeat_penalty/std": 0.32008856534957886, "rewards/near_duplicate_penalty/mean": 0.7826398611068726, "rewards/near_duplicate_penalty/std": 0.09742272645235062, "rewards/opening_diversity/mean": 0.7541667222976685, "rewards/opening_diversity/std": 0.16201850771903992, "rewards/distinct_2/mean": 0.3760785162448883, "rewards/distinct_2/std": 0.3009520471096039, "rewards/total_composite/mean": 0.25990408658981323, "rewards/total_composite/std": 0.12562499940395355, "reward": 0.25990408658981323, "reward_std": 0.12562499940395355, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08453472703695297, "sampling/sampling_logp_difference/max": 1.376196265220642, "sampling/importance_sampling_ratio/min": 0.252537339925766, "sampling/importance_sampling_ratio/mean": 1.0119431018829346, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6304626390337944, "clip_ratio/low_mean": 0.005303030367940664, "clip_ratio/low_min": 0.005303030367940664, "clip_ratio/high_mean": 0.06734117865562439, "clip_ratio/high_max": 0.06734117865562439, "clip_ratio/region_mean": 0.07264420902356505, "reward_total_mean": 0.25990408658981323, "reward_meter_mean": 0.8972945809364319, "reward_meter_std": 0.24541336297988892, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9713812470436096, "reward_lexical_plausibility_std": 0.08094610273838043, "reward_repeat_penalty_mean": 0.20878174901008606, "reward_repeat_penalty_std": 0.32008856534957886, "reward_near_duplicate_penalty_mean": 0.7826398611068726, "reward_near_duplicate_penalty_std": 0.09742272645235062, "reward_opening_diversity_mean": 0.7541667222976685, "reward_opening_diversity_std": 0.16201850771903992, "reward_distinct_2_mean": 0.3760785162448883, "reward_distinct_2_std": 0.3009520471096039, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.25990408658981323, "reward_total_composite_std": 0.12562499940395355} {"timestamp_utc": "2026-04-12T12:40:14Z", "mode": "train", "global_step": 495, "epoch": 0.019881913483552234, "loss": -0.0679, "grad_norm": 5.250760078430176, "learning_rate": 8.503030303030304e-06, "num_tokens": 980711.0, "completions/mean_length": 107.5, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.71428680419922, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7184078693389893, "rewards/meter/std": 0.38564369082450867, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9569368958473206, "rewards/lexical_plausibility/std": 0.12180086970329285, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.27445724606513977, "rewards/repeat_penalty/mean": 0.9554755091667175, "rewards/repeat_penalty/std": 0.03760902211070061, "rewards/near_duplicate_penalty/mean": 0.9656516313552856, "rewards/near_duplicate_penalty/std": 0.02569839358329773, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893856048583984, "rewards/distinct_2/std": 0.025639133527874947, "rewards/total_composite/mean": 0.3346109986305237, "rewards/total_composite/std": 0.28311118483543396, "reward": 0.3346109986305237, "reward_std": 0.2831111550331116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1423669308423996, "sampling/sampling_logp_difference/max": 1.532524585723877, "sampling/importance_sampling_ratio/min": 0.21598969399929047, "sampling/importance_sampling_ratio/mean": 1.0120123624801636, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7360295429825783, "clip_ratio/low_mean": 0.04146173573099077, "clip_ratio/low_min": 0.04146173573099077, "clip_ratio/high_mean": 0.06527573429048061, "clip_ratio/high_max": 0.06527573429048061, "clip_ratio/region_mean": 0.10673747002147138, "reward_total_mean": 0.3346109986305237, "reward_meter_mean": 0.7184078693389893, "reward_meter_std": 0.38564369082450867, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9569368958473206, "reward_lexical_plausibility_std": 0.12180086970329285, "reward_repeat_penalty_mean": 0.9554755091667175, "reward_repeat_penalty_std": 0.03760902211070061, "reward_near_duplicate_penalty_mean": 0.9656516313552856, "reward_near_duplicate_penalty_std": 0.02569839358329773, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893856048583984, "reward_distinct_2_std": 0.025639133527874947, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.27445724606513977, "reward_total_composite_mean": 0.3346109986305237, "reward_total_composite_std": 0.28311118483543396} {"timestamp_utc": "2026-04-12T12:40:23Z", "mode": "train", "global_step": 496, "epoch": 0.019922078965337188, "loss": 0.0155, "grad_norm": 16.079675674438477, "learning_rate": 8.5e-06, "num_tokens": 982656.0, "completions/mean_length": 77.125, "completions/min_length": 69.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 77.125, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.9839693903923035, "rewards/meter/std": 0.006644071079790592, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.5656132698059082, "rewards/repeat_penalty/std": 0.28013280034065247, "rewards/near_duplicate_penalty/mean": 0.8373399376869202, "rewards/near_duplicate_penalty/std": 0.12468422204256058, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.7217047214508057, "rewards/distinct_2/std": 0.18657812476158142, "rewards/total_composite/mean": 0.2345302700996399, "rewards/total_composite/std": 0.18441210687160492, "reward": 0.2345302700996399, "reward_std": 0.18441209197044373, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13972356915473938, "sampling/sampling_logp_difference/max": 2.652090072631836, "sampling/importance_sampling_ratio/min": 0.07050370424985886, "sampling/importance_sampling_ratio/mean": 1.0060112476348877, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8917623087763786, "clip_ratio/low_mean": 0.02820517448708415, "clip_ratio/low_min": 0.02820517448708415, "clip_ratio/high_mean": 0.07510748598724604, "clip_ratio/high_max": 0.07510748598724604, "clip_ratio/region_mean": 0.10331266047433019, "reward_total_mean": 0.2345302700996399, "reward_meter_mean": 0.9839693903923035, "reward_meter_std": 0.006644071079790592, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.5656132698059082, "reward_repeat_penalty_std": 0.28013280034065247, "reward_near_duplicate_penalty_mean": 0.8373399376869202, "reward_near_duplicate_penalty_std": 0.12468422204256058, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.7217047214508057, "reward_distinct_2_std": 0.18657812476158142, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2345302700996399, "reward_total_composite_std": 0.18441210687160492} {"timestamp_utc": "2026-04-12T12:40:37Z", "mode": "train", "global_step": 497, "epoch": 0.019962244447122142, "loss": -0.2274, "grad_norm": 1.3448582887649536, "learning_rate": 8.496969696969697e-06, "num_tokens": 986948.0, "completions/mean_length": 404.5, "completions/min_length": 315.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 389.14288330078125, "completions/min_terminated_length": 315.0, "completions/max_terminated_length": 483.0, "rewards/meter/mean": 0.9185574054718018, "rewards/meter/std": 0.20033182203769684, "rewards/count_adherence/mean": 0.9107142686843872, "rewards/count_adherence/std": 0.0739355981349945, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.005796496756374836, "rewards/repeat_penalty/std": 0.016394969075918198, "rewards/near_duplicate_penalty/mean": 0.36620813608169556, "rewards/near_duplicate_penalty/std": 0.2173338383436203, "rewards/opening_diversity/mean": 0.4370805323123932, "rewards/opening_diversity/std": 0.3685372769832611, "rewards/distinct_2/mean": 0.009615384973585606, "rewards/distinct_2/std": 0.02719641663134098, "rewards/total_composite/mean": 0.11464738845825195, "rewards/total_composite/std": 0.04099876806139946, "reward": 0.11464738845825195, "reward_std": 0.04099876433610916, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.03906750679016113, "sampling/sampling_logp_difference/max": 1.65081787109375, "sampling/importance_sampling_ratio/min": 0.19189289212226868, "sampling/importance_sampling_ratio/mean": 1.0020650625228882, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.29307733103632927, "clip_ratio/low_mean": 0.0015873016091063619, "clip_ratio/low_min": 0.0015873016091063619, "clip_ratio/high_mean": 0.036969875916838646, "clip_ratio/high_max": 0.036969875916838646, "clip_ratio/region_mean": 0.03855717752594501, "reward_total_mean": 0.11464738845825195, "reward_meter_mean": 0.9185574054718018, "reward_meter_std": 0.20033182203769684, "reward_count_adherence_mean": 0.9107142686843872, "reward_count_adherence_std": 0.0739355981349945, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.005796496756374836, "reward_repeat_penalty_std": 0.016394969075918198, "reward_near_duplicate_penalty_mean": 0.36620813608169556, "reward_near_duplicate_penalty_std": 0.2173338383436203, "reward_opening_diversity_mean": 0.4370805323123932, "reward_opening_diversity_std": 0.3685372769832611, "reward_distinct_2_mean": 0.009615384973585606, "reward_distinct_2_std": 0.02719641663134098, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.11464738845825195, "reward_total_composite_std": 0.04099876806139946} {"timestamp_utc": "2026-04-12T12:40:51Z", "mode": "train", "global_step": 498, "epoch": 0.020002409928907096, "loss": -0.2485, "grad_norm": 1.652599573135376, "learning_rate": 8.493939393939394e-06, "num_tokens": 989825.0, "completions/mean_length": 280.625, "completions/min_length": 157.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 203.5, "completions/min_terminated_length": 157.0, "completions/max_terminated_length": 250.0, "rewards/meter/mean": 0.8432387113571167, "rewards/meter/std": 0.3459304869174957, "rewards/count_adherence/mean": 0.7777777910232544, "rewards/count_adherence/std": 0.3894553780555725, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9609290361404419, "rewards/lexical_plausibility/std": 0.11050929874181747, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.06408699601888657, "rewards/repeat_penalty/mean": 0.2478998601436615, "rewards/repeat_penalty/std": 0.43078354001045227, "rewards/near_duplicate_penalty/mean": 0.6969571709632874, "rewards/near_duplicate_penalty/std": 0.23057764768600464, "rewards/opening_diversity/mean": 0.7395833134651184, "rewards/opening_diversity/std": 0.2901747524738312, "rewards/distinct_2/mean": 0.2668496370315552, "rewards/distinct_2/std": 0.42589062452316284, "rewards/total_composite/mean": 0.13889729976654053, "rewards/total_composite/std": 0.08664173632860184, "reward": 0.13889729976654053, "reward_std": 0.08664173632860184, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05688926577568054, "sampling/sampling_logp_difference/max": 1.4994902610778809, "sampling/importance_sampling_ratio/min": 0.22324393689632416, "sampling/importance_sampling_ratio/mean": 1.0079529285430908, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2630777284502983, "clip_ratio/low_mean": 0.003980891779065132, "clip_ratio/low_min": 0.003980891779065132, "clip_ratio/high_mean": 0.03775472263805568, "clip_ratio/high_max": 0.03775472263805568, "clip_ratio/region_mean": 0.041735614417120814, "reward_total_mean": 0.13889729976654053, "reward_meter_mean": 0.8432387113571167, "reward_meter_std": 0.3459304869174957, "reward_count_adherence_mean": 0.7777777910232544, "reward_count_adherence_std": 0.3894553780555725, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9609290361404419, "reward_lexical_plausibility_std": 0.11050929874181747, "reward_repeat_penalty_mean": 0.2478998601436615, "reward_repeat_penalty_std": 0.43078354001045227, "reward_near_duplicate_penalty_mean": 0.6969571709632874, "reward_near_duplicate_penalty_std": 0.23057764768600464, "reward_opening_diversity_mean": 0.7395833134651184, "reward_opening_diversity_std": 0.2901747524738312, "reward_distinct_2_mean": 0.2668496370315552, "reward_distinct_2_std": 0.42589062452316284, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.06408699601888657, "reward_total_composite_mean": 0.13889729976654053, "reward_total_composite_std": 0.08664173632860184} {"timestamp_utc": "2026-04-12T12:41:00Z", "mode": "train", "global_step": 499, "epoch": 0.02004257541069205, "loss": 0.0254, "grad_norm": 12.778264045715332, "learning_rate": 8.490909090909092e-06, "num_tokens": 991688.0, "completions/mean_length": 54.875, "completions/min_length": 48.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.5963794589042664, "rewards/meter/std": 0.4109093248844147, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.9931745529174805, "rewards/repeat_penalty/std": 0.010063727386295795, "rewards/near_duplicate_penalty/mean": 0.9931745529174805, "rewards/near_duplicate_penalty/std": 0.010063727386295795, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22740943729877472, "rewards/total_composite/std": 0.15244118869304657, "reward": 0.22740943729877472, "reward_std": 0.15244117379188538, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14866903424263, "sampling/sampling_logp_difference/max": 1.9792890548706055, "sampling/importance_sampling_ratio/min": 0.13816742599010468, "sampling/importance_sampling_ratio/mean": 1.0106961727142334, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9755630791187286, "clip_ratio/low_mean": 0.07379013486206532, "clip_ratio/low_min": 0.07379013486206532, "clip_ratio/high_mean": 0.06390305608510971, "clip_ratio/high_max": 0.06390305608510971, "clip_ratio/region_mean": 0.13769319094717503, "reward_total_mean": 0.22740943729877472, "reward_meter_mean": 0.5963794589042664, "reward_meter_std": 0.4109093248844147, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9931745529174805, "reward_repeat_penalty_std": 0.010063727386295795, "reward_near_duplicate_penalty_mean": 0.9931745529174805, "reward_near_duplicate_penalty_std": 0.010063727386295795, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.22740943729877472, "reward_total_composite_std": 0.15244118869304657} {"timestamp_utc": "2026-04-12T12:41:09Z", "mode": "train", "global_step": 500, "epoch": 0.020082740892477004, "loss": 0.0793, "grad_norm": 15.163819313049316, "learning_rate": 8.487878787878789e-06, "num_tokens": 993388.0, "completions/mean_length": 54.5, "completions/min_length": 43.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.5, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.5737890005111694, "rewards/meter/std": 0.4020596146583557, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9678030014038086, "rewards/lexical_plausibility/std": 0.06296154111623764, "rewards/judge_quality/mean": 0.6050000190734863, "rewards/judge_quality/std": 0.36637216806411743, "rewards/repeat_penalty/mean": 0.7873538136482239, "rewards/repeat_penalty/std": 0.2674378454685211, "rewards/near_duplicate_penalty/mean": 0.9450277090072632, "rewards/near_duplicate_penalty/std": 0.06491279602050781, "rewards/opening_diversity/mean": 0.859375, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.9507899284362793, "rewards/distinct_2/std": 0.07793406397104263, "rewards/total_composite/mean": 0.36765599250793457, "rewards/total_composite/std": 0.3304150104522705, "reward": 0.36765599250793457, "reward_std": 0.3304150104522705, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1671167016029358, "sampling/sampling_logp_difference/max": 1.783510684967041, "sampling/importance_sampling_ratio/min": 0.16804715991020203, "sampling/importance_sampling_ratio/mean": 1.024588704109192, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.223095528781414, "clip_ratio/low_mean": 0.10117241274565458, "clip_ratio/low_min": 0.10117241274565458, "clip_ratio/high_mean": 0.06417830474674702, "clip_ratio/high_max": 0.06417830474674702, "clip_ratio/region_mean": 0.1653507174924016, "reward_total_mean": 0.36765599250793457, "reward_meter_mean": 0.5737890005111694, "reward_meter_std": 0.4020596146583557, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9678030014038086, "reward_lexical_plausibility_std": 0.06296154111623764, "reward_repeat_penalty_mean": 0.7873538136482239, "reward_repeat_penalty_std": 0.2674378454685211, "reward_near_duplicate_penalty_mean": 0.9450277090072632, "reward_near_duplicate_penalty_std": 0.06491279602050781, "reward_opening_diversity_mean": 0.859375, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.9507899284362793, "reward_distinct_2_std": 0.07793406397104263, "reward_judge_quality_mean": 0.6050000190734863, "reward_judge_quality_std": 0.36637216806411743, "reward_total_composite_mean": 0.36765599250793457, "reward_total_composite_std": 0.3304150104522705} {"timestamp_utc": "2026-04-12T12:43:37Z", "mode": "eval", "global_step": 500, "epoch": 0.020082740892477004, "eval_loss": NaN, "eval_runtime": 147.8471, "eval_samples_per_second": 0.703, "eval_steps_per_second": 0.088, "eval_num_tokens": 993388.0, "eval_completions/mean_length": 195.77884615384616, "eval_completions/min_length": 48.0, "eval_completions/max_length": 451.84615384615387, "eval_completions/clipped_ratio": 0.07692307692307693, "eval_completions/mean_terminated_length": 171.2225306584285, "eval_completions/min_terminated_length": 48.0, "eval_completions/max_terminated_length": 370.7692307692308, "eval_rewards/meter/mean": 0.5651892286080581, "eval_rewards/meter/std": 0.3941987959238199, "eval_rewards/count_adherence/mean": 0.909946084022522, "eval_rewards/count_adherence/std": 0.16018480793214762, "eval_rewards/arabic_clean/mean": 0.875, "eval_rewards/arabic_clean/std": 0.25542253255844116, "eval_rewards/lexical_plausibility/mean": 0.9770224277789776, "eval_rewards/lexical_plausibility/std": 0.057162257771079354, "eval_rewards/judge_quality/mean": 0.37740384615384615, "eval_rewards/judge_quality/std": 0.2514006575712791, "eval_rewards/repeat_penalty/mean": 0.5576793345121237, "eval_rewards/repeat_penalty/std": 0.42987576585549575, "eval_rewards/near_duplicate_penalty/mean": 0.8533412401492779, "eval_rewards/near_duplicate_penalty/std": 0.18654532386706427, "eval_rewards/opening_diversity/mean": 0.883584031691918, "eval_rewards/opening_diversity/std": 0.21873986950287452, "eval_rewards/distinct_2/mean": 0.6092648460314825, "eval_rewards/distinct_2/std": 0.4301047944105588, "eval_rewards/total_composite/mean": 0.1936830941301126, "eval_rewards/total_composite/std": 0.20124758694034356, "eval_reward": 0.1936830941301126, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.05052991927816318, "eval_sampling/sampling_logp_difference/max": 1.1012824498690093, "eval_sampling/importance_sampling_ratio/min": 0.3416199019322029, "eval_sampling/importance_sampling_ratio/mean": 1.0122336149215698, "eval_sampling/importance_sampling_ratio/max": 1.4916566610336304, "eval_entropy": 0.5890490962908819, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1936830941301126, "eval_reward_meter_mean": 0.5651892286080581, "eval_reward_meter_std": 0.3941987959238199, "eval_reward_count_adherence_mean": 0.909946084022522, "eval_reward_count_adherence_std": 0.16018480793214762, "eval_reward_arabic_clean_mean": 0.875, "eval_reward_arabic_clean_std": 0.25542253255844116, "eval_reward_lexical_plausibility_mean": 0.9770224277789776, "eval_reward_lexical_plausibility_std": 0.057162257771079354, "eval_reward_repeat_penalty_mean": 0.5576793345121237, "eval_reward_repeat_penalty_std": 0.42987576585549575, "eval_reward_near_duplicate_penalty_mean": 0.8533412401492779, "eval_reward_near_duplicate_penalty_std": 0.18654532386706427, "eval_reward_opening_diversity_mean": 0.883584031691918, "eval_reward_opening_diversity_std": 0.21873986950287452, "eval_reward_distinct_2_mean": 0.6092648460314825, "eval_reward_distinct_2_std": 0.4301047944105588, "eval_reward_judge_quality_mean": 0.37740384615384615, "eval_reward_judge_quality_std": 0.2514006575712791, "eval_reward_total_composite_mean": 0.1936830941301126, "eval_reward_total_composite_std": 0.20124758694034356} {"timestamp_utc": "2026-04-12T12:43:54Z", "mode": "train", "global_step": 501, "epoch": 0.020122906374261958, "loss": 0.0099, "grad_norm": 2.6518707275390625, "learning_rate": 8.484848484848486e-06, "num_tokens": 998576.0, "completions/mean_length": 387.5, "completions/min_length": 319.0, "completions/max_length": 465.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 387.5, "completions/min_terminated_length": 319.0, "completions/max_terminated_length": 465.0, "rewards/meter/mean": 0.9701468348503113, "rewards/meter/std": 0.02333131991326809, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.059608783572912216, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.97265625, "rewards/lexical_plausibility/std": 0.07733980566263199, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.6507840156555176, "rewards/near_duplicate_penalty/std": 0.10026480257511139, "rewards/opening_diversity/mean": 0.7787426710128784, "rewards/opening_diversity/std": 0.18565993010997772, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08965564519166946, "rewards/total_composite/std": 0.06285939365625381, "reward": 0.08965564519166946, "reward_std": 0.06285939365625381, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.043643053621053696, "sampling/sampling_logp_difference/max": 2.692099094390869, "sampling/importance_sampling_ratio/min": 0.0677386000752449, "sampling/importance_sampling_ratio/mean": 0.997916579246521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2844799719750881, "clip_ratio/low_mean": 0.012866653967648745, "clip_ratio/low_min": 0.012866653967648745, "clip_ratio/high_mean": 0.0384971653111279, "clip_ratio/high_max": 0.0384971653111279, "clip_ratio/region_mean": 0.051363819278776646, "reward_total_mean": 0.08965564519166946, "reward_meter_mean": 0.9701468348503113, "reward_meter_std": 0.02333131991326809, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.059608783572912216, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.97265625, "reward_lexical_plausibility_std": 0.07733980566263199, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.6507840156555176, "reward_near_duplicate_penalty_std": 0.10026480257511139, "reward_opening_diversity_mean": 0.7787426710128784, "reward_opening_diversity_std": 0.18565993010997772, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.08965564519166946, "reward_total_composite_std": 0.06285939365625381} {"timestamp_utc": "2026-04-12T12:44:08Z", "mode": "train", "global_step": 502, "epoch": 0.02016307185604691, "loss": -0.0317, "grad_norm": 6.3878045082092285, "learning_rate": 8.481818181818182e-06, "num_tokens": 1000302.0, "completions/mean_length": 99.75, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.85714340209961, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.3857800364494324, "rewards/meter/std": 0.33045512437820435, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9721478223800659, "rewards/lexical_plausibility/std": 0.07877781242132187, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.23868314921855927, "rewards/repeat_penalty/mean": 0.9405642747879028, "rewards/repeat_penalty/std": 0.06924048066139221, "rewards/near_duplicate_penalty/mean": 0.9689872860908508, "rewards/near_duplicate_penalty/std": 0.042722415179014206, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9699149131774902, "rewards/distinct_2/std": 0.041804179549217224, "rewards/total_composite/mean": 0.21137171983718872, "rewards/total_composite/std": 0.2944623529911041, "reward": 0.21137171983718872, "reward_std": 0.2944623529911041, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17319683730602264, "sampling/sampling_logp_difference/max": 1.9168076515197754, "sampling/importance_sampling_ratio/min": 0.14707574248313904, "sampling/importance_sampling_ratio/mean": 1.0102839469909668, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7959209308028221, "clip_ratio/low_mean": 0.07633984414860606, "clip_ratio/low_min": 0.07633984414860606, "clip_ratio/high_mean": 0.03692411910742521, "clip_ratio/high_max": 0.03692411910742521, "clip_ratio/region_mean": 0.11326396325603127, "reward_total_mean": 0.21137171983718872, "reward_meter_mean": 0.3857800364494324, "reward_meter_std": 0.33045512437820435, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9721478223800659, "reward_lexical_plausibility_std": 0.07877781242132187, "reward_repeat_penalty_mean": 0.9405642747879028, "reward_repeat_penalty_std": 0.06924048066139221, "reward_near_duplicate_penalty_mean": 0.9689872860908508, "reward_near_duplicate_penalty_std": 0.042722415179014206, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9699149131774902, "reward_distinct_2_std": 0.041804179549217224, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.23868314921855927, "reward_total_composite_mean": 0.21137171983718872, "reward_total_composite_std": 0.2944623529911041} {"timestamp_utc": "2026-04-12T12:44:17Z", "mode": "train", "global_step": 503, "epoch": 0.02020323733783187, "loss": 0.0662, "grad_norm": 10.739781379699707, "learning_rate": 8.478787878787879e-06, "num_tokens": 1002102.0, "completions/mean_length": 57.0, "completions/min_length": 53.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.0, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.8123683333396912, "rewards/meter/std": 0.3386837840080261, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.94140625, "rewards/lexical_plausibility/std": 0.10881553590297699, "rewards/judge_quality/mean": 0.4874999523162842, "rewards/judge_quality/std": 0.1922609806060791, "rewards/repeat_penalty/mean": 0.9695625901222229, "rewards/repeat_penalty/std": 0.04207766056060791, "rewards/near_duplicate_penalty/mean": 0.9759550094604492, "rewards/near_duplicate_penalty/std": 0.027980675920844078, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.41370487213134766, "rewards/total_composite/std": 0.247430682182312, "reward": 0.41370487213134766, "reward_std": 0.247430682182312, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1602925807237625, "sampling/sampling_logp_difference/max": 1.499053955078125, "sampling/importance_sampling_ratio/min": 0.22334136068820953, "sampling/importance_sampling_ratio/mean": 1.007265567779541, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3459157571196556, "clip_ratio/low_mean": 0.04936777055263519, "clip_ratio/low_min": 0.04936777055263519, "clip_ratio/high_mean": 0.09928295202553272, "clip_ratio/high_max": 0.09928295202553272, "clip_ratio/region_mean": 0.14865072257816792, "reward_total_mean": 0.41370487213134766, "reward_meter_mean": 0.8123683333396912, "reward_meter_std": 0.3386837840080261, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.94140625, "reward_lexical_plausibility_std": 0.10881553590297699, "reward_repeat_penalty_mean": 0.9695625901222229, "reward_repeat_penalty_std": 0.04207766056060791, "reward_near_duplicate_penalty_mean": 0.9759550094604492, "reward_near_duplicate_penalty_std": 0.027980675920844078, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.4874999523162842, "reward_judge_quality_std": 0.1922609806060791, "reward_total_composite_mean": 0.41370487213134766, "reward_total_composite_std": 0.247430682182312} {"timestamp_utc": "2026-04-12T12:44:26Z", "mode": "train", "global_step": 504, "epoch": 0.020243402819616823, "loss": 0.0069, "grad_norm": 11.913764953613281, "learning_rate": 8.475757575757576e-06, "num_tokens": 1003762.0, "completions/mean_length": 55.5, "completions/min_length": 48.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.5, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.6863939166069031, "rewards/meter/std": 0.40984946489334106, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.7235284447669983, "rewards/repeat_penalty/std": 0.2776219844818115, "rewards/near_duplicate_penalty/mean": 0.8860005140304565, "rewards/near_duplicate_penalty/std": 0.1023278534412384, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8451676368713379, "rewards/distinct_2/std": 0.19731010496616364, "rewards/total_composite/mean": 0.3080506920814514, "rewards/total_composite/std": 0.20203770697116852, "reward": 0.3080506920814514, "reward_std": 0.20203770697116852, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1357807219028473, "sampling/sampling_logp_difference/max": 1.0764718055725098, "sampling/importance_sampling_ratio/min": 0.3407957851886749, "sampling/importance_sampling_ratio/mean": 1.0116885900497437, "sampling/importance_sampling_ratio/max": 1.9978467226028442, "entropy": 0.8812910094857216, "clip_ratio/low_mean": 0.05885989125818014, "clip_ratio/low_min": 0.05885989125818014, "clip_ratio/high_mean": 0.08359778113663197, "clip_ratio/high_max": 0.08359778113663197, "clip_ratio/region_mean": 0.1424576723948121, "reward_total_mean": 0.3080506920814514, "reward_meter_mean": 0.6863939166069031, "reward_meter_std": 0.40984946489334106, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7235284447669983, "reward_repeat_penalty_std": 0.2776219844818115, "reward_near_duplicate_penalty_mean": 0.8860005140304565, "reward_near_duplicate_penalty_std": 0.1023278534412384, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8451676368713379, "reward_distinct_2_std": 0.19731010496616364, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.3080506920814514, "reward_total_composite_std": 0.20203770697116852} {"timestamp_utc": "2026-04-12T12:44:40Z", "mode": "train", "global_step": 505, "epoch": 0.020283568301401777, "loss": -0.0951, "grad_norm": 3.9400417804718018, "learning_rate": 8.472727272727274e-06, "num_tokens": 1007654.0, "completions/mean_length": 343.5, "completions/min_length": 253.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 319.4285888671875, "completions/min_terminated_length": 253.0, "completions/max_terminated_length": 402.0, "rewards/meter/mean": 0.49392110109329224, "rewards/meter/std": 0.4835190773010254, "rewards/count_adherence/mean": 0.8181818723678589, "rewards/count_adherence/std": 0.33313652873039246, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9263225793838501, "rewards/lexical_plausibility/std": 0.12926451861858368, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.17903828620910645, "rewards/repeat_penalty/std": 0.3600805997848511, "rewards/near_duplicate_penalty/mean": 0.5830976963043213, "rewards/near_duplicate_penalty/std": 0.3056493401527405, "rewards/opening_diversity/mean": 0.5512581467628479, "rewards/opening_diversity/std": 0.3795725703239441, "rewards/distinct_2/mean": 0.19717048108577728, "rewards/distinct_2/std": 0.3628998100757599, "rewards/total_composite/mean": 0.09154044836759567, "rewards/total_composite/std": 0.11014432460069656, "reward": 0.09154044836759567, "reward_std": 0.11014432460069656, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06264153122901917, "sampling/sampling_logp_difference/max": 2.0832653045654297, "sampling/importance_sampling_ratio/min": 0.12452294677495956, "sampling/importance_sampling_ratio/mean": 1.006455421447754, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.43054076842963696, "clip_ratio/low_mean": 0.015363816171884537, "clip_ratio/low_min": 0.015363816171884537, "clip_ratio/high_mean": 0.03827769448980689, "clip_ratio/high_max": 0.03827769448980689, "clip_ratio/region_mean": 0.05364151066169143, "reward_total_mean": 0.09154044836759567, "reward_meter_mean": 0.49392110109329224, "reward_meter_std": 0.4835190773010254, "reward_count_adherence_mean": 0.8181818723678589, "reward_count_adherence_std": 0.33313652873039246, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9263225793838501, "reward_lexical_plausibility_std": 0.12926451861858368, "reward_repeat_penalty_mean": 0.17903828620910645, "reward_repeat_penalty_std": 0.3600805997848511, "reward_near_duplicate_penalty_mean": 0.5830976963043213, "reward_near_duplicate_penalty_std": 0.3056493401527405, "reward_opening_diversity_mean": 0.5512581467628479, "reward_opening_diversity_std": 0.3795725703239441, "reward_distinct_2_mean": 0.19717048108577728, "reward_distinct_2_std": 0.3628998100757599, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.09154044836759567, "reward_total_composite_std": 0.11014432460069656} {"timestamp_utc": "2026-04-12T12:44:48Z", "mode": "train", "global_step": 506, "epoch": 0.02032373378318673, "loss": 0.0633, "grad_norm": 18.310579299926758, "learning_rate": 8.46969696969697e-06, "num_tokens": 1009037.0, "completions/mean_length": 23.875, "completions/min_length": 21.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.875, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.43831267952919006, "rewards/meter/std": 0.28032413125038147, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7387499809265137, "rewards/judge_quality/std": 0.3636496663093567, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31349655985832214, "rewards/total_composite/std": 0.19792938232421875, "reward": 0.31349655985832214, "reward_std": 0.19792936742305756, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12091462314128876, "sampling/sampling_logp_difference/max": 0.961705207824707, "sampling/importance_sampling_ratio/min": 0.38224053382873535, "sampling/importance_sampling_ratio/mean": 1.0261863470077515, "sampling/importance_sampling_ratio/max": 1.9883272647857666, "entropy": 0.9679062403738499, "clip_ratio/low_mean": 0.06016457639634609, "clip_ratio/low_min": 0.06016457639634609, "clip_ratio/high_mean": 0.06392045505344868, "clip_ratio/high_max": 0.06392045505344868, "clip_ratio/region_mean": 0.12408503144979477, "reward_total_mean": 0.31349655985832214, "reward_meter_mean": 0.43831267952919006, "reward_meter_std": 0.28032413125038147, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7387499809265137, "reward_judge_quality_std": 0.3636496663093567, "reward_total_composite_mean": 0.31349655985832214, "reward_total_composite_std": 0.19792938232421875} {"timestamp_utc": "2026-04-12T12:45:01Z", "mode": "train", "global_step": 507, "epoch": 0.020363899264971685, "loss": -0.0479, "grad_norm": 2.836268663406372, "learning_rate": 8.466666666666668e-06, "num_tokens": 1010449.0, "completions/mean_length": 157.5, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 39.333335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.29638734459877014, "rewards/meter/std": 0.3345950245857239, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9288312792778015, "rewards/lexical_plausibility/std": 0.1276407390832901, "rewards/judge_quality/mean": 0.4950000047683716, "rewards/judge_quality/std": 0.38340580463409424, "rewards/repeat_penalty/mean": 0.9603478908538818, "rewards/repeat_penalty/std": 0.08630295842885971, "rewards/near_duplicate_penalty/mean": 0.9915978908538818, "rewards/near_duplicate_penalty/std": 0.01535733137279749, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18346711993217468, "rewards/total_composite/std": 0.2076093703508377, "reward": 0.18346711993217468, "reward_std": 0.2076093703508377, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16101914644241333, "sampling/sampling_logp_difference/max": 1.877507209777832, "sampling/importance_sampling_ratio/min": 0.15297095477581024, "sampling/importance_sampling_ratio/mean": 0.991775631904602, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0024839416146278, "clip_ratio/low_mean": 0.053816527128219604, "clip_ratio/low_min": 0.053816527128219604, "clip_ratio/high_mean": 0.06941848620772362, "clip_ratio/high_max": 0.06941848620772362, "clip_ratio/region_mean": 0.12323501333594322, "reward_total_mean": 0.18346711993217468, "reward_meter_mean": 0.29638734459877014, "reward_meter_std": 0.3345950245857239, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9288312792778015, "reward_lexical_plausibility_std": 0.1276407390832901, "reward_repeat_penalty_mean": 0.9603478908538818, "reward_repeat_penalty_std": 0.08630295842885971, "reward_near_duplicate_penalty_mean": 0.9915978908538818, "reward_near_duplicate_penalty_std": 0.01535733137279749, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4950000047683716, "reward_judge_quality_std": 0.38340580463409424, "reward_total_composite_mean": 0.18346711993217468, "reward_total_composite_std": 0.2076093703508377} {"timestamp_utc": "2026-04-12T12:45:15Z", "mode": "train", "global_step": 508, "epoch": 0.02040406474675664, "loss": -0.166, "grad_norm": 1.8281652927398682, "learning_rate": 8.463636363636364e-06, "num_tokens": 1014431.0, "completions/mean_length": 350.75, "completions/min_length": 285.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 327.71429443359375, "completions/min_terminated_length": 285.0, "completions/max_terminated_length": 347.0, "rewards/meter/mean": 0.9088338017463684, "rewards/meter/std": 0.23093324899673462, "rewards/count_adherence/mean": 0.8229166865348816, "rewards/count_adherence/std": 0.26888033747673035, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.989179790019989, "rewards/lexical_plausibility/std": 0.030604196712374687, "rewards/judge_quality/mean": 0.13125000894069672, "rewards/judge_quality/std": 0.0530330128967762, "rewards/repeat_penalty/mean": 0.0658489540219307, "rewards/repeat_penalty/std": 0.18624897301197052, "rewards/near_duplicate_penalty/mean": 0.4798297882080078, "rewards/near_duplicate_penalty/std": 0.2374846488237381, "rewards/opening_diversity/mean": 0.541671097278595, "rewards/opening_diversity/std": 0.27736055850982666, "rewards/distinct_2/mean": 0.11935897171497345, "rewards/distinct_2/std": 0.33759817481040955, "rewards/total_composite/mean": 0.09086012095212936, "rewards/total_composite/std": 0.06445092707872391, "reward": 0.09086012095212936, "reward_std": 0.0644509345293045, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.03532516583800316, "sampling/sampling_logp_difference/max": 1.8691463470458984, "sampling/importance_sampling_ratio/min": 0.15425528585910797, "sampling/importance_sampling_ratio/mean": 1.0060081481933594, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.1880291998386383, "clip_ratio/low_mean": 0.007126605371013284, "clip_ratio/low_min": 0.007126605371013284, "clip_ratio/high_mean": 0.015821539680473506, "clip_ratio/high_max": 0.015821539680473506, "clip_ratio/region_mean": 0.02294814505148679, "reward_total_mean": 0.09086012095212936, "reward_meter_mean": 0.9088338017463684, "reward_meter_std": 0.23093324899673462, "reward_count_adherence_mean": 0.8229166865348816, "reward_count_adherence_std": 0.26888033747673035, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.989179790019989, "reward_lexical_plausibility_std": 0.030604196712374687, "reward_repeat_penalty_mean": 0.0658489540219307, "reward_repeat_penalty_std": 0.18624897301197052, "reward_near_duplicate_penalty_mean": 0.4798297882080078, "reward_near_duplicate_penalty_std": 0.2374846488237381, "reward_opening_diversity_mean": 0.541671097278595, "reward_opening_diversity_std": 0.27736055850982666, "reward_distinct_2_mean": 0.11935897171497345, "reward_distinct_2_std": 0.33759817481040955, "reward_judge_quality_mean": 0.13125000894069672, "reward_judge_quality_std": 0.0530330128967762, "reward_total_composite_mean": 0.09086012095212936, "reward_total_composite_std": 0.06445092707872391} {"timestamp_utc": "2026-04-12T12:45:29Z", "mode": "train", "global_step": 509, "epoch": 0.020444230228541593, "loss": -0.0936, "grad_norm": 5.034311294555664, "learning_rate": 8.460606060606061e-06, "num_tokens": 1015936.0, "completions/mean_length": 109.125, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.57143020629883, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.945076048374176, "rewards/meter/std": 0.04943845793604851, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.3500000238418579, "rewards/judge_quality/std": 0.20701967179775238, "rewards/repeat_penalty/mean": 0.761979341506958, "rewards/repeat_penalty/std": 0.33365947008132935, "rewards/near_duplicate_penalty/mean": 0.9482151865959167, "rewards/near_duplicate_penalty/std": 0.04744406417012215, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.829497218132019, "rewards/distinct_2/std": 0.3429631292819977, "rewards/total_composite/mean": 0.32543379068374634, "rewards/total_composite/std": 0.19852536916732788, "reward": 0.32543379068374634, "reward_std": 0.19852536916732788, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16109664738178253, "sampling/sampling_logp_difference/max": 2.4872822761535645, "sampling/importance_sampling_ratio/min": 0.08313559740781784, "sampling/importance_sampling_ratio/mean": 0.9837594032287598, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8953721970319748, "clip_ratio/low_mean": 0.045713142259046435, "clip_ratio/low_min": 0.045713142259046435, "clip_ratio/high_mean": 0.11555221676826477, "clip_ratio/high_max": 0.11555221676826477, "clip_ratio/region_mean": 0.1612653590273112, "reward_total_mean": 0.32543379068374634, "reward_meter_mean": 0.945076048374176, "reward_meter_std": 0.04943845793604851, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.761979341506958, "reward_repeat_penalty_std": 0.33365947008132935, "reward_near_duplicate_penalty_mean": 0.9482151865959167, "reward_near_duplicate_penalty_std": 0.04744406417012215, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.829497218132019, "reward_distinct_2_std": 0.3429631292819977, "reward_judge_quality_mean": 0.3500000238418579, "reward_judge_quality_std": 0.20701967179775238, "reward_total_composite_mean": 0.32543379068374634, "reward_total_composite_std": 0.19852536916732788} {"timestamp_utc": "2026-04-12T12:45:44Z", "mode": "train", "global_step": 510, "epoch": 0.020484395710326547, "loss": 0.0131, "grad_norm": 6.778062343597412, "learning_rate": 8.457575757575758e-06, "num_tokens": 1018883.0, "completions/mean_length": 173.375, "completions/min_length": 116.0, "completions/max_length": 216.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 173.375, "completions/min_terminated_length": 116.0, "completions/max_terminated_length": 216.0, "rewards/meter/mean": 0.7390681505203247, "rewards/meter/std": 0.3173445165157318, "rewards/count_adherence/mean": 0.9464285969734192, "rewards/count_adherence/std": 0.10628911107778549, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.2772557735443115, "rewards/repeat_penalty/std": 0.29759883880615234, "rewards/near_duplicate_penalty/mean": 0.7736907005310059, "rewards/near_duplicate_penalty/std": 0.11297912895679474, "rewards/opening_diversity/mean": 0.7393543720245361, "rewards/opening_diversity/std": 0.2959821820259094, "rewards/distinct_2/mean": 0.4010602831840515, "rewards/distinct_2/std": 0.2960413992404938, "rewards/total_composite/mean": 0.16854535043239594, "rewards/total_composite/std": 0.10978459566831589, "reward": 0.16854535043239594, "reward_std": 0.10978458821773529, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0983595922589302, "sampling/sampling_logp_difference/max": 3.287526845932007, "sampling/importance_sampling_ratio/min": 0.03734609857201576, "sampling/importance_sampling_ratio/mean": 1.0133074522018433, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6525220572948456, "clip_ratio/low_mean": 0.05915332958102226, "clip_ratio/low_min": 0.05915332958102226, "clip_ratio/high_mean": 0.023187135346233845, "clip_ratio/high_max": 0.023187135346233845, "clip_ratio/region_mean": 0.08234046492725611, "reward_total_mean": 0.16854535043239594, "reward_meter_mean": 0.7390681505203247, "reward_meter_std": 0.3173445165157318, "reward_count_adherence_mean": 0.9464285969734192, "reward_count_adherence_std": 0.10628911107778549, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.2772557735443115, "reward_repeat_penalty_std": 0.29759883880615234, "reward_near_duplicate_penalty_mean": 0.7736907005310059, "reward_near_duplicate_penalty_std": 0.11297912895679474, "reward_opening_diversity_mean": 0.7393543720245361, "reward_opening_diversity_std": 0.2959821820259094, "reward_distinct_2_mean": 0.4010602831840515, "reward_distinct_2_std": 0.2960413992404938, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.16854535043239594, "reward_total_composite_std": 0.10978459566831589} {"timestamp_utc": "2026-04-12T12:45:57Z", "mode": "train", "global_step": 511, "epoch": 0.0205245611921115, "loss": 0.0254, "grad_norm": 5.904370307922363, "learning_rate": 8.454545454545455e-06, "num_tokens": 1022390.0, "completions/mean_length": 239.375, "completions/min_length": 215.0, "completions/max_length": 314.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 239.375, "completions/min_terminated_length": 215.0, "completions/max_terminated_length": 314.0, "rewards/meter/mean": 0.9285152554512024, "rewards/meter/std": 0.12181481719017029, "rewards/count_adherence/mean": 0.9305555820465088, "rewards/count_adherence/std": 0.05750546231865883, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.16502662003040314, "rewards/repeat_penalty/std": 0.2941958010196686, "rewards/near_duplicate_penalty/mean": 0.7388197779655457, "rewards/near_duplicate_penalty/std": 0.1587085872888565, "rewards/opening_diversity/mean": 0.8895833492279053, "rewards/opening_diversity/std": 0.09393831342458725, "rewards/distinct_2/mean": 0.18130643665790558, "rewards/distinct_2/std": 0.3143492043018341, "rewards/total_composite/mean": 0.180444598197937, "rewards/total_composite/std": 0.10672377049922943, "reward": 0.180444598197937, "reward_std": 0.10672377049922943, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07582195103168488, "sampling/sampling_logp_difference/max": 2.2196154594421387, "sampling/importance_sampling_ratio/min": 0.10865087807178497, "sampling/importance_sampling_ratio/mean": 1.0033222436904907, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4280640445649624, "clip_ratio/low_mean": 0.03521737502887845, "clip_ratio/low_min": 0.03521737502887845, "clip_ratio/high_mean": 0.031118144281208515, "clip_ratio/high_max": 0.031118144281208515, "clip_ratio/region_mean": 0.06633551931008697, "reward_total_mean": 0.180444598197937, "reward_meter_mean": 0.9285152554512024, "reward_meter_std": 0.12181481719017029, "reward_count_adherence_mean": 0.9305555820465088, "reward_count_adherence_std": 0.05750546231865883, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.16502662003040314, "reward_repeat_penalty_std": 0.2941958010196686, "reward_near_duplicate_penalty_mean": 0.7388197779655457, "reward_near_duplicate_penalty_std": 0.1587085872888565, "reward_opening_diversity_mean": 0.8895833492279053, "reward_opening_diversity_std": 0.09393831342458725, "reward_distinct_2_mean": 0.18130643665790558, "reward_distinct_2_std": 0.3143492043018341, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.180444598197937, "reward_total_composite_std": 0.10672377049922943} {"timestamp_utc": "2026-04-12T12:46:06Z", "mode": "train", "global_step": 512, "epoch": 0.020564726673896454, "loss": 0.0524, "grad_norm": 8.661601066589355, "learning_rate": 8.451515151515151e-06, "num_tokens": 1024517.0, "completions/mean_length": 102.875, "completions/min_length": 84.0, "completions/max_length": 137.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.875, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 137.0, "rewards/meter/mean": 0.8079421520233154, "rewards/meter/std": 0.2958540916442871, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9397321343421936, "rewards/lexical_plausibility/std": 0.13258251547813416, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.3515321910381317, "rewards/repeat_penalty/std": 0.2766278088092804, "rewards/near_duplicate_penalty/mean": 0.8433783054351807, "rewards/near_duplicate_penalty/std": 0.08072208613157272, "rewards/opening_diversity/mean": 0.8504464626312256, "rewards/opening_diversity/std": 0.20014743506908417, "rewards/distinct_2/mean": 0.5110594034194946, "rewards/distinct_2/std": 0.2516166865825653, "rewards/total_composite/mean": 0.1917930245399475, "rewards/total_composite/std": 0.12354664504528046, "reward": 0.1917930245399475, "reward_std": 0.12354663759469986, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09449737519025803, "sampling/sampling_logp_difference/max": 1.7361695766448975, "sampling/importance_sampling_ratio/min": 0.17619401216506958, "sampling/importance_sampling_ratio/mean": 1.0089701414108276, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6085465885698795, "clip_ratio/low_mean": 0.05178106855601072, "clip_ratio/low_min": 0.05178106855601072, "clip_ratio/high_mean": 0.0491557726636529, "clip_ratio/high_max": 0.0491557726636529, "clip_ratio/region_mean": 0.10093684121966362, "reward_total_mean": 0.1917930245399475, "reward_meter_mean": 0.8079421520233154, "reward_meter_std": 0.2958540916442871, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9397321343421936, "reward_lexical_plausibility_std": 0.13258251547813416, "reward_repeat_penalty_mean": 0.3515321910381317, "reward_repeat_penalty_std": 0.2766278088092804, "reward_near_duplicate_penalty_mean": 0.8433783054351807, "reward_near_duplicate_penalty_std": 0.08072208613157272, "reward_opening_diversity_mean": 0.8504464626312256, "reward_opening_diversity_std": 0.20014743506908417, "reward_distinct_2_mean": 0.5110594034194946, "reward_distinct_2_std": 0.2516166865825653, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1917930245399475, "reward_total_composite_std": 0.12354664504528046} {"timestamp_utc": "2026-04-12T12:46:15Z", "mode": "train", "global_step": 513, "epoch": 0.02060489215568141, "loss": 0.0136, "grad_norm": 16.81121253967285, "learning_rate": 8.44848484848485e-06, "num_tokens": 1026221.0, "completions/mean_length": 45.0, "completions/min_length": 42.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.0, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.4247587323188782, "rewards/meter/std": 0.4042350649833679, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.3535837233066559, "rewards/repeat_penalty/mean": 0.9381329417228699, "rewards/repeat_penalty/std": 0.11472293734550476, "rewards/near_duplicate_penalty/mean": 0.9840990900993347, "rewards/near_duplicate_penalty/std": 0.014699822291731834, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9811372756958008, "rewards/distinct_2/std": 0.035051409155130386, "rewards/total_composite/mean": 0.18739627301692963, "rewards/total_composite/std": 0.2175557166337967, "reward": 0.18739627301692963, "reward_std": 0.21755573153495789, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15761037170886993, "sampling/sampling_logp_difference/max": 1.3418798446655273, "sampling/importance_sampling_ratio/min": 0.26135390996932983, "sampling/importance_sampling_ratio/mean": 1.0226404666900635, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0555620938539505, "clip_ratio/low_mean": 0.12172575201839209, "clip_ratio/low_min": 0.12172575201839209, "clip_ratio/high_mean": 0.03297101520001888, "clip_ratio/high_max": 0.03297101520001888, "clip_ratio/region_mean": 0.15469676721841097, "reward_total_mean": 0.18739627301692963, "reward_meter_mean": 0.4247587323188782, "reward_meter_std": 0.4042350649833679, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9381329417228699, "reward_repeat_penalty_std": 0.11472293734550476, "reward_near_duplicate_penalty_mean": 0.9840990900993347, "reward_near_duplicate_penalty_std": 0.014699822291731834, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9811372756958008, "reward_distinct_2_std": 0.035051409155130386, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.3535837233066559, "reward_total_composite_mean": 0.18739627301692963, "reward_total_composite_std": 0.2175557166337967} {"timestamp_utc": "2026-04-12T12:46:29Z", "mode": "train", "global_step": 514, "epoch": 0.020645057637466362, "loss": -0.0577, "grad_norm": 5.431741714477539, "learning_rate": 8.445454545454547e-06, "num_tokens": 1028079.0, "completions/mean_length": 110.25, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.85714340209961, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.513384997844696, "rewards/meter/std": 0.40638771653175354, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.949152946472168, "rewards/lexical_plausibility/std": 0.13294920325279236, "rewards/judge_quality/mean": 0.5762499570846558, "rewards/judge_quality/std": 0.32845690846443176, "rewards/repeat_penalty/mean": 0.9661033153533936, "rewards/repeat_penalty/std": 0.0875559076666832, "rewards/near_duplicate_penalty/mean": 0.9973533153533936, "rewards/near_duplicate_penalty/std": 0.006525635253638029, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3251316547393799, "rewards/total_composite/std": 0.32359376549720764, "reward": 0.3251316547393799, "reward_std": 0.32359376549720764, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19153591990470886, "sampling/sampling_logp_difference/max": 2.0924038887023926, "sampling/importance_sampling_ratio/min": 0.12339016795158386, "sampling/importance_sampling_ratio/mean": 1.0208725929260254, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3402554169297218, "clip_ratio/low_mean": 0.06283831968903542, "clip_ratio/low_min": 0.06283831968903542, "clip_ratio/high_mean": 0.08408079575747252, "clip_ratio/high_max": 0.08408079575747252, "clip_ratio/region_mean": 0.14691911544650793, "reward_total_mean": 0.3251316547393799, "reward_meter_mean": 0.513384997844696, "reward_meter_std": 0.40638771653175354, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.949152946472168, "reward_lexical_plausibility_std": 0.13294920325279236, "reward_repeat_penalty_mean": 0.9661033153533936, "reward_repeat_penalty_std": 0.0875559076666832, "reward_near_duplicate_penalty_mean": 0.9973533153533936, "reward_near_duplicate_penalty_std": 0.006525635253638029, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5762499570846558, "reward_judge_quality_std": 0.32845690846443176, "reward_total_composite_mean": 0.3251316547393799, "reward_total_composite_std": 0.32359376549720764} {"timestamp_utc": "2026-04-12T12:46:43Z", "mode": "train", "global_step": 515, "epoch": 0.020685223119251316, "loss": -0.0291, "grad_norm": 8.370580673217773, "learning_rate": 8.442424242424243e-06, "num_tokens": 1029549.0, "completions/mean_length": 100.75, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.36182424426078796, "rewards/meter/std": 0.39704596996307373, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9768381714820862, "rewards/lexical_plausibility/std": 0.04581486061215401, "rewards/judge_quality/mean": 0.6262500286102295, "rewards/judge_quality/std": 0.3452095687389374, "rewards/repeat_penalty/mean": 0.977394163608551, "rewards/repeat_penalty/std": 0.027574090287089348, "rewards/near_duplicate_penalty/mean": 0.977394163608551, "rewards/near_duplicate_penalty/std": 0.027574090287089348, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22116199135780334, "rewards/total_composite/std": 0.2753816545009613, "reward": 0.22116199135780334, "reward_std": 0.2753816545009613, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14220990240573883, "sampling/sampling_logp_difference/max": 1.3544740676879883, "sampling/importance_sampling_ratio/min": 0.2580829858779907, "sampling/importance_sampling_ratio/mean": 1.0478286743164062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7890208065509796, "clip_ratio/low_mean": 0.046606277115643024, "clip_ratio/low_min": 0.046606277115643024, "clip_ratio/high_mean": 0.054215616546571255, "clip_ratio/high_max": 0.054215616546571255, "clip_ratio/region_mean": 0.10082189366221428, "reward_total_mean": 0.22116199135780334, "reward_meter_mean": 0.36182424426078796, "reward_meter_std": 0.39704596996307373, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9768381714820862, "reward_lexical_plausibility_std": 0.04581486061215401, "reward_repeat_penalty_mean": 0.977394163608551, "reward_repeat_penalty_std": 0.027574090287089348, "reward_near_duplicate_penalty_mean": 0.977394163608551, "reward_near_duplicate_penalty_std": 0.027574090287089348, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6262500286102295, "reward_judge_quality_std": 0.3452095687389374, "reward_total_composite_mean": 0.22116199135780334, "reward_total_composite_std": 0.2753816545009613} {"timestamp_utc": "2026-04-12T12:46:57Z", "mode": "train", "global_step": 516, "epoch": 0.02072538860103627, "loss": -0.0737, "grad_norm": 5.375249862670898, "learning_rate": 8.43939393939394e-06, "num_tokens": 1031237.0, "completions/mean_length": 109.0, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.42857360839844, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.34669095277786255, "rewards/meter/std": 0.24385115504264832, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9390032291412354, "rewards/lexical_plausibility/std": 0.09921156615018845, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2841905951499939, "rewards/repeat_penalty/mean": 0.9837115406990051, "rewards/repeat_penalty/std": 0.037624627351760864, "rewards/near_duplicate_penalty/mean": 0.9935320615768433, "rewards/near_duplicate_penalty/std": 0.011036964133381844, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.15397033095359802, "rewards/total_composite/std": 0.12483875453472137, "reward": 0.15397033095359802, "reward_std": 0.12483874708414078, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17727911472320557, "sampling/sampling_logp_difference/max": 1.3981847763061523, "sampling/importance_sampling_ratio/min": 0.24704501032829285, "sampling/importance_sampling_ratio/mean": 1.0220539569854736, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.154013380408287, "clip_ratio/low_mean": 0.061760082840919495, "clip_ratio/low_min": 0.061760082840919495, "clip_ratio/high_mean": 0.08354979753494263, "clip_ratio/high_max": 0.08354979753494263, "clip_ratio/region_mean": 0.14530988037586212, "reward_total_mean": 0.15397033095359802, "reward_meter_mean": 0.34669095277786255, "reward_meter_std": 0.24385115504264832, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9390032291412354, "reward_lexical_plausibility_std": 0.09921156615018845, "reward_repeat_penalty_mean": 0.9837115406990051, "reward_repeat_penalty_std": 0.037624627351760864, "reward_near_duplicate_penalty_mean": 0.9935320615768433, "reward_near_duplicate_penalty_std": 0.011036964133381844, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2841905951499939, "reward_total_composite_mean": 0.15397033095359802, "reward_total_composite_std": 0.12483875453472137} {"timestamp_utc": "2026-04-12T12:47:14Z", "mode": "train", "global_step": 517, "epoch": 0.020765554082821224, "loss": -0.0667, "grad_norm": 3.699153184890747, "learning_rate": 8.436363636363637e-06, "num_tokens": 1034315.0, "completions/mean_length": 217.75, "completions/min_length": 133.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 175.71429443359375, "completions/min_terminated_length": 133.0, "completions/max_terminated_length": 245.0, "rewards/meter/mean": 0.801067590713501, "rewards/meter/std": 0.18090085685253143, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.10628911107778549, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39125001430511475, "rewards/judge_quality/std": 0.2290625274181366, "rewards/repeat_penalty/mean": 0.6733967065811157, "rewards/repeat_penalty/std": 0.43340247869491577, "rewards/near_duplicate_penalty/mean": 0.8702901601791382, "rewards/near_duplicate_penalty/std": 0.29662787914276123, "rewards/opening_diversity/mean": 0.887499988079071, "rewards/opening_diversity/std": 0.3181980550289154, "rewards/distinct_2/mean": 0.6950549483299255, "rewards/distinct_2/std": 0.43958988785743713, "rewards/total_composite/mean": 0.2903161644935608, "rewards/total_composite/std": 0.17332184314727783, "reward": 0.2903161644935608, "reward_std": 0.17332184314727783, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1199302077293396, "sampling/sampling_logp_difference/max": 2.8319387435913086, "sampling/importance_sampling_ratio/min": 0.05889855697751045, "sampling/importance_sampling_ratio/mean": 1.0077662467956543, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6010359786450863, "clip_ratio/low_mean": 0.04199825134128332, "clip_ratio/low_min": 0.04199825134128332, "clip_ratio/high_mean": 0.0649514002725482, "clip_ratio/high_max": 0.0649514002725482, "clip_ratio/region_mean": 0.10694965161383152, "reward_total_mean": 0.2903161644935608, "reward_meter_mean": 0.801067590713501, "reward_meter_std": 0.18090085685253143, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.10628911107778549, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6733967065811157, "reward_repeat_penalty_std": 0.43340247869491577, "reward_near_duplicate_penalty_mean": 0.8702901601791382, "reward_near_duplicate_penalty_std": 0.29662787914276123, "reward_opening_diversity_mean": 0.887499988079071, "reward_opening_diversity_std": 0.3181980550289154, "reward_distinct_2_mean": 0.6950549483299255, "reward_distinct_2_std": 0.43958988785743713, "reward_judge_quality_mean": 0.39125001430511475, "reward_judge_quality_std": 0.2290625274181366, "reward_total_composite_mean": 0.2903161644935608, "reward_total_composite_std": 0.17332184314727783} {"timestamp_utc": "2026-04-12T12:47:27Z", "mode": "train", "global_step": 518, "epoch": 0.020805719564606178, "loss": -0.05, "grad_norm": 5.1548848152160645, "learning_rate": 8.433333333333334e-06, "num_tokens": 1035857.0, "completions/mean_length": 113.75, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.857147216796875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6722588539123535, "rewards/meter/std": 0.35397157073020935, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9697229862213135, "rewards/lexical_plausibility/std": 0.056428972631692886, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.258370578289032, "rewards/repeat_penalty/mean": 0.9477458000183105, "rewards/repeat_penalty/std": 0.08248929679393768, "rewards/near_duplicate_penalty/mean": 0.9768604636192322, "rewards/near_duplicate_penalty/std": 0.03228720650076866, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9687514305114746, "rewards/distinct_2/std": 0.057349421083927155, "rewards/total_composite/mean": 0.30740541219711304, "rewards/total_composite/std": 0.26373177766799927, "reward": 0.30740541219711304, "reward_std": 0.26373177766799927, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17935426533222198, "sampling/sampling_logp_difference/max": 1.8109140396118164, "sampling/importance_sampling_ratio/min": 0.16350461542606354, "sampling/importance_sampling_ratio/mean": 1.0112996101379395, "sampling/importance_sampling_ratio/max": 1.8057483434677124, "entropy": 1.397463046014309, "clip_ratio/low_mean": 0.03603896126151085, "clip_ratio/low_min": 0.03603896126151085, "clip_ratio/high_mean": 0.09854637738317251, "clip_ratio/high_max": 0.09854637738317251, "clip_ratio/region_mean": 0.13458533864468336, "reward_total_mean": 0.30740541219711304, "reward_meter_mean": 0.6722588539123535, "reward_meter_std": 0.35397157073020935, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9697229862213135, "reward_lexical_plausibility_std": 0.056428972631692886, "reward_repeat_penalty_mean": 0.9477458000183105, "reward_repeat_penalty_std": 0.08248929679393768, "reward_near_duplicate_penalty_mean": 0.9768604636192322, "reward_near_duplicate_penalty_std": 0.03228720650076866, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9687514305114746, "reward_distinct_2_std": 0.057349421083927155, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.258370578289032, "reward_total_composite_mean": 0.30740541219711304, "reward_total_composite_std": 0.26373177766799927} {"timestamp_utc": "2026-04-12T12:47:38Z", "mode": "train", "global_step": 519, "epoch": 0.020845885046391132, "loss": 0.123, "grad_norm": 11.445374488830566, "learning_rate": 8.43030303030303e-06, "num_tokens": 1037961.0, "completions/mean_length": 93.0, "completions/min_length": 77.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.0, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.6855309009552002, "rewards/meter/std": 0.40771737694740295, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.1642080545425415, "rewards/repeat_penalty/mean": 0.9280847907066345, "rewards/repeat_penalty/std": 0.07003556936979294, "rewards/near_duplicate_penalty/mean": 0.9765260815620422, "rewards/near_duplicate_penalty/std": 0.016959194093942642, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9565455913543701, "rewards/distinct_2/std": 0.0430552177131176, "rewards/total_composite/mean": 0.22460846602916718, "rewards/total_composite/std": 0.19476187229156494, "reward": 0.22460846602916718, "reward_std": 0.19476187229156494, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14586910605430603, "sampling/sampling_logp_difference/max": 1.9536882638931274, "sampling/importance_sampling_ratio/min": 0.1417502909898758, "sampling/importance_sampling_ratio/mean": 1.0058424472808838, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8782564327120781, "clip_ratio/low_mean": 0.07089105155318975, "clip_ratio/low_min": 0.07089105155318975, "clip_ratio/high_mean": 0.07607285212725401, "clip_ratio/high_max": 0.07607285212725401, "clip_ratio/region_mean": 0.14696390368044376, "reward_total_mean": 0.22460846602916718, "reward_meter_mean": 0.6855309009552002, "reward_meter_std": 0.40771737694740295, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9280847907066345, "reward_repeat_penalty_std": 0.07003556936979294, "reward_near_duplicate_penalty_mean": 0.9765260815620422, "reward_near_duplicate_penalty_std": 0.016959194093942642, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9565455913543701, "reward_distinct_2_std": 0.0430552177131176, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.1642080545425415, "reward_total_composite_mean": 0.22460846602916718, "reward_total_composite_std": 0.19476187229156494} {"timestamp_utc": "2026-04-12T12:47:48Z", "mode": "train", "global_step": 520, "epoch": 0.020886050528176086, "loss": -0.0109, "grad_norm": 11.413832664489746, "learning_rate": 8.427272727272729e-06, "num_tokens": 1039813.0, "completions/mean_length": 61.5, "completions/min_length": 42.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.5, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.8347108364105225, "rewards/meter/std": 0.2469102293252945, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6800000071525574, "rewards/judge_quality/std": 0.24622870981693268, "rewards/repeat_penalty/mean": 0.815872073173523, "rewards/repeat_penalty/std": 0.26995933055877686, "rewards/near_duplicate_penalty/mean": 0.9238532781600952, "rewards/near_duplicate_penalty/std": 0.08535701036453247, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8854270577430725, "rewards/distinct_2/std": 0.19207239151000977, "rewards/total_composite/mean": 0.5657850503921509, "rewards/total_composite/std": 0.29925888776779175, "reward": 0.5657850503921509, "reward_std": 0.29925885796546936, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1263042390346527, "sampling/sampling_logp_difference/max": 1.798166275024414, "sampling/importance_sampling_ratio/min": 0.16560228168964386, "sampling/importance_sampling_ratio/mean": 1.0113784074783325, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8484212383627892, "clip_ratio/low_mean": 0.055868412367999554, "clip_ratio/low_min": 0.055868412367999554, "clip_ratio/high_mean": 0.04534399416297674, "clip_ratio/high_max": 0.04534399416297674, "clip_ratio/region_mean": 0.1012124065309763, "reward_total_mean": 0.5657850503921509, "reward_meter_mean": 0.8347108364105225, "reward_meter_std": 0.2469102293252945, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.815872073173523, "reward_repeat_penalty_std": 0.26995933055877686, "reward_near_duplicate_penalty_mean": 0.9238532781600952, "reward_near_duplicate_penalty_std": 0.08535701036453247, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8854270577430725, "reward_distinct_2_std": 0.19207239151000977, "reward_judge_quality_mean": 0.6800000071525574, "reward_judge_quality_std": 0.24622870981693268, "reward_total_composite_mean": 0.5657850503921509, "reward_total_composite_std": 0.29925888776779175} {"timestamp_utc": "2026-04-12T12:48:02Z", "mode": "train", "global_step": 521, "epoch": 0.02092621600996104, "loss": -0.1316, "grad_norm": 4.403454780578613, "learning_rate": 8.424242424242425e-06, "num_tokens": 1043081.0, "completions/mean_length": 244.5, "completions/min_length": 180.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 206.2857208251953, "completions/min_terminated_length": 180.0, "completions/max_terminated_length": 239.0, "rewards/meter/mean": 0.7262649536132812, "rewards/meter/std": 0.23929134011268616, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9717724919319153, "rewards/lexical_plausibility/std": 0.07983947545289993, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.6779124736785889, "rewards/repeat_penalty/std": 0.34433984756469727, "rewards/near_duplicate_penalty/mean": 0.9364027976989746, "rewards/near_duplicate_penalty/std": 0.062103621661663055, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7290850281715393, "rewards/distinct_2/std": 0.3030446469783783, "rewards/total_composite/mean": 0.2239198386669159, "rewards/total_composite/std": 0.16303850710391998, "reward": 0.2239198386669159, "reward_std": 0.1630384922027588, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13012371957302094, "sampling/sampling_logp_difference/max": 2.064903974533081, "sampling/importance_sampling_ratio/min": 0.12683045864105225, "sampling/importance_sampling_ratio/mean": 1.003973126411438, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.848668709397316, "clip_ratio/low_mean": 0.02434131968766451, "clip_ratio/low_min": 0.02434131968766451, "clip_ratio/high_mean": 0.09618020989000797, "clip_ratio/high_max": 0.09618020989000797, "clip_ratio/region_mean": 0.12052152957767248, "reward_total_mean": 0.2239198386669159, "reward_meter_mean": 0.7262649536132812, "reward_meter_std": 0.23929134011268616, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9717724919319153, "reward_lexical_plausibility_std": 0.07983947545289993, "reward_repeat_penalty_mean": 0.6779124736785889, "reward_repeat_penalty_std": 0.34433984756469727, "reward_near_duplicate_penalty_mean": 0.9364027976989746, "reward_near_duplicate_penalty_std": 0.062103621661663055, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7290850281715393, "reward_distinct_2_std": 0.3030446469783783, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.2239198386669159, "reward_total_composite_std": 0.16303850710391998} {"timestamp_utc": "2026-04-12T12:48:10Z", "mode": "train", "global_step": 522, "epoch": 0.020966381491745994, "loss": 0.071, "grad_norm": 14.616438865661621, "learning_rate": 8.421212121212122e-06, "num_tokens": 1044721.0, "completions/mean_length": 45.0, "completions/min_length": 38.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.830040693283081, "rewards/meter/std": 0.29204705357551575, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9830596446990967, "rewards/repeat_penalty/std": 0.02361476793885231, "rewards/near_duplicate_penalty/mean": 0.9830596446990967, "rewards/near_duplicate_penalty/std": 0.02361476793885231, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5864711999893188, "rewards/total_composite/std": 0.3036585748195648, "reward": 0.5864711999893188, "reward_std": 0.30365854501724243, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14478832483291626, "sampling/sampling_logp_difference/max": 1.0192508697509766, "sampling/importance_sampling_ratio/min": 0.36086517572402954, "sampling/importance_sampling_ratio/mean": 1.0219646692276, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1900311186909676, "clip_ratio/low_mean": 0.0848024021834135, "clip_ratio/low_min": 0.0848024021834135, "clip_ratio/high_mean": 0.07249094545841217, "clip_ratio/high_max": 0.07249094545841217, "clip_ratio/region_mean": 0.15729334764182568, "reward_total_mean": 0.5864711999893188, "reward_meter_mean": 0.830040693283081, "reward_meter_std": 0.29204705357551575, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9830596446990967, "reward_repeat_penalty_std": 0.02361476793885231, "reward_near_duplicate_penalty_mean": 0.9830596446990967, "reward_near_duplicate_penalty_std": 0.02361476793885231, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.5864711999893188, "reward_total_composite_std": 0.3036585748195648} {"timestamp_utc": "2026-04-12T12:48:25Z", "mode": "train", "global_step": 523, "epoch": 0.021006546973530948, "loss": -0.0128, "grad_norm": 3.289843797683716, "learning_rate": 8.418181818181819e-06, "num_tokens": 1046024.0, "completions/mean_length": 143.875, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 21.166667938232422, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.775905191898346, "rewards/meter/std": 0.3631601333618164, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8998688459396362, "rewards/lexical_plausibility/std": 0.1405652016401291, "rewards/judge_quality/mean": 0.32124999165534973, "rewards/judge_quality/std": 0.2923519015312195, "rewards/repeat_penalty/mean": 0.7355769276618958, "rewards/repeat_penalty/std": 0.04079463332891464, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.2925552725791931, "rewards/total_composite/std": 0.31374436616897583, "reward": 0.2925552725791931, "reward_std": 0.31374436616897583, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18874205648899078, "sampling/sampling_logp_difference/max": 1.1223993301391602, "sampling/importance_sampling_ratio/min": 0.3254978656768799, "sampling/importance_sampling_ratio/mean": 1.0439214706420898, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5853483974933624, "clip_ratio/low_mean": 0.030833333730697632, "clip_ratio/low_min": 0.030833333730697632, "clip_ratio/high_mean": 0.07590579893440008, "clip_ratio/high_max": 0.07590579893440008, "clip_ratio/region_mean": 0.10673913266509771, "reward_total_mean": 0.2925552725791931, "reward_meter_mean": 0.775905191898346, "reward_meter_std": 0.3631601333618164, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8998688459396362, "reward_lexical_plausibility_std": 0.1405652016401291, "reward_repeat_penalty_mean": 0.7355769276618958, "reward_repeat_penalty_std": 0.04079463332891464, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.32124999165534973, "reward_judge_quality_std": 0.2923519015312195, "reward_total_composite_mean": 0.2925552725791931, "reward_total_composite_std": 0.31374436616897583} {"timestamp_utc": "2026-04-12T12:48:40Z", "mode": "train", "global_step": 524, "epoch": 0.0210467124553159, "loss": -0.0733, "grad_norm": 4.9495849609375, "learning_rate": 8.415151515151516e-06, "num_tokens": 1048289.0, "completions/mean_length": 165.125, "completions/min_length": 104.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 115.5714340209961, "completions/min_terminated_length": 104.0, "completions/max_terminated_length": 137.0, "rewards/meter/mean": 0.7533771991729736, "rewards/meter/std": 0.3445163667201996, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9759731888771057, "rewards/lexical_plausibility/std": 0.06795810908079147, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.2585087716579437, "rewards/repeat_penalty/mean": 0.9777988791465759, "rewards/repeat_penalty/std": 0.022853916510939598, "rewards/near_duplicate_penalty/mean": 0.9864957928657532, "rewards/near_duplicate_penalty/std": 0.011978745460510254, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9911289215087891, "rewards/distinct_2/std": 0.016462093219161034, "rewards/total_composite/mean": 0.2796931862831116, "rewards/total_composite/std": 0.2679268419742584, "reward": 0.2796931862831116, "reward_std": 0.2679268419742584, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16886699199676514, "sampling/sampling_logp_difference/max": 3.5659232139587402, "sampling/importance_sampling_ratio/min": 0.09188912063837051, "sampling/importance_sampling_ratio/mean": 1.0322113037109375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9957059249281883, "clip_ratio/low_mean": 0.05708314571529627, "clip_ratio/low_min": 0.05708314571529627, "clip_ratio/high_mean": 0.0743851400911808, "clip_ratio/high_max": 0.0743851400911808, "clip_ratio/region_mean": 0.13146828580647707, "reward_total_mean": 0.2796931862831116, "reward_meter_mean": 0.7533771991729736, "reward_meter_std": 0.3445163667201996, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9759731888771057, "reward_lexical_plausibility_std": 0.06795810908079147, "reward_repeat_penalty_mean": 0.9777988791465759, "reward_repeat_penalty_std": 0.022853916510939598, "reward_near_duplicate_penalty_mean": 0.9864957928657532, "reward_near_duplicate_penalty_std": 0.011978745460510254, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9911289215087891, "reward_distinct_2_std": 0.016462093219161034, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.2585087716579437, "reward_total_composite_mean": 0.2796931862831116, "reward_total_composite_std": 0.2679268419742584} {"timestamp_utc": "2026-04-12T12:48:52Z", "mode": "train", "global_step": 525, "epoch": 0.021086877937100856, "loss": 0.0726, "grad_norm": 9.855093002319336, "learning_rate": 8.412121212121212e-06, "num_tokens": 1050317.0, "completions/mean_length": 92.5, "completions/min_length": 64.0, "completions/max_length": 127.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 92.5, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.35597190260887146, "rewards/meter/std": 0.30366161465644836, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9686890244483948, "rewards/repeat_penalty/std": 0.02773984707891941, "rewards/near_duplicate_penalty/mean": 0.9841871857643127, "rewards/near_duplicate_penalty/std": 0.011527543887495995, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9841750860214233, "rewards/distinct_2/std": 0.022115401923656464, "rewards/total_composite/mean": 0.14699724316596985, "rewards/total_composite/std": 0.11610212922096252, "reward": 0.14699724316596985, "reward_std": 0.11610212922096252, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17837126553058624, "sampling/sampling_logp_difference/max": 1.7868213653564453, "sampling/importance_sampling_ratio/min": 0.16749171912670135, "sampling/importance_sampling_ratio/mean": 1.020738124847412, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3677703887224197, "clip_ratio/low_mean": 0.06251568999141455, "clip_ratio/low_min": 0.06251568999141455, "clip_ratio/high_mean": 0.10365104116499424, "clip_ratio/high_max": 0.10365104116499424, "clip_ratio/region_mean": 0.1661667311564088, "reward_total_mean": 0.14699724316596985, "reward_meter_mean": 0.35597190260887146, "reward_meter_std": 0.30366161465644836, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9686890244483948, "reward_repeat_penalty_std": 0.02773984707891941, "reward_near_duplicate_penalty_mean": 0.9841871857643127, "reward_near_duplicate_penalty_std": 0.011527543887495995, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9841750860214233, "reward_distinct_2_std": 0.022115401923656464, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.14699724316596985, "reward_total_composite_std": 0.11610212922096252} {"timestamp_utc": "2026-04-12T12:49:01Z", "mode": "train", "global_step": 526, "epoch": 0.02112704341888581, "loss": 0.0512, "grad_norm": 13.179574012756348, "learning_rate": 8.40909090909091e-06, "num_tokens": 1052070.0, "completions/mean_length": 52.125, "completions/min_length": 48.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.125, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7835346460342407, "rewards/meter/std": 0.2722063958644867, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9743589162826538, "rewards/lexical_plausibility/std": 0.05855080857872963, "rewards/judge_quality/mean": 0.7900000214576721, "rewards/judge_quality/std": 0.24219238758087158, "rewards/repeat_penalty/mean": 0.9872859716415405, "rewards/repeat_penalty/std": 0.019436556845903397, "rewards/near_duplicate_penalty/mean": 0.9872859716415405, "rewards/near_duplicate_penalty/std": 0.019436556845903397, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.597822904586792, "rewards/total_composite/std": 0.2706298828125, "reward": 0.597822904586792, "reward_std": 0.2706298530101776, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14874498546123505, "sampling/sampling_logp_difference/max": 1.7132418155670166, "sampling/importance_sampling_ratio/min": 0.1802804172039032, "sampling/importance_sampling_ratio/mean": 1.0163997411727905, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.785020500421524, "clip_ratio/low_mean": 0.08664832357317209, "clip_ratio/low_min": 0.08664832357317209, "clip_ratio/high_mean": 0.038968417793512344, "clip_ratio/high_max": 0.038968417793512344, "clip_ratio/region_mean": 0.12561674136668444, "reward_total_mean": 0.597822904586792, "reward_meter_mean": 0.7835346460342407, "reward_meter_std": 0.2722063958644867, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9743589162826538, "reward_lexical_plausibility_std": 0.05855080857872963, "reward_repeat_penalty_mean": 0.9872859716415405, "reward_repeat_penalty_std": 0.019436556845903397, "reward_near_duplicate_penalty_mean": 0.9872859716415405, "reward_near_duplicate_penalty_std": 0.019436556845903397, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7900000214576721, "reward_judge_quality_std": 0.24219238758087158, "reward_total_composite_mean": 0.597822904586792, "reward_total_composite_std": 0.2706298828125} {"timestamp_utc": "2026-04-12T12:49:17Z", "mode": "train", "global_step": 527, "epoch": 0.021167208900670764, "loss": -0.0784, "grad_norm": 2.7322332859039307, "learning_rate": 8.406060606060606e-06, "num_tokens": 1053736.0, "completions/mean_length": 162.25, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 45.66666793823242, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6106289029121399, "rewards/meter/std": 0.3904173970222473, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9240602850914001, "rewards/lexical_plausibility/std": 0.1270424872636795, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.28101539611816406, "rewards/repeat_penalty/mean": 0.9891421794891357, "rewards/repeat_penalty/std": 0.02679002285003662, "rewards/near_duplicate_penalty/mean": 0.9993149638175964, "rewards/near_duplicate_penalty/std": 0.0019375960109755397, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898271560668945, "rewards/distinct_2/std": 0.027016285806894302, "rewards/total_composite/mean": 0.21866630017757416, "rewards/total_composite/std": 0.17264395952224731, "reward": 0.21866630017757416, "reward_std": 0.17264395952224731, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17469477653503418, "sampling/sampling_logp_difference/max": 1.054519772529602, "sampling/importance_sampling_ratio/min": 0.37353944778442383, "sampling/importance_sampling_ratio/mean": 1.03282630443573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9298657774925232, "clip_ratio/low_mean": 0.04841269925236702, "clip_ratio/low_min": 0.04841269925236702, "clip_ratio/high_mean": 0.09396970272064209, "clip_ratio/high_max": 0.09396970272064209, "clip_ratio/region_mean": 0.1423824019730091, "reward_total_mean": 0.21866630017757416, "reward_meter_mean": 0.6106289029121399, "reward_meter_std": 0.3904173970222473, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9240602850914001, "reward_lexical_plausibility_std": 0.1270424872636795, "reward_repeat_penalty_mean": 0.9891421794891357, "reward_repeat_penalty_std": 0.02679002285003662, "reward_near_duplicate_penalty_mean": 0.9993149638175964, "reward_near_duplicate_penalty_std": 0.0019375960109755397, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898271560668945, "reward_distinct_2_std": 0.027016285806894302, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.28101539611816406, "reward_total_composite_mean": 0.21866630017757416, "reward_total_composite_std": 0.17264395952224731} {"timestamp_utc": "2026-04-12T12:49:33Z", "mode": "train", "global_step": 528, "epoch": 0.021207374382455717, "loss": -0.1165, "grad_norm": 4.148451805114746, "learning_rate": 8.403030303030304e-06, "num_tokens": 1056920.0, "completions/mean_length": 250.0, "completions/min_length": 186.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 212.57144165039062, "completions/min_terminated_length": 186.0, "completions/max_terminated_length": 307.0, "rewards/meter/mean": 0.8554412126541138, "rewards/meter/std": 0.18661826848983765, "rewards/count_adherence/mean": 0.890625, "rewards/count_adherence/std": 0.2158610224723816, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9729399681091309, "rewards/lexical_plausibility/std": 0.07653743773698807, "rewards/judge_quality/mean": 0.3162499964237213, "rewards/judge_quality/std": 0.2650572657585144, "rewards/repeat_penalty/mean": 0.4841121435165405, "rewards/repeat_penalty/std": 0.451438844203949, "rewards/near_duplicate_penalty/mean": 0.8259027004241943, "rewards/near_duplicate_penalty/std": 0.1511022299528122, "rewards/opening_diversity/mean": 0.8463541865348816, "rewards/opening_diversity/std": 0.2396641969680786, "rewards/distinct_2/mean": 0.5584592819213867, "rewards/distinct_2/std": 0.4091425836086273, "rewards/total_composite/mean": 0.2517433166503906, "rewards/total_composite/std": 0.18851564824581146, "reward": 0.2517433166503906, "reward_std": 0.18851564824581146, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1041996031999588, "sampling/sampling_logp_difference/max": 2.1392531394958496, "sampling/importance_sampling_ratio/min": 0.11774274706840515, "sampling/importance_sampling_ratio/mean": 1.0030522346496582, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5083982348442078, "clip_ratio/low_mean": 0.03600514028221369, "clip_ratio/low_min": 0.03600514028221369, "clip_ratio/high_mean": 0.06670314725488424, "clip_ratio/high_max": 0.06670314725488424, "clip_ratio/region_mean": 0.10270828753709793, "reward_total_mean": 0.2517433166503906, "reward_meter_mean": 0.8554412126541138, "reward_meter_std": 0.18661826848983765, "reward_count_adherence_mean": 0.890625, "reward_count_adherence_std": 0.2158610224723816, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9729399681091309, "reward_lexical_plausibility_std": 0.07653743773698807, "reward_repeat_penalty_mean": 0.4841121435165405, "reward_repeat_penalty_std": 0.451438844203949, "reward_near_duplicate_penalty_mean": 0.8259027004241943, "reward_near_duplicate_penalty_std": 0.1511022299528122, "reward_opening_diversity_mean": 0.8463541865348816, "reward_opening_diversity_std": 0.2396641969680786, "reward_distinct_2_mean": 0.5584592819213867, "reward_distinct_2_std": 0.4091425836086273, "reward_judge_quality_mean": 0.3162499964237213, "reward_judge_quality_std": 0.2650572657585144, "reward_total_composite_mean": 0.2517433166503906, "reward_total_composite_std": 0.18851564824581146} {"timestamp_utc": "2026-04-12T12:49:48Z", "mode": "train", "global_step": 529, "epoch": 0.02124753986424067, "loss": -0.0277, "grad_norm": 5.870815753936768, "learning_rate": 8.400000000000001e-06, "num_tokens": 1058633.0, "completions/mean_length": 112.125, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 55.000003814697266, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.937852680683136, "rewards/meter/std": 0.0940370187163353, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.8069376349449158, "rewards/repeat_penalty/std": 0.3418090343475342, "rewards/near_duplicate_penalty/mean": 0.9675962924957275, "rewards/near_duplicate_penalty/std": 0.027440514415502548, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8673076629638672, "rewards/distinct_2/std": 0.3511062264442444, "rewards/total_composite/mean": 0.299264520406723, "rewards/total_composite/std": 0.15438225865364075, "reward": 0.299264520406723, "reward_std": 0.15438224375247955, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1524091511964798, "sampling/sampling_logp_difference/max": 1.8996385335922241, "sampling/importance_sampling_ratio/min": 0.14962269365787506, "sampling/importance_sampling_ratio/mean": 1.0123872756958008, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9553992077708244, "clip_ratio/low_mean": 0.03307629842311144, "clip_ratio/low_min": 0.03307629842311144, "clip_ratio/high_mean": 0.06976372841745615, "clip_ratio/high_max": 0.06976372841745615, "clip_ratio/region_mean": 0.10284002684056759, "reward_total_mean": 0.299264520406723, "reward_meter_mean": 0.937852680683136, "reward_meter_std": 0.0940370187163353, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8069376349449158, "reward_repeat_penalty_std": 0.3418090343475342, "reward_near_duplicate_penalty_mean": 0.9675962924957275, "reward_near_duplicate_penalty_std": 0.027440514415502548, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8673076629638672, "reward_distinct_2_std": 0.3511062264442444, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.299264520406723, "reward_total_composite_std": 0.15438225865364075} {"timestamp_utc": "2026-04-12T12:50:00Z", "mode": "train", "global_step": 530, "epoch": 0.021287705346025625, "loss": 0.0651, "grad_norm": 6.3402934074401855, "learning_rate": 8.396969696969698e-06, "num_tokens": 1062073.0, "completions/mean_length": 190.0, "completions/min_length": 167.0, "completions/max_length": 207.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 190.0, "completions/min_terminated_length": 167.0, "completions/max_terminated_length": 207.0, "rewards/meter/mean": 0.8997592926025391, "rewards/meter/std": 0.1447831243276596, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9831730723381042, "rewards/lexical_plausibility/std": 0.04759372025728226, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.1761268973350525, "rewards/repeat_penalty/std": 0.14410898089408875, "rewards/near_duplicate_penalty/mean": 0.7250598669052124, "rewards/near_duplicate_penalty/std": 0.08609069883823395, "rewards/opening_diversity/mean": 0.8411458134651184, "rewards/opening_diversity/std": 0.12284223735332489, "rewards/distinct_2/mean": 0.3209337592124939, "rewards/distinct_2/std": 0.2357674092054367, "rewards/total_composite/mean": 0.2428385615348816, "rewards/total_composite/std": 0.09923245012760162, "reward": 0.2428385615348816, "reward_std": 0.09923245012760162, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09381035715341568, "sampling/sampling_logp_difference/max": 2.728348970413208, "sampling/importance_sampling_ratio/min": 0.06532705575227737, "sampling/importance_sampling_ratio/mean": 1.0126867294311523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5182583890855312, "clip_ratio/low_mean": 0.033622329123318195, "clip_ratio/low_min": 0.033622329123318195, "clip_ratio/high_mean": 0.05906510725617409, "clip_ratio/high_max": 0.05906510725617409, "clip_ratio/region_mean": 0.09268743637949228, "reward_total_mean": 0.2428385615348816, "reward_meter_mean": 0.8997592926025391, "reward_meter_std": 0.1447831243276596, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9831730723381042, "reward_lexical_plausibility_std": 0.04759372025728226, "reward_repeat_penalty_mean": 0.1761268973350525, "reward_repeat_penalty_std": 0.14410898089408875, "reward_near_duplicate_penalty_mean": 0.7250598669052124, "reward_near_duplicate_penalty_std": 0.08609069883823395, "reward_opening_diversity_mean": 0.8411458134651184, "reward_opening_diversity_std": 0.12284223735332489, "reward_distinct_2_mean": 0.3209337592124939, "reward_distinct_2_std": 0.2357674092054367, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.2428385615348816, "reward_total_composite_std": 0.09923245012760162} {"timestamp_utc": "2026-04-12T12:50:15Z", "mode": "train", "global_step": 531, "epoch": 0.02132787082781058, "loss": -0.1987, "grad_norm": 2.5517168045043945, "learning_rate": 8.393939393939394e-06, "num_tokens": 1065203.0, "completions/mean_length": 258.25, "completions/min_length": 187.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 222.00001525878906, "completions/min_terminated_length": 187.0, "completions/max_terminated_length": 272.0, "rewards/meter/mean": 0.8568861484527588, "rewards/meter/std": 0.32454073429107666, "rewards/count_adherence/mean": 0.796875, "rewards/count_adherence/std": 0.27497971057891846, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9716575145721436, "rewards/lexical_plausibility/std": 0.08016465604305267, "rewards/judge_quality/mean": 0.13125000894069672, "rewards/judge_quality/std": 0.0530330128967762, "rewards/repeat_penalty/mean": 0.125, "rewards/repeat_penalty/std": 0.3535533845424652, "rewards/near_duplicate_penalty/mean": 0.5829541087150574, "rewards/near_duplicate_penalty/std": 0.24616171419620514, "rewards/opening_diversity/mean": 0.688725471496582, "rewards/opening_diversity/std": 0.3646610975265503, "rewards/distinct_2/mean": 0.125, "rewards/distinct_2/std": 0.3535533845424652, "rewards/total_composite/mean": 0.0985783189535141, "rewards/total_composite/std": 0.05917447432875633, "reward": 0.0985783189535141, "reward_std": 0.059174466878175735, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04312387481331825, "sampling/sampling_logp_difference/max": 1.377960205078125, "sampling/importance_sampling_ratio/min": 0.25209224224090576, "sampling/importance_sampling_ratio/mean": 1.0071038007736206, "sampling/importance_sampling_ratio/max": 1.8820263147354126, "entropy": 0.2851339690387249, "clip_ratio/low_mean": 0.0065104165114462376, "clip_ratio/low_min": 0.0065104165114462376, "clip_ratio/high_mean": 0.029803105629980564, "clip_ratio/high_max": 0.029803105629980564, "clip_ratio/region_mean": 0.0363135221414268, "reward_total_mean": 0.0985783189535141, "reward_meter_mean": 0.8568861484527588, "reward_meter_std": 0.32454073429107666, "reward_count_adherence_mean": 0.796875, "reward_count_adherence_std": 0.27497971057891846, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9716575145721436, "reward_lexical_plausibility_std": 0.08016465604305267, "reward_repeat_penalty_mean": 0.125, "reward_repeat_penalty_std": 0.3535533845424652, "reward_near_duplicate_penalty_mean": 0.5829541087150574, "reward_near_duplicate_penalty_std": 0.24616171419620514, "reward_opening_diversity_mean": 0.688725471496582, "reward_opening_diversity_std": 0.3646610975265503, "reward_distinct_2_mean": 0.125, "reward_distinct_2_std": 0.3535533845424652, "reward_judge_quality_mean": 0.13125000894069672, "reward_judge_quality_std": 0.0530330128967762, "reward_total_composite_mean": 0.0985783189535141, "reward_total_composite_std": 0.05917447432875633} {"timestamp_utc": "2026-04-12T12:50:29Z", "mode": "train", "global_step": 532, "epoch": 0.021368036309595533, "loss": -0.0601, "grad_norm": 5.555056095123291, "learning_rate": 8.390909090909091e-06, "num_tokens": 1067370.0, "completions/mean_length": 162.875, "completions/min_length": 93.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 113.00000762939453, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.8084428310394287, "rewards/meter/std": 0.24196060001850128, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.6832889318466187, "rewards/repeat_penalty/std": 0.3724896311759949, "rewards/near_duplicate_penalty/mean": 0.9544548988342285, "rewards/near_duplicate_penalty/std": 0.0558350495994091, "rewards/opening_diversity/mean": 0.9765625, "rewards/opening_diversity/std": 0.032346826046705246, "rewards/distinct_2/mean": 0.7420210838317871, "rewards/distinct_2/std": 0.35255300998687744, "rewards/total_composite/mean": 0.32075899839401245, "rewards/total_composite/std": 0.20925991237163544, "reward": 0.32075899839401245, "reward_std": 0.20925991237163544, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14588786661624908, "sampling/sampling_logp_difference/max": 1.3479371070861816, "sampling/importance_sampling_ratio/min": 0.2597756087779999, "sampling/importance_sampling_ratio/mean": 1.021937608718872, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9303793534636497, "clip_ratio/low_mean": 0.03686714172363281, "clip_ratio/low_min": 0.03686714172363281, "clip_ratio/high_mean": 0.09394550323486328, "clip_ratio/high_max": 0.09394550323486328, "clip_ratio/region_mean": 0.1308126449584961, "reward_total_mean": 0.32075899839401245, "reward_meter_mean": 0.8084428310394287, "reward_meter_std": 0.24196060001850128, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6832889318466187, "reward_repeat_penalty_std": 0.3724896311759949, "reward_near_duplicate_penalty_mean": 0.9544548988342285, "reward_near_duplicate_penalty_std": 0.0558350495994091, "reward_opening_diversity_mean": 0.9765625, "reward_opening_diversity_std": 0.032346826046705246, "reward_distinct_2_mean": 0.7420210838317871, "reward_distinct_2_std": 0.35255300998687744, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.32075899839401245, "reward_total_composite_std": 0.20925991237163544} {"timestamp_utc": "2026-04-12T12:50:44Z", "mode": "train", "global_step": 533, "epoch": 0.021408201791380487, "loss": -0.1584, "grad_norm": 0.9167531132698059, "learning_rate": 8.387878787878788e-06, "num_tokens": 1070403.0, "completions/mean_length": 489.125, "completions/min_length": 436.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 451.0, "completions/min_terminated_length": 436.0, "completions/max_terminated_length": 461.0, "rewards/meter/mean": 0.8364267945289612, "rewards/meter/std": 0.22743096947669983, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.13772527873516083, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.038550376892089844, "rewards/repeat_penalty/std": 0.07170351594686508, "rewards/near_duplicate_penalty/mean": 0.7515722513198853, "rewards/near_duplicate_penalty/std": 0.1594141721725464, "rewards/opening_diversity/mean": 0.9142134189605713, "rewards/opening_diversity/std": 0.09840895235538483, "rewards/distinct_2/mean": 0.05562567338347435, "rewards/distinct_2/std": 0.10356443375349045, "rewards/total_composite/mean": 0.09171570837497711, "rewards/total_composite/std": 0.03053947724401951, "reward": 0.09171570837497711, "reward_std": 0.03053947724401951, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06979882717132568, "sampling/sampling_logp_difference/max": 1.7257180213928223, "sampling/importance_sampling_ratio/min": 0.17804516851902008, "sampling/importance_sampling_ratio/mean": 1.0062392950057983, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.15940506011247635, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.023210786283016205, "clip_ratio/high_max": 0.023210786283016205, "clip_ratio/region_mean": 0.023210786283016205, "reward_total_mean": 0.09171570837497711, "reward_meter_mean": 0.8364267945289612, "reward_meter_std": 0.22743096947669983, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.13772527873516083, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.038550376892089844, "reward_repeat_penalty_std": 0.07170351594686508, "reward_near_duplicate_penalty_mean": 0.7515722513198853, "reward_near_duplicate_penalty_std": 0.1594141721725464, "reward_opening_diversity_mean": 0.9142134189605713, "reward_opening_diversity_std": 0.09840895235538483, "reward_distinct_2_mean": 0.05562567338347435, "reward_distinct_2_std": 0.10356443375349045, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.09171570837497711, "reward_total_composite_std": 0.03053947724401951} {"timestamp_utc": "2026-04-12T12:50:54Z", "mode": "train", "global_step": 534, "epoch": 0.02144836727316544, "loss": 0.0342, "grad_norm": 12.688547134399414, "learning_rate": 8.384848484848485e-06, "num_tokens": 1072694.0, "completions/mean_length": 109.375, "completions/min_length": 96.0, "completions/max_length": 119.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.375, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.7278497219085693, "rewards/meter/std": 0.3690914809703827, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9895833730697632, "rewards/lexical_plausibility/std": 0.029462775215506554, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.7939637899398804, "rewards/repeat_penalty/std": 0.29377561807632446, "rewards/near_duplicate_penalty/mean": 0.9472005367279053, "rewards/near_duplicate_penalty/std": 0.07469348609447479, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8238227367401123, "rewards/distinct_2/std": 0.27867135405540466, "rewards/total_composite/mean": 0.285033643245697, "rewards/total_composite/std": 0.13481025397777557, "reward": 0.285033643245697, "reward_std": 0.13481023907661438, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13370047509670258, "sampling/sampling_logp_difference/max": 1.7642860412597656, "sampling/importance_sampling_ratio/min": 0.17130905389785767, "sampling/importance_sampling_ratio/mean": 1.0064051151275635, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9834525212645531, "clip_ratio/low_mean": 0.07096594572067261, "clip_ratio/low_min": 0.07096594572067261, "clip_ratio/high_mean": 0.06541966227814555, "clip_ratio/high_max": 0.06541966227814555, "clip_ratio/region_mean": 0.13638560799881816, "reward_total_mean": 0.285033643245697, "reward_meter_mean": 0.7278497219085693, "reward_meter_std": 0.3690914809703827, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9895833730697632, "reward_lexical_plausibility_std": 0.029462775215506554, "reward_repeat_penalty_mean": 0.7939637899398804, "reward_repeat_penalty_std": 0.29377561807632446, "reward_near_duplicate_penalty_mean": 0.9472005367279053, "reward_near_duplicate_penalty_std": 0.07469348609447479, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8238227367401123, "reward_distinct_2_std": 0.27867135405540466, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.285033643245697, "reward_total_composite_std": 0.13481025397777557} {"timestamp_utc": "2026-04-12T12:51:05Z", "mode": "train", "global_step": 535, "epoch": 0.021488532754950395, "loss": 0.0652, "grad_norm": 14.839488983154297, "learning_rate": 8.381818181818183e-06, "num_tokens": 1075104.0, "completions/mean_length": 103.25, "completions/min_length": 85.0, "completions/max_length": 119.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.25, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.5845506191253662, "rewards/meter/std": 0.15791787207126617, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.948292076587677, "rewards/repeat_penalty/std": 0.046413879841566086, "rewards/near_duplicate_penalty/mean": 0.9824104905128479, "rewards/near_duplicate_penalty/std": 0.009192436933517456, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9650310277938843, "rewards/distinct_2/std": 0.04034508392214775, "rewards/total_composite/mean": 0.20369039475917816, "rewards/total_composite/std": 0.09125176072120667, "reward": 0.20369039475917816, "reward_std": 0.09125176072120667, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21394693851470947, "sampling/sampling_logp_difference/max": 2.5198817253112793, "sampling/importance_sampling_ratio/min": 0.08046912401914597, "sampling/importance_sampling_ratio/mean": 0.9883208870887756, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0349463522434235, "clip_ratio/low_mean": 0.11953691951930523, "clip_ratio/low_min": 0.11953691951930523, "clip_ratio/high_mean": 0.08050814270973206, "clip_ratio/high_max": 0.08050814270973206, "clip_ratio/region_mean": 0.20004506222903728, "reward_total_mean": 0.20369039475917816, "reward_meter_mean": 0.5845506191253662, "reward_meter_std": 0.15791787207126617, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.948292076587677, "reward_repeat_penalty_std": 0.046413879841566086, "reward_near_duplicate_penalty_mean": 0.9824104905128479, "reward_near_duplicate_penalty_std": 0.009192436933517456, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9650310277938843, "reward_distinct_2_std": 0.04034508392214775, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.20369039475917816, "reward_total_composite_std": 0.09125176072120667} {"timestamp_utc": "2026-04-12T12:51:21Z", "mode": "train", "global_step": 536, "epoch": 0.02152869823673535, "loss": -0.0424, "grad_norm": 4.612396240234375, "learning_rate": 8.37878787878788e-06, "num_tokens": 1076626.0, "completions/mean_length": 167.25, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 52.333335876464844, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.19621151685714722, "rewards/meter/std": 0.24942757189273834, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9493439197540283, "rewards/lexical_plausibility/std": 0.0961630567908287, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3537932336330414, "rewards/repeat_penalty/mean": 0.9899824857711792, "rewards/repeat_penalty/std": 0.020527975633740425, "rewards/near_duplicate_penalty/mean": 0.9899824857711792, "rewards/near_duplicate_penalty/std": 0.020527975633740425, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1278495043516159, "rewards/total_composite/std": 0.22685647010803223, "reward": 0.1278495043516159, "reward_std": 0.22685645520687103, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14579251408576965, "sampling/sampling_logp_difference/max": 1.9719133377075195, "sampling/importance_sampling_ratio/min": 0.13919028639793396, "sampling/importance_sampling_ratio/mean": 1.0111684799194336, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7191209271550179, "clip_ratio/low_mean": 0.08018747624009848, "clip_ratio/low_min": 0.08018747624009848, "clip_ratio/high_mean": 0.055055659264326096, "clip_ratio/high_max": 0.055055659264326096, "clip_ratio/region_mean": 0.13524313550442457, "reward_total_mean": 0.1278495043516159, "reward_meter_mean": 0.19621151685714722, "reward_meter_std": 0.24942757189273834, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9493439197540283, "reward_lexical_plausibility_std": 0.0961630567908287, "reward_repeat_penalty_mean": 0.9899824857711792, "reward_repeat_penalty_std": 0.020527975633740425, "reward_near_duplicate_penalty_mean": 0.9899824857711792, "reward_near_duplicate_penalty_std": 0.020527975633740425, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3537932336330414, "reward_total_composite_mean": 0.1278495043516159, "reward_total_composite_std": 0.22685647010803223} {"timestamp_utc": "2026-04-12T12:51:29Z", "mode": "train", "global_step": 537, "epoch": 0.021568863718520303, "loss": 0.0479, "grad_norm": 12.68325138092041, "learning_rate": 8.375757575757576e-06, "num_tokens": 1078299.0, "completions/mean_length": 49.125, "completions/min_length": 44.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.125, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8141142129898071, "rewards/meter/std": 0.3222385346889496, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.9850510358810425, "rewards/repeat_penalty/std": 0.029591161757707596, "rewards/near_duplicate_penalty/mean": 0.9936339259147644, "rewards/near_duplicate_penalty/std": 0.007461874280124903, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.4584875702857971, "rewards/total_composite/std": 0.23430661857128143, "reward": 0.4584875702857971, "reward_std": 0.23430663347244263, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1474178284406662, "sampling/sampling_logp_difference/max": 1.5713319778442383, "sampling/importance_sampling_ratio/min": 0.2077682614326477, "sampling/importance_sampling_ratio/mean": 1.0108470916748047, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1057326719164848, "clip_ratio/low_mean": 0.11327622085809708, "clip_ratio/low_min": 0.11327622085809708, "clip_ratio/high_mean": 0.040294526144862175, "clip_ratio/high_max": 0.040294526144862175, "clip_ratio/region_mean": 0.15357074700295925, "reward_total_mean": 0.4584875702857971, "reward_meter_mean": 0.8141142129898071, "reward_meter_std": 0.3222385346889496, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9850510358810425, "reward_repeat_penalty_std": 0.029591161757707596, "reward_near_duplicate_penalty_mean": 0.9936339259147644, "reward_near_duplicate_penalty_std": 0.007461874280124903, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.4584875702857971, "reward_total_composite_std": 0.23430661857128143} {"timestamp_utc": "2026-04-12T12:51:41Z", "mode": "train", "global_step": 538, "epoch": 0.021609029200305257, "loss": 0.578, "grad_norm": 11.540745735168457, "learning_rate": 8.372727272727273e-06, "num_tokens": 1079982.0, "completions/mean_length": 54.375, "completions/min_length": 20.0, "completions/max_length": 275.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.375, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 275.0, "rewards/meter/mean": 0.489854633808136, "rewards/meter/std": 0.500199556350708, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9736684560775757, "rewards/lexical_plausibility/std": 0.053863029927015305, "rewards/judge_quality/mean": 0.7150000333786011, "rewards/judge_quality/std": 0.38052597641944885, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4499676525592804, "rewards/total_composite/std": 0.4609576165676117, "reward": 0.4499676525592804, "reward_std": 0.4609576165676117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14810021221637726, "sampling/sampling_logp_difference/max": 1.21683931350708, "sampling/importance_sampling_ratio/min": 0.29616478085517883, "sampling/importance_sampling_ratio/mean": 1.0322062969207764, "sampling/importance_sampling_ratio/max": 1.8346823453903198, "entropy": 1.885888610035181, "clip_ratio/low_mean": 0.05073616676963866, "clip_ratio/low_min": 0.05073616676963866, "clip_ratio/high_mean": 0.07121865265071392, "clip_ratio/high_max": 0.07121865265071392, "clip_ratio/region_mean": 0.12195481942035258, "reward_total_mean": 0.4499676525592804, "reward_meter_mean": 0.489854633808136, "reward_meter_std": 0.500199556350708, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9736684560775757, "reward_lexical_plausibility_std": 0.053863029927015305, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7150000333786011, "reward_judge_quality_std": 0.38052597641944885, "reward_total_composite_mean": 0.4499676525592804, "reward_total_composite_std": 0.4609576165676117} {"timestamp_utc": "2026-04-12T12:51:51Z", "mode": "train", "global_step": 539, "epoch": 0.02164919468209021, "loss": 0.0096, "grad_norm": 8.234294891357422, "learning_rate": 8.36969696969697e-06, "num_tokens": 1082383.0, "completions/mean_length": 111.125, "completions/min_length": 101.0, "completions/max_length": 128.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.125, "completions/min_terminated_length": 101.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.7686270475387573, "rewards/meter/std": 0.3404479920864105, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.4210032820701599, "rewards/repeat_penalty/std": 0.252521276473999, "rewards/near_duplicate_penalty/mean": 0.8123122453689575, "rewards/near_duplicate_penalty/std": 0.11966996639966965, "rewards/opening_diversity/mean": 0.8250000476837158, "rewards/opening_diversity/std": 0.20701968669891357, "rewards/distinct_2/mean": 0.597417414188385, "rewards/distinct_2/std": 0.187087744474411, "rewards/total_composite/mean": 0.25443488359451294, "rewards/total_composite/std": 0.14483973383903503, "reward": 0.25443488359451294, "reward_std": 0.14483973383903503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1166553646326065, "sampling/sampling_logp_difference/max": 1.492222785949707, "sampling/importance_sampling_ratio/min": 0.22487226128578186, "sampling/importance_sampling_ratio/mean": 1.024922251701355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7824344448745251, "clip_ratio/low_mean": 0.027238872833549976, "clip_ratio/low_min": 0.027238872833549976, "clip_ratio/high_mean": 0.07031228579580784, "clip_ratio/high_max": 0.07031228579580784, "clip_ratio/region_mean": 0.09755115862935781, "reward_total_mean": 0.25443488359451294, "reward_meter_mean": 0.7686270475387573, "reward_meter_std": 0.3404479920864105, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4210032820701599, "reward_repeat_penalty_std": 0.252521276473999, "reward_near_duplicate_penalty_mean": 0.8123122453689575, "reward_near_duplicate_penalty_std": 0.11966996639966965, "reward_opening_diversity_mean": 0.8250000476837158, "reward_opening_diversity_std": 0.20701968669891357, "reward_distinct_2_mean": 0.597417414188385, "reward_distinct_2_std": 0.187087744474411, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.25443488359451294, "reward_total_composite_std": 0.14483973383903503} {"timestamp_utc": "2026-04-12T12:52:05Z", "mode": "train", "global_step": 540, "epoch": 0.021689360163875165, "loss": -0.0678, "grad_norm": 5.527726173400879, "learning_rate": 8.366666666666667e-06, "num_tokens": 1084091.0, "completions/mean_length": 106.5, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.57143020629883, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7789685130119324, "rewards/meter/std": 0.3174363374710083, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9723135232925415, "rewards/lexical_plausibility/std": 0.07830909639596939, "rewards/judge_quality/mean": 0.5162500143051147, "rewards/judge_quality/std": 0.2506527006626129, "rewards/repeat_penalty/mean": 0.9699653387069702, "rewards/repeat_penalty/std": 0.050749704241752625, "rewards/near_duplicate_penalty/mean": 0.98801189661026, "rewards/near_duplicate_penalty/std": 0.01910880208015442, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9812270998954773, "rewards/distinct_2/std": 0.034774426370859146, "rewards/total_composite/mean": 0.4167323708534241, "rewards/total_composite/std": 0.29724326729774475, "reward": 0.4167323708534241, "reward_std": 0.29724326729774475, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16650508344173431, "sampling/sampling_logp_difference/max": 1.545924186706543, "sampling/importance_sampling_ratio/min": 0.21311481297016144, "sampling/importance_sampling_ratio/mean": 1.0367190837860107, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0137456208467484, "clip_ratio/low_mean": 0.04594863811507821, "clip_ratio/low_min": 0.04594863811507821, "clip_ratio/high_mean": 0.07743352837860584, "clip_ratio/high_max": 0.07743352837860584, "clip_ratio/region_mean": 0.12338216649368405, "reward_total_mean": 0.4167323708534241, "reward_meter_mean": 0.7789685130119324, "reward_meter_std": 0.3174363374710083, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9723135232925415, "reward_lexical_plausibility_std": 0.07830909639596939, "reward_repeat_penalty_mean": 0.9699653387069702, "reward_repeat_penalty_std": 0.050749704241752625, "reward_near_duplicate_penalty_mean": 0.98801189661026, "reward_near_duplicate_penalty_std": 0.01910880208015442, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9812270998954773, "reward_distinct_2_std": 0.034774426370859146, "reward_judge_quality_mean": 0.5162500143051147, "reward_judge_quality_std": 0.2506527006626129, "reward_total_composite_mean": 0.4167323708534241, "reward_total_composite_std": 0.29724326729774475} {"timestamp_utc": "2026-04-12T12:52:14Z", "mode": "train", "global_step": 541, "epoch": 0.02172952564566012, "loss": 0.0907, "grad_norm": 13.243159294128418, "learning_rate": 8.363636363636365e-06, "num_tokens": 1085833.0, "completions/mean_length": 50.75, "completions/min_length": 45.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.75, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.7803934812545776, "rewards/meter/std": 0.3405003547668457, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.9894441962242126, "rewards/repeat_penalty/std": 0.019719798117876053, "rewards/near_duplicate_penalty/mean": 0.9894441962242126, "rewards/near_duplicate_penalty/std": 0.019719798117876053, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3628407418727875, "rewards/total_composite/std": 0.26674890518188477, "reward": 0.3628407418727875, "reward_std": 0.2667488753795624, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16147242486476898, "sampling/sampling_logp_difference/max": 1.7120890617370605, "sampling/importance_sampling_ratio/min": 0.18048834800720215, "sampling/importance_sampling_ratio/mean": 1.030494213104248, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9272258132696152, "clip_ratio/low_mean": 0.06402011448517442, "clip_ratio/low_min": 0.06402011448517442, "clip_ratio/high_mean": 0.056826923973858356, "clip_ratio/high_max": 0.056826923973858356, "clip_ratio/region_mean": 0.12084703845903277, "reward_total_mean": 0.3628407418727875, "reward_meter_mean": 0.7803934812545776, "reward_meter_std": 0.3405003547668457, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9894441962242126, "reward_repeat_penalty_std": 0.019719798117876053, "reward_near_duplicate_penalty_mean": 0.9894441962242126, "reward_near_duplicate_penalty_std": 0.019719798117876053, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.3628407418727875, "reward_total_composite_std": 0.26674890518188477} {"timestamp_utc": "2026-04-12T12:52:29Z", "mode": "train", "global_step": 542, "epoch": 0.021769691127445073, "loss": -0.0194, "grad_norm": 5.271066665649414, "learning_rate": 8.360606060606062e-06, "num_tokens": 1087513.0, "completions/mean_length": 110.0, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.57143020629883, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.5333980917930603, "rewards/meter/std": 0.4215831160545349, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9752260446548462, "rewards/lexical_plausibility/std": 0.07007137686014175, "rewards/judge_quality/mean": 0.6000000238418579, "rewards/judge_quality/std": 0.34050384163856506, "rewards/repeat_penalty/mean": 0.8951529860496521, "rewards/repeat_penalty/std": 0.2170160710811615, "rewards/near_duplicate_penalty/mean": 0.9672882556915283, "rewards/near_duplicate_penalty/std": 0.040903035551309586, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.953177273273468, "rewards/distinct_2/std": 0.10797474533319473, "rewards/total_composite/mean": 0.3980540931224823, "rewards/total_composite/std": 0.3673470914363861, "reward": 0.3980540931224823, "reward_std": 0.3673470914363861, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15299922227859497, "sampling/sampling_logp_difference/max": 1.871394395828247, "sampling/importance_sampling_ratio/min": 0.15390890836715698, "sampling/importance_sampling_ratio/mean": 1.0171422958374023, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0272081568837166, "clip_ratio/low_mean": 0.035638296976685524, "clip_ratio/low_min": 0.035638296976685524, "clip_ratio/high_mean": 0.0830766474828124, "clip_ratio/high_max": 0.0830766474828124, "clip_ratio/region_mean": 0.11871494445949793, "reward_total_mean": 0.3980540931224823, "reward_meter_mean": 0.5333980917930603, "reward_meter_std": 0.4215831160545349, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9752260446548462, "reward_lexical_plausibility_std": 0.07007137686014175, "reward_repeat_penalty_mean": 0.8951529860496521, "reward_repeat_penalty_std": 0.2170160710811615, "reward_near_duplicate_penalty_mean": 0.9672882556915283, "reward_near_duplicate_penalty_std": 0.040903035551309586, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.953177273273468, "reward_distinct_2_std": 0.10797474533319473, "reward_judge_quality_mean": 0.6000000238418579, "reward_judge_quality_std": 0.34050384163856506, "reward_total_composite_mean": 0.3980540931224823, "reward_total_composite_std": 0.3673470914363861} {"timestamp_utc": "2026-04-12T12:52:43Z", "mode": "train", "global_step": 543, "epoch": 0.021809856609230027, "loss": -0.0798, "grad_norm": 5.470287322998047, "learning_rate": 8.357575757575759e-06, "num_tokens": 1089265.0, "completions/mean_length": 126.0, "completions/min_length": 65.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 70.85714721679688, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.6617354154586792, "rewards/meter/std": 0.25543513894081116, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9628397226333618, "rewards/lexical_plausibility/std": 0.1051052063703537, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9738050699234009, "rewards/repeat_penalty/std": 0.04037882015109062, "rewards/near_duplicate_penalty/mean": 0.9850949645042419, "rewards/near_duplicate_penalty/std": 0.013675507158041, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9883450269699097, "rewards/distinct_2/std": 0.03296534717082977, "rewards/total_composite/mean": 0.24361778795719147, "rewards/total_composite/std": 0.1561136245727539, "reward": 0.24361778795719147, "reward_std": 0.1561136096715927, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16222620010375977, "sampling/sampling_logp_difference/max": 1.6206461191177368, "sampling/importance_sampling_ratio/min": 0.1977708786725998, "sampling/importance_sampling_ratio/mean": 0.9903451204299927, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3137017339468002, "clip_ratio/low_mean": 0.06880779284983873, "clip_ratio/low_min": 0.06880779284983873, "clip_ratio/high_mean": 0.0771570224314928, "clip_ratio/high_max": 0.0771570224314928, "clip_ratio/region_mean": 0.14596481528133154, "reward_total_mean": 0.24361778795719147, "reward_meter_mean": 0.6617354154586792, "reward_meter_std": 0.25543513894081116, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9628397226333618, "reward_lexical_plausibility_std": 0.1051052063703537, "reward_repeat_penalty_mean": 0.9738050699234009, "reward_repeat_penalty_std": 0.04037882015109062, "reward_near_duplicate_penalty_mean": 0.9850949645042419, "reward_near_duplicate_penalty_std": 0.013675507158041, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9883450269699097, "reward_distinct_2_std": 0.03296534717082977, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.24361778795719147, "reward_total_composite_std": 0.1561136245727539} {"timestamp_utc": "2026-04-12T12:53:02Z", "mode": "train", "global_step": 544, "epoch": 0.02185002209101498, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 8.354545454545455e-06, "num_tokens": 1091265.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.9187072515487671, "rewards/meter/std": 0.09112033993005753, "rewards/count_adherence/mean": 0.9342105388641357, "rewards/count_adherence/std": 0.06745999306440353, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.4728279113769531, "rewards/near_duplicate_penalty/std": 0.13525299727916718, "rewards/opening_diversity/mean": 0.6840425133705139, "rewards/opening_diversity/std": 0.21817994117736816, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14112301170825958, "rewards/total_composite/std": 0.04260226711630821, "reward": 0.14112301170825958, "reward_std": 0.042602263391017914, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.14112301170825958, "reward_meter_mean": 0.9187072515487671, "reward_meter_std": 0.09112033993005753, "reward_count_adherence_mean": 0.9342105388641357, "reward_count_adherence_std": 0.06745999306440353, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.4728279113769531, "reward_near_duplicate_penalty_std": 0.13525299727916718, "reward_opening_diversity_mean": 0.6840425133705139, "reward_opening_diversity_std": 0.21817994117736816, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.14112301170825958, "reward_total_composite_std": 0.04260226711630821} {"timestamp_utc": "2026-04-12T12:53:12Z", "mode": "train", "global_step": 545, "epoch": 0.021890187572799934, "loss": 0.0616, "grad_norm": 13.080174446105957, "learning_rate": 8.351515151515152e-06, "num_tokens": 1092848.0, "completions/mean_length": 41.875, "completions/min_length": 37.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.6356033086776733, "rewards/meter/std": 0.3513253331184387, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9848418235778809, "rewards/repeat_penalty/std": 0.013436457142233849, "rewards/near_duplicate_penalty/mean": 0.9848418235778809, "rewards/near_duplicate_penalty/std": 0.013436457142233849, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4831591546535492, "rewards/total_composite/std": 0.3251233994960785, "reward": 0.4831591546535492, "reward_std": 0.3251233994960785, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.162849560379982, "sampling/sampling_logp_difference/max": 1.457371711730957, "sampling/importance_sampling_ratio/min": 0.2328474521636963, "sampling/importance_sampling_ratio/mean": 1.0163511037826538, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1603094786405563, "clip_ratio/low_mean": 0.09493415802717209, "clip_ratio/low_min": 0.09493415802717209, "clip_ratio/high_mean": 0.050484295934438705, "clip_ratio/high_max": 0.050484295934438705, "clip_ratio/region_mean": 0.1454184539616108, "reward_total_mean": 0.4831591546535492, "reward_meter_mean": 0.6356033086776733, "reward_meter_std": 0.3513253331184387, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9848418235778809, "reward_repeat_penalty_std": 0.013436457142233849, "reward_near_duplicate_penalty_mean": 0.9848418235778809, "reward_near_duplicate_penalty_std": 0.013436457142233849, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.4831591546535492, "reward_total_composite_std": 0.3251233994960785} {"timestamp_utc": "2026-04-12T12:53:27Z", "mode": "train", "global_step": 546, "epoch": 0.02193035305458489, "loss": -0.0296, "grad_norm": 6.41250467300415, "learning_rate": 8.348484848484849e-06, "num_tokens": 1094288.0, "completions/mean_length": 103.0, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.57143020629883, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.4175654649734497, "rewards/meter/std": 0.4242997169494629, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9850408434867859, "rewards/lexical_plausibility/std": 0.042310841381549835, "rewards/judge_quality/mean": 0.5600000619888306, "rewards/judge_quality/std": 0.39402684569358826, "rewards/repeat_penalty/mean": 0.8592712879180908, "rewards/repeat_penalty/std": 0.25859907269477844, "rewards/near_duplicate_penalty/mean": 0.960735559463501, "rewards/near_duplicate_penalty/std": 0.06616660207509995, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.952729344367981, "rewards/distinct_2/std": 0.1289743185043335, "rewards/total_composite/mean": 0.2499169409275055, "rewards/total_composite/std": 0.36938366293907166, "reward": 0.2499169409275055, "reward_std": 0.36938366293907166, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1582486778497696, "sampling/sampling_logp_difference/max": 2.2328763008117676, "sampling/importance_sampling_ratio/min": 0.10721959173679352, "sampling/importance_sampling_ratio/mean": 1.0251611471176147, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9267575144767761, "clip_ratio/low_mean": 0.07908797264099121, "clip_ratio/low_min": 0.07908797264099121, "clip_ratio/high_mean": 0.03888889029622078, "clip_ratio/high_max": 0.03888889029622078, "clip_ratio/region_mean": 0.11797686293721199, "reward_total_mean": 0.2499169409275055, "reward_meter_mean": 0.4175654649734497, "reward_meter_std": 0.4242997169494629, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9850408434867859, "reward_lexical_plausibility_std": 0.042310841381549835, "reward_repeat_penalty_mean": 0.8592712879180908, "reward_repeat_penalty_std": 0.25859907269477844, "reward_near_duplicate_penalty_mean": 0.960735559463501, "reward_near_duplicate_penalty_std": 0.06616660207509995, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.952729344367981, "reward_distinct_2_std": 0.1289743185043335, "reward_judge_quality_mean": 0.5600000619888306, "reward_judge_quality_std": 0.39402684569358826, "reward_total_composite_mean": 0.2499169409275055, "reward_total_composite_std": 0.36938366293907166} {"timestamp_utc": "2026-04-12T12:53:41Z", "mode": "train", "global_step": 547, "epoch": 0.021970518536369842, "loss": -0.1237, "grad_norm": 4.194162368774414, "learning_rate": 8.345454545454546e-06, "num_tokens": 1096002.0, "completions/mean_length": 114.25, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.42857360839844, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.777793824672699, "rewards/meter/std": 0.320039838552475, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9824602603912354, "rewards/lexical_plausibility/std": 0.0496099591255188, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.28972893953323364, "rewards/repeat_penalty/mean": 0.8999760150909424, "rewards/repeat_penalty/std": 0.17061437666416168, "rewards/near_duplicate_penalty/mean": 0.9790429472923279, "rewards/near_duplicate_penalty/std": 0.03674924373626709, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.971382737159729, "rewards/distinct_2/std": 0.05943568795919418, "rewards/total_composite/mean": 0.3156241774559021, "rewards/total_composite/std": 0.1547367125749588, "reward": 0.3156241774559021, "reward_std": 0.1547366827726364, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14931762218475342, "sampling/sampling_logp_difference/max": 1.6100870370864868, "sampling/importance_sampling_ratio/min": 0.19987021386623383, "sampling/importance_sampling_ratio/mean": 1.0040839910507202, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9953689277172089, "clip_ratio/low_mean": 0.0190677959471941, "clip_ratio/low_min": 0.0190677959471941, "clip_ratio/high_mean": 0.1263645440340042, "clip_ratio/high_max": 0.1263645440340042, "clip_ratio/region_mean": 0.1454323399811983, "reward_total_mean": 0.3156241774559021, "reward_meter_mean": 0.777793824672699, "reward_meter_std": 0.320039838552475, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9824602603912354, "reward_lexical_plausibility_std": 0.0496099591255188, "reward_repeat_penalty_mean": 0.8999760150909424, "reward_repeat_penalty_std": 0.17061437666416168, "reward_near_duplicate_penalty_mean": 0.9790429472923279, "reward_near_duplicate_penalty_std": 0.03674924373626709, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.971382737159729, "reward_distinct_2_std": 0.05943568795919418, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.28972893953323364, "reward_total_composite_mean": 0.3156241774559021, "reward_total_composite_std": 0.1547367125749588} {"timestamp_utc": "2026-04-12T12:53:50Z", "mode": "train", "global_step": 548, "epoch": 0.022010684018154796, "loss": 0.0532, "grad_norm": 15.030717849731445, "learning_rate": 8.342424242424244e-06, "num_tokens": 1097629.0, "completions/mean_length": 46.375, "completions/min_length": 39.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.375, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.8358132243156433, "rewards/meter/std": 0.2915712296962738, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6087499856948853, "rewards/judge_quality/std": 0.24930977821350098, "rewards/repeat_penalty/mean": 0.9405306577682495, "rewards/repeat_penalty/std": 0.15187403559684753, "rewards/near_duplicate_penalty/mean": 0.9794235825538635, "rewards/near_duplicate_penalty/std": 0.04282815009355545, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.48486417531967163, "rewards/total_composite/std": 0.2695642411708832, "reward": 0.48486417531967163, "reward_std": 0.2695642411708832, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16091519594192505, "sampling/sampling_logp_difference/max": 2.071469783782959, "sampling/importance_sampling_ratio/min": 0.12600044906139374, "sampling/importance_sampling_ratio/mean": 1.0105230808258057, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2028623595833778, "clip_ratio/low_mean": 0.09606942720711231, "clip_ratio/low_min": 0.09606942720711231, "clip_ratio/high_mean": 0.04661835730075836, "clip_ratio/high_max": 0.04661835730075836, "clip_ratio/region_mean": 0.14268778450787067, "reward_total_mean": 0.48486417531967163, "reward_meter_mean": 0.8358132243156433, "reward_meter_std": 0.2915712296962738, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9405306577682495, "reward_repeat_penalty_std": 0.15187403559684753, "reward_near_duplicate_penalty_mean": 0.9794235825538635, "reward_near_duplicate_penalty_std": 0.04282815009355545, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.6087499856948853, "reward_judge_quality_std": 0.24930977821350098, "reward_total_composite_mean": 0.48486417531967163, "reward_total_composite_std": 0.2695642411708832} {"timestamp_utc": "2026-04-12T12:54:04Z", "mode": "train", "global_step": 549, "epoch": 0.02205084949993975, "loss": -0.0953, "grad_norm": 1.6906237602233887, "learning_rate": 8.339393939393941e-06, "num_tokens": 1099190.0, "completions/mean_length": 349.125, "completions/min_length": 72.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 77.66667175292969, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.4822614789009094, "rewards/meter/std": 0.342801034450531, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8447681665420532, "rewards/lexical_plausibility/std": 0.13131478428840637, "rewards/judge_quality/mean": 0.25874999165534973, "rewards/judge_quality/std": 0.30898162722587585, "rewards/repeat_penalty/mean": 0.9817433953285217, "rewards/repeat_penalty/std": 0.0381956622004509, "rewards/near_duplicate_penalty/mean": 0.993170976638794, "rewards/near_duplicate_penalty/std": 0.009107104502618313, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9883450269699097, "rewards/distinct_2/std": 0.03296534717082977, "rewards/total_composite/mean": 0.09634813666343689, "rewards/total_composite/std": 0.1397472321987152, "reward": 0.09634813666343689, "reward_std": 0.13974721729755402, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1432182788848877, "sampling/sampling_logp_difference/max": 1.026468276977539, "sampling/importance_sampling_ratio/min": 0.3582700490951538, "sampling/importance_sampling_ratio/mean": 1.0189342498779297, "sampling/importance_sampling_ratio/max": 1.7254616022109985, "entropy": 0.4322194755077362, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.06151787377893925, "clip_ratio/high_max": 0.06151787377893925, "clip_ratio/region_mean": 0.06151787377893925, "reward_total_mean": 0.09634813666343689, "reward_meter_mean": 0.4822614789009094, "reward_meter_std": 0.342801034450531, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8447681665420532, "reward_lexical_plausibility_std": 0.13131478428840637, "reward_repeat_penalty_mean": 0.9817433953285217, "reward_repeat_penalty_std": 0.0381956622004509, "reward_near_duplicate_penalty_mean": 0.993170976638794, "reward_near_duplicate_penalty_std": 0.009107104502618313, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9883450269699097, "reward_distinct_2_std": 0.03296534717082977, "reward_judge_quality_mean": 0.25874999165534973, "reward_judge_quality_std": 0.30898162722587585, "reward_total_composite_mean": 0.09634813666343689, "reward_total_composite_std": 0.1397472321987152} {"timestamp_utc": "2026-04-12T12:54:19Z", "mode": "train", "global_step": 550, "epoch": 0.022091014981724704, "loss": -0.0697, "grad_norm": 6.1772990226745605, "learning_rate": 8.336363636363636e-06, "num_tokens": 1100997.0, "completions/mean_length": 117.875, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.57143020629883, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.5366573333740234, "rewards/meter/std": 0.2995971739292145, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.3563483655452728, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9671957492828369, "rewards/lexical_plausibility/std": 0.0927843302488327, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9931343197822571, "rewards/repeat_penalty/std": 0.007398698944598436, "rewards/near_duplicate_penalty/mean": 0.9931343197822571, "rewards/near_duplicate_penalty/std": 0.007398698944598436, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20977303385734558, "rewards/total_composite/std": 0.11658559739589691, "reward": 0.20977303385734558, "reward_std": 0.11658558994531631, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17950139939785004, "sampling/sampling_logp_difference/max": 1.9874672889709473, "sampling/importance_sampling_ratio/min": 0.13972559571266174, "sampling/importance_sampling_ratio/mean": 0.9971045255661011, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8207018300890923, "clip_ratio/low_mean": 0.06258048303425312, "clip_ratio/low_min": 0.06258048303425312, "clip_ratio/high_mean": 0.07775097154080868, "clip_ratio/high_max": 0.07775097154080868, "clip_ratio/region_mean": 0.1403314545750618, "reward_total_mean": 0.20977303385734558, "reward_meter_mean": 0.5366573333740234, "reward_meter_std": 0.2995971739292145, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.3563483655452728, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9671957492828369, "reward_lexical_plausibility_std": 0.0927843302488327, "reward_repeat_penalty_mean": 0.9931343197822571, "reward_repeat_penalty_std": 0.007398698944598436, "reward_near_duplicate_penalty_mean": 0.9931343197822571, "reward_near_duplicate_penalty_std": 0.007398698944598436, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.20977303385734558, "reward_total_composite_std": 0.11658559739589691} {"timestamp_utc": "2026-04-12T12:56:51Z", "mode": "eval", "global_step": 550, "epoch": 0.022091014981724704, "eval_loss": NaN, "eval_runtime": 152.1646, "eval_samples_per_second": 0.683, "eval_steps_per_second": 0.085, "eval_num_tokens": 1100997.0, "eval_completions/mean_length": 220.76923076923077, "eval_completions/min_length": 43.84615384615385, "eval_completions/max_length": 500.0769230769231, "eval_completions/clipped_ratio": 0.16346153846153846, "eval_completions/mean_terminated_length": 161.85723935640775, "eval_completions/min_terminated_length": 43.84615384615385, "eval_completions/max_terminated_length": 363.53846153846155, "eval_rewards/meter/mean": 0.586402918283756, "eval_rewards/meter/std": 0.36957008563555205, "eval_rewards/count_adherence/mean": 0.8603702325087327, "eval_rewards/count_adherence/std": 0.2073669834778859, "eval_rewards/arabic_clean/mean": 0.8365384615384616, "eval_rewards/arabic_clean/std": 0.2693372047864474, "eval_rewards/lexical_plausibility/mean": 0.9697205057510963, "eval_rewards/lexical_plausibility/std": 0.0657596132503106, "eval_rewards/judge_quality/mean": 0.356730770606261, "eval_rewards/judge_quality/std": 0.22836716014605302, "eval_rewards/repeat_penalty/mean": 0.6280048993917612, "eval_rewards/repeat_penalty/std": 0.410148391356835, "eval_rewards/near_duplicate_penalty/mean": 0.8681904627726629, "eval_rewards/near_duplicate_penalty/std": 0.18287275760219648, "eval_rewards/opening_diversity/mean": 0.9148014187812805, "eval_rewards/opening_diversity/std": 0.17345992848277092, "eval_rewards/distinct_2/mean": 0.6751560202011695, "eval_rewards/distinct_2/std": 0.41054011422854203, "eval_rewards/total_composite/mean": 0.17228719764030898, "eval_rewards/total_composite/std": 0.17016129195690155, "eval_reward": 0.17228719764030898, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.05730216749585592, "eval_sampling/sampling_logp_difference/max": 1.1263794532189002, "eval_sampling/importance_sampling_ratio/min": 0.3301447331905365, "eval_sampling/importance_sampling_ratio/mean": 1.0154129266738892, "eval_sampling/importance_sampling_ratio/max": 1.5247919009282038, "eval_entropy": 0.6868736079105964, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.17228719764030898, "eval_reward_meter_mean": 0.586402918283756, "eval_reward_meter_std": 0.36957008563555205, "eval_reward_count_adherence_mean": 0.8603702325087327, "eval_reward_count_adherence_std": 0.2073669834778859, "eval_reward_arabic_clean_mean": 0.8365384615384616, "eval_reward_arabic_clean_std": 0.2693372047864474, "eval_reward_lexical_plausibility_mean": 0.9697205057510963, "eval_reward_lexical_plausibility_std": 0.0657596132503106, "eval_reward_repeat_penalty_mean": 0.6280048993917612, "eval_reward_repeat_penalty_std": 0.410148391356835, "eval_reward_near_duplicate_penalty_mean": 0.8681904627726629, "eval_reward_near_duplicate_penalty_std": 0.18287275760219648, "eval_reward_opening_diversity_mean": 0.9148014187812805, "eval_reward_opening_diversity_std": 0.17345992848277092, "eval_reward_distinct_2_mean": 0.6751560202011695, "eval_reward_distinct_2_std": 0.41054011422854203, "eval_reward_judge_quality_mean": 0.356730770606261, "eval_reward_judge_quality_std": 0.22836716014605302, "eval_reward_total_composite_mean": 0.17228719764030898, "eval_reward_total_composite_std": 0.17016129195690155} {"timestamp_utc": "2026-04-12T12:57:08Z", "mode": "train", "global_step": 551, "epoch": 0.02213118046350966, "loss": -0.153, "grad_norm": 2.5289623737335205, "learning_rate": 8.333333333333334e-06, "num_tokens": 1103062.0, "completions/mean_length": 322.125, "completions/min_length": 116.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 132.25, "completions/min_terminated_length": 116.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.46613040566444397, "rewards/meter/std": 0.4457698166370392, "rewards/count_adherence/mean": 0.7250000238418579, "rewards/count_adherence/std": 0.3011881411075592, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8561485409736633, "rewards/lexical_plausibility/std": 0.15561705827713013, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.3165184557437897, "rewards/repeat_penalty/mean": 0.9961950778961182, "rewards/repeat_penalty/std": 0.004838768858462572, "rewards/near_duplicate_penalty/mean": 0.9961950778961182, "rewards/near_duplicate_penalty/std": 0.004838768858462572, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24493418633937836, "rewards/total_composite/std": 0.3308947682380676, "reward": 0.24493418633937836, "reward_std": 0.3308947682380676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.181468665599823, "sampling/sampling_logp_difference/max": 1.959695816040039, "sampling/importance_sampling_ratio/min": 0.14090128242969513, "sampling/importance_sampling_ratio/mean": 1.038630723953247, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.803390696644783, "clip_ratio/low_mean": 0.02822580561041832, "clip_ratio/low_min": 0.02822580561041832, "clip_ratio/high_mean": 0.06060313992202282, "clip_ratio/high_max": 0.06060313992202282, "clip_ratio/region_mean": 0.08882894553244114, "reward_total_mean": 0.24493418633937836, "reward_meter_mean": 0.46613040566444397, "reward_meter_std": 0.4457698166370392, "reward_count_adherence_mean": 0.7250000238418579, "reward_count_adherence_std": 0.3011881411075592, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8561485409736633, "reward_lexical_plausibility_std": 0.15561705827713013, "reward_repeat_penalty_mean": 0.9961950778961182, "reward_repeat_penalty_std": 0.004838768858462572, "reward_near_duplicate_penalty_mean": 0.9961950778961182, "reward_near_duplicate_penalty_std": 0.004838768858462572, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.3165184557437897, "reward_total_composite_mean": 0.24493418633937836, "reward_total_composite_std": 0.3308947682380676} {"timestamp_utc": "2026-04-12T12:57:22Z", "mode": "train", "global_step": 552, "epoch": 0.022171345945294615, "loss": -0.0378, "grad_norm": 2.1509552001953125, "learning_rate": 8.330303030303031e-06, "num_tokens": 1104403.0, "completions/mean_length": 143.625, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 20.83333396911621, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.7479416728019714, "rewards/meter/std": 0.4325871467590332, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.904184877872467, "rewards/lexical_plausibility/std": 0.13383860886096954, "rewards/judge_quality/mean": 0.35500001907348633, "rewards/judge_quality/std": 0.36245197057724, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3364430069923401, "rewards/total_composite/std": 0.3685567080974579, "reward": 0.3364430069923401, "reward_std": 0.3685566782951355, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15116764605045319, "sampling/sampling_logp_difference/max": 1.1842036247253418, "sampling/importance_sampling_ratio/min": 0.3059897720813751, "sampling/importance_sampling_ratio/mean": 1.0206120014190674, "sampling/importance_sampling_ratio/max": 1.8944429159164429, "entropy": 0.9859093278646469, "clip_ratio/low_mean": 0.06148950941860676, "clip_ratio/low_min": 0.06148950941860676, "clip_ratio/high_mean": 0.04861742490902543, "clip_ratio/high_max": 0.04861742490902543, "clip_ratio/region_mean": 0.11010693432763219, "reward_total_mean": 0.3364430069923401, "reward_meter_mean": 0.7479416728019714, "reward_meter_std": 0.4325871467590332, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.904184877872467, "reward_lexical_plausibility_std": 0.13383860886096954, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35500001907348633, "reward_judge_quality_std": 0.36245197057724, "reward_total_composite_mean": 0.3364430069923401, "reward_total_composite_std": 0.3685567080974579} {"timestamp_utc": "2026-04-12T12:57:32Z", "mode": "train", "global_step": 553, "epoch": 0.02221151142707957, "loss": 0.015, "grad_norm": 10.721797943115234, "learning_rate": 8.327272727272728e-06, "num_tokens": 1106621.0, "completions/mean_length": 92.25, "completions/min_length": 83.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 92.25, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.7491284608840942, "rewards/meter/std": 0.38307100534439087, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.7934159636497498, "rewards/repeat_penalty/std": 0.2530416250228882, "rewards/near_duplicate_penalty/mean": 0.9466469287872314, "rewards/near_duplicate_penalty/std": 0.047068409621715546, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.8599124550819397, "rewards/distinct_2/std": 0.18166913092136383, "rewards/total_composite/mean": 0.383758544921875, "rewards/total_composite/std": 0.2166719138622284, "reward": 0.383758544921875, "reward_std": 0.2166719138622284, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1297183632850647, "sampling/sampling_logp_difference/max": 2.2496402263641357, "sampling/importance_sampling_ratio/min": 0.10543715208768845, "sampling/importance_sampling_ratio/mean": 1.00994873046875, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9048366099596024, "clip_ratio/low_mean": 0.041222899220883846, "clip_ratio/low_min": 0.041222899220883846, "clip_ratio/high_mean": 0.08313542697578669, "clip_ratio/high_max": 0.08313542697578669, "clip_ratio/region_mean": 0.12435832619667053, "reward_total_mean": 0.383758544921875, "reward_meter_mean": 0.7491284608840942, "reward_meter_std": 0.38307100534439087, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7934159636497498, "reward_repeat_penalty_std": 0.2530416250228882, "reward_near_duplicate_penalty_mean": 0.9466469287872314, "reward_near_duplicate_penalty_std": 0.047068409621715546, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.8599124550819397, "reward_distinct_2_std": 0.18166913092136383, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.383758544921875, "reward_total_composite_std": 0.2166719138622284} {"timestamp_utc": "2026-04-12T12:57:46Z", "mode": "train", "global_step": 554, "epoch": 0.022251676908864523, "loss": -0.0139, "grad_norm": 6.465330123901367, "learning_rate": 8.324242424242425e-06, "num_tokens": 1108361.0, "completions/mean_length": 103.5, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.142860412597656, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.5443894267082214, "rewards/meter/std": 0.4058128297328949, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9611461162567139, "rewards/lexical_plausibility/std": 0.1098954826593399, "rewards/judge_quality/mean": 0.4674999713897705, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.9838154315948486, "rewards/repeat_penalty/std": 0.029549043625593185, "rewards/near_duplicate_penalty/mean": 0.9838154315948486, "rewards/near_duplicate_penalty/std": 0.029549043625593185, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31255239248275757, "rewards/total_composite/std": 0.32128313183784485, "reward": 0.31255239248275757, "reward_std": 0.32128313183784485, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1777176856994629, "sampling/sampling_logp_difference/max": 1.831413745880127, "sampling/importance_sampling_ratio/min": 0.16018694639205933, "sampling/importance_sampling_ratio/mean": 0.9967982769012451, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.195886306464672, "clip_ratio/low_mean": 0.04569301754236221, "clip_ratio/low_min": 0.04569301754236221, "clip_ratio/high_mean": 0.08483864553272724, "clip_ratio/high_max": 0.08483864553272724, "clip_ratio/region_mean": 0.13053166307508945, "reward_total_mean": 0.31255239248275757, "reward_meter_mean": 0.5443894267082214, "reward_meter_std": 0.4058128297328949, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9611461162567139, "reward_lexical_plausibility_std": 0.1098954826593399, "reward_repeat_penalty_mean": 0.9838154315948486, "reward_repeat_penalty_std": 0.029549043625593185, "reward_near_duplicate_penalty_mean": 0.9838154315948486, "reward_near_duplicate_penalty_std": 0.029549043625593185, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4674999713897705, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.31255239248275757, "reward_total_composite_std": 0.32128313183784485} {"timestamp_utc": "2026-04-12T12:57:59Z", "mode": "train", "global_step": 555, "epoch": 0.022291842390649477, "loss": -0.0185, "grad_norm": 2.847667694091797, "learning_rate": 8.321212121212123e-06, "num_tokens": 1109962.0, "completions/mean_length": 156.125, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.4670912027359009, "rewards/meter/std": 0.38299253582954407, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9493948221206665, "rewards/lexical_plausibility/std": 0.08566834032535553, "rewards/judge_quality/mean": 0.35500001907348633, "rewards/judge_quality/std": 0.3702508807182312, "rewards/repeat_penalty/mean": 0.9581513404846191, "rewards/repeat_penalty/std": 0.08587849885225296, "rewards/near_duplicate_penalty/mean": 0.9894013404846191, "rewards/near_duplicate_penalty/std": 0.017879048362374306, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27249038219451904, "rewards/total_composite/std": 0.3778645992279053, "reward": 0.27249038219451904, "reward_std": 0.3778645992279053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19672834873199463, "sampling/sampling_logp_difference/max": 1.9538183212280273, "sampling/importance_sampling_ratio/min": 0.141731858253479, "sampling/importance_sampling_ratio/mean": 1.0331724882125854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.115730993449688, "clip_ratio/low_mean": 0.06789673119783401, "clip_ratio/low_min": 0.06789673119783401, "clip_ratio/high_mean": 0.05420168302953243, "clip_ratio/high_max": 0.05420168302953243, "clip_ratio/region_mean": 0.12209841422736645, "reward_total_mean": 0.27249038219451904, "reward_meter_mean": 0.4670912027359009, "reward_meter_std": 0.38299253582954407, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9493948221206665, "reward_lexical_plausibility_std": 0.08566834032535553, "reward_repeat_penalty_mean": 0.9581513404846191, "reward_repeat_penalty_std": 0.08587849885225296, "reward_near_duplicate_penalty_mean": 0.9894013404846191, "reward_near_duplicate_penalty_std": 0.017879048362374306, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35500001907348633, "reward_judge_quality_std": 0.3702508807182312, "reward_total_composite_mean": 0.27249038219451904, "reward_total_composite_std": 0.3778645992279053} {"timestamp_utc": "2026-04-12T12:58:14Z", "mode": "train", "global_step": 556, "epoch": 0.02233200787243443, "loss": -0.0601, "grad_norm": 5.946819305419922, "learning_rate": 8.318181818181818e-06, "num_tokens": 1111609.0, "completions/mean_length": 112.875, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 55.857147216796875, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.7880343198776245, "rewards/meter/std": 0.3344355523586273, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.97159743309021, "rewards/lexical_plausibility/std": 0.08033450692892075, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.2121320366859436, "rewards/repeat_penalty/mean": 0.9598750472068787, "rewards/repeat_penalty/std": 0.060713496059179306, "rewards/near_duplicate_penalty/mean": 0.9663456082344055, "rewards/near_duplicate_penalty/std": 0.04469338804483414, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.29991233348846436, "rewards/total_composite/std": 0.2478688359260559, "reward": 0.29991233348846436, "reward_std": 0.24786882102489471, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15547391772270203, "sampling/sampling_logp_difference/max": 4.527191162109375, "sampling/importance_sampling_ratio/min": 0.01081099919974804, "sampling/importance_sampling_ratio/mean": 1.015523910522461, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0464322119951248, "clip_ratio/low_mean": 0.04002866800874472, "clip_ratio/low_min": 0.04002866800874472, "clip_ratio/high_mean": 0.07212395314127207, "clip_ratio/high_max": 0.07212395314127207, "clip_ratio/region_mean": 0.11215262115001678, "reward_total_mean": 0.29991233348846436, "reward_meter_mean": 0.7880343198776245, "reward_meter_std": 0.3344355523586273, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.97159743309021, "reward_lexical_plausibility_std": 0.08033450692892075, "reward_repeat_penalty_mean": 0.9598750472068787, "reward_repeat_penalty_std": 0.060713496059179306, "reward_near_duplicate_penalty_mean": 0.9663456082344055, "reward_near_duplicate_penalty_std": 0.04469338804483414, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.2121320366859436, "reward_total_composite_mean": 0.29991233348846436, "reward_total_composite_std": 0.2478688359260559} {"timestamp_utc": "2026-04-12T12:58:28Z", "mode": "train", "global_step": 557, "epoch": 0.022372173354219385, "loss": -0.1467, "grad_norm": 3.1522791385650635, "learning_rate": 8.315151515151516e-06, "num_tokens": 1114457.0, "completions/mean_length": 287.0, "completions/min_length": 191.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 212.0, "completions/min_terminated_length": 191.0, "completions/max_terminated_length": 220.0, "rewards/meter/mean": 0.8281444907188416, "rewards/meter/std": 0.3313653767108917, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.23857837915420532, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9543272256851196, "rewards/lexical_plausibility/std": 0.12918205559253693, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.08345229923725128, "rewards/repeat_penalty/mean": 0.2222694456577301, "rewards/repeat_penalty/std": 0.3289700150489807, "rewards/near_duplicate_penalty/mean": 0.7726292014122009, "rewards/near_duplicate_penalty/std": 0.1233188584446907, "rewards/opening_diversity/mean": 0.7336647510528564, "rewards/opening_diversity/std": 0.29618027806282043, "rewards/distinct_2/mean": 0.2857621908187866, "rewards/distinct_2/std": 0.33399727940559387, "rewards/total_composite/mean": 0.13144192099571228, "rewards/total_composite/std": 0.09727711230516434, "reward": 0.13144192099571228, "reward_std": 0.09727711230516434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07713959366083145, "sampling/sampling_logp_difference/max": 1.5861306190490723, "sampling/importance_sampling_ratio/min": 0.20471620559692383, "sampling/importance_sampling_ratio/mean": 1.0107210874557495, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3740359880030155, "clip_ratio/low_mean": 0.03940075542777777, "clip_ratio/low_min": 0.03940075542777777, "clip_ratio/high_mean": 0.007198953069746494, "clip_ratio/high_max": 0.007198953069746494, "clip_ratio/region_mean": 0.04659970849752426, "reward_total_mean": 0.13144192099571228, "reward_meter_mean": 0.8281444907188416, "reward_meter_std": 0.3313653767108917, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.23857837915420532, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9543272256851196, "reward_lexical_plausibility_std": 0.12918205559253693, "reward_repeat_penalty_mean": 0.2222694456577301, "reward_repeat_penalty_std": 0.3289700150489807, "reward_near_duplicate_penalty_mean": 0.7726292014122009, "reward_near_duplicate_penalty_std": 0.1233188584446907, "reward_opening_diversity_mean": 0.7336647510528564, "reward_opening_diversity_std": 0.29618027806282043, "reward_distinct_2_mean": 0.2857621908187866, "reward_distinct_2_std": 0.33399727940559387, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.08345229923725128, "reward_total_composite_mean": 0.13144192099571228, "reward_total_composite_std": 0.09727711230516434} {"timestamp_utc": "2026-04-12T12:58:43Z", "mode": "train", "global_step": 558, "epoch": 0.02241233883600434, "loss": -0.0201, "grad_norm": 2.0149505138397217, "learning_rate": 8.312121212121213e-06, "num_tokens": 1115897.0, "completions/mean_length": 284.0, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 56.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.1431046426296234, "rewards/meter/std": 0.1524447649717331, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.81473308801651, "rewards/lexical_plausibility/std": 0.1614583134651184, "rewards/judge_quality/mean": 0.32124999165534973, "rewards/judge_quality/std": 0.39248064160346985, "rewards/repeat_penalty/mean": 0.9664043188095093, "rewards/repeat_penalty/std": 0.08752123266458511, "rewards/near_duplicate_penalty/mean": 0.998210072517395, "rewards/near_duplicate_penalty/std": 0.0038493694737553596, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9994441866874695, "rewards/distinct_2/std": 0.0015720564406365156, "rewards/total_composite/mean": 0.03383456915616989, "rewards/total_composite/std": 0.055616602301597595, "reward": 0.03383456915616989, "reward_std": 0.055616602301597595, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19366790354251862, "sampling/sampling_logp_difference/max": 1.7451801300048828, "sampling/importance_sampling_ratio/min": 0.17461352050304413, "sampling/importance_sampling_ratio/mean": 1.0661776065826416, "sampling/importance_sampling_ratio/max": 1.874167799949646, "entropy": 1.338733822107315, "clip_ratio/low_mean": 0.018018018454313278, "clip_ratio/low_min": 0.018018018454313278, "clip_ratio/high_mean": 0.03905075276270509, "clip_ratio/high_max": 0.03905075276270509, "clip_ratio/region_mean": 0.057068771217018366, "reward_total_mean": 0.03383456915616989, "reward_meter_mean": 0.1431046426296234, "reward_meter_std": 0.1524447649717331, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.81473308801651, "reward_lexical_plausibility_std": 0.1614583134651184, "reward_repeat_penalty_mean": 0.9664043188095093, "reward_repeat_penalty_std": 0.08752123266458511, "reward_near_duplicate_penalty_mean": 0.998210072517395, "reward_near_duplicate_penalty_std": 0.0038493694737553596, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9994441866874695, "reward_distinct_2_std": 0.0015720564406365156, "reward_judge_quality_mean": 0.32124999165534973, "reward_judge_quality_std": 0.39248064160346985, "reward_total_composite_mean": 0.03383456915616989, "reward_total_composite_std": 0.055616602301597595} {"timestamp_utc": "2026-04-12T12:58:57Z", "mode": "train", "global_step": 559, "epoch": 0.022452504317789293, "loss": 0.0633, "grad_norm": 7.030700206756592, "learning_rate": 8.30909090909091e-06, "num_tokens": 1119461.0, "completions/mean_length": 227.5, "completions/min_length": 193.0, "completions/max_length": 252.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 227.5, "completions/min_terminated_length": 193.0, "completions/max_terminated_length": 252.0, "rewards/meter/mean": 0.7596148252487183, "rewards/meter/std": 0.25658178329467773, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.5238463282585144, "rewards/repeat_penalty/std": 0.29744085669517517, "rewards/near_duplicate_penalty/mean": 0.8949508666992188, "rewards/near_duplicate_penalty/std": 0.08561544865369797, "rewards/opening_diversity/mean": 0.9479166865348816, "rewards/opening_diversity/std": 0.11732383072376251, "rewards/distinct_2/mean": 0.6009258031845093, "rewards/distinct_2/std": 0.2808225154876709, "rewards/total_composite/mean": 0.2752179503440857, "rewards/total_composite/std": 0.10091891139745712, "reward": 0.2752179503440857, "reward_std": 0.10091891139745712, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1394757479429245, "sampling/sampling_logp_difference/max": 3.015350580215454, "sampling/importance_sampling_ratio/min": 0.04902864247560501, "sampling/importance_sampling_ratio/mean": 1.0008983612060547, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7444732151925564, "clip_ratio/low_mean": 0.04241620097309351, "clip_ratio/low_min": 0.04241620097309351, "clip_ratio/high_mean": 0.08743564877659082, "clip_ratio/high_max": 0.08743564877659082, "clip_ratio/region_mean": 0.12985184974968433, "reward_total_mean": 0.2752179503440857, "reward_meter_mean": 0.7596148252487183, "reward_meter_std": 0.25658178329467773, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5238463282585144, "reward_repeat_penalty_std": 0.29744085669517517, "reward_near_duplicate_penalty_mean": 0.8949508666992188, "reward_near_duplicate_penalty_std": 0.08561544865369797, "reward_opening_diversity_mean": 0.9479166865348816, "reward_opening_diversity_std": 0.11732383072376251, "reward_distinct_2_mean": 0.6009258031845093, "reward_distinct_2_std": 0.2808225154876709, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.2752179503440857, "reward_total_composite_std": 0.10091891139745712} {"timestamp_utc": "2026-04-12T12:59:12Z", "mode": "train", "global_step": 560, "epoch": 0.022492669799574247, "loss": -0.0894, "grad_norm": 4.5670037269592285, "learning_rate": 8.306060606060606e-06, "num_tokens": 1122889.0, "completions/mean_length": 279.5, "completions/min_length": 216.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 246.2857208251953, "completions/min_terminated_length": 216.0, "completions/max_terminated_length": 283.0, "rewards/meter/mean": 0.7371165752410889, "rewards/meter/std": 0.4074375331401825, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3110969364643097, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.961893618106842, "rewards/lexical_plausibility/std": 0.10778112709522247, "rewards/judge_quality/mean": 0.39375001192092896, "rewards/judge_quality/std": 0.20604698359966278, "rewards/repeat_penalty/mean": 0.7667455673217773, "rewards/repeat_penalty/std": 0.1332370489835739, "rewards/near_duplicate_penalty/mean": 0.9596879482269287, "rewards/near_duplicate_penalty/std": 0.022995855659246445, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8332638144493103, "rewards/distinct_2/std": 0.13802498579025269, "rewards/total_composite/mean": 0.3322353959083557, "rewards/total_composite/std": 0.2467871457338333, "reward": 0.3322353959083557, "reward_std": 0.2467871606349945, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15317615866661072, "sampling/sampling_logp_difference/max": 2.7960309982299805, "sampling/importance_sampling_ratio/min": 0.17604616284370422, "sampling/importance_sampling_ratio/mean": 1.0157796144485474, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8752892836928368, "clip_ratio/low_mean": 0.03733076713979244, "clip_ratio/low_min": 0.03733076713979244, "clip_ratio/high_mean": 0.08274878561496735, "clip_ratio/high_max": 0.08274878561496735, "clip_ratio/region_mean": 0.12007955275475979, "reward_total_mean": 0.3322353959083557, "reward_meter_mean": 0.7371165752410889, "reward_meter_std": 0.4074375331401825, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3110969364643097, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.961893618106842, "reward_lexical_plausibility_std": 0.10778112709522247, "reward_repeat_penalty_mean": 0.7667455673217773, "reward_repeat_penalty_std": 0.1332370489835739, "reward_near_duplicate_penalty_mean": 0.9596879482269287, "reward_near_duplicate_penalty_std": 0.022995855659246445, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8332638144493103, "reward_distinct_2_std": 0.13802498579025269, "reward_judge_quality_mean": 0.39375001192092896, "reward_judge_quality_std": 0.20604698359966278, "reward_total_composite_mean": 0.3322353959083557, "reward_total_composite_std": 0.2467871457338333} {"timestamp_utc": "2026-04-12T12:59:22Z", "mode": "train", "global_step": 561, "epoch": 0.0225328352813592, "loss": 0.0637, "grad_norm": 15.194409370422363, "learning_rate": 8.303030303030305e-06, "num_tokens": 1124482.0, "completions/mean_length": 46.125, "completions/min_length": 40.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.859315037727356, "rewards/meter/std": 0.23800811171531677, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9320663809776306, "rewards/lexical_plausibility/std": 0.16831834614276886, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.231084406375885, "rewards/repeat_penalty/mean": 0.9562109708786011, "rewards/repeat_penalty/std": 0.05390492081642151, "rewards/near_duplicate_penalty/mean": 0.9744315147399902, "rewards/near_duplicate_penalty/std": 0.02383003756403923, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807209968566895, "rewards/distinct_2/std": 0.0357571542263031, "rewards/total_composite/mean": 0.5776807069778442, "rewards/total_composite/std": 0.3228343427181244, "reward": 0.5776807069778442, "reward_std": 0.322834312915802, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17364515364170074, "sampling/sampling_logp_difference/max": 2.161709785461426, "sampling/importance_sampling_ratio/min": 0.11512810736894608, "sampling/importance_sampling_ratio/mean": 0.9876819849014282, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0650817900896072, "clip_ratio/low_mean": 0.061446020379662514, "clip_ratio/low_min": 0.061446020379662514, "clip_ratio/high_mean": 0.11508160457015038, "clip_ratio/high_max": 0.11508160457015038, "clip_ratio/region_mean": 0.1765276249498129, "reward_total_mean": 0.5776807069778442, "reward_meter_mean": 0.859315037727356, "reward_meter_std": 0.23800811171531677, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9320663809776306, "reward_lexical_plausibility_std": 0.16831834614276886, "reward_repeat_penalty_mean": 0.9562109708786011, "reward_repeat_penalty_std": 0.05390492081642151, "reward_near_duplicate_penalty_mean": 0.9744315147399902, "reward_near_duplicate_penalty_std": 0.02383003756403923, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807209968566895, "reward_distinct_2_std": 0.0357571542263031, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.231084406375885, "reward_total_composite_mean": 0.5776807069778442, "reward_total_composite_std": 0.3228343427181244} {"timestamp_utc": "2026-04-12T12:59:33Z", "mode": "train", "global_step": 562, "epoch": 0.022573000763144155, "loss": 0.0585, "grad_norm": 12.776339530944824, "learning_rate": 8.3e-06, "num_tokens": 1126206.0, "completions/mean_length": 52.5, "completions/min_length": 47.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.5, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6997398138046265, "rewards/meter/std": 0.3450835347175598, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6637499928474426, "rewards/judge_quality/std": 0.28465205430984497, "rewards/repeat_penalty/mean": 0.966732919216156, "rewards/repeat_penalty/std": 0.04837942123413086, "rewards/near_duplicate_penalty/mean": 0.9843859076499939, "rewards/near_duplicate_penalty/std": 0.02186666615307331, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9816849827766418, "rewards/distinct_2/std": 0.03391282260417938, "rewards/total_composite/mean": 0.4740862548351288, "rewards/total_composite/std": 0.33488765358924866, "reward": 0.4740862548351288, "reward_std": 0.33488768339157104, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16140180826187134, "sampling/sampling_logp_difference/max": 1.4580715894699097, "sampling/importance_sampling_ratio/min": 0.23268455266952515, "sampling/importance_sampling_ratio/mean": 1.0163640975952148, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1352339908480644, "clip_ratio/low_mean": 0.06900547398254275, "clip_ratio/low_min": 0.06900547398254275, "clip_ratio/high_mean": 0.05386254005134106, "clip_ratio/high_max": 0.05386254005134106, "clip_ratio/region_mean": 0.12286801403388381, "reward_total_mean": 0.4740862548351288, "reward_meter_mean": 0.6997398138046265, "reward_meter_std": 0.3450835347175598, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.966732919216156, "reward_repeat_penalty_std": 0.04837942123413086, "reward_near_duplicate_penalty_mean": 0.9843859076499939, "reward_near_duplicate_penalty_std": 0.02186666615307331, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9816849827766418, "reward_distinct_2_std": 0.03391282260417938, "reward_judge_quality_mean": 0.6637499928474426, "reward_judge_quality_std": 0.28465205430984497, "reward_total_composite_mean": 0.4740862548351288, "reward_total_composite_std": 0.33488765358924866} {"timestamp_utc": "2026-04-12T12:59:44Z", "mode": "train", "global_step": 563, "epoch": 0.02261316624492911, "loss": 0.0082, "grad_norm": 17.09084701538086, "learning_rate": 8.296969696969697e-06, "num_tokens": 1128294.0, "completions/mean_length": 87.0, "completions/min_length": 74.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.0, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.394396036863327, "rewards/meter/std": 0.2646758556365967, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.6897436380386353, "rewards/repeat_penalty/std": 0.2753545045852661, "rewards/near_duplicate_penalty/mean": 0.903167188167572, "rewards/near_duplicate_penalty/std": 0.08225918561220169, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.7783054113388062, "rewards/distinct_2/std": 0.20354458689689636, "rewards/total_composite/mean": 0.12317164987325668, "rewards/total_composite/std": 0.08558519929647446, "reward": 0.12317164987325668, "reward_std": 0.08558519929647446, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16062937676906586, "sampling/sampling_logp_difference/max": 2.943558692932129, "sampling/importance_sampling_ratio/min": 0.052677929401397705, "sampling/importance_sampling_ratio/mean": 1.0046311616897583, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6217370927333832, "clip_ratio/low_mean": 0.09821091499179602, "clip_ratio/low_min": 0.09821091499179602, "clip_ratio/high_mean": 0.04175998363643885, "clip_ratio/high_max": 0.04175998363643885, "clip_ratio/region_mean": 0.13997089862823486, "reward_total_mean": 0.12317164987325668, "reward_meter_mean": 0.394396036863327, "reward_meter_std": 0.2646758556365967, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6897436380386353, "reward_repeat_penalty_std": 0.2753545045852661, "reward_near_duplicate_penalty_mean": 0.903167188167572, "reward_near_duplicate_penalty_std": 0.08225918561220169, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.7783054113388062, "reward_distinct_2_std": 0.20354458689689636, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.12317164987325668, "reward_total_composite_std": 0.08558519929647446} {"timestamp_utc": "2026-04-12T13:00:00Z", "mode": "train", "global_step": 564, "epoch": 0.022653331726714063, "loss": -0.0646, "grad_norm": 3.1676385402679443, "learning_rate": 8.293939393939395e-06, "num_tokens": 1129835.0, "completions/mean_length": 161.625, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 44.833335876464844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.36686593294143677, "rewards/meter/std": 0.36617180705070496, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.944107711315155, "rewards/lexical_plausibility/std": 0.10829658061265945, "rewards/judge_quality/mean": 0.26500001549720764, "rewards/judge_quality/std": 0.29267242550849915, "rewards/repeat_penalty/mean": 0.9262036085128784, "rewards/repeat_penalty/std": 0.11174186319112778, "rewards/near_duplicate_penalty/mean": 0.9790786504745483, "rewards/near_duplicate_penalty/std": 0.03449733927845955, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9763580560684204, "rewards/distinct_2/std": 0.06364420056343079, "rewards/total_composite/mean": 0.07410462200641632, "rewards/total_composite/std": 0.07805755734443665, "reward": 0.07410462200641632, "reward_std": 0.07805755734443665, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14709855616092682, "sampling/sampling_logp_difference/max": 1.3158307075500488, "sampling/importance_sampling_ratio/min": 0.2682513892650604, "sampling/importance_sampling_ratio/mean": 1.0264726877212524, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0641838908195496, "clip_ratio/low_mean": 0.05612799432128668, "clip_ratio/low_min": 0.05612799432128668, "clip_ratio/high_mean": 0.06306612212210894, "clip_ratio/high_max": 0.06306612212210894, "clip_ratio/region_mean": 0.11919411644339561, "reward_total_mean": 0.07410462200641632, "reward_meter_mean": 0.36686593294143677, "reward_meter_std": 0.36617180705070496, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.944107711315155, "reward_lexical_plausibility_std": 0.10829658061265945, "reward_repeat_penalty_mean": 0.9262036085128784, "reward_repeat_penalty_std": 0.11174186319112778, "reward_near_duplicate_penalty_mean": 0.9790786504745483, "reward_near_duplicate_penalty_std": 0.03449733927845955, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9763580560684204, "reward_distinct_2_std": 0.06364420056343079, "reward_judge_quality_mean": 0.26500001549720764, "reward_judge_quality_std": 0.29267242550849915, "reward_total_composite_mean": 0.07410462200641632, "reward_total_composite_std": 0.07805755734443665} {"timestamp_utc": "2026-04-12T13:00:13Z", "mode": "train", "global_step": 565, "epoch": 0.022693497208499017, "loss": 0.1062, "grad_norm": 5.6130051612854, "learning_rate": 8.290909090909092e-06, "num_tokens": 1133639.0, "completions/mean_length": 276.5, "completions/min_length": 237.0, "completions/max_length": 343.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 276.5, "completions/min_terminated_length": 237.0, "completions/max_terminated_length": 343.0, "rewards/meter/mean": 0.7869507074356079, "rewards/meter/std": 0.14151926338672638, "rewards/count_adherence/mean": 0.8541666865348816, "rewards/count_adherence/std": 0.13908715546131134, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.547345757484436, "rewards/repeat_penalty/std": 0.2718929946422577, "rewards/near_duplicate_penalty/mean": 0.937583327293396, "rewards/near_duplicate_penalty/std": 0.05010360851883888, "rewards/opening_diversity/mean": 0.998046875, "rewards/opening_diversity/std": 0.005524271633476019, "rewards/distinct_2/mean": 0.6103899478912354, "rewards/distinct_2/std": 0.265046626329422, "rewards/total_composite/mean": 0.25660911202430725, "rewards/total_composite/std": 0.08675975352525711, "reward": 0.25660911202430725, "reward_std": 0.08675975352525711, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14434683322906494, "sampling/sampling_logp_difference/max": 3.466536521911621, "sampling/importance_sampling_ratio/min": 0.031224992126226425, "sampling/importance_sampling_ratio/mean": 1.0100514888763428, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7649172767996788, "clip_ratio/low_mean": 0.06368709448724985, "clip_ratio/low_min": 0.06368709448724985, "clip_ratio/high_mean": 0.07652063854038715, "clip_ratio/high_max": 0.07652063854038715, "clip_ratio/region_mean": 0.140207733027637, "reward_total_mean": 0.25660911202430725, "reward_meter_mean": 0.7869507074356079, "reward_meter_std": 0.14151926338672638, "reward_count_adherence_mean": 0.8541666865348816, "reward_count_adherence_std": 0.13908715546131134, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.547345757484436, "reward_repeat_penalty_std": 0.2718929946422577, "reward_near_duplicate_penalty_mean": 0.937583327293396, "reward_near_duplicate_penalty_std": 0.05010360851883888, "reward_opening_diversity_mean": 0.998046875, "reward_opening_diversity_std": 0.005524271633476019, "reward_distinct_2_mean": 0.6103899478912354, "reward_distinct_2_std": 0.265046626329422, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.25660911202430725, "reward_total_composite_std": 0.08675975352525711} {"timestamp_utc": "2026-04-12T13:00:27Z", "mode": "train", "global_step": 566, "epoch": 0.02273366269028397, "loss": -0.064, "grad_norm": 2.637990713119507, "learning_rate": 8.287878787878787e-06, "num_tokens": 1135129.0, "completions/mean_length": 163.25, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.6106027364730835, "rewards/meter/std": 0.4446389377117157, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9282266497612, "rewards/lexical_plausibility/std": 0.1329856663942337, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.37209591269493103, "rewards/repeat_penalty/mean": 0.9416448473930359, "rewards/repeat_penalty/std": 0.11396066099405289, "rewards/near_duplicate_penalty/mean": 0.980570912361145, "rewards/near_duplicate_penalty/std": 0.0292997807264328, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9886243939399719, "rewards/distinct_2/std": 0.024782273918390274, "rewards/total_composite/mean": 0.4156671464443207, "rewards/total_composite/std": 0.3648478388786316, "reward": 0.4156671464443207, "reward_std": 0.3648478388786316, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1527395099401474, "sampling/sampling_logp_difference/max": 1.5353171825408936, "sampling/importance_sampling_ratio/min": 0.21538737416267395, "sampling/importance_sampling_ratio/mean": 1.01309072971344, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8335897997021675, "clip_ratio/low_mean": 0.031235750764608383, "clip_ratio/low_min": 0.031235750764608383, "clip_ratio/high_mean": 0.07875300478190184, "clip_ratio/high_max": 0.07875300478190184, "clip_ratio/region_mean": 0.10998875554651022, "reward_total_mean": 0.4156671464443207, "reward_meter_mean": 0.6106027364730835, "reward_meter_std": 0.4446389377117157, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9282266497612, "reward_lexical_plausibility_std": 0.1329856663942337, "reward_repeat_penalty_mean": 0.9416448473930359, "reward_repeat_penalty_std": 0.11396066099405289, "reward_near_duplicate_penalty_mean": 0.980570912361145, "reward_near_duplicate_penalty_std": 0.0292997807264328, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9886243939399719, "reward_distinct_2_std": 0.024782273918390274, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.37209591269493103, "reward_total_composite_mean": 0.4156671464443207, "reward_total_composite_std": 0.3648478388786316} {"timestamp_utc": "2026-04-12T13:00:37Z", "mode": "train", "global_step": 567, "epoch": 0.022773828172068925, "loss": 0.071, "grad_norm": 13.785236358642578, "learning_rate": 8.284848484848486e-06, "num_tokens": 1136758.0, "completions/mean_length": 44.625, "completions/min_length": 38.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.9689449071884155, "rewards/meter/std": 0.04034477844834328, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3184336721897125, "rewards/repeat_penalty/mean": 0.6969336867332458, "rewards/repeat_penalty/std": 0.37751781940460205, "rewards/near_duplicate_penalty/mean": 0.8623055219650269, "rewards/near_duplicate_penalty/std": 0.16690663993358612, "rewards/opening_diversity/mean": 0.859375, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.8451367616653442, "rewards/distinct_2/std": 0.26540008187294006, "rewards/total_composite/mean": 0.6106916666030884, "rewards/total_composite/std": 0.3000105917453766, "reward": 0.6106916666030884, "reward_std": 0.3000105917453766, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14804808795452118, "sampling/sampling_logp_difference/max": 1.9665656089782715, "sampling/importance_sampling_ratio/min": 0.139936625957489, "sampling/importance_sampling_ratio/mean": 1.0200014114379883, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9125291332602501, "clip_ratio/low_mean": 0.05262185260653496, "clip_ratio/low_min": 0.05262185260653496, "clip_ratio/high_mean": 0.06844110134989023, "clip_ratio/high_max": 0.06844110134989023, "clip_ratio/region_mean": 0.12106295395642519, "reward_total_mean": 0.6106916666030884, "reward_meter_mean": 0.9689449071884155, "reward_meter_std": 0.04034477844834328, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6969336867332458, "reward_repeat_penalty_std": 0.37751781940460205, "reward_near_duplicate_penalty_mean": 0.8623055219650269, "reward_near_duplicate_penalty_std": 0.16690663993358612, "reward_opening_diversity_mean": 0.859375, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.8451367616653442, "reward_distinct_2_std": 0.26540008187294006, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3184336721897125, "reward_total_composite_mean": 0.6106916666030884, "reward_total_composite_std": 0.3000105917453766} {"timestamp_utc": "2026-04-12T13:00:48Z", "mode": "train", "global_step": 568, "epoch": 0.02281399365385388, "loss": -0.0352, "grad_norm": 7.714836597442627, "learning_rate": 8.281818181818182e-06, "num_tokens": 1139410.0, "completions/mean_length": 125.5, "completions/min_length": 105.0, "completions/max_length": 142.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 125.5, "completions/min_terminated_length": 105.0, "completions/max_terminated_length": 142.0, "rewards/meter/mean": 0.896450400352478, "rewards/meter/std": 0.165233314037323, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4662500023841858, "rewards/judge_quality/std": 0.1743508279323578, "rewards/repeat_penalty/mean": 0.907419741153717, "rewards/repeat_penalty/std": 0.18419818580150604, "rewards/near_duplicate_penalty/mean": 0.9728611707687378, "rewards/near_duplicate_penalty/std": 0.03465347737073898, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9366430044174194, "rewards/distinct_2/std": 0.14353594183921814, "rewards/total_composite/mean": 0.3970481753349304, "rewards/total_composite/std": 0.12406831979751587, "reward": 0.3970481753349304, "reward_std": 0.12406831234693527, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14454703032970428, "sampling/sampling_logp_difference/max": 2.0742719173431396, "sampling/importance_sampling_ratio/min": 0.1256478726863861, "sampling/importance_sampling_ratio/mean": 1.007752776145935, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0344690158963203, "clip_ratio/low_mean": 0.06165926530957222, "clip_ratio/low_min": 0.06165926530957222, "clip_ratio/high_mean": 0.07605502009391785, "clip_ratio/high_max": 0.07605502009391785, "clip_ratio/region_mean": 0.13771428540349007, "reward_total_mean": 0.3970481753349304, "reward_meter_mean": 0.896450400352478, "reward_meter_std": 0.165233314037323, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.907419741153717, "reward_repeat_penalty_std": 0.18419818580150604, "reward_near_duplicate_penalty_mean": 0.9728611707687378, "reward_near_duplicate_penalty_std": 0.03465347737073898, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9366430044174194, "reward_distinct_2_std": 0.14353594183921814, "reward_judge_quality_mean": 0.4662500023841858, "reward_judge_quality_std": 0.1743508279323578, "reward_total_composite_mean": 0.3970481753349304, "reward_total_composite_std": 0.12406831979751587} {"timestamp_utc": "2026-04-12T13:00:59Z", "mode": "train", "global_step": 569, "epoch": 0.022854159135638832, "loss": 0.0284, "grad_norm": 7.0395097732543945, "learning_rate": 8.27878787878788e-06, "num_tokens": 1141800.0, "completions/mean_length": 107.75, "completions/min_length": 96.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.75, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.5035848617553711, "rewards/meter/std": 0.2208067774772644, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4749999940395355, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.8326623439788818, "rewards/repeat_penalty/std": 0.3059518039226532, "rewards/near_duplicate_penalty/mean": 0.9547679424285889, "rewards/near_duplicate_penalty/std": 0.09025280177593231, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8751956224441528, "rewards/distinct_2/std": 0.22261351346969604, "rewards/total_composite/mean": 0.20396524667739868, "rewards/total_composite/std": 0.1100090891122818, "reward": 0.20396524667739868, "reward_std": 0.1100090891122818, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12819813191890717, "sampling/sampling_logp_difference/max": 2.7097034454345703, "sampling/importance_sampling_ratio/min": 0.06655654311180115, "sampling/importance_sampling_ratio/mean": 0.9968386292457581, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6736838817596436, "clip_ratio/low_mean": 0.07226160261780024, "clip_ratio/low_min": 0.07226160261780024, "clip_ratio/high_mean": 0.037748207338154316, "clip_ratio/high_max": 0.037748207338154316, "clip_ratio/region_mean": 0.11000980995595455, "reward_total_mean": 0.20396524667739868, "reward_meter_mean": 0.5035848617553711, "reward_meter_std": 0.2208067774772644, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8326623439788818, "reward_repeat_penalty_std": 0.3059518039226532, "reward_near_duplicate_penalty_mean": 0.9547679424285889, "reward_near_duplicate_penalty_std": 0.09025280177593231, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8751956224441528, "reward_distinct_2_std": 0.22261351346969604, "reward_judge_quality_mean": 0.4749999940395355, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.20396524667739868, "reward_total_composite_std": 0.1100090891122818} {"timestamp_utc": "2026-04-12T13:01:12Z", "mode": "train", "global_step": 570, "epoch": 0.022894324617423786, "loss": -0.0682, "grad_norm": 3.0202219486236572, "learning_rate": 8.275757575757577e-06, "num_tokens": 1143087.0, "completions/mean_length": 81.875, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.428571701049805, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.71962970495224, "rewards/meter/std": 0.35546237230300903, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.972630500793457, "rewards/lexical_plausibility/std": 0.07741261273622513, "rewards/judge_quality/mean": 0.8299999833106995, "rewards/judge_quality/std": 0.31545883417129517, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6782770752906799, "rewards/total_composite/std": 0.3369387090206146, "reward": 0.6782770752906799, "reward_std": 0.3369387090206146, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1483437567949295, "sampling/sampling_logp_difference/max": 1.1063976287841797, "sampling/importance_sampling_ratio/min": 0.3307483196258545, "sampling/importance_sampling_ratio/mean": 1.0200278759002686, "sampling/importance_sampling_ratio/max": 1.6298166513442993, "entropy": 0.8440438508987427, "clip_ratio/low_mean": 0.0069444444961845875, "clip_ratio/low_min": 0.0069444444961845875, "clip_ratio/high_mean": 0.1421447629109025, "clip_ratio/high_max": 0.1421447629109025, "clip_ratio/region_mean": 0.1490892074070871, "reward_total_mean": 0.6782770752906799, "reward_meter_mean": 0.71962970495224, "reward_meter_std": 0.35546237230300903, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.972630500793457, "reward_lexical_plausibility_std": 0.07741261273622513, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8299999833106995, "reward_judge_quality_std": 0.31545883417129517, "reward_total_composite_mean": 0.6782770752906799, "reward_total_composite_std": 0.3369387090206146} {"timestamp_utc": "2026-04-12T13:01:27Z", "mode": "train", "global_step": 571, "epoch": 0.02293449009920874, "loss": -0.0724, "grad_norm": 2.476228713989258, "learning_rate": 8.272727272727274e-06, "num_tokens": 1144658.0, "completions/mean_length": 166.375, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 51.16666793823242, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.6900045871734619, "rewards/meter/std": 0.4044930934906006, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9468242526054382, "rewards/lexical_plausibility/std": 0.10111001133918762, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.23260942101478577, "rewards/repeat_penalty/mean": 0.9614250659942627, "rewards/repeat_penalty/std": 0.08640110492706299, "rewards/near_duplicate_penalty/mean": 0.9926750659942627, "rewards/near_duplicate_penalty/std": 0.013261236250400543, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29301339387893677, "rewards/total_composite/std": 0.2625063359737396, "reward": 0.29301339387893677, "reward_std": 0.2625063359737396, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16469305753707886, "sampling/sampling_logp_difference/max": 2.1570959091186523, "sampling/importance_sampling_ratio/min": 0.11566052585840225, "sampling/importance_sampling_ratio/mean": 1.035529375076294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.016656644642353, "clip_ratio/low_mean": 0.040816327556967735, "clip_ratio/low_min": 0.040816327556967735, "clip_ratio/high_mean": 0.08386882115155458, "clip_ratio/high_max": 0.08386882115155458, "clip_ratio/region_mean": 0.12468514870852232, "reward_total_mean": 0.29301339387893677, "reward_meter_mean": 0.6900045871734619, "reward_meter_std": 0.4044930934906006, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9468242526054382, "reward_lexical_plausibility_std": 0.10111001133918762, "reward_repeat_penalty_mean": 0.9614250659942627, "reward_repeat_penalty_std": 0.08640110492706299, "reward_near_duplicate_penalty_mean": 0.9926750659942627, "reward_near_duplicate_penalty_std": 0.013261236250400543, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.23260942101478577, "reward_total_composite_mean": 0.29301339387893677, "reward_total_composite_std": 0.2625063359737396} {"timestamp_utc": "2026-04-12T13:01:40Z", "mode": "train", "global_step": 572, "epoch": 0.022974655580993694, "loss": -0.0547, "grad_norm": 9.258003234863281, "learning_rate": 8.269696969696971e-06, "num_tokens": 1147431.0, "completions/mean_length": 151.625, "completions/min_length": 47.0, "completions/max_length": 183.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.625, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 183.0, "rewards/meter/mean": 0.809888482093811, "rewards/meter/std": 0.2024429887533188, "rewards/count_adherence/mean": 0.8928571343421936, "rewards/count_adherence/std": 0.30304577946662903, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4874999523162842, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9014173746109009, "rewards/repeat_penalty/std": 0.06960899382829666, "rewards/near_duplicate_penalty/mean": 0.9741859436035156, "rewards/near_duplicate_penalty/std": 0.01830022595822811, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9247065782546997, "rewards/distinct_2/std": 0.05930177494883537, "rewards/total_composite/mean": 0.2677019536495209, "rewards/total_composite/std": 0.23452313244342804, "reward": 0.2677019536495209, "reward_std": 0.23452313244342804, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14180618524551392, "sampling/sampling_logp_difference/max": 2.9570159912109375, "sampling/importance_sampling_ratio/min": 0.051973775029182434, "sampling/importance_sampling_ratio/mean": 1.0224672555923462, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8546986281871796, "clip_ratio/low_mean": 0.04997908137738705, "clip_ratio/low_min": 0.04997908137738705, "clip_ratio/high_mean": 0.07101702503859997, "clip_ratio/high_max": 0.07101702503859997, "clip_ratio/region_mean": 0.12099610641598701, "reward_total_mean": 0.2677019536495209, "reward_meter_mean": 0.809888482093811, "reward_meter_std": 0.2024429887533188, "reward_count_adherence_mean": 0.8928571343421936, "reward_count_adherence_std": 0.30304577946662903, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9014173746109009, "reward_repeat_penalty_std": 0.06960899382829666, "reward_near_duplicate_penalty_mean": 0.9741859436035156, "reward_near_duplicate_penalty_std": 0.01830022595822811, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9247065782546997, "reward_distinct_2_std": 0.05930177494883537, "reward_judge_quality_mean": 0.4874999523162842, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.2677019536495209, "reward_total_composite_std": 0.23452313244342804} {"timestamp_utc": "2026-04-12T13:01:54Z", "mode": "train", "global_step": 573, "epoch": 0.023014821062778648, "loss": -0.0367, "grad_norm": 3.1884655952453613, "learning_rate": 8.266666666666667e-06, "num_tokens": 1148939.0, "completions/mean_length": 161.5, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 44.66666793823242, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.2651941776275635, "rewards/meter/std": 0.42671820521354675, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9270649552345276, "rewards/lexical_plausibility/std": 0.14048178493976593, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.37209591269493103, "rewards/repeat_penalty/mean": 0.9437205195426941, "rewards/repeat_penalty/std": 0.08234898746013641, "rewards/near_duplicate_penalty/mean": 0.9856542348861694, "rewards/near_duplicate_penalty/std": 0.013923265039920807, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.16601510345935822, "rewards/total_composite/std": 0.2700558006763458, "reward": 0.16601510345935822, "reward_std": 0.2700558006763458, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1659148633480072, "sampling/sampling_logp_difference/max": 1.5692558288574219, "sampling/importance_sampling_ratio/min": 0.20820006728172302, "sampling/importance_sampling_ratio/mean": 1.0147768259048462, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6306677088141441, "clip_ratio/low_mean": 0.04621415585279465, "clip_ratio/low_min": 0.04621415585279465, "clip_ratio/high_mean": 0.040568181313574314, "clip_ratio/high_max": 0.040568181313574314, "clip_ratio/region_mean": 0.08678233716636896, "reward_total_mean": 0.16601510345935822, "reward_meter_mean": 0.2651941776275635, "reward_meter_std": 0.42671820521354675, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9270649552345276, "reward_lexical_plausibility_std": 0.14048178493976593, "reward_repeat_penalty_mean": 0.9437205195426941, "reward_repeat_penalty_std": 0.08234898746013641, "reward_near_duplicate_penalty_mean": 0.9856542348861694, "reward_near_duplicate_penalty_std": 0.013923265039920807, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.37209591269493103, "reward_total_composite_mean": 0.16601510345935822, "reward_total_composite_std": 0.2700558006763458} {"timestamp_utc": "2026-04-12T13:02:05Z", "mode": "train", "global_step": 574, "epoch": 0.023054986544563602, "loss": 0.0198, "grad_norm": 16.67266082763672, "learning_rate": 8.263636363636366e-06, "num_tokens": 1151467.0, "completions/mean_length": 119.0, "completions/min_length": 98.0, "completions/max_length": 138.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.0, "completions/min_terminated_length": 98.0, "completions/max_terminated_length": 138.0, "rewards/meter/mean": 0.7381832599639893, "rewards/meter/std": 0.2610228657722473, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.1511857807636261, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.9304074048995972, "rewards/repeat_penalty/std": 0.13754808902740479, "rewards/near_duplicate_penalty/mean": 0.9826213121414185, "rewards/near_duplicate_penalty/std": 0.017901146784424782, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9549735188484192, "rewards/distinct_2/std": 0.1023939698934555, "rewards/total_composite/mean": 0.21185347437858582, "rewards/total_composite/std": 0.1496955156326294, "reward": 0.21185347437858582, "reward_std": 0.1496955007314682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1336987316608429, "sampling/sampling_logp_difference/max": 3.364473342895508, "sampling/importance_sampling_ratio/min": 0.03458022326231003, "sampling/importance_sampling_ratio/mean": 1.0063978433609009, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7657769918441772, "clip_ratio/low_mean": 0.06030426826328039, "clip_ratio/low_min": 0.06030426826328039, "clip_ratio/high_mean": 0.05361561942845583, "clip_ratio/high_max": 0.05361561942845583, "clip_ratio/region_mean": 0.11391988769173622, "reward_total_mean": 0.21185347437858582, "reward_meter_mean": 0.7381832599639893, "reward_meter_std": 0.2610228657722473, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.1511857807636261, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9304074048995972, "reward_repeat_penalty_std": 0.13754808902740479, "reward_near_duplicate_penalty_mean": 0.9826213121414185, "reward_near_duplicate_penalty_std": 0.017901146784424782, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9549735188484192, "reward_distinct_2_std": 0.1023939698934555, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.21185347437858582, "reward_total_composite_std": 0.1496955156326294} {"timestamp_utc": "2026-04-12T13:02:20Z", "mode": "train", "global_step": 575, "epoch": 0.023095152026348556, "loss": -0.0336, "grad_norm": 4.962844371795654, "learning_rate": 8.260606060606061e-06, "num_tokens": 1153024.0, "completions/mean_length": 103.625, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.28571701049805, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.5643232464790344, "rewards/meter/std": 0.3730098009109497, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9652791023254395, "rewards/lexical_plausibility/std": 0.0982055589556694, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.9623034596443176, "rewards/repeat_penalty/std": 0.08640687167644501, "rewards/near_duplicate_penalty/mean": 0.9935534596443176, "rewards/near_duplicate_penalty/std": 0.010682421736419201, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2575927674770355, "rewards/total_composite/std": 0.2454334944486618, "reward": 0.2575927674770355, "reward_std": 0.2454334795475006, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18178588151931763, "sampling/sampling_logp_difference/max": 1.4608869552612305, "sampling/importance_sampling_ratio/min": 0.23203037679195404, "sampling/importance_sampling_ratio/mean": 1.0186171531677246, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0370404049754143, "clip_ratio/low_mean": 0.04936229903250933, "clip_ratio/low_min": 0.04936229903250933, "clip_ratio/high_mean": 0.0777665888890624, "clip_ratio/high_max": 0.0777665888890624, "clip_ratio/region_mean": 0.12712888792157173, "reward_total_mean": 0.2575927674770355, "reward_meter_mean": 0.5643232464790344, "reward_meter_std": 0.3730098009109497, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9652791023254395, "reward_lexical_plausibility_std": 0.0982055589556694, "reward_repeat_penalty_mean": 0.9623034596443176, "reward_repeat_penalty_std": 0.08640687167644501, "reward_near_duplicate_penalty_mean": 0.9935534596443176, "reward_near_duplicate_penalty_std": 0.010682421736419201, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.2575927674770355, "reward_total_composite_std": 0.2454334944486618} {"timestamp_utc": "2026-04-12T13:02:36Z", "mode": "train", "global_step": 576, "epoch": 0.02313531750813351, "loss": -0.1999, "grad_norm": 3.657471179962158, "learning_rate": 8.257575757575758e-06, "num_tokens": 1155175.0, "completions/mean_length": 145.875, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 93.5714340209961, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 121.0, "rewards/meter/mean": 0.940564751625061, "rewards/meter/std": 0.06310593336820602, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.22903135418891907, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.962358832359314, "rewards/lexical_plausibility/std": 0.10646536946296692, "rewards/judge_quality/mean": 0.35624998807907104, "rewards/judge_quality/std": 0.15221577882766724, "rewards/repeat_penalty/mean": 0.9759054183959961, "rewards/repeat_penalty/std": 0.03560880199074745, "rewards/near_duplicate_penalty/mean": 0.9866353869438171, "rewards/near_duplicate_penalty/std": 0.009828095324337482, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9890109896659851, "rewards/distinct_2/std": 0.031081615015864372, "rewards/total_composite/mean": 0.2960255444049835, "rewards/total_composite/std": 0.1426866203546524, "reward": 0.2960255444049835, "reward_std": 0.1426866203546524, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15812592208385468, "sampling/sampling_logp_difference/max": 1.9688575267791748, "sampling/importance_sampling_ratio/min": 0.13961626589298248, "sampling/importance_sampling_ratio/mean": 1.0087487697601318, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9720896631479263, "clip_ratio/low_mean": 0.03464866895228624, "clip_ratio/low_min": 0.03464866895228624, "clip_ratio/high_mean": 0.09635142516344786, "clip_ratio/high_max": 0.09635142516344786, "clip_ratio/region_mean": 0.1310000941157341, "reward_total_mean": 0.2960255444049835, "reward_meter_mean": 0.940564751625061, "reward_meter_std": 0.06310593336820602, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.22903135418891907, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.962358832359314, "reward_lexical_plausibility_std": 0.10646536946296692, "reward_repeat_penalty_mean": 0.9759054183959961, "reward_repeat_penalty_std": 0.03560880199074745, "reward_near_duplicate_penalty_mean": 0.9866353869438171, "reward_near_duplicate_penalty_std": 0.009828095324337482, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9890109896659851, "reward_distinct_2_std": 0.031081615015864372, "reward_judge_quality_mean": 0.35624998807907104, "reward_judge_quality_std": 0.15221577882766724, "reward_total_composite_mean": 0.2960255444049835, "reward_total_composite_std": 0.1426866203546524} {"timestamp_utc": "2026-04-12T13:02:45Z", "mode": "train", "global_step": 577, "epoch": 0.023175482989918464, "loss": -0.0203, "grad_norm": 19.71200942993164, "learning_rate": 8.254545454545456e-06, "num_tokens": 1156606.0, "completions/mean_length": 21.875, "completions/min_length": 20.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.875, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.7545794248580933, "rewards/meter/std": 0.3721073269844055, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8062499761581421, "rewards/judge_quality/std": 0.22012579441070557, "rewards/repeat_penalty/mean": 0.7231106758117676, "rewards/repeat_penalty/std": 0.06289298832416534, "rewards/near_duplicate_penalty/mean": 0.9641475677490234, "rewards/near_duplicate_penalty/std": 0.08385732024908066, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6397749185562134, "rewards/total_composite/std": 0.3437376618385315, "reward": 0.6397749185562134, "reward_std": 0.3437376618385315, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11730854213237762, "sampling/sampling_logp_difference/max": 1.0412530899047852, "sampling/importance_sampling_ratio/min": 0.3530120551586151, "sampling/importance_sampling_ratio/mean": 1.007327914237976, "sampling/importance_sampling_ratio/max": 1.7369740009307861, "entropy": 0.9567297101020813, "clip_ratio/low_mean": 0.05338203627616167, "clip_ratio/low_min": 0.05338203627616167, "clip_ratio/high_mean": 0.06627435237169266, "clip_ratio/high_max": 0.06627435237169266, "clip_ratio/region_mean": 0.11965638864785433, "reward_total_mean": 0.6397749185562134, "reward_meter_mean": 0.7545794248580933, "reward_meter_std": 0.3721073269844055, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7231106758117676, "reward_repeat_penalty_std": 0.06289298832416534, "reward_near_duplicate_penalty_mean": 0.9641475677490234, "reward_near_duplicate_penalty_std": 0.08385732024908066, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8062499761581421, "reward_judge_quality_std": 0.22012579441070557, "reward_total_composite_mean": 0.6397749185562134, "reward_total_composite_std": 0.3437376618385315} {"timestamp_utc": "2026-04-12T13:02:58Z", "mode": "train", "global_step": 578, "epoch": 0.023215648471703418, "loss": 0.0114, "grad_norm": 3.3425655364990234, "learning_rate": 8.251515151515153e-06, "num_tokens": 1161338.0, "completions/mean_length": 340.5, "completions/min_length": 324.0, "completions/max_length": 375.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 340.5, "completions/min_terminated_length": 324.0, "completions/max_terminated_length": 375.0, "rewards/meter/mean": 0.8657701015472412, "rewards/meter/std": 0.3493468165397644, "rewards/count_adherence/mean": 0.8181818127632141, "rewards/count_adherence/std": 0.048592954874038696, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.008949579671025276, "rewards/repeat_penalty/std": 0.016940230503678322, "rewards/near_duplicate_penalty/mean": 0.5584791302680969, "rewards/near_duplicate_penalty/std": 0.20024442672729492, "rewards/opening_diversity/mean": 0.6278331279754639, "rewards/opening_diversity/std": 0.3554748594760895, "rewards/distinct_2/mean": 0.016301684081554413, "rewards/distinct_2/std": 0.030627399682998657, "rewards/total_composite/mean": 0.07612084597349167, "rewards/total_composite/std": 0.06336943060159683, "reward": 0.07612084597349167, "reward_std": 0.06336943060159683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04761502891778946, "sampling/sampling_logp_difference/max": 1.5711016654968262, "sampling/importance_sampling_ratio/min": 0.20781610906124115, "sampling/importance_sampling_ratio/mean": 0.9998597502708435, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.31269117072224617, "clip_ratio/low_mean": 0.014324888703413308, "clip_ratio/low_min": 0.014324888703413308, "clip_ratio/high_mean": 0.020633989362977445, "clip_ratio/high_max": 0.020633989362977445, "clip_ratio/region_mean": 0.03495887806639075, "reward_total_mean": 0.07612084597349167, "reward_meter_mean": 0.8657701015472412, "reward_meter_std": 0.3493468165397644, "reward_count_adherence_mean": 0.8181818127632141, "reward_count_adherence_std": 0.048592954874038696, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.008949579671025276, "reward_repeat_penalty_std": 0.016940230503678322, "reward_near_duplicate_penalty_mean": 0.5584791302680969, "reward_near_duplicate_penalty_std": 0.20024442672729492, "reward_opening_diversity_mean": 0.6278331279754639, "reward_opening_diversity_std": 0.3554748594760895, "reward_distinct_2_mean": 0.016301684081554413, "reward_distinct_2_std": 0.030627399682998657, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.07612084597349167, "reward_total_composite_std": 0.06336943060159683} {"timestamp_utc": "2026-04-12T13:03:07Z", "mode": "train", "global_step": 579, "epoch": 0.023255813953488372, "loss": 0.0331, "grad_norm": 15.134308815002441, "learning_rate": 8.248484848484848e-06, "num_tokens": 1162970.0, "completions/mean_length": 42.0, "completions/min_length": 38.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.9501508474349976, "rewards/meter/std": 0.025710590183734894, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7225000262260437, "rewards/judge_quality/std": 0.232854962348938, "rewards/repeat_penalty/mean": 0.8606948256492615, "rewards/repeat_penalty/std": 0.2064901739358902, "rewards/near_duplicate_penalty/mean": 0.9639027118682861, "rewards/near_duplicate_penalty/std": 0.05945350602269173, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9348984360694885, "rewards/distinct_2/std": 0.10414022207260132, "rewards/total_composite/mean": 0.6869061589241028, "rewards/total_composite/std": 0.22407598793506622, "reward": 0.6869061589241028, "reward_std": 0.22407598793506622, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15086950361728668, "sampling/sampling_logp_difference/max": 1.4813685417175293, "sampling/importance_sampling_ratio/min": 0.2273263782262802, "sampling/importance_sampling_ratio/mean": 1.0305646657943726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.811005987226963, "clip_ratio/low_mean": 0.029723837971687317, "clip_ratio/low_min": 0.029723837971687317, "clip_ratio/high_mean": 0.0991767467930913, "clip_ratio/high_max": 0.0991767467930913, "clip_ratio/region_mean": 0.12890058476477861, "reward_total_mean": 0.6869061589241028, "reward_meter_mean": 0.9501508474349976, "reward_meter_std": 0.025710590183734894, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8606948256492615, "reward_repeat_penalty_std": 0.2064901739358902, "reward_near_duplicate_penalty_mean": 0.9639027118682861, "reward_near_duplicate_penalty_std": 0.05945350602269173, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9348984360694885, "reward_distinct_2_std": 0.10414022207260132, "reward_judge_quality_mean": 0.7225000262260437, "reward_judge_quality_std": 0.232854962348938, "reward_total_composite_mean": 0.6869061589241028, "reward_total_composite_std": 0.22407598793506622} {"timestamp_utc": "2026-04-12T13:03:22Z", "mode": "train", "global_step": 580, "epoch": 0.023295979435273326, "loss": -0.1163, "grad_norm": 3.920473575592041, "learning_rate": 8.245454545454546e-06, "num_tokens": 1164801.0, "completions/mean_length": 113.875, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.000003814697266, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.7830889225006104, "rewards/meter/std": 0.3687279522418976, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.33034372329711914, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9654290676116943, "rewards/lexical_plausibility/std": 0.09778142720460892, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.5481995940208435, "rewards/repeat_penalty/std": 0.2665763795375824, "rewards/near_duplicate_penalty/mean": 0.8030309677124023, "rewards/near_duplicate_penalty/std": 0.12721829116344452, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.7613962888717651, "rewards/distinct_2/std": 0.16005690395832062, "rewards/total_composite/mean": 0.2469968944787979, "rewards/total_composite/std": 0.1343400925397873, "reward": 0.2469968944787979, "reward_std": 0.1343400925397873, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1405726969242096, "sampling/sampling_logp_difference/max": 3.062925338745117, "sampling/importance_sampling_ratio/min": 0.04675073176622391, "sampling/importance_sampling_ratio/mean": 1.0136158466339111, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7760870456695557, "clip_ratio/low_mean": 0.03786821663379669, "clip_ratio/low_min": 0.03786821663379669, "clip_ratio/high_mean": 0.04754090262576938, "clip_ratio/high_max": 0.04754090262576938, "clip_ratio/region_mean": 0.08540911925956607, "reward_total_mean": 0.2469968944787979, "reward_meter_mean": 0.7830889225006104, "reward_meter_std": 0.3687279522418976, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.33034372329711914, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9654290676116943, "reward_lexical_plausibility_std": 0.09778142720460892, "reward_repeat_penalty_mean": 0.5481995940208435, "reward_repeat_penalty_std": 0.2665763795375824, "reward_near_duplicate_penalty_mean": 0.8030309677124023, "reward_near_duplicate_penalty_std": 0.12721829116344452, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.7613962888717651, "reward_distinct_2_std": 0.16005690395832062, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.2469968944787979, "reward_total_composite_std": 0.1343400925397873} {"timestamp_utc": "2026-04-12T13:03:34Z", "mode": "train", "global_step": 581, "epoch": 0.02333614491705828, "loss": 0.0199, "grad_norm": 7.384605884552002, "learning_rate": 8.242424242424243e-06, "num_tokens": 1167735.0, "completions/mean_length": 161.75, "completions/min_length": 137.0, "completions/max_length": 184.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.75, "completions/min_terminated_length": 137.0, "completions/max_terminated_length": 184.0, "rewards/meter/mean": 0.878890872001648, "rewards/meter/std": 0.1957164853811264, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8601372838020325, "rewards/repeat_penalty/std": 0.09740442037582397, "rewards/near_duplicate_penalty/mean": 0.9627166986465454, "rewards/near_duplicate_penalty/std": 0.024184366688132286, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8917944431304932, "rewards/distinct_2/std": 0.08167210966348648, "rewards/total_composite/mean": 0.3456624448299408, "rewards/total_composite/std": 0.08569075167179108, "reward": 0.3456624448299408, "reward_std": 0.08569075167179108, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1548485904932022, "sampling/sampling_logp_difference/max": 2.275144577026367, "sampling/importance_sampling_ratio/min": 0.10278204828500748, "sampling/importance_sampling_ratio/mean": 1.0003671646118164, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.989480510354042, "clip_ratio/low_mean": 0.04997400101274252, "clip_ratio/low_min": 0.04997400101274252, "clip_ratio/high_mean": 0.11123065650463104, "clip_ratio/high_max": 0.11123065650463104, "clip_ratio/region_mean": 0.16120465751737356, "reward_total_mean": 0.3456624448299408, "reward_meter_mean": 0.878890872001648, "reward_meter_std": 0.1957164853811264, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8601372838020325, "reward_repeat_penalty_std": 0.09740442037582397, "reward_near_duplicate_penalty_mean": 0.9627166986465454, "reward_near_duplicate_penalty_std": 0.024184366688132286, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8917944431304932, "reward_distinct_2_std": 0.08167210966348648, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3456624448299408, "reward_total_composite_std": 0.08569075167179108} {"timestamp_utc": "2026-04-12T13:03:42Z", "mode": "train", "global_step": 582, "epoch": 0.023376310398843234, "loss": 0.0364, "grad_norm": 23.21431541442871, "learning_rate": 8.23939393939394e-06, "num_tokens": 1169235.0, "completions/mean_length": 34.5, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.560826301574707, "rewards/meter/std": 0.3040037453174591, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9898897409439087, "rewards/lexical_plausibility/std": 0.028596237301826477, "rewards/judge_quality/mean": 0.6225000023841858, "rewards/judge_quality/std": 0.3285357356071472, "rewards/repeat_penalty/mean": 0.9979792833328247, "rewards/repeat_penalty/std": 0.005715449806302786, "rewards/near_duplicate_penalty/mean": 0.9979792833328247, "rewards/near_duplicate_penalty/std": 0.005715449806302786, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3604447543621063, "rewards/total_composite/std": 0.2884591221809387, "reward": 0.3604447543621063, "reward_std": 0.2884591221809387, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13150335848331451, "sampling/sampling_logp_difference/max": 2.0473315715789795, "sampling/importance_sampling_ratio/min": 0.12907887995243073, "sampling/importance_sampling_ratio/mean": 1.0005255937576294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6319779381155968, "clip_ratio/low_mean": 0.059326283633708954, "clip_ratio/low_min": 0.059326283633708954, "clip_ratio/high_mean": 0.05271501839160919, "clip_ratio/high_max": 0.05271501839160919, "clip_ratio/region_mean": 0.11204130202531815, "reward_total_mean": 0.3604447543621063, "reward_meter_mean": 0.560826301574707, "reward_meter_std": 0.3040037453174591, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9898897409439087, "reward_lexical_plausibility_std": 0.028596237301826477, "reward_repeat_penalty_mean": 0.9979792833328247, "reward_repeat_penalty_std": 0.005715449806302786, "reward_near_duplicate_penalty_mean": 0.9979792833328247, "reward_near_duplicate_penalty_std": 0.005715449806302786, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6225000023841858, "reward_judge_quality_std": 0.3285357356071472, "reward_total_composite_mean": 0.3604447543621063, "reward_total_composite_std": 0.2884591221809387} {"timestamp_utc": "2026-04-12T13:03:56Z", "mode": "train", "global_step": 583, "epoch": 0.023416475880628188, "loss": -0.0551, "grad_norm": 5.221027374267578, "learning_rate": 8.236363636363637e-06, "num_tokens": 1170841.0, "completions/mean_length": 105.75, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.71428680419922, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.6080485582351685, "rewards/meter/std": 0.43777281045913696, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9689664244651794, "rewards/lexical_plausibility/std": 0.08777620643377304, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.9648683667182922, "rewards/repeat_penalty/std": 0.08714817464351654, "rewards/near_duplicate_penalty/mean": 0.9961183667182922, "rewards/near_duplicate_penalty/std": 0.0077176871709525585, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3765876293182373, "rewards/total_composite/std": 0.3583544194698334, "reward": 0.3765876293182373, "reward_std": 0.358354389667511, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13303391635417938, "sampling/sampling_logp_difference/max": 1.2548370361328125, "sampling/importance_sampling_ratio/min": 0.2851223051548004, "sampling/importance_sampling_ratio/mean": 1.0224131345748901, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7562833800911903, "clip_ratio/low_mean": 0.0714285746216774, "clip_ratio/low_min": 0.0714285746216774, "clip_ratio/high_mean": 0.07753804791718721, "clip_ratio/high_max": 0.07753804791718721, "clip_ratio/region_mean": 0.1489666225388646, "reward_total_mean": 0.3765876293182373, "reward_meter_mean": 0.6080485582351685, "reward_meter_std": 0.43777281045913696, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9689664244651794, "reward_lexical_plausibility_std": 0.08777620643377304, "reward_repeat_penalty_mean": 0.9648683667182922, "reward_repeat_penalty_std": 0.08714817464351654, "reward_near_duplicate_penalty_mean": 0.9961183667182922, "reward_near_duplicate_penalty_std": 0.0077176871709525585, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.3765876293182373, "reward_total_composite_std": 0.3583544194698334} {"timestamp_utc": "2026-04-12T13:04:06Z", "mode": "train", "global_step": 584, "epoch": 0.02345664136241314, "loss": 0.0693, "grad_norm": 10.465445518493652, "learning_rate": 8.233333333333335e-06, "num_tokens": 1172998.0, "completions/mean_length": 87.625, "completions/min_length": 78.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.625, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.7624784708023071, "rewards/meter/std": 0.3110302686691284, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9221370220184326, "rewards/repeat_penalty/std": 0.05366437882184982, "rewards/near_duplicate_penalty/mean": 0.9665480852127075, "rewards/near_duplicate_penalty/std": 0.018389509990811348, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9539777040481567, "rewards/distinct_2/std": 0.05056172236800194, "rewards/total_composite/mean": 0.3033396005630493, "rewards/total_composite/std": 0.14325401186943054, "reward": 0.3033396005630493, "reward_std": 0.14325399696826935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1579848676919937, "sampling/sampling_logp_difference/max": 1.4948318004608154, "sampling/importance_sampling_ratio/min": 0.22428633272647858, "sampling/importance_sampling_ratio/mean": 1.0212000608444214, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1626967042684555, "clip_ratio/low_mean": 0.0546164195984602, "clip_ratio/low_min": 0.0546164195984602, "clip_ratio/high_mean": 0.10806668363511562, "clip_ratio/high_max": 0.10806668363511562, "clip_ratio/region_mean": 0.16268310323357582, "reward_total_mean": 0.3033396005630493, "reward_meter_mean": 0.7624784708023071, "reward_meter_std": 0.3110302686691284, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9221370220184326, "reward_repeat_penalty_std": 0.05366437882184982, "reward_near_duplicate_penalty_mean": 0.9665480852127075, "reward_near_duplicate_penalty_std": 0.018389509990811348, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9539777040481567, "reward_distinct_2_std": 0.05056172236800194, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3033396005630493, "reward_total_composite_std": 0.14325401186943054} {"timestamp_utc": "2026-04-12T13:04:16Z", "mode": "train", "global_step": 585, "epoch": 0.023496806844198095, "loss": 0.0247, "grad_norm": 10.929614067077637, "learning_rate": 8.23030303030303e-06, "num_tokens": 1174916.0, "completions/mean_length": 66.75, "completions/min_length": 45.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.75, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.8810107111930847, "rewards/meter/std": 0.1937389075756073, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.8048100471496582, "rewards/repeat_penalty/std": 0.2865392863750458, "rewards/near_duplicate_penalty/mean": 0.9030643105506897, "rewards/near_duplicate_penalty/std": 0.12144850194454193, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.9081178903579712, "rewards/distinct_2/std": 0.1395706683397293, "rewards/total_composite/mean": 0.4271959960460663, "rewards/total_composite/std": 0.2150857150554657, "reward": 0.4271959960460663, "reward_std": 0.2150857299566269, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1364094763994217, "sampling/sampling_logp_difference/max": 1.7006666660308838, "sampling/importance_sampling_ratio/min": 0.18256177008152008, "sampling/importance_sampling_ratio/mean": 1.010083556175232, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8348531275987625, "clip_ratio/low_mean": 0.04211481101810932, "clip_ratio/low_min": 0.04211481101810932, "clip_ratio/high_mean": 0.09378836676478386, "clip_ratio/high_max": 0.09378836676478386, "clip_ratio/region_mean": 0.13590317778289318, "reward_total_mean": 0.4271959960460663, "reward_meter_mean": 0.8810107111930847, "reward_meter_std": 0.1937389075756073, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8048100471496582, "reward_repeat_penalty_std": 0.2865392863750458, "reward_near_duplicate_penalty_mean": 0.9030643105506897, "reward_near_duplicate_penalty_std": 0.12144850194454193, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.9081178903579712, "reward_distinct_2_std": 0.1395706683397293, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.4271959960460663, "reward_total_composite_std": 0.2150857150554657} {"timestamp_utc": "2026-04-12T13:04:30Z", "mode": "train", "global_step": 586, "epoch": 0.02353697232598305, "loss": -0.0461, "grad_norm": 4.653808116912842, "learning_rate": 8.227272727272728e-06, "num_tokens": 1176635.0, "completions/mean_length": 110.875, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.57143020629883, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.8222522735595703, "rewards/meter/std": 0.27135413885116577, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9601929187774658, "rewards/lexical_plausibility/std": 0.07594508677721024, "rewards/judge_quality/mean": 0.5325000286102295, "rewards/judge_quality/std": 0.34656479954719543, "rewards/repeat_penalty/mean": 0.9464002847671509, "rewards/repeat_penalty/std": 0.09431640803813934, "rewards/near_duplicate_penalty/mean": 0.9856500625610352, "rewards/near_duplicate_penalty/std": 0.02964356541633606, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.46150755882263184, "rewards/total_composite/std": 0.36525657773017883, "reward": 0.46150755882263184, "reward_std": 0.36525657773017883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17011520266532898, "sampling/sampling_logp_difference/max": 2.3689229488372803, "sampling/importance_sampling_ratio/min": 0.09358146041631699, "sampling/importance_sampling_ratio/mean": 1.0176448822021484, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.152994766831398, "clip_ratio/low_mean": 0.08484716154634953, "clip_ratio/low_min": 0.08484716154634953, "clip_ratio/high_mean": 0.06638168357312679, "clip_ratio/high_max": 0.06638168357312679, "clip_ratio/region_mean": 0.15122884511947632, "reward_total_mean": 0.46150755882263184, "reward_meter_mean": 0.8222522735595703, "reward_meter_std": 0.27135413885116577, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9601929187774658, "reward_lexical_plausibility_std": 0.07594508677721024, "reward_repeat_penalty_mean": 0.9464002847671509, "reward_repeat_penalty_std": 0.09431640803813934, "reward_near_duplicate_penalty_mean": 0.9856500625610352, "reward_near_duplicate_penalty_std": 0.02964356541633606, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.5325000286102295, "reward_judge_quality_std": 0.34656479954719543, "reward_total_composite_mean": 0.46150755882263184, "reward_total_composite_std": 0.36525657773017883} {"timestamp_utc": "2026-04-12T13:04:44Z", "mode": "train", "global_step": 587, "epoch": 0.023577137807768003, "loss": -0.0732, "grad_norm": 5.389424800872803, "learning_rate": 8.224242424242425e-06, "num_tokens": 1178294.0, "completions/mean_length": 108.375, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.71428680419922, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.9181538820266724, "rewards/meter/std": 0.1899999976158142, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.95954430103302, "rewards/lexical_plausibility/std": 0.0839536190032959, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9667361378669739, "rewards/repeat_penalty/std": 0.04056604579091072, "rewards/near_duplicate_penalty/mean": 0.9820794463157654, "rewards/near_duplicate_penalty/std": 0.017676454037427902, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9841362237930298, "rewards/distinct_2/std": 0.029577190056443214, "rewards/total_composite/mean": 0.38899046182632446, "rewards/total_composite/std": 0.20348544418811798, "reward": 0.38899046182632446, "reward_std": 0.2034854143857956, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18173500895500183, "sampling/sampling_logp_difference/max": 1.330775260925293, "sampling/importance_sampling_ratio/min": 0.2642723023891449, "sampling/importance_sampling_ratio/mean": 1.035598874092102, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.385396733880043, "clip_ratio/low_mean": 0.037711864337325096, "clip_ratio/low_min": 0.037711864337325096, "clip_ratio/high_mean": 0.12368344143033028, "clip_ratio/high_max": 0.12368344143033028, "clip_ratio/region_mean": 0.16139530576765537, "reward_total_mean": 0.38899046182632446, "reward_meter_mean": 0.9181538820266724, "reward_meter_std": 0.1899999976158142, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.95954430103302, "reward_lexical_plausibility_std": 0.0839536190032959, "reward_repeat_penalty_mean": 0.9667361378669739, "reward_repeat_penalty_std": 0.04056604579091072, "reward_near_duplicate_penalty_mean": 0.9820794463157654, "reward_near_duplicate_penalty_std": 0.017676454037427902, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9841362237930298, "reward_distinct_2_std": 0.029577190056443214, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.38899046182632446, "reward_total_composite_std": 0.20348544418811798} {"timestamp_utc": "2026-04-12T13:04:56Z", "mode": "train", "global_step": 588, "epoch": 0.023617303289552957, "loss": 0.0638, "grad_norm": 3.340954065322876, "learning_rate": 8.221212121212122e-06, "num_tokens": 1181666.0, "completions/mean_length": 230.5, "completions/min_length": 203.0, "completions/max_length": 263.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 230.5, "completions/min_terminated_length": 203.0, "completions/max_terminated_length": 263.0, "rewards/meter/mean": 0.9035285711288452, "rewards/meter/std": 0.18135115504264832, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.0534522607922554, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.0020673582330346107, "rewards/repeat_penalty/std": 0.005847372114658356, "rewards/near_duplicate_penalty/mean": 0.47508320212364197, "rewards/near_duplicate_penalty/std": 0.13144657015800476, "rewards/opening_diversity/mean": 0.47642046213150024, "rewards/opening_diversity/std": 0.33804193139076233, "rewards/distinct_2/mean": 0.0158083438873291, "rewards/distinct_2/std": 0.044712748378515244, "rewards/total_composite/mean": 0.20263038575649261, "rewards/total_composite/std": 0.11826668679714203, "reward": 0.20263038575649261, "reward_std": 0.11826668679714203, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0420808270573616, "sampling/sampling_logp_difference/max": 1.8253421783447266, "sampling/importance_sampling_ratio/min": 0.16116249561309814, "sampling/importance_sampling_ratio/mean": 1.0034795999526978, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.27530100382864475, "clip_ratio/low_mean": 0.01830257789697498, "clip_ratio/low_min": 0.01830257789697498, "clip_ratio/high_mean": 0.018705840688198805, "clip_ratio/high_max": 0.018705840688198805, "clip_ratio/region_mean": 0.037008418585173786, "reward_total_mean": 0.20263038575649261, "reward_meter_mean": 0.9035285711288452, "reward_meter_std": 0.18135115504264832, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.0534522607922554, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0020673582330346107, "reward_repeat_penalty_std": 0.005847372114658356, "reward_near_duplicate_penalty_mean": 0.47508320212364197, "reward_near_duplicate_penalty_std": 0.13144657015800476, "reward_opening_diversity_mean": 0.47642046213150024, "reward_opening_diversity_std": 0.33804193139076233, "reward_distinct_2_mean": 0.0158083438873291, "reward_distinct_2_std": 0.044712748378515244, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.20263038575649261, "reward_total_composite_std": 0.11826668679714203} {"timestamp_utc": "2026-04-12T13:05:10Z", "mode": "train", "global_step": 589, "epoch": 0.02365746877133791, "loss": -0.0561, "grad_norm": 6.356830596923828, "learning_rate": 8.21818181818182e-06, "num_tokens": 1183411.0, "completions/mean_length": 113.125, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.142860412597656, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.48142874240875244, "rewards/meter/std": 0.30561205744743347, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9659296870231628, "rewards/lexical_plausibility/std": 0.09636537730693817, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9884310960769653, "rewards/repeat_penalty/std": 0.018634436652064323, "rewards/near_duplicate_penalty/mean": 0.9884310960769653, "rewards/near_duplicate_penalty/std": 0.018634436652064323, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1727956235408783, "rewards/total_composite/std": 0.1319209635257721, "reward": 0.1727956235408783, "reward_std": 0.1319209635257721, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1446923166513443, "sampling/sampling_logp_difference/max": 1.9724135398864746, "sampling/importance_sampling_ratio/min": 0.1391206830739975, "sampling/importance_sampling_ratio/mean": 0.9802079796791077, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6234605275094509, "clip_ratio/low_mean": 0.025961538776755333, "clip_ratio/low_min": 0.025961538776755333, "clip_ratio/high_mean": 0.08062838343903422, "clip_ratio/high_max": 0.08062838343903422, "clip_ratio/region_mean": 0.10658992221578956, "reward_total_mean": 0.1727956235408783, "reward_meter_mean": 0.48142874240875244, "reward_meter_std": 0.30561205744743347, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9659296870231628, "reward_lexical_plausibility_std": 0.09636537730693817, "reward_repeat_penalty_mean": 0.9884310960769653, "reward_repeat_penalty_std": 0.018634436652064323, "reward_near_duplicate_penalty_mean": 0.9884310960769653, "reward_near_duplicate_penalty_std": 0.018634436652064323, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.1727956235408783, "reward_total_composite_std": 0.1319209635257721} {"timestamp_utc": "2026-04-12T13:05:22Z", "mode": "train", "global_step": 590, "epoch": 0.023697634253122865, "loss": 0.0032, "grad_norm": 5.88330602645874, "learning_rate": 8.215151515151517e-06, "num_tokens": 1186330.0, "completions/mean_length": 174.875, "completions/min_length": 145.0, "completions/max_length": 200.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 174.875, "completions/min_terminated_length": 145.0, "completions/max_terminated_length": 200.0, "rewards/meter/mean": 0.9274966716766357, "rewards/meter/std": 0.07063567638397217, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.07253516465425491, "rewards/repeat_penalty/std": 0.08631241321563721, "rewards/near_duplicate_penalty/mean": 0.7592816352844238, "rewards/near_duplicate_penalty/std": 0.09269137680530548, "rewards/opening_diversity/mean": 0.7142857313156128, "rewards/opening_diversity/std": 0.23006081581115723, "rewards/distinct_2/mean": 0.15668581426143646, "rewards/distinct_2/std": 0.19408312439918518, "rewards/total_composite/mean": 0.1346191167831421, "rewards/total_composite/std": 0.011395241133868694, "reward": 0.1346191167831421, "reward_std": 0.01139524020254612, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07822994142770767, "sampling/sampling_logp_difference/max": 2.2538514137268066, "sampling/importance_sampling_ratio/min": 0.1437089443206787, "sampling/importance_sampling_ratio/mean": 1.0050102472305298, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4841975122690201, "clip_ratio/low_mean": 0.03451812267303467, "clip_ratio/low_min": 0.03451812267303467, "clip_ratio/high_mean": 0.03097512573003769, "clip_ratio/high_max": 0.03097512573003769, "clip_ratio/region_mean": 0.06549324840307236, "reward_total_mean": 0.1346191167831421, "reward_meter_mean": 0.9274966716766357, "reward_meter_std": 0.07063567638397217, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.07253516465425491, "reward_repeat_penalty_std": 0.08631241321563721, "reward_near_duplicate_penalty_mean": 0.7592816352844238, "reward_near_duplicate_penalty_std": 0.09269137680530548, "reward_opening_diversity_mean": 0.7142857313156128, "reward_opening_diversity_std": 0.23006081581115723, "reward_distinct_2_mean": 0.15668581426143646, "reward_distinct_2_std": 0.19408312439918518, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.1346191167831421, "reward_total_composite_std": 0.011395241133868694} {"timestamp_utc": "2026-04-12T13:05:31Z", "mode": "train", "global_step": 591, "epoch": 0.02373779973490782, "loss": 0.0358, "grad_norm": 11.83116626739502, "learning_rate": 8.212121212121212e-06, "num_tokens": 1188316.0, "completions/mean_length": 73.25, "completions/min_length": 68.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.6335621476173401, "rewards/meter/std": 0.3610627055168152, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9570281505584717, "rewards/repeat_penalty/std": 0.052605655044317245, "rewards/near_duplicate_penalty/mean": 0.9728123545646667, "rewards/near_duplicate_penalty/std": 0.01498380582779646, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9835164546966553, "rewards/distinct_2/std": 0.046622421592473984, "rewards/total_composite/mean": 0.2758263945579529, "rewards/total_composite/std": 0.13896574079990387, "reward": 0.2758263945579529, "reward_std": 0.13896572589874268, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17875981330871582, "sampling/sampling_logp_difference/max": 1.8909282684326172, "sampling/importance_sampling_ratio/min": 0.15093164145946503, "sampling/importance_sampling_ratio/mean": 1.0222339630126953, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4100866466760635, "clip_ratio/low_mean": 0.07188650220632553, "clip_ratio/low_min": 0.07188650220632553, "clip_ratio/high_mean": 0.07916142418980598, "clip_ratio/high_max": 0.07916142418980598, "clip_ratio/region_mean": 0.15104792639613152, "reward_total_mean": 0.2758263945579529, "reward_meter_mean": 0.6335621476173401, "reward_meter_std": 0.3610627055168152, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9570281505584717, "reward_repeat_penalty_std": 0.052605655044317245, "reward_near_duplicate_penalty_mean": 0.9728123545646667, "reward_near_duplicate_penalty_std": 0.01498380582779646, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9835164546966553, "reward_distinct_2_std": 0.046622421592473984, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.2758263945579529, "reward_total_composite_std": 0.13896574079990387} {"timestamp_utc": "2026-04-12T13:05:42Z", "mode": "train", "global_step": 592, "epoch": 0.023777965216692773, "loss": -0.002, "grad_norm": 9.355712890625, "learning_rate": 8.20909090909091e-06, "num_tokens": 1190774.0, "completions/mean_length": 108.25, "completions/min_length": 91.0, "completions/max_length": 115.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 108.25, "completions/min_terminated_length": 91.0, "completions/max_terminated_length": 115.0, "rewards/meter/mean": 0.6430141925811768, "rewards/meter/std": 0.26479583978652954, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.46775728464126587, "rewards/repeat_penalty/std": 0.2647733688354492, "rewards/near_duplicate_penalty/mean": 0.8557314872741699, "rewards/near_duplicate_penalty/std": 0.1383117288351059, "rewards/opening_diversity/mean": 0.729687511920929, "rewards/opening_diversity/std": 0.25477033853530884, "rewards/distinct_2/mean": 0.6347394585609436, "rewards/distinct_2/std": 0.24497342109680176, "rewards/total_composite/mean": 0.19323819875717163, "rewards/total_composite/std": 0.1093558818101883, "reward": 0.19323819875717163, "reward_std": 0.10935588926076889, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12800531089305878, "sampling/sampling_logp_difference/max": 1.877915382385254, "sampling/importance_sampling_ratio/min": 0.1529085338115692, "sampling/importance_sampling_ratio/mean": 1.002397060394287, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8475909605622292, "clip_ratio/low_mean": 0.055872602853924036, "clip_ratio/low_min": 0.055872602853924036, "clip_ratio/high_mean": 0.0824524313211441, "clip_ratio/high_max": 0.0824524313211441, "clip_ratio/region_mean": 0.13832503417506814, "reward_total_mean": 0.19323819875717163, "reward_meter_mean": 0.6430141925811768, "reward_meter_std": 0.26479583978652954, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.46775728464126587, "reward_repeat_penalty_std": 0.2647733688354492, "reward_near_duplicate_penalty_mean": 0.8557314872741699, "reward_near_duplicate_penalty_std": 0.1383117288351059, "reward_opening_diversity_mean": 0.729687511920929, "reward_opening_diversity_std": 0.25477033853530884, "reward_distinct_2_mean": 0.6347394585609436, "reward_distinct_2_std": 0.24497342109680176, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.19323819875717163, "reward_total_composite_std": 0.1093558818101883} {"timestamp_utc": "2026-04-12T13:05:53Z", "mode": "train", "global_step": 593, "epoch": 0.023818130698477727, "loss": 0.0391, "grad_norm": 5.09604024887085, "learning_rate": 8.206060606060607e-06, "num_tokens": 1193512.0, "completions/mean_length": 158.25, "completions/min_length": 140.0, "completions/max_length": 173.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 158.25, "completions/min_terminated_length": 140.0, "completions/max_terminated_length": 173.0, "rewards/meter/mean": 0.9881192445755005, "rewards/meter/std": 0.004923494532704353, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.0976167768239975, "rewards/repeat_penalty/std": 0.12892010807991028, "rewards/near_duplicate_penalty/mean": 0.6389048099517822, "rewards/near_duplicate_penalty/std": 0.16052363812923431, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.22903135418891907, "rewards/distinct_2/mean": 0.1999150812625885, "rewards/distinct_2/std": 0.1849735677242279, "rewards/total_composite/mean": 0.24686813354492188, "rewards/total_composite/std": 0.10521165281534195, "reward": 0.24686813354492188, "reward_std": 0.10521166771650314, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06000611186027527, "sampling/sampling_logp_difference/max": 1.356687068939209, "sampling/importance_sampling_ratio/min": 0.25751248002052307, "sampling/importance_sampling_ratio/mean": 1.0063353776931763, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4491439461708069, "clip_ratio/low_mean": 0.018415135331451893, "clip_ratio/low_min": 0.018415135331451893, "clip_ratio/high_mean": 0.03881014045327902, "clip_ratio/high_max": 0.03881014045327902, "clip_ratio/region_mean": 0.05722527578473091, "reward_total_mean": 0.24686813354492188, "reward_meter_mean": 0.9881192445755005, "reward_meter_std": 0.004923494532704353, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0976167768239975, "reward_repeat_penalty_std": 0.12892010807991028, "reward_near_duplicate_penalty_mean": 0.6389048099517822, "reward_near_duplicate_penalty_std": 0.16052363812923431, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.22903135418891907, "reward_distinct_2_mean": 0.1999150812625885, "reward_distinct_2_std": 0.1849735677242279, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.24686813354492188, "reward_total_composite_std": 0.10521165281534195} {"timestamp_utc": "2026-04-12T13:06:07Z", "mode": "train", "global_step": 594, "epoch": 0.02385829618026268, "loss": -0.0704, "grad_norm": 2.8470280170440674, "learning_rate": 8.203030303030304e-06, "num_tokens": 1195056.0, "completions/mean_length": 222.0, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 48.0, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.4698549509048462, "rewards/meter/std": 0.4591921865940094, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8958449959754944, "rewards/lexical_plausibility/std": 0.12080350518226624, "rewards/judge_quality/mean": 0.28125, "rewards/judge_quality/std": 0.2086307406425476, "rewards/repeat_penalty/mean": 0.9939273595809937, "rewards/repeat_penalty/std": 0.013081302866339684, "rewards/near_duplicate_penalty/mean": 0.9939273595809937, "rewards/near_duplicate_penalty/std": 0.013081302866339684, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13311700522899628, "rewards/total_composite/std": 0.18157075345516205, "reward": 0.13311700522899628, "reward_std": 0.18157075345516205, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18174710869789124, "sampling/sampling_logp_difference/max": 1.377575159072876, "sampling/importance_sampling_ratio/min": 0.2521893382072449, "sampling/importance_sampling_ratio/mean": 1.034491777420044, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9815448224544525, "clip_ratio/low_mean": 0.030424287542700768, "clip_ratio/low_min": 0.030424287542700768, "clip_ratio/high_mean": 0.06478696875274181, "clip_ratio/high_max": 0.06478696875274181, "clip_ratio/region_mean": 0.09521125629544258, "reward_total_mean": 0.13311700522899628, "reward_meter_mean": 0.4698549509048462, "reward_meter_std": 0.4591921865940094, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8958449959754944, "reward_lexical_plausibility_std": 0.12080350518226624, "reward_repeat_penalty_mean": 0.9939273595809937, "reward_repeat_penalty_std": 0.013081302866339684, "reward_near_duplicate_penalty_mean": 0.9939273595809937, "reward_near_duplicate_penalty_std": 0.013081302866339684, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.28125, "reward_judge_quality_std": 0.2086307406425476, "reward_total_composite_mean": 0.13311700522899628, "reward_total_composite_std": 0.18157075345516205} {"timestamp_utc": "2026-04-12T13:06:17Z", "mode": "train", "global_step": 595, "epoch": 0.023898461662047635, "loss": 0.013, "grad_norm": 8.841227531433105, "learning_rate": 8.2e-06, "num_tokens": 1197953.0, "completions/mean_length": 142.125, "completions/min_length": 127.0, "completions/max_length": 151.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 142.125, "completions/min_terminated_length": 127.0, "completions/max_terminated_length": 151.0, "rewards/meter/mean": 0.9749481678009033, "rewards/meter/std": 0.014264386147260666, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.7836911678314209, "rewards/repeat_penalty/std": 0.09300744533538818, "rewards/near_duplicate_penalty/mean": 0.9508271217346191, "rewards/near_duplicate_penalty/std": 0.0181761272251606, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0578637570142746, "rewards/distinct_2/mean": 0.8482184410095215, "rewards/distinct_2/std": 0.050839297473430634, "rewards/total_composite/mean": 0.35877329111099243, "rewards/total_composite/std": 0.0758342295885086, "reward": 0.35877329111099243, "reward_std": 0.0758342295885086, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14057113230228424, "sampling/sampling_logp_difference/max": 3.4908461570739746, "sampling/importance_sampling_ratio/min": 0.03047507256269455, "sampling/importance_sampling_ratio/mean": 1.0044574737548828, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8607720509171486, "clip_ratio/low_mean": 0.07302203122526407, "clip_ratio/low_min": 0.07302203122526407, "clip_ratio/high_mean": 0.05689534358680248, "clip_ratio/high_max": 0.05689534358680248, "clip_ratio/region_mean": 0.12991737481206656, "reward_total_mean": 0.35877329111099243, "reward_meter_mean": 0.9749481678009033, "reward_meter_std": 0.014264386147260666, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7836911678314209, "reward_repeat_penalty_std": 0.09300744533538818, "reward_near_duplicate_penalty_mean": 0.9508271217346191, "reward_near_duplicate_penalty_std": 0.0181761272251606, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0578637570142746, "reward_distinct_2_mean": 0.8482184410095215, "reward_distinct_2_std": 0.050839297473430634, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.35877329111099243, "reward_total_composite_std": 0.0758342295885086} {"timestamp_utc": "2026-04-12T13:06:27Z", "mode": "train", "global_step": 596, "epoch": 0.02393862714383259, "loss": -0.0029, "grad_norm": 11.209979057312012, "learning_rate": 8.196969696969698e-06, "num_tokens": 1199548.0, "completions/mean_length": 46.375, "completions/min_length": 40.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.375, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8741564750671387, "rewards/meter/std": 0.21297281980514526, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7300000190734863, "rewards/judge_quality/std": 0.2331155687570572, "rewards/repeat_penalty/mean": 0.7269378900527954, "rewards/repeat_penalty/std": 0.2766073942184448, "rewards/near_duplicate_penalty/mean": 0.9295974969863892, "rewards/near_duplicate_penalty/std": 0.045377690345048904, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.9116463661193848, "rewards/distinct_2/std": 0.09794268012046814, "rewards/total_composite/mean": 0.6433532238006592, "rewards/total_composite/std": 0.276895672082901, "reward": 0.6433532238006592, "reward_std": 0.2768957018852234, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10909253358840942, "sampling/sampling_logp_difference/max": 2.1995065212249756, "sampling/importance_sampling_ratio/min": 0.11085785180330276, "sampling/importance_sampling_ratio/mean": 0.9987157583236694, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8462506011128426, "clip_ratio/low_mean": 0.03605072549544275, "clip_ratio/low_min": 0.03605072549544275, "clip_ratio/high_mean": 0.07286687940359116, "clip_ratio/high_max": 0.07286687940359116, "clip_ratio/region_mean": 0.1089176048990339, "reward_total_mean": 0.6433532238006592, "reward_meter_mean": 0.8741564750671387, "reward_meter_std": 0.21297281980514526, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7269378900527954, "reward_repeat_penalty_std": 0.2766073942184448, "reward_near_duplicate_penalty_mean": 0.9295974969863892, "reward_near_duplicate_penalty_std": 0.045377690345048904, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.9116463661193848, "reward_distinct_2_std": 0.09794268012046814, "reward_judge_quality_mean": 0.7300000190734863, "reward_judge_quality_std": 0.2331155687570572, "reward_total_composite_mean": 0.6433532238006592, "reward_total_composite_std": 0.276895672082901} {"timestamp_utc": "2026-04-12T13:06:40Z", "mode": "train", "global_step": 597, "epoch": 0.023978792625617543, "loss": -0.0327, "grad_norm": 2.5110538005828857, "learning_rate": 8.193939393939394e-06, "num_tokens": 1200851.0, "completions/mean_length": 144.875, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 22.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.6916502714157104, "rewards/meter/std": 0.43547436594963074, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8985511660575867, "rewards/lexical_plausibility/std": 0.19062189757823944, "rewards/judge_quality/mean": 0.2587500214576721, "rewards/judge_quality/std": 0.2947850525379181, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22420215606689453, "rewards/total_composite/std": 0.2921702265739441, "reward": 0.22420215606689453, "reward_std": 0.2921702265739441, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1687224805355072, "sampling/sampling_logp_difference/max": 1.0874176025390625, "sampling/importance_sampling_ratio/min": 0.33708587288856506, "sampling/importance_sampling_ratio/mean": 1.054047703742981, "sampling/importance_sampling_ratio/max": 1.8535075187683105, "entropy": 1.0874253511428833, "clip_ratio/low_mean": 0.09645562805235386, "clip_ratio/low_min": 0.09645562805235386, "clip_ratio/high_mean": 0.048958332277834415, "clip_ratio/high_max": 0.048958332277834415, "clip_ratio/region_mean": 0.14541396033018827, "reward_total_mean": 0.22420215606689453, "reward_meter_mean": 0.6916502714157104, "reward_meter_std": 0.43547436594963074, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8985511660575867, "reward_lexical_plausibility_std": 0.19062189757823944, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2587500214576721, "reward_judge_quality_std": 0.2947850525379181, "reward_total_composite_mean": 0.22420215606689453, "reward_total_composite_std": 0.2921702265739441} {"timestamp_utc": "2026-04-12T13:06:54Z", "mode": "train", "global_step": 598, "epoch": 0.024018958107402497, "loss": -0.232, "grad_norm": 2.3085203170776367, "learning_rate": 8.190909090909091e-06, "num_tokens": 1203279.0, "completions/mean_length": 228.5, "completions/min_length": 126.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 134.0, "completions/min_terminated_length": 126.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.86614990234375, "rewards/meter/std": 0.3320692181587219, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.2976095378398895, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9482486248016357, "rewards/lexical_plausibility/std": 0.09619145840406418, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.8865271806716919, "rewards/repeat_penalty/std": 0.14012016355991364, "rewards/near_duplicate_penalty/mean": 0.969161331653595, "rewards/near_duplicate_penalty/std": 0.03032568469643593, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9205664992332458, "rewards/distinct_2/std": 0.09932316094636917, "rewards/total_composite/mean": 0.3072720766067505, "rewards/total_composite/std": 0.19429200887680054, "reward": 0.3072720766067505, "reward_std": 0.19429200887680054, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14834855496883392, "sampling/sampling_logp_difference/max": 1.7641253471374512, "sampling/importance_sampling_ratio/min": 0.1713365763425827, "sampling/importance_sampling_ratio/mean": 1.0215569734573364, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9741218537092209, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.10811312682926655, "clip_ratio/high_max": 0.10811312682926655, "clip_ratio/region_mean": 0.10811312682926655, "reward_total_mean": 0.3072720766067505, "reward_meter_mean": 0.86614990234375, "reward_meter_std": 0.3320692181587219, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.2976095378398895, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9482486248016357, "reward_lexical_plausibility_std": 0.09619145840406418, "reward_repeat_penalty_mean": 0.8865271806716919, "reward_repeat_penalty_std": 0.14012016355991364, "reward_near_duplicate_penalty_mean": 0.969161331653595, "reward_near_duplicate_penalty_std": 0.03032568469643593, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9205664992332458, "reward_distinct_2_std": 0.09932316094636917, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.3072720766067505, "reward_total_composite_std": 0.19429200887680054} {"timestamp_utc": "2026-04-12T13:07:09Z", "mode": "train", "global_step": 599, "epoch": 0.024059123589187454, "loss": -0.3541, "grad_norm": 0.9565184712409973, "learning_rate": 8.187878787878788e-06, "num_tokens": 1207013.0, "completions/mean_length": 391.75, "completions/min_length": 316.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 351.66668701171875, "completions/min_terminated_length": 316.0, "completions/max_terminated_length": 406.0, "rewards/meter/mean": 0.7749155759811401, "rewards/meter/std": 0.36531969904899597, "rewards/count_adherence/mean": 0.6607142686843872, "rewards/count_adherence/std": 0.36770108342170715, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9490639567375183, "rewards/lexical_plausibility/std": 0.0980229303240776, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.21573305130004883, "rewards/repeat_penalty/std": 0.4061233401298523, "rewards/near_duplicate_penalty/mean": 0.4996299147605896, "rewards/near_duplicate_penalty/std": 0.3419327139854431, "rewards/opening_diversity/mean": 0.3902803361415863, "rewards/opening_diversity/std": 0.39332956075668335, "rewards/distinct_2/mean": 0.2485092431306839, "rewards/distinct_2/std": 0.4601607620716095, "rewards/total_composite/mean": 0.09274835884571075, "rewards/total_composite/std": 0.05764620378613472, "reward": 0.09274835884571075, "reward_std": 0.05764620378613472, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.030050111934542656, "sampling/sampling_logp_difference/max": 1.4638023376464844, "sampling/importance_sampling_ratio/min": 0.23135492205619812, "sampling/importance_sampling_ratio/mean": 1.005531907081604, "sampling/importance_sampling_ratio/max": 1.9063942432403564, "entropy": 0.19107347913086414, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.017522387322969735, "clip_ratio/high_max": 0.017522387322969735, "clip_ratio/region_mean": 0.017522387322969735, "reward_total_mean": 0.09274835884571075, "reward_meter_mean": 0.7749155759811401, "reward_meter_std": 0.36531969904899597, "reward_count_adherence_mean": 0.6607142686843872, "reward_count_adherence_std": 0.36770108342170715, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9490639567375183, "reward_lexical_plausibility_std": 0.0980229303240776, "reward_repeat_penalty_mean": 0.21573305130004883, "reward_repeat_penalty_std": 0.4061233401298523, "reward_near_duplicate_penalty_mean": 0.4996299147605896, "reward_near_duplicate_penalty_std": 0.3419327139854431, "reward_opening_diversity_mean": 0.3902803361415863, "reward_opening_diversity_std": 0.39332956075668335, "reward_distinct_2_mean": 0.2485092431306839, "reward_distinct_2_std": 0.4601607620716095, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.09274835884571075, "reward_total_composite_std": 0.05764620378613472} {"timestamp_utc": "2026-04-12T13:07:23Z", "mode": "train", "global_step": 600, "epoch": 0.024099289070972408, "loss": -0.1437, "grad_norm": 2.395522117614746, "learning_rate": 8.184848484848486e-06, "num_tokens": 1208870.0, "completions/mean_length": 248.125, "completions/min_length": 87.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 89.80000305175781, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.7769525051116943, "rewards/meter/std": 0.2592514157295227, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.18898223340511322, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.901878833770752, "rewards/lexical_plausibility/std": 0.14493505656719208, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.7106788754463196, "rewards/repeat_penalty/std": 0.3217860162258148, "rewards/near_duplicate_penalty/mean": 0.9214297533035278, "rewards/near_duplicate_penalty/std": 0.09038443118333817, "rewards/opening_diversity/mean": 0.8415178656578064, "rewards/opening_diversity/std": 0.2187955528497696, "rewards/distinct_2/mean": 0.8476666212081909, "rewards/distinct_2/std": 0.18866392970085144, "rewards/total_composite/mean": 0.20124664902687073, "rewards/total_composite/std": 0.17528368532657623, "reward": 0.20124664902687073, "reward_std": 0.17528368532657623, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13525071740150452, "sampling/sampling_logp_difference/max": 1.5899407863616943, "sampling/importance_sampling_ratio/min": 0.20393767952919006, "sampling/importance_sampling_ratio/mean": 1.0231225490570068, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5701515153050423, "clip_ratio/low_mean": 0.007102272938936949, "clip_ratio/low_min": 0.007102272938936949, "clip_ratio/high_mean": 0.0804181657731533, "clip_ratio/high_max": 0.0804181657731533, "clip_ratio/region_mean": 0.08752043871209025, "reward_total_mean": 0.20124664902687073, "reward_meter_mean": 0.7769525051116943, "reward_meter_std": 0.2592514157295227, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.18898223340511322, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.901878833770752, "reward_lexical_plausibility_std": 0.14493505656719208, "reward_repeat_penalty_mean": 0.7106788754463196, "reward_repeat_penalty_std": 0.3217860162258148, "reward_near_duplicate_penalty_mean": 0.9214297533035278, "reward_near_duplicate_penalty_std": 0.09038443118333817, "reward_opening_diversity_mean": 0.8415178656578064, "reward_opening_diversity_std": 0.2187955528497696, "reward_distinct_2_mean": 0.8476666212081909, "reward_distinct_2_std": 0.18866392970085144, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.20124664902687073, "reward_total_composite_std": 0.17528368532657623} {"timestamp_utc": "2026-04-12T13:09:58Z", "mode": "eval", "global_step": 600, "epoch": 0.024099289070972408, "eval_loss": NaN, "eval_runtime": 154.3055, "eval_samples_per_second": 0.674, "eval_steps_per_second": 0.084, "eval_num_tokens": 1208870.0, "eval_completions/mean_length": 240.84615384615384, "eval_completions/min_length": 49.76923076923077, "eval_completions/max_length": 482.15384615384613, "eval_completions/clipped_ratio": 0.23076923076923078, "eval_completions/mean_terminated_length": 161.69963836669922, "eval_completions/min_terminated_length": 49.76923076923077, "eval_completions/max_terminated_length": 322.7692307692308, "eval_rewards/meter/mean": 0.5123148812697484, "eval_rewards/meter/std": 0.38864422073731053, "eval_rewards/count_adherence/mean": 0.8358814578789932, "eval_rewards/count_adherence/std": 0.24184314992565376, "eval_rewards/arabic_clean/mean": 0.7788461538461539, "eval_rewards/arabic_clean/std": 0.4062624206909767, "eval_rewards/lexical_plausibility/mean": 0.9462600946426392, "eval_rewards/lexical_plausibility/std": 0.09318991621526387, "eval_rewards/judge_quality/mean": 0.2827884600712703, "eval_rewards/judge_quality/std": 0.18655071120995742, "eval_rewards/repeat_penalty/mean": 0.7113298040169936, "eval_rewards/repeat_penalty/std": 0.35973638869248903, "eval_rewards/near_duplicate_penalty/mean": 0.9038105607032776, "eval_rewards/near_duplicate_penalty/std": 0.13724762401901758, "eval_rewards/opening_diversity/mean": 0.9311670752672049, "eval_rewards/opening_diversity/std": 0.12307891335624915, "eval_rewards/distinct_2/mean": 0.7650806307792664, "eval_rewards/distinct_2/std": 0.3487296878145291, "eval_rewards/total_composite/mean": 0.13370628081835234, "eval_rewards/total_composite/std": 0.1360558053621879, "eval_reward": 0.13370628081835234, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06334158462973741, "eval_sampling/sampling_logp_difference/max": 1.0068141497098482, "eval_sampling/importance_sampling_ratio/min": 0.36993258733015794, "eval_sampling/importance_sampling_ratio/mean": 1.0165570974349976, "eval_sampling/importance_sampling_ratio/max": 1.5171292561751146, "eval_entropy": 0.7645946099207952, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.13370628081835234, "eval_reward_meter_mean": 0.5123148812697484, "eval_reward_meter_std": 0.38864422073731053, "eval_reward_count_adherence_mean": 0.8358814578789932, "eval_reward_count_adherence_std": 0.24184314992565376, "eval_reward_arabic_clean_mean": 0.7788461538461539, "eval_reward_arabic_clean_std": 0.4062624206909767, "eval_reward_lexical_plausibility_mean": 0.9462600946426392, "eval_reward_lexical_plausibility_std": 0.09318991621526387, "eval_reward_repeat_penalty_mean": 0.7113298040169936, "eval_reward_repeat_penalty_std": 0.35973638869248903, "eval_reward_near_duplicate_penalty_mean": 0.9038105607032776, "eval_reward_near_duplicate_penalty_std": 0.13724762401901758, "eval_reward_opening_diversity_mean": 0.9311670752672049, "eval_reward_opening_diversity_std": 0.12307891335624915, "eval_reward_distinct_2_mean": 0.7650806307792664, "eval_reward_distinct_2_std": 0.3487296878145291, "eval_reward_judge_quality_mean": 0.2827884600712703, "eval_reward_judge_quality_std": 0.18655071120995742, "eval_reward_total_composite_mean": 0.13370628081835234, "eval_reward_total_composite_std": 0.1360558053621879} {"timestamp_utc": "2026-04-12T13:10:14Z", "mode": "train", "global_step": 601, "epoch": 0.024139454552757362, "loss": -0.0498, "grad_norm": 1.9377853870391846, "learning_rate": 8.181818181818183e-06, "num_tokens": 1210352.0, "completions/mean_length": 218.25, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.2855945825576782, "rewards/meter/std": 0.35705050826072693, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.890587568283081, "rewards/lexical_plausibility/std": 0.15190117061138153, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.29587340354919434, "rewards/repeat_penalty/mean": 0.8381612300872803, "rewards/repeat_penalty/std": 0.19212819635868073, "rewards/near_duplicate_penalty/mean": 0.9620789289474487, "rewards/near_duplicate_penalty/std": 0.052541568875312805, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9505941271781921, "rewards/distinct_2/std": 0.10680097341537476, "rewards/total_composite/mean": 0.10880088061094284, "rewards/total_composite/std": 0.1451246440410614, "reward": 0.10880088061094284, "reward_std": 0.1451246440410614, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12478195130825043, "sampling/sampling_logp_difference/max": 0.9111672639846802, "sampling/importance_sampling_ratio/min": 0.40205466747283936, "sampling/importance_sampling_ratio/mean": 1.024455189704895, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7010936513543129, "clip_ratio/low_mean": 0.0299990214407444, "clip_ratio/low_min": 0.0299990214407444, "clip_ratio/high_mean": 0.02738095261156559, "clip_ratio/high_max": 0.02738095261156559, "clip_ratio/region_mean": 0.05737997405230999, "reward_total_mean": 0.10880088061094284, "reward_meter_mean": 0.2855945825576782, "reward_meter_std": 0.35705050826072693, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.890587568283081, "reward_lexical_plausibility_std": 0.15190117061138153, "reward_repeat_penalty_mean": 0.8381612300872803, "reward_repeat_penalty_std": 0.19212819635868073, "reward_near_duplicate_penalty_mean": 0.9620789289474487, "reward_near_duplicate_penalty_std": 0.052541568875312805, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9505941271781921, "reward_distinct_2_std": 0.10680097341537476, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.29587340354919434, "reward_total_composite_mean": 0.10880088061094284, "reward_total_composite_std": 0.1451246440410614} {"timestamp_utc": "2026-04-12T13:10:23Z", "mode": "train", "global_step": 602, "epoch": 0.024179620034542316, "loss": 0.0884, "grad_norm": 16.810245513916016, "learning_rate": 8.17878787878788e-06, "num_tokens": 1211849.0, "completions/mean_length": 32.125, "completions/min_length": 29.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.626380443572998, "rewards/meter/std": 0.3864566683769226, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.2794605791568756, "rewards/repeat_penalty/mean": 0.949288010597229, "rewards/repeat_penalty/std": 0.04986143112182617, "rewards/near_duplicate_penalty/mean": 0.9612667560577393, "rewards/near_duplicate_penalty/std": 0.02451680414378643, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.4113466739654541, "rewards/total_composite/std": 0.3315257132053375, "reward": 0.4113466739654541, "reward_std": 0.3315257132053375, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1796492040157318, "sampling/sampling_logp_difference/max": 1.7996973991394043, "sampling/importance_sampling_ratio/min": 0.16534891724586487, "sampling/importance_sampling_ratio/mean": 1.0236263275146484, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2363914623856544, "clip_ratio/low_mean": 0.08908404689282179, "clip_ratio/low_min": 0.08908404689282179, "clip_ratio/high_mean": 0.05182291753590107, "clip_ratio/high_max": 0.05182291753590107, "clip_ratio/region_mean": 0.14090696442872286, "reward_total_mean": 0.4113466739654541, "reward_meter_mean": 0.626380443572998, "reward_meter_std": 0.3864566683769226, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.949288010597229, "reward_repeat_penalty_std": 0.04986143112182617, "reward_near_duplicate_penalty_mean": 0.9612667560577393, "reward_near_duplicate_penalty_std": 0.02451680414378643, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.2794605791568756, "reward_total_composite_mean": 0.4113466739654541, "reward_total_composite_std": 0.3315257132053375} {"timestamp_utc": "2026-04-12T13:10:36Z", "mode": "train", "global_step": 603, "epoch": 0.02421978551632727, "loss": 0.0211, "grad_norm": 3.903568744659424, "learning_rate": 8.175757575757577e-06, "num_tokens": 1215831.0, "completions/mean_length": 284.75, "completions/min_length": 259.0, "completions/max_length": 351.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 284.75, "completions/min_terminated_length": 259.0, "completions/max_terminated_length": 351.0, "rewards/meter/mean": 0.8659458160400391, "rewards/meter/std": 0.21825405955314636, "rewards/count_adherence/mean": 0.9807692170143127, "rewards/count_adherence/std": 0.03560846298933029, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.004345335997641087, "rewards/repeat_penalty/std": 0.012290466576814651, "rewards/near_duplicate_penalty/mean": 0.44887831807136536, "rewards/near_duplicate_penalty/std": 0.1940241903066635, "rewards/opening_diversity/mean": 0.49038463830947876, "rewards/opening_diversity/std": 0.3376176357269287, "rewards/distinct_2/mean": 0.008531960658729076, "rewards/distinct_2/std": 0.024132030084729195, "rewards/total_composite/mean": 0.1512950360774994, "rewards/total_composite/std": 0.09996257722377777, "reward": 0.1512950360774994, "reward_std": 0.09996257722377777, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05523812770843506, "sampling/sampling_logp_difference/max": 3.0551135540008545, "sampling/importance_sampling_ratio/min": 0.04711737111210823, "sampling/importance_sampling_ratio/mean": 1.0041542053222656, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.35286697559058666, "clip_ratio/low_mean": 0.02745216037146747, "clip_ratio/low_min": 0.02745216037146747, "clip_ratio/high_mean": 0.01791114266961813, "clip_ratio/high_max": 0.01791114266961813, "clip_ratio/region_mean": 0.0453633030410856, "reward_total_mean": 0.1512950360774994, "reward_meter_mean": 0.8659458160400391, "reward_meter_std": 0.21825405955314636, "reward_count_adherence_mean": 0.9807692170143127, "reward_count_adherence_std": 0.03560846298933029, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.004345335997641087, "reward_repeat_penalty_std": 0.012290466576814651, "reward_near_duplicate_penalty_mean": 0.44887831807136536, "reward_near_duplicate_penalty_std": 0.1940241903066635, "reward_opening_diversity_mean": 0.49038463830947876, "reward_opening_diversity_std": 0.3376176357269287, "reward_distinct_2_mean": 0.008531960658729076, "reward_distinct_2_std": 0.024132030084729195, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1512950360774994, "reward_total_composite_std": 0.09996257722377777} {"timestamp_utc": "2026-04-12T13:10:49Z", "mode": "train", "global_step": 604, "epoch": 0.024259950998112224, "loss": -0.041, "grad_norm": 4.592195987701416, "learning_rate": 8.172727272727273e-06, "num_tokens": 1217294.0, "completions/mean_length": 100.875, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.142860412597656, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.46032580733299255, "rewards/meter/std": 0.3890128433704376, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9694451689720154, "rewards/lexical_plausibility/std": 0.08642213046550751, "rewards/judge_quality/mean": 0.53125, "rewards/judge_quality/std": 0.30600830912590027, "rewards/repeat_penalty/mean": 0.8391133546829224, "rewards/repeat_penalty/std": 0.30781739950180054, "rewards/near_duplicate_penalty/mean": 0.9558348655700684, "rewards/near_duplicate_penalty/std": 0.0789102241396904, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.930601954460144, "rewards/distinct_2/std": 0.14452484250068665, "rewards/total_composite/mean": 0.31847354769706726, "rewards/total_composite/std": 0.32631081342697144, "reward": 0.31847354769706726, "reward_std": 0.32631081342697144, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14562717080116272, "sampling/sampling_logp_difference/max": 1.5322856903076172, "sampling/importance_sampling_ratio/min": 0.21604129672050476, "sampling/importance_sampling_ratio/mean": 0.9944778680801392, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8797452300786972, "clip_ratio/low_mean": 0.04144576843827963, "clip_ratio/low_min": 0.04144576843827963, "clip_ratio/high_mean": 0.07772436086088419, "clip_ratio/high_max": 0.07772436086088419, "clip_ratio/region_mean": 0.11917012929916382, "reward_total_mean": 0.31847354769706726, "reward_meter_mean": 0.46032580733299255, "reward_meter_std": 0.3890128433704376, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9694451689720154, "reward_lexical_plausibility_std": 0.08642213046550751, "reward_repeat_penalty_mean": 0.8391133546829224, "reward_repeat_penalty_std": 0.30781739950180054, "reward_near_duplicate_penalty_mean": 0.9558348655700684, "reward_near_duplicate_penalty_std": 0.0789102241396904, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.930601954460144, "reward_distinct_2_std": 0.14452484250068665, "reward_judge_quality_mean": 0.53125, "reward_judge_quality_std": 0.30600830912590027, "reward_total_composite_mean": 0.31847354769706726, "reward_total_composite_std": 0.32631081342697144} {"timestamp_utc": "2026-04-12T13:10:59Z", "mode": "train", "global_step": 605, "epoch": 0.024300116479897178, "loss": 0.0157, "grad_norm": 6.320730209350586, "learning_rate": 8.16969696969697e-06, "num_tokens": 1219948.0, "completions/mean_length": 117.75, "completions/min_length": 90.0, "completions/max_length": 137.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 117.75, "completions/min_terminated_length": 90.0, "completions/max_terminated_length": 137.0, "rewards/meter/mean": 0.9773919582366943, "rewards/meter/std": 0.013674728572368622, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.24494178593158722, "rewards/repeat_penalty/std": 0.1995166391134262, "rewards/near_duplicate_penalty/mean": 0.7836527824401855, "rewards/near_duplicate_penalty/std": 0.1670757383108139, "rewards/opening_diversity/mean": 0.5625, "rewards/opening_diversity/std": 0.2748376131057739, "rewards/distinct_2/mean": 0.4683367908000946, "rewards/distinct_2/std": 0.21342182159423828, "rewards/total_composite/mean": 0.21540188789367676, "rewards/total_composite/std": 0.10226933658123016, "reward": 0.21540188789367676, "reward_std": 0.10226932913064957, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10175961256027222, "sampling/sampling_logp_difference/max": 1.4451415538787842, "sampling/importance_sampling_ratio/min": 0.2357127070426941, "sampling/importance_sampling_ratio/mean": 1.0097334384918213, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7508847042918205, "clip_ratio/low_mean": 0.06030849181115627, "clip_ratio/low_min": 0.06030849181115627, "clip_ratio/high_mean": 0.046880092471838, "clip_ratio/high_max": 0.046880092471838, "clip_ratio/region_mean": 0.10718858428299427, "reward_total_mean": 0.21540188789367676, "reward_meter_mean": 0.9773919582366943, "reward_meter_std": 0.013674728572368622, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.24494178593158722, "reward_repeat_penalty_std": 0.1995166391134262, "reward_near_duplicate_penalty_mean": 0.7836527824401855, "reward_near_duplicate_penalty_std": 0.1670757383108139, "reward_opening_diversity_mean": 0.5625, "reward_opening_diversity_std": 0.2748376131057739, "reward_distinct_2_mean": 0.4683367908000946, "reward_distinct_2_std": 0.21342182159423828, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.21540188789367676, "reward_total_composite_std": 0.10226933658123016} {"timestamp_utc": "2026-04-12T13:11:08Z", "mode": "train", "global_step": 606, "epoch": 0.02434028196168213, "loss": -0.0129, "grad_norm": 19.67855453491211, "learning_rate": 8.166666666666668e-06, "num_tokens": 1221539.0, "completions/mean_length": 34.875, "completions/min_length": 29.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.7507923245429993, "rewards/meter/std": 0.2904006540775299, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7900000214576721, "rewards/judge_quality/std": 0.24219238758087158, "rewards/repeat_penalty/mean": 0.9974340200424194, "rewards/repeat_penalty/std": 0.007257687393575907, "rewards/near_duplicate_penalty/mean": 0.9974340200424194, "rewards/near_duplicate_penalty/std": 0.007257687393575907, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5838419198989868, "rewards/total_composite/std": 0.30834606289863586, "reward": 0.5838419198989868, "reward_std": 0.30834606289863586, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14887173473834991, "sampling/sampling_logp_difference/max": 1.9746841192245483, "sampling/importance_sampling_ratio/min": 0.13880515098571777, "sampling/importance_sampling_ratio/mean": 0.9879239797592163, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.658489890396595, "clip_ratio/low_mean": 0.06835006643086672, "clip_ratio/low_min": 0.06835006643086672, "clip_ratio/high_mean": 0.0649535283446312, "clip_ratio/high_max": 0.0649535283446312, "clip_ratio/region_mean": 0.1333035947754979, "reward_total_mean": 0.5838419198989868, "reward_meter_mean": 0.7507923245429993, "reward_meter_std": 0.2904006540775299, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9974340200424194, "reward_repeat_penalty_std": 0.007257687393575907, "reward_near_duplicate_penalty_mean": 0.9974340200424194, "reward_near_duplicate_penalty_std": 0.007257687393575907, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7900000214576721, "reward_judge_quality_std": 0.24219238758087158, "reward_total_composite_mean": 0.5838419198989868, "reward_total_composite_std": 0.30834606289863586} {"timestamp_utc": "2026-04-12T13:11:18Z", "mode": "train", "global_step": 607, "epoch": 0.024380447443467086, "loss": -0.0017, "grad_norm": 11.003536224365234, "learning_rate": 8.163636363636365e-06, "num_tokens": 1223422.0, "completions/mean_length": 68.375, "completions/min_length": 63.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.375, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.9552795886993408, "rewards/meter/std": 0.050910934805870056, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.7330594062805176, "rewards/repeat_penalty/std": 0.20595264434814453, "rewards/near_duplicate_penalty/mean": 0.9217890501022339, "rewards/near_duplicate_penalty/std": 0.058528222143650055, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8583263158798218, "rewards/distinct_2/std": 0.09201016277074814, "rewards/total_composite/mean": 0.47105875611305237, "rewards/total_composite/std": 0.15274225175380707, "reward": 0.47105875611305237, "reward_std": 0.15274225175380707, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14251470565795898, "sampling/sampling_logp_difference/max": 1.588109016418457, "sampling/importance_sampling_ratio/min": 0.20431159436702728, "sampling/importance_sampling_ratio/mean": 1.0019904375076294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7803902328014374, "clip_ratio/low_mean": 0.08321047015488148, "clip_ratio/low_min": 0.08321047015488148, "clip_ratio/high_mean": 0.02678571455180645, "clip_ratio/high_max": 0.02678571455180645, "clip_ratio/region_mean": 0.10999618470668793, "reward_total_mean": 0.47105875611305237, "reward_meter_mean": 0.9552795886993408, "reward_meter_std": 0.050910934805870056, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7330594062805176, "reward_repeat_penalty_std": 0.20595264434814453, "reward_near_duplicate_penalty_mean": 0.9217890501022339, "reward_near_duplicate_penalty_std": 0.058528222143650055, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8583263158798218, "reward_distinct_2_std": 0.09201016277074814, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.47105875611305237, "reward_total_composite_std": 0.15274225175380707} {"timestamp_utc": "2026-04-12T13:11:27Z", "mode": "train", "global_step": 608, "epoch": 0.02442061292525204, "loss": 0.0353, "grad_norm": 12.383308410644531, "learning_rate": 8.16060606060606e-06, "num_tokens": 1225327.0, "completions/mean_length": 53.125, "completions/min_length": 46.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.125, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.7017092704772949, "rewards/meter/std": 0.36034920811653137, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.4625000059604645, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.9731595516204834, "rewards/repeat_penalty/std": 0.05205292999744415, "rewards/near_duplicate_penalty/mean": 0.9880070686340332, "rewards/near_duplicate_penalty/std": 0.012963104993104935, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9846153855323792, "rewards/distinct_2/std": 0.04351425915956497, "rewards/total_composite/mean": 0.33394530415534973, "rewards/total_composite/std": 0.20485422015190125, "reward": 0.33394530415534973, "reward_std": 0.20485422015190125, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17869995534420013, "sampling/sampling_logp_difference/max": 1.3907296657562256, "sampling/importance_sampling_ratio/min": 0.2751923203468323, "sampling/importance_sampling_ratio/mean": 1.0368835926055908, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4442286118865013, "clip_ratio/low_mean": 0.04861699044704437, "clip_ratio/low_min": 0.04861699044704437, "clip_ratio/high_mean": 0.1034470684826374, "clip_ratio/high_max": 0.1034470684826374, "clip_ratio/region_mean": 0.15206405892968178, "reward_total_mean": 0.33394530415534973, "reward_meter_mean": 0.7017092704772949, "reward_meter_std": 0.36034920811653137, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9731595516204834, "reward_repeat_penalty_std": 0.05205292999744415, "reward_near_duplicate_penalty_mean": 0.9880070686340332, "reward_near_duplicate_penalty_std": 0.012963104993104935, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9846153855323792, "reward_distinct_2_std": 0.04351425915956497, "reward_judge_quality_mean": 0.4625000059604645, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.33394530415534973, "reward_total_composite_std": 0.20485422015190125} {"timestamp_utc": "2026-04-12T13:11:37Z", "mode": "train", "global_step": 609, "epoch": 0.024460778407036993, "loss": 0.0899, "grad_norm": 16.349994659423828, "learning_rate": 8.15757575757576e-06, "num_tokens": 1227038.0, "completions/mean_length": 53.875, "completions/min_length": 47.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.875, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.7870069742202759, "rewards/meter/std": 0.3712165653705597, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9397884011268616, "rewards/repeat_penalty/std": 0.05675487220287323, "rewards/near_duplicate_penalty/mean": 0.9605423212051392, "rewards/near_duplicate_penalty/std": 0.03168892115354538, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9780626893043518, "rewards/distinct_2/std": 0.04296828806400299, "rewards/total_composite/mean": 0.3579288721084595, "rewards/total_composite/std": 0.20732474327087402, "reward": 0.3579288721084595, "reward_std": 0.20732474327087402, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14755448698997498, "sampling/sampling_logp_difference/max": 2.3139448165893555, "sampling/importance_sampling_ratio/min": 0.09887045621871948, "sampling/importance_sampling_ratio/mean": 1.017095923423767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0073984190821648, "clip_ratio/low_mean": 0.05191622208803892, "clip_ratio/low_min": 0.05191622208803892, "clip_ratio/high_mean": 0.11532354354858398, "clip_ratio/high_max": 0.11532354354858398, "clip_ratio/region_mean": 0.1672397656366229, "reward_total_mean": 0.3579288721084595, "reward_meter_mean": 0.7870069742202759, "reward_meter_std": 0.3712165653705597, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9397884011268616, "reward_repeat_penalty_std": 0.05675487220287323, "reward_near_duplicate_penalty_mean": 0.9605423212051392, "reward_near_duplicate_penalty_std": 0.03168892115354538, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9780626893043518, "reward_distinct_2_std": 0.04296828806400299, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.3579288721084595, "reward_total_composite_std": 0.20732474327087402} {"timestamp_utc": "2026-04-12T13:11:51Z", "mode": "train", "global_step": 610, "epoch": 0.024500943888821947, "loss": -0.0639, "grad_norm": 5.973407745361328, "learning_rate": 8.154545454545455e-06, "num_tokens": 1228932.0, "completions/mean_length": 113.75, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.857147216796875, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.7780847549438477, "rewards/meter/std": 0.38483375310897827, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9737052917480469, "rewards/lexical_plausibility/std": 0.07437256723642349, "rewards/judge_quality/mean": 0.39375001192092896, "rewards/judge_quality/std": 0.18407586216926575, "rewards/repeat_penalty/mean": 0.9340187311172485, "rewards/repeat_penalty/std": 0.09607148170471191, "rewards/near_duplicate_penalty/mean": 0.9705223441123962, "rewards/near_duplicate_penalty/std": 0.032134246081113815, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9606755375862122, "rewards/distinct_2/std": 0.07428864389657974, "rewards/total_composite/mean": 0.30759817361831665, "rewards/total_composite/std": 0.23372232913970947, "reward": 0.30759817361831665, "reward_std": 0.23372232913970947, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14644905924797058, "sampling/sampling_logp_difference/max": 1.707603931427002, "sampling/importance_sampling_ratio/min": 0.18129968643188477, "sampling/importance_sampling_ratio/mean": 1.022405743598938, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8063682839274406, "clip_ratio/low_mean": 0.03767339326441288, "clip_ratio/low_min": 0.03767339326441288, "clip_ratio/high_mean": 0.07242566626518965, "clip_ratio/high_max": 0.07242566626518965, "clip_ratio/region_mean": 0.11009905952960253, "reward_total_mean": 0.30759817361831665, "reward_meter_mean": 0.7780847549438477, "reward_meter_std": 0.38483375310897827, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9737052917480469, "reward_lexical_plausibility_std": 0.07437256723642349, "reward_repeat_penalty_mean": 0.9340187311172485, "reward_repeat_penalty_std": 0.09607148170471191, "reward_near_duplicate_penalty_mean": 0.9705223441123962, "reward_near_duplicate_penalty_std": 0.032134246081113815, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9606755375862122, "reward_distinct_2_std": 0.07428864389657974, "reward_judge_quality_mean": 0.39375001192092896, "reward_judge_quality_std": 0.18407586216926575, "reward_total_composite_mean": 0.30759817361831665, "reward_total_composite_std": 0.23372232913970947} {"timestamp_utc": "2026-04-12T13:12:05Z", "mode": "train", "global_step": 611, "epoch": 0.0245411093706069, "loss": -0.028, "grad_norm": 5.934566497802734, "learning_rate": 8.151515151515152e-06, "num_tokens": 1230642.0, "completions/mean_length": 109.75, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.28571701049805, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.42813026905059814, "rewards/meter/std": 0.3249087631702423, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9751070737838745, "rewards/lexical_plausibility/std": 0.07040776312351227, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.36286312341690063, "rewards/repeat_penalty/mean": 0.9826894402503967, "rewards/repeat_penalty/std": 0.027173364534974098, "rewards/near_duplicate_penalty/mean": 0.9913424253463745, "rewards/near_duplicate_penalty/std": 0.010528694838285446, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.19174829125404358, "rewards/total_composite/std": 0.21112436056137085, "reward": 0.19174829125404358, "reward_std": 0.21112436056137085, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15664783120155334, "sampling/sampling_logp_difference/max": 2.4705190658569336, "sampling/importance_sampling_ratio/min": 0.0845409631729126, "sampling/importance_sampling_ratio/mean": 1.0318156480789185, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9008237831294537, "clip_ratio/low_mean": 0.08856004476547241, "clip_ratio/low_min": 0.08856004476547241, "clip_ratio/high_mean": 0.054008278995752335, "clip_ratio/high_max": 0.054008278995752335, "clip_ratio/region_mean": 0.14256832376122475, "reward_total_mean": 0.19174829125404358, "reward_meter_mean": 0.42813026905059814, "reward_meter_std": 0.3249087631702423, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9751070737838745, "reward_lexical_plausibility_std": 0.07040776312351227, "reward_repeat_penalty_mean": 0.9826894402503967, "reward_repeat_penalty_std": 0.027173364534974098, "reward_near_duplicate_penalty_mean": 0.9913424253463745, "reward_near_duplicate_penalty_std": 0.010528694838285446, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.36286312341690063, "reward_total_composite_mean": 0.19174829125404358, "reward_total_composite_std": 0.21112436056137085} {"timestamp_utc": "2026-04-12T13:12:14Z", "mode": "train", "global_step": 612, "epoch": 0.024581274852391855, "loss": 0.0116, "grad_norm": 21.2740478515625, "learning_rate": 8.14848484848485e-06, "num_tokens": 1231954.0, "completions/mean_length": 21.0, "completions/min_length": 17.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.961848258972168, "rewards/meter/std": 0.053047578781843185, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.32262319326400757, "rewards/repeat_penalty/mean": 0.46212121844291687, "rewards/repeat_penalty/std": 0.3830924332141876, "rewards/near_duplicate_penalty/mean": 0.8724478483200073, "rewards/near_duplicate_penalty/std": 0.16538074612617493, "rewards/opening_diversity/mean": 0.46875, "rewards/opening_diversity/std": 0.38816189765930176, "rewards/distinct_2/mean": 0.884615421295166, "rewards/distinct_2/std": 0.15924589335918427, "rewards/total_composite/mean": 0.4156397879123688, "rewards/total_composite/std": 0.30976879596710205, "reward": 0.4156397879123688, "reward_std": 0.30976879596710205, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11739847809076309, "sampling/sampling_logp_difference/max": 1.1665740013122559, "sampling/importance_sampling_ratio/min": 0.3114320635795593, "sampling/importance_sampling_ratio/mean": 1.0275083780288696, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7884392067790031, "clip_ratio/low_mean": 0.0880969543941319, "clip_ratio/low_min": 0.0880969543941319, "clip_ratio/high_mean": 0.004807692486792803, "clip_ratio/high_max": 0.004807692486792803, "clip_ratio/region_mean": 0.0929046468809247, "reward_total_mean": 0.4156397879123688, "reward_meter_mean": 0.961848258972168, "reward_meter_std": 0.053047578781843185, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.46212121844291687, "reward_repeat_penalty_std": 0.3830924332141876, "reward_near_duplicate_penalty_mean": 0.8724478483200073, "reward_near_duplicate_penalty_std": 0.16538074612617493, "reward_opening_diversity_mean": 0.46875, "reward_opening_diversity_std": 0.38816189765930176, "reward_distinct_2_mean": 0.884615421295166, "reward_distinct_2_std": 0.15924589335918427, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.32262319326400757, "reward_total_composite_mean": 0.4156397879123688, "reward_total_composite_std": 0.30976879596710205} {"timestamp_utc": "2026-04-12T13:12:22Z", "mode": "train", "global_step": 613, "epoch": 0.02462144033417681, "loss": -0.0054, "grad_norm": 19.19696617126465, "learning_rate": 8.145454545454547e-06, "num_tokens": 1233401.0, "completions/mean_length": 33.875, "completions/min_length": 30.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.49567335844039917, "rewards/meter/std": 0.407177209854126, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.9988636374473572, "rewards/repeat_penalty/std": 0.003214118769392371, "rewards/near_duplicate_penalty/mean": 0.9988636374473572, "rewards/near_duplicate_penalty/std": 0.003214118769392371, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38026097416877747, "rewards/total_composite/std": 0.3626217246055603, "reward": 0.38026097416877747, "reward_std": 0.3626217246055603, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16059303283691406, "sampling/sampling_logp_difference/max": 1.1132054328918457, "sampling/importance_sampling_ratio/min": 0.3285042643547058, "sampling/importance_sampling_ratio/mean": 1.009480595588684, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8764260411262512, "clip_ratio/low_mean": 0.06027056369930506, "clip_ratio/low_min": 0.06027056369930506, "clip_ratio/high_mean": 0.06838949210941792, "clip_ratio/high_max": 0.06838949210941792, "clip_ratio/region_mean": 0.12866005580872297, "reward_total_mean": 0.38026097416877747, "reward_meter_mean": 0.49567335844039917, "reward_meter_std": 0.407177209854126, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9988636374473572, "reward_repeat_penalty_std": 0.003214118769392371, "reward_near_duplicate_penalty_mean": 0.9988636374473572, "reward_near_duplicate_penalty_std": 0.003214118769392371, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.38026097416877747, "reward_total_composite_std": 0.3626217246055603} {"timestamp_utc": "2026-04-12T13:12:32Z", "mode": "train", "global_step": 614, "epoch": 0.024661605815961763, "loss": 0.0478, "grad_norm": 7.49420690536499, "learning_rate": 8.142424242424242e-06, "num_tokens": 1236292.0, "completions/mean_length": 168.375, "completions/min_length": 148.0, "completions/max_length": 198.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 168.375, "completions/min_terminated_length": 148.0, "completions/max_terminated_length": 198.0, "rewards/meter/mean": 0.9708923101425171, "rewards/meter/std": 0.04286763817071915, "rewards/count_adherence/mean": 0.890625, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.6537837982177734, "rewards/repeat_penalty/std": 0.27695295214653015, "rewards/near_duplicate_penalty/mean": 0.9114950895309448, "rewards/near_duplicate_penalty/std": 0.08545321226119995, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.7120804786682129, "rewards/distinct_2/std": 0.2674011290073395, "rewards/total_composite/mean": 0.19515065848827362, "rewards/total_composite/std": 0.16530510783195496, "reward": 0.19515065848827362, "reward_std": 0.16530510783195496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12216014415025711, "sampling/sampling_logp_difference/max": 1.8836517333984375, "sampling/importance_sampling_ratio/min": 0.15203391015529633, "sampling/importance_sampling_ratio/mean": 1.0056089162826538, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8603750579059124, "clip_ratio/low_mean": 0.03700372390449047, "clip_ratio/low_min": 0.03700372390449047, "clip_ratio/high_mean": 0.09614876471459866, "clip_ratio/high_max": 0.09614876471459866, "clip_ratio/region_mean": 0.13315248861908913, "reward_total_mean": 0.19515065848827362, "reward_meter_mean": 0.9708923101425171, "reward_meter_std": 0.04286763817071915, "reward_count_adherence_mean": 0.890625, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6537837982177734, "reward_repeat_penalty_std": 0.27695295214653015, "reward_near_duplicate_penalty_mean": 0.9114950895309448, "reward_near_duplicate_penalty_std": 0.08545321226119995, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.7120804786682129, "reward_distinct_2_std": 0.2674011290073395, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.19515065848827362, "reward_total_composite_std": 0.16530510783195496} {"timestamp_utc": "2026-04-12T13:12:39Z", "mode": "train", "global_step": 615, "epoch": 0.024701771297746717, "loss": 0.0385, "grad_norm": 20.74620246887207, "learning_rate": 8.139393939393941e-06, "num_tokens": 1237708.0, "completions/mean_length": 22.0, "completions/min_length": 19.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.6093144416809082, "rewards/meter/std": 0.3814626634120941, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7649999856948853, "rewards/judge_quality/std": 0.2979933023452759, "rewards/repeat_penalty/mean": 0.7414772510528564, "rewards/repeat_penalty/std": 0.02410591021180153, "rewards/near_duplicate_penalty/mean": 0.9886363744735718, "rewards/near_duplicate_penalty/std": 0.03214120864868164, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4846035838127136, "rewards/total_composite/std": 0.35006004571914673, "reward": 0.4846035838127136, "reward_std": 0.35006001591682434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17349903285503387, "sampling/sampling_logp_difference/max": 1.5350637435913086, "sampling/importance_sampling_ratio/min": 0.35379427671432495, "sampling/importance_sampling_ratio/mean": 1.0315041542053223, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9633065909147263, "clip_ratio/low_mean": 0.12268170714378357, "clip_ratio/low_min": 0.12268170714378357, "clip_ratio/high_mean": 0.038784585893154144, "clip_ratio/high_max": 0.038784585893154144, "clip_ratio/region_mean": 0.1614662930369377, "reward_total_mean": 0.4846035838127136, "reward_meter_mean": 0.6093144416809082, "reward_meter_std": 0.3814626634120941, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7414772510528564, "reward_repeat_penalty_std": 0.02410591021180153, "reward_near_duplicate_penalty_mean": 0.9886363744735718, "reward_near_duplicate_penalty_std": 0.03214120864868164, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7649999856948853, "reward_judge_quality_std": 0.2979933023452759, "reward_total_composite_mean": 0.4846035838127136, "reward_total_composite_std": 0.35006004571914673} {"timestamp_utc": "2026-04-12T13:12:48Z", "mode": "train", "global_step": 616, "epoch": 0.02474193677953167, "loss": 0.0166, "grad_norm": 15.133147239685059, "learning_rate": 8.136363636363637e-06, "num_tokens": 1239337.0, "completions/mean_length": 48.625, "completions/min_length": 45.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.625, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.9023321866989136, "rewards/meter/std": 0.1227162629365921, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9886363744735718, "rewards/lexical_plausibility/std": 0.03214120864868164, "rewards/judge_quality/mean": 0.7925000190734863, "rewards/judge_quality/std": 0.21211522817611694, "rewards/repeat_penalty/mean": 0.8279917240142822, "rewards/repeat_penalty/std": 0.20133918523788452, "rewards/near_duplicate_penalty/mean": 0.9511077404022217, "rewards/near_duplicate_penalty/std": 0.04021043702960014, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9458041787147522, "rewards/distinct_2/std": 0.08372856676578522, "rewards/total_composite/mean": 0.706574022769928, "rewards/total_composite/std": 0.19633522629737854, "reward": 0.706574022769928, "reward_std": 0.19633522629737854, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15388040244579315, "sampling/sampling_logp_difference/max": 2.0758848190307617, "sampling/importance_sampling_ratio/min": 0.1254453808069229, "sampling/importance_sampling_ratio/mean": 0.9870394468307495, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9838912785053253, "clip_ratio/low_mean": 0.06094952765852213, "clip_ratio/low_min": 0.06094952765852213, "clip_ratio/high_mean": 0.08726144209504128, "clip_ratio/high_max": 0.08726144209504128, "clip_ratio/region_mean": 0.1482109697535634, "reward_total_mean": 0.706574022769928, "reward_meter_mean": 0.9023321866989136, "reward_meter_std": 0.1227162629365921, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9886363744735718, "reward_lexical_plausibility_std": 0.03214120864868164, "reward_repeat_penalty_mean": 0.8279917240142822, "reward_repeat_penalty_std": 0.20133918523788452, "reward_near_duplicate_penalty_mean": 0.9511077404022217, "reward_near_duplicate_penalty_std": 0.04021043702960014, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9458041787147522, "reward_distinct_2_std": 0.08372856676578522, "reward_judge_quality_mean": 0.7925000190734863, "reward_judge_quality_std": 0.21211522817611694, "reward_total_composite_mean": 0.706574022769928, "reward_total_composite_std": 0.19633522629737854} {"timestamp_utc": "2026-04-12T13:12:57Z", "mode": "train", "global_step": 617, "epoch": 0.024782102261316625, "loss": 0.0561, "grad_norm": 11.658555030822754, "learning_rate": 8.133333333333334e-06, "num_tokens": 1241005.0, "completions/mean_length": 50.5, "completions/min_length": 45.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.5, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.4762023091316223, "rewards/meter/std": 0.3319661617279053, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.9491168260574341, "rewards/repeat_penalty/std": 0.04230201989412308, "rewards/near_duplicate_penalty/mean": 0.966844916343689, "rewards/near_duplicate_penalty/std": 0.035048648715019226, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9819197654724121, "rewards/distinct_2/std": 0.03420789912343025, "rewards/total_composite/mean": 0.27313536405563354, "rewards/total_composite/std": 0.2842390835285187, "reward": 0.27313536405563354, "reward_std": 0.2842390835285187, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12931419909000397, "sampling/sampling_logp_difference/max": 1.1296586990356445, "sampling/importance_sampling_ratio/min": 0.32314351201057434, "sampling/importance_sampling_ratio/mean": 1.0486185550689697, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1068106405436993, "clip_ratio/low_mean": 0.07377674616873264, "clip_ratio/low_min": 0.07377674616873264, "clip_ratio/high_mean": 0.04960516653954983, "clip_ratio/high_max": 0.04960516653954983, "clip_ratio/region_mean": 0.12338191270828247, "reward_total_mean": 0.27313536405563354, "reward_meter_mean": 0.4762023091316223, "reward_meter_std": 0.3319661617279053, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9491168260574341, "reward_repeat_penalty_std": 0.04230201989412308, "reward_near_duplicate_penalty_mean": 0.966844916343689, "reward_near_duplicate_penalty_std": 0.035048648715019226, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9819197654724121, "reward_distinct_2_std": 0.03420789912343025, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.27313536405563354, "reward_total_composite_std": 0.2842390835285187} {"timestamp_utc": "2026-04-12T13:13:12Z", "mode": "train", "global_step": 618, "epoch": 0.02482226774310158, "loss": -0.2818, "grad_norm": 3.9043819904327393, "learning_rate": 8.130303030303031e-06, "num_tokens": 1243788.0, "completions/mean_length": 208.875, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 165.57144165039062, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 221.0, "rewards/meter/mean": 0.906912088394165, "rewards/meter/std": 0.12399955838918686, "rewards/count_adherence/mean": 0.734375, "rewards/count_adherence/std": 0.3435470163822174, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9705565571784973, "rewards/lexical_plausibility/std": 0.08327867090702057, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.8192172646522522, "rewards/repeat_penalty/std": 0.12516537308692932, "rewards/near_duplicate_penalty/mean": 0.9616886377334595, "rewards/near_duplicate_penalty/std": 0.023740138858556747, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8889564275741577, "rewards/distinct_2/std": 0.11105122417211533, "rewards/total_composite/mean": 0.23532873392105103, "rewards/total_composite/std": 0.1476844698190689, "reward": 0.23532873392105103, "reward_std": 0.14768445491790771, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15201258659362793, "sampling/sampling_logp_difference/max": 2.5541534423828125, "sampling/importance_sampling_ratio/min": 0.07775802910327911, "sampling/importance_sampling_ratio/mean": 1.0186711549758911, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9685016870498657, "clip_ratio/low_mean": 0.018518518656492233, "clip_ratio/low_min": 0.018518518656492233, "clip_ratio/high_mean": 0.110755305737257, "clip_ratio/high_max": 0.110755305737257, "clip_ratio/region_mean": 0.12927382439374924, "reward_total_mean": 0.23532873392105103, "reward_meter_mean": 0.906912088394165, "reward_meter_std": 0.12399955838918686, "reward_count_adherence_mean": 0.734375, "reward_count_adherence_std": 0.3435470163822174, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9705565571784973, "reward_lexical_plausibility_std": 0.08327867090702057, "reward_repeat_penalty_mean": 0.8192172646522522, "reward_repeat_penalty_std": 0.12516537308692932, "reward_near_duplicate_penalty_mean": 0.9616886377334595, "reward_near_duplicate_penalty_std": 0.023740138858556747, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8889564275741577, "reward_distinct_2_std": 0.11105122417211533, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.23532873392105103, "reward_total_composite_std": 0.1476844698190689} {"timestamp_utc": "2026-04-12T13:13:26Z", "mode": "train", "global_step": 619, "epoch": 0.024862433224886533, "loss": -0.0608, "grad_norm": 2.523797035217285, "learning_rate": 8.127272727272728e-06, "num_tokens": 1245542.0, "completions/mean_length": 297.25, "completions/min_length": 64.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 82.5, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.3566693067550659, "rewards/meter/std": 0.40195488929748535, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8842828869819641, "rewards/lexical_plausibility/std": 0.12774690985679626, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.21380899846553802, "rewards/repeat_penalty/mean": 0.9717923402786255, "rewards/repeat_penalty/std": 0.05927469581365585, "rewards/near_duplicate_penalty/mean": 0.9900150299072266, "rewards/near_duplicate_penalty/std": 0.008720648474991322, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9812382459640503, "rewards/distinct_2/std": 0.05306617170572281, "rewards/total_composite/mean": 0.08977677673101425, "rewards/total_composite/std": 0.1531929075717926, "reward": 0.08977677673101425, "reward_std": 0.1531929075717926, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14239159226417542, "sampling/sampling_logp_difference/max": 1.0537962913513184, "sampling/importance_sampling_ratio/min": 0.3486118018627167, "sampling/importance_sampling_ratio/mean": 1.039147973060608, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6592914760112762, "clip_ratio/low_mean": 0.022849462926387787, "clip_ratio/low_min": 0.022849462926387787, "clip_ratio/high_mean": 0.0557304210960865, "clip_ratio/high_max": 0.0557304210960865, "clip_ratio/region_mean": 0.07857988402247429, "reward_total_mean": 0.08977677673101425, "reward_meter_mean": 0.3566693067550659, "reward_meter_std": 0.40195488929748535, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8842828869819641, "reward_lexical_plausibility_std": 0.12774690985679626, "reward_repeat_penalty_mean": 0.9717923402786255, "reward_repeat_penalty_std": 0.05927469581365585, "reward_near_duplicate_penalty_mean": 0.9900150299072266, "reward_near_duplicate_penalty_std": 0.008720648474991322, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9812382459640503, "reward_distinct_2_std": 0.05306617170572281, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.21380899846553802, "reward_total_composite_mean": 0.08977677673101425, "reward_total_composite_std": 0.1531929075717926} {"timestamp_utc": "2026-04-12T13:13:37Z", "mode": "train", "global_step": 620, "epoch": 0.024902598706671487, "loss": 0.0797, "grad_norm": 7.215310096740723, "learning_rate": 8.124242424242424e-06, "num_tokens": 1248179.0, "completions/mean_length": 131.625, "completions/min_length": 112.0, "completions/max_length": 149.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 131.625, "completions/min_terminated_length": 112.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.9546153545379639, "rewards/meter/std": 0.05853186547756195, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.09161253273487091, "rewards/repeat_penalty/mean": 0.6516979932785034, "rewards/repeat_penalty/std": 0.24182568490505219, "rewards/near_duplicate_penalty/mean": 0.9193305969238281, "rewards/near_duplicate_penalty/std": 0.07163485139608383, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.7071529030799866, "rewards/distinct_2/std": 0.20859256386756897, "rewards/total_composite/mean": 0.17269445955753326, "rewards/total_composite/std": 0.061212316155433655, "reward": 0.17269445955753326, "reward_std": 0.061212316155433655, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14097511768341064, "sampling/sampling_logp_difference/max": 2.991375207901001, "sampling/importance_sampling_ratio/min": 0.05021832883358002, "sampling/importance_sampling_ratio/mean": 1.019101858139038, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9945002570748329, "clip_ratio/low_mean": 0.05802720983047038, "clip_ratio/low_min": 0.05802720983047038, "clip_ratio/high_mean": 0.049660032615065575, "clip_ratio/high_max": 0.049660032615065575, "clip_ratio/region_mean": 0.10768724244553596, "reward_total_mean": 0.17269445955753326, "reward_meter_mean": 0.9546153545379639, "reward_meter_std": 0.05853186547756195, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6516979932785034, "reward_repeat_penalty_std": 0.24182568490505219, "reward_near_duplicate_penalty_mean": 0.9193305969238281, "reward_near_duplicate_penalty_std": 0.07163485139608383, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.7071529030799866, "reward_distinct_2_std": 0.20859256386756897, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.09161253273487091, "reward_total_composite_mean": 0.17269445955753326, "reward_total_composite_std": 0.061212316155433655} {"timestamp_utc": "2026-04-12T13:13:50Z", "mode": "train", "global_step": 621, "epoch": 0.02494276418845644, "loss": -0.0109, "grad_norm": 6.699946880340576, "learning_rate": 8.121212121212121e-06, "num_tokens": 1249647.0, "completions/mean_length": 98.5, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.42857360839844, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.16228392720222473, "rewards/meter/std": 0.1424250602722168, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9783446192741394, "rewards/lexical_plausibility/std": 0.06125066801905632, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.32459867000579834, "rewards/repeat_penalty/mean": 0.9503357410430908, "rewards/repeat_penalty/std": 0.08662397414445877, "rewards/near_duplicate_penalty/mean": 0.991681694984436, "rewards/near_duplicate_penalty/std": 0.018021628260612488, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.13230977952480316, "rewards/total_composite/std": 0.1309736967086792, "reward": 0.13230977952480316, "reward_std": 0.1309736967086792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16338719427585602, "sampling/sampling_logp_difference/max": 4.11427116394043, "sampling/importance_sampling_ratio/min": 0.016337843611836433, "sampling/importance_sampling_ratio/mean": 1.0064324140548706, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6377340257167816, "clip_ratio/low_mean": 0.061812132596969604, "clip_ratio/low_min": 0.061812132596969604, "clip_ratio/high_mean": 0.03415915835648775, "clip_ratio/high_max": 0.03415915835648775, "clip_ratio/region_mean": 0.09597129095345736, "reward_total_mean": 0.13230977952480316, "reward_meter_mean": 0.16228392720222473, "reward_meter_std": 0.1424250602722168, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9783446192741394, "reward_lexical_plausibility_std": 0.06125066801905632, "reward_repeat_penalty_mean": 0.9503357410430908, "reward_repeat_penalty_std": 0.08662397414445877, "reward_near_duplicate_penalty_mean": 0.991681694984436, "reward_near_duplicate_penalty_std": 0.018021628260612488, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.32459867000579834, "reward_total_composite_mean": 0.13230977952480316, "reward_total_composite_std": 0.1309736967086792} {"timestamp_utc": "2026-04-12T13:14:05Z", "mode": "train", "global_step": 622, "epoch": 0.024982929670241395, "loss": -0.0424, "grad_norm": 2.576357841491699, "learning_rate": 8.118181818181819e-06, "num_tokens": 1251084.0, "completions/mean_length": 159.625, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 42.16666793823242, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6240122318267822, "rewards/meter/std": 0.41501474380493164, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9315087795257568, "rewards/lexical_plausibility/std": 0.10194209218025208, "rewards/judge_quality/mean": 0.45499998331069946, "rewards/judge_quality/std": 0.33200690150260925, "rewards/repeat_penalty/mean": 0.741641640663147, "rewards/repeat_penalty/std": 0.2957896590232849, "rewards/near_duplicate_penalty/mean": 0.9325931668281555, "rewards/near_duplicate_penalty/std": 0.07531813532114029, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.9144536256790161, "rewards/distinct_2/std": 0.120970219373703, "rewards/total_composite/mean": 0.32535994052886963, "rewards/total_composite/std": 0.3713827431201935, "reward": 0.32535994052886963, "reward_std": 0.3713827431201935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16923077404499054, "sampling/sampling_logp_difference/max": 1.417853832244873, "sampling/importance_sampling_ratio/min": 0.24223333597183228, "sampling/importance_sampling_ratio/mean": 1.0087859630584717, "sampling/importance_sampling_ratio/max": 1.892889380455017, "entropy": 1.0709325671195984, "clip_ratio/low_mean": 0.0752748791128397, "clip_ratio/low_min": 0.0752748791128397, "clip_ratio/high_mean": 0.032917533069849014, "clip_ratio/high_max": 0.032917533069849014, "clip_ratio/region_mean": 0.10819241218268871, "reward_total_mean": 0.32535994052886963, "reward_meter_mean": 0.6240122318267822, "reward_meter_std": 0.41501474380493164, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9315087795257568, "reward_lexical_plausibility_std": 0.10194209218025208, "reward_repeat_penalty_mean": 0.741641640663147, "reward_repeat_penalty_std": 0.2957896590232849, "reward_near_duplicate_penalty_mean": 0.9325931668281555, "reward_near_duplicate_penalty_std": 0.07531813532114029, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.9144536256790161, "reward_distinct_2_std": 0.120970219373703, "reward_judge_quality_mean": 0.45499998331069946, "reward_judge_quality_std": 0.33200690150260925, "reward_total_composite_mean": 0.32535994052886963, "reward_total_composite_std": 0.3713827431201935} {"timestamp_utc": "2026-04-12T13:14:19Z", "mode": "train", "global_step": 623, "epoch": 0.02502309515202635, "loss": -0.0588, "grad_norm": 1.6638461351394653, "learning_rate": 8.115151515151516e-06, "num_tokens": 1252571.0, "completions/mean_length": 276.875, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 41.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.5826632380485535, "rewards/meter/std": 0.355167418718338, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.869391679763794, "rewards/lexical_plausibility/std": 0.15019075572490692, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9958506226539612, "rewards/repeat_penalty/std": 0.008159920573234558, "rewards/near_duplicate_penalty/mean": 0.9958506226539612, "rewards/near_duplicate_penalty/std": 0.008159920573234558, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13165487349033356, "rewards/total_composite/std": 0.17305083572864532, "reward": 0.13165487349033356, "reward_std": 0.17305083572864532, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17046697437763214, "sampling/sampling_logp_difference/max": 1.659440040588379, "sampling/importance_sampling_ratio/min": 0.19024547934532166, "sampling/importance_sampling_ratio/mean": 1.0163774490356445, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6407098323106766, "clip_ratio/low_mean": 0.016025641933083534, "clip_ratio/low_min": 0.016025641933083534, "clip_ratio/high_mean": 0.05231627356261015, "clip_ratio/high_max": 0.05231627356261015, "clip_ratio/region_mean": 0.06834191549569368, "reward_total_mean": 0.13165487349033356, "reward_meter_mean": 0.5826632380485535, "reward_meter_std": 0.355167418718338, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.869391679763794, "reward_lexical_plausibility_std": 0.15019075572490692, "reward_repeat_penalty_mean": 0.9958506226539612, "reward_repeat_penalty_std": 0.008159920573234558, "reward_near_duplicate_penalty_mean": 0.9958506226539612, "reward_near_duplicate_penalty_std": 0.008159920573234558, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.13165487349033356, "reward_total_composite_std": 0.17305083572864532} {"timestamp_utc": "2026-04-12T13:14:32Z", "mode": "train", "global_step": 624, "epoch": 0.025063260633811302, "loss": -0.0939, "grad_norm": 2.0242741107940674, "learning_rate": 8.112121212121213e-06, "num_tokens": 1254095.0, "completions/mean_length": 169.5, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 55.333335876464844, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.920796275138855, "rewards/meter/std": 0.1217091754078865, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9258214235305786, "rewards/lexical_plausibility/std": 0.12028312683105469, "rewards/judge_quality/mean": 0.3787499964237213, "rewards/judge_quality/std": 0.2630283832550049, "rewards/repeat_penalty/mean": 0.7558110952377319, "rewards/repeat_penalty/std": 0.2434026151895523, "rewards/near_duplicate_penalty/mean": 0.9661861658096313, "rewards/near_duplicate_penalty/std": 0.04693194851279259, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.9123941659927368, "rewards/distinct_2/std": 0.10995517671108246, "rewards/total_composite/mean": 0.3570767641067505, "rewards/total_composite/std": 0.27805736660957336, "reward": 0.3570767641067505, "reward_std": 0.27805736660957336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16967812180519104, "sampling/sampling_logp_difference/max": 1.991382122039795, "sampling/importance_sampling_ratio/min": 0.13650661706924438, "sampling/importance_sampling_ratio/mean": 1.0271700620651245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.095145545899868, "clip_ratio/low_mean": 0.02461662609130144, "clip_ratio/low_min": 0.02461662609130144, "clip_ratio/high_mean": 0.06225738022476435, "clip_ratio/high_max": 0.06225738022476435, "clip_ratio/region_mean": 0.08687400631606579, "reward_total_mean": 0.3570767641067505, "reward_meter_mean": 0.920796275138855, "reward_meter_std": 0.1217091754078865, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9258214235305786, "reward_lexical_plausibility_std": 0.12028312683105469, "reward_repeat_penalty_mean": 0.7558110952377319, "reward_repeat_penalty_std": 0.2434026151895523, "reward_near_duplicate_penalty_mean": 0.9661861658096313, "reward_near_duplicate_penalty_std": 0.04693194851279259, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.9123941659927368, "reward_distinct_2_std": 0.10995517671108246, "reward_judge_quality_mean": 0.3787499964237213, "reward_judge_quality_std": 0.2630283832550049, "reward_total_composite_mean": 0.3570767641067505, "reward_total_composite_std": 0.27805736660957336} {"timestamp_utc": "2026-04-12T13:14:46Z", "mode": "train", "global_step": 625, "epoch": 0.025103426115596256, "loss": -0.0406, "grad_norm": 4.97029447555542, "learning_rate": 8.10909090909091e-06, "num_tokens": 1255726.0, "completions/mean_length": 107.875, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.142860412597656, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.5163154602050781, "rewards/meter/std": 0.3986039161682129, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9473627805709839, "rewards/lexical_plausibility/std": 0.11657222360372543, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.9596666097640991, "rewards/repeat_penalty/std": 0.036881618201732635, "rewards/near_duplicate_penalty/mean": 0.9753938913345337, "rewards/near_duplicate_penalty/std": 0.02577846311032772, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839464426040649, "rewards/distinct_2/std": 0.029759714379906654, "rewards/total_composite/mean": 0.23325850069522858, "rewards/total_composite/std": 0.22179822623729706, "reward": 0.23325850069522858, "reward_std": 0.22179822623729706, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18569746613502502, "sampling/sampling_logp_difference/max": 1.4033632278442383, "sampling/importance_sampling_ratio/min": 0.24576899409294128, "sampling/importance_sampling_ratio/mean": 1.0396032333374023, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9483740329742432, "clip_ratio/low_mean": 0.04591658432036638, "clip_ratio/low_min": 0.04591658432036638, "clip_ratio/high_mean": 0.09515212289988995, "clip_ratio/high_max": 0.09515212289988995, "clip_ratio/region_mean": 0.14106870722025633, "reward_total_mean": 0.23325850069522858, "reward_meter_mean": 0.5163154602050781, "reward_meter_std": 0.3986039161682129, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9473627805709839, "reward_lexical_plausibility_std": 0.11657222360372543, "reward_repeat_penalty_mean": 0.9596666097640991, "reward_repeat_penalty_std": 0.036881618201732635, "reward_near_duplicate_penalty_mean": 0.9753938913345337, "reward_near_duplicate_penalty_std": 0.02577846311032772, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839464426040649, "reward_distinct_2_std": 0.029759714379906654, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.23325850069522858, "reward_total_composite_std": 0.22179822623729706} {"timestamp_utc": "2026-04-12T13:15:00Z", "mode": "train", "global_step": 626, "epoch": 0.02514359159738121, "loss": -0.0912, "grad_norm": 2.7027525901794434, "learning_rate": 8.106060606060606e-06, "num_tokens": 1257290.0, "completions/mean_length": 231.5, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 63.20000076293945, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.6179291605949402, "rewards/meter/std": 0.42140281200408936, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9073654413223267, "rewards/lexical_plausibility/std": 0.13420233130455017, "rewards/judge_quality/mean": 0.3787499964237213, "rewards/judge_quality/std": 0.32166698575019836, "rewards/repeat_penalty/mean": 0.9481266736984253, "rewards/repeat_penalty/std": 0.051743339747190475, "rewards/near_duplicate_penalty/mean": 0.9822664260864258, "rewards/near_duplicate_penalty/std": 0.021032456308603287, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9772042036056519, "rewards/distinct_2/std": 0.02437390573322773, "rewards/total_composite/mean": 0.30892783403396606, "rewards/total_composite/std": 0.34324121475219727, "reward": 0.30892783403396606, "reward_std": 0.34324121475219727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15500257909297943, "sampling/sampling_logp_difference/max": 1.173779010772705, "sampling/importance_sampling_ratio/min": 0.3091962933540344, "sampling/importance_sampling_ratio/mean": 1.0177265405654907, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9733167588710785, "clip_ratio/low_mean": 0.029982023872435093, "clip_ratio/low_min": 0.029982023872435093, "clip_ratio/high_mean": 0.06459018401801586, "clip_ratio/high_max": 0.06459018401801586, "clip_ratio/region_mean": 0.09457220789045095, "reward_total_mean": 0.30892783403396606, "reward_meter_mean": 0.6179291605949402, "reward_meter_std": 0.42140281200408936, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9073654413223267, "reward_lexical_plausibility_std": 0.13420233130455017, "reward_repeat_penalty_mean": 0.9481266736984253, "reward_repeat_penalty_std": 0.051743339747190475, "reward_near_duplicate_penalty_mean": 0.9822664260864258, "reward_near_duplicate_penalty_std": 0.021032456308603287, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9772042036056519, "reward_distinct_2_std": 0.02437390573322773, "reward_judge_quality_mean": 0.3787499964237213, "reward_judge_quality_std": 0.32166698575019836, "reward_total_composite_mean": 0.30892783403396606, "reward_total_composite_std": 0.34324121475219727} {"timestamp_utc": "2026-04-12T13:15:10Z", "mode": "train", "global_step": 627, "epoch": 0.025183757079166164, "loss": -0.0331, "grad_norm": 13.08083438873291, "learning_rate": 8.103030303030303e-06, "num_tokens": 1258791.0, "completions/mean_length": 44.625, "completions/min_length": 38.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.9668298959732056, "rewards/meter/std": 0.03126410022377968, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4675000309944153, "rewards/judge_quality/std": 0.29261142015457153, "rewards/repeat_penalty/mean": 0.9204707145690918, "rewards/repeat_penalty/std": 0.12259316444396973, "rewards/near_duplicate_penalty/mean": 0.9745610356330872, "rewards/near_duplicate_penalty/std": 0.021819118410348892, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9720279574394226, "rewards/distinct_2/std": 0.05644134432077408, "rewards/total_composite/mean": 0.3993763029575348, "rewards/total_composite/std": 0.325158953666687, "reward": 0.3993763029575348, "reward_std": 0.3251589238643646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12139907479286194, "sampling/sampling_logp_difference/max": 1.9642690420150757, "sampling/importance_sampling_ratio/min": 0.14025837182998657, "sampling/importance_sampling_ratio/mean": 1.0100677013397217, "sampling/importance_sampling_ratio/max": 1.6912506818771362, "entropy": 0.8464110419154167, "clip_ratio/low_mean": 0.0733287027105689, "clip_ratio/low_min": 0.0733287027105689, "clip_ratio/high_mean": 0.044492464512586594, "clip_ratio/high_max": 0.044492464512586594, "clip_ratio/region_mean": 0.1178211672231555, "reward_total_mean": 0.3993763029575348, "reward_meter_mean": 0.9668298959732056, "reward_meter_std": 0.03126410022377968, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9204707145690918, "reward_repeat_penalty_std": 0.12259316444396973, "reward_near_duplicate_penalty_mean": 0.9745610356330872, "reward_near_duplicate_penalty_std": 0.021819118410348892, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9720279574394226, "reward_distinct_2_std": 0.05644134432077408, "reward_judge_quality_mean": 0.4675000309944153, "reward_judge_quality_std": 0.29261142015457153, "reward_total_composite_mean": 0.3993763029575348, "reward_total_composite_std": 0.325158953666687} {"timestamp_utc": "2026-04-12T13:15:24Z", "mode": "train", "global_step": 628, "epoch": 0.025223922560951118, "loss": -0.0986, "grad_norm": 2.82222843170166, "learning_rate": 8.1e-06, "num_tokens": 1260449.0, "completions/mean_length": 175.25, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 63.0, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6874505281448364, "rewards/meter/std": 0.4127632975578308, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9381188750267029, "rewards/lexical_plausibility/std": 0.11458229273557663, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.7721683382987976, "rewards/repeat_penalty/std": 0.23168954253196716, "rewards/near_duplicate_penalty/mean": 0.9404508471488953, "rewards/near_duplicate_penalty/std": 0.05880289152264595, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.88327556848526, "rewards/distinct_2/std": 0.12183911353349686, "rewards/total_composite/mean": 0.23909616470336914, "rewards/total_composite/std": 0.2025579810142517, "reward": 0.23909616470336914, "reward_std": 0.2025579810142517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14117272198200226, "sampling/sampling_logp_difference/max": 1.0313647985458374, "sampling/importance_sampling_ratio/min": 0.3565200865268707, "sampling/importance_sampling_ratio/mean": 1.0376149415969849, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8580816984176636, "clip_ratio/low_mean": 0.02217741869390011, "clip_ratio/low_min": 0.02217741869390011, "clip_ratio/high_mean": 0.07609720341861248, "clip_ratio/high_max": 0.07609720341861248, "clip_ratio/region_mean": 0.09827462211251259, "reward_total_mean": 0.23909616470336914, "reward_meter_mean": 0.6874505281448364, "reward_meter_std": 0.4127632975578308, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9381188750267029, "reward_lexical_plausibility_std": 0.11458229273557663, "reward_repeat_penalty_mean": 0.7721683382987976, "reward_repeat_penalty_std": 0.23168954253196716, "reward_near_duplicate_penalty_mean": 0.9404508471488953, "reward_near_duplicate_penalty_std": 0.05880289152264595, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.88327556848526, "reward_distinct_2_std": 0.12183911353349686, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.23909616470336914, "reward_total_composite_std": 0.2025579810142517} {"timestamp_utc": "2026-04-12T13:15:38Z", "mode": "train", "global_step": 629, "epoch": 0.025264088042736072, "loss": -0.0524, "grad_norm": 1.4695098400115967, "learning_rate": 8.096969696969698e-06, "num_tokens": 1261783.0, "completions/mean_length": 336.75, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 44.66666793823242, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.24681605398654938, "rewards/meter/std": 0.3352571427822113, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8966175317764282, "rewards/lexical_plausibility/std": 0.08834678679704666, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.26592159271240234, "rewards/repeat_penalty/mean": 0.9511940479278564, "rewards/repeat_penalty/std": 0.08496034890413284, "rewards/near_duplicate_penalty/mean": 0.9906213879585266, "rewards/near_duplicate_penalty/std": 0.01871313527226448, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9918146133422852, "rewards/distinct_2/std": 0.02160203829407692, "rewards/total_composite/mean": 0.03236179053783417, "rewards/total_composite/std": 0.04901016503572464, "reward": 0.03236179053783417, "reward_std": 0.04901016876101494, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23172251880168915, "sampling/sampling_logp_difference/max": 1.4877829551696777, "sampling/importance_sampling_ratio/min": 0.22587287425994873, "sampling/importance_sampling_ratio/mean": 1.064292073249817, "sampling/importance_sampling_ratio/max": 1.9341951608657837, "entropy": 0.8464368432760239, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0490370187908411, "clip_ratio/high_max": 0.0490370187908411, "clip_ratio/region_mean": 0.0490370187908411, "reward_total_mean": 0.03236179053783417, "reward_meter_mean": 0.24681605398654938, "reward_meter_std": 0.3352571427822113, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8966175317764282, "reward_lexical_plausibility_std": 0.08834678679704666, "reward_repeat_penalty_mean": 0.9511940479278564, "reward_repeat_penalty_std": 0.08496034890413284, "reward_near_duplicate_penalty_mean": 0.9906213879585266, "reward_near_duplicate_penalty_std": 0.01871313527226448, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9918146133422852, "reward_distinct_2_std": 0.02160203829407692, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.26592159271240234, "reward_total_composite_mean": 0.03236179053783417, "reward_total_composite_std": 0.04901016503572464} {"timestamp_utc": "2026-04-12T13:15:54Z", "mode": "train", "global_step": 630, "epoch": 0.025304253524521026, "loss": -0.0517, "grad_norm": 5.594262599945068, "learning_rate": 8.093939393939395e-06, "num_tokens": 1263672.0, "completions/mean_length": 122.125, "completions/min_length": 61.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 66.42857360839844, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.5022074580192566, "rewards/meter/std": 0.3894704282283783, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9602227210998535, "rewards/lexical_plausibility/std": 0.11250722408294678, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.8946222066879272, "rewards/repeat_penalty/std": 0.0831746757030487, "rewards/near_duplicate_penalty/mean": 0.9494065642356873, "rewards/near_duplicate_penalty/std": 0.03705008327960968, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9406620264053345, "rewards/distinct_2/std": 0.05450836196541786, "rewards/total_composite/mean": 0.1588403284549713, "rewards/total_composite/std": 0.15504039824008942, "reward": 0.1588403284549713, "reward_std": 0.15504039824008942, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20285888016223907, "sampling/sampling_logp_difference/max": 1.7668914794921875, "sampling/importance_sampling_ratio/min": 0.1708633005619049, "sampling/importance_sampling_ratio/mean": 1.0529505014419556, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.576981171965599, "clip_ratio/low_mean": 0.059718722477555275, "clip_ratio/low_min": 0.059718722477555275, "clip_ratio/high_mean": 0.0863551665097475, "clip_ratio/high_max": 0.0863551665097475, "clip_ratio/region_mean": 0.14607388898730278, "reward_total_mean": 0.1588403284549713, "reward_meter_mean": 0.5022074580192566, "reward_meter_std": 0.3894704282283783, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9602227210998535, "reward_lexical_plausibility_std": 0.11250722408294678, "reward_repeat_penalty_mean": 0.8946222066879272, "reward_repeat_penalty_std": 0.0831746757030487, "reward_near_duplicate_penalty_mean": 0.9494065642356873, "reward_near_duplicate_penalty_std": 0.03705008327960968, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9406620264053345, "reward_distinct_2_std": 0.05450836196541786, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.1588403284549713, "reward_total_composite_std": 0.15504039824008942} {"timestamp_utc": "2026-04-12T13:16:08Z", "mode": "train", "global_step": 631, "epoch": 0.02534441900630598, "loss": -0.0663, "grad_norm": 5.523833274841309, "learning_rate": 8.090909090909092e-06, "num_tokens": 1265834.0, "completions/mean_length": 162.25, "completions/min_length": 104.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 112.28572082519531, "completions/min_terminated_length": 104.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.9624959826469421, "rewards/meter/std": 0.035045068711042404, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9842867851257324, "rewards/lexical_plausibility/std": 0.04444364085793495, "rewards/judge_quality/mean": 0.32749998569488525, "rewards/judge_quality/std": 0.27343058586120605, "rewards/repeat_penalty/mean": 0.8556100130081177, "rewards/repeat_penalty/std": 0.1390679031610489, "rewards/near_duplicate_penalty/mean": 0.9416369199752808, "rewards/near_duplicate_penalty/std": 0.035905905067920685, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9056022763252258, "rewards/distinct_2/std": 0.12288402020931244, "rewards/total_composite/mean": 0.30060014128685, "rewards/total_composite/std": 0.28588518500328064, "reward": 0.30060014128685, "reward_std": 0.28588518500328064, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1634335070848465, "sampling/sampling_logp_difference/max": 1.9987869262695312, "sampling/importance_sampling_ratio/min": 0.13549955189228058, "sampling/importance_sampling_ratio/mean": 1.0251843929290771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1761610209941864, "clip_ratio/low_mean": 0.03800287377089262, "clip_ratio/low_min": 0.03800287377089262, "clip_ratio/high_mean": 0.10151827149093151, "clip_ratio/high_max": 0.10151827149093151, "clip_ratio/region_mean": 0.13952114526182413, "reward_total_mean": 0.30060014128685, "reward_meter_mean": 0.9624959826469421, "reward_meter_std": 0.035045068711042404, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9842867851257324, "reward_lexical_plausibility_std": 0.04444364085793495, "reward_repeat_penalty_mean": 0.8556100130081177, "reward_repeat_penalty_std": 0.1390679031610489, "reward_near_duplicate_penalty_mean": 0.9416369199752808, "reward_near_duplicate_penalty_std": 0.035905905067920685, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9056022763252258, "reward_distinct_2_std": 0.12288402020931244, "reward_judge_quality_mean": 0.32749998569488525, "reward_judge_quality_std": 0.27343058586120605, "reward_total_composite_mean": 0.30060014128685, "reward_total_composite_std": 0.28588518500328064} {"timestamp_utc": "2026-04-12T13:16:21Z", "mode": "train", "global_step": 632, "epoch": 0.025384584488090934, "loss": -0.0608, "grad_norm": 2.5967648029327393, "learning_rate": 8.08787878787879e-06, "num_tokens": 1267300.0, "completions/mean_length": 215.25, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 37.20000076293945, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.261963814496994, "rewards/meter/std": 0.3052437901496887, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9159097075462341, "rewards/lexical_plausibility/std": 0.11721618473529816, "rewards/judge_quality/mean": 0.23749998211860657, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.9788684844970703, "rewards/repeat_penalty/std": 0.0204145647585392, "rewards/near_duplicate_penalty/mean": 0.9788684844970703, "rewards/near_duplicate_penalty/std": 0.0204145647585392, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.04824015125632286, "rewards/total_composite/std": 0.04420493170619011, "reward": 0.04824015125632286, "reward_std": 0.04420492798089981, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21038556098937988, "sampling/sampling_logp_difference/max": 1.7036457061767578, "sampling/importance_sampling_ratio/min": 0.1820187270641327, "sampling/importance_sampling_ratio/mean": 1.0416951179504395, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0705594271421432, "clip_ratio/low_mean": 0.01171875, "clip_ratio/low_min": 0.01171875, "clip_ratio/high_mean": 0.09922089613974094, "clip_ratio/high_max": 0.09922089613974094, "clip_ratio/region_mean": 0.11093964613974094, "reward_total_mean": 0.04824015125632286, "reward_meter_mean": 0.261963814496994, "reward_meter_std": 0.3052437901496887, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9159097075462341, "reward_lexical_plausibility_std": 0.11721618473529816, "reward_repeat_penalty_mean": 0.9788684844970703, "reward_repeat_penalty_std": 0.0204145647585392, "reward_near_duplicate_penalty_mean": 0.9788684844970703, "reward_near_duplicate_penalty_std": 0.0204145647585392, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.23749998211860657, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.04824015125632286, "reward_total_composite_std": 0.04420493170619011} {"timestamp_utc": "2026-04-12T13:16:29Z", "mode": "train", "global_step": 633, "epoch": 0.025424749969875888, "loss": -0.0191, "grad_norm": 14.925973892211914, "learning_rate": 8.084848484848485e-06, "num_tokens": 1268979.0, "completions/mean_length": 43.875, "completions/min_length": 39.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5629684925079346, "rewards/meter/std": 0.4164302349090576, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7762500047683716, "rewards/judge_quality/std": 0.30500292778015137, "rewards/repeat_penalty/mean": 0.9292605519294739, "rewards/repeat_penalty/std": 0.1500680148601532, "rewards/near_duplicate_penalty/mean": 0.9707680940628052, "rewards/near_duplicate_penalty/std": 0.03805668279528618, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.05725561082363129, "rewards/total_composite/mean": 0.39023247361183167, "rewards/total_composite/std": 0.3673883080482483, "reward": 0.39023247361183167, "reward_std": 0.3673883378505707, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14959272742271423, "sampling/sampling_logp_difference/max": 2.071025848388672, "sampling/importance_sampling_ratio/min": 0.12605640292167664, "sampling/importance_sampling_ratio/mean": 1.0124744176864624, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2291499078273773, "clip_ratio/low_mean": 0.05689174123108387, "clip_ratio/low_min": 0.05689174123108387, "clip_ratio/high_mean": 0.06366459582932293, "clip_ratio/high_max": 0.06366459582932293, "clip_ratio/region_mean": 0.1205563370604068, "reward_total_mean": 0.39023247361183167, "reward_meter_mean": 0.5629684925079346, "reward_meter_std": 0.4164302349090576, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9292605519294739, "reward_repeat_penalty_std": 0.1500680148601532, "reward_near_duplicate_penalty_mean": 0.9707680940628052, "reward_near_duplicate_penalty_std": 0.03805668279528618, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.05725561082363129, "reward_judge_quality_mean": 0.7762500047683716, "reward_judge_quality_std": 0.30500292778015137, "reward_total_composite_mean": 0.39023247361183167, "reward_total_composite_std": 0.3673883080482483} {"timestamp_utc": "2026-04-12T13:16:43Z", "mode": "train", "global_step": 634, "epoch": 0.025464915451660842, "loss": -0.0168, "grad_norm": 1.4095944166183472, "learning_rate": 8.081818181818182e-06, "num_tokens": 1270272.0, "completions/mean_length": 265.625, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 19.25, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.2789691686630249, "rewards/meter/std": 0.28043612837791443, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8315871357917786, "rewards/lexical_plausibility/std": 0.1664452999830246, "rewards/judge_quality/mean": 0.2862499952316284, "rewards/judge_quality/std": 0.3945680260658264, "rewards/repeat_penalty/mean": 0.7809751033782959, "rewards/repeat_penalty/std": 0.08850277960300446, "rewards/near_duplicate_penalty/mean": 0.9996334314346313, "rewards/near_duplicate_penalty/std": 0.0010368125513195992, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1212349608540535, "rewards/total_composite/std": 0.2543593645095825, "reward": 0.1212349608540535, "reward_std": 0.2543593645095825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17294777929782867, "sampling/sampling_logp_difference/max": 1.9102692604064941, "sampling/importance_sampling_ratio/min": 0.1480405181646347, "sampling/importance_sampling_ratio/mean": 1.0439677238464355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7391538321971893, "clip_ratio/low_mean": 0.03611111221835017, "clip_ratio/low_min": 0.03611111221835017, "clip_ratio/high_mean": 0.0062500000931322575, "clip_ratio/high_max": 0.0062500000931322575, "clip_ratio/region_mean": 0.04236111231148243, "reward_total_mean": 0.1212349608540535, "reward_meter_mean": 0.2789691686630249, "reward_meter_std": 0.28043612837791443, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8315871357917786, "reward_lexical_plausibility_std": 0.1664452999830246, "reward_repeat_penalty_mean": 0.7809751033782959, "reward_repeat_penalty_std": 0.08850277960300446, "reward_near_duplicate_penalty_mean": 0.9996334314346313, "reward_near_duplicate_penalty_std": 0.0010368125513195992, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2862499952316284, "reward_judge_quality_std": 0.3945680260658264, "reward_total_composite_mean": 0.1212349608540535, "reward_total_composite_std": 0.2543593645095825} {"timestamp_utc": "2026-04-12T13:16:55Z", "mode": "train", "global_step": 635, "epoch": 0.025505080933445796, "loss": -0.0314, "grad_norm": 6.6901655197143555, "learning_rate": 8.07878787878788e-06, "num_tokens": 1273144.0, "completions/mean_length": 154.0, "completions/min_length": 58.0, "completions/max_length": 235.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 154.0, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 235.0, "rewards/meter/mean": 0.9548834562301636, "rewards/meter/std": 0.026925699785351753, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.2920915186405182, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.5209765434265137, "rewards/repeat_penalty/std": 0.35144948959350586, "rewards/near_duplicate_penalty/mean": 0.8737728595733643, "rewards/near_duplicate_penalty/std": 0.10306568443775177, "rewards/opening_diversity/mean": 0.9352678656578064, "rewards/opening_diversity/std": 0.09637068212032318, "rewards/distinct_2/mean": 0.6008220911026001, "rewards/distinct_2/std": 0.3171120882034302, "rewards/total_composite/mean": 0.16293153166770935, "rewards/total_composite/std": 0.1565198451280594, "reward": 0.16293153166770935, "reward_std": 0.1565198451280594, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10899078100919724, "sampling/sampling_logp_difference/max": 1.8785130977630615, "sampling/importance_sampling_ratio/min": 0.15281717479228973, "sampling/importance_sampling_ratio/mean": 1.0064257383346558, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8146054446697235, "clip_ratio/low_mean": 0.06438315100967884, "clip_ratio/low_min": 0.06438315100967884, "clip_ratio/high_mean": 0.04923677537590265, "clip_ratio/high_max": 0.04923677537590265, "clip_ratio/region_mean": 0.1136199263855815, "reward_total_mean": 0.16293153166770935, "reward_meter_mean": 0.9548834562301636, "reward_meter_std": 0.026925699785351753, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.2920915186405182, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.5209765434265137, "reward_repeat_penalty_std": 0.35144948959350586, "reward_near_duplicate_penalty_mean": 0.8737728595733643, "reward_near_duplicate_penalty_std": 0.10306568443775177, "reward_opening_diversity_mean": 0.9352678656578064, "reward_opening_diversity_std": 0.09637068212032318, "reward_distinct_2_mean": 0.6008220911026001, "reward_distinct_2_std": 0.3171120882034302, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.16293153166770935, "reward_total_composite_std": 0.1565198451280594} {"timestamp_utc": "2026-04-12T13:17:06Z", "mode": "train", "global_step": 636, "epoch": 0.02554524641523075, "loss": 0.0334, "grad_norm": 10.770613670349121, "learning_rate": 8.075757575757577e-06, "num_tokens": 1276342.0, "completions/mean_length": 171.75, "completions/min_length": 148.0, "completions/max_length": 187.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 171.75, "completions/min_terminated_length": 148.0, "completions/max_terminated_length": 187.0, "rewards/meter/mean": 0.8720189332962036, "rewards/meter/std": 0.15706664323806763, "rewards/count_adherence/mean": 0.8611111640930176, "rewards/count_adherence/std": 0.05143444612622261, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.566994845867157, "rewards/repeat_penalty/std": 0.2003743052482605, "rewards/near_duplicate_penalty/mean": 0.9049088954925537, "rewards/near_duplicate_penalty/std": 0.04348953068256378, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6383098363876343, "rewards/distinct_2/std": 0.1683952957391739, "rewards/total_composite/mean": 0.25634610652923584, "rewards/total_composite/std": 0.061406008899211884, "reward": 0.25634610652923584, "reward_std": 0.061406008899211884, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13206955790519714, "sampling/sampling_logp_difference/max": 3.0831995010375977, "sampling/importance_sampling_ratio/min": 0.045812446624040604, "sampling/importance_sampling_ratio/mean": 1.006094217300415, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7453290075063705, "clip_ratio/low_mean": 0.04905197583138943, "clip_ratio/low_min": 0.04905197583138943, "clip_ratio/high_mean": 0.08030822314321995, "clip_ratio/high_max": 0.08030822314321995, "clip_ratio/region_mean": 0.12936019897460938, "reward_total_mean": 0.25634610652923584, "reward_meter_mean": 0.8720189332962036, "reward_meter_std": 0.15706664323806763, "reward_count_adherence_mean": 0.8611111640930176, "reward_count_adherence_std": 0.05143444612622261, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.566994845867157, "reward_repeat_penalty_std": 0.2003743052482605, "reward_near_duplicate_penalty_mean": 0.9049088954925537, "reward_near_duplicate_penalty_std": 0.04348953068256378, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6383098363876343, "reward_distinct_2_std": 0.1683952957391739, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.25634610652923584, "reward_total_composite_std": 0.061406008899211884} {"timestamp_utc": "2026-04-12T13:17:19Z", "mode": "train", "global_step": 637, "epoch": 0.025585411897015704, "loss": -0.0455, "grad_norm": 3.5608768463134766, "learning_rate": 8.072727272727274e-06, "num_tokens": 1277773.0, "completions/mean_length": 157.875, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 39.833335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.38278231024742126, "rewards/meter/std": 0.3874512016773224, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.928788423538208, "rewards/lexical_plausibility/std": 0.11096619069576263, "rewards/judge_quality/mean": 0.4637500047683716, "rewards/judge_quality/std": 0.3948214054107666, "rewards/repeat_penalty/mean": 0.9843645095825195, "rewards/repeat_penalty/std": 0.019120698794722557, "rewards/near_duplicate_penalty/mean": 0.9843645095825195, "rewards/near_duplicate_penalty/std": 0.019120698794722557, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10513200610876083, "rewards/total_composite/std": 0.11730080097913742, "reward": 0.10513200610876083, "reward_std": 0.11730080097913742, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17525507509708405, "sampling/sampling_logp_difference/max": 1.5014729499816895, "sampling/importance_sampling_ratio/min": 0.22280174493789673, "sampling/importance_sampling_ratio/mean": 1.0429105758666992, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9021463692188263, "clip_ratio/low_mean": 0.0445723682641983, "clip_ratio/low_min": 0.0445723682641983, "clip_ratio/high_mean": 0.0713918786495924, "clip_ratio/high_max": 0.0713918786495924, "clip_ratio/region_mean": 0.1159642469137907, "reward_total_mean": 0.10513200610876083, "reward_meter_mean": 0.38278231024742126, "reward_meter_std": 0.3874512016773224, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.928788423538208, "reward_lexical_plausibility_std": 0.11096619069576263, "reward_repeat_penalty_mean": 0.9843645095825195, "reward_repeat_penalty_std": 0.019120698794722557, "reward_near_duplicate_penalty_mean": 0.9843645095825195, "reward_near_duplicate_penalty_std": 0.019120698794722557, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4637500047683716, "reward_judge_quality_std": 0.3948214054107666, "reward_total_composite_mean": 0.10513200610876083, "reward_total_composite_std": 0.11730080097913742} {"timestamp_utc": "2026-04-12T13:17:26Z", "mode": "train", "global_step": 638, "epoch": 0.025625577378800658, "loss": 0.0115, "grad_norm": 14.571146965026855, "learning_rate": 8.069696969696971e-06, "num_tokens": 1279259.0, "completions/mean_length": 26.75, "completions/min_length": 24.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.75, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.8380571603775024, "rewards/meter/std": 0.31788626313209534, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.959099292755127, "rewards/lexical_plausibility/std": 0.09303800761699677, "rewards/judge_quality/mean": 0.7649999856948853, "rewards/judge_quality/std": 0.29799333214759827, "rewards/repeat_penalty/mean": 0.7357954382896423, "rewards/repeat_penalty/std": 0.040176525712013245, "rewards/near_duplicate_penalty/mean": 0.9810606241226196, "rewards/near_duplicate_penalty/std": 0.05356868728995323, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6197974681854248, "rewards/total_composite/std": 0.35693055391311646, "reward": 0.6197974681854248, "reward_std": 0.35693055391311646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1598413586616516, "sampling/sampling_logp_difference/max": 1.6024084091186523, "sampling/importance_sampling_ratio/min": 0.20141084492206573, "sampling/importance_sampling_ratio/mean": 1.0275013446807861, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9943805411458015, "clip_ratio/low_mean": 0.06134615372866392, "clip_ratio/low_min": 0.06134615372866392, "clip_ratio/high_mean": 0.08046245528385043, "clip_ratio/high_max": 0.08046245528385043, "clip_ratio/region_mean": 0.14180860901251435, "reward_total_mean": 0.6197974681854248, "reward_meter_mean": 0.8380571603775024, "reward_meter_std": 0.31788626313209534, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.959099292755127, "reward_lexical_plausibility_std": 0.09303800761699677, "reward_repeat_penalty_mean": 0.7357954382896423, "reward_repeat_penalty_std": 0.040176525712013245, "reward_near_duplicate_penalty_mean": 0.9810606241226196, "reward_near_duplicate_penalty_std": 0.05356868728995323, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7649999856948853, "reward_judge_quality_std": 0.29799333214759827, "reward_total_composite_mean": 0.6197974681854248, "reward_total_composite_std": 0.35693055391311646} {"timestamp_utc": "2026-04-12T13:17:41Z", "mode": "train", "global_step": 639, "epoch": 0.02566574286058561, "loss": -0.2527, "grad_norm": 2.107557773590088, "learning_rate": 8.066666666666667e-06, "num_tokens": 1284153.0, "completions/mean_length": 362.75, "completions/min_length": 84.0, "completions/max_length": 465.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 362.75, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 465.0, "rewards/meter/mean": 0.9797854423522949, "rewards/meter/std": 0.019569000229239464, "rewards/count_adherence/mean": 0.8214285373687744, "rewards/count_adherence/std": 0.2474358230829239, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.10890862345695496, "rewards/repeat_penalty/std": 0.3080401122570038, "rewards/near_duplicate_penalty/mean": 0.6676996350288391, "rewards/near_duplicate_penalty/std": 0.12176878750324249, "rewards/opening_diversity/mean": 0.8863281011581421, "rewards/opening_diversity/std": 0.09243025630712509, "rewards/distinct_2/mean": 0.11917249113321304, "rewards/distinct_2/std": 0.3370707035064697, "rewards/total_composite/mean": 0.12620297074317932, "rewards/total_composite/std": 0.022907156497240067, "reward": 0.12620297074317932, "reward_std": 0.022907156497240067, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.039396945387125015, "sampling/sampling_logp_difference/max": 3.5351552963256836, "sampling/importance_sampling_ratio/min": 0.029154228046536446, "sampling/importance_sampling_ratio/mean": 1.0001709461212158, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.29568417742848396, "clip_ratio/low_mean": 0.01957417675293982, "clip_ratio/low_min": 0.01957417675293982, "clip_ratio/high_mean": 0.026986095821484923, "clip_ratio/high_max": 0.026986095821484923, "clip_ratio/region_mean": 0.046560272574424744, "reward_total_mean": 0.12620297074317932, "reward_meter_mean": 0.9797854423522949, "reward_meter_std": 0.019569000229239464, "reward_count_adherence_mean": 0.8214285373687744, "reward_count_adherence_std": 0.2474358230829239, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.10890862345695496, "reward_repeat_penalty_std": 0.3080401122570038, "reward_near_duplicate_penalty_mean": 0.6676996350288391, "reward_near_duplicate_penalty_std": 0.12176878750324249, "reward_opening_diversity_mean": 0.8863281011581421, "reward_opening_diversity_std": 0.09243025630712509, "reward_distinct_2_mean": 0.11917249113321304, "reward_distinct_2_std": 0.3370707035064697, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.12620297074317932, "reward_total_composite_std": 0.022907156497240067} {"timestamp_utc": "2026-04-12T13:17:55Z", "mode": "train", "global_step": 640, "epoch": 0.025705908342370565, "loss": -0.0319, "grad_norm": 7.621056079864502, "learning_rate": 8.063636363636364e-06, "num_tokens": 1285615.0, "completions/mean_length": 83.75, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.571430206298828, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.6029120087623596, "rewards/meter/std": 0.49232953786849976, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9339431524276733, "rewards/lexical_plausibility/std": 0.12514233589172363, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.3479095697402954, "rewards/repeat_penalty/mean": 0.7169308662414551, "rewards/repeat_penalty/std": 0.04585881903767586, "rewards/near_duplicate_penalty/mean": 0.9559078812599182, "rewards/near_duplicate_penalty/std": 0.06114509701728821, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22680015861988068, "rewards/total_composite/std": 0.31569546461105347, "reward": 0.22680015861988068, "reward_std": 0.3156954348087311, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15921121835708618, "sampling/sampling_logp_difference/max": 1.4940481185913086, "sampling/importance_sampling_ratio/min": 0.22446216642856598, "sampling/importance_sampling_ratio/mean": 1.0230909585952759, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8584880083799362, "clip_ratio/low_mean": 0.0924185486510396, "clip_ratio/low_min": 0.0924185486510396, "clip_ratio/high_mean": 0.04479437693953514, "clip_ratio/high_max": 0.04479437693953514, "clip_ratio/region_mean": 0.13721292559057474, "reward_total_mean": 0.22680015861988068, "reward_meter_mean": 0.6029120087623596, "reward_meter_std": 0.49232953786849976, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9339431524276733, "reward_lexical_plausibility_std": 0.12514233589172363, "reward_repeat_penalty_mean": 0.7169308662414551, "reward_repeat_penalty_std": 0.04585881903767586, "reward_near_duplicate_penalty_mean": 0.9559078812599182, "reward_near_duplicate_penalty_std": 0.06114509701728821, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.3479095697402954, "reward_total_composite_mean": 0.22680015861988068, "reward_total_composite_std": 0.31569546461105347} {"timestamp_utc": "2026-04-12T13:18:05Z", "mode": "train", "global_step": 641, "epoch": 0.02574607382415552, "loss": 0.157, "grad_norm": 15.96769905090332, "learning_rate": 8.060606060606061e-06, "num_tokens": 1287435.0, "completions/mean_length": 64.5, "completions/min_length": 45.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.5, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.7461182475090027, "rewards/meter/std": 0.2852329909801483, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.21836650371551514, "rewards/repeat_penalty/mean": 0.9395760297775269, "rewards/repeat_penalty/std": 0.051755864173173904, "rewards/near_duplicate_penalty/mean": 0.9722237586975098, "rewards/near_duplicate_penalty/std": 0.01932915486395359, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.966033935546875, "rewards/distinct_2/std": 0.040175117552280426, "rewards/total_composite/mean": 0.32378101348876953, "rewards/total_composite/std": 0.18241840600967407, "reward": 0.32378101348876953, "reward_std": 0.18241840600967407, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18672369420528412, "sampling/sampling_logp_difference/max": 2.4093427658081055, "sampling/importance_sampling_ratio/min": 0.08987434953451157, "sampling/importance_sampling_ratio/mean": 1.025506854057312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9243885278701782, "clip_ratio/low_mean": 0.07249605283141136, "clip_ratio/low_min": 0.07249605283141136, "clip_ratio/high_mean": 0.10350418835878372, "clip_ratio/high_max": 0.10350418835878372, "clip_ratio/region_mean": 0.17600024119019508, "reward_total_mean": 0.32378101348876953, "reward_meter_mean": 0.7461182475090027, "reward_meter_std": 0.2852329909801483, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9395760297775269, "reward_repeat_penalty_std": 0.051755864173173904, "reward_near_duplicate_penalty_mean": 0.9722237586975098, "reward_near_duplicate_penalty_std": 0.01932915486395359, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.966033935546875, "reward_distinct_2_std": 0.040175117552280426, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.21836650371551514, "reward_total_composite_mean": 0.32378101348876953, "reward_total_composite_std": 0.18241840600967407} {"timestamp_utc": "2026-04-12T13:18:15Z", "mode": "train", "global_step": 642, "epoch": 0.025786239305940473, "loss": 0.0134, "grad_norm": 9.472576141357422, "learning_rate": 8.057575757575759e-06, "num_tokens": 1289618.0, "completions/mean_length": 93.875, "completions/min_length": 68.0, "completions/max_length": 120.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 120.0, "rewards/meter/mean": 0.481609046459198, "rewards/meter/std": 0.39368680119514465, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.6929478645324707, "rewards/repeat_penalty/std": 0.22728116810321808, "rewards/near_duplicate_penalty/mean": 0.9295317530632019, "rewards/near_duplicate_penalty/std": 0.04386115446686745, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.16366341710090637, "rewards/distinct_2/mean": 0.8599269986152649, "rewards/distinct_2/std": 0.10274447500705719, "rewards/total_composite/mean": 0.16080939769744873, "rewards/total_composite/std": 0.170904740691185, "reward": 0.16080939769744873, "reward_std": 0.170904740691185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1623670756816864, "sampling/sampling_logp_difference/max": 2.36892032623291, "sampling/importance_sampling_ratio/min": 0.09358171373605728, "sampling/importance_sampling_ratio/mean": 0.9873301386833191, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8296694234013557, "clip_ratio/low_mean": 0.07854306325316429, "clip_ratio/low_min": 0.07854306325316429, "clip_ratio/high_mean": 0.07493629865348339, "clip_ratio/high_max": 0.07493629865348339, "clip_ratio/region_mean": 0.15347936190664768, "reward_total_mean": 0.16080939769744873, "reward_meter_mean": 0.481609046459198, "reward_meter_std": 0.39368680119514465, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6929478645324707, "reward_repeat_penalty_std": 0.22728116810321808, "reward_near_duplicate_penalty_mean": 0.9295317530632019, "reward_near_duplicate_penalty_std": 0.04386115446686745, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.16366341710090637, "reward_distinct_2_mean": 0.8599269986152649, "reward_distinct_2_std": 0.10274447500705719, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.16080939769744873, "reward_total_composite_std": 0.170904740691185} {"timestamp_utc": "2026-04-12T13:18:24Z", "mode": "train", "global_step": 643, "epoch": 0.025826404787725427, "loss": 0.0112, "grad_norm": 11.457493782043457, "learning_rate": 8.054545454545454e-06, "num_tokens": 1291562.0, "completions/mean_length": 78.0, "completions/min_length": 68.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 78.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.5476718544960022, "rewards/meter/std": 0.31364360451698303, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9320908784866333, "rewards/repeat_penalty/std": 0.08314214646816254, "rewards/near_duplicate_penalty/mean": 0.9673113226890564, "rewards/near_duplicate_penalty/std": 0.027428893372416496, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9626831412315369, "rewards/distinct_2/std": 0.07143151015043259, "rewards/total_composite/mean": 0.10499675571918488, "rewards/total_composite/std": 0.07011913508176804, "reward": 0.10499675571918488, "reward_std": 0.07011914253234863, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13167837262153625, "sampling/sampling_logp_difference/max": 1.5653483867645264, "sampling/importance_sampling_ratio/min": 0.24765388667583466, "sampling/importance_sampling_ratio/mean": 1.012163758277893, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8878500610589981, "clip_ratio/low_mean": 0.05099678970873356, "clip_ratio/low_min": 0.05099678970873356, "clip_ratio/high_mean": 0.06668656319379807, "clip_ratio/high_max": 0.06668656319379807, "clip_ratio/region_mean": 0.11768335290253162, "reward_total_mean": 0.10499675571918488, "reward_meter_mean": 0.5476718544960022, "reward_meter_std": 0.31364360451698303, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9320908784866333, "reward_repeat_penalty_std": 0.08314214646816254, "reward_near_duplicate_penalty_mean": 0.9673113226890564, "reward_near_duplicate_penalty_std": 0.027428893372416496, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9626831412315369, "reward_distinct_2_std": 0.07143151015043259, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.10499675571918488, "reward_total_composite_std": 0.07011913508176804} {"timestamp_utc": "2026-04-12T13:18:33Z", "mode": "train", "global_step": 644, "epoch": 0.02586657026951038, "loss": 0.074, "grad_norm": 14.46362018585205, "learning_rate": 8.051515151515153e-06, "num_tokens": 1293507.0, "completions/mean_length": 49.125, "completions/min_length": 41.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.125, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6963322162628174, "rewards/meter/std": 0.3832204043865204, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.975322425365448, "rewards/lexical_plausibility/std": 0.04015253856778145, "rewards/judge_quality/mean": 0.8524999618530273, "rewards/judge_quality/std": 0.20331187546253204, "rewards/repeat_penalty/mean": 0.9885950684547424, "rewards/repeat_penalty/std": 0.014315770007669926, "rewards/near_duplicate_penalty/mean": 0.9885950684547424, "rewards/near_duplicate_penalty/std": 0.014315770007669926, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5737149715423584, "rewards/total_composite/std": 0.3512689769268036, "reward": 0.5737149715423584, "reward_std": 0.3512689769268036, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14565438032150269, "sampling/sampling_logp_difference/max": 1.4939188957214355, "sampling/importance_sampling_ratio/min": 0.2244911789894104, "sampling/importance_sampling_ratio/mean": 1.0124223232269287, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9569375514984131, "clip_ratio/low_mean": 0.09816683270037174, "clip_ratio/low_min": 0.09816683270037174, "clip_ratio/high_mean": 0.05961468303576112, "clip_ratio/high_max": 0.05961468303576112, "clip_ratio/region_mean": 0.15778151573613286, "reward_total_mean": 0.5737149715423584, "reward_meter_mean": 0.6963322162628174, "reward_meter_std": 0.3832204043865204, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.975322425365448, "reward_lexical_plausibility_std": 0.04015253856778145, "reward_repeat_penalty_mean": 0.9885950684547424, "reward_repeat_penalty_std": 0.014315770007669926, "reward_near_duplicate_penalty_mean": 0.9885950684547424, "reward_near_duplicate_penalty_std": 0.014315770007669926, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8524999618530273, "reward_judge_quality_std": 0.20331187546253204, "reward_total_composite_mean": 0.5737149715423584, "reward_total_composite_std": 0.3512689769268036} {"timestamp_utc": "2026-04-12T13:18:48Z", "mode": "train", "global_step": 645, "epoch": 0.025906735751295335, "loss": -0.0593, "grad_norm": 5.030296325683594, "learning_rate": 8.048484848484849e-06, "num_tokens": 1295481.0, "completions/mean_length": 130.75, "completions/min_length": 71.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 76.28572082519531, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.45199140906333923, "rewards/meter/std": 0.33480334281921387, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9682062864303589, "rewards/lexical_plausibility/std": 0.08992617577314377, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9182196855545044, "rewards/repeat_penalty/std": 0.06554044783115387, "rewards/near_duplicate_penalty/mean": 0.9543733596801758, "rewards/near_duplicate_penalty/std": 0.027052002027630806, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9612371921539307, "rewards/distinct_2/std": 0.046426400542259216, "rewards/total_composite/mean": 0.08623696863651276, "rewards/total_composite/std": 0.07367822527885437, "reward": 0.08623696863651276, "reward_std": 0.07367822527885437, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1614648401737213, "sampling/sampling_logp_difference/max": 1.3377704620361328, "sampling/importance_sampling_ratio/min": 0.2624301314353943, "sampling/importance_sampling_ratio/mean": 1.030680537223816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2282000184059143, "clip_ratio/low_mean": 0.0690268985927105, "clip_ratio/low_min": 0.0690268985927105, "clip_ratio/high_mean": 0.07994715869426727, "clip_ratio/high_max": 0.07994715869426727, "clip_ratio/region_mean": 0.14897405728697777, "reward_total_mean": 0.08623696863651276, "reward_meter_mean": 0.45199140906333923, "reward_meter_std": 0.33480334281921387, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9682062864303589, "reward_lexical_plausibility_std": 0.08992617577314377, "reward_repeat_penalty_mean": 0.9182196855545044, "reward_repeat_penalty_std": 0.06554044783115387, "reward_near_duplicate_penalty_mean": 0.9543733596801758, "reward_near_duplicate_penalty_std": 0.027052002027630806, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9612371921539307, "reward_distinct_2_std": 0.046426400542259216, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.08623696863651276, "reward_total_composite_std": 0.07367822527885437} {"timestamp_utc": "2026-04-12T13:18:58Z", "mode": "train", "global_step": 646, "epoch": 0.02594690123308029, "loss": 0.0588, "grad_norm": 17.052248001098633, "learning_rate": 8.045454545454546e-06, "num_tokens": 1297184.0, "completions/mean_length": 47.875, "completions/min_length": 43.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.875, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6372324228286743, "rewards/meter/std": 0.37157922983169556, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9930521249771118, "rewards/repeat_penalty/std": 0.0094807930290699, "rewards/near_duplicate_penalty/mean": 0.9930521249771118, "rewards/near_duplicate_penalty/std": 0.0094807930290699, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3884514570236206, "rewards/total_composite/std": 0.34655410051345825, "reward": 0.3884514570236206, "reward_std": 0.34655407071113586, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15788908302783966, "sampling/sampling_logp_difference/max": 2.327352523803711, "sampling/importance_sampling_ratio/min": 0.18768973648548126, "sampling/importance_sampling_ratio/mean": 1.0095030069351196, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.687575925141573, "clip_ratio/low_mean": 0.07169033400714397, "clip_ratio/low_min": 0.07169033400714397, "clip_ratio/high_mean": 0.060691287741065025, "clip_ratio/high_max": 0.060691287741065025, "clip_ratio/region_mean": 0.132381621748209, "reward_total_mean": 0.3884514570236206, "reward_meter_mean": 0.6372324228286743, "reward_meter_std": 0.37157922983169556, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9930521249771118, "reward_repeat_penalty_std": 0.0094807930290699, "reward_near_duplicate_penalty_mean": 0.9930521249771118, "reward_near_duplicate_penalty_std": 0.0094807930290699, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.3884514570236206, "reward_total_composite_std": 0.34655410051345825} {"timestamp_utc": "2026-04-12T13:19:07Z", "mode": "train", "global_step": 647, "epoch": 0.025987066714865246, "loss": 0.0042, "grad_norm": 19.14881706237793, "learning_rate": 8.042424242424243e-06, "num_tokens": 1298598.0, "completions/mean_length": 25.75, "completions/min_length": 23.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.75, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.5218876600265503, "rewards/meter/std": 0.49559152126312256, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.966911792755127, "rewards/lexical_plausibility/std": 0.09358766674995422, "rewards/judge_quality/mean": 0.6425000429153442, "rewards/judge_quality/std": 0.4080178737640381, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19465665519237518, "rewards/total_composite/std": 0.28726205229759216, "reward": 0.19465665519237518, "reward_std": 0.28726205229759216, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11895209550857544, "sampling/sampling_logp_difference/max": 1.2821241617202759, "sampling/importance_sampling_ratio/min": 0.27744731307029724, "sampling/importance_sampling_ratio/mean": 1.0020582675933838, "sampling/importance_sampling_ratio/max": 1.704353928565979, "entropy": 0.8862093053758144, "clip_ratio/low_mean": 0.09759674221277237, "clip_ratio/low_min": 0.09759674221277237, "clip_ratio/high_mean": 0.014423076994717121, "clip_ratio/high_max": 0.014423076994717121, "clip_ratio/region_mean": 0.11201981920748949, "reward_total_mean": 0.19465665519237518, "reward_meter_mean": 0.5218876600265503, "reward_meter_std": 0.49559152126312256, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.966911792755127, "reward_lexical_plausibility_std": 0.09358766674995422, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6425000429153442, "reward_judge_quality_std": 0.4080178737640381, "reward_total_composite_mean": 0.19465665519237518, "reward_total_composite_std": 0.28726205229759216} {"timestamp_utc": "2026-04-12T13:19:22Z", "mode": "train", "global_step": 648, "epoch": 0.0260272321966502, "loss": -0.1016, "grad_norm": 3.156404733657837, "learning_rate": 8.03939393939394e-06, "num_tokens": 1300181.0, "completions/mean_length": 165.875, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 50.5, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.749919056892395, "rewards/meter/std": 0.3598979711532593, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9536298513412476, "rewards/lexical_plausibility/std": 0.08603141456842422, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.9071629643440247, "rewards/repeat_penalty/std": 0.12951858341693878, "rewards/near_duplicate_penalty/mean": 0.9722334742546082, "rewards/near_duplicate_penalty/std": 0.03392884507775307, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9598901271820068, "rewards/distinct_2/std": 0.05960153788328171, "rewards/total_composite/mean": 0.23855365812778473, "rewards/total_composite/std": 0.17867974936962128, "reward": 0.23855365812778473, "reward_std": 0.17867976427078247, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17387282848358154, "sampling/sampling_logp_difference/max": 2.792581081390381, "sampling/importance_sampling_ratio/min": 0.06126288324594498, "sampling/importance_sampling_ratio/mean": 1.0311232805252075, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.774294950067997, "clip_ratio/low_mean": 0.01595744676887989, "clip_ratio/low_min": 0.01595744676887989, "clip_ratio/high_mean": 0.09739032946527004, "clip_ratio/high_max": 0.09739032946527004, "clip_ratio/region_mean": 0.11334777623414993, "reward_total_mean": 0.23855365812778473, "reward_meter_mean": 0.749919056892395, "reward_meter_std": 0.3598979711532593, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9536298513412476, "reward_lexical_plausibility_std": 0.08603141456842422, "reward_repeat_penalty_mean": 0.9071629643440247, "reward_repeat_penalty_std": 0.12951858341693878, "reward_near_duplicate_penalty_mean": 0.9722334742546082, "reward_near_duplicate_penalty_std": 0.03392884507775307, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9598901271820068, "reward_distinct_2_std": 0.05960153788328171, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.23855365812778473, "reward_total_composite_std": 0.17867974936962128} {"timestamp_utc": "2026-04-12T13:19:30Z", "mode": "train", "global_step": 649, "epoch": 0.026067397678435154, "loss": 0.0213, "grad_norm": 18.302217483520508, "learning_rate": 8.036363636363636e-06, "num_tokens": 1301648.0, "completions/mean_length": 24.375, "completions/min_length": 22.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.375, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.9763913154602051, "rewards/meter/std": 0.014494826085865498, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9574281573295593, "rewards/lexical_plausibility/std": 0.09763853251934052, "rewards/judge_quality/mean": 0.9387500286102295, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.7201539278030396, "rewards/repeat_penalty/std": 0.052037425339221954, "rewards/near_duplicate_penalty/mean": 0.9602053165435791, "rewards/near_duplicate_penalty/std": 0.06938322633504868, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.9167482852935791, "rewards/total_composite/std": 0.027317216619849205, "reward": 0.9167482852935791, "reward_std": 0.027317220345139503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1170336902141571, "sampling/sampling_logp_difference/max": 1.5248045921325684, "sampling/importance_sampling_ratio/min": 0.21766360104084015, "sampling/importance_sampling_ratio/mean": 0.9827519655227661, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6033441759645939, "clip_ratio/low_mean": 0.04053758829832077, "clip_ratio/low_min": 0.04053758829832077, "clip_ratio/high_mean": 0.09080864861607552, "clip_ratio/high_max": 0.09080864861607552, "clip_ratio/region_mean": 0.13134623691439629, "reward_total_mean": 0.9167482852935791, "reward_meter_mean": 0.9763913154602051, "reward_meter_std": 0.014494826085865498, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9574281573295593, "reward_lexical_plausibility_std": 0.09763853251934052, "reward_repeat_penalty_mean": 0.7201539278030396, "reward_repeat_penalty_std": 0.052037425339221954, "reward_near_duplicate_penalty_mean": 0.9602053165435791, "reward_near_duplicate_penalty_std": 0.06938322633504868, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9387500286102295, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.9167482852935791, "reward_total_composite_std": 0.027317216619849205} {"timestamp_utc": "2026-04-12T13:19:38Z", "mode": "train", "global_step": 650, "epoch": 0.02610756316022011, "loss": 0.0548, "grad_norm": 87.50554656982422, "learning_rate": 8.033333333333335e-06, "num_tokens": 1303056.0, "completions/mean_length": 28.0, "completions/min_length": 23.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.0, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.6164331436157227, "rewards/meter/std": 0.44052690267562866, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.34087073802948, "rewards/repeat_penalty/mean": 0.7469173073768616, "rewards/repeat_penalty/std": 0.00871915090829134, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2809414267539978, "rewards/total_composite/std": 0.30079224705696106, "reward": 0.2809414267539978, "reward_std": 0.30079224705696106, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.177694171667099, "sampling/sampling_logp_difference/max": 2.093334197998047, "sampling/importance_sampling_ratio/min": 0.21737733483314514, "sampling/importance_sampling_ratio/mean": 1.0162487030029297, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.173734374344349, "clip_ratio/low_mean": 0.053314114455133677, "clip_ratio/low_min": 0.053314114455133677, "clip_ratio/high_mean": 0.06503349542617798, "clip_ratio/high_max": 0.06503349542617798, "clip_ratio/region_mean": 0.11834760988131166, "reward_total_mean": 0.2809414267539978, "reward_meter_mean": 0.6164331436157227, "reward_meter_std": 0.44052690267562866, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7469173073768616, "reward_repeat_penalty_std": 0.00871915090829134, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.34087073802948, "reward_total_composite_mean": 0.2809414267539978, "reward_total_composite_std": 0.30079224705696106} {"timestamp_utc": "2026-04-12T13:22:02Z", "mode": "eval", "global_step": 650, "epoch": 0.02610756316022011, "eval_loss": NaN, "eval_runtime": 143.1603, "eval_samples_per_second": 0.726, "eval_steps_per_second": 0.091, "eval_num_tokens": 1303056.0, "eval_completions/mean_length": 186.21153846153845, "eval_completions/min_length": 44.46153846153846, "eval_completions/max_length": 434.9230769230769, "eval_completions/clipped_ratio": 0.04807692307692308, "eval_completions/mean_terminated_length": 169.38553443321814, "eval_completions/min_terminated_length": 44.46153846153846, "eval_completions/max_terminated_length": 405.0769230769231, "eval_rewards/meter/mean": 0.5176326403251061, "eval_rewards/meter/std": 0.38338013337208676, "eval_rewards/count_adherence/mean": 0.9161025790067819, "eval_rewards/count_adherence/std": 0.10158824261564475, "eval_rewards/arabic_clean/mean": 0.9134615384615384, "eval_rewards/arabic_clean/std": 0.22598336522395795, "eval_rewards/lexical_plausibility/mean": 0.9886978818820074, "eval_rewards/lexical_plausibility/std": 0.03196719833291494, "eval_rewards/judge_quality/mean": 0.32038461245023286, "eval_rewards/judge_quality/std": 0.18748051501237428, "eval_rewards/repeat_penalty/mean": 0.6313059673859522, "eval_rewards/repeat_penalty/std": 0.3831306535464067, "eval_rewards/near_duplicate_penalty/mean": 0.882120247070606, "eval_rewards/near_duplicate_penalty/std": 0.14898592720811182, "eval_rewards/opening_diversity/mean": 0.935858442233159, "eval_rewards/opening_diversity/std": 0.13979974389076233, "eval_rewards/distinct_2/mean": 0.6888675918945899, "eval_rewards/distinct_2/std": 0.37871775661523527, "eval_rewards/total_composite/mean": 0.15516162205200928, "eval_rewards/total_composite/std": 0.1773617290533506, "eval_reward": 0.15516162205200928, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.049533164558502346, "eval_sampling/sampling_logp_difference/max": 1.100408700796274, "eval_sampling/importance_sampling_ratio/min": 0.33582237362861633, "eval_sampling/importance_sampling_ratio/mean": 1.0101247934194713, "eval_sampling/importance_sampling_ratio/max": 1.5279319011248076, "eval_entropy": 0.5434640416732202, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.15516162205200928, "eval_reward_meter_mean": 0.5176326403251061, "eval_reward_meter_std": 0.38338013337208676, "eval_reward_count_adherence_mean": 0.9161025790067819, "eval_reward_count_adherence_std": 0.10158824261564475, "eval_reward_arabic_clean_mean": 0.9134615384615384, "eval_reward_arabic_clean_std": 0.22598336522395795, "eval_reward_lexical_plausibility_mean": 0.9886978818820074, "eval_reward_lexical_plausibility_std": 0.03196719833291494, "eval_reward_repeat_penalty_mean": 0.6313059673859522, "eval_reward_repeat_penalty_std": 0.3831306535464067, "eval_reward_near_duplicate_penalty_mean": 0.882120247070606, "eval_reward_near_duplicate_penalty_std": 0.14898592720811182, "eval_reward_opening_diversity_mean": 0.935858442233159, "eval_reward_opening_diversity_std": 0.13979974389076233, "eval_reward_distinct_2_mean": 0.6888675918945899, "eval_reward_distinct_2_std": 0.37871775661523527, "eval_reward_judge_quality_mean": 0.32038461245023286, "eval_reward_judge_quality_std": 0.18748051501237428, "eval_reward_total_composite_mean": 0.15516162205200928, "eval_reward_total_composite_std": 0.1773617290533506} {"timestamp_utc": "2026-04-12T13:22:13Z", "mode": "train", "global_step": 651, "epoch": 0.026147728642005062, "loss": 0.0201, "grad_norm": 18.738645553588867, "learning_rate": 8.03030303030303e-06, "num_tokens": 1304488.0, "completions/mean_length": 26.0, "completions/min_length": 22.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.0, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.9726604223251343, "rewards/meter/std": 0.030426910147070885, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3184336721897125, "rewards/repeat_penalty/mean": 0.7372881174087524, "rewards/repeat_penalty/std": 0.025295833125710487, "rewards/near_duplicate_penalty/mean": 0.9830508232116699, "rewards/near_duplicate_penalty/std": 0.033727772533893585, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6145163774490356, "rewards/total_composite/std": 0.30505234003067017, "reward": 0.6145163774490356, "reward_std": 0.30505234003067017, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13733744621276855, "sampling/sampling_logp_difference/max": 1.0213537216186523, "sampling/importance_sampling_ratio/min": 0.3601071536540985, "sampling/importance_sampling_ratio/mean": 1.0433086156845093, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8922332152724266, "clip_ratio/low_mean": 0.06401891633868217, "clip_ratio/low_min": 0.06401891633868217, "clip_ratio/high_mean": 0.06468990864232183, "clip_ratio/high_max": 0.06468990864232183, "clip_ratio/region_mean": 0.128708824981004, "reward_total_mean": 0.6145163774490356, "reward_meter_mean": 0.9726604223251343, "reward_meter_std": 0.030426910147070885, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7372881174087524, "reward_repeat_penalty_std": 0.025295833125710487, "reward_near_duplicate_penalty_mean": 0.9830508232116699, "reward_near_duplicate_penalty_std": 0.033727772533893585, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3184336721897125, "reward_total_composite_mean": 0.6145163774490356, "reward_total_composite_std": 0.30505234003067017} {"timestamp_utc": "2026-04-12T13:22:24Z", "mode": "train", "global_step": 652, "epoch": 0.026187894123790016, "loss": 0.0465, "grad_norm": 5.845699310302734, "learning_rate": 8.027272727272728e-06, "num_tokens": 1308269.0, "completions/mean_length": 258.625, "completions/min_length": 224.0, "completions/max_length": 287.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 258.625, "completions/min_terminated_length": 224.0, "completions/max_terminated_length": 287.0, "rewards/meter/mean": 0.8591511249542236, "rewards/meter/std": 0.3451387882232666, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.1414213478565216, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.488717257976532, "rewards/near_duplicate_penalty/std": 0.11153869330883026, "rewards/opening_diversity/mean": 0.7508928775787354, "rewards/opening_diversity/std": 0.25745269656181335, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12882253527641296, "rewards/total_composite/std": 0.0519123338162899, "reward": 0.12882253527641296, "reward_std": 0.0519123300909996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.03103749454021454, "sampling/sampling_logp_difference/max": 1.6186375617980957, "sampling/importance_sampling_ratio/min": 0.19816851615905762, "sampling/importance_sampling_ratio/mean": 1.0036224126815796, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.18352647498250008, "clip_ratio/low_mean": 0.0030487803742289543, "clip_ratio/low_min": 0.0030487803742289543, "clip_ratio/high_mean": 0.026172100100666285, "clip_ratio/high_max": 0.026172100100666285, "clip_ratio/region_mean": 0.02922088047489524, "reward_total_mean": 0.12882253527641296, "reward_meter_mean": 0.8591511249542236, "reward_meter_std": 0.3451387882232666, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.1414213478565216, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.488717257976532, "reward_near_duplicate_penalty_std": 0.11153869330883026, "reward_opening_diversity_mean": 0.7508928775787354, "reward_opening_diversity_std": 0.25745269656181335, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.12882253527641296, "reward_total_composite_std": 0.0519123338162899} {"timestamp_utc": "2026-04-12T13:22:34Z", "mode": "train", "global_step": 653, "epoch": 0.02622805960557497, "loss": -0.0468, "grad_norm": 14.32152271270752, "learning_rate": 8.024242424242425e-06, "num_tokens": 1309991.0, "completions/mean_length": 51.25, "completions/min_length": 27.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.25, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.767805278301239, "rewards/meter/std": 0.29257190227508545, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.9154626131057739, "rewards/repeat_penalty/std": 0.09929834306240082, "rewards/near_duplicate_penalty/mean": 0.9682186841964722, "rewards/near_duplicate_penalty/std": 0.023648826405405998, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9752647876739502, "rewards/distinct_2/std": 0.034148700535297394, "rewards/total_composite/mean": 0.36292827129364014, "rewards/total_composite/std": 0.22661900520324707, "reward": 0.36292827129364014, "reward_std": 0.22661900520324707, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1530527025461197, "sampling/sampling_logp_difference/max": 1.8436579704284668, "sampling/importance_sampling_ratio/min": 0.1582375317811966, "sampling/importance_sampling_ratio/mean": 1.0349364280700684, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9279947057366371, "clip_ratio/low_mean": 0.09473566338419914, "clip_ratio/low_min": 0.09473566338419914, "clip_ratio/high_mean": 0.06286514457315207, "clip_ratio/high_max": 0.06286514457315207, "clip_ratio/region_mean": 0.1576008079573512, "reward_total_mean": 0.36292827129364014, "reward_meter_mean": 0.767805278301239, "reward_meter_std": 0.29257190227508545, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9154626131057739, "reward_repeat_penalty_std": 0.09929834306240082, "reward_near_duplicate_penalty_mean": 0.9682186841964722, "reward_near_duplicate_penalty_std": 0.023648826405405998, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9752647876739502, "reward_distinct_2_std": 0.034148700535297394, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.36292827129364014, "reward_total_composite_std": 0.22661900520324707} {"timestamp_utc": "2026-04-12T13:22:43Z", "mode": "train", "global_step": 654, "epoch": 0.026268225087359924, "loss": 0.0469, "grad_norm": 10.498310089111328, "learning_rate": 8.021212121212122e-06, "num_tokens": 1312341.0, "completions/mean_length": 106.75, "completions/min_length": 97.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.75, "completions/min_terminated_length": 97.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.9362326264381409, "rewards/meter/std": 0.09628015756607056, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.7272390723228455, "rewards/repeat_penalty/std": 0.16425026953220367, "rewards/near_duplicate_penalty/mean": 0.9148551821708679, "rewards/near_duplicate_penalty/std": 0.04300973564386368, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.8128030300140381, "rewards/distinct_2/std": 0.12252521514892578, "rewards/total_composite/mean": 0.34084993600845337, "rewards/total_composite/std": 0.10532856732606888, "reward": 0.34084993600845337, "reward_std": 0.10532856732606888, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14149324595928192, "sampling/sampling_logp_difference/max": 1.6551990509033203, "sampling/importance_sampling_ratio/min": 0.19105401635169983, "sampling/importance_sampling_ratio/mean": 1.003642201423645, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7534263432025909, "clip_ratio/low_mean": 0.02264983393251896, "clip_ratio/low_min": 0.02264983393251896, "clip_ratio/high_mean": 0.11159832589328289, "clip_ratio/high_max": 0.11159832589328289, "clip_ratio/region_mean": 0.13424815982580185, "reward_total_mean": 0.34084993600845337, "reward_meter_mean": 0.9362326264381409, "reward_meter_std": 0.09628015756607056, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7272390723228455, "reward_repeat_penalty_std": 0.16425026953220367, "reward_near_duplicate_penalty_mean": 0.9148551821708679, "reward_near_duplicate_penalty_std": 0.04300973564386368, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.8128030300140381, "reward_distinct_2_std": 0.12252521514892578, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.34084993600845337, "reward_total_composite_std": 0.10532856732606888} {"timestamp_utc": "2026-04-12T13:22:58Z", "mode": "train", "global_step": 655, "epoch": 0.026308390569144878, "loss": -0.0229, "grad_norm": 6.326838970184326, "learning_rate": 8.018181818181818e-06, "num_tokens": 1313915.0, "completions/mean_length": 102.75, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.28571701049805, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.3526526093482971, "rewards/meter/std": 0.3082861304283142, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9672703742980957, "rewards/lexical_plausibility/std": 0.09257334470748901, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.23868314921855927, "rewards/repeat_penalty/mean": 0.9533663392066956, "rewards/repeat_penalty/std": 0.04521464928984642, "rewards/near_duplicate_penalty/mean": 0.9627457857131958, "rewards/near_duplicate_penalty/std": 0.02561154030263424, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.989881157875061, "rewards/distinct_2/std": 0.027029765769839287, "rewards/total_composite/mean": 0.14078126847743988, "rewards/total_composite/std": 0.1517435908317566, "reward": 0.14078126847743988, "reward_std": 0.15174360573291779, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15908733010292053, "sampling/sampling_logp_difference/max": 1.8897331953048706, "sampling/importance_sampling_ratio/min": 0.1511121243238449, "sampling/importance_sampling_ratio/mean": 1.0027285814285278, "sampling/importance_sampling_ratio/max": 1.9810218811035156, "entropy": 0.7259085550904274, "clip_ratio/low_mean": 0.051550510339438915, "clip_ratio/low_min": 0.051550510339438915, "clip_ratio/high_mean": 0.0810845885425806, "clip_ratio/high_max": 0.0810845885425806, "clip_ratio/region_mean": 0.13263509888201952, "reward_total_mean": 0.14078126847743988, "reward_meter_mean": 0.3526526093482971, "reward_meter_std": 0.3082861304283142, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9672703742980957, "reward_lexical_plausibility_std": 0.09257334470748901, "reward_repeat_penalty_mean": 0.9533663392066956, "reward_repeat_penalty_std": 0.04521464928984642, "reward_near_duplicate_penalty_mean": 0.9627457857131958, "reward_near_duplicate_penalty_std": 0.02561154030263424, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.989881157875061, "reward_distinct_2_std": 0.027029765769839287, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.23868314921855927, "reward_total_composite_mean": 0.14078126847743988, "reward_total_composite_std": 0.1517435908317566} {"timestamp_utc": "2026-04-12T13:23:06Z", "mode": "train", "global_step": 656, "epoch": 0.026348556050929832, "loss": 0.064, "grad_norm": 13.405967712402344, "learning_rate": 8.015151515151515e-06, "num_tokens": 1315539.0, "completions/mean_length": 45.0, "completions/min_length": 38.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.48697662353515625, "rewards/meter/std": 0.3975958228111267, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.27458736300468445, "rewards/repeat_penalty/mean": 0.9424288272857666, "rewards/repeat_penalty/std": 0.07438904047012329, "rewards/near_duplicate_penalty/mean": 0.9495924711227417, "rewards/near_duplicate_penalty/std": 0.05471259355545044, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.18401092290878296, "rewards/total_composite/std": 0.21311181783676147, "reward": 0.18401092290878296, "reward_std": 0.21311181783676147, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14915597438812256, "sampling/sampling_logp_difference/max": 1.995527982711792, "sampling/importance_sampling_ratio/min": 0.13594186305999756, "sampling/importance_sampling_ratio/mean": 0.9948115944862366, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8379657715559006, "clip_ratio/low_mean": 0.07851754873991013, "clip_ratio/low_min": 0.07851754873991013, "clip_ratio/high_mean": 0.05291762016713619, "clip_ratio/high_max": 0.05291762016713619, "clip_ratio/region_mean": 0.13143516890704632, "reward_total_mean": 0.18401092290878296, "reward_meter_mean": 0.48697662353515625, "reward_meter_std": 0.3975958228111267, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9424288272857666, "reward_repeat_penalty_std": 0.07438904047012329, "reward_near_duplicate_penalty_mean": 0.9495924711227417, "reward_near_duplicate_penalty_std": 0.05471259355545044, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.27458736300468445, "reward_total_composite_mean": 0.18401092290878296, "reward_total_composite_std": 0.21311181783676147} {"timestamp_utc": "2026-04-12T13:23:18Z", "mode": "train", "global_step": 657, "epoch": 0.026388721532714786, "loss": -0.1019, "grad_norm": 8.138545989990234, "learning_rate": 8.012121212121214e-06, "num_tokens": 1318125.0, "completions/mean_length": 127.25, "completions/min_length": 42.0, "completions/max_length": 155.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.25, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 155.0, "rewards/meter/mean": 0.43511897325515747, "rewards/meter/std": 0.2925766110420227, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.2182178944349289, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9402433037757874, "rewards/lexical_plausibility/std": 0.13108384609222412, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.6454905271530151, "rewards/repeat_penalty/std": 0.28969377279281616, "rewards/near_duplicate_penalty/mean": 0.8732624053955078, "rewards/near_duplicate_penalty/std": 0.2218487709760666, "rewards/opening_diversity/mean": 0.846875011920929, "rewards/opening_diversity/std": 0.3048528730869293, "rewards/distinct_2/mean": 0.7203527092933655, "rewards/distinct_2/std": 0.30008402466773987, "rewards/total_composite/mean": 0.08786556124687195, "rewards/total_composite/std": 0.062393952161073685, "reward": 0.08786556124687195, "reward_std": 0.062393948435783386, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14421558380126953, "sampling/sampling_logp_difference/max": 2.2183570861816406, "sampling/importance_sampling_ratio/min": 0.10878768563270569, "sampling/importance_sampling_ratio/mean": 0.9979930520057678, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8150635771453381, "clip_ratio/low_mean": 0.04829929443076253, "clip_ratio/low_min": 0.04829929443076253, "clip_ratio/high_mean": 0.07662495132535696, "clip_ratio/high_max": 0.07662495132535696, "clip_ratio/region_mean": 0.12492424575611949, "reward_total_mean": 0.08786556124687195, "reward_meter_mean": 0.43511897325515747, "reward_meter_std": 0.2925766110420227, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.2182178944349289, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9402433037757874, "reward_lexical_plausibility_std": 0.13108384609222412, "reward_repeat_penalty_mean": 0.6454905271530151, "reward_repeat_penalty_std": 0.28969377279281616, "reward_near_duplicate_penalty_mean": 0.8732624053955078, "reward_near_duplicate_penalty_std": 0.2218487709760666, "reward_opening_diversity_mean": 0.846875011920929, "reward_opening_diversity_std": 0.3048528730869293, "reward_distinct_2_mean": 0.7203527092933655, "reward_distinct_2_std": 0.30008402466773987, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.08786556124687195, "reward_total_composite_std": 0.062393952161073685} {"timestamp_utc": "2026-04-12T13:23:33Z", "mode": "train", "global_step": 658, "epoch": 0.02642888701449974, "loss": 0.0301, "grad_norm": 2.0185253620147705, "learning_rate": 8.00909090909091e-06, "num_tokens": 1323693.0, "completions/mean_length": 451.0, "completions/min_length": 407.0, "completions/max_length": 489.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 451.0, "completions/min_terminated_length": 407.0, "completions/max_terminated_length": 489.0, "rewards/meter/mean": 0.5132176876068115, "rewards/meter/std": 0.483419269323349, "rewards/count_adherence/mean": 0.7916666269302368, "rewards/count_adherence/std": 0.04272466152906418, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.4448012411594391, "rewards/near_duplicate_penalty/std": 0.2239237129688263, "rewards/opening_diversity/mean": 0.7188467979431152, "rewards/opening_diversity/std": 0.2755339741706848, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.05027870833873749, "rewards/total_composite/std": 0.0547531358897686, "reward": 0.05027870833873749, "reward_std": 0.0547531358897686, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.02426569163799286, "sampling/sampling_logp_difference/max": 2.7454569339752197, "sampling/importance_sampling_ratio/min": 0.06421895325183868, "sampling/importance_sampling_ratio/mean": 1.0036330223083496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.1453683408908546, "clip_ratio/low_mean": 0.013538115366827697, "clip_ratio/low_min": 0.013538115366827697, "clip_ratio/high_mean": 0.01030551188159734, "clip_ratio/high_max": 0.01030551188159734, "clip_ratio/region_mean": 0.023843627248425037, "reward_total_mean": 0.05027870833873749, "reward_meter_mean": 0.5132176876068115, "reward_meter_std": 0.483419269323349, "reward_count_adherence_mean": 0.7916666269302368, "reward_count_adherence_std": 0.04272466152906418, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.4448012411594391, "reward_near_duplicate_penalty_std": 0.2239237129688263, "reward_opening_diversity_mean": 0.7188467979431152, "reward_opening_diversity_std": 0.2755339741706848, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.05027870833873749, "reward_total_composite_std": 0.0547531358897686} {"timestamp_utc": "2026-04-12T13:23:47Z", "mode": "train", "global_step": 659, "epoch": 0.026469052496284694, "loss": -0.1073, "grad_norm": 5.058903217315674, "learning_rate": 8.006060606060607e-06, "num_tokens": 1325330.0, "completions/mean_length": 111.625, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.42857360839844, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.7167664766311646, "rewards/meter/std": 0.40534457564353943, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9550361633300781, "rewards/lexical_plausibility/std": 0.12717685103416443, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8984770178794861, "rewards/repeat_penalty/std": 0.13434016704559326, "rewards/near_duplicate_penalty/mean": 0.9604055881500244, "rewards/near_duplicate_penalty/std": 0.03500939533114433, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9608974456787109, "rewards/distinct_2/std": 0.057494573295116425, "rewards/total_composite/mean": 0.24018089473247528, "rewards/total_composite/std": 0.15819303691387177, "reward": 0.24018089473247528, "reward_std": 0.15819303691387177, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16321519017219543, "sampling/sampling_logp_difference/max": 1.762455940246582, "sampling/importance_sampling_ratio/min": 0.1716228574514389, "sampling/importance_sampling_ratio/mean": 1.0060358047485352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7552897930145264, "clip_ratio/low_mean": 0.01922682556323707, "clip_ratio/low_min": 0.01922682556323707, "clip_ratio/high_mean": 0.0866461917757988, "clip_ratio/high_max": 0.0866461917757988, "clip_ratio/region_mean": 0.10587301733903587, "reward_total_mean": 0.24018089473247528, "reward_meter_mean": 0.7167664766311646, "reward_meter_std": 0.40534457564353943, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9550361633300781, "reward_lexical_plausibility_std": 0.12717685103416443, "reward_repeat_penalty_mean": 0.8984770178794861, "reward_repeat_penalty_std": 0.13434016704559326, "reward_near_duplicate_penalty_mean": 0.9604055881500244, "reward_near_duplicate_penalty_std": 0.03500939533114433, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9608974456787109, "reward_distinct_2_std": 0.057494573295116425, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.24018089473247528, "reward_total_composite_std": 0.15819303691387177} {"timestamp_utc": "2026-04-12T13:23:57Z", "mode": "train", "global_step": 660, "epoch": 0.026509217978069648, "loss": 0.0499, "grad_norm": 10.33723258972168, "learning_rate": 8.003030303030304e-06, "num_tokens": 1327271.0, "completions/mean_length": 85.625, "completions/min_length": 78.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.625, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.6358233690261841, "rewards/meter/std": 0.34739404916763306, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.5449999570846558, "rewards/judge_quality/std": 0.22915996611118317, "rewards/repeat_penalty/mean": 0.9449267387390137, "rewards/repeat_penalty/std": 0.03723674267530441, "rewards/near_duplicate_penalty/mean": 0.9611337184906006, "rewards/near_duplicate_penalty/std": 0.016394222155213356, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9828397631645203, "rewards/distinct_2/std": 0.02371014468371868, "rewards/total_composite/mean": 0.327256977558136, "rewards/total_composite/std": 0.23568442463874817, "reward": 0.327256977558136, "reward_std": 0.23568440973758698, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15584082901477814, "sampling/sampling_logp_difference/max": 3.2166783809661865, "sampling/importance_sampling_ratio/min": 0.0400879941880703, "sampling/importance_sampling_ratio/mean": 1.0125001668930054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8571107685565948, "clip_ratio/low_mean": 0.07578548043966293, "clip_ratio/low_min": 0.07578548043966293, "clip_ratio/high_mean": 0.05673158261924982, "clip_ratio/high_max": 0.05673158261924982, "clip_ratio/region_mean": 0.13251706305891275, "reward_total_mean": 0.327256977558136, "reward_meter_mean": 0.6358233690261841, "reward_meter_std": 0.34739404916763306, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9449267387390137, "reward_repeat_penalty_std": 0.03723674267530441, "reward_near_duplicate_penalty_mean": 0.9611337184906006, "reward_near_duplicate_penalty_std": 0.016394222155213356, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9828397631645203, "reward_distinct_2_std": 0.02371014468371868, "reward_judge_quality_mean": 0.5449999570846558, "reward_judge_quality_std": 0.22915996611118317, "reward_total_composite_mean": 0.327256977558136, "reward_total_composite_std": 0.23568442463874817} {"timestamp_utc": "2026-04-12T13:24:07Z", "mode": "train", "global_step": 661, "epoch": 0.0265493834598546, "loss": -0.0203, "grad_norm": 11.228118896484375, "learning_rate": 8.000000000000001e-06, "num_tokens": 1329368.0, "completions/mean_length": 79.125, "completions/min_length": 45.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.125, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.35494035482406616, "rewards/meter/std": 0.38554656505584717, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9864042401313782, "rewards/lexical_plausibility/std": 0.031858112663030624, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9130034446716309, "rewards/repeat_penalty/std": 0.1118207573890686, "rewards/near_duplicate_penalty/mean": 0.9660369753837585, "rewards/near_duplicate_penalty/std": 0.024087518453598022, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9431574940681458, "rewards/distinct_2/std": 0.0974927470088005, "rewards/total_composite/mean": 0.11021161079406738, "rewards/total_composite/std": 0.13464927673339844, "reward": 0.11021161079406738, "reward_std": 0.13464926183223724, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15921148657798767, "sampling/sampling_logp_difference/max": 2.1211700439453125, "sampling/importance_sampling_ratio/min": 0.11989127099514008, "sampling/importance_sampling_ratio/mean": 0.9796518683433533, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.687077060341835, "clip_ratio/low_mean": 0.09710708633065224, "clip_ratio/low_min": 0.09710708633065224, "clip_ratio/high_mean": 0.031055900268256664, "clip_ratio/high_max": 0.031055900268256664, "clip_ratio/region_mean": 0.1281629865989089, "reward_total_mean": 0.11021161079406738, "reward_meter_mean": 0.35494035482406616, "reward_meter_std": 0.38554656505584717, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9864042401313782, "reward_lexical_plausibility_std": 0.031858112663030624, "reward_repeat_penalty_mean": 0.9130034446716309, "reward_repeat_penalty_std": 0.1118207573890686, "reward_near_duplicate_penalty_mean": 0.9660369753837585, "reward_near_duplicate_penalty_std": 0.024087518453598022, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9431574940681458, "reward_distinct_2_std": 0.0974927470088005, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.11021161079406738, "reward_total_composite_std": 0.13464927673339844} {"timestamp_utc": "2026-04-12T13:24:21Z", "mode": "train", "global_step": 662, "epoch": 0.026589548941639556, "loss": -0.0499, "grad_norm": 5.116161346435547, "learning_rate": 7.996969696969697e-06, "num_tokens": 1331139.0, "completions/mean_length": 102.375, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.85714340209961, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.4327571988105774, "rewards/meter/std": 0.4184527099132538, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9693456888198853, "rewards/lexical_plausibility/std": 0.08670346438884735, "rewards/judge_quality/mean": 0.6937500238418579, "rewards/judge_quality/std": 0.335769385099411, "rewards/repeat_penalty/mean": 0.8699858784675598, "rewards/repeat_penalty/std": 0.1817188262939453, "rewards/near_duplicate_penalty/mean": 0.9534045457839966, "rewards/near_duplicate_penalty/std": 0.062445808202028275, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9624541997909546, "rewards/distinct_2/std": 0.0560930110514164, "rewards/total_composite/mean": 0.3592093586921692, "rewards/total_composite/std": 0.4135020971298218, "reward": 0.3592093586921692, "reward_std": 0.4135020971298218, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13316769897937775, "sampling/sampling_logp_difference/max": 1.3598146438598633, "sampling/importance_sampling_ratio/min": 0.2567083537578583, "sampling/importance_sampling_ratio/mean": 1.0052872896194458, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.690619707107544, "clip_ratio/low_mean": 0.052816879004240036, "clip_ratio/low_min": 0.052816879004240036, "clip_ratio/high_mean": 0.0431758863851428, "clip_ratio/high_max": 0.0431758863851428, "clip_ratio/region_mean": 0.09599276538938284, "reward_total_mean": 0.3592093586921692, "reward_meter_mean": 0.4327571988105774, "reward_meter_std": 0.4184527099132538, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9693456888198853, "reward_lexical_plausibility_std": 0.08670346438884735, "reward_repeat_penalty_mean": 0.8699858784675598, "reward_repeat_penalty_std": 0.1817188262939453, "reward_near_duplicate_penalty_mean": 0.9534045457839966, "reward_near_duplicate_penalty_std": 0.062445808202028275, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9624541997909546, "reward_distinct_2_std": 0.0560930110514164, "reward_judge_quality_mean": 0.6937500238418579, "reward_judge_quality_std": 0.335769385099411, "reward_total_composite_mean": 0.3592093586921692, "reward_total_composite_std": 0.4135020971298218} {"timestamp_utc": "2026-04-12T13:24:31Z", "mode": "train", "global_step": 663, "epoch": 0.02662971442342451, "loss": 0.062, "grad_norm": 8.638606071472168, "learning_rate": 7.993939393939396e-06, "num_tokens": 1333388.0, "completions/mean_length": 100.125, "completions/min_length": 91.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.125, "completions/min_terminated_length": 91.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.6953133344650269, "rewards/meter/std": 0.36091312766075134, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.8255414366722107, "rewards/repeat_penalty/std": 0.11612191051244736, "rewards/near_duplicate_penalty/mean": 0.9499050378799438, "rewards/near_duplicate_penalty/std": 0.03630257397890091, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.8796696662902832, "rewards/distinct_2/std": 0.08587934076786041, "rewards/total_composite/mean": 0.2767334580421448, "rewards/total_composite/std": 0.1958579123020172, "reward": 0.2767334580421448, "reward_std": 0.1958579123020172, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1456546187400818, "sampling/sampling_logp_difference/max": 1.9623117446899414, "sampling/importance_sampling_ratio/min": 0.14053316414356232, "sampling/importance_sampling_ratio/mean": 1.00351083278656, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6855262108147144, "clip_ratio/low_mean": 0.06558650452643633, "clip_ratio/low_min": 0.06558650452643633, "clip_ratio/high_mean": 0.06632081046700478, "clip_ratio/high_max": 0.06632081046700478, "clip_ratio/region_mean": 0.1319073149934411, "reward_total_mean": 0.2767334580421448, "reward_meter_mean": 0.6953133344650269, "reward_meter_std": 0.36091312766075134, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8255414366722107, "reward_repeat_penalty_std": 0.11612191051244736, "reward_near_duplicate_penalty_mean": 0.9499050378799438, "reward_near_duplicate_penalty_std": 0.03630257397890091, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.8796696662902832, "reward_distinct_2_std": 0.08587934076786041, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.2767334580421448, "reward_total_composite_std": 0.1958579123020172} {"timestamp_utc": "2026-04-12T13:24:40Z", "mode": "train", "global_step": 664, "epoch": 0.026669879905209463, "loss": -0.0089, "grad_norm": 13.82679271697998, "learning_rate": 7.990909090909091e-06, "num_tokens": 1335064.0, "completions/mean_length": 53.5, "completions/min_length": 48.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.5, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7547950744628906, "rewards/meter/std": 0.29388749599456787, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6124999523162842, "rewards/judge_quality/std": 0.23741163313388824, "rewards/repeat_penalty/mean": 0.914587140083313, "rewards/repeat_penalty/std": 0.13662421703338623, "rewards/near_duplicate_penalty/mean": 0.9572491645812988, "rewards/near_duplicate_penalty/std": 0.018889212980866432, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.05725561082363129, "rewards/total_composite/mean": 0.4655528962612152, "rewards/total_composite/std": 0.2876104414463043, "reward": 0.4655528962612152, "reward_std": 0.28761041164398193, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1815180480480194, "sampling/sampling_logp_difference/max": 5.202572822570801, "sampling/importance_sampling_ratio/min": 0.005502389278262854, "sampling/importance_sampling_ratio/mean": 1.001611590385437, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8862349018454552, "clip_ratio/low_mean": 0.06500632595270872, "clip_ratio/low_min": 0.06500632595270872, "clip_ratio/high_mean": 0.09317438304424286, "clip_ratio/high_max": 0.09317438304424286, "clip_ratio/region_mean": 0.15818070899695158, "reward_total_mean": 0.4655528962612152, "reward_meter_mean": 0.7547950744628906, "reward_meter_std": 0.29388749599456787, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.914587140083313, "reward_repeat_penalty_std": 0.13662421703338623, "reward_near_duplicate_penalty_mean": 0.9572491645812988, "reward_near_duplicate_penalty_std": 0.018889212980866432, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.05725561082363129, "reward_judge_quality_mean": 0.6124999523162842, "reward_judge_quality_std": 0.23741163313388824, "reward_total_composite_mean": 0.4655528962612152, "reward_total_composite_std": 0.2876104414463043} {"timestamp_utc": "2026-04-12T13:24:49Z", "mode": "train", "global_step": 665, "epoch": 0.026710045386994417, "loss": 0.0249, "grad_norm": 13.572747230529785, "learning_rate": 7.987878787878789e-06, "num_tokens": 1336727.0, "completions/mean_length": 56.875, "completions/min_length": 47.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.875, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.8040631413459778, "rewards/meter/std": 0.33520224690437317, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.8539631366729736, "rewards/lexical_plausibility/std": 0.1430853307247162, "rewards/judge_quality/mean": 0.5350000262260437, "rewards/judge_quality/std": 0.411582350730896, "rewards/repeat_penalty/mean": 0.964275598526001, "rewards/repeat_penalty/std": 0.05441336706280708, "rewards/near_duplicate_penalty/mean": 0.9808967113494873, "rewards/near_duplicate_penalty/std": 0.03064265102148056, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.03237133473157883, "rewards/total_composite/mean": 0.4284802973270416, "rewards/total_composite/std": 0.4009256958961487, "reward": 0.4284802973270416, "reward_std": 0.4009256958961487, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1456071138381958, "sampling/sampling_logp_difference/max": 1.9290480613708496, "sampling/importance_sampling_ratio/min": 0.1452864408493042, "sampling/importance_sampling_ratio/mean": 1.0067170858383179, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9042868167161942, "clip_ratio/low_mean": 0.08205477707087994, "clip_ratio/low_min": 0.08205477707087994, "clip_ratio/high_mean": 0.05415690876543522, "clip_ratio/high_max": 0.05415690876543522, "clip_ratio/region_mean": 0.13621168583631516, "reward_total_mean": 0.4284802973270416, "reward_meter_mean": 0.8040631413459778, "reward_meter_std": 0.33520224690437317, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.8539631366729736, "reward_lexical_plausibility_std": 0.1430853307247162, "reward_repeat_penalty_mean": 0.964275598526001, "reward_repeat_penalty_std": 0.05441336706280708, "reward_near_duplicate_penalty_mean": 0.9808967113494873, "reward_near_duplicate_penalty_std": 0.03064265102148056, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.03237133473157883, "reward_judge_quality_mean": 0.5350000262260437, "reward_judge_quality_std": 0.411582350730896, "reward_total_composite_mean": 0.4284802973270416, "reward_total_composite_std": 0.4009256958961487} {"timestamp_utc": "2026-04-12T13:24:59Z", "mode": "train", "global_step": 666, "epoch": 0.02675021086877937, "loss": 0.0983, "grad_norm": 16.244979858398438, "learning_rate": 7.984848484848486e-06, "num_tokens": 1338812.0, "completions/mean_length": 93.625, "completions/min_length": 72.0, "completions/max_length": 103.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.625, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.6764025688171387, "rewards/meter/std": 0.27123498916625977, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.15526476502418518, "rewards/repeat_penalty/mean": 0.9311668872833252, "rewards/repeat_penalty/std": 0.06370653957128525, "rewards/near_duplicate_penalty/mean": 0.9684038162231445, "rewards/near_duplicate_penalty/std": 0.021242352202534676, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9611342549324036, "rewards/distinct_2/std": 0.05580252408981323, "rewards/total_composite/mean": 0.2956639230251312, "rewards/total_composite/std": 0.12961456179618835, "reward": 0.2956639230251312, "reward_std": 0.12961454689502716, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14634813368320465, "sampling/sampling_logp_difference/max": 1.6656081676483154, "sampling/importance_sampling_ratio/min": 0.18907563388347626, "sampling/importance_sampling_ratio/mean": 1.015251874923706, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7250681594014168, "clip_ratio/low_mean": 0.061393896117806435, "clip_ratio/low_min": 0.061393896117806435, "clip_ratio/high_mean": 0.08866982720792294, "clip_ratio/high_max": 0.08866982720792294, "clip_ratio/region_mean": 0.15006372332572937, "reward_total_mean": 0.2956639230251312, "reward_meter_mean": 0.6764025688171387, "reward_meter_std": 0.27123498916625977, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9311668872833252, "reward_repeat_penalty_std": 0.06370653957128525, "reward_near_duplicate_penalty_mean": 0.9684038162231445, "reward_near_duplicate_penalty_std": 0.021242352202534676, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9611342549324036, "reward_distinct_2_std": 0.05580252408981323, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.15526476502418518, "reward_total_composite_mean": 0.2956639230251312, "reward_total_composite_std": 0.12961456179618835} {"timestamp_utc": "2026-04-12T13:25:10Z", "mode": "train", "global_step": 667, "epoch": 0.026790376350564325, "loss": 0.0539, "grad_norm": 11.671969413757324, "learning_rate": 7.981818181818183e-06, "num_tokens": 1340980.0, "completions/mean_length": 94.0, "completions/min_length": 84.0, "completions/max_length": 108.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.0, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.5911504030227661, "rewards/meter/std": 0.3050113022327423, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9143061637878418, "rewards/repeat_penalty/std": 0.056243348866701126, "rewards/near_duplicate_penalty/mean": 0.9560746550559998, "rewards/near_duplicate_penalty/std": 0.03006063774228096, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9558618068695068, "rewards/distinct_2/std": 0.03913449868559837, "rewards/total_composite/mean": 0.15422356128692627, "rewards/total_composite/std": 0.1303739994764328, "reward": 0.15422356128692627, "reward_std": 0.1303739994764328, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1310657262802124, "sampling/sampling_logp_difference/max": 2.116398811340332, "sampling/importance_sampling_ratio/min": 0.12046466022729874, "sampling/importance_sampling_ratio/mean": 1.012769341468811, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.626823864877224, "clip_ratio/low_mean": 0.07949473522603512, "clip_ratio/low_min": 0.07949473522603512, "clip_ratio/high_mean": 0.042927565053105354, "clip_ratio/high_max": 0.042927565053105354, "clip_ratio/region_mean": 0.12242230027914047, "reward_total_mean": 0.15422356128692627, "reward_meter_mean": 0.5911504030227661, "reward_meter_std": 0.3050113022327423, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9143061637878418, "reward_repeat_penalty_std": 0.056243348866701126, "reward_near_duplicate_penalty_mean": 0.9560746550559998, "reward_near_duplicate_penalty_std": 0.03006063774228096, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9558618068695068, "reward_distinct_2_std": 0.03913449868559837, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.15422356128692627, "reward_total_composite_std": 0.1303739994764328} {"timestamp_utc": "2026-04-12T13:25:21Z", "mode": "train", "global_step": 668, "epoch": 0.02683054183234928, "loss": -0.0223, "grad_norm": 8.770500183105469, "learning_rate": 7.978787878787879e-06, "num_tokens": 1343552.0, "completions/mean_length": 123.5, "completions/min_length": 96.0, "completions/max_length": 132.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.5, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 132.0, "rewards/meter/mean": 0.36670535802841187, "rewards/meter/std": 0.363443523645401, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.6017524003982544, "rewards/repeat_penalty/std": 0.17603251338005066, "rewards/near_duplicate_penalty/mean": 0.8795514702796936, "rewards/near_duplicate_penalty/std": 0.04831100255250931, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.6907018423080444, "rewards/distinct_2/std": 0.14063426852226257, "rewards/total_composite/mean": 0.06219920516014099, "rewards/total_composite/std": 0.06289541721343994, "reward": 0.06219920516014099, "reward_std": 0.06289542466402054, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1278284341096878, "sampling/sampling_logp_difference/max": 2.4323699474334717, "sampling/importance_sampling_ratio/min": 0.08782843500375748, "sampling/importance_sampling_ratio/mean": 0.9909975528717041, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6201633624732494, "clip_ratio/low_mean": 0.06598906312137842, "clip_ratio/low_min": 0.06598906312137842, "clip_ratio/high_mean": 0.04261363670229912, "clip_ratio/high_max": 0.04261363670229912, "clip_ratio/region_mean": 0.10860269982367754, "reward_total_mean": 0.06219920516014099, "reward_meter_mean": 0.36670535802841187, "reward_meter_std": 0.363443523645401, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6017524003982544, "reward_repeat_penalty_std": 0.17603251338005066, "reward_near_duplicate_penalty_mean": 0.8795514702796936, "reward_near_duplicate_penalty_std": 0.04831100255250931, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.6907018423080444, "reward_distinct_2_std": 0.14063426852226257, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.06219920516014099, "reward_total_composite_std": 0.06289541721343994} {"timestamp_utc": "2026-04-12T13:25:31Z", "mode": "train", "global_step": 669, "epoch": 0.026870707314134233, "loss": 0.0056, "grad_norm": 13.67820930480957, "learning_rate": 7.975757575757576e-06, "num_tokens": 1345383.0, "completions/mean_length": 51.875, "completions/min_length": 45.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.875, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.7102116346359253, "rewards/meter/std": 0.38947975635528564, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9329346418380737, "rewards/repeat_penalty/std": 0.05199816823005676, "rewards/near_duplicate_penalty/mean": 0.95139479637146, "rewards/near_duplicate_penalty/std": 0.030207542702555656, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9802631139755249, "rewards/distinct_2/std": 0.036561544984579086, "rewards/total_composite/mean": 0.32223033905029297, "rewards/total_composite/std": 0.15651214122772217, "reward": 0.32223033905029297, "reward_std": 0.15651212632656097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14197148382663727, "sampling/sampling_logp_difference/max": 2.001180648803711, "sampling/importance_sampling_ratio/min": 0.13517560064792633, "sampling/importance_sampling_ratio/mean": 0.9927393198013306, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7489805072546005, "clip_ratio/low_mean": 0.036504664458334446, "clip_ratio/low_min": 0.036504664458334446, "clip_ratio/high_mean": 0.08419650979340076, "clip_ratio/high_max": 0.08419650979340076, "clip_ratio/region_mean": 0.12070117425173521, "reward_total_mean": 0.32223033905029297, "reward_meter_mean": 0.7102116346359253, "reward_meter_std": 0.38947975635528564, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9329346418380737, "reward_repeat_penalty_std": 0.05199816823005676, "reward_near_duplicate_penalty_mean": 0.95139479637146, "reward_near_duplicate_penalty_std": 0.030207542702555656, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9802631139755249, "reward_distinct_2_std": 0.036561544984579086, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.32223033905029297, "reward_total_composite_std": 0.15651214122772217} {"timestamp_utc": "2026-04-12T13:25:40Z", "mode": "train", "global_step": 670, "epoch": 0.026910872795919187, "loss": 0.0172, "grad_norm": 12.20312786102295, "learning_rate": 7.972727272727273e-06, "num_tokens": 1347125.0, "completions/mean_length": 52.75, "completions/min_length": 48.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.75, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.987130880355835, "rewards/meter/std": 0.0074296449311077595, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9887152910232544, "rewards/lexical_plausibility/std": 0.022863244637846947, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.8460367918014526, "rewards/repeat_penalty/std": 0.1868453323841095, "rewards/near_duplicate_penalty/mean": 0.9336796998977661, "rewards/near_duplicate_penalty/std": 0.07384230196475983, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9526585340499878, "rewards/distinct_2/std": 0.055468734353780746, "rewards/total_composite/mean": 0.5933990478515625, "rewards/total_composite/std": 0.2635002136230469, "reward": 0.5933990478515625, "reward_std": 0.2635002136230469, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1362331360578537, "sampling/sampling_logp_difference/max": 1.7461051940917969, "sampling/importance_sampling_ratio/min": 0.1798045039176941, "sampling/importance_sampling_ratio/mean": 1.0128592252731323, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7716864421963692, "clip_ratio/low_mean": 0.053620395716279745, "clip_ratio/low_min": 0.053620395716279745, "clip_ratio/high_mean": 0.03396551730111241, "clip_ratio/high_max": 0.03396551730111241, "clip_ratio/region_mean": 0.08758591301739216, "reward_total_mean": 0.5933990478515625, "reward_meter_mean": 0.987130880355835, "reward_meter_std": 0.0074296449311077595, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9887152910232544, "reward_lexical_plausibility_std": 0.022863244637846947, "reward_repeat_penalty_mean": 0.8460367918014526, "reward_repeat_penalty_std": 0.1868453323841095, "reward_near_duplicate_penalty_mean": 0.9336796998977661, "reward_near_duplicate_penalty_std": 0.07384230196475983, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9526585340499878, "reward_distinct_2_std": 0.055468734353780746, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.5933990478515625, "reward_total_composite_std": 0.2635002136230469} {"timestamp_utc": "2026-04-12T13:25:50Z", "mode": "train", "global_step": 671, "epoch": 0.02695103827770414, "loss": 0.0711, "grad_norm": 9.78178882598877, "learning_rate": 7.96969696969697e-06, "num_tokens": 1349057.0, "completions/mean_length": 72.5, "completions/min_length": 63.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.5, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.3886287808418274, "rewards/meter/std": 0.40985411405563354, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9256945848464966, "rewards/repeat_penalty/std": 0.04860997945070267, "rewards/near_duplicate_penalty/mean": 0.9604939818382263, "rewards/near_duplicate_penalty/std": 0.02726934663951397, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.963475227355957, "rewards/distinct_2/std": 0.03487830236554146, "rewards/total_composite/mean": 0.1587459146976471, "rewards/total_composite/std": 0.17057305574417114, "reward": 0.1587459146976471, "reward_std": 0.17057305574417114, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1335901916027069, "sampling/sampling_logp_difference/max": 2.0363283157348633, "sampling/importance_sampling_ratio/min": 0.13050702214241028, "sampling/importance_sampling_ratio/mean": 1.0084887742996216, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7365903630852699, "clip_ratio/low_mean": 0.0709469704888761, "clip_ratio/low_min": 0.0709469704888761, "clip_ratio/high_mean": 0.042468528263270855, "clip_ratio/high_max": 0.042468528263270855, "clip_ratio/region_mean": 0.11341549875214696, "reward_total_mean": 0.1587459146976471, "reward_meter_mean": 0.3886287808418274, "reward_meter_std": 0.40985411405563354, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9256945848464966, "reward_repeat_penalty_std": 0.04860997945070267, "reward_near_duplicate_penalty_mean": 0.9604939818382263, "reward_near_duplicate_penalty_std": 0.02726934663951397, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.963475227355957, "reward_distinct_2_std": 0.03487830236554146, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.1587459146976471, "reward_total_composite_std": 0.17057305574417114} {"timestamp_utc": "2026-04-12T13:26:06Z", "mode": "train", "global_step": 672, "epoch": 0.026991203759489095, "loss": -0.0295, "grad_norm": 7.1071672439575195, "learning_rate": 7.966666666666668e-06, "num_tokens": 1351271.0, "completions/mean_length": 162.75, "completions/min_length": 85.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 112.85714721679688, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.4819783866405487, "rewards/meter/std": 0.3900616765022278, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.7841250896453857, "rewards/repeat_penalty/std": 0.3230384290218353, "rewards/near_duplicate_penalty/mean": 0.9610974192619324, "rewards/near_duplicate_penalty/std": 0.01954832673072815, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.816798746585846, "rewards/distinct_2/std": 0.3341992199420929, "rewards/total_composite/mean": 0.17207136750221252, "rewards/total_composite/std": 0.16055873036384583, "reward": 0.17207136750221252, "reward_std": 0.16055871546268463, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1683012694120407, "sampling/sampling_logp_difference/max": 2.6271228790283203, "sampling/importance_sampling_ratio/min": 0.07228614389896393, "sampling/importance_sampling_ratio/mean": 1.000517725944519, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6649110615253448, "clip_ratio/low_mean": 0.05331201106309891, "clip_ratio/low_min": 0.05331201106309891, "clip_ratio/high_mean": 0.07885371707379818, "clip_ratio/high_max": 0.07885371707379818, "clip_ratio/region_mean": 0.1321657281368971, "reward_total_mean": 0.17207136750221252, "reward_meter_mean": 0.4819783866405487, "reward_meter_std": 0.3900616765022278, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7841250896453857, "reward_repeat_penalty_std": 0.3230384290218353, "reward_near_duplicate_penalty_mean": 0.9610974192619324, "reward_near_duplicate_penalty_std": 0.01954832673072815, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.816798746585846, "reward_distinct_2_std": 0.3341992199420929, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.17207136750221252, "reward_total_composite_std": 0.16055873036384583} {"timestamp_utc": "2026-04-12T13:26:15Z", "mode": "train", "global_step": 673, "epoch": 0.02703136924127405, "loss": 0.0454, "grad_norm": 14.057157516479492, "learning_rate": 7.963636363636365e-06, "num_tokens": 1352888.0, "completions/mean_length": 46.125, "completions/min_length": 42.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.8637489080429077, "rewards/meter/std": 0.1764443814754486, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4587499797344208, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9530385136604309, "rewards/repeat_penalty/std": 0.04393855109810829, "rewards/near_duplicate_penalty/mean": 0.961021900177002, "rewards/near_duplicate_penalty/std": 0.023450659587979317, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.39170509576797485, "rewards/total_composite/std": 0.17069067060947418, "reward": 0.39170509576797485, "reward_std": 0.17069067060947418, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13802801072597504, "sampling/sampling_logp_difference/max": 3.609140634536743, "sampling/importance_sampling_ratio/min": 0.027075106278061867, "sampling/importance_sampling_ratio/mean": 1.0172617435455322, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6700945235788822, "clip_ratio/low_mean": 0.060082800686359406, "clip_ratio/low_min": 0.060082800686359406, "clip_ratio/high_mean": 0.05822447966784239, "clip_ratio/high_max": 0.05822447966784239, "clip_ratio/region_mean": 0.1183072803542018, "reward_total_mean": 0.39170509576797485, "reward_meter_mean": 0.8637489080429077, "reward_meter_std": 0.1764443814754486, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9530385136604309, "reward_repeat_penalty_std": 0.04393855109810829, "reward_near_duplicate_penalty_mean": 0.961021900177002, "reward_near_duplicate_penalty_std": 0.023450659587979317, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.4587499797344208, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.39170509576797485, "reward_total_composite_std": 0.17069067060947418} {"timestamp_utc": "2026-04-12T13:26:24Z", "mode": "train", "global_step": 674, "epoch": 0.027071534723059003, "loss": -0.0281, "grad_norm": 17.77109146118164, "learning_rate": 7.96060606060606e-06, "num_tokens": 1354487.0, "completions/mean_length": 34.875, "completions/min_length": 29.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.6136876344680786, "rewards/meter/std": 0.3237185776233673, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9697059392929077, "rewards/repeat_penalty/std": 0.04509860649704933, "rewards/near_duplicate_penalty/mean": 0.978339672088623, "rewards/near_duplicate_penalty/std": 0.027134040370583534, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.38173848390579224, "rewards/total_composite/std": 0.32607918977737427, "reward": 0.38173848390579224, "reward_std": 0.32607918977737427, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15165205299854279, "sampling/sampling_logp_difference/max": 1.9108219146728516, "sampling/importance_sampling_ratio/min": 0.14795872569084167, "sampling/importance_sampling_ratio/mean": 1.01705801486969, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0126424580812454, "clip_ratio/low_mean": 0.08050890080630779, "clip_ratio/low_min": 0.08050890080630779, "clip_ratio/high_mean": 0.03880772087723017, "clip_ratio/high_max": 0.03880772087723017, "clip_ratio/region_mean": 0.11931662168353796, "reward_total_mean": 0.38173848390579224, "reward_meter_mean": 0.6136876344680786, "reward_meter_std": 0.3237185776233673, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9697059392929077, "reward_repeat_penalty_std": 0.04509860649704933, "reward_near_duplicate_penalty_mean": 0.978339672088623, "reward_near_duplicate_penalty_std": 0.027134040370583534, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.38173848390579224, "reward_total_composite_std": 0.32607918977737427} {"timestamp_utc": "2026-04-12T13:26:36Z", "mode": "train", "global_step": 675, "epoch": 0.027111700204843957, "loss": 0.0224, "grad_norm": 5.370761871337891, "learning_rate": 7.957575757575758e-06, "num_tokens": 1358401.0, "completions/mean_length": 279.25, "completions/min_length": 262.0, "completions/max_length": 298.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 279.25, "completions/min_terminated_length": 262.0, "completions/max_terminated_length": 298.0, "rewards/meter/mean": 0.8288944363594055, "rewards/meter/std": 0.19590497016906738, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.2540968358516693, "rewards/repeat_penalty/std": 0.13142986595630646, "rewards/near_duplicate_penalty/mean": 0.8205145597457886, "rewards/near_duplicate_penalty/std": 0.061271749436855316, "rewards/opening_diversity/mean": 0.9943181872367859, "rewards/opening_diversity/std": 0.016070615500211716, "rewards/distinct_2/mean": 0.3660544157028198, "rewards/distinct_2/std": 0.15977324545383453, "rewards/total_composite/mean": 0.17865273356437683, "rewards/total_composite/std": 0.09777577966451645, "reward": 0.17865273356437683, "reward_std": 0.09777577221393585, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09400346875190735, "sampling/sampling_logp_difference/max": 3.8435425758361816, "sampling/importance_sampling_ratio/min": 0.021417593583464622, "sampling/importance_sampling_ratio/mean": 0.9996914863586426, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4531523250043392, "clip_ratio/low_mean": 0.05183503497391939, "clip_ratio/low_min": 0.05183503497391939, "clip_ratio/high_mean": 0.03676219470798969, "clip_ratio/high_max": 0.03676219470798969, "clip_ratio/region_mean": 0.08859722968190908, "reward_total_mean": 0.17865273356437683, "reward_meter_mean": 0.8288944363594055, "reward_meter_std": 0.19590497016906738, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2540968358516693, "reward_repeat_penalty_std": 0.13142986595630646, "reward_near_duplicate_penalty_mean": 0.8205145597457886, "reward_near_duplicate_penalty_std": 0.061271749436855316, "reward_opening_diversity_mean": 0.9943181872367859, "reward_opening_diversity_std": 0.016070615500211716, "reward_distinct_2_mean": 0.3660544157028198, "reward_distinct_2_std": 0.15977324545383453, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.17865273356437683, "reward_total_composite_std": 0.09777577966451645} {"timestamp_utc": "2026-04-12T13:26:45Z", "mode": "train", "global_step": 676, "epoch": 0.02715186568662891, "loss": 0.0441, "grad_norm": 11.891114234924316, "learning_rate": 7.954545454545455e-06, "num_tokens": 1359869.0, "completions/mean_length": 28.5, "completions/min_length": 25.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.5, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.9678075909614563, "rewards/meter/std": 0.056856755167245865, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.7450793981552124, "rewards/repeat_penalty/std": 0.01093420758843422, "rewards/near_duplicate_penalty/mean": 0.9934391975402832, "rewards/near_duplicate_penalty/std": 0.014578936621546745, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4934595823287964, "rewards/total_composite/std": 0.2405196726322174, "reward": 0.4934595823287964, "reward_std": 0.2405196577310562, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1260237842798233, "sampling/sampling_logp_difference/max": 1.4793071746826172, "sampling/importance_sampling_ratio/min": 0.22779546678066254, "sampling/importance_sampling_ratio/mean": 1.0029480457305908, "sampling/importance_sampling_ratio/max": 1.9300601482391357, "entropy": 0.7648178711533546, "clip_ratio/low_mean": 0.08059035800397396, "clip_ratio/low_min": 0.08059035800397396, "clip_ratio/high_mean": 0.029464286286383867, "clip_ratio/high_max": 0.029464286286383867, "clip_ratio/region_mean": 0.11005464429035783, "reward_total_mean": 0.4934595823287964, "reward_meter_mean": 0.9678075909614563, "reward_meter_std": 0.056856755167245865, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7450793981552124, "reward_repeat_penalty_std": 0.01093420758843422, "reward_near_duplicate_penalty_mean": 0.9934391975402832, "reward_near_duplicate_penalty_std": 0.014578936621546745, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.4934595823287964, "reward_total_composite_std": 0.2405196726322174} {"timestamp_utc": "2026-04-12T13:26:53Z", "mode": "train", "global_step": 677, "epoch": 0.027192031168413865, "loss": 0.0772, "grad_norm": 12.06702709197998, "learning_rate": 7.951515151515152e-06, "num_tokens": 1361385.0, "completions/mean_length": 43.5, "completions/min_length": 39.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.5, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6745848655700684, "rewards/meter/std": 0.4040341377258301, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2975345253944397, "rewards/repeat_penalty/mean": 0.9609465003013611, "rewards/repeat_penalty/std": 0.0487876832485199, "rewards/near_duplicate_penalty/mean": 0.9680687785148621, "rewards/near_duplicate_penalty/std": 0.03588702902197838, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.4496162533760071, "rewards/total_composite/std": 0.34201952815055847, "reward": 0.4496162533760071, "reward_std": 0.34201952815055847, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12411359697580338, "sampling/sampling_logp_difference/max": 1.5364108085632324, "sampling/importance_sampling_ratio/min": 0.21515193581581116, "sampling/importance_sampling_ratio/mean": 0.9982262849807739, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7586450204253197, "clip_ratio/low_mean": 0.07098861550912261, "clip_ratio/low_min": 0.07098861550912261, "clip_ratio/high_mean": 0.046543041709810495, "clip_ratio/high_max": 0.046543041709810495, "clip_ratio/region_mean": 0.1175316572189331, "reward_total_mean": 0.4496162533760071, "reward_meter_mean": 0.6745848655700684, "reward_meter_std": 0.4040341377258301, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9609465003013611, "reward_repeat_penalty_std": 0.0487876832485199, "reward_near_duplicate_penalty_mean": 0.9680687785148621, "reward_near_duplicate_penalty_std": 0.03588702902197838, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2975345253944397, "reward_total_composite_mean": 0.4496162533760071, "reward_total_composite_std": 0.34201952815055847} {"timestamp_utc": "2026-04-12T13:27:04Z", "mode": "train", "global_step": 678, "epoch": 0.02723219665019882, "loss": 0.047, "grad_norm": 7.9541168212890625, "learning_rate": 7.948484848484848e-06, "num_tokens": 1364109.0, "completions/mean_length": 161.5, "completions/min_length": 130.0, "completions/max_length": 183.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 161.5, "completions/min_terminated_length": 130.0, "completions/max_terminated_length": 183.0, "rewards/meter/mean": 0.8053493499755859, "rewards/meter/std": 0.322150856256485, "rewards/count_adherence/mean": 0.9285714626312256, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.6077289581298828, "rewards/repeat_penalty/std": 0.251259446144104, "rewards/near_duplicate_penalty/mean": 0.8977565765380859, "rewards/near_duplicate_penalty/std": 0.05994274839758873, "rewards/opening_diversity/mean": 0.9955357313156128, "rewards/opening_diversity/std": 0.012626901268959045, "rewards/distinct_2/mean": 0.6936469078063965, "rewards/distinct_2/std": 0.20930396020412445, "rewards/total_composite/mean": 0.18478071689605713, "rewards/total_composite/std": 0.17019730806350708, "reward": 0.18478071689605713, "reward_std": 0.1701972782611847, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11972744762897491, "sampling/sampling_logp_difference/max": 2.36962890625, "sampling/importance_sampling_ratio/min": 0.09351541846990585, "sampling/importance_sampling_ratio/mean": 0.9945900440216064, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.592000599950552, "clip_ratio/low_mean": 0.0536336125805974, "clip_ratio/low_min": 0.0536336125805974, "clip_ratio/high_mean": 0.05580764450132847, "clip_ratio/high_max": 0.05580764450132847, "clip_ratio/region_mean": 0.10944125708192587, "reward_total_mean": 0.18478071689605713, "reward_meter_mean": 0.8053493499755859, "reward_meter_std": 0.322150856256485, "reward_count_adherence_mean": 0.9285714626312256, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6077289581298828, "reward_repeat_penalty_std": 0.251259446144104, "reward_near_duplicate_penalty_mean": 0.8977565765380859, "reward_near_duplicate_penalty_std": 0.05994274839758873, "reward_opening_diversity_mean": 0.9955357313156128, "reward_opening_diversity_std": 0.012626901268959045, "reward_distinct_2_mean": 0.6936469078063965, "reward_distinct_2_std": 0.20930396020412445, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.18478071689605713, "reward_total_composite_std": 0.17019730806350708} {"timestamp_utc": "2026-04-12T13:27:13Z", "mode": "train", "global_step": 679, "epoch": 0.027272362131983773, "loss": 0.0183, "grad_norm": 11.858473777770996, "learning_rate": 7.945454545454547e-06, "num_tokens": 1365876.0, "completions/mean_length": 50.875, "completions/min_length": 48.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6219387054443359, "rewards/meter/std": 0.4098900258541107, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6387500166893005, "rewards/judge_quality/std": 0.24718055129051208, "rewards/repeat_penalty/mean": 0.9427800178527832, "rewards/repeat_penalty/std": 0.0702410340309143, "rewards/near_duplicate_penalty/mean": 0.9608965516090393, "rewards/near_duplicate_penalty/std": 0.042752623558044434, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9801586866378784, "rewards/distinct_2/std": 0.036883533000946045, "rewards/total_composite/mean": 0.39213526248931885, "rewards/total_composite/std": 0.33854520320892334, "reward": 0.39213526248931885, "reward_std": 0.33854517340660095, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12446413189172745, "sampling/sampling_logp_difference/max": 1.531905174255371, "sampling/importance_sampling_ratio/min": 0.2161235213279724, "sampling/importance_sampling_ratio/mean": 0.9956213235855103, "sampling/importance_sampling_ratio/max": 1.9025863409042358, "entropy": 0.664982732385397, "clip_ratio/low_mean": 0.07277948781847954, "clip_ratio/low_min": 0.07277948781847954, "clip_ratio/high_mean": 0.0642069336026907, "clip_ratio/high_max": 0.0642069336026907, "clip_ratio/region_mean": 0.13698642142117023, "reward_total_mean": 0.39213526248931885, "reward_meter_mean": 0.6219387054443359, "reward_meter_std": 0.4098900258541107, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9427800178527832, "reward_repeat_penalty_std": 0.0702410340309143, "reward_near_duplicate_penalty_mean": 0.9608965516090393, "reward_near_duplicate_penalty_std": 0.042752623558044434, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9801586866378784, "reward_distinct_2_std": 0.036883533000946045, "reward_judge_quality_mean": 0.6387500166893005, "reward_judge_quality_std": 0.24718055129051208, "reward_total_composite_mean": 0.39213526248931885, "reward_total_composite_std": 0.33854520320892334} {"timestamp_utc": "2026-04-12T13:27:23Z", "mode": "train", "global_step": 680, "epoch": 0.027312527613768726, "loss": -0.0238, "grad_norm": 11.923002243041992, "learning_rate": 7.942424242424242e-06, "num_tokens": 1367841.0, "completions/mean_length": 89.625, "completions/min_length": 75.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 89.625, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.6149957180023193, "rewards/meter/std": 0.3780932128429413, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.8234045505523682, "rewards/repeat_penalty/std": 0.057999514043331146, "rewards/near_duplicate_penalty/mean": 0.928970992565155, "rewards/near_duplicate_penalty/std": 0.030884819105267525, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8857342600822449, "rewards/distinct_2/std": 0.041356515139341354, "rewards/total_composite/mean": 0.2690228521823883, "rewards/total_composite/std": 0.20418933033943176, "reward": 0.2690228521823883, "reward_std": 0.20418934524059296, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15171462297439575, "sampling/sampling_logp_difference/max": 3.026287078857422, "sampling/importance_sampling_ratio/min": 0.04849536716938019, "sampling/importance_sampling_ratio/mean": 1.004455804824829, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8101786896586418, "clip_ratio/low_mean": 0.06674056965857744, "clip_ratio/low_min": 0.06674056965857744, "clip_ratio/high_mean": 0.08735445328056812, "clip_ratio/high_max": 0.08735445328056812, "clip_ratio/region_mean": 0.15409502293914557, "reward_total_mean": 0.2690228521823883, "reward_meter_mean": 0.6149957180023193, "reward_meter_std": 0.3780932128429413, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8234045505523682, "reward_repeat_penalty_std": 0.057999514043331146, "reward_near_duplicate_penalty_mean": 0.928970992565155, "reward_near_duplicate_penalty_std": 0.030884819105267525, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8857342600822449, "reward_distinct_2_std": 0.041356515139341354, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.2690228521823883, "reward_total_composite_std": 0.20418933033943176} {"timestamp_utc": "2026-04-12T13:27:36Z", "mode": "train", "global_step": 681, "epoch": 0.02735269309555368, "loss": -0.0927, "grad_norm": 2.6674611568450928, "learning_rate": 7.93939393939394e-06, "num_tokens": 1369439.0, "completions/mean_length": 162.75, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 46.333335876464844, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7847678065299988, "rewards/meter/std": 0.3550890386104584, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9615534543991089, "rewards/lexical_plausibility/std": 0.1087433397769928, "rewards/judge_quality/mean": 0.512499988079071, "rewards/judge_quality/std": 0.31949737668037415, "rewards/repeat_penalty/mean": 0.8113471269607544, "rewards/repeat_penalty/std": 0.34022751450538635, "rewards/near_duplicate_penalty/mean": 0.9766889810562134, "rewards/near_duplicate_penalty/std": 0.033630695194005966, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8647711277008057, "rewards/distinct_2/std": 0.3503357172012329, "rewards/total_composite/mean": 0.44961053133010864, "rewards/total_composite/std": 0.362165629863739, "reward": 0.44961053133010864, "reward_std": 0.3621656000614166, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12778885662555695, "sampling/sampling_logp_difference/max": 1.2149319648742676, "sampling/importance_sampling_ratio/min": 0.2967301905155182, "sampling/importance_sampling_ratio/mean": 1.0071533918380737, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.565909743309021, "clip_ratio/low_mean": 0.046725478023290634, "clip_ratio/low_min": 0.046725478023290634, "clip_ratio/high_mean": 0.0532852578908205, "clip_ratio/high_max": 0.0532852578908205, "clip_ratio/region_mean": 0.10001073591411114, "reward_total_mean": 0.44961053133010864, "reward_meter_mean": 0.7847678065299988, "reward_meter_std": 0.3550890386104584, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9615534543991089, "reward_lexical_plausibility_std": 0.1087433397769928, "reward_repeat_penalty_mean": 0.8113471269607544, "reward_repeat_penalty_std": 0.34022751450538635, "reward_near_duplicate_penalty_mean": 0.9766889810562134, "reward_near_duplicate_penalty_std": 0.033630695194005966, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8647711277008057, "reward_distinct_2_std": 0.3503357172012329, "reward_judge_quality_mean": 0.512499988079071, "reward_judge_quality_std": 0.31949737668037415, "reward_total_composite_mean": 0.44961053133010864, "reward_total_composite_std": 0.362165629863739} {"timestamp_utc": "2026-04-12T13:27:47Z", "mode": "train", "global_step": 682, "epoch": 0.027392858577338634, "loss": -0.022, "grad_norm": 10.661027908325195, "learning_rate": 7.936363636363637e-06, "num_tokens": 1371316.0, "completions/mean_length": 81.625, "completions/min_length": 72.0, "completions/max_length": 90.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.625, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.6773897409439087, "rewards/meter/std": 0.3524584472179413, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9228302836418152, "rewards/repeat_penalty/std": 0.07274725288152695, "rewards/near_duplicate_penalty/mean": 0.9561222195625305, "rewards/near_duplicate_penalty/std": 0.036774892359972, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.963905930519104, "rewards/distinct_2/std": 0.04218706116080284, "rewards/total_composite/mean": 0.1977335810661316, "rewards/total_composite/std": 0.12415219843387604, "reward": 0.1977335810661316, "reward_std": 0.12415219843387604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13656394183635712, "sampling/sampling_logp_difference/max": 1.4903523921966553, "sampling/importance_sampling_ratio/min": 0.22529326379299164, "sampling/importance_sampling_ratio/mean": 1.0086195468902588, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6780933775007725, "clip_ratio/low_mean": 0.05089546926319599, "clip_ratio/low_min": 0.05089546926319599, "clip_ratio/high_mean": 0.09456607233732939, "clip_ratio/high_max": 0.09456607233732939, "clip_ratio/region_mean": 0.14546154160052538, "reward_total_mean": 0.1977335810661316, "reward_meter_mean": 0.6773897409439087, "reward_meter_std": 0.3524584472179413, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9228302836418152, "reward_repeat_penalty_std": 0.07274725288152695, "reward_near_duplicate_penalty_mean": 0.9561222195625305, "reward_near_duplicate_penalty_std": 0.036774892359972, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.963905930519104, "reward_distinct_2_std": 0.04218706116080284, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.1977335810661316, "reward_total_composite_std": 0.12415219843387604} {"timestamp_utc": "2026-04-12T13:27:57Z", "mode": "train", "global_step": 683, "epoch": 0.02743302405912359, "loss": 0.0256, "grad_norm": 17.77046775817871, "learning_rate": 7.933333333333334e-06, "num_tokens": 1372919.0, "completions/mean_length": 48.375, "completions/min_length": 44.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.840705394744873, "rewards/meter/std": 0.18037928640842438, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.512499988079071, "rewards/judge_quality/std": 0.18468119204044342, "rewards/repeat_penalty/mean": 0.9711122512817383, "rewards/repeat_penalty/std": 0.04365866258740425, "rewards/near_duplicate_penalty/mean": 0.9910552501678467, "rewards/near_duplicate_penalty/std": 0.012532477267086506, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9797008633613586, "rewards/distinct_2/std": 0.037656061351299286, "rewards/total_composite/mean": 0.43711957335472107, "rewards/total_composite/std": 0.20955386757850647, "reward": 0.43711957335472107, "reward_std": 0.20955388247966766, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11673174798488617, "sampling/sampling_logp_difference/max": 2.4938652515411377, "sampling/importance_sampling_ratio/min": 0.08259011805057526, "sampling/importance_sampling_ratio/mean": 1.0123649835586548, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5816117040812969, "clip_ratio/low_mean": 0.06230353470891714, "clip_ratio/low_min": 0.06230353470891714, "clip_ratio/high_mean": 0.03842670004814863, "clip_ratio/high_max": 0.03842670004814863, "clip_ratio/region_mean": 0.10073023475706577, "reward_total_mean": 0.43711957335472107, "reward_meter_mean": 0.840705394744873, "reward_meter_std": 0.18037928640842438, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9711122512817383, "reward_repeat_penalty_std": 0.04365866258740425, "reward_near_duplicate_penalty_mean": 0.9910552501678467, "reward_near_duplicate_penalty_std": 0.012532477267086506, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9797008633613586, "reward_distinct_2_std": 0.037656061351299286, "reward_judge_quality_mean": 0.512499988079071, "reward_judge_quality_std": 0.18468119204044342, "reward_total_composite_mean": 0.43711957335472107, "reward_total_composite_std": 0.20955386757850647} {"timestamp_utc": "2026-04-12T13:28:06Z", "mode": "train", "global_step": 684, "epoch": 0.027473189540908542, "loss": 0.0906, "grad_norm": 12.437556266784668, "learning_rate": 7.930303030303031e-06, "num_tokens": 1374680.0, "completions/mean_length": 53.125, "completions/min_length": 42.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.125, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.35926711559295654, "rewards/meter/std": 0.33269840478897095, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6387500166893005, "rewards/judge_quality/std": 0.3224211037158966, "rewards/repeat_penalty/mean": 0.9056887626647949, "rewards/repeat_penalty/std": 0.07590774446725845, "rewards/near_duplicate_penalty/mean": 0.935394287109375, "rewards/near_duplicate_penalty/std": 0.0471920445561409, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9673083424568176, "rewards/distinct_2/std": 0.047377511858940125, "rewards/total_composite/mean": 0.22235041856765747, "rewards/total_composite/std": 0.24022987484931946, "reward": 0.22235041856765747, "reward_std": 0.24022985994815826, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14882268011569977, "sampling/sampling_logp_difference/max": 2.0587077140808105, "sampling/importance_sampling_ratio/min": 0.24324600398540497, "sampling/importance_sampling_ratio/mean": 1.0149168968200684, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8003500439226627, "clip_ratio/low_mean": 0.1035881545394659, "clip_ratio/low_min": 0.1035881545394659, "clip_ratio/high_mean": 0.021844115341082215, "clip_ratio/high_max": 0.021844115341082215, "clip_ratio/region_mean": 0.12543226988054812, "reward_total_mean": 0.22235041856765747, "reward_meter_mean": 0.35926711559295654, "reward_meter_std": 0.33269840478897095, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9056887626647949, "reward_repeat_penalty_std": 0.07590774446725845, "reward_near_duplicate_penalty_mean": 0.935394287109375, "reward_near_duplicate_penalty_std": 0.0471920445561409, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9673083424568176, "reward_distinct_2_std": 0.047377511858940125, "reward_judge_quality_mean": 0.6387500166893005, "reward_judge_quality_std": 0.3224211037158966, "reward_total_composite_mean": 0.22235041856765747, "reward_total_composite_std": 0.24022987484931946} {"timestamp_utc": "2026-04-12T13:28:16Z", "mode": "train", "global_step": 685, "epoch": 0.027513355022693496, "loss": 0.0211, "grad_norm": 10.001082420349121, "learning_rate": 7.927272727272729e-06, "num_tokens": 1377110.0, "completions/mean_length": 108.75, "completions/min_length": 103.0, "completions/max_length": 119.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 108.75, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.6494002342224121, "rewards/meter/std": 0.3196577727794647, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.7960606217384338, "rewards/repeat_penalty/std": 0.1494201123714447, "rewards/near_duplicate_penalty/mean": 0.9417764544487, "rewards/near_duplicate_penalty/std": 0.02592436410486698, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8607696294784546, "rewards/distinct_2/std": 0.11884584277868271, "rewards/total_composite/mean": 0.25066906213760376, "rewards/total_composite/std": 0.12427356094121933, "reward": 0.25066906213760376, "reward_std": 0.12427355349063873, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13754647970199585, "sampling/sampling_logp_difference/max": 2.2427010536193848, "sampling/importance_sampling_ratio/min": 0.10617134720087051, "sampling/importance_sampling_ratio/mean": 0.997316300868988, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6303588226437569, "clip_ratio/low_mean": 0.07756581623107195, "clip_ratio/low_min": 0.07756581623107195, "clip_ratio/high_mean": 0.04796245601028204, "clip_ratio/high_max": 0.04796245601028204, "clip_ratio/region_mean": 0.125528272241354, "reward_total_mean": 0.25066906213760376, "reward_meter_mean": 0.6494002342224121, "reward_meter_std": 0.3196577727794647, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7960606217384338, "reward_repeat_penalty_std": 0.1494201123714447, "reward_near_duplicate_penalty_mean": 0.9417764544487, "reward_near_duplicate_penalty_std": 0.02592436410486698, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8607696294784546, "reward_distinct_2_std": 0.11884584277868271, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.25066906213760376, "reward_total_composite_std": 0.12427356094121933} {"timestamp_utc": "2026-04-12T13:28:26Z", "mode": "train", "global_step": 686, "epoch": 0.02755352050447845, "loss": -0.0143, "grad_norm": 7.473944664001465, "learning_rate": 7.924242424242426e-06, "num_tokens": 1379655.0, "completions/mean_length": 143.125, "completions/min_length": 113.0, "completions/max_length": 161.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 143.125, "completions/min_terminated_length": 113.0, "completions/max_terminated_length": 161.0, "rewards/meter/mean": 0.8714023232460022, "rewards/meter/std": 0.18332542479038239, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.28070366382598877, "rewards/repeat_penalty/std": 0.24587886035442352, "rewards/near_duplicate_penalty/mean": 0.7621680498123169, "rewards/near_duplicate_penalty/std": 0.15426813066005707, "rewards/opening_diversity/mean": 0.800000011920929, "rewards/opening_diversity/std": 0.21876275539398193, "rewards/distinct_2/mean": 0.3956928849220276, "rewards/distinct_2/std": 0.2787923514842987, "rewards/total_composite/mean": 0.19202126562595367, "rewards/total_composite/std": 0.13257306814193726, "reward": 0.19202126562595367, "reward_std": 0.13257306814193726, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09486376494169235, "sampling/sampling_logp_difference/max": 2.607607841491699, "sampling/importance_sampling_ratio/min": 0.07371066510677338, "sampling/importance_sampling_ratio/mean": 1.0006015300750732, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.48386170342564583, "clip_ratio/low_mean": 0.04504252364858985, "clip_ratio/low_min": 0.04504252364858985, "clip_ratio/high_mean": 0.03957773372530937, "clip_ratio/high_max": 0.03957773372530937, "clip_ratio/region_mean": 0.08462025737389922, "reward_total_mean": 0.19202126562595367, "reward_meter_mean": 0.8714023232460022, "reward_meter_std": 0.18332542479038239, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.28070366382598877, "reward_repeat_penalty_std": 0.24587886035442352, "reward_near_duplicate_penalty_mean": 0.7621680498123169, "reward_near_duplicate_penalty_std": 0.15426813066005707, "reward_opening_diversity_mean": 0.800000011920929, "reward_opening_diversity_std": 0.21876275539398193, "reward_distinct_2_mean": 0.3956928849220276, "reward_distinct_2_std": 0.2787923514842987, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.19202126562595367, "reward_total_composite_std": 0.13257306814193726} {"timestamp_utc": "2026-04-12T13:28:36Z", "mode": "train", "global_step": 687, "epoch": 0.027593685986263404, "loss": 0.0115, "grad_norm": 16.36661148071289, "learning_rate": 7.921212121212122e-06, "num_tokens": 1381198.0, "completions/mean_length": 48.875, "completions/min_length": 45.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.875, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6924780011177063, "rewards/meter/std": 0.34872353076934814, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.16690458357334137, "rewards/repeat_penalty/mean": 0.9573004245758057, "rewards/repeat_penalty/std": 0.04531080275774002, "rewards/near_duplicate_penalty/mean": 0.9760246276855469, "rewards/near_duplicate_penalty/std": 0.025973476469516754, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807209968566895, "rewards/distinct_2/std": 0.0357571542263031, "rewards/total_composite/mean": 0.2855433225631714, "rewards/total_composite/std": 0.20969447493553162, "reward": 0.2855433225631714, "reward_std": 0.20969446003437042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16747529804706573, "sampling/sampling_logp_difference/max": 2.515855312347412, "sampling/importance_sampling_ratio/min": 0.08079377561807632, "sampling/importance_sampling_ratio/mean": 0.9764614701271057, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8049458265304565, "clip_ratio/low_mean": 0.07250000163912773, "clip_ratio/low_min": 0.07250000163912773, "clip_ratio/high_mean": 0.09820890054106712, "clip_ratio/high_max": 0.09820890054106712, "clip_ratio/region_mean": 0.17070890218019485, "reward_total_mean": 0.2855433225631714, "reward_meter_mean": 0.6924780011177063, "reward_meter_std": 0.34872353076934814, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9573004245758057, "reward_repeat_penalty_std": 0.04531080275774002, "reward_near_duplicate_penalty_mean": 0.9760246276855469, "reward_near_duplicate_penalty_std": 0.025973476469516754, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807209968566895, "reward_distinct_2_std": 0.0357571542263031, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.16690458357334137, "reward_total_composite_mean": 0.2855433225631714, "reward_total_composite_std": 0.20969447493553162} {"timestamp_utc": "2026-04-12T13:28:46Z", "mode": "train", "global_step": 688, "epoch": 0.027633851468048358, "loss": 0.0661, "grad_norm": 14.963428497314453, "learning_rate": 7.918181818181819e-06, "num_tokens": 1382905.0, "completions/mean_length": 48.375, "completions/min_length": 43.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.4290289282798767, "rewards/meter/std": 0.39136409759521484, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5337499380111694, "rewards/judge_quality/std": 0.17104199528694153, "rewards/repeat_penalty/mean": 0.9784921407699585, "rewards/repeat_penalty/std": 0.02166825532913208, "rewards/near_duplicate_penalty/mean": 0.9784921407699585, "rewards/near_duplicate_penalty/std": 0.02166825532913208, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21057572960853577, "rewards/total_composite/std": 0.17712515592575073, "reward": 0.21057572960853577, "reward_std": 0.17712515592575073, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16132418811321259, "sampling/sampling_logp_difference/max": 1.9058542251586914, "sampling/importance_sampling_ratio/min": 0.14869557321071625, "sampling/importance_sampling_ratio/mean": 1.0063754320144653, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0045779198408127, "clip_ratio/low_mean": 0.04261253890581429, "clip_ratio/low_min": 0.04261253890581429, "clip_ratio/high_mean": 0.07253559492528439, "clip_ratio/high_max": 0.07253559492528439, "clip_ratio/region_mean": 0.11514813383109868, "reward_total_mean": 0.21057572960853577, "reward_meter_mean": 0.4290289282798767, "reward_meter_std": 0.39136409759521484, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9784921407699585, "reward_repeat_penalty_std": 0.02166825532913208, "reward_near_duplicate_penalty_mean": 0.9784921407699585, "reward_near_duplicate_penalty_std": 0.02166825532913208, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5337499380111694, "reward_judge_quality_std": 0.17104199528694153, "reward_total_composite_mean": 0.21057572960853577, "reward_total_composite_std": 0.17712515592575073} {"timestamp_utc": "2026-04-12T13:28:56Z", "mode": "train", "global_step": 689, "epoch": 0.027674016949833312, "loss": 0.0272, "grad_norm": 7.877944469451904, "learning_rate": 7.915151515151516e-06, "num_tokens": 1385842.0, "completions/mean_length": 159.125, "completions/min_length": 145.0, "completions/max_length": 176.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.125, "completions/min_terminated_length": 145.0, "completions/max_terminated_length": 176.0, "rewards/meter/mean": 0.7990224957466125, "rewards/meter/std": 0.2898417115211487, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.8136865496635437, "rewards/repeat_penalty/std": 0.14370132982730865, "rewards/near_duplicate_penalty/mean": 0.9447270035743713, "rewards/near_duplicate_penalty/std": 0.029538163915276527, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8677237629890442, "rewards/distinct_2/std": 0.1118897870182991, "rewards/total_composite/mean": 0.26758864521980286, "rewards/total_composite/std": 0.12349135428667068, "reward": 0.26758864521980286, "reward_std": 0.12349135428667068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14809967577457428, "sampling/sampling_logp_difference/max": 1.9510507583618164, "sampling/importance_sampling_ratio/min": 0.14212465286254883, "sampling/importance_sampling_ratio/mean": 1.0038474798202515, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7957801297307014, "clip_ratio/low_mean": 0.06031614821404219, "clip_ratio/low_min": 0.06031614821404219, "clip_ratio/high_mean": 0.07692786864936352, "clip_ratio/high_max": 0.07692786864936352, "clip_ratio/region_mean": 0.1372440168634057, "reward_total_mean": 0.26758864521980286, "reward_meter_mean": 0.7990224957466125, "reward_meter_std": 0.2898417115211487, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8136865496635437, "reward_repeat_penalty_std": 0.14370132982730865, "reward_near_duplicate_penalty_mean": 0.9447270035743713, "reward_near_duplicate_penalty_std": 0.029538163915276527, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8677237629890442, "reward_distinct_2_std": 0.1118897870182991, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.26758864521980286, "reward_total_composite_std": 0.12349135428667068} {"timestamp_utc": "2026-04-12T13:29:10Z", "mode": "train", "global_step": 690, "epoch": 0.027714182431618266, "loss": 0.0007, "grad_norm": 3.4282939434051514, "learning_rate": 7.912121212121213e-06, "num_tokens": 1391062.0, "completions/mean_length": 422.5, "completions/min_length": 385.0, "completions/max_length": 470.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 422.5, "completions/min_terminated_length": 385.0, "completions/max_terminated_length": 470.0, "rewards/meter/mean": 0.8916245698928833, "rewards/meter/std": 0.1614583283662796, "rewards/count_adherence/mean": 0.9285714626312256, "rewards/count_adherence/std": 0.03818017616868019, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.04020589590072632, "rewards/repeat_penalty/std": 0.060685306787490845, "rewards/near_duplicate_penalty/mean": 0.7095133066177368, "rewards/near_duplicate_penalty/std": 0.10145653039216995, "rewards/opening_diversity/mean": 0.9389951229095459, "rewards/opening_diversity/std": 0.07091031968593597, "rewards/distinct_2/mean": 0.06345638632774353, "rewards/distinct_2/std": 0.09171286970376968, "rewards/total_composite/mean": 0.1816328763961792, "rewards/total_composite/std": 0.08169139176607132, "reward": 0.1816328763961792, "reward_std": 0.08169138431549072, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05731300637125969, "sampling/sampling_logp_difference/max": 5.075409889221191, "sampling/importance_sampling_ratio/min": 0.0062485248781740665, "sampling/importance_sampling_ratio/mean": 1.0016580820083618, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.28396112471818924, "clip_ratio/low_mean": 0.02942675177473575, "clip_ratio/low_min": 0.02942675177473575, "clip_ratio/high_mean": 0.023079270496964455, "clip_ratio/high_max": 0.023079270496964455, "clip_ratio/region_mean": 0.0525060222717002, "reward_total_mean": 0.1816328763961792, "reward_meter_mean": 0.8916245698928833, "reward_meter_std": 0.1614583283662796, "reward_count_adherence_mean": 0.9285714626312256, "reward_count_adherence_std": 0.03818017616868019, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.04020589590072632, "reward_repeat_penalty_std": 0.060685306787490845, "reward_near_duplicate_penalty_mean": 0.7095133066177368, "reward_near_duplicate_penalty_std": 0.10145653039216995, "reward_opening_diversity_mean": 0.9389951229095459, "reward_opening_diversity_std": 0.07091031968593597, "reward_distinct_2_mean": 0.06345638632774353, "reward_distinct_2_std": 0.09171286970376968, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1816328763961792, "reward_total_composite_std": 0.08169139176607132} {"timestamp_utc": "2026-04-12T13:29:18Z", "mode": "train", "global_step": 691, "epoch": 0.02775434791340322, "loss": 0.1545, "grad_norm": 19.48782730102539, "learning_rate": 7.909090909090909e-06, "num_tokens": 1392662.0, "completions/mean_length": 34.0, "completions/min_length": 24.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.0, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.4723680913448334, "rewards/meter/std": 0.4853588938713074, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7262499928474426, "rewards/judge_quality/std": 0.2859039604663849, "rewards/repeat_penalty/mean": 0.8004690408706665, "rewards/repeat_penalty/std": 0.09692622721195221, "rewards/near_duplicate_penalty/mean": 0.998526930809021, "rewards/near_duplicate_penalty/std": 0.004166448023170233, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.25151702761650085, "rewards/total_composite/std": 0.36730679869651794, "reward": 0.25151702761650085, "reward_std": 0.36730679869651794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14715968072414398, "sampling/sampling_logp_difference/max": 2.48984432220459, "sampling/importance_sampling_ratio/min": 0.08292287588119507, "sampling/importance_sampling_ratio/mean": 1.0106021165847778, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6632404625415802, "clip_ratio/low_mean": 0.06620554672554135, "clip_ratio/low_min": 0.06620554672554135, "clip_ratio/high_mean": 0.03504807688295841, "clip_ratio/high_max": 0.03504807688295841, "clip_ratio/region_mean": 0.10125362360849977, "reward_total_mean": 0.25151702761650085, "reward_meter_mean": 0.4723680913448334, "reward_meter_std": 0.4853588938713074, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8004690408706665, "reward_repeat_penalty_std": 0.09692622721195221, "reward_near_duplicate_penalty_mean": 0.998526930809021, "reward_near_duplicate_penalty_std": 0.004166448023170233, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.7262499928474426, "reward_judge_quality_std": 0.2859039604663849, "reward_total_composite_mean": 0.25151702761650085, "reward_total_composite_std": 0.36730679869651794} {"timestamp_utc": "2026-04-12T13:29:27Z", "mode": "train", "global_step": 692, "epoch": 0.027794513395188174, "loss": 0.0825, "grad_norm": 12.445843696594238, "learning_rate": 7.906060606060608e-06, "num_tokens": 1394428.0, "completions/mean_length": 56.75, "completions/min_length": 48.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.75, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.8535615801811218, "rewards/meter/std": 0.24634356796741486, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.9866340160369873, "rewards/repeat_penalty/std": 0.019210243597626686, "rewards/near_duplicate_penalty/mean": 0.9866340160369873, "rewards/near_duplicate_penalty/std": 0.019210243597626686, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.41610342264175415, "rewards/total_composite/std": 0.28258654475212097, "reward": 0.41610342264175415, "reward_std": 0.28258654475212097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15511003136634827, "sampling/sampling_logp_difference/max": 2.0940399169921875, "sampling/importance_sampling_ratio/min": 0.12318845838308334, "sampling/importance_sampling_ratio/mean": 0.9979813694953918, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8518078625202179, "clip_ratio/low_mean": 0.06950231455266476, "clip_ratio/low_min": 0.06950231455266476, "clip_ratio/high_mean": 0.08688047714531422, "clip_ratio/high_max": 0.08688047714531422, "clip_ratio/region_mean": 0.15638279169797897, "reward_total_mean": 0.41610342264175415, "reward_meter_mean": 0.8535615801811218, "reward_meter_std": 0.24634356796741486, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9866340160369873, "reward_repeat_penalty_std": 0.019210243597626686, "reward_near_duplicate_penalty_mean": 0.9866340160369873, "reward_near_duplicate_penalty_std": 0.019210243597626686, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.41610342264175415, "reward_total_composite_std": 0.28258654475212097} {"timestamp_utc": "2026-04-12T13:29:36Z", "mode": "train", "global_step": 693, "epoch": 0.027834678876973128, "loss": 0.1626, "grad_norm": 16.988096237182617, "learning_rate": 7.903030303030303e-06, "num_tokens": 1395968.0, "completions/mean_length": 37.5, "completions/min_length": 32.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.588752806186676, "rewards/meter/std": 0.38058748841285706, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9150839447975159, "rewards/repeat_penalty/std": 0.0962492823600769, "rewards/near_duplicate_penalty/mean": 0.9545110464096069, "rewards/near_duplicate_penalty/std": 0.025570329278707504, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9575936794281006, "rewards/distinct_2/std": 0.08631627261638641, "rewards/total_composite/mean": 0.2420070767402649, "rewards/total_composite/std": 0.152871772646904, "reward": 0.2420070767402649, "reward_std": 0.1528717577457428, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14583992958068848, "sampling/sampling_logp_difference/max": 1.6880861520767212, "sampling/importance_sampling_ratio/min": 0.18487299978733063, "sampling/importance_sampling_ratio/mean": 1.003678560256958, "sampling/importance_sampling_ratio/max": 1.8421077728271484, "entropy": 0.7335262931883335, "clip_ratio/low_mean": 0.0400134869851172, "clip_ratio/low_min": 0.0400134869851172, "clip_ratio/high_mean": 0.10827442817389965, "clip_ratio/high_max": 0.10827442817389965, "clip_ratio/region_mean": 0.14828791515901685, "reward_total_mean": 0.2420070767402649, "reward_meter_mean": 0.588752806186676, "reward_meter_std": 0.38058748841285706, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9150839447975159, "reward_repeat_penalty_std": 0.0962492823600769, "reward_near_duplicate_penalty_mean": 0.9545110464096069, "reward_near_duplicate_penalty_std": 0.025570329278707504, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9575936794281006, "reward_distinct_2_std": 0.08631627261638641, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2420070767402649, "reward_total_composite_std": 0.152871772646904} {"timestamp_utc": "2026-04-12T13:29:44Z", "mode": "train", "global_step": 694, "epoch": 0.02787484435875808, "loss": 0.0104, "grad_norm": 13.769287109375, "learning_rate": 7.9e-06, "num_tokens": 1397651.0, "completions/mean_length": 48.375, "completions/min_length": 43.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.3852972388267517, "rewards/meter/std": 0.29132166504859924, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.8439086675643921, "rewards/repeat_penalty/std": 0.13462969660758972, "rewards/near_duplicate_penalty/mean": 0.923346757888794, "rewards/near_duplicate_penalty/std": 0.04904133081436157, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9397153258323669, "rewards/distinct_2/std": 0.06966220587491989, "rewards/total_composite/mean": 0.2518223822116852, "rewards/total_composite/std": 0.18078495562076569, "reward": 0.2518223822116852, "reward_std": 0.1807849407196045, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10397494584321976, "sampling/sampling_logp_difference/max": 1.1548477411270142, "sampling/importance_sampling_ratio/min": 0.31510552763938904, "sampling/importance_sampling_ratio/mean": 1.008196234703064, "sampling/importance_sampling_ratio/max": 1.869637131690979, "entropy": 0.6907190605998039, "clip_ratio/low_mean": 0.0661906199529767, "clip_ratio/low_min": 0.0661906199529767, "clip_ratio/high_mean": 0.07668428681790829, "clip_ratio/high_max": 0.07668428681790829, "clip_ratio/region_mean": 0.142874906770885, "reward_total_mean": 0.2518223822116852, "reward_meter_mean": 0.3852972388267517, "reward_meter_std": 0.29132166504859924, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8439086675643921, "reward_repeat_penalty_std": 0.13462969660758972, "reward_near_duplicate_penalty_mean": 0.923346757888794, "reward_near_duplicate_penalty_std": 0.04904133081436157, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9397153258323669, "reward_distinct_2_std": 0.06966220587491989, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.2518223822116852, "reward_total_composite_std": 0.18078495562076569} {"timestamp_utc": "2026-04-12T13:29:59Z", "mode": "train", "global_step": 695, "epoch": 0.02791500984054304, "loss": -0.1019, "grad_norm": 5.338735103607178, "learning_rate": 7.896969696969698e-06, "num_tokens": 1399378.0, "completions/mean_length": 119.875, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 63.857147216796875, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.8705810308456421, "rewards/meter/std": 0.2341153621673584, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9654704332351685, "rewards/lexical_plausibility/std": 0.09766443073749542, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.25961166620254517, "rewards/repeat_penalty/mean": 0.9646810293197632, "rewards/repeat_penalty/std": 0.018230050802230835, "rewards/near_duplicate_penalty/mean": 0.9646810293197632, "rewards/near_duplicate_penalty/std": 0.018230050802230835, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4178609848022461, "rewards/total_composite/std": 0.2828451991081238, "reward": 0.4178609848022461, "reward_std": 0.2828451991081238, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11048547923564911, "sampling/sampling_logp_difference/max": 1.5811209678649902, "sampling/importance_sampling_ratio/min": 0.20574432611465454, "sampling/importance_sampling_ratio/mean": 1.004176378250122, "sampling/importance_sampling_ratio/max": 1.7473589181900024, "entropy": 0.6982764676213264, "clip_ratio/low_mean": 0.0417844308540225, "clip_ratio/low_min": 0.0417844308540225, "clip_ratio/high_mean": 0.074519376270473, "clip_ratio/high_max": 0.074519376270473, "clip_ratio/region_mean": 0.1163038071244955, "reward_total_mean": 0.4178609848022461, "reward_meter_mean": 0.8705810308456421, "reward_meter_std": 0.2341153621673584, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9654704332351685, "reward_lexical_plausibility_std": 0.09766443073749542, "reward_repeat_penalty_mean": 0.9646810293197632, "reward_repeat_penalty_std": 0.018230050802230835, "reward_near_duplicate_penalty_mean": 0.9646810293197632, "reward_near_duplicate_penalty_std": 0.018230050802230835, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.25961166620254517, "reward_total_composite_mean": 0.4178609848022461, "reward_total_composite_std": 0.2828451991081238} {"timestamp_utc": "2026-04-12T13:30:10Z", "mode": "train", "global_step": 696, "epoch": 0.027955175322327993, "loss": 0.033, "grad_norm": 9.337010383605957, "learning_rate": 7.893939393939395e-06, "num_tokens": 1401497.0, "completions/mean_length": 93.875, "completions/min_length": 88.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.875, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.5079565644264221, "rewards/meter/std": 0.40059345960617065, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.4999999701976776, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9242500066757202, "rewards/repeat_penalty/std": 0.08778683096170425, "rewards/near_duplicate_penalty/mean": 0.9711850881576538, "rewards/near_duplicate_penalty/std": 0.025060100480914116, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9503452181816101, "rewards/distinct_2/std": 0.0717897042632103, "rewards/total_composite/mean": 0.23421421647071838, "rewards/total_composite/std": 0.17414434254169464, "reward": 0.23421421647071838, "reward_std": 0.17414434254169464, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11903917044401169, "sampling/sampling_logp_difference/max": 1.3152618408203125, "sampling/importance_sampling_ratio/min": 0.2684040367603302, "sampling/importance_sampling_ratio/mean": 1.0150032043457031, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8241725638508797, "clip_ratio/low_mean": 0.06018863990902901, "clip_ratio/low_min": 0.06018863990902901, "clip_ratio/high_mean": 0.041672642808407545, "clip_ratio/high_max": 0.041672642808407545, "clip_ratio/region_mean": 0.10186128271743655, "reward_total_mean": 0.23421421647071838, "reward_meter_mean": 0.5079565644264221, "reward_meter_std": 0.40059345960617065, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9242500066757202, "reward_repeat_penalty_std": 0.08778683096170425, "reward_near_duplicate_penalty_mean": 0.9711850881576538, "reward_near_duplicate_penalty_std": 0.025060100480914116, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9503452181816101, "reward_distinct_2_std": 0.0717897042632103, "reward_judge_quality_mean": 0.4999999701976776, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.23421421647071838, "reward_total_composite_std": 0.17414434254169464} {"timestamp_utc": "2026-04-12T13:30:25Z", "mode": "train", "global_step": 697, "epoch": 0.027995340804112947, "loss": -0.0729, "grad_norm": 4.8107686042785645, "learning_rate": 7.89090909090909e-06, "num_tokens": 1403186.0, "completions/mean_length": 111.125, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.85714340209961, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7558977007865906, "rewards/meter/std": 0.2821967303752899, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.966004490852356, "rewards/lexical_plausibility/std": 0.07419652491807938, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3296508193016052, "rewards/repeat_penalty/mean": 0.9656820297241211, "rewards/repeat_penalty/std": 0.057992201298475266, "rewards/near_duplicate_penalty/mean": 0.9748162627220154, "rewards/near_duplicate_penalty/std": 0.03587019070982933, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898927807807922, "rewards/distinct_2/std": 0.027032768353819847, "rewards/total_composite/mean": 0.4203924536705017, "rewards/total_composite/std": 0.3291851878166199, "reward": 0.4203924536705017, "reward_std": 0.32918521761894226, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1522277295589447, "sampling/sampling_logp_difference/max": 2.0605649948120117, "sampling/importance_sampling_ratio/min": 0.12738198041915894, "sampling/importance_sampling_ratio/mean": 1.0011069774627686, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7282736003398895, "clip_ratio/low_mean": 0.09063034225255251, "clip_ratio/low_min": 0.09063034225255251, "clip_ratio/high_mean": 0.04279807023704052, "clip_ratio/high_max": 0.04279807023704052, "clip_ratio/region_mean": 0.13342841248959303, "reward_total_mean": 0.4203924536705017, "reward_meter_mean": 0.7558977007865906, "reward_meter_std": 0.2821967303752899, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.966004490852356, "reward_lexical_plausibility_std": 0.07419652491807938, "reward_repeat_penalty_mean": 0.9656820297241211, "reward_repeat_penalty_std": 0.057992201298475266, "reward_near_duplicate_penalty_mean": 0.9748162627220154, "reward_near_duplicate_penalty_std": 0.03587019070982933, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898927807807922, "reward_distinct_2_std": 0.027032768353819847, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3296508193016052, "reward_total_composite_mean": 0.4203924536705017, "reward_total_composite_std": 0.3291851878166199} {"timestamp_utc": "2026-04-12T13:30:38Z", "mode": "train", "global_step": 698, "epoch": 0.0280355062858979, "loss": 0.0637, "grad_norm": 4.015619277954102, "learning_rate": 7.88787878787879e-06, "num_tokens": 1407255.0, "completions/mean_length": 315.625, "completions/min_length": 290.0, "completions/max_length": 365.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 315.625, "completions/min_terminated_length": 290.0, "completions/max_terminated_length": 365.0, "rewards/meter/mean": 0.8323097229003906, "rewards/meter/std": 0.3074272572994232, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.08908708393573761, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.1499895453453064, "rewards/repeat_penalty/std": 0.09942632913589478, "rewards/near_duplicate_penalty/mean": 0.7662094235420227, "rewards/near_duplicate_penalty/std": 0.10368543863296509, "rewards/opening_diversity/mean": 0.8797348737716675, "rewards/opening_diversity/std": 0.22495663166046143, "rewards/distinct_2/mean": 0.21349364519119263, "rewards/distinct_2/std": 0.1306503266096115, "rewards/total_composite/mean": 0.2966635525226593, "rewards/total_composite/std": 0.12691465020179749, "reward": 0.2966635525226593, "reward_std": 0.1269146353006363, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07019565999507904, "sampling/sampling_logp_difference/max": 1.841604232788086, "sampling/importance_sampling_ratio/min": 0.15856285393238068, "sampling/importance_sampling_ratio/mean": 1.0085245370864868, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.42864049412310123, "clip_ratio/low_mean": 0.01555402809754014, "clip_ratio/low_min": 0.01555402809754014, "clip_ratio/high_mean": 0.05781267490237951, "clip_ratio/high_max": 0.05781267490237951, "clip_ratio/region_mean": 0.07336670299991965, "reward_total_mean": 0.2966635525226593, "reward_meter_mean": 0.8323097229003906, "reward_meter_std": 0.3074272572994232, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.08908708393573761, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.1499895453453064, "reward_repeat_penalty_std": 0.09942632913589478, "reward_near_duplicate_penalty_mean": 0.7662094235420227, "reward_near_duplicate_penalty_std": 0.10368543863296509, "reward_opening_diversity_mean": 0.8797348737716675, "reward_opening_diversity_std": 0.22495663166046143, "reward_distinct_2_mean": 0.21349364519119263, "reward_distinct_2_std": 0.1306503266096115, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.2966635525226593, "reward_total_composite_std": 0.12691465020179749} {"timestamp_utc": "2026-04-12T13:30:47Z", "mode": "train", "global_step": 699, "epoch": 0.028075671767682855, "loss": 0.041, "grad_norm": 10.690315246582031, "learning_rate": 7.884848484848485e-06, "num_tokens": 1409031.0, "completions/mean_length": 54.0, "completions/min_length": 52.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.0, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.7896865606307983, "rewards/meter/std": 0.25810378789901733, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7337499856948853, "rewards/judge_quality/std": 0.24401040375232697, "rewards/repeat_penalty/mean": 0.9703421592712402, "rewards/repeat_penalty/std": 0.02812577411532402, "rewards/near_duplicate_penalty/mean": 0.9703421592712402, "rewards/near_duplicate_penalty/std": 0.02812577411532402, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5779894590377808, "rewards/total_composite/std": 0.293804407119751, "reward": 0.5779894590377808, "reward_std": 0.293804407119751, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1145641952753067, "sampling/sampling_logp_difference/max": 2.3285369873046875, "sampling/importance_sampling_ratio/min": 0.09743819385766983, "sampling/importance_sampling_ratio/mean": 1.0050643682479858, "sampling/importance_sampling_ratio/max": 1.9547998905181885, "entropy": 0.7624307572841644, "clip_ratio/low_mean": 0.07457103114575148, "clip_ratio/low_min": 0.07457103114575148, "clip_ratio/high_mean": 0.04112876579165459, "clip_ratio/high_max": 0.04112876579165459, "clip_ratio/region_mean": 0.11569979693740606, "reward_total_mean": 0.5779894590377808, "reward_meter_mean": 0.7896865606307983, "reward_meter_std": 0.25810378789901733, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9703421592712402, "reward_repeat_penalty_std": 0.02812577411532402, "reward_near_duplicate_penalty_mean": 0.9703421592712402, "reward_near_duplicate_penalty_std": 0.02812577411532402, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7337499856948853, "reward_judge_quality_std": 0.24401040375232697, "reward_total_composite_mean": 0.5779894590377808, "reward_total_composite_std": 0.293804407119751} {"timestamp_utc": "2026-04-12T13:31:01Z", "mode": "train", "global_step": 700, "epoch": 0.02811583724946781, "loss": -0.0224, "grad_norm": 3.9249844551086426, "learning_rate": 7.881818181818182e-06, "num_tokens": 1413897.0, "completions/mean_length": 409.25, "completions/min_length": 372.0, "completions/max_length": 481.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 409.25, "completions/min_terminated_length": 372.0, "completions/max_terminated_length": 481.0, "rewards/meter/mean": 0.8036543130874634, "rewards/meter/std": 0.1369716227054596, "rewards/count_adherence/mean": 0.9270833730697632, "rewards/count_adherence/std": 0.06954358518123627, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.2629052698612213, "rewards/repeat_penalty/std": 0.1960436850786209, "rewards/near_duplicate_penalty/mean": 0.7825131416320801, "rewards/near_duplicate_penalty/std": 0.14020468294620514, "rewards/opening_diversity/mean": 0.9412775039672852, "rewards/opening_diversity/std": 0.09353276342153549, "rewards/distinct_2/mean": 0.32654058933258057, "rewards/distinct_2/std": 0.20398451387882233, "rewards/total_composite/mean": 0.08333609998226166, "rewards/total_composite/std": 0.052965838462114334, "reward": 0.08333609998226166, "reward_std": 0.05296584218740463, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09280326962471008, "sampling/sampling_logp_difference/max": 4.093554973602295, "sampling/importance_sampling_ratio/min": 0.016679832711815834, "sampling/importance_sampling_ratio/mean": 1.0056970119476318, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6075820289552212, "clip_ratio/low_mean": 0.018030008301138878, "clip_ratio/low_min": 0.018030008301138878, "clip_ratio/high_mean": 0.06617697002366185, "clip_ratio/high_max": 0.06617697002366185, "clip_ratio/region_mean": 0.08420697832480073, "reward_total_mean": 0.08333609998226166, "reward_meter_mean": 0.8036543130874634, "reward_meter_std": 0.1369716227054596, "reward_count_adherence_mean": 0.9270833730697632, "reward_count_adherence_std": 0.06954358518123627, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2629052698612213, "reward_repeat_penalty_std": 0.1960436850786209, "reward_near_duplicate_penalty_mean": 0.7825131416320801, "reward_near_duplicate_penalty_std": 0.14020468294620514, "reward_opening_diversity_mean": 0.9412775039672852, "reward_opening_diversity_std": 0.09353276342153549, "reward_distinct_2_mean": 0.32654058933258057, "reward_distinct_2_std": 0.20398451387882233, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.08333609998226166, "reward_total_composite_std": 0.052965838462114334} {"timestamp_utc": "2026-04-12T13:33:31Z", "mode": "eval", "global_step": 700, "epoch": 0.02811583724946781, "eval_loss": NaN, "eval_runtime": 150.0697, "eval_samples_per_second": 0.693, "eval_steps_per_second": 0.087, "eval_num_tokens": 1413897.0, "eval_completions/mean_length": 280.25, "eval_completions/min_length": 71.53846153846153, "eval_completions/max_length": 512.0, "eval_completions/clipped_ratio": 0.3173076923076923, "eval_completions/mean_terminated_length": 175.25238623985877, "eval_completions/min_terminated_length": 71.53846153846153, "eval_completions/max_terminated_length": 330.7692307692308, "eval_rewards/meter/mean": 0.4329166870850783, "eval_rewards/meter/std": 0.38807074611003584, "eval_rewards/count_adherence/mean": 0.8408197302084702, "eval_rewards/count_adherence/std": 0.2695508392957541, "eval_rewards/arabic_clean/mean": 0.7403846153846154, "eval_rewards/arabic_clean/std": 0.42438613222195554, "eval_rewards/lexical_plausibility/mean": 0.9337593087783227, "eval_rewards/lexical_plausibility/std": 0.110670716716693, "eval_rewards/judge_quality/mean": 0.27413461070794326, "eval_rewards/judge_quality/std": 0.17943278298928186, "eval_rewards/repeat_penalty/mean": 0.7714204421410193, "eval_rewards/repeat_penalty/std": 0.2853775161963243, "eval_rewards/near_duplicate_penalty/mean": 0.9268902356808002, "eval_rewards/near_duplicate_penalty/std": 0.09547289031056258, "eval_rewards/opening_diversity/mean": 0.9619753910945013, "eval_rewards/opening_diversity/std": 0.084259062145765, "eval_rewards/distinct_2/mean": 0.8305996197920579, "eval_rewards/distinct_2/std": 0.27070970088243484, "eval_rewards/total_composite/mean": 0.12682079466489646, "eval_rewards/total_composite/std": 0.15041868560589278, "eval_reward": 0.12682079466489646, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.0714514791392363, "eval_sampling/sampling_logp_difference/max": 1.012208681840163, "eval_sampling/importance_sampling_ratio/min": 0.37342764322574323, "eval_sampling/importance_sampling_ratio/mean": 1.0172827794001653, "eval_sampling/importance_sampling_ratio/max": 1.5328967112761278, "eval_entropy": 0.8392358238880451, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.12682079466489646, "eval_reward_meter_mean": 0.4329166870850783, "eval_reward_meter_std": 0.38807074611003584, "eval_reward_count_adherence_mean": 0.8408197302084702, "eval_reward_count_adherence_std": 0.2695508392957541, "eval_reward_arabic_clean_mean": 0.7403846153846154, "eval_reward_arabic_clean_std": 0.42438613222195554, "eval_reward_lexical_plausibility_mean": 0.9337593087783227, "eval_reward_lexical_plausibility_std": 0.110670716716693, "eval_reward_repeat_penalty_mean": 0.7714204421410193, "eval_reward_repeat_penalty_std": 0.2853775161963243, "eval_reward_near_duplicate_penalty_mean": 0.9268902356808002, "eval_reward_near_duplicate_penalty_std": 0.09547289031056258, "eval_reward_opening_diversity_mean": 0.9619753910945013, "eval_reward_opening_diversity_std": 0.084259062145765, "eval_reward_distinct_2_mean": 0.8305996197920579, "eval_reward_distinct_2_std": 0.27070970088243484, "eval_reward_judge_quality_mean": 0.27413461070794326, "eval_reward_judge_quality_std": 0.17943278298928186, "eval_reward_total_composite_mean": 0.12682079466489646, "eval_reward_total_composite_std": 0.15041868560589278} {"timestamp_utc": "2026-04-12T13:33:47Z", "mode": "train", "global_step": 701, "epoch": 0.028156002731252763, "loss": -0.1126, "grad_norm": 4.728911399841309, "learning_rate": 7.87878787878788e-06, "num_tokens": 1415682.0, "completions/mean_length": 121.125, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 65.28572082519531, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.4598010182380676, "rewards/meter/std": 0.3762716054916382, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9777243137359619, "rewards/lexical_plausibility/std": 0.0630052387714386, "rewards/judge_quality/mean": 0.3500000238418579, "rewards/judge_quality/std": 0.2507132589817047, "rewards/repeat_penalty/mean": 0.9004499912261963, "rewards/repeat_penalty/std": 0.13890168070793152, "rewards/near_duplicate_penalty/mean": 0.9440410733222961, "rewards/near_duplicate_penalty/std": 0.0767950639128685, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9485930800437927, "rewards/distinct_2/std": 0.07988756150007248, "rewards/total_composite/mean": 0.12067333608865738, "rewards/total_composite/std": 0.07071463763713837, "reward": 0.12067333608865738, "reward_std": 0.07071464508771896, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15905775129795074, "sampling/sampling_logp_difference/max": 1.605569839477539, "sampling/importance_sampling_ratio/min": 0.2007751166820526, "sampling/importance_sampling_ratio/mean": 1.0211693048477173, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0422744303941727, "clip_ratio/low_mean": 0.04112903214991093, "clip_ratio/low_min": 0.04112903214991093, "clip_ratio/high_mean": 0.09548537991940975, "clip_ratio/high_max": 0.09548537991940975, "clip_ratio/region_mean": 0.13661441206932068, "reward_total_mean": 0.12067333608865738, "reward_meter_mean": 0.4598010182380676, "reward_meter_std": 0.3762716054916382, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9777243137359619, "reward_lexical_plausibility_std": 0.0630052387714386, "reward_repeat_penalty_mean": 0.9004499912261963, "reward_repeat_penalty_std": 0.13890168070793152, "reward_near_duplicate_penalty_mean": 0.9440410733222961, "reward_near_duplicate_penalty_std": 0.0767950639128685, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9485930800437927, "reward_distinct_2_std": 0.07988756150007248, "reward_judge_quality_mean": 0.3500000238418579, "reward_judge_quality_std": 0.2507132589817047, "reward_total_composite_mean": 0.12067333608865738, "reward_total_composite_std": 0.07071463763713837} {"timestamp_utc": "2026-04-12T13:34:00Z", "mode": "train", "global_step": 702, "epoch": 0.028196168213037717, "loss": -0.0226, "grad_norm": 5.830806732177734, "learning_rate": 7.875757575757577e-06, "num_tokens": 1417062.0, "completions/mean_length": 100.5, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.71428680419922, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.4579460024833679, "rewards/meter/std": 0.4362812042236328, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9751198291778564, "rewards/lexical_plausibility/std": 0.07037175446748734, "rewards/judge_quality/mean": 0.4737499952316284, "rewards/judge_quality/std": 0.30932819843292236, "rewards/repeat_penalty/mean": 0.9724117517471313, "rewards/repeat_penalty/std": 0.035894326865673065, "rewards/near_duplicate_penalty/mean": 0.9724117517471313, "rewards/near_duplicate_penalty/std": 0.035894326865673065, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2549290955066681, "rewards/total_composite/std": 0.307390958070755, "reward": 0.2549290955066681, "reward_std": 0.3073909878730774, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16230902075767517, "sampling/sampling_logp_difference/max": 2.509711503982544, "sampling/importance_sampling_ratio/min": 0.08129168301820755, "sampling/importance_sampling_ratio/mean": 1.0006777048110962, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6417121291160583, "clip_ratio/low_mean": 0.06327936332672834, "clip_ratio/low_min": 0.06327936332672834, "clip_ratio/high_mean": 0.04319056170061231, "clip_ratio/high_max": 0.04319056170061231, "clip_ratio/region_mean": 0.10646992502734065, "reward_total_mean": 0.2549290955066681, "reward_meter_mean": 0.4579460024833679, "reward_meter_std": 0.4362812042236328, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9751198291778564, "reward_lexical_plausibility_std": 0.07037175446748734, "reward_repeat_penalty_mean": 0.9724117517471313, "reward_repeat_penalty_std": 0.035894326865673065, "reward_near_duplicate_penalty_mean": 0.9724117517471313, "reward_near_duplicate_penalty_std": 0.035894326865673065, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4737499952316284, "reward_judge_quality_std": 0.30932819843292236, "reward_total_composite_mean": 0.2549290955066681, "reward_total_composite_std": 0.307390958070755} {"timestamp_utc": "2026-04-12T13:34:14Z", "mode": "train", "global_step": 703, "epoch": 0.02823633369482267, "loss": -0.2044, "grad_norm": 3.1238300800323486, "learning_rate": 7.872727272727273e-06, "num_tokens": 1419812.0, "completions/mean_length": 257.75, "completions/min_length": 156.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 173.0, "completions/min_terminated_length": 156.0, "completions/max_terminated_length": 197.0, "rewards/meter/mean": 0.7507860064506531, "rewards/meter/std": 0.42690497636795044, "rewards/count_adherence/mean": 0.7083333134651184, "rewards/count_adherence/std": 0.31810450553894043, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9290858507156372, "rewards/lexical_plausibility/std": 0.1349487006664276, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.9610195159912109, "rewards/repeat_penalty/std": 0.027280161157250404, "rewards/near_duplicate_penalty/mean": 0.9774726033210754, "rewards/near_duplicate_penalty/std": 0.012866468168795109, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9830514192581177, "rewards/distinct_2/std": 0.018757881596684456, "rewards/total_composite/mean": 0.2014596313238144, "rewards/total_composite/std": 0.16038274765014648, "reward": 0.2014596313238144, "reward_std": 0.16038274765014648, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14188724756240845, "sampling/sampling_logp_difference/max": 2.0898890495300293, "sampling/importance_sampling_ratio/min": 0.12370086461305618, "sampling/importance_sampling_ratio/mean": 1.0204529762268066, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7533105984330177, "clip_ratio/low_mean": 0.019508671015501022, "clip_ratio/low_min": 0.019508671015501022, "clip_ratio/high_mean": 0.09468829818069935, "clip_ratio/high_max": 0.09468829818069935, "clip_ratio/region_mean": 0.11419696919620037, "reward_total_mean": 0.2014596313238144, "reward_meter_mean": 0.7507860064506531, "reward_meter_std": 0.42690497636795044, "reward_count_adherence_mean": 0.7083333134651184, "reward_count_adherence_std": 0.31810450553894043, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9290858507156372, "reward_lexical_plausibility_std": 0.1349487006664276, "reward_repeat_penalty_mean": 0.9610195159912109, "reward_repeat_penalty_std": 0.027280161157250404, "reward_near_duplicate_penalty_mean": 0.9774726033210754, "reward_near_duplicate_penalty_std": 0.012866468168795109, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9830514192581177, "reward_distinct_2_std": 0.018757881596684456, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.2014596313238144, "reward_total_composite_std": 0.16038274765014648} {"timestamp_utc": "2026-04-12T13:34:28Z", "mode": "train", "global_step": 704, "epoch": 0.028276499176607624, "loss": -0.2351, "grad_norm": 3.3508265018463135, "learning_rate": 7.86969696969697e-06, "num_tokens": 1423139.0, "completions/mean_length": 361.875, "completions/min_length": 285.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 311.8333435058594, "completions/min_terminated_length": 285.0, "completions/max_terminated_length": 353.0, "rewards/meter/mean": 0.4262239336967468, "rewards/meter/std": 0.302864134311676, "rewards/count_adherence/mean": 0.8409091234207153, "rewards/count_adherence/std": 0.32867664098739624, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9639943838119507, "rewards/lexical_plausibility/std": 0.091572105884552, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.11259915679693222, "rewards/repeat_penalty/mean": 0.5871773958206177, "rewards/repeat_penalty/std": 0.27425143122673035, "rewards/near_duplicate_penalty/mean": 0.8991332054138184, "rewards/near_duplicate_penalty/std": 0.06064100190997124, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6544107794761658, "rewards/distinct_2/std": 0.24710626900196075, "rewards/total_composite/mean": 0.08113665878772736, "rewards/total_composite/std": 0.06976733356714249, "reward": 0.08113665878772736, "reward_std": 0.06976732611656189, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11967301368713379, "sampling/sampling_logp_difference/max": 3.156653881072998, "sampling/importance_sampling_ratio/min": 0.14452998340129852, "sampling/importance_sampling_ratio/mean": 1.013148307800293, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6142924204468727, "clip_ratio/low_mean": 0.012719297781586647, "clip_ratio/low_min": 0.012719297781586647, "clip_ratio/high_mean": 0.07558081299066544, "clip_ratio/high_max": 0.07558081299066544, "clip_ratio/region_mean": 0.08830011077225208, "reward_total_mean": 0.08113665878772736, "reward_meter_mean": 0.4262239336967468, "reward_meter_std": 0.302864134311676, "reward_count_adherence_mean": 0.8409091234207153, "reward_count_adherence_std": 0.32867664098739624, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9639943838119507, "reward_lexical_plausibility_std": 0.091572105884552, "reward_repeat_penalty_mean": 0.5871773958206177, "reward_repeat_penalty_std": 0.27425143122673035, "reward_near_duplicate_penalty_mean": 0.8991332054138184, "reward_near_duplicate_penalty_std": 0.06064100190997124, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6544107794761658, "reward_distinct_2_std": 0.24710626900196075, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.11259915679693222, "reward_total_composite_mean": 0.08113665878772736, "reward_total_composite_std": 0.06976733356714249} {"timestamp_utc": "2026-04-12T13:34:41Z", "mode": "train", "global_step": 705, "epoch": 0.02831666465839258, "loss": -0.0388, "grad_norm": 3.323040008544922, "learning_rate": 7.866666666666667e-06, "num_tokens": 1424714.0, "completions/mean_length": 166.875, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 51.833335876464844, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.20770291984081268, "rewards/meter/std": 0.3252376317977905, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9348514080047607, "rewards/lexical_plausibility/std": 0.12084727734327316, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.9069770574569702, "rewards/repeat_penalty/std": 0.0928507000207901, "rewards/near_duplicate_penalty/mean": 0.9542151093482971, "rewards/near_duplicate_penalty/std": 0.04456498473882675, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9820234179496765, "rewards/distinct_2/std": 0.033394016325473785, "rewards/total_composite/mean": 0.07226188480854034, "rewards/total_composite/std": 0.11443310976028442, "reward": 0.07226188480854034, "reward_std": 0.11443311721086502, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16576188802719116, "sampling/sampling_logp_difference/max": 2.1529626846313477, "sampling/importance_sampling_ratio/min": 0.11613956093788147, "sampling/importance_sampling_ratio/mean": 1.0327199697494507, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0006302744150162, "clip_ratio/low_mean": 0.07075394038110971, "clip_ratio/low_min": 0.07075394038110971, "clip_ratio/high_mean": 0.03052083309739828, "clip_ratio/high_max": 0.03052083309739828, "clip_ratio/region_mean": 0.101274773478508, "reward_total_mean": 0.07226188480854034, "reward_meter_mean": 0.20770291984081268, "reward_meter_std": 0.3252376317977905, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9348514080047607, "reward_lexical_plausibility_std": 0.12084727734327316, "reward_repeat_penalty_mean": 0.9069770574569702, "reward_repeat_penalty_std": 0.0928507000207901, "reward_near_duplicate_penalty_mean": 0.9542151093482971, "reward_near_duplicate_penalty_std": 0.04456498473882675, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9820234179496765, "reward_distinct_2_std": 0.033394016325473785, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.07226188480854034, "reward_total_composite_std": 0.11443310976028442} {"timestamp_utc": "2026-04-12T13:34:49Z", "mode": "train", "global_step": 706, "epoch": 0.028356830140177532, "loss": 0.058, "grad_norm": 16.509536743164062, "learning_rate": 7.863636363636364e-06, "num_tokens": 1426049.0, "completions/mean_length": 34.875, "completions/min_length": 33.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7722452878952026, "rewards/meter/std": 0.3245435953140259, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.7287236452102661, "rewards/lexical_plausibility/std": 0.2502076327800751, "rewards/judge_quality/mean": 0.6225000023841858, "rewards/judge_quality/std": 0.3285357356071472, "rewards/repeat_penalty/mean": 0.738068163394928, "rewards/repeat_penalty/std": 0.033748287707567215, "rewards/near_duplicate_penalty/mean": 0.9840909242630005, "rewards/near_duplicate_penalty/std": 0.04499770700931549, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45578867197036743, "rewards/total_composite/std": 0.32262635231018066, "reward": 0.45578867197036743, "reward_std": 0.32262635231018066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15979905426502228, "sampling/sampling_logp_difference/max": 1.5976028442382812, "sampling/importance_sampling_ratio/min": 0.20238107442855835, "sampling/importance_sampling_ratio/mean": 1.034034013748169, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3599934056401253, "clip_ratio/low_mean": 0.09168688952922821, "clip_ratio/low_min": 0.09168688952922821, "clip_ratio/high_mean": 0.06286605726927519, "clip_ratio/high_max": 0.06286605726927519, "clip_ratio/region_mean": 0.1545529467985034, "reward_total_mean": 0.45578867197036743, "reward_meter_mean": 0.7722452878952026, "reward_meter_std": 0.3245435953140259, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.7287236452102661, "reward_lexical_plausibility_std": 0.2502076327800751, "reward_repeat_penalty_mean": 0.738068163394928, "reward_repeat_penalty_std": 0.033748287707567215, "reward_near_duplicate_penalty_mean": 0.9840909242630005, "reward_near_duplicate_penalty_std": 0.04499770700931549, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6225000023841858, "reward_judge_quality_std": 0.3285357356071472, "reward_total_composite_mean": 0.45578867197036743, "reward_total_composite_std": 0.32262635231018066} {"timestamp_utc": "2026-04-12T13:35:03Z", "mode": "train", "global_step": 707, "epoch": 0.028396995621962486, "loss": -0.0906, "grad_norm": 2.5562710762023926, "learning_rate": 7.860606060606062e-06, "num_tokens": 1427778.0, "completions/mean_length": 232.125, "completions/min_length": 60.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 64.20000457763672, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.7281879186630249, "rewards/meter/std": 0.3522622883319855, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8970426321029663, "rewards/lexical_plausibility/std": 0.15456870198249817, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2881684899330139, "rewards/repeat_penalty/mean": 0.878716230392456, "rewards/repeat_penalty/std": 0.17452524602413177, "rewards/near_duplicate_penalty/mean": 0.9691689014434814, "rewards/near_duplicate_penalty/std": 0.03202034905552864, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9571457505226135, "rewards/distinct_2/std": 0.06666997075080872, "rewards/total_composite/mean": 0.1733127385377884, "rewards/total_composite/std": 0.18337255716323853, "reward": 0.1733127385377884, "reward_std": 0.18337254226207733, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13388222455978394, "sampling/sampling_logp_difference/max": 1.4603995084762573, "sampling/importance_sampling_ratio/min": 0.23214350640773773, "sampling/importance_sampling_ratio/mean": 1.0199592113494873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6001369431614876, "clip_ratio/low_mean": 0.014492753893136978, "clip_ratio/low_min": 0.014492753893136978, "clip_ratio/high_mean": 0.07541691791266203, "clip_ratio/high_max": 0.07541691791266203, "clip_ratio/region_mean": 0.08990967180579901, "reward_total_mean": 0.1733127385377884, "reward_meter_mean": 0.7281879186630249, "reward_meter_std": 0.3522622883319855, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8970426321029663, "reward_lexical_plausibility_std": 0.15456870198249817, "reward_repeat_penalty_mean": 0.878716230392456, "reward_repeat_penalty_std": 0.17452524602413177, "reward_near_duplicate_penalty_mean": 0.9691689014434814, "reward_near_duplicate_penalty_std": 0.03202034905552864, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9571457505226135, "reward_distinct_2_std": 0.06666997075080872, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2881684899330139, "reward_total_composite_mean": 0.1733127385377884, "reward_total_composite_std": 0.18337255716323853} {"timestamp_utc": "2026-04-12T13:35:17Z", "mode": "train", "global_step": 708, "epoch": 0.02843716110374744, "loss": -0.1665, "grad_norm": 2.5779967308044434, "learning_rate": 7.857575757575759e-06, "num_tokens": 1431047.0, "completions/mean_length": 278.625, "completions/min_length": 221.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 245.2857208251953, "completions/min_terminated_length": 221.0, "completions/max_terminated_length": 272.0, "rewards/meter/mean": 0.8360555171966553, "rewards/meter/std": 0.1717107594013214, "rewards/count_adherence/mean": 0.805555522441864, "rewards/count_adherence/std": 0.2832788825035095, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9661475419998169, "rewards/lexical_plausibility/std": 0.09574912488460541, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.08345229923725128, "rewards/repeat_penalty/mean": 0.5714437365531921, "rewards/repeat_penalty/std": 0.21675854921340942, "rewards/near_duplicate_penalty/mean": 0.8558686971664429, "rewards/near_duplicate_penalty/std": 0.08912242203950882, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6769595742225647, "rewards/distinct_2/std": 0.17013928294181824, "rewards/total_composite/mean": 0.12402010709047318, "rewards/total_composite/std": 0.0695514976978302, "reward": 0.12402010709047318, "reward_std": 0.0695514902472496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09929447621107101, "sampling/sampling_logp_difference/max": 1.8009637594223022, "sampling/importance_sampling_ratio/min": 0.16513966023921967, "sampling/importance_sampling_ratio/mean": 1.012818694114685, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.469089113175869, "clip_ratio/low_mean": 0.03810977004468441, "clip_ratio/low_min": 0.03810977004468441, "clip_ratio/high_mean": 0.042792328633368015, "clip_ratio/high_max": 0.042792328633368015, "clip_ratio/region_mean": 0.08090209867805243, "reward_total_mean": 0.12402010709047318, "reward_meter_mean": 0.8360555171966553, "reward_meter_std": 0.1717107594013214, "reward_count_adherence_mean": 0.805555522441864, "reward_count_adherence_std": 0.2832788825035095, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9661475419998169, "reward_lexical_plausibility_std": 0.09574912488460541, "reward_repeat_penalty_mean": 0.5714437365531921, "reward_repeat_penalty_std": 0.21675854921340942, "reward_near_duplicate_penalty_mean": 0.8558686971664429, "reward_near_duplicate_penalty_std": 0.08912242203950882, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6769595742225647, "reward_distinct_2_std": 0.17013928294181824, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.08345229923725128, "reward_total_composite_mean": 0.12402010709047318, "reward_total_composite_std": 0.0695514976978302} {"timestamp_utc": "2026-04-12T13:35:32Z", "mode": "train", "global_step": 709, "epoch": 0.028477326585532394, "loss": -0.2504, "grad_norm": 2.9031665325164795, "learning_rate": 7.854545454545454e-06, "num_tokens": 1435307.0, "completions/mean_length": 393.5, "completions/min_length": 216.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 376.5714416503906, "completions/min_terminated_length": 216.0, "completions/max_terminated_length": 434.0, "rewards/meter/mean": 0.6926078796386719, "rewards/meter/std": 0.26816973090171814, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.38184911012649536, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9558064341545105, "rewards/lexical_plausibility/std": 0.09961117058992386, "rewards/judge_quality/mean": 0.13125000894069672, "rewards/judge_quality/std": 0.0530330128967762, "rewards/repeat_penalty/mean": 0.35398775339126587, "rewards/repeat_penalty/std": 0.34143513441085815, "rewards/near_duplicate_penalty/mean": 0.8688129186630249, "rewards/near_duplicate_penalty/std": 0.08688666671514511, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.4254310131072998, "rewards/distinct_2/std": 0.37536802887916565, "rewards/total_composite/mean": 0.08600445091724396, "rewards/total_composite/std": 0.05431681498885155, "reward": 0.08600445091724396, "reward_std": 0.05431681498885155, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1035347506403923, "sampling/sampling_logp_difference/max": 2.9126782417297363, "sampling/importance_sampling_ratio/min": 0.05433002859354019, "sampling/importance_sampling_ratio/mean": 1.0033495426177979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7287429347634315, "clip_ratio/low_mean": 0.024561572819948196, "clip_ratio/low_min": 0.024561572819948196, "clip_ratio/high_mean": 0.05949160410091281, "clip_ratio/high_max": 0.05949160410091281, "clip_ratio/region_mean": 0.084053176920861, "reward_total_mean": 0.08600445091724396, "reward_meter_mean": 0.6926078796386719, "reward_meter_std": 0.26816973090171814, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.38184911012649536, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9558064341545105, "reward_lexical_plausibility_std": 0.09961117058992386, "reward_repeat_penalty_mean": 0.35398775339126587, "reward_repeat_penalty_std": 0.34143513441085815, "reward_near_duplicate_penalty_mean": 0.8688129186630249, "reward_near_duplicate_penalty_std": 0.08688666671514511, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.4254310131072998, "reward_distinct_2_std": 0.37536802887916565, "reward_judge_quality_mean": 0.13125000894069672, "reward_judge_quality_std": 0.0530330128967762, "reward_total_composite_mean": 0.08600445091724396, "reward_total_composite_std": 0.05431681498885155} {"timestamp_utc": "2026-04-12T13:35:47Z", "mode": "train", "global_step": 710, "epoch": 0.028517492067317348, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.851515151515152e-06, "num_tokens": 1437203.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.7577996253967285, "rewards/meter/std": 0.2664344310760498, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.059608783572912216, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9957386255264282, "rewards/lexical_plausibility/std": 0.012052967213094234, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.1225799024105072, "rewards/repeat_penalty/std": 0.12920282781124115, "rewards/near_duplicate_penalty/mean": 0.7553712725639343, "rewards/near_duplicate_penalty/std": 0.09750039130449295, "rewards/opening_diversity/mean": 0.9888392686843872, "rewards/opening_diversity/std": 0.031567275524139404, "rewards/distinct_2/mean": 0.17089681327342987, "rewards/distinct_2/std": 0.17077679932117462, "rewards/total_composite/mean": 0.08875250071287155, "rewards/total_composite/std": 0.04935825243592262, "reward": 0.08875250071287155, "reward_std": 0.04935825616121292, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.08875250071287155, "reward_meter_mean": 0.7577996253967285, "reward_meter_std": 0.2664344310760498, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.059608783572912216, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9957386255264282, "reward_lexical_plausibility_std": 0.012052967213094234, "reward_repeat_penalty_mean": 0.1225799024105072, "reward_repeat_penalty_std": 0.12920282781124115, "reward_near_duplicate_penalty_mean": 0.7553712725639343, "reward_near_duplicate_penalty_std": 0.09750039130449295, "reward_opening_diversity_mean": 0.9888392686843872, "reward_opening_diversity_std": 0.031567275524139404, "reward_distinct_2_mean": 0.17089681327342987, "reward_distinct_2_std": 0.17077679932117462, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.08875250071287155, "reward_total_composite_std": 0.04935825243592262} {"timestamp_utc": "2026-04-12T13:36:02Z", "mode": "train", "global_step": 711, "epoch": 0.028557657549102302, "loss": -0.0751, "grad_norm": 0.2859575152397156, "learning_rate": 7.848484848484849e-06, "num_tokens": 1440177.0, "completions/mean_length": 500.75, "completions/min_length": 425.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 467.0, "completions/min_terminated_length": 425.0, "completions/max_terminated_length": 509.0, "rewards/meter/mean": 0.9490606784820557, "rewards/meter/std": 0.056531812995672226, "rewards/count_adherence/mean": 0.9464285969734192, "rewards/count_adherence/std": 0.05050763115286827, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0008375698234885931, "rewards/repeat_penalty/std": 0.0023690052330493927, "rewards/near_duplicate_penalty/mean": 0.6331762075424194, "rewards/near_duplicate_penalty/std": 0.09013549238443375, "rewards/opening_diversity/mean": 0.8469989895820618, "rewards/opening_diversity/std": 0.08452124893665314, "rewards/distinct_2/mean": 0.0013736264081671834, "rewards/distinct_2/std": 0.003885202342644334, "rewards/total_composite/mean": 0.13455164432525635, "rewards/total_composite/std": 0.008079596795141697, "reward": 0.13455164432525635, "reward_std": 0.008079597726464272, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.02639433741569519, "sampling/sampling_logp_difference/max": 0.842078685760498, "sampling/importance_sampling_ratio/min": 0.43081408739089966, "sampling/importance_sampling_ratio/mean": 1.0005429983139038, "sampling/importance_sampling_ratio/max": 1.7887802124023438, "entropy": 0.05425930209457874, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.007167456205934286, "clip_ratio/high_max": 0.007167456205934286, "clip_ratio/region_mean": 0.007167456205934286, "reward_total_mean": 0.13455164432525635, "reward_meter_mean": 0.9490606784820557, "reward_meter_std": 0.056531812995672226, "reward_count_adherence_mean": 0.9464285969734192, "reward_count_adherence_std": 0.05050763115286827, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0008375698234885931, "reward_repeat_penalty_std": 0.0023690052330493927, "reward_near_duplicate_penalty_mean": 0.6331762075424194, "reward_near_duplicate_penalty_std": 0.09013549238443375, "reward_opening_diversity_mean": 0.8469989895820618, "reward_opening_diversity_std": 0.08452124893665314, "reward_distinct_2_mean": 0.0013736264081671834, "reward_distinct_2_std": 0.003885202342644334, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.13455164432525635, "reward_total_composite_std": 0.008079596795141697} {"timestamp_utc": "2026-04-12T13:36:16Z", "mode": "train", "global_step": 712, "epoch": 0.028597823030887256, "loss": -0.0866, "grad_norm": 4.251730442047119, "learning_rate": 7.845454545454546e-06, "num_tokens": 1441841.0, "completions/mean_length": 173.0, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 60.0, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.4674437642097473, "rewards/meter/std": 0.4737145006656647, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9053367376327515, "rewards/lexical_plausibility/std": 0.17668111622333527, "rewards/judge_quality/mean": 0.29374998807907104, "rewards/judge_quality/std": 0.17204132676124573, "rewards/repeat_penalty/mean": 0.9451378583908081, "rewards/repeat_penalty/std": 0.041200459003448486, "rewards/near_duplicate_penalty/mean": 0.9671118855476379, "rewards/near_duplicate_penalty/std": 0.021453896537423134, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.977196216583252, "rewards/distinct_2/std": 0.034176018089056015, "rewards/total_composite/mean": 0.18675193190574646, "rewards/total_composite/std": 0.19529974460601807, "reward": 0.18675193190574646, "reward_std": 0.19529974460601807, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13164152204990387, "sampling/sampling_logp_difference/max": 1.9119737148284912, "sampling/importance_sampling_ratio/min": 0.147788405418396, "sampling/importance_sampling_ratio/mean": 1.0013500452041626, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.47536277025938034, "clip_ratio/low_mean": 0.020233366638422012, "clip_ratio/low_min": 0.020233366638422012, "clip_ratio/high_mean": 0.0677831219509244, "clip_ratio/high_max": 0.0677831219509244, "clip_ratio/region_mean": 0.08801648858934641, "reward_total_mean": 0.18675193190574646, "reward_meter_mean": 0.4674437642097473, "reward_meter_std": 0.4737145006656647, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9053367376327515, "reward_lexical_plausibility_std": 0.17668111622333527, "reward_repeat_penalty_mean": 0.9451378583908081, "reward_repeat_penalty_std": 0.041200459003448486, "reward_near_duplicate_penalty_mean": 0.9671118855476379, "reward_near_duplicate_penalty_std": 0.021453896537423134, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.977196216583252, "reward_distinct_2_std": 0.034176018089056015, "reward_judge_quality_mean": 0.29374998807907104, "reward_judge_quality_std": 0.17204132676124573, "reward_total_composite_mean": 0.18675193190574646, "reward_total_composite_std": 0.19529974460601807} {"timestamp_utc": "2026-04-12T13:36:31Z", "mode": "train", "global_step": 713, "epoch": 0.02863798851267221, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.842424242424243e-06, "num_tokens": 1443665.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.38649463653564453, "rewards/meter/std": 0.35950174927711487, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.06172133609652519, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9993645548820496, "rewards/lexical_plausibility/std": 0.0017972891218960285, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.001342153875157237, "rewards/repeat_penalty/std": 0.0037961844354867935, "rewards/near_duplicate_penalty/mean": 0.449945330619812, "rewards/near_duplicate_penalty/std": 0.22313697636127472, "rewards/opening_diversity/mean": 0.5614316463470459, "rewards/opening_diversity/std": 0.35128137469291687, "rewards/distinct_2/mean": 0.0018823768477886915, "rewards/distinct_2/std": 0.005324165802448988, "rewards/total_composite/mean": 0.03751775622367859, "rewards/total_composite/std": 0.045408945530653, "reward": 0.03751775622367859, "reward_std": 0.0454089418053627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.03751775622367859, "reward_meter_mean": 0.38649463653564453, "reward_meter_std": 0.35950174927711487, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.06172133609652519, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9993645548820496, "reward_lexical_plausibility_std": 0.0017972891218960285, "reward_repeat_penalty_mean": 0.001342153875157237, "reward_repeat_penalty_std": 0.0037961844354867935, "reward_near_duplicate_penalty_mean": 0.449945330619812, "reward_near_duplicate_penalty_std": 0.22313697636127472, "reward_opening_diversity_mean": 0.5614316463470459, "reward_opening_diversity_std": 0.35128137469291687, "reward_distinct_2_mean": 0.0018823768477886915, "reward_distinct_2_std": 0.005324165802448988, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.03751775622367859, "reward_total_composite_std": 0.045408945530653} {"timestamp_utc": "2026-04-12T13:36:42Z", "mode": "train", "global_step": 714, "epoch": 0.028678153994457164, "loss": 0.0576, "grad_norm": 4.135997772216797, "learning_rate": 7.83939393939394e-06, "num_tokens": 1447134.0, "completions/mean_length": 249.625, "completions/min_length": 213.0, "completions/max_length": 267.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 249.625, "completions/min_terminated_length": 213.0, "completions/max_terminated_length": 267.0, "rewards/meter/mean": 0.763771653175354, "rewards/meter/std": 0.3426404595375061, "rewards/count_adherence/mean": 0.9107142686843872, "rewards/count_adherence/std": 0.10628911107778549, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9895833730697632, "rewards/lexical_plausibility/std": 0.029462775215506554, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.341755211353302, "rewards/repeat_penalty/std": 0.2517761290073395, "rewards/near_duplicate_penalty/mean": 0.7890658378601074, "rewards/near_duplicate_penalty/std": 0.13595765829086304, "rewards/opening_diversity/mean": 0.9317245483398438, "rewards/opening_diversity/std": 0.12083348631858826, "rewards/distinct_2/mean": 0.4419478178024292, "rewards/distinct_2/std": 0.27744823694229126, "rewards/total_composite/mean": 0.09026844799518585, "rewards/total_composite/std": 0.061080846935510635, "reward": 0.09026844799518585, "reward_std": 0.06108083948493004, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08282623440027237, "sampling/sampling_logp_difference/max": 1.605752944946289, "sampling/importance_sampling_ratio/min": 0.2007383555173874, "sampling/importance_sampling_ratio/mean": 1.0089975595474243, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.47546498849987984, "clip_ratio/low_mean": 0.019779802300035954, "clip_ratio/low_min": 0.019779802300035954, "clip_ratio/high_mean": 0.05101823341101408, "clip_ratio/high_max": 0.05101823341101408, "clip_ratio/region_mean": 0.07079803571105003, "reward_total_mean": 0.09026844799518585, "reward_meter_mean": 0.763771653175354, "reward_meter_std": 0.3426404595375061, "reward_count_adherence_mean": 0.9107142686843872, "reward_count_adherence_std": 0.10628911107778549, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9895833730697632, "reward_lexical_plausibility_std": 0.029462775215506554, "reward_repeat_penalty_mean": 0.341755211353302, "reward_repeat_penalty_std": 0.2517761290073395, "reward_near_duplicate_penalty_mean": 0.7890658378601074, "reward_near_duplicate_penalty_std": 0.13595765829086304, "reward_opening_diversity_mean": 0.9317245483398438, "reward_opening_diversity_std": 0.12083348631858826, "reward_distinct_2_mean": 0.4419478178024292, "reward_distinct_2_std": 0.27744823694229126, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.09026844799518585, "reward_total_composite_std": 0.061080846935510635} {"timestamp_utc": "2026-04-12T13:36:56Z", "mode": "train", "global_step": 715, "epoch": 0.028718319476242118, "loss": -0.1372, "grad_norm": 3.8975143432617188, "learning_rate": 7.836363636363638e-06, "num_tokens": 1449201.0, "completions/mean_length": 211.375, "completions/min_length": 87.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 111.16667175292969, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 126.0, "rewards/meter/mean": 0.3653896450996399, "rewards/meter/std": 0.3022627532482147, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.953475296497345, "rewards/lexical_plausibility/std": 0.08626838028430939, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.88077712059021, "rewards/repeat_penalty/std": 0.08017028123140335, "rewards/near_duplicate_penalty/mean": 0.9692107439041138, "rewards/near_duplicate_penalty/std": 0.0186021588742733, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9402357339859009, "rewards/distinct_2/std": 0.05703572556376457, "rewards/total_composite/mean": 0.12513285875320435, "rewards/total_composite/std": 0.11413661390542984, "reward": 0.12513285875320435, "reward_std": 0.11413661390542984, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12337290495634079, "sampling/sampling_logp_difference/max": 2.0883889198303223, "sampling/importance_sampling_ratio/min": 0.12388657033443451, "sampling/importance_sampling_ratio/mean": 1.0229735374450684, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6158076301217079, "clip_ratio/low_mean": 0.026057031005620956, "clip_ratio/low_min": 0.026057031005620956, "clip_ratio/high_mean": 0.062277442775666714, "clip_ratio/high_max": 0.062277442775666714, "clip_ratio/region_mean": 0.08833447378128767, "reward_total_mean": 0.12513285875320435, "reward_meter_mean": 0.3653896450996399, "reward_meter_std": 0.3022627532482147, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.953475296497345, "reward_lexical_plausibility_std": 0.08626838028430939, "reward_repeat_penalty_mean": 0.88077712059021, "reward_repeat_penalty_std": 0.08017028123140335, "reward_near_duplicate_penalty_mean": 0.9692107439041138, "reward_near_duplicate_penalty_std": 0.0186021588742733, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9402357339859009, "reward_distinct_2_std": 0.05703572556376457, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.12513285875320435, "reward_total_composite_std": 0.11413661390542984} {"timestamp_utc": "2026-04-12T13:37:10Z", "mode": "train", "global_step": 716, "epoch": 0.02875848495802707, "loss": -0.0798, "grad_norm": 4.312860488891602, "learning_rate": 7.833333333333333e-06, "num_tokens": 1451591.0, "completions/mean_length": 189.75, "completions/min_length": 126.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 143.71429443359375, "completions/min_terminated_length": 126.0, "completions/max_terminated_length": 161.0, "rewards/meter/mean": 0.5335475206375122, "rewards/meter/std": 0.4025692343711853, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.35197150707244873, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9378854036331177, "rewards/lexical_plausibility/std": 0.17568671703338623, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.4815531373023987, "rewards/repeat_penalty/std": 0.27292245626449585, "rewards/near_duplicate_penalty/mean": 0.7996932864189148, "rewards/near_duplicate_penalty/std": 0.11553988605737686, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.6112323999404907, "rewards/distinct_2/std": 0.2175302803516388, "rewards/total_composite/mean": 0.11849026381969452, "rewards/total_composite/std": 0.11608956009149551, "reward": 0.11849026381969452, "reward_std": 0.11608955264091492, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1107170507311821, "sampling/sampling_logp_difference/max": 3.2527613639831543, "sampling/importance_sampling_ratio/min": 0.038667287677526474, "sampling/importance_sampling_ratio/mean": 1.0102763175964355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5769151635468006, "clip_ratio/low_mean": 0.033641617745161057, "clip_ratio/low_min": 0.033641617745161057, "clip_ratio/high_mean": 0.054977825842797756, "clip_ratio/high_max": 0.054977825842797756, "clip_ratio/region_mean": 0.08861944358795881, "reward_total_mean": 0.11849026381969452, "reward_meter_mean": 0.5335475206375122, "reward_meter_std": 0.4025692343711853, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.35197150707244873, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9378854036331177, "reward_lexical_plausibility_std": 0.17568671703338623, "reward_repeat_penalty_mean": 0.4815531373023987, "reward_repeat_penalty_std": 0.27292245626449585, "reward_near_duplicate_penalty_mean": 0.7996932864189148, "reward_near_duplicate_penalty_std": 0.11553988605737686, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.6112323999404907, "reward_distinct_2_std": 0.2175302803516388, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.11849026381969452, "reward_total_composite_std": 0.11608956009149551} {"timestamp_utc": "2026-04-12T13:37:20Z", "mode": "train", "global_step": 717, "epoch": 0.028798650439812026, "loss": 0.0681, "grad_norm": 8.300482749938965, "learning_rate": 7.83030303030303e-06, "num_tokens": 1454461.0, "completions/mean_length": 151.75, "completions/min_length": 120.0, "completions/max_length": 184.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.75, "completions/min_terminated_length": 120.0, "completions/max_terminated_length": 184.0, "rewards/meter/mean": 0.5869561433792114, "rewards/meter/std": 0.4143819510936737, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.04419417306780815, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.3283223807811737, "rewards/repeat_penalty/std": 0.28635236620903015, "rewards/near_duplicate_penalty/mean": 0.7320524454116821, "rewards/near_duplicate_penalty/std": 0.1146959513425827, "rewards/opening_diversity/mean": 0.8026041984558105, "rewards/opening_diversity/std": 0.33866962790489197, "rewards/distinct_2/mean": 0.5139428377151489, "rewards/distinct_2/std": 0.2744678556919098, "rewards/total_composite/mean": 0.1502363085746765, "rewards/total_composite/std": 0.12501950562000275, "reward": 0.1502363085746765, "reward_std": 0.12501949071884155, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09794704616069794, "sampling/sampling_logp_difference/max": 1.7185297012329102, "sampling/importance_sampling_ratio/min": 0.17932963371276855, "sampling/importance_sampling_ratio/mean": 1.00253164768219, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5102434642612934, "clip_ratio/low_mean": 0.04951613815501332, "clip_ratio/low_min": 0.04951613815501332, "clip_ratio/high_mean": 0.044275776483118534, "clip_ratio/high_max": 0.044275776483118534, "clip_ratio/region_mean": 0.09379191463813186, "reward_total_mean": 0.1502363085746765, "reward_meter_mean": 0.5869561433792114, "reward_meter_std": 0.4143819510936737, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.04419417306780815, "reward_repeat_penalty_mean": 0.3283223807811737, "reward_repeat_penalty_std": 0.28635236620903015, "reward_near_duplicate_penalty_mean": 0.7320524454116821, "reward_near_duplicate_penalty_std": 0.1146959513425827, "reward_opening_diversity_mean": 0.8026041984558105, "reward_opening_diversity_std": 0.33866962790489197, "reward_distinct_2_mean": 0.5139428377151489, "reward_distinct_2_std": 0.2744678556919098, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.1502363085746765, "reward_total_composite_std": 0.12501950562000275} {"timestamp_utc": "2026-04-12T13:37:34Z", "mode": "train", "global_step": 718, "epoch": 0.02883881592159698, "loss": -0.0676, "grad_norm": 3.2426297664642334, "learning_rate": 7.827272727272728e-06, "num_tokens": 1456035.0, "completions/mean_length": 167.75, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 53.0, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.5163996815681458, "rewards/meter/std": 0.45872992277145386, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9077537655830383, "rewards/lexical_plausibility/std": 0.1766103208065033, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.9234302043914795, "rewards/repeat_penalty/std": 0.08610820025205612, "rewards/near_duplicate_penalty/mean": 0.9635096788406372, "rewards/near_duplicate_penalty/std": 0.03608851507306099, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.19901247322559357, "rewards/total_composite/std": 0.19665133953094482, "reward": 0.19901247322559357, "reward_std": 0.19665133953094482, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14281298220157623, "sampling/sampling_logp_difference/max": 1.3788189888000488, "sampling/importance_sampling_ratio/min": 0.2518758475780487, "sampling/importance_sampling_ratio/mean": 1.0090091228485107, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7193535938858986, "clip_ratio/low_mean": 0.020877009257674217, "clip_ratio/low_min": 0.020877009257674217, "clip_ratio/high_mean": 0.08075364772230387, "clip_ratio/high_max": 0.08075364772230387, "clip_ratio/region_mean": 0.10163065697997808, "reward_total_mean": 0.19901247322559357, "reward_meter_mean": 0.5163996815681458, "reward_meter_std": 0.45872992277145386, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9077537655830383, "reward_lexical_plausibility_std": 0.1766103208065033, "reward_repeat_penalty_mean": 0.9234302043914795, "reward_repeat_penalty_std": 0.08610820025205612, "reward_near_duplicate_penalty_mean": 0.9635096788406372, "reward_near_duplicate_penalty_std": 0.03608851507306099, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.19901247322559357, "reward_total_composite_std": 0.19665133953094482} {"timestamp_utc": "2026-04-12T13:37:44Z", "mode": "train", "global_step": 719, "epoch": 0.028878981403381934, "loss": 0.0118, "grad_norm": 7.891262054443359, "learning_rate": 7.824242424242425e-06, "num_tokens": 1458436.0, "completions/mean_length": 133.125, "completions/min_length": 119.0, "completions/max_length": 145.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.125, "completions/min_terminated_length": 119.0, "completions/max_terminated_length": 145.0, "rewards/meter/mean": 0.810893714427948, "rewards/meter/std": 0.27897176146507263, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.6247476935386658, "rewards/repeat_penalty/std": 0.1748056262731552, "rewards/near_duplicate_penalty/mean": 0.8178353309631348, "rewards/near_duplicate_penalty/std": 0.0779615268111229, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.7636566162109375, "rewards/distinct_2/std": 0.148441344499588, "rewards/total_composite/mean": 0.16775871813297272, "rewards/total_composite/std": 0.10743365436792374, "reward": 0.16775871813297272, "reward_std": 0.10743366181850433, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11007557809352875, "sampling/sampling_logp_difference/max": 2.2130088806152344, "sampling/importance_sampling_ratio/min": 0.10937107354402542, "sampling/importance_sampling_ratio/mean": 0.9958500862121582, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7274518944323063, "clip_ratio/low_mean": 0.06906360620632768, "clip_ratio/low_min": 0.06906360620632768, "clip_ratio/high_mean": 0.02703285962343216, "clip_ratio/high_max": 0.02703285962343216, "clip_ratio/region_mean": 0.09609646582975984, "reward_total_mean": 0.16775871813297272, "reward_meter_mean": 0.810893714427948, "reward_meter_std": 0.27897176146507263, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6247476935386658, "reward_repeat_penalty_std": 0.1748056262731552, "reward_near_duplicate_penalty_mean": 0.8178353309631348, "reward_near_duplicate_penalty_std": 0.0779615268111229, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.7636566162109375, "reward_distinct_2_std": 0.148441344499588, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.16775871813297272, "reward_total_composite_std": 0.10743365436792374} {"timestamp_utc": "2026-04-12T13:37:55Z", "mode": "train", "global_step": 720, "epoch": 0.028919146885166887, "loss": 0.0449, "grad_norm": 5.318984031677246, "learning_rate": 7.821212121212122e-06, "num_tokens": 1461868.0, "completions/mean_length": 232.0, "completions/min_length": 204.0, "completions/max_length": 247.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 232.0, "completions/min_terminated_length": 204.0, "completions/max_terminated_length": 247.0, "rewards/meter/mean": 0.3841937184333801, "rewards/meter/std": 0.3249920904636383, "rewards/count_adherence/mean": 0.9821428656578064, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.47536277770996094, "rewards/repeat_penalty/std": 0.30891862511634827, "rewards/near_duplicate_penalty/mean": 0.8349100947380066, "rewards/near_duplicate_penalty/std": 0.09276093542575836, "rewards/opening_diversity/mean": 0.9642857313156128, "rewards/opening_diversity/std": 0.0874817818403244, "rewards/distinct_2/mean": 0.5841090679168701, "rewards/distinct_2/std": 0.2916153371334076, "rewards/total_composite/mean": 0.06952423602342606, "rewards/total_composite/std": 0.0673690140247345, "reward": 0.06952423602342606, "reward_std": 0.0673690140247345, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09519623965024948, "sampling/sampling_logp_difference/max": 1.6202712059020996, "sampling/importance_sampling_ratio/min": 0.19784502685070038, "sampling/importance_sampling_ratio/mean": 1.0090858936309814, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5764502733945847, "clip_ratio/low_mean": 0.041640359442681074, "clip_ratio/low_min": 0.041640359442681074, "clip_ratio/high_mean": 0.05514508578926325, "clip_ratio/high_max": 0.05514508578926325, "clip_ratio/region_mean": 0.09678544523194432, "reward_total_mean": 0.06952423602342606, "reward_meter_mean": 0.3841937184333801, "reward_meter_std": 0.3249920904636383, "reward_count_adherence_mean": 0.9821428656578064, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.47536277770996094, "reward_repeat_penalty_std": 0.30891862511634827, "reward_near_duplicate_penalty_mean": 0.8349100947380066, "reward_near_duplicate_penalty_std": 0.09276093542575836, "reward_opening_diversity_mean": 0.9642857313156128, "reward_opening_diversity_std": 0.0874817818403244, "reward_distinct_2_mean": 0.5841090679168701, "reward_distinct_2_std": 0.2916153371334076, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.06952423602342606, "reward_total_composite_std": 0.0673690140247345} {"timestamp_utc": "2026-04-12T13:38:03Z", "mode": "train", "global_step": 721, "epoch": 0.02895931236695184, "loss": 0.025, "grad_norm": 10.545655250549316, "learning_rate": 7.81818181818182e-06, "num_tokens": 1463683.0, "completions/mean_length": 60.875, "completions/min_length": 53.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.875, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.7616569995880127, "rewards/meter/std": 0.31978484988212585, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.2547512948513031, "rewards/repeat_penalty/mean": 0.789879322052002, "rewards/repeat_penalty/std": 0.1283789724111557, "rewards/near_duplicate_penalty/mean": 0.8887174725532532, "rewards/near_duplicate_penalty/std": 0.07181558012962341, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8841814398765564, "rewards/distinct_2/std": 0.07543253898620605, "rewards/total_composite/mean": 0.29626649618148804, "rewards/total_composite/std": 0.28620389103889465, "reward": 0.29626649618148804, "reward_std": 0.28620386123657227, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1434631496667862, "sampling/sampling_logp_difference/max": 1.7655353546142578, "sampling/importance_sampling_ratio/min": 0.17109516263008118, "sampling/importance_sampling_ratio/mean": 1.0185937881469727, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0090814530849457, "clip_ratio/low_mean": 0.0695754736661911, "clip_ratio/low_min": 0.0695754736661911, "clip_ratio/high_mean": 0.06644419766962528, "clip_ratio/high_max": 0.06644419766962528, "clip_ratio/region_mean": 0.13601967133581638, "reward_total_mean": 0.29626649618148804, "reward_meter_mean": 0.7616569995880127, "reward_meter_std": 0.31978484988212585, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.789879322052002, "reward_repeat_penalty_std": 0.1283789724111557, "reward_near_duplicate_penalty_mean": 0.8887174725532532, "reward_near_duplicate_penalty_std": 0.07181558012962341, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8841814398765564, "reward_distinct_2_std": 0.07543253898620605, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.2547512948513031, "reward_total_composite_mean": 0.29626649618148804, "reward_total_composite_std": 0.28620389103889465} {"timestamp_utc": "2026-04-12T13:38:17Z", "mode": "train", "global_step": 722, "epoch": 0.028999477848736795, "loss": 0.0401, "grad_norm": 5.4081501960754395, "learning_rate": 7.815151515151515e-06, "num_tokens": 1465108.0, "completions/mean_length": 94.125, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.42857360839844, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.5046600103378296, "rewards/meter/std": 0.4424968659877777, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.951648473739624, "rewards/lexical_plausibility/std": 0.13675887882709503, "rewards/judge_quality/mean": 0.3987500071525574, "rewards/judge_quality/std": 0.35722893476486206, "rewards/repeat_penalty/mean": 0.7705550789833069, "rewards/repeat_penalty/std": 0.09742417931556702, "rewards/near_duplicate_penalty/mean": 0.9825732111930847, "rewards/near_duplicate_penalty/std": 0.04929042607545853, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9715099334716797, "rewards/distinct_2/std": 0.08058197051286697, "rewards/total_composite/mean": 0.28435760736465454, "rewards/total_composite/std": 0.3203091323375702, "reward": 0.28435760736465454, "reward_std": 0.3203091323375702, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1381158083677292, "sampling/sampling_logp_difference/max": 1.1411648988723755, "sampling/importance_sampling_ratio/min": 0.4382007122039795, "sampling/importance_sampling_ratio/mean": 1.0286113023757935, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8700064122676849, "clip_ratio/low_mean": 0.03146777022629976, "clip_ratio/low_min": 0.03146777022629976, "clip_ratio/high_mean": 0.08177659101784229, "clip_ratio/high_max": 0.08177659101784229, "clip_ratio/region_mean": 0.11324436124414206, "reward_total_mean": 0.28435760736465454, "reward_meter_mean": 0.5046600103378296, "reward_meter_std": 0.4424968659877777, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.951648473739624, "reward_lexical_plausibility_std": 0.13675887882709503, "reward_repeat_penalty_mean": 0.7705550789833069, "reward_repeat_penalty_std": 0.09742417931556702, "reward_near_duplicate_penalty_mean": 0.9825732111930847, "reward_near_duplicate_penalty_std": 0.04929042607545853, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9715099334716797, "reward_distinct_2_std": 0.08058197051286697, "reward_judge_quality_mean": 0.3987500071525574, "reward_judge_quality_std": 0.35722893476486206, "reward_total_composite_mean": 0.28435760736465454, "reward_total_composite_std": 0.3203091323375702} {"timestamp_utc": "2026-04-12T13:38:30Z", "mode": "train", "global_step": 723, "epoch": 0.02903964333052175, "loss": 0.102, "grad_norm": 0.5549939870834351, "learning_rate": 7.812121212121213e-06, "num_tokens": 1467306.0, "completions/mean_length": 508.75, "completions/min_length": 486.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 486.0, "completions/min_terminated_length": 486.0, "completions/max_terminated_length": 486.0, "rewards/meter/mean": 0.8639713525772095, "rewards/meter/std": 0.15796209871768951, "rewards/count_adherence/mean": 0.8482142686843872, "rewards/count_adherence/std": 0.3181522488594055, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.11249999701976776, "rewards/judge_quality/std": 0.051754921674728394, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.4627264142036438, "rewards/near_duplicate_penalty/std": 0.22879651188850403, "rewards/opening_diversity/mean": 0.8230406641960144, "rewards/opening_diversity/std": 0.08088110387325287, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0841808170080185, "rewards/total_composite/std": 0.04921037703752518, "reward": 0.0841808170080185, "reward_std": 0.04921037331223488, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.013573627918958664, "sampling/sampling_logp_difference/max": 0.5130642652511597, "sampling/importance_sampling_ratio/min": 0.5986583232879639, "sampling/importance_sampling_ratio/mean": 1.0011045932769775, "sampling/importance_sampling_ratio/max": 1.5862984657287598, "entropy": 0.009813507087528706, "clip_ratio/low_mean": 0.0015432098880410194, "clip_ratio/low_min": 0.0015432098880410194, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0015432098880410194, "reward_total_mean": 0.0841808170080185, "reward_meter_mean": 0.8639713525772095, "reward_meter_std": 0.15796209871768951, "reward_count_adherence_mean": 0.8482142686843872, "reward_count_adherence_std": 0.3181522488594055, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.4627264142036438, "reward_near_duplicate_penalty_std": 0.22879651188850403, "reward_opening_diversity_mean": 0.8230406641960144, "reward_opening_diversity_std": 0.08088110387325287, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.11249999701976776, "reward_judge_quality_std": 0.051754921674728394, "reward_total_composite_mean": 0.0841808170080185, "reward_total_composite_std": 0.04921037703752518} {"timestamp_utc": "2026-04-12T13:38:42Z", "mode": "train", "global_step": 724, "epoch": 0.029079808812306703, "loss": -0.0415, "grad_norm": 3.912525177001953, "learning_rate": 7.80909090909091e-06, "num_tokens": 1471331.0, "completions/mean_length": 285.125, "completions/min_length": 256.0, "completions/max_length": 309.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 285.125, "completions/min_terminated_length": 256.0, "completions/max_terminated_length": 309.0, "rewards/meter/mean": 0.9829435348510742, "rewards/meter/std": 0.03629862517118454, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.06332159042358398, "rewards/repeat_penalty/std": 0.046767961233854294, "rewards/near_duplicate_penalty/mean": 0.7141451835632324, "rewards/near_duplicate_penalty/std": 0.020828045904636383, "rewards/opening_diversity/mean": 0.8824776411056519, "rewards/opening_diversity/std": 0.11834309995174408, "rewards/distinct_2/mean": 0.15145601332187653, "rewards/distinct_2/std": 0.10429301112890244, "rewards/total_composite/mean": 0.1381019502878189, "rewards/total_composite/std": 0.00931702833622694, "reward": 0.1381019502878189, "reward_std": 0.009317024610936642, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06171497702598572, "sampling/sampling_logp_difference/max": 1.7601337432861328, "sampling/importance_sampling_ratio/min": 0.17202186584472656, "sampling/importance_sampling_ratio/mean": 1.002913475036621, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.34784314036369324, "clip_ratio/low_mean": 0.03085204283706844, "clip_ratio/low_min": 0.03085204283706844, "clip_ratio/high_mean": 0.024414620827883482, "clip_ratio/high_max": 0.024414620827883482, "clip_ratio/region_mean": 0.05526666366495192, "reward_total_mean": 0.1381019502878189, "reward_meter_mean": 0.9829435348510742, "reward_meter_std": 0.03629862517118454, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.06332159042358398, "reward_repeat_penalty_std": 0.046767961233854294, "reward_near_duplicate_penalty_mean": 0.7141451835632324, "reward_near_duplicate_penalty_std": 0.020828045904636383, "reward_opening_diversity_mean": 0.8824776411056519, "reward_opening_diversity_std": 0.11834309995174408, "reward_distinct_2_mean": 0.15145601332187653, "reward_distinct_2_std": 0.10429301112890244, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.1381019502878189, "reward_total_composite_std": 0.00931702833622694} {"timestamp_utc": "2026-04-12T13:38:50Z", "mode": "train", "global_step": 725, "epoch": 0.029119974294091657, "loss": 0.0044, "grad_norm": 13.008666038513184, "learning_rate": 7.806060606060607e-06, "num_tokens": 1473120.0, "completions/mean_length": 56.625, "completions/min_length": 42.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.625, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.7698050141334534, "rewards/meter/std": 0.18485382199287415, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45500001311302185, "rewards/judge_quality/std": 0.31883716583251953, "rewards/repeat_penalty/mean": 0.7339037656784058, "rewards/repeat_penalty/std": 0.4061550199985504, "rewards/near_duplicate_penalty/mean": 0.8356177806854248, "rewards/near_duplicate_penalty/std": 0.22047339379787445, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.8368016481399536, "rewards/distinct_2/std": 0.30542340874671936, "rewards/total_composite/mean": 0.356789767742157, "rewards/total_composite/std": 0.2745116651058197, "reward": 0.356789767742157, "reward_std": 0.2745116651058197, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13698266446590424, "sampling/sampling_logp_difference/max": 1.2988669872283936, "sampling/importance_sampling_ratio/min": 0.2728407382965088, "sampling/importance_sampling_ratio/mean": 1.0128178596496582, "sampling/importance_sampling_ratio/max": 1.9994455575942993, "entropy": 0.9383715838193893, "clip_ratio/low_mean": 0.05205825716257095, "clip_ratio/low_min": 0.05205825716257095, "clip_ratio/high_mean": 0.07010691985487938, "clip_ratio/high_max": 0.07010691985487938, "clip_ratio/region_mean": 0.12216517701745033, "reward_total_mean": 0.356789767742157, "reward_meter_mean": 0.7698050141334534, "reward_meter_std": 0.18485382199287415, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7339037656784058, "reward_repeat_penalty_std": 0.4061550199985504, "reward_near_duplicate_penalty_mean": 0.8356177806854248, "reward_near_duplicate_penalty_std": 0.22047339379787445, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.8368016481399536, "reward_distinct_2_std": 0.30542340874671936, "reward_judge_quality_mean": 0.45500001311302185, "reward_judge_quality_std": 0.31883716583251953, "reward_total_composite_mean": 0.356789767742157, "reward_total_composite_std": 0.2745116651058197} {"timestamp_utc": "2026-04-12T13:39:09Z", "mode": "train", "global_step": 726, "epoch": 0.02916013977587661, "loss": -0.1141, "grad_norm": 5.9563727378845215, "learning_rate": 7.803030303030303e-06, "num_tokens": 1475176.0, "completions/mean_length": 158.0, "completions/min_length": 97.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 107.42857360839844, "completions/min_terminated_length": 97.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.7789549827575684, "rewards/meter/std": 0.2228599637746811, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9476962089538574, "rewards/lexical_plausibility/std": 0.14793740212917328, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.6963146924972534, "rewards/repeat_penalty/std": 0.2755965292453766, "rewards/near_duplicate_penalty/mean": 0.9046881794929504, "rewards/near_duplicate_penalty/std": 0.0705389678478241, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8293020725250244, "rewards/distinct_2/std": 0.2154710590839386, "rewards/total_composite/mean": 0.16904276609420776, "rewards/total_composite/std": 0.10946167260408401, "reward": 0.16904276609420776, "reward_std": 0.10946167260408401, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12301559001207352, "sampling/sampling_logp_difference/max": 1.5293889045715332, "sampling/importance_sampling_ratio/min": 0.216668039560318, "sampling/importance_sampling_ratio/mean": 1.0064878463745117, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7016413509845734, "clip_ratio/low_mean": 0.06256412249058485, "clip_ratio/low_min": 0.06256412249058485, "clip_ratio/high_mean": 0.059111873619258404, "clip_ratio/high_max": 0.059111873619258404, "clip_ratio/region_mean": 0.12167599610984325, "reward_total_mean": 0.16904276609420776, "reward_meter_mean": 0.7789549827575684, "reward_meter_std": 0.2228599637746811, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9476962089538574, "reward_lexical_plausibility_std": 0.14793740212917328, "reward_repeat_penalty_mean": 0.6963146924972534, "reward_repeat_penalty_std": 0.2755965292453766, "reward_near_duplicate_penalty_mean": 0.9046881794929504, "reward_near_duplicate_penalty_std": 0.0705389678478241, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8293020725250244, "reward_distinct_2_std": 0.2154710590839386, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.16904276609420776, "reward_total_composite_std": 0.10946167260408401} {"timestamp_utc": "2026-04-12T13:39:18Z", "mode": "train", "global_step": 727, "epoch": 0.029200305257661565, "loss": 0.0469, "grad_norm": 9.287501335144043, "learning_rate": 7.800000000000002e-06, "num_tokens": 1476992.0, "completions/mean_length": 87.0, "completions/min_length": 80.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.0, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.8757219910621643, "rewards/meter/std": 0.18546900153160095, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.591644287109375, "rewards/repeat_penalty/std": 0.2018372267484665, "rewards/near_duplicate_penalty/mean": 0.851108729839325, "rewards/near_duplicate_penalty/std": 0.07145041227340698, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6957238912582397, "rewards/distinct_2/std": 0.17266994714736938, "rewards/total_composite/mean": 0.321175754070282, "rewards/total_composite/std": 0.08148026466369629, "reward": 0.321175754070282, "reward_std": 0.08148025721311569, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10866335779428482, "sampling/sampling_logp_difference/max": 1.2884516716003418, "sampling/importance_sampling_ratio/min": 0.2756973206996918, "sampling/importance_sampling_ratio/mean": 1.0034369230270386, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6825176067650318, "clip_ratio/low_mean": 0.035490380600094795, "clip_ratio/low_min": 0.035490380600094795, "clip_ratio/high_mean": 0.054789694491773844, "clip_ratio/high_max": 0.054789694491773844, "clip_ratio/region_mean": 0.09028007509186864, "reward_total_mean": 0.321175754070282, "reward_meter_mean": 0.8757219910621643, "reward_meter_std": 0.18546900153160095, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.591644287109375, "reward_repeat_penalty_std": 0.2018372267484665, "reward_near_duplicate_penalty_mean": 0.851108729839325, "reward_near_duplicate_penalty_std": 0.07145041227340698, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6957238912582397, "reward_distinct_2_std": 0.17266994714736938, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.321175754070282, "reward_total_composite_std": 0.08148026466369629} {"timestamp_utc": "2026-04-12T13:39:30Z", "mode": "train", "global_step": 728, "epoch": 0.02924047073944652, "loss": 0.0458, "grad_norm": 2.824350357055664, "learning_rate": 7.796969696969697e-06, "num_tokens": 1481540.0, "completions/mean_length": 351.5, "completions/min_length": 289.0, "completions/max_length": 387.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 351.5, "completions/min_terminated_length": 289.0, "completions/max_terminated_length": 387.0, "rewards/meter/mean": 0.9427692294120789, "rewards/meter/std": 0.10438236594200134, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.5373981595039368, "rewards/near_duplicate_penalty/std": 0.15793682634830475, "rewards/opening_diversity/mean": 0.7524038553237915, "rewards/opening_diversity/std": 0.26054221391677856, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12963077425956726, "rewards/total_composite/std": 0.014352576807141304, "reward": 0.12963077425956726, "reward_std": 0.014352577738463879, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.042539581656455994, "sampling/sampling_logp_difference/max": 2.898378372192383, "sampling/importance_sampling_ratio/min": 0.05511251837015152, "sampling/importance_sampling_ratio/mean": 1.002425193786621, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.24230213835835457, "clip_ratio/low_mean": 0.003552971640601754, "clip_ratio/low_min": 0.003552971640601754, "clip_ratio/high_mean": 0.03891419293358922, "clip_ratio/high_max": 0.03891419293358922, "clip_ratio/region_mean": 0.042467164574190974, "reward_total_mean": 0.12963077425956726, "reward_meter_mean": 0.9427692294120789, "reward_meter_std": 0.10438236594200134, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.5373981595039368, "reward_near_duplicate_penalty_std": 0.15793682634830475, "reward_opening_diversity_mean": 0.7524038553237915, "reward_opening_diversity_std": 0.26054221391677856, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.12963077425956726, "reward_total_composite_std": 0.014352576807141304} {"timestamp_utc": "2026-04-12T13:39:40Z", "mode": "train", "global_step": 729, "epoch": 0.029280636221231473, "loss": 0.0559, "grad_norm": 9.724015235900879, "learning_rate": 7.793939393939394e-06, "num_tokens": 1483306.0, "completions/mean_length": 64.75, "completions/min_length": 55.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.75, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.6329939961433411, "rewards/meter/std": 0.40112221240997314, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9887152910232544, "rewards/lexical_plausibility/std": 0.022863244637846947, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9505146145820618, "rewards/repeat_penalty/std": 0.05243025720119476, "rewards/near_duplicate_penalty/mean": 0.958681046962738, "rewards/near_duplicate_penalty/std": 0.031088965013623238, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.2747950553894043, "rewards/total_composite/std": 0.20810966193675995, "reward": 0.2747950553894043, "reward_std": 0.20810966193675995, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12471278756856918, "sampling/sampling_logp_difference/max": 1.5095486640930176, "sampling/importance_sampling_ratio/min": 0.22100970149040222, "sampling/importance_sampling_ratio/mean": 0.9938512444496155, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7396027520298958, "clip_ratio/low_mean": 0.06559466850012541, "clip_ratio/low_min": 0.06559466850012541, "clip_ratio/high_mean": 0.07234858348965645, "clip_ratio/high_max": 0.07234858348965645, "clip_ratio/region_mean": 0.13794325198978186, "reward_total_mean": 0.2747950553894043, "reward_meter_mean": 0.6329939961433411, "reward_meter_std": 0.40112221240997314, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9887152910232544, "reward_lexical_plausibility_std": 0.022863244637846947, "reward_repeat_penalty_mean": 0.9505146145820618, "reward_repeat_penalty_std": 0.05243025720119476, "reward_near_duplicate_penalty_mean": 0.958681046962738, "reward_near_duplicate_penalty_std": 0.031088965013623238, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.2747950553894043, "reward_total_composite_std": 0.20810966193675995} {"timestamp_utc": "2026-04-12T13:39:53Z", "mode": "train", "global_step": 730, "epoch": 0.029320801703016427, "loss": -0.0786, "grad_norm": 5.605185508728027, "learning_rate": 7.790909090909092e-06, "num_tokens": 1485100.0, "completions/mean_length": 123.25, "completions/min_length": 63.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 67.71428680419922, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.8206631541252136, "rewards/meter/std": 0.31621938943862915, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9593336582183838, "rewards/lexical_plausibility/std": 0.1150217279791832, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7912750840187073, "rewards/repeat_penalty/std": 0.15527135133743286, "rewards/near_duplicate_penalty/mean": 0.8862694501876831, "rewards/near_duplicate_penalty/std": 0.10902401059865952, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9205746054649353, "rewards/distinct_2/std": 0.10719934105873108, "rewards/total_composite/mean": 0.19626164436340332, "rewards/total_composite/std": 0.16432058811187744, "reward": 0.19626164436340332, "reward_std": 0.16432060301303864, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1414690613746643, "sampling/sampling_logp_difference/max": 1.495701789855957, "sampling/importance_sampling_ratio/min": 0.2240912914276123, "sampling/importance_sampling_ratio/mean": 1.0162965059280396, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9366847649216652, "clip_ratio/low_mean": 0.06019270699471235, "clip_ratio/low_min": 0.06019270699471235, "clip_ratio/high_mean": 0.054251277819275856, "clip_ratio/high_max": 0.054251277819275856, "clip_ratio/region_mean": 0.11444398481398821, "reward_total_mean": 0.19626164436340332, "reward_meter_mean": 0.8206631541252136, "reward_meter_std": 0.31621938943862915, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9593336582183838, "reward_lexical_plausibility_std": 0.1150217279791832, "reward_repeat_penalty_mean": 0.7912750840187073, "reward_repeat_penalty_std": 0.15527135133743286, "reward_near_duplicate_penalty_mean": 0.8862694501876831, "reward_near_duplicate_penalty_std": 0.10902401059865952, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9205746054649353, "reward_distinct_2_std": 0.10719934105873108, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.19626164436340332, "reward_total_composite_std": 0.16432058811187744} {"timestamp_utc": "2026-04-12T13:40:06Z", "mode": "train", "global_step": 731, "epoch": 0.02936096718480138, "loss": 0.0416, "grad_norm": 7.710301876068115, "learning_rate": 7.787878787878789e-06, "num_tokens": 1488440.0, "completions/mean_length": 221.5, "completions/min_length": 175.0, "completions/max_length": 271.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 221.5, "completions/min_terminated_length": 175.0, "completions/max_terminated_length": 271.0, "rewards/meter/mean": 0.10196677595376968, "rewards/meter/std": 0.04718315228819847, "rewards/count_adherence/mean": 0.9722222089767456, "rewards/count_adherence/std": 0.05143444985151291, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.5570678114891052, "rewards/repeat_penalty/std": 0.3314151465892792, "rewards/near_duplicate_penalty/mean": 0.9116718173027039, "rewards/near_duplicate_penalty/std": 0.06395211815834045, "rewards/opening_diversity/mean": 0.9791666269302368, "rewards/opening_diversity/std": 0.0589255727827549, "rewards/distinct_2/mean": 0.6194050312042236, "rewards/distinct_2/std": 0.32400867342948914, "rewards/total_composite/mean": 0.028781307861208916, "rewards/total_composite/std": 0.017596958205103874, "reward": 0.028781307861208916, "reward_std": 0.017596958205103874, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13785415887832642, "sampling/sampling_logp_difference/max": 3.0727105140686035, "sampling/importance_sampling_ratio/min": 0.04629550129175186, "sampling/importance_sampling_ratio/mean": 1.001731514930725, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5883641839027405, "clip_ratio/low_mean": 0.053245002403855324, "clip_ratio/low_min": 0.053245002403855324, "clip_ratio/high_mean": 0.07681099325418472, "clip_ratio/high_max": 0.07681099325418472, "clip_ratio/region_mean": 0.13005599565804005, "reward_total_mean": 0.028781307861208916, "reward_meter_mean": 0.10196677595376968, "reward_meter_std": 0.04718315228819847, "reward_count_adherence_mean": 0.9722222089767456, "reward_count_adherence_std": 0.05143444985151291, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.5570678114891052, "reward_repeat_penalty_std": 0.3314151465892792, "reward_near_duplicate_penalty_mean": 0.9116718173027039, "reward_near_duplicate_penalty_std": 0.06395211815834045, "reward_opening_diversity_mean": 0.9791666269302368, "reward_opening_diversity_std": 0.0589255727827549, "reward_distinct_2_mean": 0.6194050312042236, "reward_distinct_2_std": 0.32400867342948914, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.028781307861208916, "reward_total_composite_std": 0.017596958205103874} {"timestamp_utc": "2026-04-12T13:40:20Z", "mode": "train", "global_step": 732, "epoch": 0.029401132666586335, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.784848484848484e-06, "num_tokens": 1490208.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.9092035293579102, "rewards/meter/std": 0.12226000428199768, "rewards/count_adherence/mean": 0.9416667222976685, "rewards/count_adherence/std": 0.055634863674640656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.4080020487308502, "rewards/near_duplicate_penalty/std": 0.14329348504543304, "rewards/opening_diversity/mean": 0.40406736731529236, "rewards/opening_diversity/std": 0.3218400180339813, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14159801602363586, "rewards/total_composite/std": 0.0483369454741478, "reward": 0.14159801602363586, "reward_std": 0.0483369380235672, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.14159801602363586, "reward_meter_mean": 0.9092035293579102, "reward_meter_std": 0.12226000428199768, "reward_count_adherence_mean": 0.9416667222976685, "reward_count_adherence_std": 0.055634863674640656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.4080020487308502, "reward_near_duplicate_penalty_std": 0.14329348504543304, "reward_opening_diversity_mean": 0.40406736731529236, "reward_opening_diversity_std": 0.3218400180339813, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.14159801602363586, "reward_total_composite_std": 0.0483369454741478} {"timestamp_utc": "2026-04-12T13:40:33Z", "mode": "train", "global_step": 733, "epoch": 0.02944129814837129, "loss": -0.0322, "grad_norm": 4.360764026641846, "learning_rate": 7.781818181818183e-06, "num_tokens": 1491859.0, "completions/mean_length": 114.375, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.57143020629883, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.34302258491516113, "rewards/meter/std": 0.38519468903541565, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9680602550506592, "rewards/lexical_plausibility/std": 0.0903393030166626, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24720942974090576, "rewards/repeat_penalty/mean": 0.9549835324287415, "rewards/repeat_penalty/std": 0.024268770590424538, "rewards/near_duplicate_penalty/mean": 0.9633446931838989, "rewards/near_duplicate_penalty/std": 0.02702270820736885, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.1877245455980301, "rewards/total_composite/std": 0.28656256198883057, "reward": 0.1877245455980301, "reward_std": 0.2865625321865082, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14744533598423004, "sampling/sampling_logp_difference/max": 1.5596216917037964, "sampling/importance_sampling_ratio/min": 0.21021558344364166, "sampling/importance_sampling_ratio/mean": 1.0043463706970215, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7598854750394821, "clip_ratio/low_mean": 0.07134541124105453, "clip_ratio/low_min": 0.07134541124105453, "clip_ratio/high_mean": 0.04065604880452156, "clip_ratio/high_max": 0.04065604880452156, "clip_ratio/region_mean": 0.1120014600455761, "reward_total_mean": 0.1877245455980301, "reward_meter_mean": 0.34302258491516113, "reward_meter_std": 0.38519468903541565, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9680602550506592, "reward_lexical_plausibility_std": 0.0903393030166626, "reward_repeat_penalty_mean": 0.9549835324287415, "reward_repeat_penalty_std": 0.024268770590424538, "reward_near_duplicate_penalty_mean": 0.9633446931838989, "reward_near_duplicate_penalty_std": 0.02702270820736885, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24720942974090576, "reward_total_composite_mean": 0.1877245455980301, "reward_total_composite_std": 0.28656256198883057} {"timestamp_utc": "2026-04-12T13:40:44Z", "mode": "train", "global_step": 734, "epoch": 0.029481463630156243, "loss": 0.0548, "grad_norm": 8.31116771697998, "learning_rate": 7.778787878787879e-06, "num_tokens": 1494187.0, "completions/mean_length": 111.0, "completions/min_length": 105.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 111.0, "completions/min_terminated_length": 105.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.46877217292785645, "rewards/meter/std": 0.310110479593277, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9315893650054932, "rewards/repeat_penalty/std": 0.04466979578137398, "rewards/near_duplicate_penalty/mean": 0.96294766664505, "rewards/near_duplicate_penalty/std": 0.014908126555383205, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9673303961753845, "rewards/distinct_2/std": 0.04152150824666023, "rewards/total_composite/mean": 0.14507833123207092, "rewards/total_composite/std": 0.09024951606988907, "reward": 0.14507833123207092, "reward_std": 0.09024950861930847, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15470179915428162, "sampling/sampling_logp_difference/max": 1.543485164642334, "sampling/importance_sampling_ratio/min": 0.21363525092601776, "sampling/importance_sampling_ratio/mean": 1.0147583484649658, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.055388405919075, "clip_ratio/low_mean": 0.11407650262117386, "clip_ratio/low_min": 0.11407650262117386, "clip_ratio/high_mean": 0.05670710653066635, "clip_ratio/high_max": 0.05670710653066635, "clip_ratio/region_mean": 0.1707836091518402, "reward_total_mean": 0.14507833123207092, "reward_meter_mean": 0.46877217292785645, "reward_meter_std": 0.310110479593277, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9315893650054932, "reward_repeat_penalty_std": 0.04466979578137398, "reward_near_duplicate_penalty_mean": 0.96294766664505, "reward_near_duplicate_penalty_std": 0.014908126555383205, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9673303961753845, "reward_distinct_2_std": 0.04152150824666023, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.14507833123207092, "reward_total_composite_std": 0.09024951606988907} {"timestamp_utc": "2026-04-12T13:40:52Z", "mode": "train", "global_step": 735, "epoch": 0.029521629111941197, "loss": 0.0235, "grad_norm": 12.950492858886719, "learning_rate": 7.775757575757576e-06, "num_tokens": 1495778.0, "completions/mean_length": 55.875, "completions/min_length": 49.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.875, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.4620858430862427, "rewards/meter/std": 0.34902605414390564, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9603580236434937, "rewards/repeat_penalty/std": 0.038065437227487564, "rewards/near_duplicate_penalty/mean": 0.9695494174957275, "rewards/near_duplicate_penalty/std": 0.0220591202378273, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.20319171249866486, "rewards/total_composite/std": 0.1373760998249054, "reward": 0.20319171249866486, "reward_std": 0.1373760998249054, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11961657553911209, "sampling/sampling_logp_difference/max": 2.7539987564086914, "sampling/importance_sampling_ratio/min": 0.063672736287117, "sampling/importance_sampling_ratio/mean": 0.988656222820282, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5491676367819309, "clip_ratio/low_mean": 0.06995941046625376, "clip_ratio/low_min": 0.06995941046625376, "clip_ratio/high_mean": 0.06452045869082212, "clip_ratio/high_max": 0.06452045869082212, "clip_ratio/region_mean": 0.13447986915707588, "reward_total_mean": 0.20319171249866486, "reward_meter_mean": 0.4620858430862427, "reward_meter_std": 0.34902605414390564, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9603580236434937, "reward_repeat_penalty_std": 0.038065437227487564, "reward_near_duplicate_penalty_mean": 0.9695494174957275, "reward_near_duplicate_penalty_std": 0.0220591202378273, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.20319171249866486, "reward_total_composite_std": 0.1373760998249054} {"timestamp_utc": "2026-04-12T13:41:00Z", "mode": "train", "global_step": 736, "epoch": 0.02956179459372615, "loss": 0.0482, "grad_norm": 10.444803237915039, "learning_rate": 7.772727272727273e-06, "num_tokens": 1497539.0, "completions/mean_length": 64.125, "completions/min_length": 54.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.125, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.7315667271614075, "rewards/meter/std": 0.4078596532344818, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.12817399203777313, "rewards/repeat_penalty/mean": 0.8645095825195312, "rewards/repeat_penalty/std": 0.11634694784879684, "rewards/near_duplicate_penalty/mean": 0.9057682752609253, "rewards/near_duplicate_penalty/std": 0.03879751265048981, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9816433191299438, "rewards/distinct_2/std": 0.03404124453663826, "rewards/total_composite/mean": 0.25247079133987427, "rewards/total_composite/std": 0.17357505857944489, "reward": 0.25247079133987427, "reward_std": 0.17357505857944489, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11564142256975174, "sampling/sampling_logp_difference/max": 1.4629422426223755, "sampling/importance_sampling_ratio/min": 0.23155400156974792, "sampling/importance_sampling_ratio/mean": 1.0199613571166992, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8684811964631081, "clip_ratio/low_mean": 0.05177712859585881, "clip_ratio/low_min": 0.05177712859585881, "clip_ratio/high_mean": 0.06499020010232925, "clip_ratio/high_max": 0.06499020010232925, "clip_ratio/region_mean": 0.11676732869818807, "reward_total_mean": 0.25247079133987427, "reward_meter_mean": 0.7315667271614075, "reward_meter_std": 0.4078596532344818, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8645095825195312, "reward_repeat_penalty_std": 0.11634694784879684, "reward_near_duplicate_penalty_mean": 0.9057682752609253, "reward_near_duplicate_penalty_std": 0.03879751265048981, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9816433191299438, "reward_distinct_2_std": 0.03404124453663826, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.12817399203777313, "reward_total_composite_mean": 0.25247079133987427, "reward_total_composite_std": 0.17357505857944489} {"timestamp_utc": "2026-04-12T13:41:13Z", "mode": "train", "global_step": 737, "epoch": 0.029601960075511104, "loss": 0.0169, "grad_norm": 3.542360305786133, "learning_rate": 7.76969696969697e-06, "num_tokens": 1499875.0, "completions/mean_length": 205.0, "completions/min_length": 124.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 161.1428680419922, "completions/min_terminated_length": 124.0, "completions/max_terminated_length": 180.0, "rewards/meter/mean": 0.7619812488555908, "rewards/meter/std": 0.34506988525390625, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9356280565261841, "rewards/lexical_plausibility/std": 0.18207144737243652, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.3434876799583435, "rewards/repeat_penalty/std": 0.33749091625213623, "rewards/near_duplicate_penalty/mean": 0.7329788208007812, "rewards/near_duplicate_penalty/std": 0.14577917754650116, "rewards/opening_diversity/mean": 0.856249988079071, "rewards/opening_diversity/std": 0.09425459057092667, "rewards/distinct_2/mean": 0.4798237085342407, "rewards/distinct_2/std": 0.38824746012687683, "rewards/total_composite/mean": 0.11812707781791687, "rewards/total_composite/std": 0.09984802454710007, "reward": 0.11812707781791687, "reward_std": 0.09984802454710007, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0892452746629715, "sampling/sampling_logp_difference/max": 1.3417530059814453, "sampling/importance_sampling_ratio/min": 0.26138705015182495, "sampling/importance_sampling_ratio/mean": 1.0022655725479126, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5627057887613773, "clip_ratio/low_mean": 0.05400221236050129, "clip_ratio/low_min": 0.05400221236050129, "clip_ratio/high_mean": 0.016129031777381897, "clip_ratio/high_max": 0.016129031777381897, "clip_ratio/region_mean": 0.07013124413788319, "reward_total_mean": 0.11812707781791687, "reward_meter_mean": 0.7619812488555908, "reward_meter_std": 0.34506988525390625, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9356280565261841, "reward_lexical_plausibility_std": 0.18207144737243652, "reward_repeat_penalty_mean": 0.3434876799583435, "reward_repeat_penalty_std": 0.33749091625213623, "reward_near_duplicate_penalty_mean": 0.7329788208007812, "reward_near_duplicate_penalty_std": 0.14577917754650116, "reward_opening_diversity_mean": 0.856249988079071, "reward_opening_diversity_std": 0.09425459057092667, "reward_distinct_2_mean": 0.4798237085342407, "reward_distinct_2_std": 0.38824746012687683, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.11812707781791687, "reward_total_composite_std": 0.09984802454710007} {"timestamp_utc": "2026-04-12T13:41:27Z", "mode": "train", "global_step": 738, "epoch": 0.02964212555729606, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.766666666666666e-06, "num_tokens": 1501499.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.8967434763908386, "rewards/meter/std": 0.18547113239765167, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.09155285358428955, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.996417760848999, "rewards/lexical_plausibility/std": 0.010131997056305408, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.003861095989122987, "rewards/repeat_penalty/std": 0.010920829139649868, "rewards/near_duplicate_penalty/mean": 0.5388668775558472, "rewards/near_duplicate_penalty/std": 0.19304721057415009, "rewards/opening_diversity/mean": 0.7080065011978149, "rewards/opening_diversity/std": 0.2737760841846466, "rewards/distinct_2/mean": 0.006916329264640808, "rewards/distinct_2/std": 0.019562333822250366, "rewards/total_composite/mean": 0.11902313679456711, "rewards/total_composite/std": 0.031959667801856995, "reward": 0.11902313679456711, "reward_std": 0.031959664076566696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.11902313679456711, "reward_meter_mean": 0.8967434763908386, "reward_meter_std": 0.18547113239765167, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.09155285358428955, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.996417760848999, "reward_lexical_plausibility_std": 0.010131997056305408, "reward_repeat_penalty_mean": 0.003861095989122987, "reward_repeat_penalty_std": 0.010920829139649868, "reward_near_duplicate_penalty_mean": 0.5388668775558472, "reward_near_duplicate_penalty_std": 0.19304721057415009, "reward_opening_diversity_mean": 0.7080065011978149, "reward_opening_diversity_std": 0.2737760841846466, "reward_distinct_2_mean": 0.006916329264640808, "reward_distinct_2_std": 0.019562333822250366, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.11902313679456711, "reward_total_composite_std": 0.031959667801856995} {"timestamp_utc": "2026-04-12T13:41:39Z", "mode": "train", "global_step": 739, "epoch": 0.029682291039081012, "loss": -0.0003, "grad_norm": 4.201359748840332, "learning_rate": 7.763636363636364e-06, "num_tokens": 1505185.0, "completions/mean_length": 280.75, "completions/min_length": 250.0, "completions/max_length": 320.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 280.75, "completions/min_terminated_length": 250.0, "completions/max_terminated_length": 320.0, "rewards/meter/mean": 0.7154779434204102, "rewards/meter/std": 0.4361130893230438, "rewards/count_adherence/mean": 0.9861111044883728, "rewards/count_adherence/std": 0.03928370773792267, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22500000894069672, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.040792446583509445, "rewards/repeat_penalty/std": 0.056984249502420425, "rewards/near_duplicate_penalty/mean": 0.471712589263916, "rewards/near_duplicate_penalty/std": 0.19876046478748322, "rewards/opening_diversity/mean": 0.7401316165924072, "rewards/opening_diversity/std": 0.2737102210521698, "rewards/distinct_2/mean": 0.10464771836996078, "rewards/distinct_2/std": 0.14465248584747314, "rewards/total_composite/mean": 0.13055403530597687, "rewards/total_composite/std": 0.10409002006053925, "reward": 0.13055403530597687, "reward_std": 0.10409002006053925, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05282207950949669, "sampling/sampling_logp_difference/max": 1.8779902458190918, "sampling/importance_sampling_ratio/min": 0.15289708971977234, "sampling/importance_sampling_ratio/mean": 1.0042352676391602, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.29088243283331394, "clip_ratio/low_mean": 0.022267282009124756, "clip_ratio/low_min": 0.022267282009124756, "clip_ratio/high_mean": 0.02629257389344275, "clip_ratio/high_max": 0.02629257389344275, "clip_ratio/region_mean": 0.048559855902567506, "reward_total_mean": 0.13055403530597687, "reward_meter_mean": 0.7154779434204102, "reward_meter_std": 0.4361130893230438, "reward_count_adherence_mean": 0.9861111044883728, "reward_count_adherence_std": 0.03928370773792267, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.040792446583509445, "reward_repeat_penalty_std": 0.056984249502420425, "reward_near_duplicate_penalty_mean": 0.471712589263916, "reward_near_duplicate_penalty_std": 0.19876046478748322, "reward_opening_diversity_mean": 0.7401316165924072, "reward_opening_diversity_std": 0.2737102210521698, "reward_distinct_2_mean": 0.10464771836996078, "reward_distinct_2_std": 0.14465248584747314, "reward_judge_quality_mean": 0.22500000894069672, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.13055403530597687, "reward_total_composite_std": 0.10409002006053925} {"timestamp_utc": "2026-04-12T13:41:53Z", "mode": "train", "global_step": 740, "epoch": 0.029722456520865966, "loss": -0.1977, "grad_norm": 2.4809043407440186, "learning_rate": 7.76060606060606e-06, "num_tokens": 1507258.0, "completions/mean_length": 272.125, "completions/min_length": 110.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 128.1999969482422, "completions/min_terminated_length": 110.0, "completions/max_terminated_length": 155.0, "rewards/meter/mean": 0.8252730369567871, "rewards/meter/std": 0.2637774348258972, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8784559965133667, "rewards/lexical_plausibility/std": 0.17994637787342072, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.9217922687530518, "rewards/repeat_penalty/std": 0.07210688292980194, "rewards/near_duplicate_penalty/mean": 0.9669778943061829, "rewards/near_duplicate_penalty/std": 0.02374645136296749, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9525356888771057, "rewards/distinct_2/std": 0.05886922776699066, "rewards/total_composite/mean": 0.21614933013916016, "rewards/total_composite/std": 0.1745433509349823, "reward": 0.21614933013916016, "reward_std": 0.1745433360338211, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12845279276371002, "sampling/sampling_logp_difference/max": 1.1226415634155273, "sampling/importance_sampling_ratio/min": 0.32541903853416443, "sampling/importance_sampling_ratio/mean": 1.0235168933868408, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7834031879901886, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.09019136149436235, "clip_ratio/high_max": 0.09019136149436235, "clip_ratio/region_mean": 0.09019136149436235, "reward_total_mean": 0.21614933013916016, "reward_meter_mean": 0.8252730369567871, "reward_meter_std": 0.2637774348258972, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8784559965133667, "reward_lexical_plausibility_std": 0.17994637787342072, "reward_repeat_penalty_mean": 0.9217922687530518, "reward_repeat_penalty_std": 0.07210688292980194, "reward_near_duplicate_penalty_mean": 0.9669778943061829, "reward_near_duplicate_penalty_std": 0.02374645136296749, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9525356888771057, "reward_distinct_2_std": 0.05886922776699066, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.21614933013916016, "reward_total_composite_std": 0.1745433509349823} {"timestamp_utc": "2026-04-12T13:42:06Z", "mode": "train", "global_step": 741, "epoch": 0.02976262200265092, "loss": -0.0781, "grad_norm": 3.3963463306427, "learning_rate": 7.757575757575758e-06, "num_tokens": 1509167.0, "completions/mean_length": 195.625, "completions/min_length": 82.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 90.16667175292969, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.4642590284347534, "rewards/meter/std": 0.3871473968029022, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8788434863090515, "rewards/lexical_plausibility/std": 0.1749013513326645, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.9139944314956665, "rewards/repeat_penalty/std": 0.08927091956138611, "rewards/near_duplicate_penalty/mean": 0.962729275226593, "rewards/near_duplicate_penalty/std": 0.03199862316250801, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9479074478149414, "rewards/distinct_2/std": 0.06861712038516998, "rewards/total_composite/mean": 0.11039489507675171, "rewards/total_composite/std": 0.12055056542158127, "reward": 0.11039489507675171, "reward_std": 0.12055056542158127, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11214577406644821, "sampling/sampling_logp_difference/max": 2.559469699859619, "sampling/importance_sampling_ratio/min": 0.07734574377536774, "sampling/importance_sampling_ratio/mean": 1.0267283916473389, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.49914003163576126, "clip_ratio/low_mean": 0.03309566364623606, "clip_ratio/low_min": 0.03309566364623606, "clip_ratio/high_mean": 0.042008678428828716, "clip_ratio/high_max": 0.042008678428828716, "clip_ratio/region_mean": 0.07510434207506478, "reward_total_mean": 0.11039489507675171, "reward_meter_mean": 0.4642590284347534, "reward_meter_std": 0.3871473968029022, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8788434863090515, "reward_lexical_plausibility_std": 0.1749013513326645, "reward_repeat_penalty_mean": 0.9139944314956665, "reward_repeat_penalty_std": 0.08927091956138611, "reward_near_duplicate_penalty_mean": 0.962729275226593, "reward_near_duplicate_penalty_std": 0.03199862316250801, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9479074478149414, "reward_distinct_2_std": 0.06861712038516998, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.11039489507675171, "reward_total_composite_std": 0.12055056542158127} {"timestamp_utc": "2026-04-12T13:42:19Z", "mode": "train", "global_step": 742, "epoch": 0.029802787484435874, "loss": -0.1242, "grad_norm": 4.418141841888428, "learning_rate": 7.754545454545455e-06, "num_tokens": 1511395.0, "completions/mean_length": 172.5, "completions/min_length": 119.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 124.00000762939453, "completions/min_terminated_length": 119.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.783625602722168, "rewards/meter/std": 0.3340771794319153, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9600352048873901, "rewards/lexical_plausibility/std": 0.11303751915693283, "rewards/judge_quality/mean": 0.2562500238418579, "rewards/judge_quality/std": 0.13741880655288696, "rewards/repeat_penalty/mean": 0.6281116008758545, "rewards/repeat_penalty/std": 0.3001388907432556, "rewards/near_duplicate_penalty/mean": 0.8636089563369751, "rewards/near_duplicate_penalty/std": 0.10903690755367279, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1530931144952774, "rewards/distinct_2/mean": 0.7256183624267578, "rewards/distinct_2/std": 0.26374635100364685, "rewards/total_composite/mean": 0.21634042263031006, "rewards/total_composite/std": 0.13507242500782013, "reward": 0.21634042263031006, "reward_std": 0.13507241010665894, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1075095534324646, "sampling/sampling_logp_difference/max": 1.510689616203308, "sampling/importance_sampling_ratio/min": 0.22075767815113068, "sampling/importance_sampling_ratio/mean": 1.0034854412078857, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6330233700573444, "clip_ratio/low_mean": 0.0325851459056139, "clip_ratio/low_min": 0.0325851459056139, "clip_ratio/high_mean": 0.06569452211260796, "clip_ratio/high_max": 0.06569452211260796, "clip_ratio/region_mean": 0.09827966801822186, "reward_total_mean": 0.21634042263031006, "reward_meter_mean": 0.783625602722168, "reward_meter_std": 0.3340771794319153, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9600352048873901, "reward_lexical_plausibility_std": 0.11303751915693283, "reward_repeat_penalty_mean": 0.6281116008758545, "reward_repeat_penalty_std": 0.3001388907432556, "reward_near_duplicate_penalty_mean": 0.8636089563369751, "reward_near_duplicate_penalty_std": 0.10903690755367279, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1530931144952774, "reward_distinct_2_mean": 0.7256183624267578, "reward_distinct_2_std": 0.26374635100364685, "reward_judge_quality_mean": 0.2562500238418579, "reward_judge_quality_std": 0.13741880655288696, "reward_total_composite_mean": 0.21634042263031006, "reward_total_composite_std": 0.13507242500782013} {"timestamp_utc": "2026-04-12T13:42:33Z", "mode": "train", "global_step": 743, "epoch": 0.02984295296622083, "loss": -0.0985, "grad_norm": 1.9212191104888916, "learning_rate": 7.751515151515153e-06, "num_tokens": 1514982.0, "completions/mean_length": 485.375, "completions/min_length": 423.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 458.75, "completions/min_terminated_length": 423.0, "completions/max_terminated_length": 503.0, "rewards/meter/mean": 0.5891445875167847, "rewards/meter/std": 0.4586457908153534, "rewards/count_adherence/mean": 0.759615421295166, "rewards/count_adherence/std": 0.06419406831264496, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.012268980965018272, "rewards/repeat_penalty/std": 0.022723762318491936, "rewards/near_duplicate_penalty/mean": 0.5857747793197632, "rewards/near_duplicate_penalty/std": 0.14130906760692596, "rewards/opening_diversity/mean": 0.7407532334327698, "rewards/opening_diversity/std": 0.27918604016304016, "rewards/distinct_2/mean": 0.023685414344072342, "rewards/distinct_2/std": 0.04385910555720329, "rewards/total_composite/mean": 0.06668651849031448, "rewards/total_composite/std": 0.05276230350136757, "reward": 0.06668651849031448, "reward_std": 0.05276230350136757, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.044047191739082336, "sampling/sampling_logp_difference/max": 2.1677281856536865, "sampling/importance_sampling_ratio/min": 0.11443730443716049, "sampling/importance_sampling_ratio/mean": 1.0064189434051514, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.11544675100594759, "clip_ratio/low_mean": 0.007336343172937632, "clip_ratio/low_min": 0.007336343172937632, "clip_ratio/high_mean": 0.011733844876289368, "clip_ratio/high_max": 0.011733844876289368, "clip_ratio/region_mean": 0.019070188049227, "reward_total_mean": 0.06668651849031448, "reward_meter_mean": 0.5891445875167847, "reward_meter_std": 0.4586457908153534, "reward_count_adherence_mean": 0.759615421295166, "reward_count_adherence_std": 0.06419406831264496, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.012268980965018272, "reward_repeat_penalty_std": 0.022723762318491936, "reward_near_duplicate_penalty_mean": 0.5857747793197632, "reward_near_duplicate_penalty_std": 0.14130906760692596, "reward_opening_diversity_mean": 0.7407532334327698, "reward_opening_diversity_std": 0.27918604016304016, "reward_distinct_2_mean": 0.023685414344072342, "reward_distinct_2_std": 0.04385910555720329, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.06668651849031448, "reward_total_composite_std": 0.05276230350136757} {"timestamp_utc": "2026-04-12T13:42:49Z", "mode": "train", "global_step": 744, "epoch": 0.029883118448005785, "loss": -0.0357, "grad_norm": 5.227776050567627, "learning_rate": 7.74848484848485e-06, "num_tokens": 1516631.0, "completions/mean_length": 111.125, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.85714340209961, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.5472466349601746, "rewards/meter/std": 0.4355945885181427, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9639897346496582, "rewards/lexical_plausibility/std": 0.10185245424509048, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.30677762627601624, "rewards/repeat_penalty/mean": 0.9398870468139648, "rewards/repeat_penalty/std": 0.032975081354379654, "rewards/near_duplicate_penalty/mean": 0.9404217004776001, "rewards/near_duplicate_penalty/std": 0.03266766294836998, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9994224905967712, "rewards/distinct_2/std": 0.001633422332815826, "rewards/total_composite/mean": 0.23873844742774963, "rewards/total_composite/std": 0.278200626373291, "reward": 0.23873844742774963, "reward_std": 0.278200626373291, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1565236896276474, "sampling/sampling_logp_difference/max": 1.5941534042358398, "sampling/importance_sampling_ratio/min": 0.20308038592338562, "sampling/importance_sampling_ratio/mean": 1.0218241214752197, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9597418680787086, "clip_ratio/low_mean": 0.07491765636950731, "clip_ratio/low_min": 0.07491765636950731, "clip_ratio/high_mean": 0.0514801568351686, "clip_ratio/high_max": 0.0514801568351686, "clip_ratio/region_mean": 0.1263978132046759, "reward_total_mean": 0.23873844742774963, "reward_meter_mean": 0.5472466349601746, "reward_meter_std": 0.4355945885181427, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9639897346496582, "reward_lexical_plausibility_std": 0.10185245424509048, "reward_repeat_penalty_mean": 0.9398870468139648, "reward_repeat_penalty_std": 0.032975081354379654, "reward_near_duplicate_penalty_mean": 0.9404217004776001, "reward_near_duplicate_penalty_std": 0.03266766294836998, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9994224905967712, "reward_distinct_2_std": 0.001633422332815826, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.30677762627601624, "reward_total_composite_mean": 0.23873844742774963, "reward_total_composite_std": 0.278200626373291} {"timestamp_utc": "2026-04-12T13:42:57Z", "mode": "train", "global_step": 745, "epoch": 0.02992328392979074, "loss": 0.0391, "grad_norm": 11.293991088867188, "learning_rate": 7.745454545454545e-06, "num_tokens": 1518327.0, "completions/mean_length": 55.0, "completions/min_length": 52.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.0, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.9827555418014526, "rewards/meter/std": 0.016169028356671333, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6000000238418579, "rewards/judge_quality/std": 0.2317017912864685, "rewards/repeat_penalty/mean": 0.9730241298675537, "rewards/repeat_penalty/std": 0.022936878725886345, "rewards/near_duplicate_penalty/mean": 0.9730241298675537, "rewards/near_duplicate_penalty/std": 0.022936878725886345, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5882487297058105, "rewards/total_composite/std": 0.22248080372810364, "reward": 0.5882487297058105, "reward_std": 0.22248077392578125, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12161202728748322, "sampling/sampling_logp_difference/max": 1.2406206130981445, "sampling/importance_sampling_ratio/min": 0.2892046868801117, "sampling/importance_sampling_ratio/mean": 1.0001301765441895, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8677456304430962, "clip_ratio/low_mean": 0.0786271607503295, "clip_ratio/low_min": 0.0786271607503295, "clip_ratio/high_mean": 0.04597964696586132, "clip_ratio/high_max": 0.04597964696586132, "clip_ratio/region_mean": 0.12460680771619081, "reward_total_mean": 0.5882487297058105, "reward_meter_mean": 0.9827555418014526, "reward_meter_std": 0.016169028356671333, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9730241298675537, "reward_repeat_penalty_std": 0.022936878725886345, "reward_near_duplicate_penalty_mean": 0.9730241298675537, "reward_near_duplicate_penalty_std": 0.022936878725886345, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6000000238418579, "reward_judge_quality_std": 0.2317017912864685, "reward_total_composite_mean": 0.5882487297058105, "reward_total_composite_std": 0.22248080372810364} {"timestamp_utc": "2026-04-12T13:43:07Z", "mode": "train", "global_step": 746, "epoch": 0.029963449411575693, "loss": 0.0331, "grad_norm": 6.199829578399658, "learning_rate": 7.742424242424244e-06, "num_tokens": 1521104.0, "completions/mean_length": 157.125, "completions/min_length": 144.0, "completions/max_length": 176.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 157.125, "completions/min_terminated_length": 144.0, "completions/max_terminated_length": 176.0, "rewards/meter/mean": 0.7413284778594971, "rewards/meter/std": 0.38702788949012756, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.7569299936294556, "rewards/repeat_penalty/std": 0.13841694593429565, "rewards/near_duplicate_penalty/mean": 0.9138485789299011, "rewards/near_duplicate_penalty/std": 0.04501912370324135, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.823939859867096, "rewards/distinct_2/std": 0.11312751471996307, "rewards/total_composite/mean": 0.2502559721469879, "rewards/total_composite/std": 0.14552713930606842, "reward": 0.2502559721469879, "reward_std": 0.14552712440490723, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1081324964761734, "sampling/sampling_logp_difference/max": 1.7347493171691895, "sampling/importance_sampling_ratio/min": 0.1764444261789322, "sampling/importance_sampling_ratio/mean": 1.0021672248840332, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5856231823563576, "clip_ratio/low_mean": 0.03457912337034941, "clip_ratio/low_min": 0.03457912337034941, "clip_ratio/high_mean": 0.07685709651559591, "clip_ratio/high_max": 0.07685709651559591, "clip_ratio/region_mean": 0.11143621988594532, "reward_total_mean": 0.2502559721469879, "reward_meter_mean": 0.7413284778594971, "reward_meter_std": 0.38702788949012756, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7569299936294556, "reward_repeat_penalty_std": 0.13841694593429565, "reward_near_duplicate_penalty_mean": 0.9138485789299011, "reward_near_duplicate_penalty_std": 0.04501912370324135, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.823939859867096, "reward_distinct_2_std": 0.11312751471996307, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.2502559721469879, "reward_total_composite_std": 0.14552713930606842} {"timestamp_utc": "2026-04-12T13:43:20Z", "mode": "train", "global_step": 747, "epoch": 0.030003614893360647, "loss": -0.0377, "grad_norm": 2.940369129180908, "learning_rate": 7.73939393939394e-06, "num_tokens": 1522478.0, "completions/mean_length": 152.75, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 33.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.7009673118591309, "rewards/meter/std": 0.4046489894390106, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8916381597518921, "rewards/lexical_plausibility/std": 0.16471542418003082, "rewards/judge_quality/mean": 0.3487499952316284, "rewards/judge_quality/std": 0.36883747577667236, "rewards/repeat_penalty/mean": 0.7422963976860046, "rewards/repeat_penalty/std": 0.1507778763771057, "rewards/near_duplicate_penalty/mean": 0.9631261825561523, "rewards/near_duplicate_penalty/std": 0.10429497063159943, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.2553945779800415, "rewards/total_composite/std": 0.2871827483177185, "reward": 0.2553945779800415, "reward_std": 0.2871827483177185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1165352463722229, "sampling/sampling_logp_difference/max": 0.9058531522750854, "sampling/importance_sampling_ratio/min": 0.40419691801071167, "sampling/importance_sampling_ratio/mean": 1.0442841053009033, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6533161997795105, "clip_ratio/low_mean": 0.03984700050204992, "clip_ratio/low_min": 0.03984700050204992, "clip_ratio/high_mean": 0.05170829128473997, "clip_ratio/high_max": 0.05170829128473997, "clip_ratio/region_mean": 0.0915552917867899, "reward_total_mean": 0.2553945779800415, "reward_meter_mean": 0.7009673118591309, "reward_meter_std": 0.4046489894390106, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8916381597518921, "reward_lexical_plausibility_std": 0.16471542418003082, "reward_repeat_penalty_mean": 0.7422963976860046, "reward_repeat_penalty_std": 0.1507778763771057, "reward_near_duplicate_penalty_mean": 0.9631261825561523, "reward_near_duplicate_penalty_std": 0.10429497063159943, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.3487499952316284, "reward_judge_quality_std": 0.36883747577667236, "reward_total_composite_mean": 0.2553945779800415, "reward_total_composite_std": 0.2871827483177185} {"timestamp_utc": "2026-04-12T13:43:29Z", "mode": "train", "global_step": 748, "epoch": 0.0300437803751456, "loss": -0.0053, "grad_norm": 10.388566017150879, "learning_rate": 7.736363636363637e-06, "num_tokens": 1524163.0, "completions/mean_length": 57.625, "completions/min_length": 49.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.625, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.9111192226409912, "rewards/meter/std": 0.19375477731227875, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9604243040084839, "rewards/repeat_penalty/std": 0.057449083775281906, "rewards/near_duplicate_penalty/mean": 0.9687251448631287, "rewards/near_duplicate_penalty/std": 0.039593104273080826, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.45587459206581116, "rewards/total_composite/std": 0.20374882221221924, "reward": 0.45587459206581116, "reward_std": 0.20374882221221924, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11318694800138474, "sampling/sampling_logp_difference/max": 1.5116311311721802, "sampling/importance_sampling_ratio/min": 0.22054994106292725, "sampling/importance_sampling_ratio/mean": 1.0068858861923218, "sampling/importance_sampling_ratio/max": 1.795382022857666, "entropy": 0.6656927317380905, "clip_ratio/low_mean": 0.077200872823596, "clip_ratio/low_min": 0.077200872823596, "clip_ratio/high_mean": 0.004385964944958687, "clip_ratio/high_max": 0.004385964944958687, "clip_ratio/region_mean": 0.08158683776855469, "reward_total_mean": 0.45587459206581116, "reward_meter_mean": 0.9111192226409912, "reward_meter_std": 0.19375477731227875, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9604243040084839, "reward_repeat_penalty_std": 0.057449083775281906, "reward_near_duplicate_penalty_mean": 0.9687251448631287, "reward_near_duplicate_penalty_std": 0.039593104273080826, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.45587459206581116, "reward_total_composite_std": 0.20374882221221924} {"timestamp_utc": "2026-04-12T13:43:42Z", "mode": "train", "global_step": 749, "epoch": 0.030083945856930555, "loss": -0.0712, "grad_norm": 5.339338302612305, "learning_rate": 7.733333333333334e-06, "num_tokens": 1526061.0, "completions/mean_length": 137.25, "completions/min_length": 77.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 83.71428680419922, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.6527518630027771, "rewards/meter/std": 0.39722979068756104, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.932406485080719, "rewards/lexical_plausibility/std": 0.19118337333202362, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.892428457736969, "rewards/repeat_penalty/std": 0.08709447830915451, "rewards/near_duplicate_penalty/mean": 0.9321856498718262, "rewards/near_duplicate_penalty/std": 0.0488106794655323, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9555417895317078, "rewards/distinct_2/std": 0.05076823756098747, "rewards/total_composite/mean": 0.23975013196468353, "rewards/total_composite/std": 0.1801433563232422, "reward": 0.23975013196468353, "reward_std": 0.1801433563232422, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1256818324327469, "sampling/sampling_logp_difference/max": 1.4742236137390137, "sampling/importance_sampling_ratio/min": 0.2289564162492752, "sampling/importance_sampling_ratio/mean": 1.0139474868774414, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6879321783781052, "clip_ratio/low_mean": 0.029454919509589672, "clip_ratio/low_min": 0.029454919509589672, "clip_ratio/high_mean": 0.0764033542945981, "clip_ratio/high_max": 0.0764033542945981, "clip_ratio/region_mean": 0.10585827380418777, "reward_total_mean": 0.23975013196468353, "reward_meter_mean": 0.6527518630027771, "reward_meter_std": 0.39722979068756104, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.932406485080719, "reward_lexical_plausibility_std": 0.19118337333202362, "reward_repeat_penalty_mean": 0.892428457736969, "reward_repeat_penalty_std": 0.08709447830915451, "reward_near_duplicate_penalty_mean": 0.9321856498718262, "reward_near_duplicate_penalty_std": 0.0488106794655323, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9555417895317078, "reward_distinct_2_std": 0.05076823756098747, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.23975013196468353, "reward_total_composite_std": 0.1801433563232422} {"timestamp_utc": "2026-04-12T13:43:52Z", "mode": "train", "global_step": 750, "epoch": 0.03012411133871551, "loss": 0.0245, "grad_norm": 11.843229293823242, "learning_rate": 7.730303030303032e-06, "num_tokens": 1527911.0, "completions/mean_length": 62.25, "completions/min_length": 58.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.25, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.6764695644378662, "rewards/meter/std": 0.412853866815567, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9623015522956848, "rewards/lexical_plausibility/std": 0.06398618221282959, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9751977324485779, "rewards/repeat_penalty/std": 0.03601844236254692, "rewards/near_duplicate_penalty/mean": 0.9851332306861877, "rewards/near_duplicate_penalty/std": 0.020686792209744453, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.29100680351257324, "rewards/total_composite/std": 0.17981988191604614, "reward": 0.29100680351257324, "reward_std": 0.17981988191604614, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.169460266828537, "sampling/sampling_logp_difference/max": 1.4786615371704102, "sampling/importance_sampling_ratio/min": 0.2279425859451294, "sampling/importance_sampling_ratio/mean": 1.0167688131332397, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0941259264945984, "clip_ratio/low_mean": 0.056163594126701355, "clip_ratio/low_min": 0.056163594126701355, "clip_ratio/high_mean": 0.08973436057567596, "clip_ratio/high_max": 0.08973436057567596, "clip_ratio/region_mean": 0.14589795470237732, "reward_total_mean": 0.29100680351257324, "reward_meter_mean": 0.6764695644378662, "reward_meter_std": 0.412853866815567, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9623015522956848, "reward_lexical_plausibility_std": 0.06398618221282959, "reward_repeat_penalty_mean": 0.9751977324485779, "reward_repeat_penalty_std": 0.03601844236254692, "reward_near_duplicate_penalty_mean": 0.9851332306861877, "reward_near_duplicate_penalty_std": 0.020686792209744453, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.29100680351257324, "reward_total_composite_std": 0.17981988191604614} {"timestamp_utc": "2026-04-12T13:46:15Z", "mode": "eval", "global_step": 750, "epoch": 0.03012411133871551, "eval_loss": NaN, "eval_runtime": 142.9322, "eval_samples_per_second": 0.728, "eval_steps_per_second": 0.091, "eval_num_tokens": 1527911.0, "eval_completions/mean_length": 246.6153846153846, "eval_completions/min_length": 58.38461538461539, "eval_completions/max_length": 482.2307692307692, "eval_completions/clipped_ratio": 0.20192307692307693, "eval_completions/mean_terminated_length": 179.07830106295071, "eval_completions/min_terminated_length": 58.38461538461539, "eval_completions/max_terminated_length": 331.6923076923077, "eval_rewards/meter/mean": 0.5117177183811481, "eval_rewards/meter/std": 0.36041144682810855, "eval_rewards/count_adherence/mean": 0.8986238699692947, "eval_rewards/count_adherence/std": 0.15372243007788292, "eval_rewards/arabic_clean/mean": 0.9134615384615384, "eval_rewards/arabic_clean/std": 0.20719900268774766, "eval_rewards/lexical_plausibility/mean": 0.9704499336389395, "eval_rewards/lexical_plausibility/std": 0.06162142452712242, "eval_rewards/judge_quality/mean": 0.2686538489965292, "eval_rewards/judge_quality/std": 0.14796888312468162, "eval_rewards/repeat_penalty/mean": 0.5890747560904577, "eval_rewards/repeat_penalty/std": 0.37633006274700165, "eval_rewards/near_duplicate_penalty/mean": 0.854516694178948, "eval_rewards/near_duplicate_penalty/std": 0.15290856862870547, "eval_rewards/opening_diversity/mean": 0.9277158425404475, "eval_rewards/opening_diversity/std": 0.14995075504367167, "eval_rewards/distinct_2/mean": 0.6525185520832355, "eval_rewards/distinct_2/std": 0.38338895715199983, "eval_rewards/total_composite/mean": 0.11650820563618954, "eval_rewards/total_composite/std": 0.10449972261603062, "eval_reward": 0.11650820563618954, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.05291906085151892, "eval_sampling/sampling_logp_difference/max": 1.1188103602482722, "eval_sampling/importance_sampling_ratio/min": 0.3326175304559561, "eval_sampling/importance_sampling_ratio/mean": 1.0090681589566743, "eval_sampling/importance_sampling_ratio/max": 1.5178978076347938, "eval_entropy": 0.5664004935668066, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.11650820563618954, "eval_reward_meter_mean": 0.5117177183811481, "eval_reward_meter_std": 0.36041144682810855, "eval_reward_count_adherence_mean": 0.8986238699692947, "eval_reward_count_adherence_std": 0.15372243007788292, "eval_reward_arabic_clean_mean": 0.9134615384615384, "eval_reward_arabic_clean_std": 0.20719900268774766, "eval_reward_lexical_plausibility_mean": 0.9704499336389395, "eval_reward_lexical_plausibility_std": 0.06162142452712242, "eval_reward_repeat_penalty_mean": 0.5890747560904577, "eval_reward_repeat_penalty_std": 0.37633006274700165, "eval_reward_near_duplicate_penalty_mean": 0.854516694178948, "eval_reward_near_duplicate_penalty_std": 0.15290856862870547, "eval_reward_opening_diversity_mean": 0.9277158425404475, "eval_reward_opening_diversity_std": 0.14995075504367167, "eval_reward_distinct_2_mean": 0.6525185520832355, "eval_reward_distinct_2_std": 0.38338895715199983, "eval_reward_judge_quality_mean": 0.2686538489965292, "eval_reward_judge_quality_std": 0.14796888312468162, "eval_reward_total_composite_mean": 0.11650820563618954, "eval_reward_total_composite_std": 0.10449972261603062} {"timestamp_utc": "2026-04-12T13:46:32Z", "mode": "train", "global_step": 751, "epoch": 0.030164276820500463, "loss": -0.0016, "grad_norm": 5.6542582511901855, "learning_rate": 7.727272727272727e-06, "num_tokens": 1529731.0, "completions/mean_length": 115.5, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 58.857147216796875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.24534814059734344, "rewards/meter/std": 0.3199789524078369, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9051962494850159, "rewards/lexical_plausibility/std": 0.14915074408054352, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8770872950553894, "rewards/repeat_penalty/std": 0.11442028731107712, "rewards/near_duplicate_penalty/mean": 0.9448610544204712, "rewards/near_duplicate_penalty/std": 0.03827836737036705, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9257956743240356, "rewards/distinct_2/std": 0.09299763292074203, "rewards/total_composite/mean": 0.06351770460605621, "rewards/total_composite/std": 0.07437413930892944, "reward": 0.06351770460605621, "reward_std": 0.07437413930892944, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15945707261562347, "sampling/sampling_logp_difference/max": 1.4806623458862305, "sampling/importance_sampling_ratio/min": 0.2274869680404663, "sampling/importance_sampling_ratio/mean": 1.005846619606018, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0602593272924423, "clip_ratio/low_mean": 0.06553702801465988, "clip_ratio/low_min": 0.06553702801465988, "clip_ratio/high_mean": 0.06338721327483654, "clip_ratio/high_max": 0.06338721327483654, "clip_ratio/region_mean": 0.12892424128949642, "reward_total_mean": 0.06351770460605621, "reward_meter_mean": 0.24534814059734344, "reward_meter_std": 0.3199789524078369, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9051962494850159, "reward_lexical_plausibility_std": 0.14915074408054352, "reward_repeat_penalty_mean": 0.8770872950553894, "reward_repeat_penalty_std": 0.11442028731107712, "reward_near_duplicate_penalty_mean": 0.9448610544204712, "reward_near_duplicate_penalty_std": 0.03827836737036705, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9257956743240356, "reward_distinct_2_std": 0.09299763292074203, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.06351770460605621, "reward_total_composite_std": 0.07437413930892944} {"timestamp_utc": "2026-04-12T13:46:46Z", "mode": "train", "global_step": 752, "epoch": 0.030204442302285417, "loss": -0.0446, "grad_norm": 4.507869720458984, "learning_rate": 7.724242424242424e-06, "num_tokens": 1531328.0, "completions/mean_length": 107.625, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.85714340209961, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.8025414943695068, "rewards/meter/std": 0.3103002905845642, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9397887587547302, "rewards/lexical_plausibility/std": 0.13242894411087036, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.21339097619056702, "rewards/repeat_penalty/mean": 0.8586175441741943, "rewards/repeat_penalty/std": 0.1391318142414093, "rewards/near_duplicate_penalty/mean": 0.921478271484375, "rewards/near_duplicate_penalty/std": 0.040106385946273804, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.954170823097229, "rewards/distinct_2/std": 0.054563283920288086, "rewards/total_composite/mean": 0.2564723789691925, "rewards/total_composite/std": 0.22441203892230988, "reward": 0.2564723789691925, "reward_std": 0.22441203892230988, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13170906901359558, "sampling/sampling_logp_difference/max": 1.3046162128448486, "sampling/importance_sampling_ratio/min": 0.32574662566185, "sampling/importance_sampling_ratio/mean": 1.0027834177017212, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7087630107998848, "clip_ratio/low_mean": 0.025000000838190317, "clip_ratio/low_min": 0.025000000838190317, "clip_ratio/high_mean": 0.08985042944550514, "clip_ratio/high_max": 0.08985042944550514, "clip_ratio/region_mean": 0.11485043028369546, "reward_total_mean": 0.2564723789691925, "reward_meter_mean": 0.8025414943695068, "reward_meter_std": 0.3103002905845642, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9397887587547302, "reward_lexical_plausibility_std": 0.13242894411087036, "reward_repeat_penalty_mean": 0.8586175441741943, "reward_repeat_penalty_std": 0.1391318142414093, "reward_near_duplicate_penalty_mean": 0.921478271484375, "reward_near_duplicate_penalty_std": 0.040106385946273804, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.954170823097229, "reward_distinct_2_std": 0.054563283920288086, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.21339097619056702, "reward_total_composite_mean": 0.2564723789691925, "reward_total_composite_std": 0.22441203892230988} {"timestamp_utc": "2026-04-12T13:46:59Z", "mode": "train", "global_step": 753, "epoch": 0.03024460778407037, "loss": -0.0272, "grad_norm": 0.9113172292709351, "learning_rate": 7.721212121212122e-06, "num_tokens": 1532427.0, "completions/mean_length": 265.375, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 18.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.5618544816970825, "rewards/meter/std": 0.4593985974788666, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.7975413799285889, "rewards/lexical_plausibility/std": 0.22083714604377747, "rewards/judge_quality/mean": 0.4937499761581421, "rewards/judge_quality/std": 0.4880262613296509, "rewards/repeat_penalty/mean": 0.7169476747512817, "rewards/repeat_penalty/std": 0.0651947557926178, "rewards/near_duplicate_penalty/mean": 0.955930233001709, "rewards/near_duplicate_penalty/std": 0.08692633360624313, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.35111892223358154, "rewards/total_composite/std": 0.47708356380462646, "reward": 0.35111892223358154, "reward_std": 0.4770835340023041, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08600523322820663, "sampling/sampling_logp_difference/max": 0.9025000333786011, "sampling/importance_sampling_ratio/min": 0.43438971042633057, "sampling/importance_sampling_ratio/mean": 1.0342092514038086, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.31766046583652496, "clip_ratio/low_mean": 0.036764707416296005, "clip_ratio/low_min": 0.036764707416296005, "clip_ratio/high_mean": 0.012202381156384945, "clip_ratio/high_max": 0.012202381156384945, "clip_ratio/region_mean": 0.04896708857268095, "reward_total_mean": 0.35111892223358154, "reward_meter_mean": 0.5618544816970825, "reward_meter_std": 0.4593985974788666, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.7975413799285889, "reward_lexical_plausibility_std": 0.22083714604377747, "reward_repeat_penalty_mean": 0.7169476747512817, "reward_repeat_penalty_std": 0.0651947557926178, "reward_near_duplicate_penalty_mean": 0.955930233001709, "reward_near_duplicate_penalty_std": 0.08692633360624313, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4937499761581421, "reward_judge_quality_std": 0.4880262613296509, "reward_total_composite_mean": 0.35111892223358154, "reward_total_composite_std": 0.47708356380462646} {"timestamp_utc": "2026-04-12T13:47:11Z", "mode": "train", "global_step": 754, "epoch": 0.030284773265855325, "loss": -0.0599, "grad_norm": 4.117982864379883, "learning_rate": 7.718181818181819e-06, "num_tokens": 1533982.0, "completions/mean_length": 93.375, "completions/min_length": 28.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.57143020629883, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.8072152137756348, "rewards/meter/std": 0.33680295944213867, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8812618255615234, "rewards/lexical_plausibility/std": 0.20129022002220154, "rewards/judge_quality/mean": 0.6312500238418579, "rewards/judge_quality/std": 0.4020816683769226, "rewards/repeat_penalty/mean": 0.7487483024597168, "rewards/repeat_penalty/std": 0.1261836141347885, "rewards/near_duplicate_penalty/mean": 0.9697259664535522, "rewards/near_duplicate_penalty/std": 0.06563077121973038, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.5825003981590271, "rewards/total_composite/std": 0.39257144927978516, "reward": 0.5825003981590271, "reward_std": 0.39257141947746277, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1541319191455841, "sampling/sampling_logp_difference/max": 1.615778923034668, "sampling/importance_sampling_ratio/min": 0.1987358182668686, "sampling/importance_sampling_ratio/mean": 1.0031853914260864, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8037475720047951, "clip_ratio/low_mean": 0.01923963101580739, "clip_ratio/low_min": 0.01923963101580739, "clip_ratio/high_mean": 0.08317217603325844, "clip_ratio/high_max": 0.08317217603325844, "clip_ratio/region_mean": 0.10241180704906583, "reward_total_mean": 0.5825003981590271, "reward_meter_mean": 0.8072152137756348, "reward_meter_std": 0.33680295944213867, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8812618255615234, "reward_lexical_plausibility_std": 0.20129022002220154, "reward_repeat_penalty_mean": 0.7487483024597168, "reward_repeat_penalty_std": 0.1261836141347885, "reward_near_duplicate_penalty_mean": 0.9697259664535522, "reward_near_duplicate_penalty_std": 0.06563077121973038, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.6312500238418579, "reward_judge_quality_std": 0.4020816683769226, "reward_total_composite_mean": 0.5825003981590271, "reward_total_composite_std": 0.39257144927978516} {"timestamp_utc": "2026-04-12T13:47:20Z", "mode": "train", "global_step": 755, "epoch": 0.03032493874764028, "loss": 0.0474, "grad_norm": 14.829696655273438, "learning_rate": 7.715151515151516e-06, "num_tokens": 1535459.0, "completions/mean_length": 33.625, "completions/min_length": 30.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.625, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.7113251686096191, "rewards/meter/std": 0.386238694190979, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9771242141723633, "rewards/lexical_plausibility/std": 0.0647025778889656, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.7080320119857788, "rewards/repeat_penalty/std": 0.0597260519862175, "rewards/near_duplicate_penalty/mean": 0.9440426826477051, "rewards/near_duplicate_penalty/std": 0.07963474839925766, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45766425132751465, "rewards/total_composite/std": 0.3889073133468628, "reward": 0.45766425132751465, "reward_std": 0.3889073133468628, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15598982572555542, "sampling/sampling_logp_difference/max": 2.367280960083008, "sampling/importance_sampling_ratio/min": 0.09373525530099869, "sampling/importance_sampling_ratio/mean": 1.0085208415985107, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0116269662976265, "clip_ratio/low_mean": 0.07379679288715124, "clip_ratio/low_min": 0.07379679288715124, "clip_ratio/high_mean": 0.07753136195242405, "clip_ratio/high_max": 0.07753136195242405, "clip_ratio/region_mean": 0.1513281548395753, "reward_total_mean": 0.45766425132751465, "reward_meter_mean": 0.7113251686096191, "reward_meter_std": 0.386238694190979, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9771242141723633, "reward_lexical_plausibility_std": 0.0647025778889656, "reward_repeat_penalty_mean": 0.7080320119857788, "reward_repeat_penalty_std": 0.0597260519862175, "reward_near_duplicate_penalty_mean": 0.9440426826477051, "reward_near_duplicate_penalty_std": 0.07963474839925766, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.45766425132751465, "reward_total_composite_std": 0.3889073133468628} {"timestamp_utc": "2026-04-12T13:47:33Z", "mode": "train", "global_step": 756, "epoch": 0.030365104229425233, "loss": -0.0798, "grad_norm": 5.820659637451172, "learning_rate": 7.712121212121213e-06, "num_tokens": 1537325.0, "completions/mean_length": 128.25, "completions/min_length": 61.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 73.42857360839844, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.7581970691680908, "rewards/meter/std": 0.2884212136268616, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9799602627754211, "rewards/lexical_plausibility/std": 0.05668089911341667, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.7422148585319519, "rewards/repeat_penalty/std": 0.28219759464263916, "rewards/near_duplicate_penalty/mean": 0.9217819571495056, "rewards/near_duplicate_penalty/std": 0.10180716961622238, "rewards/opening_diversity/mean": 0.887499988079071, "rewards/opening_diversity/std": 0.21001701056957245, "rewards/distinct_2/mean": 0.8897054195404053, "rewards/distinct_2/std": 0.1511707305908203, "rewards/total_composite/mean": 0.20604243874549866, "rewards/total_composite/std": 0.1265801638364792, "reward": 0.20604243874549866, "reward_std": 0.1265801638364792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.139238178730011, "sampling/sampling_logp_difference/max": 1.6953731775283813, "sampling/importance_sampling_ratio/min": 0.18353073298931122, "sampling/importance_sampling_ratio/mean": 1.0003151893615723, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7519563883543015, "clip_ratio/low_mean": 0.032273298129439354, "clip_ratio/low_min": 0.032273298129439354, "clip_ratio/high_mean": 0.06528119184076786, "clip_ratio/high_max": 0.06528119184076786, "clip_ratio/region_mean": 0.09755448997020721, "reward_total_mean": 0.20604243874549866, "reward_meter_mean": 0.7581970691680908, "reward_meter_std": 0.2884212136268616, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9799602627754211, "reward_lexical_plausibility_std": 0.05668089911341667, "reward_repeat_penalty_mean": 0.7422148585319519, "reward_repeat_penalty_std": 0.28219759464263916, "reward_near_duplicate_penalty_mean": 0.9217819571495056, "reward_near_duplicate_penalty_std": 0.10180716961622238, "reward_opening_diversity_mean": 0.887499988079071, "reward_opening_diversity_std": 0.21001701056957245, "reward_distinct_2_mean": 0.8897054195404053, "reward_distinct_2_std": 0.1511707305908203, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.20604243874549866, "reward_total_composite_std": 0.1265801638364792} {"timestamp_utc": "2026-04-12T13:47:44Z", "mode": "train", "global_step": 757, "epoch": 0.030405269711210187, "loss": 0.0844, "grad_norm": 6.699467182159424, "learning_rate": 7.709090909090909e-06, "num_tokens": 1540312.0, "completions/mean_length": 180.375, "completions/min_length": 150.0, "completions/max_length": 210.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 180.375, "completions/min_terminated_length": 150.0, "completions/max_terminated_length": 210.0, "rewards/meter/mean": 0.9924758672714233, "rewards/meter/std": 0.004042538348585367, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.23643825948238373, "rewards/repeat_penalty/std": 0.1517748236656189, "rewards/near_duplicate_penalty/mean": 0.7452784776687622, "rewards/near_duplicate_penalty/std": 0.09216246008872986, "rewards/opening_diversity/mean": 0.878125011920929, "rewards/opening_diversity/std": 0.2217775136232376, "rewards/distinct_2/mean": 0.3658512234687805, "rewards/distinct_2/std": 0.14827655255794525, "rewards/total_composite/mean": 0.14143750071525574, "rewards/total_composite/std": 0.013895310461521149, "reward": 0.14143750071525574, "reward_std": 0.013895308598876, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07771893590688705, "sampling/sampling_logp_difference/max": 1.7559001445770264, "sampling/importance_sampling_ratio/min": 0.17275166511535645, "sampling/importance_sampling_ratio/mean": 1.0070961713790894, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.555378720164299, "clip_ratio/low_mean": 0.018682016525417566, "clip_ratio/low_min": 0.018682016525417566, "clip_ratio/high_mean": 0.06278140377253294, "clip_ratio/high_max": 0.06278140377253294, "clip_ratio/region_mean": 0.0814634202979505, "reward_total_mean": 0.14143750071525574, "reward_meter_mean": 0.9924758672714233, "reward_meter_std": 0.004042538348585367, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.23643825948238373, "reward_repeat_penalty_std": 0.1517748236656189, "reward_near_duplicate_penalty_mean": 0.7452784776687622, "reward_near_duplicate_penalty_std": 0.09216246008872986, "reward_opening_diversity_mean": 0.878125011920929, "reward_opening_diversity_std": 0.2217775136232376, "reward_distinct_2_mean": 0.3658512234687805, "reward_distinct_2_std": 0.14827655255794525, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.14143750071525574, "reward_total_composite_std": 0.013895310461521149} {"timestamp_utc": "2026-04-12T13:47:55Z", "mode": "train", "global_step": 758, "epoch": 0.03044543519299514, "loss": -0.012, "grad_norm": 2.2713780403137207, "learning_rate": 7.706060606060606e-06, "num_tokens": 1544597.0, "completions/mean_length": 317.625, "completions/min_length": 295.0, "completions/max_length": 343.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 317.625, "completions/min_terminated_length": 295.0, "completions/max_terminated_length": 343.0, "rewards/meter/mean": 0.7525134682655334, "rewards/meter/std": 0.4262067377567291, "rewards/count_adherence/mean": 0.890625, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.025922738015651703, "rewards/repeat_penalty/std": 0.044997766613960266, "rewards/near_duplicate_penalty/mean": 0.5169505476951599, "rewards/near_duplicate_penalty/std": 0.1723085194826126, "rewards/opening_diversity/mean": 0.46875, "rewards/opening_diversity/std": 0.29859957098960876, "rewards/distinct_2/mean": 0.07271120697259903, "rewards/distinct_2/std": 0.13307280838489532, "rewards/total_composite/mean": 0.10095322877168655, "rewards/total_composite/std": 0.05731987953186035, "reward": 0.10095322877168655, "reward_std": 0.05731987580657005, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04793323203921318, "sampling/sampling_logp_difference/max": 2.0491909980773926, "sampling/importance_sampling_ratio/min": 0.12883909046649933, "sampling/importance_sampling_ratio/mean": 1.0077365636825562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2946852520108223, "clip_ratio/low_mean": 0.008336049737408757, "clip_ratio/low_min": 0.008336049737408757, "clip_ratio/high_mean": 0.047590904869139194, "clip_ratio/high_max": 0.047590904869139194, "clip_ratio/region_mean": 0.05592695460654795, "reward_total_mean": 0.10095322877168655, "reward_meter_mean": 0.7525134682655334, "reward_meter_std": 0.4262067377567291, "reward_count_adherence_mean": 0.890625, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.025922738015651703, "reward_repeat_penalty_std": 0.044997766613960266, "reward_near_duplicate_penalty_mean": 0.5169505476951599, "reward_near_duplicate_penalty_std": 0.1723085194826126, "reward_opening_diversity_mean": 0.46875, "reward_opening_diversity_std": 0.29859957098960876, "reward_distinct_2_mean": 0.07271120697259903, "reward_distinct_2_std": 0.13307280838489532, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.10095322877168655, "reward_total_composite_std": 0.05731987953186035} {"timestamp_utc": "2026-04-12T13:48:09Z", "mode": "train", "global_step": 759, "epoch": 0.030485600674780094, "loss": -0.0843, "grad_norm": 5.156977653503418, "learning_rate": 7.703030303030304e-06, "num_tokens": 1546478.0, "completions/mean_length": 132.125, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 77.85714721679688, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.617965579032898, "rewards/meter/std": 0.3356782793998718, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9563086032867432, "rewards/lexical_plausibility/std": 0.12357787042856216, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8897678256034851, "rewards/repeat_penalty/std": 0.09109393507242203, "rewards/near_duplicate_penalty/mean": 0.9475877285003662, "rewards/near_duplicate_penalty/std": 0.04304119572043419, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9704861044883728, "rewards/distinct_2/std": 0.04337109625339508, "rewards/total_composite/mean": 0.1589117795228958, "rewards/total_composite/std": 0.1443527787923813, "reward": 0.1589117795228958, "reward_std": 0.1443527638912201, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12779755890369415, "sampling/sampling_logp_difference/max": 1.3012678623199463, "sampling/importance_sampling_ratio/min": 0.2721864879131317, "sampling/importance_sampling_ratio/mean": 1.0205940008163452, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7309146523475647, "clip_ratio/low_mean": 0.04924075026065111, "clip_ratio/low_min": 0.04924075026065111, "clip_ratio/high_mean": 0.045848920941352844, "clip_ratio/high_max": 0.045848920941352844, "clip_ratio/region_mean": 0.09508967120200396, "reward_total_mean": 0.1589117795228958, "reward_meter_mean": 0.617965579032898, "reward_meter_std": 0.3356782793998718, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9563086032867432, "reward_lexical_plausibility_std": 0.12357787042856216, "reward_repeat_penalty_mean": 0.8897678256034851, "reward_repeat_penalty_std": 0.09109393507242203, "reward_near_duplicate_penalty_mean": 0.9475877285003662, "reward_near_duplicate_penalty_std": 0.04304119572043419, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9704861044883728, "reward_distinct_2_std": 0.04337109625339508, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.1589117795228958, "reward_total_composite_std": 0.1443527787923813} {"timestamp_utc": "2026-04-12T13:48:22Z", "mode": "train", "global_step": 760, "epoch": 0.03052576615656505, "loss": -0.03, "grad_norm": 7.912317752838135, "learning_rate": 7.7e-06, "num_tokens": 1548105.0, "completions/mean_length": 96.375, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.6226221323013306, "rewards/meter/std": 0.3957872688770294, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9024482369422913, "rewards/lexical_plausibility/std": 0.18081353604793549, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101401686668396, "rewards/repeat_penalty/mean": 0.9369135499000549, "rewards/repeat_penalty/std": 0.09812384843826294, "rewards/near_duplicate_penalty/mean": 0.9622968435287476, "rewards/near_duplicate_penalty/std": 0.05941963568329811, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.971470832824707, "rewards/distinct_2/std": 0.05287402868270874, "rewards/total_composite/mean": 0.2968449592590332, "rewards/total_composite/std": 0.2879330813884735, "reward": 0.2968449592590332, "reward_std": 0.2879330813884735, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14481541514396667, "sampling/sampling_logp_difference/max": 1.2011079788208008, "sampling/importance_sampling_ratio/min": 0.3008606731891632, "sampling/importance_sampling_ratio/mean": 1.0089575052261353, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9489739835262299, "clip_ratio/low_mean": 0.029910714365541935, "clip_ratio/low_min": 0.029910714365541935, "clip_ratio/high_mean": 0.09513889090158045, "clip_ratio/high_max": 0.09513889090158045, "clip_ratio/region_mean": 0.1250496052671224, "reward_total_mean": 0.2968449592590332, "reward_meter_mean": 0.6226221323013306, "reward_meter_std": 0.3957872688770294, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9024482369422913, "reward_lexical_plausibility_std": 0.18081353604793549, "reward_repeat_penalty_mean": 0.9369135499000549, "reward_repeat_penalty_std": 0.09812384843826294, "reward_near_duplicate_penalty_mean": 0.9622968435287476, "reward_near_duplicate_penalty_std": 0.05941963568329811, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.971470832824707, "reward_distinct_2_std": 0.05287402868270874, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101401686668396, "reward_total_composite_mean": 0.2968449592590332, "reward_total_composite_std": 0.2879330813884735} {"timestamp_utc": "2026-04-12T13:48:36Z", "mode": "train", "global_step": 761, "epoch": 0.030565931638350002, "loss": -0.0299, "grad_norm": 5.511273384094238, "learning_rate": 7.696969696969696e-06, "num_tokens": 1549770.0, "completions/mean_length": 105.125, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.000003814697266, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.4457665979862213, "rewards/meter/std": 0.4284104108810425, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.959851861000061, "rewards/lexical_plausibility/std": 0.11355604976415634, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9313533306121826, "rewards/repeat_penalty/std": 0.10008540004491806, "rewards/near_duplicate_penalty/mean": 0.9754289984703064, "rewards/near_duplicate_penalty/std": 0.021154019981622696, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9536713361740112, "rewards/distinct_2/std": 0.08915838599205017, "rewards/total_composite/mean": 0.18814267218112946, "rewards/total_composite/std": 0.17935602366924286, "reward": 0.18814267218112946, "reward_std": 0.17935602366924286, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15126250684261322, "sampling/sampling_logp_difference/max": 2.151500701904297, "sampling/importance_sampling_ratio/min": 0.11630947887897491, "sampling/importance_sampling_ratio/mean": 1.0220063924789429, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8205545321106911, "clip_ratio/low_mean": 0.04237702256068587, "clip_ratio/low_min": 0.04237702256068587, "clip_ratio/high_mean": 0.07541702594608068, "clip_ratio/high_max": 0.07541702594608068, "clip_ratio/region_mean": 0.11779404850676656, "reward_total_mean": 0.18814267218112946, "reward_meter_mean": 0.4457665979862213, "reward_meter_std": 0.4284104108810425, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.959851861000061, "reward_lexical_plausibility_std": 0.11355604976415634, "reward_repeat_penalty_mean": 0.9313533306121826, "reward_repeat_penalty_std": 0.10008540004491806, "reward_near_duplicate_penalty_mean": 0.9754289984703064, "reward_near_duplicate_penalty_std": 0.021154019981622696, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9536713361740112, "reward_distinct_2_std": 0.08915838599205017, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.18814267218112946, "reward_total_composite_std": 0.17935602366924286} {"timestamp_utc": "2026-04-12T13:48:51Z", "mode": "train", "global_step": 762, "epoch": 0.030606097120134956, "loss": -0.0326, "grad_norm": 5.418692588806152, "learning_rate": 7.693939393939395e-06, "num_tokens": 1551418.0, "completions/mean_length": 115.0, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 58.28571701049805, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.26285335421562195, "rewards/meter/std": 0.26476600766181946, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9494400024414062, "rewards/lexical_plausibility/std": 0.14300529658794403, "rewards/judge_quality/mean": 0.4399999976158142, "rewards/judge_quality/std": 0.24859607219696045, "rewards/repeat_penalty/mean": 0.9500300884246826, "rewards/repeat_penalty/std": 0.08432653546333313, "rewards/near_duplicate_penalty/mean": 0.9895552396774292, "rewards/near_duplicate_penalty/std": 0.009525802917778492, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.09958121180534363, "rewards/total_composite/std": 0.1242804005742073, "reward": 0.09958121180534363, "reward_std": 0.1242804005742073, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1265241503715515, "sampling/sampling_logp_difference/max": 1.0849881172180176, "sampling/importance_sampling_ratio/min": 0.3379058241844177, "sampling/importance_sampling_ratio/mean": 1.0120832920074463, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7335836812853813, "clip_ratio/low_mean": 0.06432131212204695, "clip_ratio/low_min": 0.06432131212204695, "clip_ratio/high_mean": 0.05025284644216299, "clip_ratio/high_max": 0.05025284644216299, "clip_ratio/region_mean": 0.11457415856420994, "reward_total_mean": 0.09958121180534363, "reward_meter_mean": 0.26285335421562195, "reward_meter_std": 0.26476600766181946, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9494400024414062, "reward_lexical_plausibility_std": 0.14300529658794403, "reward_repeat_penalty_mean": 0.9500300884246826, "reward_repeat_penalty_std": 0.08432653546333313, "reward_near_duplicate_penalty_mean": 0.9895552396774292, "reward_near_duplicate_penalty_std": 0.009525802917778492, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.4399999976158142, "reward_judge_quality_std": 0.24859607219696045, "reward_total_composite_mean": 0.09958121180534363, "reward_total_composite_std": 0.1242804005742073} {"timestamp_utc": "2026-04-12T13:49:02Z", "mode": "train", "global_step": 763, "epoch": 0.03064626260191991, "loss": 0.0566, "grad_norm": 4.991977214813232, "learning_rate": 7.690909090909091e-06, "num_tokens": 1554835.0, "completions/mean_length": 224.125, "completions/min_length": 199.0, "completions/max_length": 246.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 224.125, "completions/min_terminated_length": 199.0, "completions/max_terminated_length": 246.0, "rewards/meter/mean": 0.7947300672531128, "rewards/meter/std": 0.28722473978996277, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.2018357515335083, "rewards/repeat_penalty/std": 0.14820127189159393, "rewards/near_duplicate_penalty/mean": 0.7426934242248535, "rewards/near_duplicate_penalty/std": 0.11225884407758713, "rewards/opening_diversity/mean": 0.9553571939468384, "rewards/opening_diversity/std": 0.06259103864431381, "rewards/distinct_2/mean": 0.3077459931373596, "rewards/distinct_2/std": 0.21564757823944092, "rewards/total_composite/mean": 0.11920950561761856, "rewards/total_composite/std": 0.043083708733320236, "reward": 0.11920950561761856, "reward_std": 0.043083708733320236, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08441130071878433, "sampling/sampling_logp_difference/max": 1.802474021911621, "sampling/importance_sampling_ratio/min": 0.16489045321941376, "sampling/importance_sampling_ratio/mean": 1.0006810426712036, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46828923374414444, "clip_ratio/low_mean": 0.024803034961223602, "clip_ratio/low_min": 0.024803034961223602, "clip_ratio/high_mean": 0.059402203653007746, "clip_ratio/high_max": 0.059402203653007746, "clip_ratio/region_mean": 0.08420523861423135, "reward_total_mean": 0.11920950561761856, "reward_meter_mean": 0.7947300672531128, "reward_meter_std": 0.28722473978996277, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2018357515335083, "reward_repeat_penalty_std": 0.14820127189159393, "reward_near_duplicate_penalty_mean": 0.7426934242248535, "reward_near_duplicate_penalty_std": 0.11225884407758713, "reward_opening_diversity_mean": 0.9553571939468384, "reward_opening_diversity_std": 0.06259103864431381, "reward_distinct_2_mean": 0.3077459931373596, "reward_distinct_2_std": 0.21564757823944092, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.11920950561761856, "reward_total_composite_std": 0.043083708733320236} {"timestamp_utc": "2026-04-12T13:49:16Z", "mode": "train", "global_step": 764, "epoch": 0.030686428083704864, "loss": -0.0992, "grad_norm": 4.293631553649902, "learning_rate": 7.687878787878788e-06, "num_tokens": 1556515.0, "completions/mean_length": 113.0, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.000003814697266, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.7618042826652527, "rewards/meter/std": 0.3373679518699646, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9540361762046814, "rewards/lexical_plausibility/std": 0.13000528514385223, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.23868314921855927, "rewards/repeat_penalty/mean": 0.9198135137557983, "rewards/repeat_penalty/std": 0.11262106895446777, "rewards/near_duplicate_penalty/mean": 0.9657071828842163, "rewards/near_duplicate_penalty/std": 0.027733059599995613, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9807209968566895, "rewards/distinct_2/std": 0.0357571542263031, "rewards/total_composite/mean": 0.34798580408096313, "rewards/total_composite/std": 0.2204636186361313, "reward": 0.34798580408096313, "reward_std": 0.2204636037349701, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14719754457473755, "sampling/sampling_logp_difference/max": 1.2056770324707031, "sampling/importance_sampling_ratio/min": 0.29948917031288147, "sampling/importance_sampling_ratio/mean": 0.9965231418609619, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8594876527786255, "clip_ratio/low_mean": 0.029282765928655863, "clip_ratio/low_min": 0.029282765928655863, "clip_ratio/high_mean": 0.09677751548588276, "clip_ratio/high_max": 0.09677751548588276, "clip_ratio/region_mean": 0.12606028141453862, "reward_total_mean": 0.34798580408096313, "reward_meter_mean": 0.7618042826652527, "reward_meter_std": 0.3373679518699646, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9540361762046814, "reward_lexical_plausibility_std": 0.13000528514385223, "reward_repeat_penalty_mean": 0.9198135137557983, "reward_repeat_penalty_std": 0.11262106895446777, "reward_near_duplicate_penalty_mean": 0.9657071828842163, "reward_near_duplicate_penalty_std": 0.027733059599995613, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9807209968566895, "reward_distinct_2_std": 0.0357571542263031, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.23868314921855927, "reward_total_composite_mean": 0.34798580408096313, "reward_total_composite_std": 0.2204636186361313} {"timestamp_utc": "2026-04-12T13:49:30Z", "mode": "train", "global_step": 765, "epoch": 0.030726593565489818, "loss": -0.1149, "grad_norm": 2.4354758262634277, "learning_rate": 7.684848484848485e-06, "num_tokens": 1558242.0, "completions/mean_length": 243.875, "completions/min_length": 75.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 83.0, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.2985907196998596, "rewards/meter/std": 0.3216824531555176, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8602477312088013, "rewards/lexical_plausibility/std": 0.1957496851682663, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9494669437408447, "rewards/repeat_penalty/std": 0.031903624534606934, "rewards/near_duplicate_penalty/mean": 0.9611002802848816, "rewards/near_duplicate_penalty/std": 0.02690417692065239, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.987949550151825, "rewards/distinct_2/std": 0.02104729413986206, "rewards/total_composite/mean": 0.05845516175031662, "rewards/total_composite/std": 0.06506701558828354, "reward": 0.05845516175031662, "reward_std": 0.06506701558828354, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11565515398979187, "sampling/sampling_logp_difference/max": 2.8310375213623047, "sampling/importance_sampling_ratio/min": 0.05895165726542473, "sampling/importance_sampling_ratio/mean": 1.0137100219726562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5242686420679092, "clip_ratio/low_mean": 0.01406249962747097, "clip_ratio/low_min": 0.01406249962747097, "clip_ratio/high_mean": 0.05406558606773615, "clip_ratio/high_max": 0.05406558606773615, "clip_ratio/region_mean": 0.06812808569520712, "reward_total_mean": 0.05845516175031662, "reward_meter_mean": 0.2985907196998596, "reward_meter_std": 0.3216824531555176, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8602477312088013, "reward_lexical_plausibility_std": 0.1957496851682663, "reward_repeat_penalty_mean": 0.9494669437408447, "reward_repeat_penalty_std": 0.031903624534606934, "reward_near_duplicate_penalty_mean": 0.9611002802848816, "reward_near_duplicate_penalty_std": 0.02690417692065239, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.987949550151825, "reward_distinct_2_std": 0.02104729413986206, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.05845516175031662, "reward_total_composite_std": 0.06506701558828354} {"timestamp_utc": "2026-04-12T13:49:45Z", "mode": "train", "global_step": 766, "epoch": 0.030766759047274772, "loss": -0.0272, "grad_norm": 4.402597427368164, "learning_rate": 7.681818181818183e-06, "num_tokens": 1559787.0, "completions/mean_length": 98.125, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.6116056442260742, "rewards/meter/std": 0.36475294828414917, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.955929160118103, "rewards/lexical_plausibility/std": 0.12465112656354904, "rewards/judge_quality/mean": 0.4675000309944153, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.9904035329818726, "rewards/repeat_penalty/std": 0.010543355718255043, "rewards/near_duplicate_penalty/mean": 0.9904035329818726, "rewards/near_duplicate_penalty/std": 0.010543355718255043, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.28405898809432983, "rewards/total_composite/std": 0.2783108353614807, "reward": 0.28405898809432983, "reward_std": 0.2783108353614807, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11154511570930481, "sampling/sampling_logp_difference/max": 2.150965452194214, "sampling/importance_sampling_ratio/min": 0.116371750831604, "sampling/importance_sampling_ratio/mean": 1.0186054706573486, "sampling/importance_sampling_ratio/max": 1.734793782234192, "entropy": 0.6226985715329647, "clip_ratio/low_mean": 0.06483082100749016, "clip_ratio/low_min": 0.06483082100749016, "clip_ratio/high_mean": 0.06758247036486864, "clip_ratio/high_max": 0.06758247036486864, "clip_ratio/region_mean": 0.1324132913723588, "reward_total_mean": 0.28405898809432983, "reward_meter_mean": 0.6116056442260742, "reward_meter_std": 0.36475294828414917, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.955929160118103, "reward_lexical_plausibility_std": 0.12465112656354904, "reward_repeat_penalty_mean": 0.9904035329818726, "reward_repeat_penalty_std": 0.010543355718255043, "reward_near_duplicate_penalty_mean": 0.9904035329818726, "reward_near_duplicate_penalty_std": 0.010543355718255043, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000309944153, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.28405898809432983, "reward_total_composite_std": 0.2783108353614807} {"timestamp_utc": "2026-04-12T13:49:58Z", "mode": "train", "global_step": 767, "epoch": 0.030806924529059726, "loss": -0.0179, "grad_norm": 4.854854106903076, "learning_rate": 7.678787878787878e-06, "num_tokens": 1561400.0, "completions/mean_length": 109.625, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.142860412597656, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.24479930102825165, "rewards/meter/std": 0.3385663628578186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9592169523239136, "rewards/lexical_plausibility/std": 0.10458080470561981, "rewards/judge_quality/mean": 0.3712499737739563, "rewards/judge_quality/std": 0.25670647621154785, "rewards/repeat_penalty/mean": 0.8317855000495911, "rewards/repeat_penalty/std": 0.17168274521827698, "rewards/near_duplicate_penalty/mean": 0.9257292747497559, "rewards/near_duplicate_penalty/std": 0.04465325176715851, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9487742185592651, "rewards/distinct_2/std": 0.07594232261180878, "rewards/total_composite/mean": 0.15713383257389069, "rewards/total_composite/std": 0.29908961057662964, "reward": 0.15713383257389069, "reward_std": 0.29908961057662964, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16317471861839294, "sampling/sampling_logp_difference/max": 1.7155027389526367, "sampling/importance_sampling_ratio/min": 0.1798732727766037, "sampling/importance_sampling_ratio/mean": 1.0239506959915161, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8268949091434479, "clip_ratio/low_mean": 0.09817329840734601, "clip_ratio/low_min": 0.09817329840734601, "clip_ratio/high_mean": 0.03622641507536173, "clip_ratio/high_max": 0.03622641507536173, "clip_ratio/region_mean": 0.13439971348270774, "reward_total_mean": 0.15713383257389069, "reward_meter_mean": 0.24479930102825165, "reward_meter_std": 0.3385663628578186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9592169523239136, "reward_lexical_plausibility_std": 0.10458080470561981, "reward_repeat_penalty_mean": 0.8317855000495911, "reward_repeat_penalty_std": 0.17168274521827698, "reward_near_duplicate_penalty_mean": 0.9257292747497559, "reward_near_duplicate_penalty_std": 0.04465325176715851, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9487742185592651, "reward_distinct_2_std": 0.07594232261180878, "reward_judge_quality_mean": 0.3712499737739563, "reward_judge_quality_std": 0.25670647621154785, "reward_total_composite_mean": 0.15713383257389069, "reward_total_composite_std": 0.29908961057662964} {"timestamp_utc": "2026-04-12T13:50:07Z", "mode": "train", "global_step": 768, "epoch": 0.03084709001084468, "loss": 0.0237, "grad_norm": 8.035225868225098, "learning_rate": 7.675757575757577e-06, "num_tokens": 1563614.0, "completions/mean_length": 99.75, "completions/min_length": 92.0, "completions/max_length": 108.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.75, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.7384893894195557, "rewards/meter/std": 0.3352949023246765, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9049655199050903, "rewards/repeat_penalty/std": 0.0951816514134407, "rewards/near_duplicate_penalty/mean": 0.9490857124328613, "rewards/near_duplicate_penalty/std": 0.024631649255752563, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9522029757499695, "rewards/distinct_2/std": 0.08318986743688583, "rewards/total_composite/mean": 0.3147892653942108, "rewards/total_composite/std": 0.25307226181030273, "reward": 0.3147892653942108, "reward_std": 0.25307226181030273, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12582404911518097, "sampling/sampling_logp_difference/max": 1.425328016281128, "sampling/importance_sampling_ratio/min": 0.2404295951128006, "sampling/importance_sampling_ratio/mean": 1.010919451713562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9234515354037285, "clip_ratio/low_mean": 0.055440484546124935, "clip_ratio/low_min": 0.055440484546124935, "clip_ratio/high_mean": 0.0771956229582429, "clip_ratio/high_max": 0.0771956229582429, "clip_ratio/region_mean": 0.13263610750436783, "reward_total_mean": 0.3147892653942108, "reward_meter_mean": 0.7384893894195557, "reward_meter_std": 0.3352949023246765, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9049655199050903, "reward_repeat_penalty_std": 0.0951816514134407, "reward_near_duplicate_penalty_mean": 0.9490857124328613, "reward_near_duplicate_penalty_std": 0.024631649255752563, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9522029757499695, "reward_distinct_2_std": 0.08318986743688583, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.3147892653942108, "reward_total_composite_std": 0.25307226181030273} {"timestamp_utc": "2026-04-12T13:50:22Z", "mode": "train", "global_step": 769, "epoch": 0.030887255492629634, "loss": -0.0771, "grad_norm": 4.437525749206543, "learning_rate": 7.672727272727273e-06, "num_tokens": 1566104.0, "completions/mean_length": 190.25, "completions/min_length": 125.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 144.2857208251953, "completions/min_terminated_length": 125.0, "completions/max_terminated_length": 166.0, "rewards/meter/mean": 0.4939690828323364, "rewards/meter/std": 0.37506309151649475, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.3505098223686218, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9726550579071045, "rewards/lexical_plausibility/std": 0.06802557408809662, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.806496798992157, "rewards/repeat_penalty/std": 0.20518775284290314, "rewards/near_duplicate_penalty/mean": 0.9333205223083496, "rewards/near_duplicate_penalty/std": 0.0811675414443016, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8586480617523193, "rewards/distinct_2/std": 0.157771036028862, "rewards/total_composite/mean": 0.1271776258945465, "rewards/total_composite/std": 0.10381483286619186, "reward": 0.1271776258945465, "reward_std": 0.10381483286619186, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1216985359787941, "sampling/sampling_logp_difference/max": 1.6888399124145508, "sampling/importance_sampling_ratio/min": 0.18473370373249054, "sampling/importance_sampling_ratio/mean": 1.0117864608764648, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7788887470960617, "clip_ratio/low_mean": 0.06171979568898678, "clip_ratio/low_min": 0.06171979568898678, "clip_ratio/high_mean": 0.03720343206077814, "clip_ratio/high_max": 0.03720343206077814, "clip_ratio/region_mean": 0.09892322774976492, "reward_total_mean": 0.1271776258945465, "reward_meter_mean": 0.4939690828323364, "reward_meter_std": 0.37506309151649475, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.3505098223686218, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9726550579071045, "reward_lexical_plausibility_std": 0.06802557408809662, "reward_repeat_penalty_mean": 0.806496798992157, "reward_repeat_penalty_std": 0.20518775284290314, "reward_near_duplicate_penalty_mean": 0.9333205223083496, "reward_near_duplicate_penalty_std": 0.0811675414443016, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8586480617523193, "reward_distinct_2_std": 0.157771036028862, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.1271776258945465, "reward_total_composite_std": 0.10381483286619186} {"timestamp_utc": "2026-04-12T13:50:36Z", "mode": "train", "global_step": 770, "epoch": 0.030927420974414588, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.66969696969697e-06, "num_tokens": 1568096.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.8071956634521484, "rewards/meter/std": 0.2763350307941437, "rewards/count_adherence/mean": 0.8026316165924072, "rewards/count_adherence/std": 0.06745998561382294, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.13125000894069672, "rewards/judge_quality/std": 0.0530330128967762, "rewards/repeat_penalty/mean": 0.14564862847328186, "rewards/repeat_penalty/std": 0.22092342376708984, "rewards/near_duplicate_penalty/mean": 0.721878707408905, "rewards/near_duplicate_penalty/std": 0.12384537607431412, "rewards/opening_diversity/mean": 0.9097259044647217, "rewards/opening_diversity/std": 0.159354567527771, "rewards/distinct_2/mean": 0.18396621942520142, "rewards/distinct_2/std": 0.2518809139728546, "rewards/total_composite/mean": 0.08450785279273987, "rewards/total_composite/std": 0.04974975064396858, "reward": 0.08450785279273987, "reward_std": 0.049749743193387985, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.08450785279273987, "reward_meter_mean": 0.8071956634521484, "reward_meter_std": 0.2763350307941437, "reward_count_adherence_mean": 0.8026316165924072, "reward_count_adherence_std": 0.06745998561382294, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.14564862847328186, "reward_repeat_penalty_std": 0.22092342376708984, "reward_near_duplicate_penalty_mean": 0.721878707408905, "reward_near_duplicate_penalty_std": 0.12384537607431412, "reward_opening_diversity_mean": 0.9097259044647217, "reward_opening_diversity_std": 0.159354567527771, "reward_distinct_2_mean": 0.18396621942520142, "reward_distinct_2_std": 0.2518809139728546, "reward_judge_quality_mean": 0.13125000894069672, "reward_judge_quality_std": 0.0530330128967762, "reward_total_composite_mean": 0.08450785279273987, "reward_total_composite_std": 0.04974975064396858} {"timestamp_utc": "2026-04-12T13:50:51Z", "mode": "train", "global_step": 771, "epoch": 0.030967586456199542, "loss": -0.2015, "grad_norm": 2.096440553665161, "learning_rate": 7.666666666666667e-06, "num_tokens": 1570330.0, "completions/mean_length": 335.25, "completions/min_length": 156.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 158.5, "completions/min_terminated_length": 156.0, "completions/max_terminated_length": 161.0, "rewards/meter/mean": 0.7819421887397766, "rewards/meter/std": 0.3578019142150879, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.328416109085083, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8504629731178284, "rewards/lexical_plausibility/std": 0.18675591051578522, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.6678902506828308, "rewards/repeat_penalty/std": 0.32416048645973206, "rewards/near_duplicate_penalty/mean": 0.8827751874923706, "rewards/near_duplicate_penalty/std": 0.11507882177829742, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.15221577882766724, "rewards/distinct_2/mean": 0.792546272277832, "rewards/distinct_2/std": 0.2205480933189392, "rewards/total_composite/mean": 0.14750972390174866, "rewards/total_composite/std": 0.17079360783100128, "reward": 0.14750972390174866, "reward_std": 0.17079360783100128, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10303334891796112, "sampling/sampling_logp_difference/max": 1.0576629638671875, "sampling/importance_sampling_ratio/min": 0.34726640582084656, "sampling/importance_sampling_ratio/mean": 1.025027871131897, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4936429560184479, "clip_ratio/low_mean": 0.009316770359873772, "clip_ratio/low_min": 0.009316770359873772, "clip_ratio/high_mean": 0.03644225653260946, "clip_ratio/high_max": 0.03644225653260946, "clip_ratio/region_mean": 0.045759026892483234, "reward_total_mean": 0.14750972390174866, "reward_meter_mean": 0.7819421887397766, "reward_meter_std": 0.3578019142150879, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.328416109085083, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8504629731178284, "reward_lexical_plausibility_std": 0.18675591051578522, "reward_repeat_penalty_mean": 0.6678902506828308, "reward_repeat_penalty_std": 0.32416048645973206, "reward_near_duplicate_penalty_mean": 0.8827751874923706, "reward_near_duplicate_penalty_std": 0.11507882177829742, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.15221577882766724, "reward_distinct_2_mean": 0.792546272277832, "reward_distinct_2_std": 0.2205480933189392, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.14750972390174866, "reward_total_composite_std": 0.17079360783100128} {"timestamp_utc": "2026-04-12T13:51:01Z", "mode": "train", "global_step": 772, "epoch": 0.031007751937984496, "loss": -0.0472, "grad_norm": 7.703415870666504, "learning_rate": 7.663636363636364e-06, "num_tokens": 1572507.0, "completions/mean_length": 108.125, "completions/min_length": 70.0, "completions/max_length": 119.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 108.125, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.42608457803726196, "rewards/meter/std": 0.3771738111972809, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.6464917063713074, "rewards/repeat_penalty/std": 0.16450101137161255, "rewards/near_duplicate_penalty/mean": 0.9018651247024536, "rewards/near_duplicate_penalty/std": 0.037164103239774704, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.7270519733428955, "rewards/distinct_2/std": 0.14556081593036652, "rewards/total_composite/mean": 0.1489199697971344, "rewards/total_composite/std": 0.13219745457172394, "reward": 0.1489199697971344, "reward_std": 0.13219745457172394, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10423891246318817, "sampling/sampling_logp_difference/max": 1.7511940002441406, "sampling/importance_sampling_ratio/min": 0.17356657981872559, "sampling/importance_sampling_ratio/mean": 1.0041307210922241, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7611419856548309, "clip_ratio/low_mean": 0.051392852794378996, "clip_ratio/low_min": 0.051392852794378996, "clip_ratio/high_mean": 0.05071981530636549, "clip_ratio/high_max": 0.05071981530636549, "clip_ratio/region_mean": 0.10211266810074449, "reward_total_mean": 0.1489199697971344, "reward_meter_mean": 0.42608457803726196, "reward_meter_std": 0.3771738111972809, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6464917063713074, "reward_repeat_penalty_std": 0.16450101137161255, "reward_near_duplicate_penalty_mean": 0.9018651247024536, "reward_near_duplicate_penalty_std": 0.037164103239774704, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.7270519733428955, "reward_distinct_2_std": 0.14556081593036652, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.1489199697971344, "reward_total_composite_std": 0.13219745457172394} {"timestamp_utc": "2026-04-12T13:51:15Z", "mode": "train", "global_step": 773, "epoch": 0.03104791741976945, "loss": -0.2456, "grad_norm": 1.5966325998306274, "learning_rate": 7.660606060606062e-06, "num_tokens": 1574963.0, "completions/mean_length": 323.0, "completions/min_length": 179.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 209.60000610351562, "completions/min_terminated_length": 179.0, "completions/max_terminated_length": 228.0, "rewards/meter/mean": 0.7656537294387817, "rewards/meter/std": 0.3421063721179962, "rewards/count_adherence/mean": 0.7678571343421936, "rewards/count_adherence/std": 0.3322991728782654, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8451470732688904, "rewards/lexical_plausibility/std": 0.2173515111207962, "rewards/judge_quality/mean": 0.11249999701976776, "rewards/judge_quality/std": 0.051754921674728394, "rewards/repeat_penalty/mean": 0.4553380012512207, "rewards/repeat_penalty/std": 0.4441148638725281, "rewards/near_duplicate_penalty/mean": 0.8036165237426758, "rewards/near_duplicate_penalty/std": 0.17423562705516815, "rewards/opening_diversity/mean": 0.9642857313156128, "rewards/opening_diversity/std": 0.06613000482320786, "rewards/distinct_2/mean": 0.5186556577682495, "rewards/distinct_2/std": 0.4284680485725403, "rewards/total_composite/mean": 0.08388496935367584, "rewards/total_composite/std": 0.07035890966653824, "reward": 0.08388496935367584, "reward_std": 0.07035890966653824, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0626145452260971, "sampling/sampling_logp_difference/max": 1.1764965057373047, "sampling/importance_sampling_ratio/min": 0.3083571791648865, "sampling/importance_sampling_ratio/mean": 1.010095477104187, "sampling/importance_sampling_ratio/max": 1.9337958097457886, "entropy": 0.3157663568854332, "clip_ratio/low_mean": 0.008223684504628181, "clip_ratio/low_min": 0.008223684504628181, "clip_ratio/high_mean": 0.03121564514003694, "clip_ratio/high_max": 0.03121564514003694, "clip_ratio/region_mean": 0.03943932964466512, "reward_total_mean": 0.08388496935367584, "reward_meter_mean": 0.7656537294387817, "reward_meter_std": 0.3421063721179962, "reward_count_adherence_mean": 0.7678571343421936, "reward_count_adherence_std": 0.3322991728782654, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8451470732688904, "reward_lexical_plausibility_std": 0.2173515111207962, "reward_repeat_penalty_mean": 0.4553380012512207, "reward_repeat_penalty_std": 0.4441148638725281, "reward_near_duplicate_penalty_mean": 0.8036165237426758, "reward_near_duplicate_penalty_std": 0.17423562705516815, "reward_opening_diversity_mean": 0.9642857313156128, "reward_opening_diversity_std": 0.06613000482320786, "reward_distinct_2_mean": 0.5186556577682495, "reward_distinct_2_std": 0.4284680485725403, "reward_judge_quality_mean": 0.11249999701976776, "reward_judge_quality_std": 0.051754921674728394, "reward_total_composite_mean": 0.08388496935367584, "reward_total_composite_std": 0.07035890966653824} {"timestamp_utc": "2026-04-12T13:51:29Z", "mode": "train", "global_step": 774, "epoch": 0.031088082901554404, "loss": 0.6796, "grad_norm": 8.25854206085205, "learning_rate": 7.657575757575757e-06, "num_tokens": 1577102.0, "completions/mean_length": 104.375, "completions/min_length": 48.0, "completions/max_length": 456.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 104.375, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 456.0, "rewards/meter/mean": 0.6154877543449402, "rewards/meter/std": 0.3558361530303955, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9594399929046631, "rewards/lexical_plausibility/std": 0.114720918238163, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.27105283737182617, "rewards/repeat_penalty/mean": 0.891266405582428, "rewards/repeat_penalty/std": 0.13831356167793274, "rewards/near_duplicate_penalty/mean": 0.951568603515625, "rewards/near_duplicate_penalty/std": 0.03288222849369049, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9604700803756714, "rewards/distinct_2/std": 0.059027865529060364, "rewards/total_composite/mean": 0.21076039969921112, "rewards/total_composite/std": 0.15587833523750305, "reward": 0.21076039969921112, "reward_std": 0.15587833523750305, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14122696220874786, "sampling/sampling_logp_difference/max": 1.2438321113586426, "sampling/importance_sampling_ratio/min": 0.28827738761901855, "sampling/importance_sampling_ratio/mean": 1.0190385580062866, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.172049954533577, "clip_ratio/low_mean": 0.0631115126889199, "clip_ratio/low_min": 0.0631115126889199, "clip_ratio/high_mean": 0.053981839679181576, "clip_ratio/high_max": 0.053981839679181576, "clip_ratio/region_mean": 0.11709335236810148, "reward_total_mean": 0.21076039969921112, "reward_meter_mean": 0.6154877543449402, "reward_meter_std": 0.3558361530303955, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9594399929046631, "reward_lexical_plausibility_std": 0.114720918238163, "reward_repeat_penalty_mean": 0.891266405582428, "reward_repeat_penalty_std": 0.13831356167793274, "reward_near_duplicate_penalty_mean": 0.951568603515625, "reward_near_duplicate_penalty_std": 0.03288222849369049, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9604700803756714, "reward_distinct_2_std": 0.059027865529060364, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.27105283737182617, "reward_total_composite_mean": 0.21076039969921112, "reward_total_composite_std": 0.15587833523750305} {"timestamp_utc": "2026-04-12T13:51:40Z", "mode": "train", "global_step": 775, "epoch": 0.031128248383339358, "loss": 0.0225, "grad_norm": 7.958051681518555, "learning_rate": 7.654545454545456e-06, "num_tokens": 1579360.0, "completions/mean_length": 116.25, "completions/min_length": 93.0, "completions/max_length": 131.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.25, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.9873641133308411, "rewards/meter/std": 0.006833996623754501, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.5505112409591675, "rewards/repeat_penalty/std": 0.24144576489925385, "rewards/near_duplicate_penalty/mean": 0.8619503974914551, "rewards/near_duplicate_penalty/std": 0.08173158764839172, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.6537202596664429, "rewards/distinct_2/std": 0.21680009365081787, "rewards/total_composite/mean": 0.32486623525619507, "rewards/total_composite/std": 0.08514490723609924, "reward": 0.32486623525619507, "reward_std": 0.08514490723609924, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1114606112241745, "sampling/sampling_logp_difference/max": 2.142119884490967, "sampling/importance_sampling_ratio/min": 0.11740569770336151, "sampling/importance_sampling_ratio/mean": 1.004138469696045, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5601413436233997, "clip_ratio/low_mean": 0.01877616299316287, "clip_ratio/low_min": 0.01877616299316287, "clip_ratio/high_mean": 0.07950412016361952, "clip_ratio/high_max": 0.07950412016361952, "clip_ratio/region_mean": 0.09828028315678239, "reward_total_mean": 0.32486623525619507, "reward_meter_mean": 0.9873641133308411, "reward_meter_std": 0.006833996623754501, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5505112409591675, "reward_repeat_penalty_std": 0.24144576489925385, "reward_near_duplicate_penalty_mean": 0.8619503974914551, "reward_near_duplicate_penalty_std": 0.08173158764839172, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.6537202596664429, "reward_distinct_2_std": 0.21680009365081787, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.32486623525619507, "reward_total_composite_std": 0.08514490723609924} {"timestamp_utc": "2026-04-12T13:51:54Z", "mode": "train", "global_step": 776, "epoch": 0.03116841386512431, "loss": -0.0931, "grad_norm": 3.8162519931793213, "learning_rate": 7.651515151515152e-06, "num_tokens": 1580974.0, "completions/mean_length": 110.75, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.42857360839844, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6486303210258484, "rewards/meter/std": 0.33514273166656494, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9562513828277588, "rewards/lexical_plausibility/std": 0.12373967468738556, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.2585087716579437, "rewards/repeat_penalty/mean": 0.8737409114837646, "rewards/repeat_penalty/std": 0.07075395435094833, "rewards/near_duplicate_penalty/mean": 0.891111433506012, "rewards/near_duplicate_penalty/std": 0.06787948310375214, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9805935621261597, "rewards/distinct_2/std": 0.03112947940826416, "rewards/total_composite/mean": 0.2499900758266449, "rewards/total_composite/std": 0.14878235757350922, "reward": 0.2499900758266449, "reward_std": 0.14878235757350922, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12070675194263458, "sampling/sampling_logp_difference/max": 1.8354015350341797, "sampling/importance_sampling_ratio/min": 0.15954943001270294, "sampling/importance_sampling_ratio/mean": 1.0159733295440674, "sampling/importance_sampling_ratio/max": 1.824219822883606, "entropy": 0.6956275403499603, "clip_ratio/low_mean": 0.01854395680129528, "clip_ratio/low_min": 0.01854395680129528, "clip_ratio/high_mean": 0.06450344668701291, "clip_ratio/high_max": 0.06450344668701291, "clip_ratio/region_mean": 0.08304740348830819, "reward_total_mean": 0.2499900758266449, "reward_meter_mean": 0.6486303210258484, "reward_meter_std": 0.33514273166656494, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9562513828277588, "reward_lexical_plausibility_std": 0.12373967468738556, "reward_repeat_penalty_mean": 0.8737409114837646, "reward_repeat_penalty_std": 0.07075395435094833, "reward_near_duplicate_penalty_mean": 0.891111433506012, "reward_near_duplicate_penalty_std": 0.06787948310375214, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9805935621261597, "reward_distinct_2_std": 0.03112947940826416, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.2585087716579437, "reward_total_composite_mean": 0.2499900758266449, "reward_total_composite_std": 0.14878235757350922} {"timestamp_utc": "2026-04-12T13:52:02Z", "mode": "train", "global_step": 777, "epoch": 0.031208579346909265, "loss": 0.0398, "grad_norm": 16.43800926208496, "learning_rate": 7.648484848484849e-06, "num_tokens": 1582393.0, "completions/mean_length": 24.375, "completions/min_length": 21.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.375, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.7629504203796387, "rewards/meter/std": 0.40981799364089966, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41749998927116394, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.7214998006820679, "rewards/repeat_penalty/std": 0.043466612696647644, "rewards/near_duplicate_penalty/mean": 0.961999773979187, "rewards/near_duplicate_penalty/std": 0.057955484837293625, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2467324286699295, "rewards/total_composite/std": 0.3028090000152588, "reward": 0.2467324286699295, "reward_std": 0.3028090000152588, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16168943047523499, "sampling/sampling_logp_difference/max": 1.7030162811279297, "sampling/importance_sampling_ratio/min": 0.18213333189487457, "sampling/importance_sampling_ratio/mean": 1.0011332035064697, "sampling/importance_sampling_ratio/max": 1.947780966758728, "entropy": 1.216828003525734, "clip_ratio/low_mean": 0.09256851579993963, "clip_ratio/low_min": 0.09256851579993963, "clip_ratio/high_mean": 0.06101190485060215, "clip_ratio/high_max": 0.06101190485060215, "clip_ratio/region_mean": 0.15358042065054178, "reward_total_mean": 0.2467324286699295, "reward_meter_mean": 0.7629504203796387, "reward_meter_std": 0.40981799364089966, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7214998006820679, "reward_repeat_penalty_std": 0.043466612696647644, "reward_near_duplicate_penalty_mean": 0.961999773979187, "reward_near_duplicate_penalty_std": 0.057955484837293625, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41749998927116394, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.2467324286699295, "reward_total_composite_std": 0.3028090000152588} {"timestamp_utc": "2026-04-12T13:52:11Z", "mode": "train", "global_step": 778, "epoch": 0.03124874482869422, "loss": 0.0589, "grad_norm": 9.360218048095703, "learning_rate": 7.645454545454546e-06, "num_tokens": 1584393.0, "completions/mean_length": 69.0, "completions/min_length": 64.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.0, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.9810389280319214, "rewards/meter/std": 0.011988348327577114, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.31638303399086, "rewards/repeat_penalty/mean": 0.7110658884048462, "rewards/repeat_penalty/std": 0.3008081614971161, "rewards/near_duplicate_penalty/mean": 0.8966309428215027, "rewards/near_duplicate_penalty/std": 0.08771822601556778, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8544689416885376, "rewards/distinct_2/std": 0.1578684151172638, "rewards/total_composite/mean": 0.519660234451294, "rewards/total_composite/std": 0.3348424434661865, "reward": 0.519660234451294, "reward_std": 0.33484241366386414, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1279457062482834, "sampling/sampling_logp_difference/max": 1.3275394439697266, "sampling/importance_sampling_ratio/min": 0.26512885093688965, "sampling/importance_sampling_ratio/mean": 1.0034544467926025, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.880782924592495, "clip_ratio/low_mean": 0.06230261968448758, "clip_ratio/low_min": 0.06230261968448758, "clip_ratio/high_mean": 0.07294372469186783, "clip_ratio/high_max": 0.07294372469186783, "clip_ratio/region_mean": 0.1352463443763554, "reward_total_mean": 0.519660234451294, "reward_meter_mean": 0.9810389280319214, "reward_meter_std": 0.011988348327577114, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7110658884048462, "reward_repeat_penalty_std": 0.3008081614971161, "reward_near_duplicate_penalty_mean": 0.8966309428215027, "reward_near_duplicate_penalty_std": 0.08771822601556778, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8544689416885376, "reward_distinct_2_std": 0.1578684151172638, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.31638303399086, "reward_total_composite_mean": 0.519660234451294, "reward_total_composite_std": 0.3348424434661865} {"timestamp_utc": "2026-04-12T13:52:24Z", "mode": "train", "global_step": 779, "epoch": 0.03128891031047917, "loss": -0.0641, "grad_norm": 4.622972011566162, "learning_rate": 7.642424242424244e-06, "num_tokens": 1585794.0, "completions/mean_length": 102.125, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.57143020629883, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6433348655700684, "rewards/meter/std": 0.35852622985839844, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9826866388320923, "rewards/lexical_plausibility/std": 0.04896962642669678, "rewards/judge_quality/mean": 0.5962499976158142, "rewards/judge_quality/std": 0.32945573329925537, "rewards/repeat_penalty/mean": 0.9430086016654968, "rewards/repeat_penalty/std": 0.08734755218029022, "rewards/near_duplicate_penalty/mean": 0.9601523876190186, "rewards/near_duplicate_penalty/std": 0.05086527392268181, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.392836332321167, "rewards/total_composite/std": 0.2896917760372162, "reward": 0.392836332321167, "reward_std": 0.2896917760372162, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13461820781230927, "sampling/sampling_logp_difference/max": 1.3629393577575684, "sampling/importance_sampling_ratio/min": 0.25590747594833374, "sampling/importance_sampling_ratio/mean": 1.0438573360443115, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6360959336161613, "clip_ratio/low_mean": 0.03655368648469448, "clip_ratio/low_min": 0.03655368648469448, "clip_ratio/high_mean": 0.061165111139416695, "clip_ratio/high_max": 0.061165111139416695, "clip_ratio/region_mean": 0.09771879762411118, "reward_total_mean": 0.392836332321167, "reward_meter_mean": 0.6433348655700684, "reward_meter_std": 0.35852622985839844, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9826866388320923, "reward_lexical_plausibility_std": 0.04896962642669678, "reward_repeat_penalty_mean": 0.9430086016654968, "reward_repeat_penalty_std": 0.08734755218029022, "reward_near_duplicate_penalty_mean": 0.9601523876190186, "reward_near_duplicate_penalty_std": 0.05086527392268181, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.5962499976158142, "reward_judge_quality_std": 0.32945573329925537, "reward_total_composite_mean": 0.392836332321167, "reward_total_composite_std": 0.2896917760372162} {"timestamp_utc": "2026-04-12T13:52:34Z", "mode": "train", "global_step": 780, "epoch": 0.03132907579226413, "loss": 0.0711, "grad_norm": 9.191865921020508, "learning_rate": 7.639393939393939e-06, "num_tokens": 1587987.0, "completions/mean_length": 87.125, "completions/min_length": 69.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.125, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.4510396122932434, "rewards/meter/std": 0.3611578941345215, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8547777533531189, "rewards/repeat_penalty/std": 0.10875024646520615, "rewards/near_duplicate_penalty/mean": 0.9258180856704712, "rewards/near_duplicate_penalty/std": 0.06282761693000793, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9203787446022034, "rewards/distinct_2/std": 0.06352870911359787, "rewards/total_composite/mean": 0.15372705459594727, "rewards/total_composite/std": 0.12295910716056824, "reward": 0.15372705459594727, "reward_std": 0.12295910716056824, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10808668285608292, "sampling/sampling_logp_difference/max": 1.3506691455841064, "sampling/importance_sampling_ratio/min": 0.2590668499469757, "sampling/importance_sampling_ratio/mean": 1.0184504985809326, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7183883041143417, "clip_ratio/low_mean": 0.05325394216924906, "clip_ratio/low_min": 0.05325394216924906, "clip_ratio/high_mean": 0.06475755199790001, "clip_ratio/high_max": 0.06475755199790001, "clip_ratio/region_mean": 0.11801149416714907, "reward_total_mean": 0.15372705459594727, "reward_meter_mean": 0.4510396122932434, "reward_meter_std": 0.3611578941345215, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8547777533531189, "reward_repeat_penalty_std": 0.10875024646520615, "reward_near_duplicate_penalty_mean": 0.9258180856704712, "reward_near_duplicate_penalty_std": 0.06282761693000793, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9203787446022034, "reward_distinct_2_std": 0.06352870911359787, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.15372705459594727, "reward_total_composite_std": 0.12295910716056824} {"timestamp_utc": "2026-04-12T13:52:42Z", "mode": "train", "global_step": 781, "epoch": 0.03136924127404908, "loss": 0.061, "grad_norm": 16.4144344329834, "learning_rate": 7.636363636363638e-06, "num_tokens": 1589590.0, "completions/mean_length": 38.375, "completions/min_length": 35.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.375, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.4185240566730499, "rewards/meter/std": 0.4068979322910309, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9657738208770752, "rewards/lexical_plausibility/std": 0.06534077972173691, "rewards/judge_quality/mean": 0.8524999618530273, "rewards/judge_quality/std": 0.20331187546253204, "rewards/repeat_penalty/mean": 0.9121558666229248, "rewards/repeat_penalty/std": 0.0743054747581482, "rewards/near_duplicate_penalty/mean": 0.935652494430542, "rewards/near_duplicate_penalty/std": 0.05105455219745636, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9743589758872986, "rewards/distinct_2/std": 0.047477953135967255, "rewards/total_composite/mean": 0.38194817304611206, "rewards/total_composite/std": 0.38644152879714966, "reward": 0.38194817304611206, "reward_std": 0.38644155859947205, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17882081866264343, "sampling/sampling_logp_difference/max": 2.011857032775879, "sampling/importance_sampling_ratio/min": 0.13374008238315582, "sampling/importance_sampling_ratio/mean": 1.026328206062317, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8333993703126907, "clip_ratio/low_mean": 0.06678113713860512, "clip_ratio/low_min": 0.06678113713860512, "clip_ratio/high_mean": 0.06350760627537966, "clip_ratio/high_max": 0.06350760627537966, "clip_ratio/region_mean": 0.13028874341398478, "reward_total_mean": 0.38194817304611206, "reward_meter_mean": 0.4185240566730499, "reward_meter_std": 0.4068979322910309, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9657738208770752, "reward_lexical_plausibility_std": 0.06534077972173691, "reward_repeat_penalty_mean": 0.9121558666229248, "reward_repeat_penalty_std": 0.0743054747581482, "reward_near_duplicate_penalty_mean": 0.935652494430542, "reward_near_duplicate_penalty_std": 0.05105455219745636, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9743589758872986, "reward_distinct_2_std": 0.047477953135967255, "reward_judge_quality_mean": 0.8524999618530273, "reward_judge_quality_std": 0.20331187546253204, "reward_total_composite_mean": 0.38194817304611206, "reward_total_composite_std": 0.38644152879714966} {"timestamp_utc": "2026-04-12T13:52:50Z", "mode": "train", "global_step": 782, "epoch": 0.031409406755834035, "loss": 0.0893, "grad_norm": 9.844320297241211, "learning_rate": 7.633333333333334e-06, "num_tokens": 1591514.0, "completions/mean_length": 82.5, "completions/min_length": 64.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.5, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.785467803478241, "rewards/meter/std": 0.3208889663219452, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4662500023841858, "rewards/judge_quality/std": 0.17435084283351898, "rewards/repeat_penalty/mean": 0.906518816947937, "rewards/repeat_penalty/std": 0.13854116201400757, "rewards/near_duplicate_penalty/mean": 0.9609131813049316, "rewards/near_duplicate_penalty/std": 0.024943312630057335, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9670645594596863, "rewards/distinct_2/std": 0.05618254095315933, "rewards/total_composite/mean": 0.3451053500175476, "rewards/total_composite/std": 0.15760640799999237, "reward": 0.3451053500175476, "reward_std": 0.15760640799999237, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11764537543058395, "sampling/sampling_logp_difference/max": 1.815509557723999, "sampling/importance_sampling_ratio/min": 0.2030559778213501, "sampling/importance_sampling_ratio/mean": 1.0113693475723267, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7865246385335922, "clip_ratio/low_mean": 0.04976032115519047, "clip_ratio/low_min": 0.04976032115519047, "clip_ratio/high_mean": 0.04963441099971533, "clip_ratio/high_max": 0.04963441099971533, "clip_ratio/region_mean": 0.0993947321549058, "reward_total_mean": 0.3451053500175476, "reward_meter_mean": 0.785467803478241, "reward_meter_std": 0.3208889663219452, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.906518816947937, "reward_repeat_penalty_std": 0.13854116201400757, "reward_near_duplicate_penalty_mean": 0.9609131813049316, "reward_near_duplicate_penalty_std": 0.024943312630057335, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9670645594596863, "reward_distinct_2_std": 0.05618254095315933, "reward_judge_quality_mean": 0.4662500023841858, "reward_judge_quality_std": 0.17435084283351898, "reward_total_composite_mean": 0.3451053500175476, "reward_total_composite_std": 0.15760640799999237} {"timestamp_utc": "2026-04-12T13:53:00Z", "mode": "train", "global_step": 783, "epoch": 0.03144957223761899, "loss": 0.0563, "grad_norm": 12.375184059143066, "learning_rate": 7.630303030303031e-06, "num_tokens": 1593360.0, "completions/mean_length": 61.75, "completions/min_length": 55.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.75, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.7023825645446777, "rewards/meter/std": 0.2803703248500824, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.8060828447341919, "rewards/repeat_penalty/std": 0.16500318050384521, "rewards/near_duplicate_penalty/mean": 0.9578722715377808, "rewards/near_duplicate_penalty/std": 0.028928671032190323, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9550883769989014, "rewards/distinct_2/std": 0.0376155711710453, "rewards/total_composite/mean": 0.35603511333465576, "rewards/total_composite/std": 0.19789965450763702, "reward": 0.35603511333465576, "reward_std": 0.19789965450763702, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1304122656583786, "sampling/sampling_logp_difference/max": 2.1529884338378906, "sampling/importance_sampling_ratio/min": 0.1161365658044815, "sampling/importance_sampling_ratio/mean": 1.0186083316802979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9203171506524086, "clip_ratio/low_mean": 0.04593327455222607, "clip_ratio/low_min": 0.04593327455222607, "clip_ratio/high_mean": 0.1020668912678957, "clip_ratio/high_max": 0.1020668912678957, "clip_ratio/region_mean": 0.14800016582012177, "reward_total_mean": 0.35603511333465576, "reward_meter_mean": 0.7023825645446777, "reward_meter_std": 0.2803703248500824, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.8060828447341919, "reward_repeat_penalty_std": 0.16500318050384521, "reward_near_duplicate_penalty_mean": 0.9578722715377808, "reward_near_duplicate_penalty_std": 0.028928671032190323, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9550883769989014, "reward_distinct_2_std": 0.0376155711710453, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.35603511333465576, "reward_total_composite_std": 0.19789965450763702} {"timestamp_utc": "2026-04-12T13:53:09Z", "mode": "train", "global_step": 784, "epoch": 0.03148973771940394, "loss": 0.0805, "grad_norm": 10.62993335723877, "learning_rate": 7.627272727272727e-06, "num_tokens": 1595054.0, "completions/mean_length": 55.75, "completions/min_length": 48.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.75, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.4122018814086914, "rewards/meter/std": 0.45157957077026367, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.47999998927116394, "rewards/judge_quality/std": 0.28400203585624695, "rewards/repeat_penalty/mean": 0.9630240797996521, "rewards/repeat_penalty/std": 0.031217806041240692, "rewards/near_duplicate_penalty/mean": 0.9630240797996521, "rewards/near_duplicate_penalty/std": 0.031217806041240692, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22415006160736084, "rewards/total_composite/std": 0.30988043546676636, "reward": 0.22415006160736084, "reward_std": 0.30988043546676636, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13101045787334442, "sampling/sampling_logp_difference/max": 2.3957738876342773, "sampling/importance_sampling_ratio/min": 0.09110214561223984, "sampling/importance_sampling_ratio/mean": 0.9963176250457764, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7998340651392937, "clip_ratio/low_mean": 0.06532953213900328, "clip_ratio/low_min": 0.06532953213900328, "clip_ratio/high_mean": 0.04112681280821562, "clip_ratio/high_max": 0.04112681280821562, "clip_ratio/region_mean": 0.1064563449472189, "reward_total_mean": 0.22415006160736084, "reward_meter_mean": 0.4122018814086914, "reward_meter_std": 0.45157957077026367, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.9630240797996521, "reward_repeat_penalty_std": 0.031217806041240692, "reward_near_duplicate_penalty_mean": 0.9630240797996521, "reward_near_duplicate_penalty_std": 0.031217806041240692, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.47999998927116394, "reward_judge_quality_std": 0.28400203585624695, "reward_total_composite_mean": 0.22415006160736084, "reward_total_composite_std": 0.30988043546676636} {"timestamp_utc": "2026-04-12T13:53:17Z", "mode": "train", "global_step": 785, "epoch": 0.0315299032011889, "loss": 0.044, "grad_norm": 12.129380226135254, "learning_rate": 7.6242424242424254e-06, "num_tokens": 1596896.0, "completions/mean_length": 63.25, "completions/min_length": 54.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.25, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.4240260124206543, "rewards/meter/std": 0.26575201749801636, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.97265625, "rewards/lexical_plausibility/std": 0.07733980566263199, "rewards/judge_quality/mean": 0.8612500429153442, "rewards/judge_quality/std": 0.16617010533809662, "rewards/repeat_penalty/mean": 0.9878485202789307, "rewards/repeat_penalty/std": 0.010732484050095081, "rewards/near_duplicate_penalty/mean": 0.9878485202789307, "rewards/near_duplicate_penalty/std": 0.010732484050095081, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3471768796443939, "rewards/total_composite/std": 0.21641911566257477, "reward": 0.3471768796443939, "reward_std": 0.21641911566257477, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14089399576187134, "sampling/sampling_logp_difference/max": 1.877039909362793, "sampling/importance_sampling_ratio/min": 0.15304245054721832, "sampling/importance_sampling_ratio/mean": 0.9881336688995361, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5656032934784889, "clip_ratio/low_mean": 0.07480002893134952, "clip_ratio/low_min": 0.07480002893134952, "clip_ratio/high_mean": 0.021241830196231604, "clip_ratio/high_max": 0.021241830196231604, "clip_ratio/region_mean": 0.09604185912758112, "reward_total_mean": 0.3471768796443939, "reward_meter_mean": 0.4240260124206543, "reward_meter_std": 0.26575201749801636, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.97265625, "reward_lexical_plausibility_std": 0.07733980566263199, "reward_repeat_penalty_mean": 0.9878485202789307, "reward_repeat_penalty_std": 0.010732484050095081, "reward_near_duplicate_penalty_mean": 0.9878485202789307, "reward_near_duplicate_penalty_std": 0.010732484050095081, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8612500429153442, "reward_judge_quality_std": 0.16617010533809662, "reward_total_composite_mean": 0.3471768796443939, "reward_total_composite_std": 0.21641911566257477} {"timestamp_utc": "2026-04-12T13:53:28Z", "mode": "train", "global_step": 786, "epoch": 0.03157006868297385, "loss": 0.0438, "grad_norm": 9.026449203491211, "learning_rate": 7.621212121212122e-06, "num_tokens": 1600169.0, "completions/mean_length": 194.125, "completions/min_length": 158.0, "completions/max_length": 220.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 194.125, "completions/min_terminated_length": 158.0, "completions/max_terminated_length": 220.0, "rewards/meter/mean": 0.691949188709259, "rewards/meter/std": 0.21175561845302582, "rewards/count_adherence/mean": 0.9624999761581421, "rewards/count_adherence/std": 0.05175493285059929, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.7400339841842651, "rewards/repeat_penalty/std": 0.10134749114513397, "rewards/near_duplicate_penalty/mean": 0.9417881369590759, "rewards/near_duplicate_penalty/std": 0.02220279909670353, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7936058044433594, "rewards/distinct_2/std": 0.08217776566743851, "rewards/total_composite/mean": 0.2555861473083496, "rewards/total_composite/std": 0.07860279828310013, "reward": 0.2555861473083496, "reward_std": 0.07860280573368073, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14242398738861084, "sampling/sampling_logp_difference/max": 3.973184108734131, "sampling/importance_sampling_ratio/min": 0.01881343312561512, "sampling/importance_sampling_ratio/mean": 0.9988805651664734, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6547017022967339, "clip_ratio/low_mean": 0.05870208702981472, "clip_ratio/low_min": 0.05870208702981472, "clip_ratio/high_mean": 0.05752360261976719, "clip_ratio/high_max": 0.05752360261976719, "clip_ratio/region_mean": 0.11622568964958191, "reward_total_mean": 0.2555861473083496, "reward_meter_mean": 0.691949188709259, "reward_meter_std": 0.21175561845302582, "reward_count_adherence_mean": 0.9624999761581421, "reward_count_adherence_std": 0.05175493285059929, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7400339841842651, "reward_repeat_penalty_std": 0.10134749114513397, "reward_near_duplicate_penalty_mean": 0.9417881369590759, "reward_near_duplicate_penalty_std": 0.02220279909670353, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7936058044433594, "reward_distinct_2_std": 0.08217776566743851, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.2555861473083496, "reward_total_composite_std": 0.07860279828310013} {"timestamp_utc": "2026-04-12T13:53:37Z", "mode": "train", "global_step": 787, "epoch": 0.031610234164758805, "loss": 0.0316, "grad_norm": 9.279489517211914, "learning_rate": 7.618181818181819e-06, "num_tokens": 1602332.0, "completions/mean_length": 91.375, "completions/min_length": 72.0, "completions/max_length": 112.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.375, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 112.0, "rewards/meter/mean": 0.38759708404541016, "rewards/meter/std": 0.31130579113960266, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5537499785423279, "rewards/judge_quality/std": 0.22639647126197815, "rewards/repeat_penalty/mean": 0.9654989242553711, "rewards/repeat_penalty/std": 0.025990501046180725, "rewards/near_duplicate_penalty/mean": 0.9810584783554077, "rewards/near_duplicate_penalty/std": 0.009181052446365356, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9840800166130066, "rewards/distinct_2/std": 0.022015659138560295, "rewards/total_composite/mean": 0.21744802594184875, "rewards/total_composite/std": 0.2141205370426178, "reward": 0.21744802594184875, "reward_std": 0.2141205370426178, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12602442502975464, "sampling/sampling_logp_difference/max": 1.798635482788086, "sampling/importance_sampling_ratio/min": 0.16552460193634033, "sampling/importance_sampling_ratio/mean": 1.0107314586639404, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7529631331562996, "clip_ratio/low_mean": 0.06275359215214849, "clip_ratio/low_min": 0.06275359215214849, "clip_ratio/high_mean": 0.050168365240097046, "clip_ratio/high_max": 0.050168365240097046, "clip_ratio/region_mean": 0.11292195739224553, "reward_total_mean": 0.21744802594184875, "reward_meter_mean": 0.38759708404541016, "reward_meter_std": 0.31130579113960266, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9654989242553711, "reward_repeat_penalty_std": 0.025990501046180725, "reward_near_duplicate_penalty_mean": 0.9810584783554077, "reward_near_duplicate_penalty_std": 0.009181052446365356, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9840800166130066, "reward_distinct_2_std": 0.022015659138560295, "reward_judge_quality_mean": 0.5537499785423279, "reward_judge_quality_std": 0.22639647126197815, "reward_total_composite_mean": 0.21744802594184875, "reward_total_composite_std": 0.2141205370426178} {"timestamp_utc": "2026-04-12T13:53:45Z", "mode": "train", "global_step": 788, "epoch": 0.03165039964654376, "loss": 0.078, "grad_norm": 12.124133110046387, "learning_rate": 7.6151515151515155e-06, "num_tokens": 1604041.0, "completions/mean_length": 54.625, "completions/min_length": 49.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.625, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6030672788619995, "rewards/meter/std": 0.34272781014442444, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.3554876148700714, "rewards/repeat_penalty/mean": 0.9607193470001221, "rewards/repeat_penalty/std": 0.051950499415397644, "rewards/near_duplicate_penalty/mean": 0.968349814414978, "rewards/near_duplicate_penalty/std": 0.03550909087061882, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.20431560277938843, "rewards/total_composite/std": 0.12262222170829773, "reward": 0.20431560277938843, "reward_std": 0.12262222170829773, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13692446053028107, "sampling/sampling_logp_difference/max": 1.3064236640930176, "sampling/importance_sampling_ratio/min": 0.27078676223754883, "sampling/importance_sampling_ratio/mean": 1.0283405780792236, "sampling/importance_sampling_ratio/max": 1.9296555519104004, "entropy": 1.1032139733433723, "clip_ratio/low_mean": 0.0755410585552454, "clip_ratio/low_min": 0.0755410585552454, "clip_ratio/high_mean": 0.03683578735217452, "clip_ratio/high_max": 0.03683578735217452, "clip_ratio/region_mean": 0.11237684590741992, "reward_total_mean": 0.20431560277938843, "reward_meter_mean": 0.6030672788619995, "reward_meter_std": 0.34272781014442444, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9607193470001221, "reward_repeat_penalty_std": 0.051950499415397644, "reward_near_duplicate_penalty_mean": 0.968349814414978, "reward_near_duplicate_penalty_std": 0.03550909087061882, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.3554876148700714, "reward_total_composite_mean": 0.20431560277938843, "reward_total_composite_std": 0.12262222170829773} {"timestamp_utc": "2026-04-12T13:53:58Z", "mode": "train", "global_step": 789, "epoch": 0.03169056512832871, "loss": -0.0278, "grad_norm": 2.4306137561798096, "learning_rate": 7.612121212121213e-06, "num_tokens": 1605424.0, "completions/mean_length": 148.875, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 27.83333396911621, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.42209821939468384, "rewards/meter/std": 0.46939533948898315, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.919418454170227, "rewards/lexical_plausibility/std": 0.1502324342727661, "rewards/judge_quality/mean": 0.45125001668930054, "rewards/judge_quality/std": 0.40755149722099304, "rewards/repeat_penalty/mean": 0.7149593234062195, "rewards/repeat_penalty/std": 0.15700507164001465, "rewards/near_duplicate_penalty/mean": 0.9116124510765076, "rewards/near_duplicate_penalty/std": 0.14668512344360352, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1891888976097107, "rewards/total_composite/std": 0.32353198528289795, "reward": 0.1891888976097107, "reward_std": 0.32353198528289795, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11858377605676651, "sampling/sampling_logp_difference/max": 1.191333532333374, "sampling/importance_sampling_ratio/min": 0.3038158416748047, "sampling/importance_sampling_ratio/mean": 1.0269629955291748, "sampling/importance_sampling_ratio/max": 1.8580149412155151, "entropy": 0.6887340247631073, "clip_ratio/low_mean": 0.0416162027977407, "clip_ratio/low_min": 0.0416162027977407, "clip_ratio/high_mean": 0.04620295576751232, "clip_ratio/high_max": 0.04620295576751232, "clip_ratio/region_mean": 0.08781915856525302, "reward_total_mean": 0.1891888976097107, "reward_meter_mean": 0.42209821939468384, "reward_meter_std": 0.46939533948898315, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.919418454170227, "reward_lexical_plausibility_std": 0.1502324342727661, "reward_repeat_penalty_mean": 0.7149593234062195, "reward_repeat_penalty_std": 0.15700507164001465, "reward_near_duplicate_penalty_mean": 0.9116124510765076, "reward_near_duplicate_penalty_std": 0.14668512344360352, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45125001668930054, "reward_judge_quality_std": 0.40755149722099304, "reward_total_composite_mean": 0.1891888976097107, "reward_total_composite_std": 0.32353198528289795} {"timestamp_utc": "2026-04-12T13:54:12Z", "mode": "train", "global_step": 790, "epoch": 0.03173073061011367, "loss": -0.0589, "grad_norm": 5.683746337890625, "learning_rate": 7.609090909090909e-06, "num_tokens": 1607307.0, "completions/mean_length": 122.375, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 66.71428680419922, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.4358466863632202, "rewards/meter/std": 0.41290050745010376, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9692785739898682, "rewards/lexical_plausibility/std": 0.08689332008361816, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.9191659688949585, "rewards/repeat_penalty/std": 0.0840807631611824, "rewards/near_duplicate_penalty/mean": 0.9589775800704956, "rewards/near_duplicate_penalty/std": 0.029607703909277916, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9572770595550537, "rewards/distinct_2/std": 0.06648191809654236, "rewards/total_composite/mean": 0.14345701038837433, "rewards/total_composite/std": 0.1522519737482071, "reward": 0.14345701038837433, "reward_std": 0.1522519588470459, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13306333124637604, "sampling/sampling_logp_difference/max": 1.5143718719482422, "sampling/importance_sampling_ratio/min": 0.21994629502296448, "sampling/importance_sampling_ratio/mean": 1.016107201576233, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7931018397212029, "clip_ratio/low_mean": 0.07569516729563475, "clip_ratio/low_min": 0.07569516729563475, "clip_ratio/high_mean": 0.03265977557748556, "clip_ratio/high_max": 0.03265977557748556, "clip_ratio/region_mean": 0.10835494287312031, "reward_total_mean": 0.14345701038837433, "reward_meter_mean": 0.4358466863632202, "reward_meter_std": 0.41290050745010376, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9692785739898682, "reward_lexical_plausibility_std": 0.08689332008361816, "reward_repeat_penalty_mean": 0.9191659688949585, "reward_repeat_penalty_std": 0.0840807631611824, "reward_near_duplicate_penalty_mean": 0.9589775800704956, "reward_near_duplicate_penalty_std": 0.029607703909277916, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9572770595550537, "reward_distinct_2_std": 0.06648191809654236, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.14345701038837433, "reward_total_composite_std": 0.1522519737482071} {"timestamp_utc": "2026-04-12T13:54:22Z", "mode": "train", "global_step": 791, "epoch": 0.03177089609189862, "loss": 0.0635, "grad_norm": 6.78140115737915, "learning_rate": 7.606060606060606e-06, "num_tokens": 1610303.0, "completions/mean_length": 173.5, "completions/min_length": 152.0, "completions/max_length": 197.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 173.5, "completions/min_terminated_length": 152.0, "completions/max_terminated_length": 197.0, "rewards/meter/mean": 0.8277313709259033, "rewards/meter/std": 0.1654488444328308, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.4860149025917053, "rewards/repeat_penalty/std": 0.23334413766860962, "rewards/near_duplicate_penalty/mean": 0.8298006057739258, "rewards/near_duplicate_penalty/std": 0.06878306716680527, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.04419417306780815, "rewards/distinct_2/mean": 0.6087020635604858, "rewards/distinct_2/std": 0.2167627364397049, "rewards/total_composite/mean": 0.18599867820739746, "rewards/total_composite/std": 0.09120912849903107, "reward": 0.18599867820739746, "reward_std": 0.09120912849903107, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09823337942361832, "sampling/sampling_logp_difference/max": 3.743842601776123, "sampling/importance_sampling_ratio/min": 0.023663001134991646, "sampling/importance_sampling_ratio/mean": 1.0083887577056885, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.579167727380991, "clip_ratio/low_mean": 0.03915188554674387, "clip_ratio/low_min": 0.03915188554674387, "clip_ratio/high_mean": 0.046736656688153744, "clip_ratio/high_max": 0.046736656688153744, "clip_ratio/region_mean": 0.08588854223489761, "reward_total_mean": 0.18599867820739746, "reward_meter_mean": 0.8277313709259033, "reward_meter_std": 0.1654488444328308, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4860149025917053, "reward_repeat_penalty_std": 0.23334413766860962, "reward_near_duplicate_penalty_mean": 0.8298006057739258, "reward_near_duplicate_penalty_std": 0.06878306716680527, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.04419417306780815, "reward_distinct_2_mean": 0.6087020635604858, "reward_distinct_2_std": 0.2167627364397049, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.18599867820739746, "reward_total_composite_std": 0.09120912849903107} {"timestamp_utc": "2026-04-12T13:54:32Z", "mode": "train", "global_step": 792, "epoch": 0.031811061573683574, "loss": -0.0291, "grad_norm": 7.867350101470947, "learning_rate": 7.603030303030303e-06, "num_tokens": 1612875.0, "completions/mean_length": 117.5, "completions/min_length": 99.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 117.5, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.8110174536705017, "rewards/meter/std": 0.2681174874305725, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.6792880296707153, "rewards/repeat_penalty/std": 0.12674009799957275, "rewards/near_duplicate_penalty/mean": 0.8890895843505859, "rewards/near_duplicate_penalty/std": 0.040204595774412155, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7828903794288635, "rewards/distinct_2/std": 0.0826951339840889, "rewards/total_composite/mean": 0.2730887532234192, "rewards/total_composite/std": 0.11727865040302277, "reward": 0.2730887532234192, "reward_std": 0.11727864295244217, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11835320293903351, "sampling/sampling_logp_difference/max": 2.456092596054077, "sampling/importance_sampling_ratio/min": 0.08576942980289459, "sampling/importance_sampling_ratio/mean": 1.0024019479751587, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6475649625062943, "clip_ratio/low_mean": 0.0405631959438324, "clip_ratio/low_min": 0.0405631959438324, "clip_ratio/high_mean": 0.0671022292226553, "clip_ratio/high_max": 0.0671022292226553, "clip_ratio/region_mean": 0.1076654251664877, "reward_total_mean": 0.2730887532234192, "reward_meter_mean": 0.8110174536705017, "reward_meter_std": 0.2681174874305725, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6792880296707153, "reward_repeat_penalty_std": 0.12674009799957275, "reward_near_duplicate_penalty_mean": 0.8890895843505859, "reward_near_duplicate_penalty_std": 0.040204595774412155, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7828903794288635, "reward_distinct_2_std": 0.0826951339840889, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.2730887532234192, "reward_total_composite_std": 0.11727865040302277} {"timestamp_utc": "2026-04-12T13:54:46Z", "mode": "train", "global_step": 793, "epoch": 0.03185122705546853, "loss": -0.0664, "grad_norm": 2.1196558475494385, "learning_rate": 7.600000000000001e-06, "num_tokens": 1614471.0, "completions/mean_length": 226.5, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 55.20000076293945, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.39400628209114075, "rewards/meter/std": 0.43972936272621155, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9326790571212769, "rewards/lexical_plausibility/std": 0.09621042013168335, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.3066611886024475, "rewards/repeat_penalty/mean": 0.9104909896850586, "rewards/repeat_penalty/std": 0.1162523701786995, "rewards/near_duplicate_penalty/mean": 0.9561881422996521, "rewards/near_duplicate_penalty/std": 0.06250674277544022, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.13824868202209473, "rewards/total_composite/std": 0.17110635340213776, "reward": 0.13824868202209473, "reward_std": 0.17110635340213776, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13401292264461517, "sampling/sampling_logp_difference/max": 1.46588134765625, "sampling/importance_sampling_ratio/min": 0.2308744192123413, "sampling/importance_sampling_ratio/mean": 1.0125057697296143, "sampling/importance_sampling_ratio/max": 1.8767222166061401, "entropy": 0.5378298386931419, "clip_ratio/low_mean": 0.02801724150776863, "clip_ratio/low_min": 0.02801724150776863, "clip_ratio/high_mean": 0.050941724330186844, "clip_ratio/high_max": 0.050941724330186844, "clip_ratio/region_mean": 0.07895896583795547, "reward_total_mean": 0.13824868202209473, "reward_meter_mean": 0.39400628209114075, "reward_meter_std": 0.43972936272621155, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9326790571212769, "reward_lexical_plausibility_std": 0.09621042013168335, "reward_repeat_penalty_mean": 0.9104909896850586, "reward_repeat_penalty_std": 0.1162523701786995, "reward_near_duplicate_penalty_mean": 0.9561881422996521, "reward_near_duplicate_penalty_std": 0.06250674277544022, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.3066611886024475, "reward_total_composite_mean": 0.13824868202209473, "reward_total_composite_std": 0.17110635340213776} {"timestamp_utc": "2026-04-12T13:54:59Z", "mode": "train", "global_step": 794, "epoch": 0.03189139253725348, "loss": -0.0458, "grad_norm": 1.9994498491287231, "learning_rate": 7.596969696969697e-06, "num_tokens": 1615952.0, "completions/mean_length": 225.125, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 53.0, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.30815163254737854, "rewards/meter/std": 0.4055858552455902, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9001245498657227, "rewards/lexical_plausibility/std": 0.13998135924339294, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.29875636100769043, "rewards/repeat_penalty/mean": 0.8298996090888977, "rewards/repeat_penalty/std": 0.17024771869182587, "rewards/near_duplicate_penalty/mean": 0.9721620082855225, "rewards/near_duplicate_penalty/std": 0.05000936985015869, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9688255786895752, "rewards/distinct_2/std": 0.06448943167924881, "rewards/total_composite/mean": 0.08152542263269424, "rewards/total_composite/std": 0.13616929948329926, "reward": 0.08152542263269424, "reward_std": 0.13616929948329926, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1460765153169632, "sampling/sampling_logp_difference/max": 1.451857566833496, "sampling/importance_sampling_ratio/min": 0.2341349720954895, "sampling/importance_sampling_ratio/mean": 1.0301177501678467, "sampling/importance_sampling_ratio/max": 1.8213194608688354, "entropy": 0.8199094757437706, "clip_ratio/low_mean": 0.04438250511884689, "clip_ratio/low_min": 0.04438250511884689, "clip_ratio/high_mean": 0.026405845768749714, "clip_ratio/high_max": 0.026405845768749714, "clip_ratio/region_mean": 0.07078835088759661, "reward_total_mean": 0.08152542263269424, "reward_meter_mean": 0.30815163254737854, "reward_meter_std": 0.4055858552455902, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9001245498657227, "reward_lexical_plausibility_std": 0.13998135924339294, "reward_repeat_penalty_mean": 0.8298996090888977, "reward_repeat_penalty_std": 0.17024771869182587, "reward_near_duplicate_penalty_mean": 0.9721620082855225, "reward_near_duplicate_penalty_std": 0.05000936985015869, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9688255786895752, "reward_distinct_2_std": 0.06448943167924881, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.29875636100769043, "reward_total_composite_mean": 0.08152542263269424, "reward_total_composite_std": 0.13616929948329926} {"timestamp_utc": "2026-04-12T13:55:08Z", "mode": "train", "global_step": 795, "epoch": 0.031931558019038436, "loss": 0.0811, "grad_norm": 10.82763385772705, "learning_rate": 7.593939393939395e-06, "num_tokens": 1617655.0, "completions/mean_length": 57.875, "completions/min_length": 52.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.875, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.6357424855232239, "rewards/meter/std": 0.36386656761169434, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9697063565254211, "rewards/repeat_penalty/std": 0.04479420930147171, "rewards/near_duplicate_penalty/mean": 0.9770572185516357, "rewards/near_duplicate_penalty/std": 0.03484059497714043, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.22125570476055145, "rewards/total_composite/std": 0.1574130803346634, "reward": 0.22125570476055145, "reward_std": 0.1574130803346634, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14132018387317657, "sampling/sampling_logp_difference/max": 1.8274240493774414, "sampling/importance_sampling_ratio/min": 0.16082732379436493, "sampling/importance_sampling_ratio/mean": 1.0085033178329468, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1949525251984596, "clip_ratio/low_mean": 0.04530677758157253, "clip_ratio/low_min": 0.04530677758157253, "clip_ratio/high_mean": 0.06336268410086632, "clip_ratio/high_max": 0.06336268410086632, "clip_ratio/region_mean": 0.10866946168243885, "reward_total_mean": 0.22125570476055145, "reward_meter_mean": 0.6357424855232239, "reward_meter_std": 0.36386656761169434, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9697063565254211, "reward_repeat_penalty_std": 0.04479420930147171, "reward_near_duplicate_penalty_mean": 0.9770572185516357, "reward_near_duplicate_penalty_std": 0.03484059497714043, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.22125570476055145, "reward_total_composite_std": 0.1574130803346634} {"timestamp_utc": "2026-04-12T13:55:23Z", "mode": "train", "global_step": 796, "epoch": 0.03197172350082339, "loss": -0.1423, "grad_norm": 3.7218844890594482, "learning_rate": 7.590909090909091e-06, "num_tokens": 1620466.0, "completions/mean_length": 227.375, "completions/min_length": 165.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 186.71429443359375, "completions/min_terminated_length": 165.0, "completions/max_terminated_length": 212.0, "rewards/meter/mean": 0.8557415008544922, "rewards/meter/std": 0.2478206753730774, "rewards/count_adherence/mean": 0.8035714626312256, "rewards/count_adherence/std": 0.15152288973331451, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9750967621803284, "rewards/lexical_plausibility/std": 0.070436991751194, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.647225022315979, "rewards/repeat_penalty/std": 0.1830524355173111, "rewards/near_duplicate_penalty/mean": 0.9145234227180481, "rewards/near_duplicate_penalty/std": 0.04553912580013275, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.737200140953064, "rewards/distinct_2/std": 0.13940955698490143, "rewards/total_composite/mean": 0.19946572184562683, "rewards/total_composite/std": 0.11524349451065063, "reward": 0.19946572184562683, "reward_std": 0.11524349451065063, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11161487549543381, "sampling/sampling_logp_difference/max": 1.481365442276001, "sampling/importance_sampling_ratio/min": 0.22732707858085632, "sampling/importance_sampling_ratio/mean": 1.0250014066696167, "sampling/importance_sampling_ratio/max": 1.9287081956863403, "entropy": 0.9043225273489952, "clip_ratio/low_mean": 0.021276067942380905, "clip_ratio/low_min": 0.021276067942380905, "clip_ratio/high_mean": 0.06665316876024008, "clip_ratio/high_max": 0.06665316876024008, "clip_ratio/region_mean": 0.08792923670262098, "reward_total_mean": 0.19946572184562683, "reward_meter_mean": 0.8557415008544922, "reward_meter_std": 0.2478206753730774, "reward_count_adherence_mean": 0.8035714626312256, "reward_count_adherence_std": 0.15152288973331451, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9750967621803284, "reward_lexical_plausibility_std": 0.070436991751194, "reward_repeat_penalty_mean": 0.647225022315979, "reward_repeat_penalty_std": 0.1830524355173111, "reward_near_duplicate_penalty_mean": 0.9145234227180481, "reward_near_duplicate_penalty_std": 0.04553912580013275, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.737200140953064, "reward_distinct_2_std": 0.13940955698490143, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.19946572184562683, "reward_total_composite_std": 0.11524349451065063} {"timestamp_utc": "2026-04-12T13:55:37Z", "mode": "train", "global_step": 797, "epoch": 0.032011888982608344, "loss": -0.0865, "grad_norm": 2.3491971492767334, "learning_rate": 7.587878787878788e-06, "num_tokens": 1622248.0, "completions/mean_length": 231.75, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 63.60000228881836, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.8426979184150696, "rewards/meter/std": 0.2519124448299408, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9274377822875977, "rewards/lexical_plausibility/std": 0.08428309857845306, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.6938273310661316, "rewards/repeat_penalty/std": 0.20207174122333527, "rewards/near_duplicate_penalty/mean": 0.894913375377655, "rewards/near_duplicate_penalty/std": 0.09684357792139053, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9376318454742432, "rewards/distinct_2/std": 0.08143006265163422, "rewards/total_composite/mean": 0.2021869719028473, "rewards/total_composite/std": 0.1991923749446869, "reward": 0.2021869719028473, "reward_std": 0.1991923600435257, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12575359642505646, "sampling/sampling_logp_difference/max": 1.5154848098754883, "sampling/importance_sampling_ratio/min": 0.2197016477584839, "sampling/importance_sampling_ratio/mean": 1.016856074333191, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6785863637924194, "clip_ratio/low_mean": 0.04193564131855965, "clip_ratio/low_min": 0.04193564131855965, "clip_ratio/high_mean": 0.03797266911715269, "clip_ratio/high_max": 0.03797266911715269, "clip_ratio/region_mean": 0.07990831043571234, "reward_total_mean": 0.2021869719028473, "reward_meter_mean": 0.8426979184150696, "reward_meter_std": 0.2519124448299408, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9274377822875977, "reward_lexical_plausibility_std": 0.08428309857845306, "reward_repeat_penalty_mean": 0.6938273310661316, "reward_repeat_penalty_std": 0.20207174122333527, "reward_near_duplicate_penalty_mean": 0.894913375377655, "reward_near_duplicate_penalty_std": 0.09684357792139053, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9376318454742432, "reward_distinct_2_std": 0.08143006265163422, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.2021869719028473, "reward_total_composite_std": 0.1991923749446869} {"timestamp_utc": "2026-04-12T13:55:51Z", "mode": "train", "global_step": 798, "epoch": 0.0320520544643933, "loss": -0.045, "grad_norm": 4.649588108062744, "learning_rate": 7.584848484848486e-06, "num_tokens": 1623895.0, "completions/mean_length": 106.875, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.000003814697266, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.6023092865943909, "rewards/meter/std": 0.4553332030773163, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9571899175643921, "rewards/lexical_plausibility/std": 0.1210852637887001, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9110137820243835, "rewards/repeat_penalty/std": 0.09770961850881577, "rewards/near_duplicate_penalty/mean": 0.959513783454895, "rewards/near_duplicate_penalty/std": 0.04790858179330826, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9807209968566895, "rewards/distinct_2/std": 0.0357571542263031, "rewards/total_composite/mean": 0.1801133155822754, "rewards/total_composite/std": 0.16981984674930573, "reward": 0.1801133155822754, "reward_std": 0.16981984674930573, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14103667438030243, "sampling/sampling_logp_difference/max": 1.1155471801757812, "sampling/importance_sampling_ratio/min": 0.32773590087890625, "sampling/importance_sampling_ratio/mean": 1.0315786600112915, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1726729571819305, "clip_ratio/low_mean": 0.08622794505208731, "clip_ratio/low_min": 0.08622794505208731, "clip_ratio/high_mean": 0.04975543078035116, "clip_ratio/high_max": 0.04975543078035116, "clip_ratio/region_mean": 0.13598337583243847, "reward_total_mean": 0.1801133155822754, "reward_meter_mean": 0.6023092865943909, "reward_meter_std": 0.4553332030773163, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9571899175643921, "reward_lexical_plausibility_std": 0.1210852637887001, "reward_repeat_penalty_mean": 0.9110137820243835, "reward_repeat_penalty_std": 0.09770961850881577, "reward_near_duplicate_penalty_mean": 0.959513783454895, "reward_near_duplicate_penalty_std": 0.04790858179330826, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9807209968566895, "reward_distinct_2_std": 0.0357571542263031, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.1801133155822754, "reward_total_composite_std": 0.16981984674930573} {"timestamp_utc": "2026-04-12T13:56:05Z", "mode": "train", "global_step": 799, "epoch": 0.03209221994617825, "loss": -0.2154, "grad_norm": 2.5473053455352783, "learning_rate": 7.581818181818183e-06, "num_tokens": 1626541.0, "completions/mean_length": 260.75, "completions/min_length": 160.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 177.0, "completions/min_terminated_length": 160.0, "completions/max_terminated_length": 188.0, "rewards/meter/mean": 0.3980942964553833, "rewards/meter/std": 0.3225463926792145, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.27532118558883667, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9650053381919861, "rewards/lexical_plausibility/std": 0.06587570905685425, "rewards/judge_quality/mean": 0.17499999701976776, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.6902345418930054, "rewards/repeat_penalty/std": 0.24288712441921234, "rewards/near_duplicate_penalty/mean": 0.9081143736839294, "rewards/near_duplicate_penalty/std": 0.06450329720973969, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0578637570142746, "rewards/distinct_2/mean": 0.7805726528167725, "rewards/distinct_2/std": 0.18296225368976593, "rewards/total_composite/mean": 0.06317733228206635, "rewards/total_composite/std": 0.04797625169157982, "reward": 0.06317733228206635, "reward_std": 0.04797625169157982, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12680472433567047, "sampling/sampling_logp_difference/max": 1.7284345626831055, "sampling/importance_sampling_ratio/min": 0.1775621473789215, "sampling/importance_sampling_ratio/mean": 1.0184462070465088, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8330177888274193, "clip_ratio/low_mean": 0.025344843044877052, "clip_ratio/low_min": 0.025344843044877052, "clip_ratio/high_mean": 0.06401803530752659, "clip_ratio/high_max": 0.06401803530752659, "clip_ratio/region_mean": 0.08936287835240364, "reward_total_mean": 0.06317733228206635, "reward_meter_mean": 0.3980942964553833, "reward_meter_std": 0.3225463926792145, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.27532118558883667, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9650053381919861, "reward_lexical_plausibility_std": 0.06587570905685425, "reward_repeat_penalty_mean": 0.6902345418930054, "reward_repeat_penalty_std": 0.24288712441921234, "reward_near_duplicate_penalty_mean": 0.9081143736839294, "reward_near_duplicate_penalty_std": 0.06450329720973969, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0578637570142746, "reward_distinct_2_mean": 0.7805726528167725, "reward_distinct_2_std": 0.18296225368976593, "reward_judge_quality_mean": 0.17499999701976776, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.06317733228206635, "reward_total_composite_std": 0.04797625169157982} {"timestamp_utc": "2026-04-12T13:56:19Z", "mode": "train", "global_step": 800, "epoch": 0.032132385427963206, "loss": -0.0944, "grad_norm": 2.552888870239258, "learning_rate": 7.57878787878788e-06, "num_tokens": 1628227.0, "completions/mean_length": 242.75, "completions/min_length": 76.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 81.20000457763672, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.446036696434021, "rewards/meter/std": 0.38267219066619873, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.30860668420791626, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9024382829666138, "rewards/lexical_plausibility/std": 0.134896382689476, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.7273341417312622, "rewards/repeat_penalty/std": 0.23968623578548431, "rewards/near_duplicate_penalty/mean": 0.9229803085327148, "rewards/near_duplicate_penalty/std": 0.06741784512996674, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.909904956817627, "rewards/distinct_2/std": 0.08924520760774612, "rewards/total_composite/mean": 0.09542323648929596, "rewards/total_composite/std": 0.11714858561754227, "reward": 0.09542323648929596, "reward_std": 0.11714857816696167, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11899919807910919, "sampling/sampling_logp_difference/max": 1.0878639221191406, "sampling/importance_sampling_ratio/min": 0.33693546056747437, "sampling/importance_sampling_ratio/mean": 1.0266708135604858, "sampling/importance_sampling_ratio/max": 1.9578245878219604, "entropy": 0.521456390619278, "clip_ratio/low_mean": 0.035671756602823734, "clip_ratio/low_min": 0.035671756602823734, "clip_ratio/high_mean": 0.04763440228998661, "clip_ratio/high_max": 0.04763440228998661, "clip_ratio/region_mean": 0.08330615889281034, "reward_total_mean": 0.09542323648929596, "reward_meter_mean": 0.446036696434021, "reward_meter_std": 0.38267219066619873, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.30860668420791626, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9024382829666138, "reward_lexical_plausibility_std": 0.134896382689476, "reward_repeat_penalty_mean": 0.7273341417312622, "reward_repeat_penalty_std": 0.23968623578548431, "reward_near_duplicate_penalty_mean": 0.9229803085327148, "reward_near_duplicate_penalty_std": 0.06741784512996674, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.909904956817627, "reward_distinct_2_std": 0.08924520760774612, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.09542323648929596, "reward_total_composite_std": 0.11714858561754227} {"timestamp_utc": "2026-04-12T13:58:47Z", "mode": "eval", "global_step": 800, "epoch": 0.032132385427963206, "eval_loss": NaN, "eval_runtime": 148.2555, "eval_samples_per_second": 0.701, "eval_steps_per_second": 0.088, "eval_num_tokens": 1628227.0, "eval_completions/mean_length": 251.14423076923077, "eval_completions/min_length": 53.30769230769231, "eval_completions/max_length": 512.0, "eval_completions/clipped_ratio": 0.25961538461538464, "eval_completions/mean_terminated_length": 158.62601118821365, "eval_completions/min_terminated_length": 53.30769230769231, "eval_completions/max_terminated_length": 304.53846153846155, "eval_rewards/meter/mean": 0.509127662732051, "eval_rewards/meter/std": 0.36145220696926117, "eval_rewards/count_adherence/mean": 0.8326160632647001, "eval_rewards/count_adherence/std": 0.21441587977684462, "eval_rewards/arabic_clean/mean": 0.8173076923076923, "eval_rewards/arabic_clean/std": 0.31626112644488996, "eval_rewards/lexical_plausibility/mean": 0.958170601954827, "eval_rewards/lexical_plausibility/std": 0.08274339003345141, "eval_rewards/judge_quality/mean": 0.30413461648500884, "eval_rewards/judge_quality/std": 0.1935537434541262, "eval_rewards/repeat_penalty/mean": 0.6384293872576493, "eval_rewards/repeat_penalty/std": 0.3749214456631587, "eval_rewards/near_duplicate_penalty/mean": 0.8722778191933265, "eval_rewards/near_duplicate_penalty/std": 0.1579323072846119, "eval_rewards/opening_diversity/mean": 0.9181619240687444, "eval_rewards/opening_diversity/std": 0.16182654408308175, "eval_rewards/distinct_2/mean": 0.7001253549869244, "eval_rewards/distinct_2/std": 0.3752513281427897, "eval_rewards/total_composite/mean": 0.142544326873926, "eval_rewards/total_composite/std": 0.1466588183091237, "eval_reward": 0.142544326873926, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.0514264189853118, "eval_sampling/sampling_logp_difference/max": 0.9607755220853366, "eval_sampling/importance_sampling_ratio/min": 0.3911426869722513, "eval_sampling/importance_sampling_ratio/mean": 1.0133316058378954, "eval_sampling/importance_sampling_ratio/max": 1.4807185668211718, "eval_entropy": 0.6052966370032384, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.142544326873926, "eval_reward_meter_mean": 0.509127662732051, "eval_reward_meter_std": 0.36145220696926117, "eval_reward_count_adherence_mean": 0.8326160632647001, "eval_reward_count_adherence_std": 0.21441587977684462, "eval_reward_arabic_clean_mean": 0.8173076923076923, "eval_reward_arabic_clean_std": 0.31626112644488996, "eval_reward_lexical_plausibility_mean": 0.958170601954827, "eval_reward_lexical_plausibility_std": 0.08274339003345141, "eval_reward_repeat_penalty_mean": 0.6384293872576493, "eval_reward_repeat_penalty_std": 0.3749214456631587, "eval_reward_near_duplicate_penalty_mean": 0.8722778191933265, "eval_reward_near_duplicate_penalty_std": 0.1579323072846119, "eval_reward_opening_diversity_mean": 0.9181619240687444, "eval_reward_opening_diversity_std": 0.16182654408308175, "eval_reward_distinct_2_mean": 0.7001253549869244, "eval_reward_distinct_2_std": 0.3752513281427897, "eval_reward_judge_quality_mean": 0.30413461648500884, "eval_reward_judge_quality_std": 0.1935537434541262, "eval_reward_total_composite_mean": 0.142544326873926, "eval_reward_total_composite_std": 0.1466588183091237} {"timestamp_utc": "2026-04-12T13:59:03Z", "mode": "train", "global_step": 801, "epoch": 0.03217255090974816, "loss": -0.0903, "grad_norm": 4.7603678703308105, "learning_rate": 7.5757575757575764e-06, "num_tokens": 1629797.0, "completions/mean_length": 104.25, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 46.000003814697266, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8133636116981506, "rewards/meter/std": 0.307601660490036, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9706271290779114, "rewards/lexical_plausibility/std": 0.0830790102481842, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.8802578449249268, "rewards/repeat_penalty/std": 0.09642595052719116, "rewards/near_duplicate_penalty/mean": 0.9326709508895874, "rewards/near_duplicate_penalty/std": 0.03488456457853317, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.942307710647583, "rewards/distinct_2/std": 0.07962294667959213, "rewards/total_composite/mean": 0.3017697334289551, "rewards/total_composite/std": 0.18662135303020477, "reward": 0.3017697334289551, "reward_std": 0.18662135303020477, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15090008080005646, "sampling/sampling_logp_difference/max": 1.8050336837768555, "sampling/importance_sampling_ratio/min": 0.164468914270401, "sampling/importance_sampling_ratio/mean": 1.0130020380020142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8559260070323944, "clip_ratio/low_mean": 0.015243902802467346, "clip_ratio/low_min": 0.015243902802467346, "clip_ratio/high_mean": 0.09896360617130995, "clip_ratio/high_max": 0.09896360617130995, "clip_ratio/region_mean": 0.1142075089737773, "reward_total_mean": 0.3017697334289551, "reward_meter_mean": 0.8133636116981506, "reward_meter_std": 0.307601660490036, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9706271290779114, "reward_lexical_plausibility_std": 0.0830790102481842, "reward_repeat_penalty_mean": 0.8802578449249268, "reward_repeat_penalty_std": 0.09642595052719116, "reward_near_duplicate_penalty_mean": 0.9326709508895874, "reward_near_duplicate_penalty_std": 0.03488456457853317, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.942307710647583, "reward_distinct_2_std": 0.07962294667959213, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.3017697334289551, "reward_total_composite_std": 0.18662135303020477} {"timestamp_utc": "2026-04-12T13:59:16Z", "mode": "train", "global_step": 802, "epoch": 0.032212716391533114, "loss": -0.0453, "grad_norm": 3.8556666374206543, "learning_rate": 7.572727272727274e-06, "num_tokens": 1631230.0, "completions/mean_length": 87.125, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 26.428571701049805, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.7231729030609131, "rewards/meter/std": 0.4302844703197479, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9578319787979126, "rewards/lexical_plausibility/std": 0.07433262467384338, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.3829747438430786, "rewards/repeat_penalty/mean": 0.7019463181495667, "rewards/repeat_penalty/std": 0.07367491722106934, "rewards/near_duplicate_penalty/mean": 0.935928463935852, "rewards/near_duplicate_penalty/std": 0.09823321551084518, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5763436555862427, "rewards/total_composite/std": 0.4322705566883087, "reward": 0.5763436555862427, "reward_std": 0.43227052688598633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12684661149978638, "sampling/sampling_logp_difference/max": 1.168478012084961, "sampling/importance_sampling_ratio/min": 0.3108396530151367, "sampling/importance_sampling_ratio/mean": 1.0102213621139526, "sampling/importance_sampling_ratio/max": 1.6923881769180298, "entropy": 0.7740373127162457, "clip_ratio/low_mean": 0.024193547666072845, "clip_ratio/low_min": 0.024193547666072845, "clip_ratio/high_mean": 0.0625854698009789, "clip_ratio/high_max": 0.0625854698009789, "clip_ratio/region_mean": 0.08677901746705174, "reward_total_mean": 0.5763436555862427, "reward_meter_mean": 0.7231729030609131, "reward_meter_std": 0.4302844703197479, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9578319787979126, "reward_lexical_plausibility_std": 0.07433262467384338, "reward_repeat_penalty_mean": 0.7019463181495667, "reward_repeat_penalty_std": 0.07367491722106934, "reward_near_duplicate_penalty_mean": 0.935928463935852, "reward_near_duplicate_penalty_std": 0.09823321551084518, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.3829747438430786, "reward_total_composite_mean": 0.5763436555862427, "reward_total_composite_std": 0.4322705566883087} {"timestamp_utc": "2026-04-12T13:59:29Z", "mode": "train", "global_step": 803, "epoch": 0.03225288187331807, "loss": -0.0488, "grad_norm": 1.8177719116210938, "learning_rate": 7.56969696969697e-06, "num_tokens": 1632873.0, "completions/mean_length": 222.375, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 48.60000228881836, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.45540738105773926, "rewards/meter/std": 0.4550536572933197, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9265633821487427, "rewards/lexical_plausibility/std": 0.10626909136772156, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.7691882848739624, "rewards/repeat_penalty/std": 0.2682081460952759, "rewards/near_duplicate_penalty/mean": 0.9177781343460083, "rewards/near_duplicate_penalty/std": 0.10729513317346573, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.9015784859657288, "rewards/distinct_2/std": 0.15883569419384003, "rewards/total_composite/mean": 0.09251372516155243, "rewards/total_composite/std": 0.1316995769739151, "reward": 0.09251372516155243, "reward_std": 0.1316995769739151, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13744182884693146, "sampling/sampling_logp_difference/max": 2.3321428298950195, "sampling/importance_sampling_ratio/min": 0.09708748012781143, "sampling/importance_sampling_ratio/mean": 1.013674020767212, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5119334906339645, "clip_ratio/low_mean": 0.03316326532512903, "clip_ratio/low_min": 0.03316326532512903, "clip_ratio/high_mean": 0.04126336984336376, "clip_ratio/high_max": 0.04126336984336376, "clip_ratio/region_mean": 0.0744266351684928, "reward_total_mean": 0.09251372516155243, "reward_meter_mean": 0.45540738105773926, "reward_meter_std": 0.4550536572933197, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9265633821487427, "reward_lexical_plausibility_std": 0.10626909136772156, "reward_repeat_penalty_mean": 0.7691882848739624, "reward_repeat_penalty_std": 0.2682081460952759, "reward_near_duplicate_penalty_mean": 0.9177781343460083, "reward_near_duplicate_penalty_std": 0.10729513317346573, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.9015784859657288, "reward_distinct_2_std": 0.15883569419384003, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.09251372516155243, "reward_total_composite_std": 0.1316995769739151} {"timestamp_utc": "2026-04-12T13:59:42Z", "mode": "train", "global_step": 804, "epoch": 0.03229304735510302, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.566666666666667e-06, "num_tokens": 1634537.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.8814504146575928, "rewards/meter/std": 0.14642086625099182, "rewards/count_adherence/mean": 0.824999988079071, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.6114320158958435, "rewards/near_duplicate_penalty/std": 0.0560067854821682, "rewards/opening_diversity/mean": 0.83519446849823, "rewards/opening_diversity/std": 0.08232733607292175, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1087028980255127, "rewards/total_composite/std": 0.018740905448794365, "reward": 0.1087028980255127, "reward_std": 0.018740905448794365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.1087028980255127, "reward_meter_mean": 0.8814504146575928, "reward_meter_std": 0.14642086625099182, "reward_count_adherence_mean": 0.824999988079071, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.6114320158958435, "reward_near_duplicate_penalty_std": 0.0560067854821682, "reward_opening_diversity_mean": 0.83519446849823, "reward_opening_diversity_std": 0.08232733607292175, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.1087028980255127, "reward_total_composite_std": 0.018740905448794365} {"timestamp_utc": "2026-04-12T13:59:55Z", "mode": "train", "global_step": 805, "epoch": 0.032333212836887976, "loss": -0.0881, "grad_norm": 3.9951589107513428, "learning_rate": 7.563636363636364e-06, "num_tokens": 1636190.0, "completions/mean_length": 111.625, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.42857360839844, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.29652339220046997, "rewards/meter/std": 0.25362810492515564, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9670965671539307, "rewards/lexical_plausibility/std": 0.09306494146585464, "rewards/judge_quality/mean": 0.45625001192092896, "rewards/judge_quality/std": 0.2859039604663849, "rewards/repeat_penalty/mean": 0.9841243028640747, "rewards/repeat_penalty/std": 0.023894984275102615, "rewards/near_duplicate_penalty/mean": 0.9841243028640747, "rewards/near_duplicate_penalty/std": 0.023894984275102615, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1305471658706665, "rewards/total_composite/std": 0.09607304632663727, "reward": 0.1305471658706665, "reward_std": 0.09607304632663727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12095951288938522, "sampling/sampling_logp_difference/max": 1.6738252639770508, "sampling/importance_sampling_ratio/min": 0.1875283420085907, "sampling/importance_sampling_ratio/mean": 1.0074149370193481, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6449631676077843, "clip_ratio/low_mean": 0.045387988910079, "clip_ratio/low_min": 0.045387988910079, "clip_ratio/high_mean": 0.062398978509008884, "clip_ratio/high_max": 0.062398978509008884, "clip_ratio/region_mean": 0.10778696741908789, "reward_total_mean": 0.1305471658706665, "reward_meter_mean": 0.29652339220046997, "reward_meter_std": 0.25362810492515564, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9670965671539307, "reward_lexical_plausibility_std": 0.09306494146585464, "reward_repeat_penalty_mean": 0.9841243028640747, "reward_repeat_penalty_std": 0.023894984275102615, "reward_near_duplicate_penalty_mean": 0.9841243028640747, "reward_near_duplicate_penalty_std": 0.023894984275102615, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45625001192092896, "reward_judge_quality_std": 0.2859039604663849, "reward_total_composite_mean": 0.1305471658706665, "reward_total_composite_std": 0.09607304632663727} {"timestamp_utc": "2026-04-12T14:00:04Z", "mode": "train", "global_step": 806, "epoch": 0.03237337831867293, "loss": 0.0586, "grad_norm": 9.549102783203125, "learning_rate": 7.560606060606062e-06, "num_tokens": 1637925.0, "completions/mean_length": 52.875, "completions/min_length": 48.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.27364253997802734, "rewards/meter/std": 0.4285583198070526, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.7717296481132507, "rewards/repeat_penalty/std": 0.24070711433887482, "rewards/near_duplicate_penalty/mean": 0.9155372381210327, "rewards/near_duplicate_penalty/std": 0.057281166315078735, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9046062231063843, "rewards/distinct_2/std": 0.15360285341739655, "rewards/total_composite/mean": 0.10954989492893219, "rewards/total_composite/std": 0.1720762699842453, "reward": 0.10954989492893219, "reward_std": 0.1720762699842453, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1407819241285324, "sampling/sampling_logp_difference/max": 2.5419509410858154, "sampling/importance_sampling_ratio/min": 0.07871268689632416, "sampling/importance_sampling_ratio/mean": 1.023868441581726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9626564495265484, "clip_ratio/low_mean": 0.09288047160953283, "clip_ratio/low_min": 0.09288047160953283, "clip_ratio/high_mean": 0.0379081629216671, "clip_ratio/high_max": 0.0379081629216671, "clip_ratio/region_mean": 0.13078863453119993, "reward_total_mean": 0.10954989492893219, "reward_meter_mean": 0.27364253997802734, "reward_meter_std": 0.4285583198070526, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7717296481132507, "reward_repeat_penalty_std": 0.24070711433887482, "reward_near_duplicate_penalty_mean": 0.9155372381210327, "reward_near_duplicate_penalty_std": 0.057281166315078735, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9046062231063843, "reward_distinct_2_std": 0.15360285341739655, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.10954989492893219, "reward_total_composite_std": 0.1720762699842453} {"timestamp_utc": "2026-04-12T14:00:18Z", "mode": "train", "global_step": 807, "epoch": 0.032413543800457884, "loss": -0.1041, "grad_norm": 2.359036445617676, "learning_rate": 7.557575757575758e-06, "num_tokens": 1639638.0, "completions/mean_length": 170.125, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 56.16666793823242, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.4385441541671753, "rewards/meter/std": 0.3289654552936554, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9390053153038025, "rewards/lexical_plausibility/std": 0.08770473301410675, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.7213979959487915, "rewards/repeat_penalty/std": 0.09601594507694244, "rewards/near_duplicate_penalty/mean": 0.9701355695724487, "rewards/near_duplicate_penalty/std": 0.01984023116528988, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9508130550384521, "rewards/distinct_2/std": 0.03979373723268509, "rewards/total_composite/mean": 0.1577109694480896, "rewards/total_composite/std": 0.11559614539146423, "reward": 0.1577109694480896, "reward_std": 0.11559613049030304, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10493512451648712, "sampling/sampling_logp_difference/max": 1.499145746231079, "sampling/importance_sampling_ratio/min": 0.223320871591568, "sampling/importance_sampling_ratio/mean": 1.006955623626709, "sampling/importance_sampling_ratio/max": 1.9603747129440308, "entropy": 0.48986345902085304, "clip_ratio/low_mean": 0.025925926864147186, "clip_ratio/low_min": 0.025925926864147186, "clip_ratio/high_mean": 0.049597340170294046, "clip_ratio/high_max": 0.049597340170294046, "clip_ratio/region_mean": 0.07552326703444123, "reward_total_mean": 0.1577109694480896, "reward_meter_mean": 0.4385441541671753, "reward_meter_std": 0.3289654552936554, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9390053153038025, "reward_lexical_plausibility_std": 0.08770473301410675, "reward_repeat_penalty_mean": 0.7213979959487915, "reward_repeat_penalty_std": 0.09601594507694244, "reward_near_duplicate_penalty_mean": 0.9701355695724487, "reward_near_duplicate_penalty_std": 0.01984023116528988, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9508130550384521, "reward_distinct_2_std": 0.03979373723268509, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.1577109694480896, "reward_total_composite_std": 0.11559614539146423} {"timestamp_utc": "2026-04-12T14:00:31Z", "mode": "train", "global_step": 808, "epoch": 0.03245370928224284, "loss": 0.0102, "grad_norm": 3.2151262760162354, "learning_rate": 7.5545454545454555e-06, "num_tokens": 1641044.0, "completions/mean_length": 82.75, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.428571701049805, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.25902217626571655, "rewards/meter/std": 0.4510461091995239, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9760870933532715, "rewards/lexical_plausibility/std": 0.06763587146997452, "rewards/judge_quality/mean": 0.4699999988079071, "rewards/judge_quality/std": 0.3931557536125183, "rewards/repeat_penalty/mean": 0.7457716464996338, "rewards/repeat_penalty/std": 0.11551118642091751, "rewards/near_duplicate_penalty/mean": 0.9526956081390381, "rewards/near_duplicate_penalty/std": 0.07298299670219421, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13849323987960815, "rewards/total_composite/std": 0.31568512320518494, "reward": 0.13849323987960815, "reward_std": 0.31568509340286255, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18987688422203064, "sampling/sampling_logp_difference/max": 4.385435104370117, "sampling/importance_sampling_ratio/min": 0.012457466684281826, "sampling/importance_sampling_ratio/mean": 1.0182334184646606, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6999455392360687, "clip_ratio/low_mean": 0.07515787286683917, "clip_ratio/low_min": 0.07515787286683917, "clip_ratio/high_mean": 0.013194444589316845, "clip_ratio/high_max": 0.013194444589316845, "clip_ratio/region_mean": 0.08835231745615602, "reward_total_mean": 0.13849323987960815, "reward_meter_mean": 0.25902217626571655, "reward_meter_std": 0.4510461091995239, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9760870933532715, "reward_lexical_plausibility_std": 0.06763587146997452, "reward_repeat_penalty_mean": 0.7457716464996338, "reward_repeat_penalty_std": 0.11551118642091751, "reward_near_duplicate_penalty_mean": 0.9526956081390381, "reward_near_duplicate_penalty_std": 0.07298299670219421, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4699999988079071, "reward_judge_quality_std": 0.3931557536125183, "reward_total_composite_mean": 0.13849323987960815, "reward_total_composite_std": 0.31568512320518494} {"timestamp_utc": "2026-04-12T14:00:41Z", "mode": "train", "global_step": 809, "epoch": 0.03249387476402779, "loss": 0.0209, "grad_norm": 7.382968902587891, "learning_rate": 7.551515151515152e-06, "num_tokens": 1643827.0, "completions/mean_length": 140.875, "completions/min_length": 133.0, "completions/max_length": 149.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 140.875, "completions/min_terminated_length": 133.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.8070170283317566, "rewards/meter/std": 0.2273350954055786, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9989224076271057, "rewards/lexical_plausibility/std": 0.0030478707049041986, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.8352359533309937, "rewards/repeat_penalty/std": 0.05035965517163277, "rewards/near_duplicate_penalty/mean": 0.9464985728263855, "rewards/near_duplicate_penalty/std": 0.024888422340154648, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8819787502288818, "rewards/distinct_2/std": 0.03616122156381607, "rewards/total_composite/mean": 0.2557677924633026, "rewards/total_composite/std": 0.0903015211224556, "reward": 0.2557677924633026, "reward_std": 0.0903015211224556, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10854829847812653, "sampling/sampling_logp_difference/max": 2.001067638397217, "sampling/importance_sampling_ratio/min": 0.13519087433815002, "sampling/importance_sampling_ratio/mean": 1.0040498971939087, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6414512395858765, "clip_ratio/low_mean": 0.031189512461423874, "clip_ratio/low_min": 0.031189512461423874, "clip_ratio/high_mean": 0.07563150580972433, "clip_ratio/high_max": 0.07563150580972433, "clip_ratio/region_mean": 0.1068210182711482, "reward_total_mean": 0.2557677924633026, "reward_meter_mean": 0.8070170283317566, "reward_meter_std": 0.2273350954055786, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9989224076271057, "reward_lexical_plausibility_std": 0.0030478707049041986, "reward_repeat_penalty_mean": 0.8352359533309937, "reward_repeat_penalty_std": 0.05035965517163277, "reward_near_duplicate_penalty_mean": 0.9464985728263855, "reward_near_duplicate_penalty_std": 0.024888422340154648, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8819787502288818, "reward_distinct_2_std": 0.03616122156381607, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2557677924633026, "reward_total_composite_std": 0.0903015211224556} {"timestamp_utc": "2026-04-12T14:00:49Z", "mode": "train", "global_step": 810, "epoch": 0.032534040245812745, "loss": 0.0607, "grad_norm": 15.186004638671875, "learning_rate": 7.548484848484849e-06, "num_tokens": 1645482.0, "completions/mean_length": 49.875, "completions/min_length": 41.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.875, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.6428830623626709, "rewards/meter/std": 0.3336312770843506, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8600000143051147, "rewards/judge_quality/std": 0.2066052109003067, "rewards/repeat_penalty/mean": 0.9832959771156311, "rewards/repeat_penalty/std": 0.023197973147034645, "rewards/near_duplicate_penalty/mean": 0.9832959771156311, "rewards/near_duplicate_penalty/std": 0.023197973147034645, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5680773854255676, "rewards/total_composite/std": 0.35162076354026794, "reward": 0.5680773854255676, "reward_std": 0.35162076354026794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12980584800243378, "sampling/sampling_logp_difference/max": 1.2337841987609863, "sampling/importance_sampling_ratio/min": 0.2911885678768158, "sampling/importance_sampling_ratio/mean": 1.0130921602249146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7987408712506294, "clip_ratio/low_mean": 0.0774453654885292, "clip_ratio/low_min": 0.0774453654885292, "clip_ratio/high_mean": 0.05865356419235468, "clip_ratio/high_max": 0.05865356419235468, "clip_ratio/region_mean": 0.13609892968088388, "reward_total_mean": 0.5680773854255676, "reward_meter_mean": 0.6428830623626709, "reward_meter_std": 0.3336312770843506, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9832959771156311, "reward_repeat_penalty_std": 0.023197973147034645, "reward_near_duplicate_penalty_mean": 0.9832959771156311, "reward_near_duplicate_penalty_std": 0.023197973147034645, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8600000143051147, "reward_judge_quality_std": 0.2066052109003067, "reward_total_composite_mean": 0.5680773854255676, "reward_total_composite_std": 0.35162076354026794} {"timestamp_utc": "2026-04-12T14:01:00Z", "mode": "train", "global_step": 811, "epoch": 0.0325742057275977, "loss": 0.0752, "grad_norm": 7.575557708740234, "learning_rate": 7.545454545454546e-06, "num_tokens": 1648527.0, "completions/mean_length": 145.625, "completions/min_length": 133.0, "completions/max_length": 173.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.625, "completions/min_terminated_length": 133.0, "completions/max_terminated_length": 173.0, "rewards/meter/mean": 0.4031369090080261, "rewards/meter/std": 0.16512039303779602, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.8054443597793579, "rewards/repeat_penalty/std": 0.20166487991809845, "rewards/near_duplicate_penalty/mean": 0.9416308403015137, "rewards/near_duplicate_penalty/std": 0.026360351592302322, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.8756292462348938, "rewards/distinct_2/std": 0.15422005951404572, "rewards/total_composite/mean": 0.13066896796226501, "rewards/total_composite/std": 0.07025513797998428, "reward": 0.13066896796226501, "reward_std": 0.07025514543056488, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12699490785598755, "sampling/sampling_logp_difference/max": 2.679246664047241, "sampling/importance_sampling_ratio/min": 0.06861482560634613, "sampling/importance_sampling_ratio/mean": 1.0148481130599976, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.666357297450304, "clip_ratio/low_mean": 0.081703987903893, "clip_ratio/low_min": 0.081703987903893, "clip_ratio/high_mean": 0.056133151054382324, "clip_ratio/high_max": 0.056133151054382324, "clip_ratio/region_mean": 0.13783713895827532, "reward_total_mean": 0.13066896796226501, "reward_meter_mean": 0.4031369090080261, "reward_meter_std": 0.16512039303779602, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8054443597793579, "reward_repeat_penalty_std": 0.20166487991809845, "reward_near_duplicate_penalty_mean": 0.9416308403015137, "reward_near_duplicate_penalty_std": 0.026360351592302322, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.8756292462348938, "reward_distinct_2_std": 0.15422005951404572, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.13066896796226501, "reward_total_composite_std": 0.07025513797998428} {"timestamp_utc": "2026-04-12T14:01:14Z", "mode": "train", "global_step": 812, "epoch": 0.03261437120938265, "loss": -0.0989, "grad_norm": 3.800428867340088, "learning_rate": 7.542424242424244e-06, "num_tokens": 1650038.0, "completions/mean_length": 106.875, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.000003814697266, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.7874910235404968, "rewards/meter/std": 0.3190709948539734, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9728875160217285, "rewards/lexical_plausibility/std": 0.0766855999827385, "rewards/judge_quality/mean": 0.6812499761581421, "rewards/judge_quality/std": 0.34778639674186707, "rewards/repeat_penalty/mean": 0.9951555728912354, "rewards/repeat_penalty/std": 0.009139057248830795, "rewards/near_duplicate_penalty/mean": 0.9951555728912354, "rewards/near_duplicate_penalty/std": 0.009139057248830795, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6066259145736694, "rewards/total_composite/std": 0.33748865127563477, "reward": 0.6066259145736694, "reward_std": 0.3374886214733124, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11039450764656067, "sampling/sampling_logp_difference/max": 1.1034941673278809, "sampling/importance_sampling_ratio/min": 0.33171001076698303, "sampling/importance_sampling_ratio/mean": 1.0036505460739136, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5837102606892586, "clip_ratio/low_mean": 0.03169326204806566, "clip_ratio/low_min": 0.03169326204806566, "clip_ratio/high_mean": 0.07745151408016682, "clip_ratio/high_max": 0.07745151408016682, "clip_ratio/region_mean": 0.10914477612823248, "reward_total_mean": 0.6066259145736694, "reward_meter_mean": 0.7874910235404968, "reward_meter_std": 0.3190709948539734, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9728875160217285, "reward_lexical_plausibility_std": 0.0766855999827385, "reward_repeat_penalty_mean": 0.9951555728912354, "reward_repeat_penalty_std": 0.009139057248830795, "reward_near_duplicate_penalty_mean": 0.9951555728912354, "reward_near_duplicate_penalty_std": 0.009139057248830795, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6812499761581421, "reward_judge_quality_std": 0.34778639674186707, "reward_total_composite_mean": 0.6066259145736694, "reward_total_composite_std": 0.33748865127563477} {"timestamp_utc": "2026-04-12T14:01:27Z", "mode": "train", "global_step": 813, "epoch": 0.03265453669116761, "loss": -0.1692, "grad_norm": 3.3232412338256836, "learning_rate": 7.53939393939394e-06, "num_tokens": 1652949.0, "completions/mean_length": 235.875, "completions/min_length": 178.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 196.42857360839844, "completions/min_terminated_length": 178.0, "completions/max_terminated_length": 222.0, "rewards/meter/mean": 0.9412060976028442, "rewards/meter/std": 0.09580641239881516, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9826085567474365, "rewards/lexical_plausibility/std": 0.049190327525138855, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.4942803680896759, "rewards/repeat_penalty/std": 0.28950735926628113, "rewards/near_duplicate_penalty/mean": 0.8248645067214966, "rewards/near_duplicate_penalty/std": 0.13155001401901245, "rewards/opening_diversity/mean": 0.9508928656578064, "rewards/opening_diversity/std": 0.08307480067014694, "rewards/distinct_2/mean": 0.576888382434845, "rewards/distinct_2/std": 0.27701079845428467, "rewards/total_composite/mean": 0.21751300990581512, "rewards/total_composite/std": 0.12358205765485764, "reward": 0.21751300990581512, "reward_std": 0.12358205020427704, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08466082066297531, "sampling/sampling_logp_difference/max": 2.178527355194092, "sampling/importance_sampling_ratio/min": 0.11320812255144119, "sampling/importance_sampling_ratio/mean": 1.0056116580963135, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3652648665010929, "clip_ratio/low_mean": 0.02692485461011529, "clip_ratio/low_min": 0.02692485461011529, "clip_ratio/high_mean": 0.03873121226206422, "clip_ratio/high_max": 0.03873121226206422, "clip_ratio/region_mean": 0.06565606687217951, "reward_total_mean": 0.21751300990581512, "reward_meter_mean": 0.9412060976028442, "reward_meter_std": 0.09580641239881516, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9826085567474365, "reward_lexical_plausibility_std": 0.049190327525138855, "reward_repeat_penalty_mean": 0.4942803680896759, "reward_repeat_penalty_std": 0.28950735926628113, "reward_near_duplicate_penalty_mean": 0.8248645067214966, "reward_near_duplicate_penalty_std": 0.13155001401901245, "reward_opening_diversity_mean": 0.9508928656578064, "reward_opening_diversity_std": 0.08307480067014694, "reward_distinct_2_mean": 0.576888382434845, "reward_distinct_2_std": 0.27701079845428467, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.21751300990581512, "reward_total_composite_std": 0.12358205765485764} {"timestamp_utc": "2026-04-12T14:01:41Z", "mode": "train", "global_step": 814, "epoch": 0.03269470217295257, "loss": -0.0491, "grad_norm": 5.6867218017578125, "learning_rate": 7.536363636363637e-06, "num_tokens": 1655171.0, "completions/mean_length": 156.75, "completions/min_length": 94.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 106.00000762939453, "completions/min_terminated_length": 94.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.46127668023109436, "rewards/meter/std": 0.31799080967903137, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9457124471664429, "rewards/lexical_plausibility/std": 0.12819664180278778, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8547135591506958, "rewards/repeat_penalty/std": 0.09622027724981308, "rewards/near_duplicate_penalty/mean": 0.9376049041748047, "rewards/near_duplicate_penalty/std": 0.03273974359035492, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9166576862335205, "rewards/distinct_2/std": 0.07167264819145203, "rewards/total_composite/mean": 0.09750284254550934, "rewards/total_composite/std": 0.0943702831864357, "reward": 0.09750284254550934, "reward_std": 0.0943702831864357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1176077127456665, "sampling/sampling_logp_difference/max": 1.5749835968017578, "sampling/importance_sampling_ratio/min": 0.20701095461845398, "sampling/importance_sampling_ratio/mean": 1.0081753730773926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5940612480044365, "clip_ratio/low_mean": 0.07036321051418781, "clip_ratio/low_min": 0.07036321051418781, "clip_ratio/high_mean": 0.04490788094699383, "clip_ratio/high_max": 0.04490788094699383, "clip_ratio/region_mean": 0.11527109146118164, "reward_total_mean": 0.09750284254550934, "reward_meter_mean": 0.46127668023109436, "reward_meter_std": 0.31799080967903137, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9457124471664429, "reward_lexical_plausibility_std": 0.12819664180278778, "reward_repeat_penalty_mean": 0.8547135591506958, "reward_repeat_penalty_std": 0.09622027724981308, "reward_near_duplicate_penalty_mean": 0.9376049041748047, "reward_near_duplicate_penalty_std": 0.03273974359035492, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9166576862335205, "reward_distinct_2_std": 0.07167264819145203, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.09750284254550934, "reward_total_composite_std": 0.0943702831864357} {"timestamp_utc": "2026-04-12T14:01:55Z", "mode": "train", "global_step": 815, "epoch": 0.03273486765473752, "loss": -0.0806, "grad_norm": 1.8392436504364014, "learning_rate": 7.533333333333334e-06, "num_tokens": 1656727.0, "completions/mean_length": 223.5, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 50.400001525878906, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6055207252502441, "rewards/meter/std": 0.45552077889442444, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9034929275512695, "rewards/lexical_plausibility/std": 0.15283240377902985, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.16903086006641388, "rewards/repeat_penalty/mean": 0.9737361669540405, "rewards/repeat_penalty/std": 0.05313893407583237, "rewards/near_duplicate_penalty/mean": 0.9830358028411865, "rewards/near_duplicate_penalty/std": 0.027686437591910362, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.18413877487182617, "rewards/total_composite/std": 0.1905413419008255, "reward": 0.18413877487182617, "reward_std": 0.1905413120985031, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1374284327030182, "sampling/sampling_logp_difference/max": 1.6445746421813965, "sampling/importance_sampling_ratio/min": 0.1930946707725525, "sampling/importance_sampling_ratio/mean": 1.0112168788909912, "sampling/importance_sampling_ratio/max": 1.7742395401000977, "entropy": 0.5638574585318565, "clip_ratio/low_mean": 0.0026041667442768812, "clip_ratio/low_min": 0.0026041667442768812, "clip_ratio/high_mean": 0.06918557081371546, "clip_ratio/high_max": 0.06918557081371546, "clip_ratio/region_mean": 0.07178973755799234, "reward_total_mean": 0.18413877487182617, "reward_meter_mean": 0.6055207252502441, "reward_meter_std": 0.45552077889442444, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9034929275512695, "reward_lexical_plausibility_std": 0.15283240377902985, "reward_repeat_penalty_mean": 0.9737361669540405, "reward_repeat_penalty_std": 0.05313893407583237, "reward_near_duplicate_penalty_mean": 0.9830358028411865, "reward_near_duplicate_penalty_std": 0.027686437591910362, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.16903086006641388, "reward_total_composite_mean": 0.18413877487182617, "reward_total_composite_std": 0.1905413419008255} {"timestamp_utc": "2026-04-12T14:02:03Z", "mode": "train", "global_step": 816, "epoch": 0.032775033136522476, "loss": 0.112, "grad_norm": 24.046463012695312, "learning_rate": 7.530303030303031e-06, "num_tokens": 1658111.0, "completions/mean_length": 24.0, "completions/min_length": 21.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.8469799757003784, "rewards/meter/std": 0.3430926501750946, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8525000214576721, "rewards/judge_quality/std": 0.20331189036369324, "rewards/repeat_penalty/mean": 0.7330512404441833, "rewards/repeat_penalty/std": 0.032561879605054855, "rewards/near_duplicate_penalty/mean": 0.977401614189148, "rewards/near_duplicate_penalty/std": 0.043415818363428116, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7126477360725403, "rewards/total_composite/std": 0.34694704413414, "reward": 0.7126477360725403, "reward_std": 0.3469470143318176, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13056868314743042, "sampling/sampling_logp_difference/max": 1.508354663848877, "sampling/importance_sampling_ratio/min": 0.2212737500667572, "sampling/importance_sampling_ratio/mean": 0.9936178922653198, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7504385411739349, "clip_ratio/low_mean": 0.052769985049963, "clip_ratio/low_min": 0.052769985049963, "clip_ratio/high_mean": 0.11626353021711111, "clip_ratio/high_max": 0.11626353021711111, "clip_ratio/region_mean": 0.1690335152670741, "reward_total_mean": 0.7126477360725403, "reward_meter_mean": 0.8469799757003784, "reward_meter_std": 0.3430926501750946, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7330512404441833, "reward_repeat_penalty_std": 0.032561879605054855, "reward_near_duplicate_penalty_mean": 0.977401614189148, "reward_near_duplicate_penalty_std": 0.043415818363428116, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8525000214576721, "reward_judge_quality_std": 0.20331189036369324, "reward_total_composite_mean": 0.7126477360725403, "reward_total_composite_std": 0.34694704413414} {"timestamp_utc": "2026-04-12T14:02:12Z", "mode": "train", "global_step": 817, "epoch": 0.03281519861830743, "loss": 0.0616, "grad_norm": 9.506650924682617, "learning_rate": 7.5272727272727274e-06, "num_tokens": 1660075.0, "completions/mean_length": 71.5, "completions/min_length": 55.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.5, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.4503295421600342, "rewards/meter/std": 0.37437984347343445, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.973711371421814, "rewards/repeat_penalty/std": 0.030898524448275566, "rewards/near_duplicate_penalty/mean": 0.9805337190628052, "rewards/near_duplicate_penalty/std": 0.01512462180107832, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.2287340760231018, "rewards/total_composite/std": 0.207951158285141, "reward": 0.2287340760231018, "reward_std": 0.207951158285141, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11539392173290253, "sampling/sampling_logp_difference/max": 1.0871162414550781, "sampling/importance_sampling_ratio/min": 0.3371874690055847, "sampling/importance_sampling_ratio/mean": 1.0085090398788452, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7391100414097309, "clip_ratio/low_mean": 0.06265426147729158, "clip_ratio/low_min": 0.06265426147729158, "clip_ratio/high_mean": 0.02900556055828929, "clip_ratio/high_max": 0.02900556055828929, "clip_ratio/region_mean": 0.09165982203558087, "reward_total_mean": 0.2287340760231018, "reward_meter_mean": 0.4503295421600342, "reward_meter_std": 0.37437984347343445, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.973711371421814, "reward_repeat_penalty_std": 0.030898524448275566, "reward_near_duplicate_penalty_mean": 0.9805337190628052, "reward_near_duplicate_penalty_std": 0.01512462180107832, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.2287340760231018, "reward_total_composite_std": 0.207951158285141} {"timestamp_utc": "2026-04-12T14:02:23Z", "mode": "train", "global_step": 818, "epoch": 0.032855364100092384, "loss": 0.0361, "grad_norm": 4.781548976898193, "learning_rate": 7.524242424242425e-06, "num_tokens": 1663616.0, "completions/mean_length": 252.625, "completions/min_length": 218.0, "completions/max_length": 288.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 252.625, "completions/min_terminated_length": 218.0, "completions/max_terminated_length": 288.0, "rewards/meter/mean": 0.8705605268478394, "rewards/meter/std": 0.20197537541389465, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.05750546231865883, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.24633942544460297, "rewards/repeat_penalty/std": 0.16943033039569855, "rewards/near_duplicate_penalty/mean": 0.7904670238494873, "rewards/near_duplicate_penalty/std": 0.12964604794979095, "rewards/opening_diversity/mean": 0.9895833730697632, "rewards/opening_diversity/std": 0.029462775215506554, "rewards/distinct_2/mean": 0.32842856645584106, "rewards/distinct_2/std": 0.2051476538181305, "rewards/total_composite/mean": 0.23434017598628998, "rewards/total_composite/std": 0.10898102074861526, "reward": 0.23434017598628998, "reward_std": 0.10898101329803467, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07445370405912399, "sampling/sampling_logp_difference/max": 2.2147040367126465, "sampling/importance_sampling_ratio/min": 0.10918582230806351, "sampling/importance_sampling_ratio/mean": 0.998491108417511, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.37534728460013866, "clip_ratio/low_mean": 0.03056690702214837, "clip_ratio/low_min": 0.03056690702214837, "clip_ratio/high_mean": 0.04160299897193909, "clip_ratio/high_max": 0.04160299897193909, "clip_ratio/region_mean": 0.07216990599408746, "reward_total_mean": 0.23434017598628998, "reward_meter_mean": 0.8705605268478394, "reward_meter_std": 0.20197537541389465, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.05750546231865883, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.24633942544460297, "reward_repeat_penalty_std": 0.16943033039569855, "reward_near_duplicate_penalty_mean": 0.7904670238494873, "reward_near_duplicate_penalty_std": 0.12964604794979095, "reward_opening_diversity_mean": 0.9895833730697632, "reward_opening_diversity_std": 0.029462775215506554, "reward_distinct_2_mean": 0.32842856645584106, "reward_distinct_2_std": 0.2051476538181305, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.23434017598628998, "reward_total_composite_std": 0.10898102074861526} {"timestamp_utc": "2026-04-12T14:02:37Z", "mode": "train", "global_step": 819, "epoch": 0.03289552958187734, "loss": -0.0568, "grad_norm": 2.4939849376678467, "learning_rate": 7.521212121212121e-06, "num_tokens": 1665105.0, "completions/mean_length": 222.125, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 48.20000076293945, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.48654890060424805, "rewards/meter/std": 0.4777888357639313, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9322326183319092, "rewards/lexical_plausibility/std": 0.09612184762954712, "rewards/judge_quality/mean": 0.4125000238418579, "rewards/judge_quality/std": 0.35346245765686035, "rewards/repeat_penalty/mean": 0.998511016368866, "rewards/repeat_penalty/std": 0.0029533349443227053, "rewards/near_duplicate_penalty/mean": 0.9990079402923584, "rewards/near_duplicate_penalty/std": 0.0028059897013008595, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9995030760765076, "rewards/distinct_2/std": 0.0014054919593036175, "rewards/total_composite/mean": 0.21199412643909454, "rewards/total_composite/std": 0.28878629207611084, "reward": 0.21199412643909454, "reward_std": 0.28878626227378845, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14067530632019043, "sampling/sampling_logp_difference/max": 1.3530428409576416, "sampling/importance_sampling_ratio/min": 0.2584526240825653, "sampling/importance_sampling_ratio/mean": 0.991131603717804, "sampling/importance_sampling_ratio/max": 1.9702669382095337, "entropy": 0.5373192317783833, "clip_ratio/low_mean": 0.01886792480945587, "clip_ratio/low_min": 0.01886792480945587, "clip_ratio/high_mean": 0.0463135102763772, "clip_ratio/high_max": 0.0463135102763772, "clip_ratio/region_mean": 0.06518143508583307, "reward_total_mean": 0.21199412643909454, "reward_meter_mean": 0.48654890060424805, "reward_meter_std": 0.4777888357639313, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9322326183319092, "reward_lexical_plausibility_std": 0.09612184762954712, "reward_repeat_penalty_mean": 0.998511016368866, "reward_repeat_penalty_std": 0.0029533349443227053, "reward_near_duplicate_penalty_mean": 0.9990079402923584, "reward_near_duplicate_penalty_std": 0.0028059897013008595, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9995030760765076, "reward_distinct_2_std": 0.0014054919593036175, "reward_judge_quality_mean": 0.4125000238418579, "reward_judge_quality_std": 0.35346245765686035, "reward_total_composite_mean": 0.21199412643909454, "reward_total_composite_std": 0.28878629207611084} {"timestamp_utc": "2026-04-12T14:02:46Z", "mode": "train", "global_step": 820, "epoch": 0.03293569506366229, "loss": 0.0655, "grad_norm": 8.09565258026123, "learning_rate": 7.518181818181819e-06, "num_tokens": 1667433.0, "completions/mean_length": 113.0, "completions/min_length": 97.0, "completions/max_length": 123.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.0, "completions/min_terminated_length": 97.0, "completions/max_terminated_length": 123.0, "rewards/meter/mean": 0.5458306670188904, "rewards/meter/std": 0.32007092237472534, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.8199503421783447, "rewards/repeat_penalty/std": 0.09975920617580414, "rewards/near_duplicate_penalty/mean": 0.9429879188537598, "rewards/near_duplicate_penalty/std": 0.03316446766257286, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.867276132106781, "rewards/distinct_2/std": 0.07919946312904358, "rewards/total_composite/mean": 0.18988703191280365, "rewards/total_composite/std": 0.12961415946483612, "reward": 0.18988703191280365, "reward_std": 0.12961415946483612, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1332654356956482, "sampling/sampling_logp_difference/max": 1.441481113433838, "sampling/importance_sampling_ratio/min": 0.236577108502388, "sampling/importance_sampling_ratio/mean": 1.0116586685180664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7692822888493538, "clip_ratio/low_mean": 0.05453959107398987, "clip_ratio/low_min": 0.05453959107398987, "clip_ratio/high_mean": 0.08198838122189045, "clip_ratio/high_max": 0.08198838122189045, "clip_ratio/region_mean": 0.13652797229588032, "reward_total_mean": 0.18988703191280365, "reward_meter_mean": 0.5458306670188904, "reward_meter_std": 0.32007092237472534, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8199503421783447, "reward_repeat_penalty_std": 0.09975920617580414, "reward_near_duplicate_penalty_mean": 0.9429879188537598, "reward_near_duplicate_penalty_std": 0.03316446766257286, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.867276132106781, "reward_distinct_2_std": 0.07919946312904358, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.18988703191280365, "reward_total_composite_std": 0.12961415946483612} {"timestamp_utc": "2026-04-12T14:03:00Z", "mode": "train", "global_step": 821, "epoch": 0.032975860545447246, "loss": -0.0938, "grad_norm": 2.969666004180908, "learning_rate": 7.515151515151516e-06, "num_tokens": 1669106.0, "completions/mean_length": 168.125, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 53.5, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6630713939666748, "rewards/meter/std": 0.4266056418418884, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9276131391525269, "rewards/lexical_plausibility/std": 0.13415464758872986, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.9203839898109436, "rewards/repeat_penalty/std": 0.10864054411649704, "rewards/near_duplicate_penalty/mean": 0.9828839898109436, "rewards/near_duplicate_penalty/std": 0.02924136444926262, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2532910704612732, "rewards/total_composite/std": 0.19527983665466309, "reward": 0.2532910704612732, "reward_std": 0.19527983665466309, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1490723043680191, "sampling/sampling_logp_difference/max": 1.6246337890625, "sampling/importance_sampling_ratio/min": 0.19698379933834076, "sampling/importance_sampling_ratio/mean": 1.0188796520233154, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6903570517897606, "clip_ratio/low_mean": 0.007352941203862429, "clip_ratio/low_min": 0.007352941203862429, "clip_ratio/high_mean": 0.10040908213704824, "clip_ratio/high_max": 0.10040908213704824, "clip_ratio/region_mean": 0.10776202334091067, "reward_total_mean": 0.2532910704612732, "reward_meter_mean": 0.6630713939666748, "reward_meter_std": 0.4266056418418884, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9276131391525269, "reward_lexical_plausibility_std": 0.13415464758872986, "reward_repeat_penalty_mean": 0.9203839898109436, "reward_repeat_penalty_std": 0.10864054411649704, "reward_near_duplicate_penalty_mean": 0.9828839898109436, "reward_near_duplicate_penalty_std": 0.02924136444926262, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.2532910704612732, "reward_total_composite_std": 0.19527983665466309} {"timestamp_utc": "2026-04-12T14:03:13Z", "mode": "train", "global_step": 822, "epoch": 0.0330160260272322, "loss": -0.0417, "grad_norm": 4.708151817321777, "learning_rate": 7.512121212121213e-06, "num_tokens": 1670805.0, "completions/mean_length": 103.375, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.000003814697266, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.3182946443557739, "rewards/meter/std": 0.3539869785308838, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9741119146347046, "rewards/lexical_plausibility/std": 0.07322254031896591, "rewards/judge_quality/mean": 0.752500057220459, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.9276940226554871, "rewards/repeat_penalty/std": 0.09563203155994415, "rewards/near_duplicate_penalty/mean": 0.9678204655647278, "rewards/near_duplicate_penalty/std": 0.039478566497564316, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.956501841545105, "rewards/distinct_2/std": 0.0633978545665741, "rewards/total_composite/mean": 0.28315919637680054, "rewards/total_composite/std": 0.33432263135910034, "reward": 0.28315919637680054, "reward_std": 0.33432263135910034, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12824253737926483, "sampling/sampling_logp_difference/max": 1.1638872623443604, "sampling/importance_sampling_ratio/min": 0.312269926071167, "sampling/importance_sampling_ratio/mean": 1.0155647993087769, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5962987914681435, "clip_ratio/low_mean": 0.061575678177177906, "clip_ratio/low_min": 0.061575678177177906, "clip_ratio/high_mean": 0.05713362991809845, "clip_ratio/high_max": 0.05713362991809845, "clip_ratio/region_mean": 0.11870930809527636, "reward_total_mean": 0.28315919637680054, "reward_meter_mean": 0.3182946443557739, "reward_meter_std": 0.3539869785308838, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9741119146347046, "reward_lexical_plausibility_std": 0.07322254031896591, "reward_repeat_penalty_mean": 0.9276940226554871, "reward_repeat_penalty_std": 0.09563203155994415, "reward_near_duplicate_penalty_mean": 0.9678204655647278, "reward_near_duplicate_penalty_std": 0.039478566497564316, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.956501841545105, "reward_distinct_2_std": 0.0633978545665741, "reward_judge_quality_mean": 0.752500057220459, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.28315919637680054, "reward_total_composite_std": 0.33432263135910034} {"timestamp_utc": "2026-04-12T14:03:27Z", "mode": "train", "global_step": 823, "epoch": 0.033056191509017153, "loss": -0.1665, "grad_norm": 3.7394113540649414, "learning_rate": 7.509090909090909e-06, "num_tokens": 1673552.0, "completions/mean_length": 230.375, "completions/min_length": 167.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 190.1428680419922, "completions/min_terminated_length": 167.0, "completions/max_terminated_length": 232.0, "rewards/meter/mean": 0.9197593927383423, "rewards/meter/std": 0.1841699331998825, "rewards/count_adherence/mean": 0.8035714626312256, "rewards/count_adherence/std": 0.215134397149086, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9680410027503967, "rewards/lexical_plausibility/std": 0.09039372205734253, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.42832398414611816, "rewards/repeat_penalty/std": 0.24702930450439453, "rewards/near_duplicate_penalty/mean": 0.7599433660507202, "rewards/near_duplicate_penalty/std": 0.24937529861927032, "rewards/opening_diversity/mean": 0.859375, "rewards/opening_diversity/std": 0.30935922265052795, "rewards/distinct_2/mean": 0.5753481984138489, "rewards/distinct_2/std": 0.3082761764526367, "rewards/total_composite/mean": 0.17166483402252197, "rewards/total_composite/std": 0.09905346482992172, "reward": 0.17166483402252197, "reward_std": 0.09905345737934113, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10652532428503036, "sampling/sampling_logp_difference/max": 2.2755303382873535, "sampling/importance_sampling_ratio/min": 0.10274240374565125, "sampling/importance_sampling_ratio/mean": 1.0041534900665283, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5771142337471247, "clip_ratio/low_mean": 0.032494738698005676, "clip_ratio/low_min": 0.032494738698005676, "clip_ratio/high_mean": 0.04119925294071436, "clip_ratio/high_max": 0.04119925294071436, "clip_ratio/region_mean": 0.07369399163872004, "reward_total_mean": 0.17166483402252197, "reward_meter_mean": 0.9197593927383423, "reward_meter_std": 0.1841699331998825, "reward_count_adherence_mean": 0.8035714626312256, "reward_count_adherence_std": 0.215134397149086, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9680410027503967, "reward_lexical_plausibility_std": 0.09039372205734253, "reward_repeat_penalty_mean": 0.42832398414611816, "reward_repeat_penalty_std": 0.24702930450439453, "reward_near_duplicate_penalty_mean": 0.7599433660507202, "reward_near_duplicate_penalty_std": 0.24937529861927032, "reward_opening_diversity_mean": 0.859375, "reward_opening_diversity_std": 0.30935922265052795, "reward_distinct_2_mean": 0.5753481984138489, "reward_distinct_2_std": 0.3082761764526367, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.17166483402252197, "reward_total_composite_std": 0.09905346482992172} {"timestamp_utc": "2026-04-12T14:03:35Z", "mode": "train", "global_step": 824, "epoch": 0.03309635699080211, "loss": 0.0071, "grad_norm": 17.515064239501953, "learning_rate": 7.5060606060606065e-06, "num_tokens": 1675218.0, "completions/mean_length": 45.25, "completions/min_length": 41.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.4593569040298462, "rewards/meter/std": 0.4075322449207306, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6262500286102295, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.906800389289856, "rewards/repeat_penalty/std": 0.1017073392868042, "rewards/near_duplicate_penalty/mean": 0.9504185914993286, "rewards/near_duplicate_penalty/std": 0.0443868413567543, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9518266916275024, "rewards/distinct_2/std": 0.07075672596693039, "rewards/total_composite/mean": 0.2819594740867615, "rewards/total_composite/std": 0.27868616580963135, "reward": 0.2819594740867615, "reward_std": 0.27868616580963135, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15847836434841156, "sampling/sampling_logp_difference/max": 1.7431327104568481, "sampling/importance_sampling_ratio/min": 0.17497140169143677, "sampling/importance_sampling_ratio/mean": 1.023474097251892, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9544377326965332, "clip_ratio/low_mean": 0.08723642397671938, "clip_ratio/low_min": 0.08723642397671938, "clip_ratio/high_mean": 0.054752906784415245, "clip_ratio/high_max": 0.054752906784415245, "clip_ratio/region_mean": 0.14198933076113462, "reward_total_mean": 0.2819594740867615, "reward_meter_mean": 0.4593569040298462, "reward_meter_std": 0.4075322449207306, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.906800389289856, "reward_repeat_penalty_std": 0.1017073392868042, "reward_near_duplicate_penalty_mean": 0.9504185914993286, "reward_near_duplicate_penalty_std": 0.0443868413567543, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9518266916275024, "reward_distinct_2_std": 0.07075672596693039, "reward_judge_quality_mean": 0.6262500286102295, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.2819594740867615, "reward_total_composite_std": 0.27868616580963135} {"timestamp_utc": "2026-04-12T14:03:48Z", "mode": "train", "global_step": 825, "epoch": 0.03313652247258706, "loss": -0.0429, "grad_norm": 2.90382719039917, "learning_rate": 7.503030303030303e-06, "num_tokens": 1676872.0, "completions/mean_length": 166.75, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 51.66666793823242, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.504851758480072, "rewards/meter/std": 0.4356744885444641, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9281660318374634, "rewards/lexical_plausibility/std": 0.09923125803470612, "rewards/judge_quality/mean": 0.2837499976158142, "rewards/judge_quality/std": 0.28278905153274536, "rewards/repeat_penalty/mean": 0.6415095329284668, "rewards/repeat_penalty/std": 0.2112969309091568, "rewards/near_duplicate_penalty/mean": 0.9031348824501038, "rewards/near_duplicate_penalty/std": 0.05762649327516556, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8525846600532532, "rewards/distinct_2/std": 0.11896373331546783, "rewards/total_composite/mean": 0.21184338629245758, "rewards/total_composite/std": 0.3044293224811554, "reward": 0.21184338629245758, "reward_std": 0.3044293224811554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12933504581451416, "sampling/sampling_logp_difference/max": 1.1533470153808594, "sampling/importance_sampling_ratio/min": 0.31557875871658325, "sampling/importance_sampling_ratio/mean": 1.0194796323776245, "sampling/importance_sampling_ratio/max": 1.8992120027542114, "entropy": 0.8100524507462978, "clip_ratio/low_mean": 0.054800222627818584, "clip_ratio/low_min": 0.054800222627818584, "clip_ratio/high_mean": 0.017500000074505806, "clip_ratio/high_max": 0.017500000074505806, "clip_ratio/region_mean": 0.07230022270232439, "reward_total_mean": 0.21184338629245758, "reward_meter_mean": 0.504851758480072, "reward_meter_std": 0.4356744885444641, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9281660318374634, "reward_lexical_plausibility_std": 0.09923125803470612, "reward_repeat_penalty_mean": 0.6415095329284668, "reward_repeat_penalty_std": 0.2112969309091568, "reward_near_duplicate_penalty_mean": 0.9031348824501038, "reward_near_duplicate_penalty_std": 0.05762649327516556, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8525846600532532, "reward_distinct_2_std": 0.11896373331546783, "reward_judge_quality_mean": 0.2837499976158142, "reward_judge_quality_std": 0.28278905153274536, "reward_total_composite_mean": 0.21184338629245758, "reward_total_composite_std": 0.3044293224811554} {"timestamp_utc": "2026-04-12T14:04:01Z", "mode": "train", "global_step": 826, "epoch": 0.033176687954372015, "loss": 0.093, "grad_norm": 5.559487342834473, "learning_rate": 7.500000000000001e-06, "num_tokens": 1681173.0, "completions/mean_length": 297.625, "completions/min_length": 237.0, "completions/max_length": 351.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 297.625, "completions/min_terminated_length": 237.0, "completions/max_terminated_length": 351.0, "rewards/meter/mean": 0.8171510696411133, "rewards/meter/std": 0.1934913843870163, "rewards/count_adherence/mean": 0.8863636255264282, "rewards/count_adherence/std": 0.06428244709968567, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22500000894069672, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.3406097888946533, "rewards/repeat_penalty/std": 0.31617647409439087, "rewards/near_duplicate_penalty/mean": 0.8323519229888916, "rewards/near_duplicate_penalty/std": 0.08623382449150085, "rewards/opening_diversity/mean": 0.8984375, "rewards/opening_diversity/std": 0.15434837341308594, "rewards/distinct_2/mean": 0.42978453636169434, "rewards/distinct_2/std": 0.3113824129104614, "rewards/total_composite/mean": 0.16477039456367493, "rewards/total_composite/std": 0.08743821084499359, "reward": 0.16477039456367493, "reward_std": 0.08743821829557419, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0844714343547821, "sampling/sampling_logp_difference/max": 2.0492701530456543, "sampling/importance_sampling_ratio/min": 0.12882889807224274, "sampling/importance_sampling_ratio/mean": 1.010542869567871, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46387164667248726, "clip_ratio/low_mean": 0.040871933568269014, "clip_ratio/low_min": 0.040871933568269014, "clip_ratio/high_mean": 0.03977311495691538, "clip_ratio/high_max": 0.03977311495691538, "clip_ratio/region_mean": 0.08064504852518439, "reward_total_mean": 0.16477039456367493, "reward_meter_mean": 0.8171510696411133, "reward_meter_std": 0.1934913843870163, "reward_count_adherence_mean": 0.8863636255264282, "reward_count_adherence_std": 0.06428244709968567, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3406097888946533, "reward_repeat_penalty_std": 0.31617647409439087, "reward_near_duplicate_penalty_mean": 0.8323519229888916, "reward_near_duplicate_penalty_std": 0.08623382449150085, "reward_opening_diversity_mean": 0.8984375, "reward_opening_diversity_std": 0.15434837341308594, "reward_distinct_2_mean": 0.42978453636169434, "reward_distinct_2_std": 0.3113824129104614, "reward_judge_quality_mean": 0.22500000894069672, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.16477039456367493, "reward_total_composite_std": 0.08743821084499359} {"timestamp_utc": "2026-04-12T14:04:09Z", "mode": "train", "global_step": 827, "epoch": 0.03321685343615697, "loss": 0.0612, "grad_norm": 11.485149383544922, "learning_rate": 7.496969696969698e-06, "num_tokens": 1683029.0, "completions/mean_length": 46.0, "completions/min_length": 43.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.0, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.5837651491165161, "rewards/meter/std": 0.363710880279541, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.8799999952316284, "rewards/judge_quality/std": 0.1742740124464035, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5367031693458557, "rewards/total_composite/std": 0.35172075033187866, "reward": 0.5367031693458557, "reward_std": 0.35172075033187866, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.108575239777565, "sampling/sampling_logp_difference/max": 2.805960178375244, "sampling/importance_sampling_ratio/min": 0.06044870242476463, "sampling/importance_sampling_ratio/mean": 0.9819539189338684, "sampling/importance_sampling_ratio/max": 1.9269944429397583, "entropy": 0.330756351351738, "clip_ratio/low_mean": 0.029451093869283795, "clip_ratio/low_min": 0.029451093869283795, "clip_ratio/high_mean": 0.050069005228579044, "clip_ratio/high_max": 0.050069005228579044, "clip_ratio/region_mean": 0.07952009909786284, "reward_total_mean": 0.5367031693458557, "reward_meter_mean": 0.5837651491165161, "reward_meter_std": 0.363710880279541, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8799999952316284, "reward_judge_quality_std": 0.1742740124464035, "reward_total_composite_mean": 0.5367031693458557, "reward_total_composite_std": 0.35172075033187866} {"timestamp_utc": "2026-04-12T14:04:17Z", "mode": "train", "global_step": 828, "epoch": 0.03325701891794192, "loss": 0.0348, "grad_norm": 12.208457946777344, "learning_rate": 7.493939393939395e-06, "num_tokens": 1684714.0, "completions/mean_length": 51.625, "completions/min_length": 47.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.625, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7387732863426208, "rewards/meter/std": 0.3698543310165405, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6875, "rewards/judge_quality/std": 0.24211864173412323, "rewards/repeat_penalty/mean": 0.9855691194534302, "rewards/repeat_penalty/std": 0.018926572054624557, "rewards/near_duplicate_penalty/mean": 0.9855691194534302, "rewards/near_duplicate_penalty/std": 0.018926572054624557, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4585193693637848, "rewards/total_composite/std": 0.2535739839076996, "reward": 0.4585193693637848, "reward_std": 0.2535739839076996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1267327219247818, "sampling/sampling_logp_difference/max": 1.2790570259094238, "sampling/importance_sampling_ratio/min": 0.27829962968826294, "sampling/importance_sampling_ratio/mean": 1.0119009017944336, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8061745166778564, "clip_ratio/low_mean": 0.07376865297555923, "clip_ratio/low_min": 0.07376865297555923, "clip_ratio/high_mean": 0.044817928690463305, "clip_ratio/high_max": 0.044817928690463305, "clip_ratio/region_mean": 0.11858658166602254, "reward_total_mean": 0.4585193693637848, "reward_meter_mean": 0.7387732863426208, "reward_meter_std": 0.3698543310165405, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9855691194534302, "reward_repeat_penalty_std": 0.018926572054624557, "reward_near_duplicate_penalty_mean": 0.9855691194534302, "reward_near_duplicate_penalty_std": 0.018926572054624557, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6875, "reward_judge_quality_std": 0.24211864173412323, "reward_total_composite_mean": 0.4585193693637848, "reward_total_composite_std": 0.2535739839076996} {"timestamp_utc": "2026-04-12T14:04:30Z", "mode": "train", "global_step": 829, "epoch": 0.03329718439972688, "loss": -0.0491, "grad_norm": 4.997721195220947, "learning_rate": 7.490909090909092e-06, "num_tokens": 1686790.0, "completions/mean_length": 159.5, "completions/min_length": 92.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 109.14286041259766, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 132.0, "rewards/meter/mean": 0.7552764415740967, "rewards/meter/std": 0.32096803188323975, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9618983864784241, "rewards/lexical_plausibility/std": 0.10776761174201965, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.5502966642379761, "rewards/repeat_penalty/std": 0.30307191610336304, "rewards/near_duplicate_penalty/mean": 0.8795453310012817, "rewards/near_duplicate_penalty/std": 0.0521891750395298, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.6573268175125122, "rewards/distinct_2/std": 0.3117270767688751, "rewards/total_composite/mean": 0.21154771745204926, "rewards/total_composite/std": 0.13740533590316772, "reward": 0.21154771745204926, "reward_std": 0.13740533590316772, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09593869745731354, "sampling/sampling_logp_difference/max": 1.836510181427002, "sampling/importance_sampling_ratio/min": 0.15937264263629913, "sampling/importance_sampling_ratio/mean": 1.0106825828552246, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5000378489494324, "clip_ratio/low_mean": 0.036383810453116894, "clip_ratio/low_min": 0.036383810453116894, "clip_ratio/high_mean": 0.05148236081004143, "clip_ratio/high_max": 0.05148236081004143, "clip_ratio/region_mean": 0.08786617126315832, "reward_total_mean": 0.21154771745204926, "reward_meter_mean": 0.7552764415740967, "reward_meter_std": 0.32096803188323975, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9618983864784241, "reward_lexical_plausibility_std": 0.10776761174201965, "reward_repeat_penalty_mean": 0.5502966642379761, "reward_repeat_penalty_std": 0.30307191610336304, "reward_near_duplicate_penalty_mean": 0.8795453310012817, "reward_near_duplicate_penalty_std": 0.0521891750395298, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.6573268175125122, "reward_distinct_2_std": 0.3117270767688751, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.21154771745204926, "reward_total_composite_std": 0.13740533590316772} {"timestamp_utc": "2026-04-12T14:04:43Z", "mode": "train", "global_step": 830, "epoch": 0.03333734988151183, "loss": -0.0401, "grad_norm": 3.4121365547180176, "learning_rate": 7.487878787878788e-06, "num_tokens": 1688406.0, "completions/mean_length": 96.0, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.57143020629883, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6927865743637085, "rewards/meter/std": 0.3873361349105835, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9700043797492981, "rewards/lexical_plausibility/std": 0.08484045416116714, "rewards/judge_quality/mean": 0.7637499570846558, "rewards/judge_quality/std": 0.3349173665046692, "rewards/repeat_penalty/mean": 0.998106062412262, "rewards/repeat_penalty/std": 0.005356864538043737, "rewards/near_duplicate_penalty/mean": 0.998106062412262, "rewards/near_duplicate_penalty/std": 0.005356864538043737, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6377477645874023, "rewards/total_composite/std": 0.3818265199661255, "reward": 0.6377477645874023, "reward_std": 0.3818265199661255, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1056709885597229, "sampling/sampling_logp_difference/max": 2.4557881355285645, "sampling/importance_sampling_ratio/min": 0.08579555153846741, "sampling/importance_sampling_ratio/mean": 0.9991392493247986, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3120129220187664, "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.010416666977107525, "clip_ratio/high_mean": 0.06031998083926737, "clip_ratio/high_max": 0.06031998083926737, "clip_ratio/region_mean": 0.0707366478163749, "reward_total_mean": 0.6377477645874023, "reward_meter_mean": 0.6927865743637085, "reward_meter_std": 0.3873361349105835, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9700043797492981, "reward_lexical_plausibility_std": 0.08484045416116714, "reward_repeat_penalty_mean": 0.998106062412262, "reward_repeat_penalty_std": 0.005356864538043737, "reward_near_duplicate_penalty_mean": 0.998106062412262, "reward_near_duplicate_penalty_std": 0.005356864538043737, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7637499570846558, "reward_judge_quality_std": 0.3349173665046692, "reward_total_composite_mean": 0.6377477645874023, "reward_total_composite_std": 0.3818265199661255} {"timestamp_utc": "2026-04-12T14:04:57Z", "mode": "train", "global_step": 831, "epoch": 0.033377515363296785, "loss": -0.0925, "grad_norm": 3.299501895904541, "learning_rate": 7.484848484848486e-06, "num_tokens": 1690215.0, "completions/mean_length": 243.125, "completions/min_length": 75.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 81.80000305175781, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.2392055094242096, "rewards/meter/std": 0.28342151641845703, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9162173271179199, "rewards/lexical_plausibility/std": 0.12281563133001328, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.15526476502418518, "rewards/repeat_penalty/mean": 0.877632737159729, "rewards/repeat_penalty/std": 0.0954660102725029, "rewards/near_duplicate_penalty/mean": 0.9493685364723206, "rewards/near_duplicate_penalty/std": 0.05328753963112831, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9554908275604248, "rewards/distinct_2/std": 0.04688442870974541, "rewards/total_composite/mean": 0.0472441241145134, "rewards/total_composite/std": 0.0789516270160675, "reward": 0.0472441241145134, "reward_std": 0.0789516270160675, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16318044066429138, "sampling/sampling_logp_difference/max": 2.1976687908172607, "sampling/importance_sampling_ratio/min": 0.11106175929307938, "sampling/importance_sampling_ratio/mean": 1.0221236944198608, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6983982473611832, "clip_ratio/low_mean": 0.04283104743808508, "clip_ratio/low_min": 0.04283104743808508, "clip_ratio/high_mean": 0.056785713881254196, "clip_ratio/high_max": 0.056785713881254196, "clip_ratio/region_mean": 0.09961676131933928, "reward_total_mean": 0.0472441241145134, "reward_meter_mean": 0.2392055094242096, "reward_meter_std": 0.28342151641845703, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9162173271179199, "reward_lexical_plausibility_std": 0.12281563133001328, "reward_repeat_penalty_mean": 0.877632737159729, "reward_repeat_penalty_std": 0.0954660102725029, "reward_near_duplicate_penalty_mean": 0.9493685364723206, "reward_near_duplicate_penalty_std": 0.05328753963112831, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9554908275604248, "reward_distinct_2_std": 0.04688442870974541, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.15526476502418518, "reward_total_composite_mean": 0.0472441241145134, "reward_total_composite_std": 0.0789516270160675} {"timestamp_utc": "2026-04-12T14:05:12Z", "mode": "train", "global_step": 832, "epoch": 0.03341768084508174, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.481818181818182e-06, "num_tokens": 1692071.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.6423313617706299, "rewards/meter/std": 0.4211899936199188, "rewards/count_adherence/mean": 0.9411764740943909, "rewards/count_adherence/std": 0.06288499385118484, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.6244285106658936, "rewards/near_duplicate_penalty/std": 0.13046982884407043, "rewards/opening_diversity/mean": 0.7550863027572632, "rewards/opening_diversity/std": 0.2533925771713257, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08885331451892853, "rewards/total_composite/std": 0.05813891440629959, "reward": 0.08885331451892853, "reward_std": 0.05813891440629959, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.08885331451892853, "reward_meter_mean": 0.6423313617706299, "reward_meter_std": 0.4211899936199188, "reward_count_adherence_mean": 0.9411764740943909, "reward_count_adherence_std": 0.06288499385118484, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.6244285106658936, "reward_near_duplicate_penalty_std": 0.13046982884407043, "reward_opening_diversity_mean": 0.7550863027572632, "reward_opening_diversity_std": 0.2533925771713257, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.08885331451892853, "reward_total_composite_std": 0.05813891440629959} {"timestamp_utc": "2026-04-12T14:05:25Z", "mode": "train", "global_step": 833, "epoch": 0.03345784632686669, "loss": -0.0261, "grad_norm": 3.6566264629364014, "learning_rate": 7.47878787878788e-06, "num_tokens": 1693447.0, "completions/mean_length": 147.0, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 25.33333396911621, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.5361067056655884, "rewards/meter/std": 0.39208167791366577, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9393448233604431, "rewards/lexical_plausibility/std": 0.11451318860054016, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3703642189502716, "rewards/repeat_penalty/mean": 0.7643716335296631, "rewards/repeat_penalty/std": 0.10628793388605118, "rewards/near_duplicate_penalty/mean": 0.977495551109314, "rewards/near_duplicate_penalty/std": 0.06365221738815308, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2797941267490387, "rewards/total_composite/std": 0.3050786256790161, "reward": 0.2797941267490387, "reward_std": 0.3050785958766937, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11691392213106155, "sampling/sampling_logp_difference/max": 1.3519599437713623, "sampling/importance_sampling_ratio/min": 0.2587326765060425, "sampling/importance_sampling_ratio/mean": 1.0241702795028687, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46255865320563316, "clip_ratio/low_mean": 0.045495014637708664, "clip_ratio/low_min": 0.045495014637708664, "clip_ratio/high_mean": 0.03691123239696026, "clip_ratio/high_max": 0.03691123239696026, "clip_ratio/region_mean": 0.08240624703466892, "reward_total_mean": 0.2797941267490387, "reward_meter_mean": 0.5361067056655884, "reward_meter_std": 0.39208167791366577, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9393448233604431, "reward_lexical_plausibility_std": 0.11451318860054016, "reward_repeat_penalty_mean": 0.7643716335296631, "reward_repeat_penalty_std": 0.10628793388605118, "reward_near_duplicate_penalty_mean": 0.977495551109314, "reward_near_duplicate_penalty_std": 0.06365221738815308, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3703642189502716, "reward_total_composite_mean": 0.2797941267490387, "reward_total_composite_std": 0.3050786256790161} {"timestamp_utc": "2026-04-12T14:05:40Z", "mode": "train", "global_step": 834, "epoch": 0.03349801180865165, "loss": -0.0338, "grad_norm": 1.1344773769378662, "learning_rate": 7.4757575757575765e-06, "num_tokens": 1694730.0, "completions/mean_length": 454.375, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 51.0, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.3278172016143799, "rewards/meter/std": 0.35006678104400635, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8194913268089294, "rewards/lexical_plausibility/std": 0.11611448973417282, "rewards/judge_quality/mean": 0.1587500125169754, "rewards/judge_quality/std": 0.3075914680957794, "rewards/repeat_penalty/mean": 0.9270184636116028, "rewards/repeat_penalty/std": 0.11105029284954071, "rewards/near_duplicate_penalty/mean": 0.9910468459129333, "rewards/near_duplicate_penalty/std": 0.019919803366065025, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.998443067073822, "rewards/distinct_2/std": 0.0031093021389096975, "rewards/total_composite/mean": 0.028080236166715622, "rewards/total_composite/std": 0.07942290604114532, "reward": 0.028080236166715622, "reward_std": 0.07942289859056473, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13641683757305145, "sampling/sampling_logp_difference/max": 1.346531867980957, "sampling/importance_sampling_ratio/min": 0.26014089584350586, "sampling/importance_sampling_ratio/mean": 0.9992741942405701, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.0773949921131134, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.014705882407724857, "clip_ratio/high_max": 0.014705882407724857, "clip_ratio/region_mean": 0.014705882407724857, "reward_total_mean": 0.028080236166715622, "reward_meter_mean": 0.3278172016143799, "reward_meter_std": 0.35006678104400635, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8194913268089294, "reward_lexical_plausibility_std": 0.11611448973417282, "reward_repeat_penalty_mean": 0.9270184636116028, "reward_repeat_penalty_std": 0.11105029284954071, "reward_near_duplicate_penalty_mean": 0.9910468459129333, "reward_near_duplicate_penalty_std": 0.019919803366065025, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.998443067073822, "reward_distinct_2_std": 0.0031093021389096975, "reward_judge_quality_mean": 0.1587500125169754, "reward_judge_quality_std": 0.3075914680957794, "reward_total_composite_mean": 0.028080236166715622, "reward_total_composite_std": 0.07942290604114532} {"timestamp_utc": "2026-04-12T14:05:54Z", "mode": "train", "global_step": 835, "epoch": 0.0335381772904366, "loss": -0.029, "grad_norm": 5.611277103424072, "learning_rate": 7.472727272727274e-06, "num_tokens": 1697034.0, "completions/mean_length": 184.0, "completions/min_length": 112.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 137.1428680419922, "completions/min_terminated_length": 112.0, "completions/max_terminated_length": 195.0, "rewards/meter/mean": 0.7396829128265381, "rewards/meter/std": 0.3543570339679718, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.1414213478565216, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9472166299819946, "rewards/lexical_plausibility/std": 0.10670626163482666, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.41893428564071655, "rewards/repeat_penalty/std": 0.36091017723083496, "rewards/near_duplicate_penalty/mean": 0.8077979683876038, "rewards/near_duplicate_penalty/std": 0.12983903288841248, "rewards/opening_diversity/mean": 0.9124999642372131, "rewards/opening_diversity/std": 0.13562026619911194, "rewards/distinct_2/mean": 0.5231683850288391, "rewards/distinct_2/std": 0.3322204351425171, "rewards/total_composite/mean": 0.12948951125144958, "rewards/total_composite/std": 0.1072273850440979, "reward": 0.12948951125144958, "reward_std": 0.1072273850440979, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09975112974643707, "sampling/sampling_logp_difference/max": 2.4648022651672363, "sampling/importance_sampling_ratio/min": 0.08502565324306488, "sampling/importance_sampling_ratio/mean": 1.0083603858947754, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6093812212347984, "clip_ratio/low_mean": 0.02280219830572605, "clip_ratio/low_min": 0.02280219830572605, "clip_ratio/high_mean": 0.055024812929332256, "clip_ratio/high_max": 0.055024812929332256, "clip_ratio/region_mean": 0.07782701123505831, "reward_total_mean": 0.12948951125144958, "reward_meter_mean": 0.7396829128265381, "reward_meter_std": 0.3543570339679718, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.1414213478565216, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9472166299819946, "reward_lexical_plausibility_std": 0.10670626163482666, "reward_repeat_penalty_mean": 0.41893428564071655, "reward_repeat_penalty_std": 0.36091017723083496, "reward_near_duplicate_penalty_mean": 0.8077979683876038, "reward_near_duplicate_penalty_std": 0.12983903288841248, "reward_opening_diversity_mean": 0.9124999642372131, "reward_opening_diversity_std": 0.13562026619911194, "reward_distinct_2_mean": 0.5231683850288391, "reward_distinct_2_std": 0.3322204351425171, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.12948951125144958, "reward_total_composite_std": 0.1072273850440979} {"timestamp_utc": "2026-04-12T14:06:07Z", "mode": "train", "global_step": 836, "epoch": 0.033578342772221555, "loss": -0.1061, "grad_norm": 5.153656959533691, "learning_rate": 7.46969696969697e-06, "num_tokens": 1699147.0, "completions/mean_length": 153.125, "completions/min_length": 87.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 101.85714721679688, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.7257121801376343, "rewards/meter/std": 0.28514406085014343, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9867037534713745, "rewards/lexical_plausibility/std": 0.03760756924748421, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.222898930311203, "rewards/repeat_penalty/mean": 0.6885099411010742, "rewards/repeat_penalty/std": 0.2579411566257477, "rewards/near_duplicate_penalty/mean": 0.9214573502540588, "rewards/near_duplicate_penalty/std": 0.08484853059053421, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.17912860214710236, "rewards/distinct_2/mean": 0.86307692527771, "rewards/distinct_2/std": 0.10983160138130188, "rewards/total_composite/mean": 0.25582242012023926, "rewards/total_composite/std": 0.20269383490085602, "reward": 0.25582242012023926, "reward_std": 0.20269383490085602, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12152904272079468, "sampling/sampling_logp_difference/max": 1.9659693241119385, "sampling/importance_sampling_ratio/min": 0.14002008736133575, "sampling/importance_sampling_ratio/mean": 1.0027951002120972, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46619174629449844, "clip_ratio/low_mean": 0.0416061719879508, "clip_ratio/low_min": 0.0416061719879508, "clip_ratio/high_mean": 0.0638554748147726, "clip_ratio/high_max": 0.0638554748147726, "clip_ratio/region_mean": 0.10546164680272341, "reward_total_mean": 0.25582242012023926, "reward_meter_mean": 0.7257121801376343, "reward_meter_std": 0.28514406085014343, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9867037534713745, "reward_lexical_plausibility_std": 0.03760756924748421, "reward_repeat_penalty_mean": 0.6885099411010742, "reward_repeat_penalty_std": 0.2579411566257477, "reward_near_duplicate_penalty_mean": 0.9214573502540588, "reward_near_duplicate_penalty_std": 0.08484853059053421, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.17912860214710236, "reward_distinct_2_mean": 0.86307692527771, "reward_distinct_2_std": 0.10983160138130188, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.222898930311203, "reward_total_composite_mean": 0.25582242012023926, "reward_total_composite_std": 0.20269383490085602} {"timestamp_utc": "2026-04-12T14:06:20Z", "mode": "train", "global_step": 837, "epoch": 0.03361850825400651, "loss": -0.0394, "grad_norm": 1.0968133211135864, "learning_rate": 7.4666666666666675e-06, "num_tokens": 1700414.0, "completions/mean_length": 205.375, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 21.399999618530273, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.6317184567451477, "rewards/meter/std": 0.48563364148139954, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.927947461605072, "rewards/lexical_plausibility/std": 0.10021715611219406, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.4569600820541382, "rewards/repeat_penalty/mean": 0.693365752696991, "rewards/repeat_penalty/std": 0.1168353334069252, "rewards/near_duplicate_penalty/mean": 0.939164400100708, "rewards/near_duplicate_penalty/std": 0.1186617836356163, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.4740714728832245, "rewards/total_composite/std": 0.4698944389820099, "reward": 0.4740714728832245, "reward_std": 0.4698944091796875, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08677541464567184, "sampling/sampling_logp_difference/max": 1.6270151138305664, "sampling/importance_sampling_ratio/min": 0.1965152770280838, "sampling/importance_sampling_ratio/mean": 1.0064005851745605, "sampling/importance_sampling_ratio/max": 1.5441728830337524, "entropy": 0.3056196980178356, "clip_ratio/low_mean": 0.01785714365541935, "clip_ratio/low_min": 0.01785714365541935, "clip_ratio/high_mean": 0.044728299137204885, "clip_ratio/high_max": 0.044728299137204885, "clip_ratio/region_mean": 0.06258544279262424, "reward_total_mean": 0.4740714728832245, "reward_meter_mean": 0.6317184567451477, "reward_meter_std": 0.48563364148139954, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.927947461605072, "reward_lexical_plausibility_std": 0.10021715611219406, "reward_repeat_penalty_mean": 0.693365752696991, "reward_repeat_penalty_std": 0.1168353334069252, "reward_near_duplicate_penalty_mean": 0.939164400100708, "reward_near_duplicate_penalty_std": 0.1186617836356163, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.4569600820541382, "reward_total_composite_mean": 0.4740714728832245, "reward_total_composite_std": 0.4698944389820099} {"timestamp_utc": "2026-04-12T14:06:35Z", "mode": "train", "global_step": 838, "epoch": 0.03365867373579146, "loss": -0.1768, "grad_norm": 3.3862082958221436, "learning_rate": 7.463636363636364e-06, "num_tokens": 1703069.0, "completions/mean_length": 306.875, "completions/min_length": 168.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 183.8000030517578, "completions/min_terminated_length": 168.0, "completions/max_terminated_length": 208.0, "rewards/meter/mean": 0.39931076765060425, "rewards/meter/std": 0.27909573912620544, "rewards/count_adherence/mean": 0.703125, "rewards/count_adherence/std": 0.3269003629684448, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9378780126571655, "rewards/lexical_plausibility/std": 0.10751595348119736, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.6501808166503906, "rewards/repeat_penalty/std": 0.3393625020980835, "rewards/near_duplicate_penalty/mean": 0.8912743926048279, "rewards/near_duplicate_penalty/std": 0.13243815302848816, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7067744135856628, "rewards/distinct_2/std": 0.3037939667701721, "rewards/total_composite/mean": 0.091504767537117, "rewards/total_composite/std": 0.09957390278577805, "reward": 0.091504767537117, "reward_std": 0.09957390278577805, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1197218969464302, "sampling/sampling_logp_difference/max": 2.356180191040039, "sampling/importance_sampling_ratio/min": 0.09478157758712769, "sampling/importance_sampling_ratio/mean": 1.0022670030593872, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3877883516252041, "clip_ratio/low_mean": 0.015739469090476632, "clip_ratio/low_min": 0.015739469090476632, "clip_ratio/high_mean": 0.04271893482655287, "clip_ratio/high_max": 0.04271893482655287, "clip_ratio/region_mean": 0.0584584039170295, "reward_total_mean": 0.091504767537117, "reward_meter_mean": 0.39931076765060425, "reward_meter_std": 0.27909573912620544, "reward_count_adherence_mean": 0.703125, "reward_count_adherence_std": 0.3269003629684448, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9378780126571655, "reward_lexical_plausibility_std": 0.10751595348119736, "reward_repeat_penalty_mean": 0.6501808166503906, "reward_repeat_penalty_std": 0.3393625020980835, "reward_near_duplicate_penalty_mean": 0.8912743926048279, "reward_near_duplicate_penalty_std": 0.13243815302848816, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7067744135856628, "reward_distinct_2_std": 0.3037939667701721, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.091504767537117, "reward_total_composite_std": 0.09957390278577805} {"timestamp_utc": "2026-04-12T14:06:49Z", "mode": "train", "global_step": 839, "epoch": 0.033698839217576416, "loss": -0.0879, "grad_norm": 5.077421188354492, "learning_rate": 7.460606060606061e-06, "num_tokens": 1704950.0, "completions/mean_length": 134.125, "completions/min_length": 71.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 80.14286041259766, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.808836817741394, "rewards/meter/std": 0.18064318597316742, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9653936624526978, "rewards/lexical_plausibility/std": 0.09788139909505844, "rewards/judge_quality/mean": 0.5287500023841858, "rewards/judge_quality/std": 0.3231734335422516, "rewards/repeat_penalty/mean": 0.8903459310531616, "rewards/repeat_penalty/std": 0.15989521145820618, "rewards/near_duplicate_penalty/mean": 0.957159161567688, "rewards/near_duplicate_penalty/std": 0.0361555740237236, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.945880115032196, "rewards/distinct_2/std": 0.0991036668419838, "rewards/total_composite/mean": 0.41259628534317017, "rewards/total_composite/std": 0.3446335196495056, "reward": 0.41259628534317017, "reward_std": 0.3446335196495056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1046198308467865, "sampling/sampling_logp_difference/max": 2.309542655944824, "sampling/importance_sampling_ratio/min": 0.09930665791034698, "sampling/importance_sampling_ratio/mean": 1.0194816589355469, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5719370767474174, "clip_ratio/low_mean": 0.04114250931888819, "clip_ratio/low_min": 0.04114250931888819, "clip_ratio/high_mean": 0.052555736154317856, "clip_ratio/high_max": 0.052555736154317856, "clip_ratio/region_mean": 0.09369824547320604, "reward_total_mean": 0.41259628534317017, "reward_meter_mean": 0.808836817741394, "reward_meter_std": 0.18064318597316742, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9653936624526978, "reward_lexical_plausibility_std": 0.09788139909505844, "reward_repeat_penalty_mean": 0.8903459310531616, "reward_repeat_penalty_std": 0.15989521145820618, "reward_near_duplicate_penalty_mean": 0.957159161567688, "reward_near_duplicate_penalty_std": 0.0361555740237236, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.945880115032196, "reward_distinct_2_std": 0.0991036668419838, "reward_judge_quality_mean": 0.5287500023841858, "reward_judge_quality_std": 0.3231734335422516, "reward_total_composite_mean": 0.41259628534317017, "reward_total_composite_std": 0.3446335196495056} {"timestamp_utc": "2026-04-12T14:07:02Z", "mode": "train", "global_step": 840, "epoch": 0.03373900469936137, "loss": -0.0255, "grad_norm": 0.8306662440299988, "learning_rate": 7.4575757575757575e-06, "num_tokens": 1706145.0, "completions/mean_length": 390.375, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 25.5, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.2271895855665207, "rewards/meter/std": 0.408864289522171, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.7962422370910645, "rewards/lexical_plausibility/std": 0.14310558140277863, "rewards/judge_quality/mean": 0.26875001192092896, "rewards/judge_quality/std": 0.4208303987979889, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21006235480308533, "rewards/total_composite/std": 0.3916552662849426, "reward": 0.21006235480308533, "reward_std": 0.39165523648262024, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10430178046226501, "sampling/sampling_logp_difference/max": 0.7973198890686035, "sampling/importance_sampling_ratio/min": 0.450534850358963, "sampling/importance_sampling_ratio/mean": 1.0402921438217163, "sampling/importance_sampling_ratio/max": 1.7328897714614868, "entropy": 0.14956891536712646, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.014467592816799879, "clip_ratio/high_max": 0.014467592816799879, "clip_ratio/region_mean": 0.014467592816799879, "reward_total_mean": 0.21006235480308533, "reward_meter_mean": 0.2271895855665207, "reward_meter_std": 0.408864289522171, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.7962422370910645, "reward_lexical_plausibility_std": 0.14310558140277863, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.26875001192092896, "reward_judge_quality_std": 0.4208303987979889, "reward_total_composite_mean": 0.21006235480308533, "reward_total_composite_std": 0.3916552662849426} {"timestamp_utc": "2026-04-12T14:07:16Z", "mode": "train", "global_step": 841, "epoch": 0.033779170181146324, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.454545454545456e-06, "num_tokens": 1707497.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.015986643731594086, "rewards/meter/std": 0.022730566561222076, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.7878352403640747, "rewards/lexical_plausibility/std": 0.04710675776004791, "rewards/judge_quality/mean": 0.05000000074505806, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9990274906158447, "rewards/repeat_penalty/std": 0.0018006979953497648, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9990274906158447, "rewards/distinct_2/std": 0.0018006979953497648, "rewards/total_composite/mean": 2.4907198167056777e-05, "rewards/total_composite/std": 7.044819358270615e-05, "reward": 2.4907198167056777e-05, "reward_std": 7.044819358270615e-05, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 2.4907198167056777e-05, "reward_meter_mean": 0.015986643731594086, "reward_meter_std": 0.022730566561222076, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.7878352403640747, "reward_lexical_plausibility_std": 0.04710675776004791, "reward_repeat_penalty_mean": 0.9990274906158447, "reward_repeat_penalty_std": 0.0018006979953497648, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9990274906158447, "reward_distinct_2_std": 0.0018006979953497648, "reward_judge_quality_mean": 0.05000000074505806, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 2.4907198167056777e-05, "reward_total_composite_std": 7.044819358270615e-05} {"timestamp_utc": "2026-04-12T14:07:31Z", "mode": "train", "global_step": 842, "epoch": 0.03381933566293128, "loss": -0.0362, "grad_norm": 1.4071052074432373, "learning_rate": 7.451515151515152e-06, "num_tokens": 1708809.0, "completions/mean_length": 269.0, "completions/min_length": 26.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 26.0, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.5345239043235779, "rewards/meter/std": 0.4528908133506775, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8868546485900879, "rewards/lexical_plausibility/std": 0.12396898120641708, "rewards/judge_quality/mean": 0.38875001668930054, "rewards/judge_quality/std": 0.44121384620666504, "rewards/repeat_penalty/mean": 0.7730461359024048, "rewards/repeat_penalty/std": 0.09359873831272125, "rewards/near_duplicate_penalty/mean": 0.9890615344047546, "rewards/near_duplicate_penalty/std": 0.025376567617058754, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3438541889190674, "rewards/total_composite/std": 0.44879963994026184, "reward": 0.3438541889190674, "reward_std": 0.44879963994026184, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12024195492267609, "sampling/sampling_logp_difference/max": 0.9006625413894653, "sampling/importance_sampling_ratio/min": 0.4856184720993042, "sampling/importance_sampling_ratio/mean": 1.0317338705062866, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5495957285165787, "clip_ratio/low_mean": 0.01923076994717121, "clip_ratio/low_min": 0.01923076994717121, "clip_ratio/high_mean": 0.024038461968302727, "clip_ratio/high_max": 0.024038461968302727, "clip_ratio/region_mean": 0.04326923191547394, "reward_total_mean": 0.3438541889190674, "reward_meter_mean": 0.5345239043235779, "reward_meter_std": 0.4528908133506775, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8868546485900879, "reward_lexical_plausibility_std": 0.12396898120641708, "reward_repeat_penalty_mean": 0.7730461359024048, "reward_repeat_penalty_std": 0.09359873831272125, "reward_near_duplicate_penalty_mean": 0.9890615344047546, "reward_near_duplicate_penalty_std": 0.025376567617058754, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38875001668930054, "reward_judge_quality_std": 0.44121384620666504, "reward_total_composite_mean": 0.3438541889190674, "reward_total_composite_std": 0.44879963994026184} {"timestamp_utc": "2026-04-12T14:07:46Z", "mode": "train", "global_step": 843, "epoch": 0.03385950114471623, "loss": -0.3255, "grad_norm": 2.028681755065918, "learning_rate": 7.448484848484849e-06, "num_tokens": 1713231.0, "completions/mean_length": 406.75, "completions/min_length": 314.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 371.66668701171875, "completions/min_terminated_length": 314.0, "completions/max_terminated_length": 442.0, "rewards/meter/mean": 0.5781040787696838, "rewards/meter/std": 0.16782401502132416, "rewards/count_adherence/mean": 0.7291666865348816, "rewards/count_adherence/std": 0.2878147065639496, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9710139632225037, "rewards/lexical_plausibility/std": 0.08198493719100952, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.5036746859550476, "rewards/repeat_penalty/std": 0.32200655341148376, "rewards/near_duplicate_penalty/mean": 0.9133760929107666, "rewards/near_duplicate_penalty/std": 0.08105232566595078, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5551795363426208, "rewards/distinct_2/std": 0.3133257031440735, "rewards/total_composite/mean": 0.13722610473632812, "rewards/total_composite/std": 0.07641561329364777, "reward": 0.13722610473632812, "reward_std": 0.07641561329364777, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0807938203215599, "sampling/sampling_logp_difference/max": 2.5774078369140625, "sampling/importance_sampling_ratio/min": 0.07597067207098007, "sampling/importance_sampling_ratio/mean": 1.0048794746398926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3612729646265507, "clip_ratio/low_mean": 0.006787330377846956, "clip_ratio/low_min": 0.006787330377846956, "clip_ratio/high_mean": 0.051659686490893364, "clip_ratio/high_max": 0.051659686490893364, "clip_ratio/region_mean": 0.05844701686874032, "reward_total_mean": 0.13722610473632812, "reward_meter_mean": 0.5781040787696838, "reward_meter_std": 0.16782401502132416, "reward_count_adherence_mean": 0.7291666865348816, "reward_count_adherence_std": 0.2878147065639496, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9710139632225037, "reward_lexical_plausibility_std": 0.08198493719100952, "reward_repeat_penalty_mean": 0.5036746859550476, "reward_repeat_penalty_std": 0.32200655341148376, "reward_near_duplicate_penalty_mean": 0.9133760929107666, "reward_near_duplicate_penalty_std": 0.08105232566595078, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5551795363426208, "reward_distinct_2_std": 0.3133257031440735, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.13722610473632812, "reward_total_composite_std": 0.07641561329364777} {"timestamp_utc": "2026-04-12T14:08:00Z", "mode": "train", "global_step": 844, "epoch": 0.033899666626501186, "loss": -0.0878, "grad_norm": 4.211852550506592, "learning_rate": 7.445454545454546e-06, "num_tokens": 1715558.0, "completions/mean_length": 152.875, "completions/min_length": 91.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 101.5714340209961, "completions/min_terminated_length": 91.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.474073588848114, "rewards/meter/std": 0.35706835985183716, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9775367975234985, "rewards/lexical_plausibility/std": 0.06353551149368286, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9689923524856567, "rewards/repeat_penalty/std": 0.05518259108066559, "rewards/near_duplicate_penalty/mean": 0.9857252836227417, "rewards/near_duplicate_penalty/std": 0.009722024202346802, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.08947252482175827, "rewards/total_composite/std": 0.06534622609615326, "reward": 0.08947252482175827, "reward_std": 0.06534622609615326, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10866747796535492, "sampling/sampling_logp_difference/max": 1.9588477611541748, "sampling/importance_sampling_ratio/min": 0.14102081954479218, "sampling/importance_sampling_ratio/mean": 1.0037509202957153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.45201993733644485, "clip_ratio/low_mean": 0.040869816206395626, "clip_ratio/low_min": 0.040869816206395626, "clip_ratio/high_mean": 0.04959984961897135, "clip_ratio/high_max": 0.04959984961897135, "clip_ratio/region_mean": 0.09046966582536697, "reward_total_mean": 0.08947252482175827, "reward_meter_mean": 0.474073588848114, "reward_meter_std": 0.35706835985183716, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9775367975234985, "reward_lexical_plausibility_std": 0.06353551149368286, "reward_repeat_penalty_mean": 0.9689923524856567, "reward_repeat_penalty_std": 0.05518259108066559, "reward_near_duplicate_penalty_mean": 0.9857252836227417, "reward_near_duplicate_penalty_std": 0.009722024202346802, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.08947252482175827, "reward_total_composite_std": 0.06534622609615326} {"timestamp_utc": "2026-04-12T14:08:15Z", "mode": "train", "global_step": 845, "epoch": 0.03393983210828614, "loss": -0.047, "grad_norm": 1.157021164894104, "learning_rate": 7.442424242424243e-06, "num_tokens": 1716911.0, "completions/mean_length": 396.125, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 48.5, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6507343649864197, "rewards/meter/std": 0.395896315574646, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8463503122329712, "rewards/lexical_plausibility/std": 0.11834544688463211, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.22320714592933655, "rewards/repeat_penalty/mean": 0.954783022403717, "rewards/repeat_penalty/std": 0.08504591137170792, "rewards/near_duplicate_penalty/mean": 0.9879560470581055, "rewards/near_duplicate_penalty/std": 0.018811138346791267, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9980278015136719, "rewards/distinct_2/std": 0.003018119838088751, "rewards/total_composite/mean": 0.0071954140439629555, "rewards/total_composite/std": 0.01335498970001936, "reward": 0.0071954140439629555, "reward_std": 0.01335498783737421, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14272001385688782, "sampling/sampling_logp_difference/max": 1.3716845512390137, "sampling/importance_sampling_ratio/min": 0.2536792457103729, "sampling/importance_sampling_ratio/mean": 0.9959360957145691, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.19408629834651947, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.04373937100172043, "clip_ratio/high_max": 0.04373937100172043, "clip_ratio/region_mean": 0.04373937100172043, "reward_total_mean": 0.0071954140439629555, "reward_meter_mean": 0.6507343649864197, "reward_meter_std": 0.395896315574646, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8463503122329712, "reward_lexical_plausibility_std": 0.11834544688463211, "reward_repeat_penalty_mean": 0.954783022403717, "reward_repeat_penalty_std": 0.08504591137170792, "reward_near_duplicate_penalty_mean": 0.9879560470581055, "reward_near_duplicate_penalty_std": 0.018811138346791267, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9980278015136719, "reward_distinct_2_std": 0.003018119838088751, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.22320714592933655, "reward_total_composite_mean": 0.0071954140439629555, "reward_total_composite_std": 0.01335498970001936} {"timestamp_utc": "2026-04-12T14:08:27Z", "mode": "train", "global_step": 846, "epoch": 0.033979997590071094, "loss": 0.0032, "grad_norm": 4.8742594718933105, "learning_rate": 7.439393939393939e-06, "num_tokens": 1720998.0, "completions/mean_length": 266.875, "completions/min_length": 229.0, "completions/max_length": 314.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 266.875, "completions/min_terminated_length": 229.0, "completions/max_terminated_length": 314.0, "rewards/meter/mean": 0.5946990847587585, "rewards/meter/std": 0.26137739419937134, "rewards/count_adherence/mean": 0.9305555820465088, "rewards/count_adherence/std": 0.10179170221090317, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.3091259002685547, "rewards/repeat_penalty/std": 0.2901867628097534, "rewards/near_duplicate_penalty/mean": 0.8128618001937866, "rewards/near_duplicate_penalty/std": 0.13602638244628906, "rewards/opening_diversity/mean": 0.9382575750350952, "rewards/opening_diversity/std": 0.07783199101686478, "rewards/distinct_2/mean": 0.37824079394340515, "rewards/distinct_2/std": 0.32145142555236816, "rewards/total_composite/mean": 0.1485380232334137, "rewards/total_composite/std": 0.10988743603229523, "reward": 0.1485380232334137, "reward_std": 0.10988743603229523, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07831436395645142, "sampling/sampling_logp_difference/max": 3.982466697692871, "sampling/importance_sampling_ratio/min": 0.01863960362970829, "sampling/importance_sampling_ratio/mean": 1.0055218935012817, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3786616772413254, "clip_ratio/low_mean": 0.029865495627745986, "clip_ratio/low_min": 0.029865495627745986, "clip_ratio/high_mean": 0.0433481028303504, "clip_ratio/high_max": 0.0433481028303504, "clip_ratio/region_mean": 0.07321359845809639, "reward_total_mean": 0.1485380232334137, "reward_meter_mean": 0.5946990847587585, "reward_meter_std": 0.26137739419937134, "reward_count_adherence_mean": 0.9305555820465088, "reward_count_adherence_std": 0.10179170221090317, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3091259002685547, "reward_repeat_penalty_std": 0.2901867628097534, "reward_near_duplicate_penalty_mean": 0.8128618001937866, "reward_near_duplicate_penalty_std": 0.13602638244628906, "reward_opening_diversity_mean": 0.9382575750350952, "reward_opening_diversity_std": 0.07783199101686478, "reward_distinct_2_mean": 0.37824079394340515, "reward_distinct_2_std": 0.32145142555236816, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.1485380232334137, "reward_total_composite_std": 0.10988743603229523} {"timestamp_utc": "2026-04-12T14:08:41Z", "mode": "train", "global_step": 847, "epoch": 0.03402016307185605, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.4363636363636375e-06, "num_tokens": 1722398.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.07988806068897247, "rewards/meter/std": 0.18823161721229553, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.7785017490386963, "rewards/lexical_plausibility/std": 0.030447019264101982, "rewards/judge_quality/mean": 0.05000000074505806, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.90625, "rewards/repeat_penalty/std": 0.12938730418682098, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0, "rewards/total_composite/std": 0.0, "reward": 0.0, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.0, "reward_meter_mean": 0.07988806068897247, "reward_meter_std": 0.18823161721229553, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.7785017490386963, "reward_lexical_plausibility_std": 0.030447019264101982, "reward_repeat_penalty_mean": 0.90625, "reward_repeat_penalty_std": 0.12938730418682098, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.05000000074505806, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.0, "reward_total_composite_std": 0.0} {"timestamp_utc": "2026-04-12T14:08:52Z", "mode": "train", "global_step": 848, "epoch": 0.034060328553641, "loss": 0.0161, "grad_norm": 10.770121574401855, "learning_rate": 7.433333333333334e-06, "num_tokens": 1724479.0, "completions/mean_length": 79.125, "completions/min_length": 67.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.125, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.8448991775512695, "rewards/meter/std": 0.21849018335342407, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47874999046325684, "rewards/judge_quality/std": 0.19208908081054688, "rewards/repeat_penalty/mean": 0.8118500709533691, "rewards/repeat_penalty/std": 0.19468837976455688, "rewards/near_duplicate_penalty/mean": 0.9453835487365723, "rewards/near_duplicate_penalty/std": 0.05366896465420723, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8872851133346558, "rewards/distinct_2/std": 0.10600007325410843, "rewards/total_composite/mean": 0.4133495092391968, "rewards/total_composite/std": 0.22245998680591583, "reward": 0.4133495092391968, "reward_std": 0.22245998680591583, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11687285453081131, "sampling/sampling_logp_difference/max": 1.5692310333251953, "sampling/importance_sampling_ratio/min": 0.2082052230834961, "sampling/importance_sampling_ratio/mean": 1.0286939144134521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7251513004302979, "clip_ratio/low_mean": 0.07596874516457319, "clip_ratio/low_min": 0.07596874516457319, "clip_ratio/high_mean": 0.04243226069957018, "clip_ratio/high_max": 0.04243226069957018, "clip_ratio/region_mean": 0.11840100586414337, "reward_total_mean": 0.4133495092391968, "reward_meter_mean": 0.8448991775512695, "reward_meter_std": 0.21849018335342407, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8118500709533691, "reward_repeat_penalty_std": 0.19468837976455688, "reward_near_duplicate_penalty_mean": 0.9453835487365723, "reward_near_duplicate_penalty_std": 0.05366896465420723, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8872851133346558, "reward_distinct_2_std": 0.10600007325410843, "reward_judge_quality_mean": 0.47874999046325684, "reward_judge_quality_std": 0.19208908081054688, "reward_total_composite_mean": 0.4133495092391968, "reward_total_composite_std": 0.22245998680591583} {"timestamp_utc": "2026-04-12T14:09:03Z", "mode": "train", "global_step": 849, "epoch": 0.034100494035425956, "loss": -0.0103, "grad_norm": 7.369930744171143, "learning_rate": 7.430303030303031e-06, "num_tokens": 1727847.0, "completions/mean_length": 203.0, "completions/min_length": 185.0, "completions/max_length": 244.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 203.0, "completions/min_terminated_length": 185.0, "completions/max_terminated_length": 244.0, "rewards/meter/mean": 0.6535764932632446, "rewards/meter/std": 0.24456477165222168, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.49451619386672974, "rewards/repeat_penalty/std": 0.29470983147621155, "rewards/near_duplicate_penalty/mean": 0.8792835474014282, "rewards/near_duplicate_penalty/std": 0.06122273951768875, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.5813867449760437, "rewards/distinct_2/std": 0.3329528868198395, "rewards/total_composite/mean": 0.20918208360671997, "rewards/total_composite/std": 0.10735700279474258, "reward": 0.20918208360671997, "reward_std": 0.10735700279474258, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08552273362874985, "sampling/sampling_logp_difference/max": 1.9656343460083008, "sampling/importance_sampling_ratio/min": 0.140066996216774, "sampling/importance_sampling_ratio/mean": 1.0032917261123657, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.37725358456373215, "clip_ratio/low_mean": 0.05769258085638285, "clip_ratio/low_min": 0.05769258085638285, "clip_ratio/high_mean": 0.024382275994867086, "clip_ratio/high_max": 0.024382275994867086, "clip_ratio/region_mean": 0.08207485685124993, "reward_total_mean": 0.20918208360671997, "reward_meter_mean": 0.6535764932632446, "reward_meter_std": 0.24456477165222168, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.49451619386672974, "reward_repeat_penalty_std": 0.29470983147621155, "reward_near_duplicate_penalty_mean": 0.8792835474014282, "reward_near_duplicate_penalty_std": 0.06122273951768875, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.5813867449760437, "reward_distinct_2_std": 0.3329528868198395, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.20918208360671997, "reward_total_composite_std": 0.10735700279474258} {"timestamp_utc": "2026-04-12T14:09:17Z", "mode": "train", "global_step": 850, "epoch": 0.03414065951721091, "loss": -0.046, "grad_norm": 3.770644187927246, "learning_rate": 7.4272727272727275e-06, "num_tokens": 1729265.0, "completions/mean_length": 84.25, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.142858505249023, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.7202411890029907, "rewards/meter/std": 0.4407414495944977, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9792736172676086, "rewards/lexical_plausibility/std": 0.03989769518375397, "rewards/judge_quality/mean": 0.7150000333786011, "rewards/judge_quality/std": 0.38052597641944885, "rewards/repeat_penalty/mean": 0.73777174949646, "rewards/repeat_penalty/std": 0.03458673879504204, "rewards/near_duplicate_penalty/mean": 0.9836956262588501, "rewards/near_duplicate_penalty/std": 0.04611567035317421, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.582308828830719, "rewards/total_composite/std": 0.4445638954639435, "reward": 0.582308828830719, "reward_std": 0.4445638954639435, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1147550567984581, "sampling/sampling_logp_difference/max": 1.2857037782669067, "sampling/importance_sampling_ratio/min": 0.27645593881607056, "sampling/importance_sampling_ratio/mean": 1.0257759094238281, "sampling/importance_sampling_ratio/max": 1.9395263195037842, "entropy": 0.5739097781479359, "clip_ratio/low_mean": 0.02223320212215185, "clip_ratio/low_min": 0.02223320212215185, "clip_ratio/high_mean": 0.0953409094363451, "clip_ratio/high_max": 0.0953409094363451, "clip_ratio/region_mean": 0.11757411155849695, "reward_total_mean": 0.582308828830719, "reward_meter_mean": 0.7202411890029907, "reward_meter_std": 0.4407414495944977, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9792736172676086, "reward_lexical_plausibility_std": 0.03989769518375397, "reward_repeat_penalty_mean": 0.73777174949646, "reward_repeat_penalty_std": 0.03458673879504204, "reward_near_duplicate_penalty_mean": 0.9836956262588501, "reward_near_duplicate_penalty_std": 0.04611567035317421, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7150000333786011, "reward_judge_quality_std": 0.38052597641944885, "reward_total_composite_mean": 0.582308828830719, "reward_total_composite_std": 0.4445638954639435} {"timestamp_utc": "2026-04-12T14:11:48Z", "mode": "eval", "global_step": 850, "epoch": 0.03414065951721091, "eval_loss": NaN, "eval_runtime": 151.1241, "eval_samples_per_second": 0.688, "eval_steps_per_second": 0.086, "eval_num_tokens": 1729265.0, "eval_completions/mean_length": 249.90384615384616, "eval_completions/min_length": 51.53846153846154, "eval_completions/max_length": 511.53846153846155, "eval_completions/clipped_ratio": 0.22115384615384615, "eval_completions/mean_terminated_length": 176.33379540076623, "eval_completions/min_terminated_length": 51.53846153846154, "eval_completions/max_terminated_length": 365.0, "eval_rewards/meter/mean": 0.4448819011449814, "eval_rewards/meter/std": 0.3580018625809596, "eval_rewards/count_adherence/mean": 0.8912672629723182, "eval_rewards/count_adherence/std": 0.1746937598173435, "eval_rewards/arabic_clean/mean": 0.8557692307692307, "eval_rewards/arabic_clean/std": 0.28682195911040675, "eval_rewards/lexical_plausibility/mean": 0.9675572973031265, "eval_rewards/lexical_plausibility/std": 0.05942482429628189, "eval_rewards/judge_quality/mean": 0.3385576903820038, "eval_rewards/judge_quality/std": 0.21257938329990095, "eval_rewards/repeat_penalty/mean": 0.6054709003521845, "eval_rewards/repeat_penalty/std": 0.37947613573991335, "eval_rewards/near_duplicate_penalty/mean": 0.8781809302476736, "eval_rewards/near_duplicate_penalty/std": 0.13536858558654785, "eval_rewards/opening_diversity/mean": 0.9364497157243582, "eval_rewards/opening_diversity/std": 0.12932605783526713, "eval_rewards/distinct_2/mean": 0.671563290632688, "eval_rewards/distinct_2/std": 0.38163365652927983, "eval_rewards/total_composite/mean": 0.12671952522717989, "eval_rewards/total_composite/std": 0.13176435031569922, "eval_reward": 0.12671952522717989, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.04447327324977288, "eval_sampling/sampling_logp_difference/max": 1.0257074282719538, "eval_sampling/importance_sampling_ratio/min": 0.3644731044769287, "eval_sampling/importance_sampling_ratio/mean": 1.0076959683344915, "eval_sampling/importance_sampling_ratio/max": 1.5320360935651338, "eval_entropy": 0.4640323542631589, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.12671952522717989, "eval_reward_meter_mean": 0.4448819011449814, "eval_reward_meter_std": 0.3580018625809596, "eval_reward_count_adherence_mean": 0.8912672629723182, "eval_reward_count_adherence_std": 0.1746937598173435, "eval_reward_arabic_clean_mean": 0.8557692307692307, "eval_reward_arabic_clean_std": 0.28682195911040675, "eval_reward_lexical_plausibility_mean": 0.9675572973031265, "eval_reward_lexical_plausibility_std": 0.05942482429628189, "eval_reward_repeat_penalty_mean": 0.6054709003521845, "eval_reward_repeat_penalty_std": 0.37947613573991335, "eval_reward_near_duplicate_penalty_mean": 0.8781809302476736, "eval_reward_near_duplicate_penalty_std": 0.13536858558654785, "eval_reward_opening_diversity_mean": 0.9364497157243582, "eval_reward_opening_diversity_std": 0.12932605783526713, "eval_reward_distinct_2_mean": 0.671563290632688, "eval_reward_distinct_2_std": 0.38163365652927983, "eval_reward_judge_quality_mean": 0.3385576903820038, "eval_reward_judge_quality_std": 0.21257938329990095, "eval_reward_total_composite_mean": 0.12671952522717989, "eval_reward_total_composite_std": 0.13176435031569922} {"timestamp_utc": "2026-04-12T14:12:05Z", "mode": "train", "global_step": 851, "epoch": 0.034180824998995864, "loss": -0.1915, "grad_norm": 3.036870241165161, "learning_rate": 7.424242424242425e-06, "num_tokens": 1731652.0, "completions/mean_length": 238.375, "completions/min_length": 138.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 147.1666717529297, "completions/min_terminated_length": 138.0, "completions/max_terminated_length": 157.0, "rewards/meter/mean": 0.49326273798942566, "rewards/meter/std": 0.2799670696258545, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9327911138534546, "rewards/lexical_plausibility/std": 0.12464896589517593, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.8372189998626709, "rewards/repeat_penalty/std": 0.1295851618051529, "rewards/near_duplicate_penalty/mean": 0.9472448825836182, "rewards/near_duplicate_penalty/std": 0.027554435655474663, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8812383413314819, "rewards/distinct_2/std": 0.11631060391664505, "rewards/total_composite/mean": 0.15697631239891052, "rewards/total_composite/std": 0.12170809507369995, "reward": 0.15697631239891052, "reward_std": 0.12170809507369995, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13440777361392975, "sampling/sampling_logp_difference/max": 2.7319352626800537, "sampling/importance_sampling_ratio/min": 0.06509319692850113, "sampling/importance_sampling_ratio/mean": 0.996009111404419, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5036326497793198, "clip_ratio/low_mean": 0.03144668601453304, "clip_ratio/low_min": 0.03144668601453304, "clip_ratio/high_mean": 0.078272994607687, "clip_ratio/high_max": 0.078272994607687, "clip_ratio/region_mean": 0.10971968062222004, "reward_total_mean": 0.15697631239891052, "reward_meter_mean": 0.49326273798942566, "reward_meter_std": 0.2799670696258545, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9327911138534546, "reward_lexical_plausibility_std": 0.12464896589517593, "reward_repeat_penalty_mean": 0.8372189998626709, "reward_repeat_penalty_std": 0.1295851618051529, "reward_near_duplicate_penalty_mean": 0.9472448825836182, "reward_near_duplicate_penalty_std": 0.027554435655474663, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8812383413314819, "reward_distinct_2_std": 0.11631060391664505, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.15697631239891052, "reward_total_composite_std": 0.12170809507369995} {"timestamp_utc": "2026-04-12T14:12:18Z", "mode": "train", "global_step": 852, "epoch": 0.03422099048078082, "loss": 0.0236, "grad_norm": 5.771389007568359, "learning_rate": 7.421212121212121e-06, "num_tokens": 1733330.0, "completions/mean_length": 117.75, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.42857360839844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.6570340394973755, "rewards/meter/std": 0.3390442430973053, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9543074369430542, "rewards/lexical_plausibility/std": 0.09006527811288834, "rewards/judge_quality/mean": 0.5587500333786011, "rewards/judge_quality/std": 0.31669893860816956, "rewards/repeat_penalty/mean": 0.9256876111030579, "rewards/repeat_penalty/std": 0.06792078167200089, "rewards/near_duplicate_penalty/mean": 0.9544930458068848, "rewards/near_duplicate_penalty/std": 0.04653129726648331, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.969480037689209, "rewards/distinct_2/std": 0.04637126624584198, "rewards/total_composite/mean": 0.35104185342788696, "rewards/total_composite/std": 0.3258068859577179, "reward": 0.35104185342788696, "reward_std": 0.3258068859577179, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14230962097644806, "sampling/sampling_logp_difference/max": 1.5181989669799805, "sampling/importance_sampling_ratio/min": 0.21910616755485535, "sampling/importance_sampling_ratio/mean": 1.005537986755371, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8239889964461327, "clip_ratio/low_mean": 0.02830155473202467, "clip_ratio/low_min": 0.02830155473202467, "clip_ratio/high_mean": 0.08166788890957832, "clip_ratio/high_max": 0.08166788890957832, "clip_ratio/region_mean": 0.10996944364160299, "reward_total_mean": 0.35104185342788696, "reward_meter_mean": 0.6570340394973755, "reward_meter_std": 0.3390442430973053, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9543074369430542, "reward_lexical_plausibility_std": 0.09006527811288834, "reward_repeat_penalty_mean": 0.9256876111030579, "reward_repeat_penalty_std": 0.06792078167200089, "reward_near_duplicate_penalty_mean": 0.9544930458068848, "reward_near_duplicate_penalty_std": 0.04653129726648331, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.969480037689209, "reward_distinct_2_std": 0.04637126624584198, "reward_judge_quality_mean": 0.5587500333786011, "reward_judge_quality_std": 0.31669893860816956, "reward_total_composite_mean": 0.35104185342788696, "reward_total_composite_std": 0.3258068859577179} {"timestamp_utc": "2026-04-12T14:12:33Z", "mode": "train", "global_step": 853, "epoch": 0.03426115596256577, "loss": 0.0951, "grad_norm": 1.5703561305999756, "learning_rate": 7.4181818181818185e-06, "num_tokens": 1737230.0, "completions/mean_length": 457.5, "completions/min_length": 389.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 424.8000183105469, "completions/min_terminated_length": 389.0, "completions/max_terminated_length": 492.0, "rewards/meter/mean": 0.6266857385635376, "rewards/meter/std": 0.362479567527771, "rewards/count_adherence/mean": 0.6538461446762085, "rewards/count_adherence/std": 0.23619985580444336, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9819031357765198, "rewards/lexical_plausibility/std": 0.04779762774705887, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.12918885052204132, "rewards/repeat_penalty/std": 0.34368520975112915, "rewards/near_duplicate_penalty/mean": 0.7267413139343262, "rewards/near_duplicate_penalty/std": 0.153737410902977, "rewards/opening_diversity/mean": 0.7754915952682495, "rewards/opening_diversity/std": 0.3050152659416199, "rewards/distinct_2/mean": 0.13968680799007416, "rewards/distinct_2/std": 0.348369836807251, "rewards/total_composite/mean": 0.05157095566391945, "rewards/total_composite/std": 0.037722326815128326, "reward": 0.05157095566391945, "reward_std": 0.03772232308983803, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05474357679486275, "sampling/sampling_logp_difference/max": 2.797646999359131, "sampling/importance_sampling_ratio/min": 0.06095331534743309, "sampling/importance_sampling_ratio/mean": 1.0069084167480469, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.1865599974989891, "clip_ratio/low_mean": 0.018432441633194685, "clip_ratio/low_min": 0.018432441633194685, "clip_ratio/high_mean": 0.011336264666169882, "clip_ratio/high_max": 0.011336264666169882, "clip_ratio/region_mean": 0.029768706299364567, "reward_total_mean": 0.05157095566391945, "reward_meter_mean": 0.6266857385635376, "reward_meter_std": 0.362479567527771, "reward_count_adherence_mean": 0.6538461446762085, "reward_count_adherence_std": 0.23619985580444336, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9819031357765198, "reward_lexical_plausibility_std": 0.04779762774705887, "reward_repeat_penalty_mean": 0.12918885052204132, "reward_repeat_penalty_std": 0.34368520975112915, "reward_near_duplicate_penalty_mean": 0.7267413139343262, "reward_near_duplicate_penalty_std": 0.153737410902977, "reward_opening_diversity_mean": 0.7754915952682495, "reward_opening_diversity_std": 0.3050152659416199, "reward_distinct_2_mean": 0.13968680799007416, "reward_distinct_2_std": 0.348369836807251, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.05157095566391945, "reward_total_composite_std": 0.037722326815128326} {"timestamp_utc": "2026-04-12T14:12:46Z", "mode": "train", "global_step": 854, "epoch": 0.034301321444350726, "loss": -0.1222, "grad_norm": 3.162191152572632, "learning_rate": 7.415151515151515e-06, "num_tokens": 1739061.0, "completions/mean_length": 186.875, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 78.5, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.35487979650497437, "rewards/meter/std": 0.17712539434432983, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.93937087059021, "rewards/lexical_plausibility/std": 0.11311454325914383, "rewards/judge_quality/mean": 0.5450000166893005, "rewards/judge_quality/std": 0.3766392767429352, "rewards/repeat_penalty/mean": 0.9895455241203308, "rewards/repeat_penalty/std": 0.008139162324368954, "rewards/near_duplicate_penalty/mean": 0.9900454878807068, "rewards/near_duplicate_penalty/std": 0.008581546135246754, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9994992017745972, "rewards/distinct_2/std": 0.0014164713211357594, "rewards/total_composite/mean": 0.22739753127098083, "rewards/total_composite/std": 0.17319437861442566, "reward": 0.22739753127098083, "reward_std": 0.17319437861442566, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1522524654865265, "sampling/sampling_logp_difference/max": 1.7845678329467773, "sampling/importance_sampling_ratio/min": 0.16786959767341614, "sampling/importance_sampling_ratio/mean": 0.9787825345993042, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.42490098997950554, "clip_ratio/low_mean": 0.01617647148668766, "clip_ratio/low_min": 0.01617647148668766, "clip_ratio/high_mean": 0.0963799711316824, "clip_ratio/high_max": 0.0963799711316824, "clip_ratio/region_mean": 0.11255644261837006, "reward_total_mean": 0.22739753127098083, "reward_meter_mean": 0.35487979650497437, "reward_meter_std": 0.17712539434432983, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.93937087059021, "reward_lexical_plausibility_std": 0.11311454325914383, "reward_repeat_penalty_mean": 0.9895455241203308, "reward_repeat_penalty_std": 0.008139162324368954, "reward_near_duplicate_penalty_mean": 0.9900454878807068, "reward_near_duplicate_penalty_std": 0.008581546135246754, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9994992017745972, "reward_distinct_2_std": 0.0014164713211357594, "reward_judge_quality_mean": 0.5450000166893005, "reward_judge_quality_std": 0.3766392767429352, "reward_total_composite_mean": 0.22739753127098083, "reward_total_composite_std": 0.17319437861442566} {"timestamp_utc": "2026-04-12T14:12:59Z", "mode": "train", "global_step": 855, "epoch": 0.03434148692613568, "loss": -0.0805, "grad_norm": 5.049601078033447, "learning_rate": 7.412121212121213e-06, "num_tokens": 1740582.0, "completions/mean_length": 102.125, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.57143020629883, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.9404455423355103, "rewards/meter/std": 0.10320204496383667, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9707344174385071, "rewards/lexical_plausibility/std": 0.0827755481004715, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3443005383014679, "rewards/repeat_penalty/mean": 0.9731278419494629, "rewards/repeat_penalty/std": 0.026308590546250343, "rewards/near_duplicate_penalty/mean": 0.9731278419494629, "rewards/near_duplicate_penalty/std": 0.026308590546250343, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6001728773117065, "rewards/total_composite/std": 0.3590646982192993, "reward": 0.6001728773117065, "reward_std": 0.35906466841697693, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10709303617477417, "sampling/sampling_logp_difference/max": 1.1990714073181152, "sampling/importance_sampling_ratio/min": 0.30147403478622437, "sampling/importance_sampling_ratio/mean": 1.0106830596923828, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4722936786711216, "clip_ratio/low_mean": 0.019832042045891285, "clip_ratio/low_min": 0.019832042045891285, "clip_ratio/high_mean": 0.07080832682549953, "clip_ratio/high_max": 0.07080832682549953, "clip_ratio/region_mean": 0.09064036887139082, "reward_total_mean": 0.6001728773117065, "reward_meter_mean": 0.9404455423355103, "reward_meter_std": 0.10320204496383667, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9707344174385071, "reward_lexical_plausibility_std": 0.0827755481004715, "reward_repeat_penalty_mean": 0.9731278419494629, "reward_repeat_penalty_std": 0.026308590546250343, "reward_near_duplicate_penalty_mean": 0.9731278419494629, "reward_near_duplicate_penalty_std": 0.026308590546250343, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3443005383014679, "reward_total_composite_mean": 0.6001728773117065, "reward_total_composite_std": 0.3590646982192993} {"timestamp_utc": "2026-04-12T14:13:12Z", "mode": "train", "global_step": 856, "epoch": 0.03438165240792063, "loss": -0.0728, "grad_norm": 1.8549288511276245, "learning_rate": 7.40909090909091e-06, "num_tokens": 1742168.0, "completions/mean_length": 220.25, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 45.20000076293945, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7261562347412109, "rewards/meter/std": 0.38776305317878723, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.915650486946106, "rewards/lexical_plausibility/std": 0.11713753640651703, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.29875636100769043, "rewards/repeat_penalty/mean": 0.952872633934021, "rewards/repeat_penalty/std": 0.06170550361275673, "rewards/near_duplicate_penalty/mean": 0.9707337021827698, "rewards/near_duplicate_penalty/std": 0.023901375010609627, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9810642600059509, "rewards/distinct_2/std": 0.04894232377409935, "rewards/total_composite/mean": 0.30604180693626404, "rewards/total_composite/std": 0.3092731237411499, "reward": 0.30604180693626404, "reward_std": 0.3092730939388275, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1227310299873352, "sampling/sampling_logp_difference/max": 1.4008054733276367, "sampling/importance_sampling_ratio/min": 0.2463984340429306, "sampling/importance_sampling_ratio/mean": 0.9991787672042847, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4100022315979004, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08825570717453957, "clip_ratio/high_max": 0.08825570717453957, "clip_ratio/region_mean": 0.08825570717453957, "reward_total_mean": 0.30604180693626404, "reward_meter_mean": 0.7261562347412109, "reward_meter_std": 0.38776305317878723, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.915650486946106, "reward_lexical_plausibility_std": 0.11713753640651703, "reward_repeat_penalty_mean": 0.952872633934021, "reward_repeat_penalty_std": 0.06170550361275673, "reward_near_duplicate_penalty_mean": 0.9707337021827698, "reward_near_duplicate_penalty_std": 0.023901375010609627, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9810642600059509, "reward_distinct_2_std": 0.04894232377409935, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.29875636100769043, "reward_total_composite_mean": 0.30604180693626404, "reward_total_composite_std": 0.3092731237411499} {"timestamp_utc": "2026-04-12T14:13:26Z", "mode": "train", "global_step": 857, "epoch": 0.03442181788970559, "loss": -0.0541, "grad_norm": 2.7563040256500244, "learning_rate": 7.406060606060607e-06, "num_tokens": 1743617.0, "completions/mean_length": 223.125, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 49.79999923706055, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.27811571955680847, "rewards/meter/std": 0.3214670419692993, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8602814674377441, "rewards/lexical_plausibility/std": 0.15611913800239563, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.22320714592933655, "rewards/repeat_penalty/mean": 0.9917591214179993, "rewards/repeat_penalty/std": 0.01286725327372551, "rewards/near_duplicate_penalty/mean": 0.9917591214179993, "rewards/near_duplicate_penalty/std": 0.01286725327372551, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12017762660980225, "rewards/total_composite/std": 0.17518144845962524, "reward": 0.12017762660980225, "reward_std": 0.17518143355846405, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1400035172700882, "sampling/sampling_logp_difference/max": 1.4476470947265625, "sampling/importance_sampling_ratio/min": 0.23512287437915802, "sampling/importance_sampling_ratio/mean": 1.0204826593399048, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5590995326638222, "clip_ratio/low_mean": 0.028879476711153984, "clip_ratio/low_min": 0.028879476711153984, "clip_ratio/high_mean": 0.03676243592053652, "clip_ratio/high_max": 0.03676243592053652, "clip_ratio/region_mean": 0.0656419126316905, "reward_total_mean": 0.12017762660980225, "reward_meter_mean": 0.27811571955680847, "reward_meter_std": 0.3214670419692993, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8602814674377441, "reward_lexical_plausibility_std": 0.15611913800239563, "reward_repeat_penalty_mean": 0.9917591214179993, "reward_repeat_penalty_std": 0.01286725327372551, "reward_near_duplicate_penalty_mean": 0.9917591214179993, "reward_near_duplicate_penalty_std": 0.01286725327372551, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.22320714592933655, "reward_total_composite_mean": 0.12017762660980225, "reward_total_composite_std": 0.17518144845962524} {"timestamp_utc": "2026-04-12T14:13:39Z", "mode": "train", "global_step": 858, "epoch": 0.03446198337149054, "loss": -0.0145, "grad_norm": 3.7855429649353027, "learning_rate": 7.403030303030304e-06, "num_tokens": 1746891.0, "completions/mean_length": 292.25, "completions/min_length": 192.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 260.8571472167969, "completions/min_terminated_length": 192.0, "completions/max_terminated_length": 378.0, "rewards/meter/mean": 0.33917608857154846, "rewards/meter/std": 0.2654321789741516, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.21128857135772705, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.974175751209259, "rewards/lexical_plausibility/std": 0.07304198294878006, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.34017446637153625, "rewards/repeat_penalty/std": 0.19788828492164612, "rewards/near_duplicate_penalty/mean": 0.8011940717697144, "rewards/near_duplicate_penalty/std": 0.10140984505414963, "rewards/opening_diversity/mean": 0.9831730723381042, "rewards/opening_diversity/std": 0.04759372025728226, "rewards/distinct_2/mean": 0.4517394006252289, "rewards/distinct_2/std": 0.1864631175994873, "rewards/total_composite/mean": 0.05384580045938492, "rewards/total_composite/std": 0.04389374330639839, "reward": 0.05384580045938492, "reward_std": 0.04389374330639839, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09047599136829376, "sampling/sampling_logp_difference/max": 3.042069911956787, "sampling/importance_sampling_ratio/min": 0.04773597791790962, "sampling/importance_sampling_ratio/mean": 1.0003856420516968, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3925344701856375, "clip_ratio/low_mean": 0.03446326730772853, "clip_ratio/low_min": 0.03446326730772853, "clip_ratio/high_mean": 0.03539368836209178, "clip_ratio/high_max": 0.03539368836209178, "clip_ratio/region_mean": 0.06985695566982031, "reward_total_mean": 0.05384580045938492, "reward_meter_mean": 0.33917608857154846, "reward_meter_std": 0.2654321789741516, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.21128857135772705, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.974175751209259, "reward_lexical_plausibility_std": 0.07304198294878006, "reward_repeat_penalty_mean": 0.34017446637153625, "reward_repeat_penalty_std": 0.19788828492164612, "reward_near_duplicate_penalty_mean": 0.8011940717697144, "reward_near_duplicate_penalty_std": 0.10140984505414963, "reward_opening_diversity_mean": 0.9831730723381042, "reward_opening_diversity_std": 0.04759372025728226, "reward_distinct_2_mean": 0.4517394006252289, "reward_distinct_2_std": 0.1864631175994873, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.05384580045938492, "reward_total_composite_std": 0.04389374330639839} {"timestamp_utc": "2026-04-12T14:13:53Z", "mode": "train", "global_step": 859, "epoch": 0.034502148853275495, "loss": -0.0723, "grad_norm": 4.451854228973389, "learning_rate": 7.4e-06, "num_tokens": 1749133.0, "completions/mean_length": 159.25, "completions/min_length": 102.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 108.85714721679688, "completions/min_terminated_length": 102.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.3008106052875519, "rewards/meter/std": 0.24272847175598145, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.972153902053833, "rewards/lexical_plausibility/std": 0.0459597073495388, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.346533864736557, "rewards/repeat_penalty/mean": 0.9406341314315796, "rewards/repeat_penalty/std": 0.06208498775959015, "rewards/near_duplicate_penalty/mean": 0.9765318632125854, "rewards/near_duplicate_penalty/std": 0.01911858841776848, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9630399942398071, "rewards/distinct_2/std": 0.057189639657735825, "rewards/total_composite/mean": 0.17408716678619385, "rewards/total_composite/std": 0.1432017832994461, "reward": 0.17408716678619385, "reward_std": 0.1432017832994461, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11997110396623611, "sampling/sampling_logp_difference/max": 2.8195769786834717, "sampling/importance_sampling_ratio/min": 0.05963116139173508, "sampling/importance_sampling_ratio/mean": 0.9923701286315918, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4308541715145111, "clip_ratio/low_mean": 0.04663661774247885, "clip_ratio/low_min": 0.04663661774247885, "clip_ratio/high_mean": 0.06251640524715185, "clip_ratio/high_max": 0.06251640524715185, "clip_ratio/region_mean": 0.1091530229896307, "reward_total_mean": 0.17408716678619385, "reward_meter_mean": 0.3008106052875519, "reward_meter_std": 0.24272847175598145, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.972153902053833, "reward_lexical_plausibility_std": 0.0459597073495388, "reward_repeat_penalty_mean": 0.9406341314315796, "reward_repeat_penalty_std": 0.06208498775959015, "reward_near_duplicate_penalty_mean": 0.9765318632125854, "reward_near_duplicate_penalty_std": 0.01911858841776848, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9630399942398071, "reward_distinct_2_std": 0.057189639657735825, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.346533864736557, "reward_total_composite_mean": 0.17408716678619385, "reward_total_composite_std": 0.1432017832994461} {"timestamp_utc": "2026-04-12T14:14:02Z", "mode": "train", "global_step": 860, "epoch": 0.03454231433506045, "loss": 0.0024, "grad_norm": 7.0358099937438965, "learning_rate": 7.396969696969698e-06, "num_tokens": 1751326.0, "completions/mean_length": 91.125, "completions/min_length": 81.0, "completions/max_length": 114.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.125, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.7421751022338867, "rewards/meter/std": 0.3366747796535492, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.9613125324249268, "rewards/repeat_penalty/std": 0.049800075590610504, "rewards/near_duplicate_penalty/mean": 0.9764053225517273, "rewards/near_duplicate_penalty/std": 0.020267708227038383, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.031795889139175415, "rewards/total_composite/mean": 0.40260064601898193, "rewards/total_composite/std": 0.31393536925315857, "reward": 0.40260064601898193, "reward_std": 0.31393536925315857, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1001368835568428, "sampling/sampling_logp_difference/max": 1.8461298942565918, "sampling/importance_sampling_ratio/min": 0.15784688293933868, "sampling/importance_sampling_ratio/mean": 0.9935073852539062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4307049550116062, "clip_ratio/low_mean": 0.07043880689889193, "clip_ratio/low_min": 0.07043880689889193, "clip_ratio/high_mean": 0.03290719632059336, "clip_ratio/high_max": 0.03290719632059336, "clip_ratio/region_mean": 0.10334600321948528, "reward_total_mean": 0.40260064601898193, "reward_meter_mean": 0.7421751022338867, "reward_meter_std": 0.3366747796535492, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9613125324249268, "reward_repeat_penalty_std": 0.049800075590610504, "reward_near_duplicate_penalty_mean": 0.9764053225517273, "reward_near_duplicate_penalty_std": 0.020267708227038383, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.031795889139175415, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.40260064601898193, "reward_total_composite_std": 0.31393536925315857} {"timestamp_utc": "2026-04-12T14:14:15Z", "mode": "train", "global_step": 861, "epoch": 0.0345824798168454, "loss": -0.0756, "grad_norm": 6.31519079208374, "learning_rate": 7.393939393939395e-06, "num_tokens": 1753433.0, "completions/mean_length": 147.375, "completions/min_length": 88.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 95.28572082519531, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.48967862129211426, "rewards/meter/std": 0.3885529637336731, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9755135774612427, "rewards/lexical_plausibility/std": 0.06925806403160095, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3586059510707855, "rewards/repeat_penalty/mean": 0.5996940732002258, "rewards/repeat_penalty/std": 0.24790264666080475, "rewards/near_duplicate_penalty/mean": 0.8497533798217773, "rewards/near_duplicate_penalty/std": 0.08299332112073898, "rewards/opening_diversity/mean": 0.9765625, "rewards/opening_diversity/std": 0.032346826046705246, "rewards/distinct_2/mean": 0.7284420728683472, "rewards/distinct_2/std": 0.2116343379020691, "rewards/total_composite/mean": 0.2513570785522461, "rewards/total_composite/std": 0.28744709491729736, "reward": 0.2513570785522461, "reward_std": 0.28744709491729736, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08761265128850937, "sampling/sampling_logp_difference/max": 2.0567173957824707, "sampling/importance_sampling_ratio/min": 0.12787304818630219, "sampling/importance_sampling_ratio/mean": 1.0038927793502808, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3343055620789528, "clip_ratio/low_mean": 0.034244128968566656, "clip_ratio/low_min": 0.034244128968566656, "clip_ratio/high_mean": 0.042165616527199745, "clip_ratio/high_max": 0.042165616527199745, "clip_ratio/region_mean": 0.0764097454957664, "reward_total_mean": 0.2513570785522461, "reward_meter_mean": 0.48967862129211426, "reward_meter_std": 0.3885529637336731, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9755135774612427, "reward_lexical_plausibility_std": 0.06925806403160095, "reward_repeat_penalty_mean": 0.5996940732002258, "reward_repeat_penalty_std": 0.24790264666080475, "reward_near_duplicate_penalty_mean": 0.8497533798217773, "reward_near_duplicate_penalty_std": 0.08299332112073898, "reward_opening_diversity_mean": 0.9765625, "reward_opening_diversity_std": 0.032346826046705246, "reward_distinct_2_mean": 0.7284420728683472, "reward_distinct_2_std": 0.2116343379020691, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3586059510707855, "reward_total_composite_mean": 0.2513570785522461, "reward_total_composite_std": 0.28744709491729736} {"timestamp_utc": "2026-04-12T14:14:28Z", "mode": "train", "global_step": 862, "epoch": 0.03462264529863036, "loss": -0.1084, "grad_norm": 4.4236555099487305, "learning_rate": 7.390909090909092e-06, "num_tokens": 1754964.0, "completions/mean_length": 126.375, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 71.28572082519531, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.7048521041870117, "rewards/meter/std": 0.2765464186668396, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9603685140609741, "rewards/lexical_plausibility/std": 0.10133814066648483, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.5826496481895447, "rewards/repeat_penalty/std": 0.24502216279506683, "rewards/near_duplicate_penalty/mean": 0.8624882102012634, "rewards/near_duplicate_penalty/std": 0.10935547202825546, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.6983522176742554, "rewards/distinct_2/std": 0.2373177409172058, "rewards/total_composite/mean": 0.09684468805789948, "rewards/total_composite/std": 0.055279623717069626, "reward": 0.09684468805789948, "reward_std": 0.055279623717069626, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12048140913248062, "sampling/sampling_logp_difference/max": 1.75498366355896, "sampling/importance_sampling_ratio/min": 0.20727141201496124, "sampling/importance_sampling_ratio/mean": 1.0190989971160889, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6958971619606018, "clip_ratio/low_mean": 0.03912902623414993, "clip_ratio/low_min": 0.03912902623414993, "clip_ratio/high_mean": 0.07419338077306747, "clip_ratio/high_max": 0.07419338077306747, "clip_ratio/region_mean": 0.11332240700721741, "reward_total_mean": 0.09684468805789948, "reward_meter_mean": 0.7048521041870117, "reward_meter_std": 0.2765464186668396, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9603685140609741, "reward_lexical_plausibility_std": 0.10133814066648483, "reward_repeat_penalty_mean": 0.5826496481895447, "reward_repeat_penalty_std": 0.24502216279506683, "reward_near_duplicate_penalty_mean": 0.8624882102012634, "reward_near_duplicate_penalty_std": 0.10935547202825546, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.6983522176742554, "reward_distinct_2_std": 0.2373177409172058, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.09684468805789948, "reward_total_composite_std": 0.055279623717069626} {"timestamp_utc": "2026-04-12T14:14:42Z", "mode": "train", "global_step": 863, "epoch": 0.03466281078041531, "loss": -0.1476, "grad_norm": 3.4566609859466553, "learning_rate": 7.3878787878787885e-06, "num_tokens": 1757296.0, "completions/mean_length": 170.5, "completions/min_length": 117.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 121.71429443359375, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.7879217863082886, "rewards/meter/std": 0.3524387776851654, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.956170916557312, "rewards/lexical_plausibility/std": 0.12396745383739471, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.5562999248504639, "rewards/repeat_penalty/std": 0.295958936214447, "rewards/near_duplicate_penalty/mean": 0.8740394115447998, "rewards/near_duplicate_penalty/std": 0.08502187579870224, "rewards/opening_diversity/mean": 0.9750000238418579, "rewards/opening_diversity/std": 0.04629101976752281, "rewards/distinct_2/mean": 0.6530981063842773, "rewards/distinct_2/std": 0.25794315338134766, "rewards/total_composite/mean": 0.27703890204429626, "rewards/total_composite/std": 0.15440022945404053, "reward": 0.27703890204429626, "reward_std": 0.15440022945404053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10070232301950455, "sampling/sampling_logp_difference/max": 1.567529320716858, "sampling/importance_sampling_ratio/min": 0.2085598260164261, "sampling/importance_sampling_ratio/mean": 1.0005910396575928, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5294371768832207, "clip_ratio/low_mean": 0.014707273803651333, "clip_ratio/low_min": 0.014707273803651333, "clip_ratio/high_mean": 0.07067823689430952, "clip_ratio/high_max": 0.07067823689430952, "clip_ratio/region_mean": 0.08538551069796085, "reward_total_mean": 0.27703890204429626, "reward_meter_mean": 0.7879217863082886, "reward_meter_std": 0.3524387776851654, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.956170916557312, "reward_lexical_plausibility_std": 0.12396745383739471, "reward_repeat_penalty_mean": 0.5562999248504639, "reward_repeat_penalty_std": 0.295958936214447, "reward_near_duplicate_penalty_mean": 0.8740394115447998, "reward_near_duplicate_penalty_std": 0.08502187579870224, "reward_opening_diversity_mean": 0.9750000238418579, "reward_opening_diversity_std": 0.04629101976752281, "reward_distinct_2_mean": 0.6530981063842773, "reward_distinct_2_std": 0.25794315338134766, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.27703890204429626, "reward_total_composite_std": 0.15440022945404053} {"timestamp_utc": "2026-04-12T14:14:55Z", "mode": "train", "global_step": 864, "epoch": 0.034702976262200265, "loss": -0.0882, "grad_norm": 1.6613599061965942, "learning_rate": 7.384848484848486e-06, "num_tokens": 1758751.0, "completions/mean_length": 224.875, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 52.60000228881836, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.6435930728912354, "rewards/meter/std": 0.3932993412017822, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.902877926826477, "rewards/lexical_plausibility/std": 0.10823936015367508, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1927248239517212, "rewards/repeat_penalty/mean": 0.5592107772827148, "rewards/repeat_penalty/std": 0.32434093952178955, "rewards/near_duplicate_penalty/mean": 0.8366586565971375, "rewards/near_duplicate_penalty/std": 0.1928642988204956, "rewards/opening_diversity/mean": 0.71875, "rewards/opening_diversity/std": 0.23857837915420532, "rewards/distinct_2/mean": 0.8448572158813477, "rewards/distinct_2/std": 0.2168506532907486, "rewards/total_composite/mean": 0.20020878314971924, "rewards/total_composite/std": 0.18904922902584076, "reward": 0.20020878314971924, "reward_std": 0.18904922902584076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13655053079128265, "sampling/sampling_logp_difference/max": 2.8553378582000732, "sampling/importance_sampling_ratio/min": 0.057536378502845764, "sampling/importance_sampling_ratio/mean": 0.9979873299598694, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3610412999987602, "clip_ratio/low_mean": 0.014999999664723873, "clip_ratio/low_min": 0.014999999664723873, "clip_ratio/high_mean": 0.05459588207304478, "clip_ratio/high_max": 0.05459588207304478, "clip_ratio/region_mean": 0.06959588173776865, "reward_total_mean": 0.20020878314971924, "reward_meter_mean": 0.6435930728912354, "reward_meter_std": 0.3932993412017822, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.902877926826477, "reward_lexical_plausibility_std": 0.10823936015367508, "reward_repeat_penalty_mean": 0.5592107772827148, "reward_repeat_penalty_std": 0.32434093952178955, "reward_near_duplicate_penalty_mean": 0.8366586565971375, "reward_near_duplicate_penalty_std": 0.1928642988204956, "reward_opening_diversity_mean": 0.71875, "reward_opening_diversity_std": 0.23857837915420532, "reward_distinct_2_mean": 0.8448572158813477, "reward_distinct_2_std": 0.2168506532907486, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1927248239517212, "reward_total_composite_mean": 0.20020878314971924, "reward_total_composite_std": 0.18904922902584076} {"timestamp_utc": "2026-04-12T14:15:04Z", "mode": "train", "global_step": 865, "epoch": 0.03474314174398522, "loss": 0.0598, "grad_norm": 10.180727005004883, "learning_rate": 7.381818181818182e-06, "num_tokens": 1760494.0, "completions/mean_length": 60.875, "completions/min_length": 55.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.875, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.7840351462364197, "rewards/meter/std": 0.3521861135959625, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.5899261832237244, "rewards/repeat_penalty/std": 0.2448299080133438, "rewards/near_duplicate_penalty/mean": 0.8201501965522766, "rewards/near_duplicate_penalty/std": 0.13156695663928986, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.7801418304443359, "rewards/distinct_2/std": 0.14881575107574463, "rewards/total_composite/mean": 0.28938913345336914, "rewards/total_composite/std": 0.12707412242889404, "reward": 0.28938913345336914, "reward_std": 0.12707412242889404, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11234337836503983, "sampling/sampling_logp_difference/max": 1.9080142974853516, "sampling/importance_sampling_ratio/min": 0.14837472140789032, "sampling/importance_sampling_ratio/mean": 1.0136069059371948, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5191529989242554, "clip_ratio/low_mean": 0.030281012412160635, "clip_ratio/low_min": 0.030281012412160635, "clip_ratio/high_mean": 0.0663289362564683, "clip_ratio/high_max": 0.0663289362564683, "clip_ratio/region_mean": 0.09660994866862893, "reward_total_mean": 0.28938913345336914, "reward_meter_mean": 0.7840351462364197, "reward_meter_std": 0.3521861135959625, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5899261832237244, "reward_repeat_penalty_std": 0.2448299080133438, "reward_near_duplicate_penalty_mean": 0.8201501965522766, "reward_near_duplicate_penalty_std": 0.13156695663928986, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.7801418304443359, "reward_distinct_2_std": 0.14881575107574463, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.28938913345336914, "reward_total_composite_std": 0.12707412242889404} {"timestamp_utc": "2026-04-12T14:15:17Z", "mode": "train", "global_step": 866, "epoch": 0.03478330722577017, "loss": -0.094, "grad_norm": 3.834961175918579, "learning_rate": 7.378787878787879e-06, "num_tokens": 1762115.0, "completions/mean_length": 108.625, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.000003814697266, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7777613401412964, "rewards/meter/std": 0.34793820977211, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9689165353775024, "rewards/lexical_plausibility/std": 0.0879172757267952, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.43883436918258667, "rewards/repeat_penalty/std": 0.17324909567832947, "rewards/near_duplicate_penalty/mean": 0.8260517716407776, "rewards/near_duplicate_penalty/std": 0.08417052030563354, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.1735912710428238, "rewards/distinct_2/mean": 0.7871530055999756, "rewards/distinct_2/std": 0.1044204831123352, "rewards/total_composite/mean": 0.297556072473526, "rewards/total_composite/std": 0.16931691765785217, "reward": 0.297556072473526, "reward_std": 0.16931691765785217, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0845629945397377, "sampling/sampling_logp_difference/max": 1.9395453929901123, "sampling/importance_sampling_ratio/min": 0.1437692940235138, "sampling/importance_sampling_ratio/mean": 1.010769009590149, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3806200809776783, "clip_ratio/low_mean": 0.009615384973585606, "clip_ratio/low_min": 0.009615384973585606, "clip_ratio/high_mean": 0.05670261709019542, "clip_ratio/high_max": 0.05670261709019542, "clip_ratio/region_mean": 0.06631800206378102, "reward_total_mean": 0.297556072473526, "reward_meter_mean": 0.7777613401412964, "reward_meter_std": 0.34793820977211, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9689165353775024, "reward_lexical_plausibility_std": 0.0879172757267952, "reward_repeat_penalty_mean": 0.43883436918258667, "reward_repeat_penalty_std": 0.17324909567832947, "reward_near_duplicate_penalty_mean": 0.8260517716407776, "reward_near_duplicate_penalty_std": 0.08417052030563354, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.1735912710428238, "reward_distinct_2_mean": 0.7871530055999756, "reward_distinct_2_std": 0.1044204831123352, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.297556072473526, "reward_total_composite_std": 0.16931691765785217} {"timestamp_utc": "2026-04-12T14:15:30Z", "mode": "train", "global_step": 867, "epoch": 0.03482347270755513, "loss": -0.0947, "grad_norm": 3.859180450439453, "learning_rate": 7.375757575757576e-06, "num_tokens": 1763915.0, "completions/mean_length": 180.0, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 69.33333587646484, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.2914176285266876, "rewards/meter/std": 0.15172293782234192, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9521939158439636, "rewards/lexical_plausibility/std": 0.09111620485782623, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.31272992491722107, "rewards/repeat_penalty/mean": 0.9737507104873657, "rewards/repeat_penalty/std": 0.02878880500793457, "rewards/near_duplicate_penalty/mean": 0.9803803563117981, "rewards/near_duplicate_penalty/std": 0.015758827328681946, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.16419778764247894, "rewards/total_composite/std": 0.13353072106838226, "reward": 0.16419778764247894, "reward_std": 0.13353072106838226, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15073788166046143, "sampling/sampling_logp_difference/max": 1.4994456768035889, "sampling/importance_sampling_ratio/min": 0.22325389087200165, "sampling/importance_sampling_ratio/mean": 1.0131865739822388, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5943051502108574, "clip_ratio/low_mean": 0.03898390382528305, "clip_ratio/low_min": 0.03898390382528305, "clip_ratio/high_mean": 0.07402368821203709, "clip_ratio/high_max": 0.07402368821203709, "clip_ratio/region_mean": 0.11300759203732014, "reward_total_mean": 0.16419778764247894, "reward_meter_mean": 0.2914176285266876, "reward_meter_std": 0.15172293782234192, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9521939158439636, "reward_lexical_plausibility_std": 0.09111620485782623, "reward_repeat_penalty_mean": 0.9737507104873657, "reward_repeat_penalty_std": 0.02878880500793457, "reward_near_duplicate_penalty_mean": 0.9803803563117981, "reward_near_duplicate_penalty_std": 0.015758827328681946, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.31272992491722107, "reward_total_composite_mean": 0.16419778764247894, "reward_total_composite_std": 0.13353072106838226} {"timestamp_utc": "2026-04-12T14:15:39Z", "mode": "train", "global_step": 868, "epoch": 0.03486363818934008, "loss": 0.05, "grad_norm": 13.824076652526855, "learning_rate": 7.372727272727274e-06, "num_tokens": 1765763.0, "completions/mean_length": 67.0, "completions/min_length": 60.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.0, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.38709595799446106, "rewards/meter/std": 0.3622923195362091, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9322495460510254, "rewards/repeat_penalty/std": 0.1190701350569725, "rewards/near_duplicate_penalty/mean": 0.9690883159637451, "rewards/near_duplicate_penalty/std": 0.04162357375025749, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9587912559509277, "rewards/distinct_2/std": 0.09065470844507217, "rewards/total_composite/mean": 0.1587425172328949, "rewards/total_composite/std": 0.14384205639362335, "reward": 0.1587425172328949, "reward_std": 0.14384204149246216, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1594058722257614, "sampling/sampling_logp_difference/max": 2.085472583770752, "sampling/importance_sampling_ratio/min": 0.12424838542938232, "sampling/importance_sampling_ratio/mean": 0.9888842701911926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6814248487353325, "clip_ratio/low_mean": 0.07203493919223547, "clip_ratio/low_min": 0.07203493919223547, "clip_ratio/high_mean": 0.04719291161745787, "clip_ratio/high_max": 0.04719291161745787, "clip_ratio/region_mean": 0.11922785080969334, "reward_total_mean": 0.1587425172328949, "reward_meter_mean": 0.38709595799446106, "reward_meter_std": 0.3622923195362091, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9322495460510254, "reward_repeat_penalty_std": 0.1190701350569725, "reward_near_duplicate_penalty_mean": 0.9690883159637451, "reward_near_duplicate_penalty_std": 0.04162357375025749, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9587912559509277, "reward_distinct_2_std": 0.09065470844507217, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.1587425172328949, "reward_total_composite_std": 0.14384205639362335} {"timestamp_utc": "2026-04-12T14:15:53Z", "mode": "train", "global_step": 869, "epoch": 0.034903803671125035, "loss": -0.0813, "grad_norm": 3.225282669067383, "learning_rate": 7.36969696969697e-06, "num_tokens": 1767384.0, "completions/mean_length": 177.625, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 66.16667175292969, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.36734604835510254, "rewards/meter/std": 0.3179638683795929, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9347068071365356, "rewards/lexical_plausibility/std": 0.12127043306827545, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.21380898356437683, "rewards/repeat_penalty/mean": 0.6754549145698547, "rewards/repeat_penalty/std": 0.21429799497127533, "rewards/near_duplicate_penalty/mean": 0.8525331020355225, "rewards/near_duplicate_penalty/std": 0.08067642897367477, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8559688329696655, "rewards/distinct_2/std": 0.12709783017635345, "rewards/total_composite/mean": 0.1239505410194397, "rewards/total_composite/std": 0.10338914394378662, "reward": 0.1239505410194397, "reward_std": 0.10338913649320602, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13509614765644073, "sampling/sampling_logp_difference/max": 1.2986257076263428, "sampling/importance_sampling_ratio/min": 0.2854008674621582, "sampling/importance_sampling_ratio/mean": 1.001600742340088, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.45891711115837097, "clip_ratio/low_mean": 0.026167278178036213, "clip_ratio/low_min": 0.026167278178036213, "clip_ratio/high_mean": 0.05937543511390686, "clip_ratio/high_max": 0.05937543511390686, "clip_ratio/region_mean": 0.08554271329194307, "reward_total_mean": 0.1239505410194397, "reward_meter_mean": 0.36734604835510254, "reward_meter_std": 0.3179638683795929, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9347068071365356, "reward_lexical_plausibility_std": 0.12127043306827545, "reward_repeat_penalty_mean": 0.6754549145698547, "reward_repeat_penalty_std": 0.21429799497127533, "reward_near_duplicate_penalty_mean": 0.8525331020355225, "reward_near_duplicate_penalty_std": 0.08067642897367477, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8559688329696655, "reward_distinct_2_std": 0.12709783017635345, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.21380898356437683, "reward_total_composite_mean": 0.1239505410194397, "reward_total_composite_std": 0.10338914394378662} {"timestamp_utc": "2026-04-12T14:16:02Z", "mode": "train", "global_step": 870, "epoch": 0.03494396915290999, "loss": 0.0215, "grad_norm": 7.330625534057617, "learning_rate": 7.3666666666666676e-06, "num_tokens": 1769847.0, "completions/mean_length": 126.875, "completions/min_length": 112.0, "completions/max_length": 149.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 126.875, "completions/min_terminated_length": 112.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.8272303342819214, "rewards/meter/std": 0.18839241564273834, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.5826253294944763, "rewards/repeat_penalty/std": 0.16902408003807068, "rewards/near_duplicate_penalty/mean": 0.8882546424865723, "rewards/near_duplicate_penalty/std": 0.03844599425792694, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.708530843257904, "rewards/distinct_2/std": 0.15559612214565277, "rewards/total_composite/mean": 0.2730218172073364, "rewards/total_composite/std": 0.10799101740121841, "reward": 0.2730218172073364, "reward_std": 0.10799100995063782, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10582651197910309, "sampling/sampling_logp_difference/max": 2.2159557342529297, "sampling/importance_sampling_ratio/min": 0.1090492457151413, "sampling/importance_sampling_ratio/mean": 1.0091804265975952, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4706226587295532, "clip_ratio/low_mean": 0.05683693056926131, "clip_ratio/low_min": 0.05683693056926131, "clip_ratio/high_mean": 0.04243682138621807, "clip_ratio/high_max": 0.04243682138621807, "clip_ratio/region_mean": 0.09927375195547938, "reward_total_mean": 0.2730218172073364, "reward_meter_mean": 0.8272303342819214, "reward_meter_std": 0.18839241564273834, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5826253294944763, "reward_repeat_penalty_std": 0.16902408003807068, "reward_near_duplicate_penalty_mean": 0.8882546424865723, "reward_near_duplicate_penalty_std": 0.03844599425792694, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.708530843257904, "reward_distinct_2_std": 0.15559612214565277, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.2730218172073364, "reward_total_composite_std": 0.10799101740121841} {"timestamp_utc": "2026-04-12T14:16:16Z", "mode": "train", "global_step": 871, "epoch": 0.03498413463469494, "loss": -0.0619, "grad_norm": 6.001213550567627, "learning_rate": 7.363636363636364e-06, "num_tokens": 1772137.0, "completions/mean_length": 175.25, "completions/min_length": 112.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 127.14286041259766, "completions/min_terminated_length": 112.0, "completions/max_terminated_length": 157.0, "rewards/meter/mean": 0.39989596605300903, "rewards/meter/std": 0.3121834397315979, "rewards/count_adherence/mean": 0.8958333134651184, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9654213190078735, "rewards/lexical_plausibility/std": 0.09780332446098328, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7331823110580444, "rewards/repeat_penalty/std": 0.22717273235321045, "rewards/near_duplicate_penalty/mean": 0.9222255945205688, "rewards/near_duplicate_penalty/std": 0.05219656229019165, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7962535619735718, "rewards/distinct_2/std": 0.2072196751832962, "rewards/total_composite/mean": 0.08924335241317749, "rewards/total_composite/std": 0.10416724532842636, "reward": 0.08924335241317749, "reward_std": 0.10416723787784576, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1451282948255539, "sampling/sampling_logp_difference/max": 2.7776942253112793, "sampling/importance_sampling_ratio/min": 0.06218171864748001, "sampling/importance_sampling_ratio/mean": 0.9980655312538147, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.578022550791502, "clip_ratio/low_mean": 0.08239227440208197, "clip_ratio/low_min": 0.08239227440208197, "clip_ratio/high_mean": 0.0257191713899374, "clip_ratio/high_max": 0.0257191713899374, "clip_ratio/region_mean": 0.10811144579201937, "reward_total_mean": 0.08924335241317749, "reward_meter_mean": 0.39989596605300903, "reward_meter_std": 0.3121834397315979, "reward_count_adherence_mean": 0.8958333134651184, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9654213190078735, "reward_lexical_plausibility_std": 0.09780332446098328, "reward_repeat_penalty_mean": 0.7331823110580444, "reward_repeat_penalty_std": 0.22717273235321045, "reward_near_duplicate_penalty_mean": 0.9222255945205688, "reward_near_duplicate_penalty_std": 0.05219656229019165, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7962535619735718, "reward_distinct_2_std": 0.2072196751832962, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.08924335241317749, "reward_total_composite_std": 0.10416724532842636} {"timestamp_utc": "2026-04-12T14:16:26Z", "mode": "train", "global_step": 872, "epoch": 0.035024300116479896, "loss": -0.0197, "grad_norm": 7.632763862609863, "learning_rate": 7.360606060606061e-06, "num_tokens": 1774674.0, "completions/mean_length": 127.125, "completions/min_length": 105.0, "completions/max_length": 141.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.125, "completions/min_terminated_length": 105.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.5476891994476318, "rewards/meter/std": 0.34833618998527527, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8275880813598633, "rewards/repeat_penalty/std": 0.10005103796720505, "rewards/near_duplicate_penalty/mean": 0.9418987035751343, "rewards/near_duplicate_penalty/std": 0.013158251531422138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8921672105789185, "rewards/distinct_2/std": 0.07349219173192978, "rewards/total_composite/mean": 0.20300811529159546, "rewards/total_composite/std": 0.13897737860679626, "reward": 0.20300811529159546, "reward_std": 0.13897736370563507, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11417630314826965, "sampling/sampling_logp_difference/max": 2.6972084045410156, "sampling/importance_sampling_ratio/min": 0.06739338487386703, "sampling/importance_sampling_ratio/mean": 0.9951967000961304, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5607620626688004, "clip_ratio/low_mean": 0.05955591704696417, "clip_ratio/low_min": 0.05955591704696417, "clip_ratio/high_mean": 0.05671980790793896, "clip_ratio/high_max": 0.05671980790793896, "clip_ratio/region_mean": 0.11627572495490313, "reward_total_mean": 0.20300811529159546, "reward_meter_mean": 0.5476891994476318, "reward_meter_std": 0.34833618998527527, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8275880813598633, "reward_repeat_penalty_std": 0.10005103796720505, "reward_near_duplicate_penalty_mean": 0.9418987035751343, "reward_near_duplicate_penalty_std": 0.013158251531422138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8921672105789185, "reward_distinct_2_std": 0.07349219173192978, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.20300811529159546, "reward_total_composite_std": 0.13897737860679626} {"timestamp_utc": "2026-04-12T14:16:40Z", "mode": "train", "global_step": 873, "epoch": 0.03506446559826485, "loss": -0.0555, "grad_norm": 4.501315593719482, "learning_rate": 7.357575757575758e-06, "num_tokens": 1776302.0, "completions/mean_length": 112.5, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 55.42857360839844, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.8306863307952881, "rewards/meter/std": 0.33223599195480347, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9848498106002808, "rewards/lexical_plausibility/std": 0.04285118728876114, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.2840491831302643, "rewards/repeat_penalty/mean": 0.8906967639923096, "rewards/repeat_penalty/std": 0.12793321907520294, "rewards/near_duplicate_penalty/mean": 0.9242289066314697, "rewards/near_duplicate_penalty/std": 0.08066439628601074, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9602006673812866, "rewards/distinct_2/std": 0.07493601739406586, "rewards/total_composite/mean": 0.3201238512992859, "rewards/total_composite/std": 0.2824220061302185, "reward": 0.3201238512992859, "reward_std": 0.2824220061302185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13651838898658752, "sampling/sampling_logp_difference/max": 2.6320786476135254, "sampling/importance_sampling_ratio/min": 0.07192879170179367, "sampling/importance_sampling_ratio/mean": 1.008743405342102, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6360415667295456, "clip_ratio/low_mean": 0.035882867872714996, "clip_ratio/low_min": 0.035882867872714996, "clip_ratio/high_mean": 0.06075863540172577, "clip_ratio/high_max": 0.06075863540172577, "clip_ratio/region_mean": 0.09664150327444077, "reward_total_mean": 0.3201238512992859, "reward_meter_mean": 0.8306863307952881, "reward_meter_std": 0.33223599195480347, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9848498106002808, "reward_lexical_plausibility_std": 0.04285118728876114, "reward_repeat_penalty_mean": 0.8906967639923096, "reward_repeat_penalty_std": 0.12793321907520294, "reward_near_duplicate_penalty_mean": 0.9242289066314697, "reward_near_duplicate_penalty_std": 0.08066439628601074, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9602006673812866, "reward_distinct_2_std": 0.07493601739406586, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.2840491831302643, "reward_total_composite_mean": 0.3201238512992859, "reward_total_composite_std": 0.2824220061302185} {"timestamp_utc": "2026-04-12T14:16:49Z", "mode": "train", "global_step": 874, "epoch": 0.035104631080049804, "loss": 0.1414, "grad_norm": 7.832292079925537, "learning_rate": 7.354545454545456e-06, "num_tokens": 1778317.0, "completions/mean_length": 79.875, "completions/min_length": 56.0, "completions/max_length": 105.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.875, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.29746511578559875, "rewards/meter/std": 0.2942606508731842, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.5523877143859863, "rewards/repeat_penalty/std": 0.2730301022529602, "rewards/near_duplicate_penalty/mean": 0.8659970164299011, "rewards/near_duplicate_penalty/std": 0.1328260600566864, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.1602174937725067, "rewards/distinct_2/mean": 0.7535686492919922, "rewards/distinct_2/std": 0.20347315073013306, "rewards/total_composite/mean": 0.09182830154895782, "rewards/total_composite/std": 0.06809425354003906, "reward": 0.09182830154895782, "reward_std": 0.06809425354003906, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10342110693454742, "sampling/sampling_logp_difference/max": 3.3455324172973633, "sampling/importance_sampling_ratio/min": 0.035241447389125824, "sampling/importance_sampling_ratio/mean": 1.009207844734192, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5651168003678322, "clip_ratio/low_mean": 0.05296321352943778, "clip_ratio/low_min": 0.05296321352943778, "clip_ratio/high_mean": 0.03530844207853079, "clip_ratio/high_max": 0.03530844207853079, "clip_ratio/region_mean": 0.08827165560796857, "reward_total_mean": 0.09182830154895782, "reward_meter_mean": 0.29746511578559875, "reward_meter_std": 0.2942606508731842, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5523877143859863, "reward_repeat_penalty_std": 0.2730301022529602, "reward_near_duplicate_penalty_mean": 0.8659970164299011, "reward_near_duplicate_penalty_std": 0.1328260600566864, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.1602174937725067, "reward_distinct_2_mean": 0.7535686492919922, "reward_distinct_2_std": 0.20347315073013306, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.09182830154895782, "reward_total_composite_std": 0.06809425354003906} {"timestamp_utc": "2026-04-12T14:16:58Z", "mode": "train", "global_step": 875, "epoch": 0.03514479656183476, "loss": 0.0711, "grad_norm": 10.09304428100586, "learning_rate": 7.351515151515151e-06, "num_tokens": 1780299.0, "completions/mean_length": 71.75, "completions/min_length": 63.0, "completions/max_length": 83.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.75, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.9014970660209656, "rewards/meter/std": 0.13068506121635437, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.13562028110027313, "rewards/repeat_penalty/mean": 0.8311077356338501, "rewards/repeat_penalty/std": 0.11203678697347641, "rewards/near_duplicate_penalty/mean": 0.9320562481880188, "rewards/near_duplicate_penalty/std": 0.028182754293084145, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8894095420837402, "rewards/distinct_2/std": 0.09910806268453598, "rewards/total_composite/mean": 0.38931509852409363, "rewards/total_composite/std": 0.11298346519470215, "reward": 0.38931509852409363, "reward_std": 0.11298347264528275, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1445842832326889, "sampling/sampling_logp_difference/max": 1.7441703081130981, "sampling/importance_sampling_ratio/min": 0.17478995025157928, "sampling/importance_sampling_ratio/mean": 1.0147509574890137, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.779978558421135, "clip_ratio/low_mean": 0.08296741731464863, "clip_ratio/low_min": 0.08296741731464863, "clip_ratio/high_mean": 0.060111574828624725, "clip_ratio/high_max": 0.060111574828624725, "clip_ratio/region_mean": 0.14307899214327335, "reward_total_mean": 0.38931509852409363, "reward_meter_mean": 0.9014970660209656, "reward_meter_std": 0.13068506121635437, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8311077356338501, "reward_repeat_penalty_std": 0.11203678697347641, "reward_near_duplicate_penalty_mean": 0.9320562481880188, "reward_near_duplicate_penalty_std": 0.028182754293084145, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8894095420837402, "reward_distinct_2_std": 0.09910806268453598, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.13562028110027313, "reward_total_composite_mean": 0.38931509852409363, "reward_total_composite_std": 0.11298346519470215} {"timestamp_utc": "2026-04-12T14:17:10Z", "mode": "train", "global_step": 876, "epoch": 0.03518496204361971, "loss": 0.0299, "grad_norm": 4.762448310852051, "learning_rate": 7.348484848484849e-06, "num_tokens": 1783902.0, "completions/mean_length": 236.375, "completions/min_length": 208.0, "completions/max_length": 280.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 236.375, "completions/min_terminated_length": 208.0, "completions/max_terminated_length": 280.0, "rewards/meter/mean": 0.5270986557006836, "rewards/meter/std": 0.2685558795928955, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.28528380393981934, "rewards/repeat_penalty/std": 0.19556787610054016, "rewards/near_duplicate_penalty/mean": 0.8050830364227295, "rewards/near_duplicate_penalty/std": 0.06882479786872864, "rewards/opening_diversity/mean": 0.9963235259056091, "rewards/opening_diversity/std": 0.010398639366030693, "rewards/distinct_2/mean": 0.38537976145744324, "rewards/distinct_2/std": 0.2111949622631073, "rewards/total_composite/mean": 0.13332274556159973, "rewards/total_composite/std": 0.07764926552772522, "reward": 0.13332274556159973, "reward_std": 0.07764925807714462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09145982563495636, "sampling/sampling_logp_difference/max": 2.0879368782043457, "sampling/importance_sampling_ratio/min": 0.12394257634878159, "sampling/importance_sampling_ratio/mean": 1.0108877420425415, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4582247845828533, "clip_ratio/low_mean": 0.0729204248636961, "clip_ratio/low_min": 0.0729204248636961, "clip_ratio/high_mean": 0.0327193234115839, "clip_ratio/high_max": 0.0327193234115839, "clip_ratio/region_mean": 0.10563974827528, "reward_total_mean": 0.13332274556159973, "reward_meter_mean": 0.5270986557006836, "reward_meter_std": 0.2685558795928955, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.28528380393981934, "reward_repeat_penalty_std": 0.19556787610054016, "reward_near_duplicate_penalty_mean": 0.8050830364227295, "reward_near_duplicate_penalty_std": 0.06882479786872864, "reward_opening_diversity_mean": 0.9963235259056091, "reward_opening_diversity_std": 0.010398639366030693, "reward_distinct_2_mean": 0.38537976145744324, "reward_distinct_2_std": 0.2111949622631073, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.13332274556159973, "reward_total_composite_std": 0.07764926552772522} {"timestamp_utc": "2026-04-12T14:17:18Z", "mode": "train", "global_step": 877, "epoch": 0.035225127525404666, "loss": 0.0469, "grad_norm": 19.530975341796875, "learning_rate": 7.345454545454546e-06, "num_tokens": 1785613.0, "completions/mean_length": 56.875, "completions/min_length": 55.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.875, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.8635131120681763, "rewards/meter/std": 0.2633155584335327, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48875001072883606, "rewards/judge_quality/std": 0.3626662492752075, "rewards/repeat_penalty/mean": 0.8042378425598145, "rewards/repeat_penalty/std": 0.09148935973644257, "rewards/near_duplicate_penalty/mean": 0.9202189445495605, "rewards/near_duplicate_penalty/std": 0.05062742531299591, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8718816041946411, "rewards/distinct_2/std": 0.06363079696893692, "rewards/total_composite/mean": 0.4415525197982788, "rewards/total_composite/std": 0.34574729204177856, "reward": 0.4415525197982788, "reward_std": 0.34574729204177856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09606894105672836, "sampling/sampling_logp_difference/max": 1.6975698471069336, "sampling/importance_sampling_ratio/min": 0.1831280142068863, "sampling/importance_sampling_ratio/mean": 0.9880635142326355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4432758465409279, "clip_ratio/low_mean": 0.06798952259123325, "clip_ratio/low_min": 0.06798952259123325, "clip_ratio/high_mean": 0.033223243430256844, "clip_ratio/high_max": 0.033223243430256844, "clip_ratio/region_mean": 0.1012127660214901, "reward_total_mean": 0.4415525197982788, "reward_meter_mean": 0.8635131120681763, "reward_meter_std": 0.2633155584335327, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8042378425598145, "reward_repeat_penalty_std": 0.09148935973644257, "reward_near_duplicate_penalty_mean": 0.9202189445495605, "reward_near_duplicate_penalty_std": 0.05062742531299591, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8718816041946411, "reward_distinct_2_std": 0.06363079696893692, "reward_judge_quality_mean": 0.48875001072883606, "reward_judge_quality_std": 0.3626662492752075, "reward_total_composite_mean": 0.4415525197982788, "reward_total_composite_std": 0.34574729204177856} {"timestamp_utc": "2026-04-12T14:17:32Z", "mode": "train", "global_step": 878, "epoch": 0.03526529300718962, "loss": -0.0678, "grad_norm": 2.321756601333618, "learning_rate": 7.342424242424243e-06, "num_tokens": 1787140.0, "completions/mean_length": 223.875, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 51.0, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.659151554107666, "rewards/meter/std": 0.4500230550765991, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8951897025108337, "rewards/lexical_plausibility/std": 0.1461409479379654, "rewards/judge_quality/mean": 0.29625001549720764, "rewards/judge_quality/std": 0.2980382442474365, "rewards/repeat_penalty/mean": 0.7111141681671143, "rewards/repeat_penalty/std": 0.29982367157936096, "rewards/near_duplicate_penalty/mean": 0.8549773693084717, "rewards/near_duplicate_penalty/std": 0.16954217851161957, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8347539305686951, "rewards/distinct_2/std": 0.23982471227645874, "rewards/total_composite/mean": 0.27332350611686707, "rewards/total_composite/std": 0.31190598011016846, "reward": 0.27332350611686707, "reward_std": 0.31190595030784607, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11236979067325592, "sampling/sampling_logp_difference/max": 1.2867416143417358, "sampling/importance_sampling_ratio/min": 0.27616918087005615, "sampling/importance_sampling_ratio/mean": 0.9936332702636719, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.37248532474040985, "clip_ratio/low_mean": 0.010775862261652946, "clip_ratio/low_min": 0.010775862261652946, "clip_ratio/high_mean": 0.07108418364077806, "clip_ratio/high_max": 0.07108418364077806, "clip_ratio/region_mean": 0.08186004590243101, "reward_total_mean": 0.27332350611686707, "reward_meter_mean": 0.659151554107666, "reward_meter_std": 0.4500230550765991, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8951897025108337, "reward_lexical_plausibility_std": 0.1461409479379654, "reward_repeat_penalty_mean": 0.7111141681671143, "reward_repeat_penalty_std": 0.29982367157936096, "reward_near_duplicate_penalty_mean": 0.8549773693084717, "reward_near_duplicate_penalty_std": 0.16954217851161957, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8347539305686951, "reward_distinct_2_std": 0.23982471227645874, "reward_judge_quality_mean": 0.29625001549720764, "reward_judge_quality_std": 0.2980382442474365, "reward_total_composite_mean": 0.27332350611686707, "reward_total_composite_std": 0.31190598011016846} {"timestamp_utc": "2026-04-12T14:17:46Z", "mode": "train", "global_step": 879, "epoch": 0.035305458488974574, "loss": -0.0941, "grad_norm": 5.5998148918151855, "learning_rate": 7.3393939393939395e-06, "num_tokens": 1788731.0, "completions/mean_length": 106.875, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.000003814697266, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7215713858604431, "rewards/meter/std": 0.4185429513454437, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9464878439903259, "rewards/lexical_plausibility/std": 0.10046496242284775, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.8929903507232666, "rewards/repeat_penalty/std": 0.08757708221673965, "rewards/near_duplicate_penalty/mean": 0.912240743637085, "rewards/near_duplicate_penalty/std": 0.06082136183977127, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9773755669593811, "rewards/distinct_2/std": 0.041892312467098236, "rewards/total_composite/mean": 0.30992770195007324, "rewards/total_composite/std": 0.18913213908672333, "reward": 0.30992770195007324, "reward_std": 0.18913212418556213, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16873911023139954, "sampling/sampling_logp_difference/max": 3.967195749282837, "sampling/importance_sampling_ratio/min": 0.018926434218883514, "sampling/importance_sampling_ratio/mean": 0.9758078455924988, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5684429481625557, "clip_ratio/low_mean": 0.005319148767739534, "clip_ratio/low_min": 0.005319148767739534, "clip_ratio/high_mean": 0.1118007549084723, "clip_ratio/high_max": 0.1118007549084723, "clip_ratio/region_mean": 0.11711990367621183, "reward_total_mean": 0.30992770195007324, "reward_meter_mean": 0.7215713858604431, "reward_meter_std": 0.4185429513454437, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9464878439903259, "reward_lexical_plausibility_std": 0.10046496242284775, "reward_repeat_penalty_mean": 0.8929903507232666, "reward_repeat_penalty_std": 0.08757708221673965, "reward_near_duplicate_penalty_mean": 0.912240743637085, "reward_near_duplicate_penalty_std": 0.06082136183977127, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9773755669593811, "reward_distinct_2_std": 0.041892312467098236, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.30992770195007324, "reward_total_composite_std": 0.18913213908672333} {"timestamp_utc": "2026-04-12T14:17:54Z", "mode": "train", "global_step": 880, "epoch": 0.03534562397075953, "loss": 0.0097, "grad_norm": 10.49024772644043, "learning_rate": 7.336363636363637e-06, "num_tokens": 1790709.0, "completions/mean_length": 74.25, "completions/min_length": 65.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.25, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.5394495725631714, "rewards/meter/std": 0.3519377112388611, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9955357313156128, "rewards/lexical_plausibility/std": 0.008266246877610683, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.7814996242523193, "rewards/repeat_penalty/std": 0.11847735941410065, "rewards/near_duplicate_penalty/mean": 0.9319391250610352, "rewards/near_duplicate_penalty/std": 0.05879274010658264, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8353081345558167, "rewards/distinct_2/std": 0.09324527531862259, "rewards/total_composite/mean": 0.12256370484828949, "rewards/total_composite/std": 0.11397451162338257, "reward": 0.12256370484828949, "reward_std": 0.11397451162338257, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.132102370262146, "sampling/sampling_logp_difference/max": 2.2229855060577393, "sampling/importance_sampling_ratio/min": 0.1082853376865387, "sampling/importance_sampling_ratio/mean": 1.0134063959121704, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7012450322508812, "clip_ratio/low_mean": 0.09132364299148321, "clip_ratio/low_min": 0.09132364299148321, "clip_ratio/high_mean": 0.03963879402726889, "clip_ratio/high_max": 0.03963879402726889, "clip_ratio/region_mean": 0.1309624370187521, "reward_total_mean": 0.12256370484828949, "reward_meter_mean": 0.5394495725631714, "reward_meter_std": 0.3519377112388611, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9955357313156128, "reward_lexical_plausibility_std": 0.008266246877610683, "reward_repeat_penalty_mean": 0.7814996242523193, "reward_repeat_penalty_std": 0.11847735941410065, "reward_near_duplicate_penalty_mean": 0.9319391250610352, "reward_near_duplicate_penalty_std": 0.05879274010658264, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8353081345558167, "reward_distinct_2_std": 0.09324527531862259, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.12256370484828949, "reward_total_composite_std": 0.11397451162338257} {"timestamp_utc": "2026-04-12T14:18:08Z", "mode": "train", "global_step": 881, "epoch": 0.03538578945254448, "loss": -0.0076, "grad_norm": 2.9933884143829346, "learning_rate": 7.333333333333333e-06, "num_tokens": 1795458.0, "completions/mean_length": 440.625, "completions/min_length": 372.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 430.4285888671875, "completions/min_terminated_length": 372.0, "completions/max_terminated_length": 486.0, "rewards/meter/mean": 0.23844513297080994, "rewards/meter/std": 0.2061980962753296, "rewards/count_adherence/mean": 0.7727273106575012, "rewards/count_adherence/std": 0.06872081011533737, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.037745535373687744, "rewards/repeat_penalty/std": 0.05902951583266258, "rewards/near_duplicate_penalty/mean": 0.7385398149490356, "rewards/near_duplicate_penalty/std": 0.11261305212974548, "rewards/opening_diversity/mean": 0.9590517282485962, "rewards/opening_diversity/std": 0.11581922322511673, "rewards/distinct_2/mean": 0.0638369545340538, "rewards/distinct_2/std": 0.10444370657205582, "rewards/total_composite/mean": 0.02498304285109043, "rewards/total_composite/std": 0.02411171793937683, "reward": 0.02498304285109043, "reward_std": 0.024111716076731682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05810955911874771, "sampling/sampling_logp_difference/max": 2.770911693572998, "sampling/importance_sampling_ratio/min": 0.06260490417480469, "sampling/importance_sampling_ratio/mean": 0.9986941814422607, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2401742935180664, "clip_ratio/low_mean": 0.02730027073994279, "clip_ratio/low_min": 0.02730027073994279, "clip_ratio/high_mean": 0.018933712039142847, "clip_ratio/high_max": 0.018933712039142847, "clip_ratio/region_mean": 0.046233982779085636, "reward_total_mean": 0.02498304285109043, "reward_meter_mean": 0.23844513297080994, "reward_meter_std": 0.2061980962753296, "reward_count_adherence_mean": 0.7727273106575012, "reward_count_adherence_std": 0.06872081011533737, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.037745535373687744, "reward_repeat_penalty_std": 0.05902951583266258, "reward_near_duplicate_penalty_mean": 0.7385398149490356, "reward_near_duplicate_penalty_std": 0.11261305212974548, "reward_opening_diversity_mean": 0.9590517282485962, "reward_opening_diversity_std": 0.11581922322511673, "reward_distinct_2_mean": 0.0638369545340538, "reward_distinct_2_std": 0.10444370657205582, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.02498304285109043, "reward_total_composite_std": 0.02411171793937683} {"timestamp_utc": "2026-04-12T14:18:22Z", "mode": "train", "global_step": 882, "epoch": 0.035425954934329436, "loss": -0.1186, "grad_norm": 4.406069755554199, "learning_rate": 7.330303030303031e-06, "num_tokens": 1797942.0, "completions/mean_length": 173.5, "completions/min_length": 118.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 125.14286041259766, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 134.0, "rewards/meter/mean": 0.6663212180137634, "rewards/meter/std": 0.3866715729236603, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9844070672988892, "rewards/lexical_plausibility/std": 0.044103577733039856, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.6938369870185852, "rewards/repeat_penalty/std": 0.1847635954618454, "rewards/near_duplicate_penalty/mean": 0.8913737535476685, "rewards/near_duplicate_penalty/std": 0.06611061096191406, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7686411738395691, "rewards/distinct_2/std": 0.16424210369586945, "rewards/total_composite/mean": 0.27357497811317444, "rewards/total_composite/std": 0.18653017282485962, "reward": 0.27357497811317444, "reward_std": 0.18653017282485962, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10844583809375763, "sampling/sampling_logp_difference/max": 2.675227642059326, "sampling/importance_sampling_ratio/min": 0.06889114528894424, "sampling/importance_sampling_ratio/mean": 1.0037729740142822, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.373327162116766, "clip_ratio/low_mean": 0.019054178148508072, "clip_ratio/low_min": 0.019054178148508072, "clip_ratio/high_mean": 0.06575033254921436, "clip_ratio/high_max": 0.06575033254921436, "clip_ratio/region_mean": 0.08480451069772243, "reward_total_mean": 0.27357497811317444, "reward_meter_mean": 0.6663212180137634, "reward_meter_std": 0.3866715729236603, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9844070672988892, "reward_lexical_plausibility_std": 0.044103577733039856, "reward_repeat_penalty_mean": 0.6938369870185852, "reward_repeat_penalty_std": 0.1847635954618454, "reward_near_duplicate_penalty_mean": 0.8913737535476685, "reward_near_duplicate_penalty_std": 0.06611061096191406, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7686411738395691, "reward_distinct_2_std": 0.16424210369586945, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.27357497811317444, "reward_total_composite_std": 0.18653017282485962} {"timestamp_utc": "2026-04-12T14:18:36Z", "mode": "train", "global_step": 883, "epoch": 0.03546612041611439, "loss": -0.0793, "grad_norm": 1.5109801292419434, "learning_rate": 7.3272727272727285e-06, "num_tokens": 1799484.0, "completions/mean_length": 220.75, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 46.0, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7229549288749695, "rewards/meter/std": 0.3531128466129303, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9609307050704956, "rewards/lexical_plausibility/std": 0.05956076458096504, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.29587340354919434, "rewards/repeat_penalty/mean": 0.8986272811889648, "rewards/repeat_penalty/std": 0.11397247761487961, "rewards/near_duplicate_penalty/mean": 0.940723180770874, "rewards/near_duplicate_penalty/std": 0.043794725090265274, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.953309178352356, "rewards/distinct_2/std": 0.09601422399282455, "rewards/total_composite/mean": 0.29068809747695923, "rewards/total_composite/std": 0.2798406481742859, "reward": 0.29068809747695923, "reward_std": 0.2798406481742859, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11197210103273392, "sampling/sampling_logp_difference/max": 1.4107227325439453, "sampling/importance_sampling_ratio/min": 0.24396690726280212, "sampling/importance_sampling_ratio/mean": 0.9942339062690735, "sampling/importance_sampling_ratio/max": 1.7780050039291382, "entropy": 0.4382961876690388, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.06563917454332113, "clip_ratio/high_max": 0.06563917454332113, "clip_ratio/region_mean": 0.06563917454332113, "reward_total_mean": 0.29068809747695923, "reward_meter_mean": 0.7229549288749695, "reward_meter_std": 0.3531128466129303, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9609307050704956, "reward_lexical_plausibility_std": 0.05956076458096504, "reward_repeat_penalty_mean": 0.8986272811889648, "reward_repeat_penalty_std": 0.11397247761487961, "reward_near_duplicate_penalty_mean": 0.940723180770874, "reward_near_duplicate_penalty_std": 0.043794725090265274, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.953309178352356, "reward_distinct_2_std": 0.09601422399282455, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.29587340354919434, "reward_total_composite_mean": 0.29068809747695923, "reward_total_composite_std": 0.2798406481742859} {"timestamp_utc": "2026-04-12T14:18:46Z", "mode": "train", "global_step": 884, "epoch": 0.035506285897899344, "loss": 0.0247, "grad_norm": 8.392919540405273, "learning_rate": 7.324242424242425e-06, "num_tokens": 1802612.0, "completions/mean_length": 182.0, "completions/min_length": 159.0, "completions/max_length": 213.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 182.0, "completions/min_terminated_length": 159.0, "completions/max_terminated_length": 213.0, "rewards/meter/mean": 0.6464889645576477, "rewards/meter/std": 0.21471653878688812, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.09161253273487091, "rewards/repeat_penalty/mean": 0.6105477809906006, "rewards/repeat_penalty/std": 0.22797583043575287, "rewards/near_duplicate_penalty/mean": 0.8850646018981934, "rewards/near_duplicate_penalty/std": 0.11498953402042389, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6659486293792725, "rewards/distinct_2/std": 0.2227121740579605, "rewards/total_composite/mean": 0.1691592037677765, "rewards/total_composite/std": 0.10603190213441849, "reward": 0.1691592037677765, "reward_std": 0.10603189468383789, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10739102214574814, "sampling/sampling_logp_difference/max": 2.722109079360962, "sampling/importance_sampling_ratio/min": 0.06573596596717834, "sampling/importance_sampling_ratio/mean": 0.9946879744529724, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5474977977573872, "clip_ratio/low_mean": 0.047079429030418396, "clip_ratio/low_min": 0.047079429030418396, "clip_ratio/high_mean": 0.0636939350515604, "clip_ratio/high_max": 0.0636939350515604, "clip_ratio/region_mean": 0.1107733640819788, "reward_total_mean": 0.1691592037677765, "reward_meter_mean": 0.6464889645576477, "reward_meter_std": 0.21471653878688812, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6105477809906006, "reward_repeat_penalty_std": 0.22797583043575287, "reward_near_duplicate_penalty_mean": 0.8850646018981934, "reward_near_duplicate_penalty_std": 0.11498953402042389, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6659486293792725, "reward_distinct_2_std": 0.2227121740579605, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.09161253273487091, "reward_total_composite_mean": 0.1691592037677765, "reward_total_composite_std": 0.10603190213441849} {"timestamp_utc": "2026-04-12T14:18:54Z", "mode": "train", "global_step": 885, "epoch": 0.0355464513796843, "loss": -0.0351, "grad_norm": 10.396985054016113, "learning_rate": 7.321212121212122e-06, "num_tokens": 1804290.0, "completions/mean_length": 47.75, "completions/min_length": 26.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.75, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7428503036499023, "rewards/meter/std": 0.31914523243904114, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5587500333786011, "rewards/judge_quality/std": 0.195041224360466, "rewards/repeat_penalty/mean": 0.7894636988639832, "rewards/repeat_penalty/std": 0.0972859337925911, "rewards/near_duplicate_penalty/mean": 0.9249110221862793, "rewards/near_duplicate_penalty/std": 0.05529322847723961, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.881542980670929, "rewards/distinct_2/std": 0.05211632698774338, "rewards/total_composite/mean": 0.4224734902381897, "rewards/total_composite/std": 0.2751162350177765, "reward": 0.4224734902381897, "reward_std": 0.2751162350177765, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09754500538110733, "sampling/sampling_logp_difference/max": 1.0492095947265625, "sampling/importance_sampling_ratio/min": 0.35115674138069153, "sampling/importance_sampling_ratio/mean": 1.0087987184524536, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4358046241104603, "clip_ratio/low_mean": 0.061739190481603146, "clip_ratio/low_min": 0.061739190481603146, "clip_ratio/high_mean": 0.03851819969713688, "clip_ratio/high_max": 0.03851819969713688, "clip_ratio/region_mean": 0.10025739017874002, "reward_total_mean": 0.4224734902381897, "reward_meter_mean": 0.7428503036499023, "reward_meter_std": 0.31914523243904114, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7894636988639832, "reward_repeat_penalty_std": 0.0972859337925911, "reward_near_duplicate_penalty_mean": 0.9249110221862793, "reward_near_duplicate_penalty_std": 0.05529322847723961, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.881542980670929, "reward_distinct_2_std": 0.05211632698774338, "reward_judge_quality_mean": 0.5587500333786011, "reward_judge_quality_std": 0.195041224360466, "reward_total_composite_mean": 0.4224734902381897, "reward_total_composite_std": 0.2751162350177765} {"timestamp_utc": "2026-04-12T14:19:07Z", "mode": "train", "global_step": 886, "epoch": 0.03558661686146925, "loss": 0.05, "grad_norm": 5.040018558502197, "learning_rate": 7.3181818181818186e-06, "num_tokens": 1808849.0, "completions/mean_length": 330.875, "completions/min_length": 310.0, "completions/max_length": 382.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 330.875, "completions/min_terminated_length": 310.0, "completions/max_terminated_length": 382.0, "rewards/meter/mean": 0.09013642370700836, "rewards/meter/std": 0.08543291687965393, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106664776802, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.2519568204879761, "rewards/repeat_penalty/std": 0.1718509942293167, "rewards/near_duplicate_penalty/mean": 0.740941047668457, "rewards/near_duplicate_penalty/std": 0.09234555810689926, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.3602747619152069, "rewards/distinct_2/std": 0.210606649518013, "rewards/total_composite/mean": 0.01846323534846306, "rewards/total_composite/std": 0.01902730017900467, "reward": 0.01846323534846306, "reward_std": 0.01902730017900467, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0903920903801918, "sampling/sampling_logp_difference/max": 2.914473533630371, "sampling/importance_sampling_ratio/min": 0.05423257499933243, "sampling/importance_sampling_ratio/mean": 1.0015575885772705, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.39976517111063004, "clip_ratio/low_mean": 0.04512396873906255, "clip_ratio/low_min": 0.04512396873906255, "clip_ratio/high_mean": 0.035638079047203064, "clip_ratio/high_max": 0.035638079047203064, "clip_ratio/region_mean": 0.08076204778626561, "reward_total_mean": 0.01846323534846306, "reward_meter_mean": 0.09013642370700836, "reward_meter_std": 0.08543291687965393, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106664776802, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2519568204879761, "reward_repeat_penalty_std": 0.1718509942293167, "reward_near_duplicate_penalty_mean": 0.740941047668457, "reward_near_duplicate_penalty_std": 0.09234555810689926, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.3602747619152069, "reward_distinct_2_std": 0.210606649518013, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.01846323534846306, "reward_total_composite_std": 0.01902730017900467} {"timestamp_utc": "2026-04-12T14:19:20Z", "mode": "train", "global_step": 887, "epoch": 0.035626782343254206, "loss": -0.0799, "grad_norm": 4.748170375823975, "learning_rate": 7.315151515151516e-06, "num_tokens": 1810698.0, "completions/mean_length": 130.125, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 75.5714340209961, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.5883125066757202, "rewards/meter/std": 0.42992734909057617, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9682332873344421, "rewards/lexical_plausibility/std": 0.08984983712434769, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.32262319326400757, "rewards/repeat_penalty/mean": 0.6742799282073975, "rewards/repeat_penalty/std": 0.16807249188423157, "rewards/near_duplicate_penalty/mean": 0.9275095462799072, "rewards/near_duplicate_penalty/std": 0.03420286625623703, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8833611011505127, "rewards/distinct_2/std": 0.083704374730587, "rewards/total_composite/mean": 0.24122354388237, "rewards/total_composite/std": 0.1925996094942093, "reward": 0.24122354388237, "reward_std": 0.1925996094942093, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10349947214126587, "sampling/sampling_logp_difference/max": 2.3311681747436523, "sampling/importance_sampling_ratio/min": 0.09718216210603714, "sampling/importance_sampling_ratio/mean": 1.0020560026168823, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.41072361543774605, "clip_ratio/low_mean": 0.03469423530623317, "clip_ratio/low_min": 0.03469423530623317, "clip_ratio/high_mean": 0.04431463126093149, "clip_ratio/high_max": 0.04431463126093149, "clip_ratio/region_mean": 0.07900886656716466, "reward_total_mean": 0.24122354388237, "reward_meter_mean": 0.5883125066757202, "reward_meter_std": 0.42992734909057617, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9682332873344421, "reward_lexical_plausibility_std": 0.08984983712434769, "reward_repeat_penalty_mean": 0.6742799282073975, "reward_repeat_penalty_std": 0.16807249188423157, "reward_near_duplicate_penalty_mean": 0.9275095462799072, "reward_near_duplicate_penalty_std": 0.03420286625623703, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8833611011505127, "reward_distinct_2_std": 0.083704374730587, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.32262319326400757, "reward_total_composite_mean": 0.24122354388237, "reward_total_composite_std": 0.1925996094942093} {"timestamp_utc": "2026-04-12T14:19:33Z", "mode": "train", "global_step": 888, "epoch": 0.03566694782503916, "loss": -0.029, "grad_norm": 6.361115455627441, "learning_rate": 7.312121212121212e-06, "num_tokens": 1812533.0, "completions/mean_length": 115.375, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 58.71428680419922, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.24721597135066986, "rewards/meter/std": 0.30799585580825806, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9663930535316467, "rewards/lexical_plausibility/std": 0.09505482017993927, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8729970455169678, "rewards/repeat_penalty/std": 0.0752529501914978, "rewards/near_duplicate_penalty/mean": 0.9179536700248718, "rewards/near_duplicate_penalty/std": 0.025116555392742157, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9506443738937378, "rewards/distinct_2/std": 0.0722939670085907, "rewards/total_composite/mean": 0.09125371277332306, "rewards/total_composite/std": 0.10675454139709473, "reward": 0.09125371277332306, "reward_std": 0.10675454139709473, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13567937910556793, "sampling/sampling_logp_difference/max": 2.0671396255493164, "sampling/importance_sampling_ratio/min": 0.12654723227024078, "sampling/importance_sampling_ratio/mean": 1.011005163192749, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5403723903000355, "clip_ratio/low_mean": 0.05108470655977726, "clip_ratio/low_min": 0.05108470655977726, "clip_ratio/high_mean": 0.04891751799732447, "clip_ratio/high_max": 0.04891751799732447, "clip_ratio/region_mean": 0.10000222455710173, "reward_total_mean": 0.09125371277332306, "reward_meter_mean": 0.24721597135066986, "reward_meter_std": 0.30799585580825806, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9663930535316467, "reward_lexical_plausibility_std": 0.09505482017993927, "reward_repeat_penalty_mean": 0.8729970455169678, "reward_repeat_penalty_std": 0.0752529501914978, "reward_near_duplicate_penalty_mean": 0.9179536700248718, "reward_near_duplicate_penalty_std": 0.025116555392742157, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9506443738937378, "reward_distinct_2_std": 0.0722939670085907, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.09125371277332306, "reward_total_composite_std": 0.10675454139709473} {"timestamp_utc": "2026-04-12T14:19:47Z", "mode": "train", "global_step": 889, "epoch": 0.03570711330682411, "loss": -0.0597, "grad_norm": 4.837181568145752, "learning_rate": 7.30909090909091e-06, "num_tokens": 1814164.0, "completions/mean_length": 109.875, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.42857360839844, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.5529102683067322, "rewards/meter/std": 0.4197533428668976, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9508507251739502, "rewards/lexical_plausibility/std": 0.13901503384113312, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.6603304147720337, "rewards/repeat_penalty/std": 0.311467707157135, "rewards/near_duplicate_penalty/mean": 0.8855952024459839, "rewards/near_duplicate_penalty/std": 0.08292616158723831, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.8661375641822815, "rewards/distinct_2/std": 0.16727451980113983, "rewards/total_composite/mean": 0.1800411343574524, "rewards/total_composite/std": 0.15511508285999298, "reward": 0.1800411343574524, "reward_std": 0.15511509776115417, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0980653464794159, "sampling/sampling_logp_difference/max": 1.3906984329223633, "sampling/importance_sampling_ratio/min": 0.24890141189098358, "sampling/importance_sampling_ratio/mean": 1.011983036994934, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4984290860593319, "clip_ratio/low_mean": 0.027500967727974057, "clip_ratio/low_min": 0.027500967727974057, "clip_ratio/high_mean": 0.041873543756082654, "clip_ratio/high_max": 0.041873543756082654, "clip_ratio/region_mean": 0.06937451148405671, "reward_total_mean": 0.1800411343574524, "reward_meter_mean": 0.5529102683067322, "reward_meter_std": 0.4197533428668976, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9508507251739502, "reward_lexical_plausibility_std": 0.13901503384113312, "reward_repeat_penalty_mean": 0.6603304147720337, "reward_repeat_penalty_std": 0.311467707157135, "reward_near_duplicate_penalty_mean": 0.8855952024459839, "reward_near_duplicate_penalty_std": 0.08292616158723831, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.8661375641822815, "reward_distinct_2_std": 0.16727451980113983, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.1800411343574524, "reward_total_composite_std": 0.15511508285999298} {"timestamp_utc": "2026-04-12T14:19:56Z", "mode": "train", "global_step": 890, "epoch": 0.03574727878860907, "loss": 0.0958, "grad_norm": 8.40279769897461, "learning_rate": 7.306060606060607e-06, "num_tokens": 1816104.0, "completions/mean_length": 89.5, "completions/min_length": 62.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 89.5, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.48707133531570435, "rewards/meter/std": 0.29376834630966187, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.31250518560409546, "rewards/repeat_penalty/std": 0.29178664088249207, "rewards/near_duplicate_penalty/mean": 0.7215415239334106, "rewards/near_duplicate_penalty/std": 0.2148185670375824, "rewards/opening_diversity/mean": 0.7942708730697632, "rewards/opening_diversity/std": 0.28225407004356384, "rewards/distinct_2/mean": 0.40195611119270325, "rewards/distinct_2/std": 0.3049626052379608, "rewards/total_composite/mean": 0.08777297288179398, "rewards/total_composite/std": 0.06469108909368515, "reward": 0.08777297288179398, "reward_std": 0.06469108909368515, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09963199496269226, "sampling/sampling_logp_difference/max": 2.1541762351989746, "sampling/importance_sampling_ratio/min": 0.11599870771169662, "sampling/importance_sampling_ratio/mean": 1.0099962949752808, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5191951468586922, "clip_ratio/low_mean": 0.04910414153710008, "clip_ratio/low_min": 0.04910414153710008, "clip_ratio/high_mean": 0.04114343272522092, "clip_ratio/high_max": 0.04114343272522092, "clip_ratio/region_mean": 0.090247574262321, "reward_total_mean": 0.08777297288179398, "reward_meter_mean": 0.48707133531570435, "reward_meter_std": 0.29376834630966187, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.31250518560409546, "reward_repeat_penalty_std": 0.29178664088249207, "reward_near_duplicate_penalty_mean": 0.7215415239334106, "reward_near_duplicate_penalty_std": 0.2148185670375824, "reward_opening_diversity_mean": 0.7942708730697632, "reward_opening_diversity_std": 0.28225407004356384, "reward_distinct_2_mean": 0.40195611119270325, "reward_distinct_2_std": 0.3049626052379608, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.08777297288179398, "reward_total_composite_std": 0.06469108909368515} {"timestamp_utc": "2026-04-12T14:20:09Z", "mode": "train", "global_step": 891, "epoch": 0.03578744427039402, "loss": -0.0295, "grad_norm": 1.2182680368423462, "learning_rate": 7.303030303030304e-06, "num_tokens": 1817386.0, "completions/mean_length": 333.25, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 35.333335876464844, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.28022828698158264, "rewards/meter/std": 0.34886088967323303, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8258205056190491, "rewards/lexical_plausibility/std": 0.1288675218820572, "rewards/judge_quality/mean": 0.2150000035762787, "rewards/judge_quality/std": 0.3188372254371643, "rewards/repeat_penalty/mean": 0.9227318167686462, "rewards/repeat_penalty/std": 0.09093921631574631, "rewards/near_duplicate_penalty/mean": 0.9550496935844421, "rewards/near_duplicate_penalty/std": 0.0405331626534462, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9648663997650146, "rewards/distinct_2/std": 0.06941013783216476, "rewards/total_composite/mean": 0.10385888814926147, "rewards/total_composite/std": 0.1914631426334381, "reward": 0.10385888814926147, "reward_std": 0.1914631426334381, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1345459371805191, "sampling/sampling_logp_difference/max": 1.0366363525390625, "sampling/importance_sampling_ratio/min": 0.3914050757884979, "sampling/importance_sampling_ratio/mean": 1.0274628400802612, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3371424302458763, "clip_ratio/low_mean": 0.0029761905316263437, "clip_ratio/low_min": 0.0029761905316263437, "clip_ratio/high_mean": 0.04337732121348381, "clip_ratio/high_max": 0.04337732121348381, "clip_ratio/region_mean": 0.046353511745110154, "reward_total_mean": 0.10385888814926147, "reward_meter_mean": 0.28022828698158264, "reward_meter_std": 0.34886088967323303, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8258205056190491, "reward_lexical_plausibility_std": 0.1288675218820572, "reward_repeat_penalty_mean": 0.9227318167686462, "reward_repeat_penalty_std": 0.09093921631574631, "reward_near_duplicate_penalty_mean": 0.9550496935844421, "reward_near_duplicate_penalty_std": 0.0405331626534462, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9648663997650146, "reward_distinct_2_std": 0.06941013783216476, "reward_judge_quality_mean": 0.2150000035762787, "reward_judge_quality_std": 0.3188372254371643, "reward_total_composite_mean": 0.10385888814926147, "reward_total_composite_std": 0.1914631426334381} {"timestamp_utc": "2026-04-12T14:20:23Z", "mode": "train", "global_step": 892, "epoch": 0.035827609752178975, "loss": -0.0432, "grad_norm": 5.134486675262451, "learning_rate": 7.3e-06, "num_tokens": 1819190.0, "completions/mean_length": 116.5, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.000003814697266, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7746455073356628, "rewards/meter/std": 0.3026490807533264, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9716020822525024, "rewards/lexical_plausibility/std": 0.08032133430242538, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.2585087716579437, "rewards/repeat_penalty/mean": 0.9318588972091675, "rewards/repeat_penalty/std": 0.0886862576007843, "rewards/near_duplicate_penalty/mean": 0.9741957187652588, "rewards/near_duplicate_penalty/std": 0.02595910243690014, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9553326368331909, "rewards/distinct_2/std": 0.07399500906467438, "rewards/total_composite/mean": 0.2802067995071411, "rewards/total_composite/std": 0.306781530380249, "reward": 0.2802067995071411, "reward_std": 0.306781530380249, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12372325360774994, "sampling/sampling_logp_difference/max": 1.265763282775879, "sampling/importance_sampling_ratio/min": 0.28202393651008606, "sampling/importance_sampling_ratio/mean": 1.0104753971099854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6737786903977394, "clip_ratio/low_mean": 0.0495247570797801, "clip_ratio/low_min": 0.0495247570797801, "clip_ratio/high_mean": 0.06382819265127182, "clip_ratio/high_max": 0.06382819265127182, "clip_ratio/region_mean": 0.11335294973105192, "reward_total_mean": 0.2802067995071411, "reward_meter_mean": 0.7746455073356628, "reward_meter_std": 0.3026490807533264, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9716020822525024, "reward_lexical_plausibility_std": 0.08032133430242538, "reward_repeat_penalty_mean": 0.9318588972091675, "reward_repeat_penalty_std": 0.0886862576007843, "reward_near_duplicate_penalty_mean": 0.9741957187652588, "reward_near_duplicate_penalty_std": 0.02595910243690014, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9553326368331909, "reward_distinct_2_std": 0.07399500906467438, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.2585087716579437, "reward_total_composite_mean": 0.2802067995071411, "reward_total_composite_std": 0.306781530380249} {"timestamp_utc": "2026-04-12T14:20:36Z", "mode": "train", "global_step": 893, "epoch": 0.03586777523396393, "loss": -0.1405, "grad_norm": 3.605888843536377, "learning_rate": 7.296969696969698e-06, "num_tokens": 1821401.0, "completions/mean_length": 213.375, "completions/min_length": 106.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 113.83333587646484, "completions/min_terminated_length": 106.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.5278173685073853, "rewards/meter/std": 0.380450576543808, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9403489828109741, "rewards/lexical_plausibility/std": 0.11958342045545578, "rewards/judge_quality/mean": 0.28125, "rewards/judge_quality/std": 0.13346347212791443, "rewards/repeat_penalty/mean": 0.7489525079727173, "rewards/repeat_penalty/std": 0.16229791939258575, "rewards/near_duplicate_penalty/mean": 0.9234349727630615, "rewards/near_duplicate_penalty/std": 0.04624555632472038, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8060756325721741, "rewards/distinct_2/std": 0.14574405550956726, "rewards/total_composite/mean": 0.13932116329669952, "rewards/total_composite/std": 0.1388460397720337, "reward": 0.13932116329669952, "reward_std": 0.1388460397720337, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12520933151245117, "sampling/sampling_logp_difference/max": 3.3137621879577637, "sampling/importance_sampling_ratio/min": 0.036379050463438034, "sampling/importance_sampling_ratio/mean": 1.0155220031738281, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5951655730605125, "clip_ratio/low_mean": 0.038522012531757355, "clip_ratio/low_min": 0.038522012531757355, "clip_ratio/high_mean": 0.06053047347813845, "clip_ratio/high_max": 0.06053047347813845, "clip_ratio/region_mean": 0.0990524860098958, "reward_total_mean": 0.13932116329669952, "reward_meter_mean": 0.5278173685073853, "reward_meter_std": 0.380450576543808, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9403489828109741, "reward_lexical_plausibility_std": 0.11958342045545578, "reward_repeat_penalty_mean": 0.7489525079727173, "reward_repeat_penalty_std": 0.16229791939258575, "reward_near_duplicate_penalty_mean": 0.9234349727630615, "reward_near_duplicate_penalty_std": 0.04624555632472038, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8060756325721741, "reward_distinct_2_std": 0.14574405550956726, "reward_judge_quality_mean": 0.28125, "reward_judge_quality_std": 0.13346347212791443, "reward_total_composite_mean": 0.13932116329669952, "reward_total_composite_std": 0.1388460397720337} {"timestamp_utc": "2026-04-12T14:20:51Z", "mode": "train", "global_step": 894, "epoch": 0.03590794071574888, "loss": -0.0537, "grad_norm": 4.7556352615356445, "learning_rate": 7.293939393939394e-06, "num_tokens": 1823099.0, "completions/mean_length": 109.25, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.71428680419922, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.6064315438270569, "rewards/meter/std": 0.4437050223350525, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9821075797080994, "rewards/lexical_plausibility/std": 0.05060745030641556, "rewards/judge_quality/mean": 0.5762500166893005, "rewards/judge_quality/std": 0.31513887643814087, "rewards/repeat_penalty/mean": 0.8857088685035706, "rewards/repeat_penalty/std": 0.06341800838708878, "rewards/near_duplicate_penalty/mean": 0.9281342625617981, "rewards/near_duplicate_penalty/std": 0.051846202462911606, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9541317820549011, "rewards/distinct_2/std": 0.03692275285720825, "rewards/total_composite/mean": 0.3359679579734802, "rewards/total_composite/std": 0.3716164231300354, "reward": 0.3359679579734802, "reward_std": 0.371616393327713, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09344349056482315, "sampling/sampling_logp_difference/max": 1.2455737590789795, "sampling/importance_sampling_ratio/min": 0.28777575492858887, "sampling/importance_sampling_ratio/mean": 1.0080801248550415, "sampling/importance_sampling_ratio/max": 1.9176734685897827, "entropy": 0.443700160831213, "clip_ratio/low_mean": 0.0349231674335897, "clip_ratio/low_min": 0.0349231674335897, "clip_ratio/high_mean": 0.03835763339884579, "clip_ratio/high_max": 0.03835763339884579, "clip_ratio/region_mean": 0.07328080083243549, "reward_total_mean": 0.3359679579734802, "reward_meter_mean": 0.6064315438270569, "reward_meter_std": 0.4437050223350525, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9821075797080994, "reward_lexical_plausibility_std": 0.05060745030641556, "reward_repeat_penalty_mean": 0.8857088685035706, "reward_repeat_penalty_std": 0.06341800838708878, "reward_near_duplicate_penalty_mean": 0.9281342625617981, "reward_near_duplicate_penalty_std": 0.051846202462911606, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9541317820549011, "reward_distinct_2_std": 0.03692275285720825, "reward_judge_quality_mean": 0.5762500166893005, "reward_judge_quality_std": 0.31513887643814087, "reward_total_composite_mean": 0.3359679579734802, "reward_total_composite_std": 0.3716164231300354} {"timestamp_utc": "2026-04-12T14:21:04Z", "mode": "train", "global_step": 895, "epoch": 0.03594810619753384, "loss": -0.0466, "grad_norm": 2.282470464706421, "learning_rate": 7.290909090909092e-06, "num_tokens": 1824720.0, "completions/mean_length": 226.625, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 55.400001525878906, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.24938635528087616, "rewards/meter/std": 0.3241385519504547, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8015584945678711, "rewards/lexical_plausibility/std": 0.12472990155220032, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.7836134433746338, "rewards/repeat_penalty/std": 0.14723502099514008, "rewards/near_duplicate_penalty/mean": 0.9140781164169312, "rewards/near_duplicate_penalty/std": 0.0649443045258522, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9146628379821777, "rewards/distinct_2/std": 0.10737480968236923, "rewards/total_composite/mean": 0.09016980975866318, "rewards/total_composite/std": 0.14305296540260315, "reward": 0.09016980975866318, "reward_std": 0.14305298030376434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1548057645559311, "sampling/sampling_logp_difference/max": 1.9008073806762695, "sampling/importance_sampling_ratio/min": 0.14944791793823242, "sampling/importance_sampling_ratio/mean": 1.032528042793274, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7295360565185547, "clip_ratio/low_mean": 0.020233366638422012, "clip_ratio/low_min": 0.020233366638422012, "clip_ratio/high_mean": 0.04418042488396168, "clip_ratio/high_max": 0.04418042488396168, "clip_ratio/region_mean": 0.06441379152238369, "reward_total_mean": 0.09016980975866318, "reward_meter_mean": 0.24938635528087616, "reward_meter_std": 0.3241385519504547, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8015584945678711, "reward_lexical_plausibility_std": 0.12472990155220032, "reward_repeat_penalty_mean": 0.7836134433746338, "reward_repeat_penalty_std": 0.14723502099514008, "reward_near_duplicate_penalty_mean": 0.9140781164169312, "reward_near_duplicate_penalty_std": 0.0649443045258522, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9146628379821777, "reward_distinct_2_std": 0.10737480968236923, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.09016980975866318, "reward_total_composite_std": 0.14305296540260315} {"timestamp_utc": "2026-04-12T14:21:18Z", "mode": "train", "global_step": 896, "epoch": 0.03598827167931879, "loss": -0.0902, "grad_norm": 1.4859238862991333, "learning_rate": 7.287878787878789e-06, "num_tokens": 1826222.0, "completions/mean_length": 223.75, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 50.79999923706055, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.571113109588623, "rewards/meter/std": 0.35994669795036316, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.911432683467865, "rewards/lexical_plausibility/std": 0.13451498746871948, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2930839955806732, "rewards/repeat_penalty/mean": 0.9230127334594727, "rewards/repeat_penalty/std": 0.09052017331123352, "rewards/near_duplicate_penalty/mean": 0.9542627334594727, "rewards/near_duplicate_penalty/std": 0.06040158122777939, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2108093649148941, "rewards/total_composite/std": 0.20128123462200165, "reward": 0.2108093649148941, "reward_std": 0.20128123462200165, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12994879484176636, "sampling/sampling_logp_difference/max": 1.7714948654174805, "sampling/importance_sampling_ratio/min": 0.1700785607099533, "sampling/importance_sampling_ratio/mean": 1.0071216821670532, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4746543578803539, "clip_ratio/low_mean": 0.01944444514811039, "clip_ratio/low_min": 0.01944444514811039, "clip_ratio/high_mean": 0.052552847657352686, "clip_ratio/high_max": 0.052552847657352686, "clip_ratio/region_mean": 0.07199729280546308, "reward_total_mean": 0.2108093649148941, "reward_meter_mean": 0.571113109588623, "reward_meter_std": 0.35994669795036316, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.911432683467865, "reward_lexical_plausibility_std": 0.13451498746871948, "reward_repeat_penalty_mean": 0.9230127334594727, "reward_repeat_penalty_std": 0.09052017331123352, "reward_near_duplicate_penalty_mean": 0.9542627334594727, "reward_near_duplicate_penalty_std": 0.06040158122777939, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2930839955806732, "reward_total_composite_mean": 0.2108093649148941, "reward_total_composite_std": 0.20128123462200165} {"timestamp_utc": "2026-04-12T14:21:33Z", "mode": "train", "global_step": 897, "epoch": 0.036028437161103745, "loss": -0.0846, "grad_norm": 3.193230628967285, "learning_rate": 7.284848484848486e-06, "num_tokens": 1827979.0, "completions/mean_length": 170.625, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 56.833335876464844, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.32843998074531555, "rewards/meter/std": 0.31348317861557007, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9387256503105164, "rewards/lexical_plausibility/std": 0.11420927196741104, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.918314516544342, "rewards/repeat_penalty/std": 0.09387185424566269, "rewards/near_duplicate_penalty/mean": 0.9749169945716858, "rewards/near_duplicate_penalty/std": 0.033262208104133606, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9729020595550537, "rewards/distinct_2/std": 0.037460874766111374, "rewards/total_composite/mean": 0.12396536767482758, "rewards/total_composite/std": 0.12815655767917633, "reward": 0.12396536767482758, "reward_std": 0.12815655767917633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11207740753889084, "sampling/sampling_logp_difference/max": 1.2449564933776855, "sampling/importance_sampling_ratio/min": 0.3877437710762024, "sampling/importance_sampling_ratio/mean": 1.0083962678909302, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4012759141623974, "clip_ratio/low_mean": 0.029596560634672642, "clip_ratio/low_min": 0.029596560634672642, "clip_ratio/high_mean": 0.05037395842373371, "clip_ratio/high_max": 0.05037395842373371, "clip_ratio/region_mean": 0.07997051905840635, "reward_total_mean": 0.12396536767482758, "reward_meter_mean": 0.32843998074531555, "reward_meter_std": 0.31348317861557007, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9387256503105164, "reward_lexical_plausibility_std": 0.11420927196741104, "reward_repeat_penalty_mean": 0.918314516544342, "reward_repeat_penalty_std": 0.09387185424566269, "reward_near_duplicate_penalty_mean": 0.9749169945716858, "reward_near_duplicate_penalty_std": 0.033262208104133606, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9729020595550537, "reward_distinct_2_std": 0.037460874766111374, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.12396536767482758, "reward_total_composite_std": 0.12815655767917633} {"timestamp_utc": "2026-04-12T14:21:46Z", "mode": "train", "global_step": 898, "epoch": 0.0360686026428887, "loss": -0.0352, "grad_norm": 4.640687465667725, "learning_rate": 7.281818181818182e-06, "num_tokens": 1829442.0, "completions/mean_length": 88.875, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 28.428573608398438, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.9009531736373901, "rewards/meter/std": 0.21193014085292816, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9477071762084961, "rewards/lexical_plausibility/std": 0.099457286298275, "rewards/judge_quality/mean": 0.2837499976158142, "rewards/judge_quality/std": 0.27769139409065247, "rewards/repeat_penalty/mean": 0.7404162883758545, "rewards/repeat_penalty/std": 0.08220633864402771, "rewards/near_duplicate_penalty/mean": 0.9521687626838684, "rewards/near_duplicate_penalty/std": 0.09419640153646469, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9990137815475464, "rewards/distinct_2/std": 0.002789383754134178, "rewards/total_composite/mean": 0.24241797626018524, "rewards/total_composite/std": 0.2762780785560608, "reward": 0.24241797626018524, "reward_std": 0.2762780785560608, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12997201085090637, "sampling/sampling_logp_difference/max": 1.2856168746948242, "sampling/importance_sampling_ratio/min": 0.2764799892902374, "sampling/importance_sampling_ratio/mean": 0.9943518042564392, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5958964861929417, "clip_ratio/low_mean": 0.07402955833822489, "clip_ratio/low_min": 0.07402955833822489, "clip_ratio/high_mean": 0.04330294393002987, "clip_ratio/high_max": 0.04330294393002987, "clip_ratio/region_mean": 0.11733250226825476, "reward_total_mean": 0.24241797626018524, "reward_meter_mean": 0.9009531736373901, "reward_meter_std": 0.21193014085292816, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9477071762084961, "reward_lexical_plausibility_std": 0.099457286298275, "reward_repeat_penalty_mean": 0.7404162883758545, "reward_repeat_penalty_std": 0.08220633864402771, "reward_near_duplicate_penalty_mean": 0.9521687626838684, "reward_near_duplicate_penalty_std": 0.09419640153646469, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9990137815475464, "reward_distinct_2_std": 0.002789383754134178, "reward_judge_quality_mean": 0.2837499976158142, "reward_judge_quality_std": 0.27769139409065247, "reward_total_composite_mean": 0.24241797626018524, "reward_total_composite_std": 0.2762780785560608} {"timestamp_utc": "2026-04-12T14:21:59Z", "mode": "train", "global_step": 899, "epoch": 0.03610876812467365, "loss": -0.1324, "grad_norm": 1.8525489568710327, "learning_rate": 7.2787878787878795e-06, "num_tokens": 1831163.0, "completions/mean_length": 179.125, "completions/min_length": 60.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 68.16667175292969, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6899092197418213, "rewards/meter/std": 0.2848189175128937, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9384576082229614, "rewards/lexical_plausibility/std": 0.12220805138349533, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.27458736300468445, "rewards/repeat_penalty/mean": 0.672481894493103, "rewards/repeat_penalty/std": 0.2398921251296997, "rewards/near_duplicate_penalty/mean": 0.9235548377037048, "rewards/near_duplicate_penalty/std": 0.03125934302806854, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.24775780737400055, "rewards/distinct_2/mean": 0.9214152097702026, "rewards/distinct_2/std": 0.0647495687007904, "rewards/total_composite/mean": 0.24811697006225586, "rewards/total_composite/std": 0.1650158166885376, "reward": 0.24811697006225586, "reward_std": 0.1650158166885376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12798967957496643, "sampling/sampling_logp_difference/max": 3.1604881286621094, "sampling/importance_sampling_ratio/min": 0.042405035346746445, "sampling/importance_sampling_ratio/mean": 0.9993575215339661, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3327045850455761, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08540903823450208, "clip_ratio/high_max": 0.08540903823450208, "clip_ratio/region_mean": 0.08540903823450208, "reward_total_mean": 0.24811697006225586, "reward_meter_mean": 0.6899092197418213, "reward_meter_std": 0.2848189175128937, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9384576082229614, "reward_lexical_plausibility_std": 0.12220805138349533, "reward_repeat_penalty_mean": 0.672481894493103, "reward_repeat_penalty_std": 0.2398921251296997, "reward_near_duplicate_penalty_mean": 0.9235548377037048, "reward_near_duplicate_penalty_std": 0.03125934302806854, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.24775780737400055, "reward_distinct_2_mean": 0.9214152097702026, "reward_distinct_2_std": 0.0647495687007904, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.27458736300468445, "reward_total_composite_mean": 0.24811697006225586, "reward_total_composite_std": 0.1650158166885376} {"timestamp_utc": "2026-04-12T14:22:12Z", "mode": "train", "global_step": 900, "epoch": 0.03614893360645861, "loss": -0.047, "grad_norm": 4.618988037109375, "learning_rate": 7.275757575757576e-06, "num_tokens": 1832644.0, "completions/mean_length": 94.125, "completions/min_length": 26.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.42857360839844, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.5552480220794678, "rewards/meter/std": 0.35175880789756775, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9113634824752808, "rewards/lexical_plausibility/std": 0.16448672115802765, "rewards/judge_quality/mean": 0.5375000238418579, "rewards/judge_quality/std": 0.3681517541408539, "rewards/repeat_penalty/mean": 0.7949947118759155, "rewards/repeat_penalty/std": 0.21434663236141205, "rewards/near_duplicate_penalty/mean": 0.9128570556640625, "rewards/near_duplicate_penalty/std": 0.06426502019166946, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8788214921951294, "rewards/distinct_2/std": 0.14814431965351105, "rewards/total_composite/mean": 0.24640285968780518, "rewards/total_composite/std": 0.20807690918445587, "reward": 0.24640285968780518, "reward_std": 0.20807690918445587, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12182287871837616, "sampling/sampling_logp_difference/max": 1.4263579845428467, "sampling/importance_sampling_ratio/min": 0.2401820868253708, "sampling/importance_sampling_ratio/mean": 0.9938217997550964, "sampling/importance_sampling_ratio/max": 1.8640339374542236, "entropy": 0.4641291946172714, "clip_ratio/low_mean": 0.019736841320991516, "clip_ratio/low_min": 0.019736841320991516, "clip_ratio/high_mean": 0.07001307792961597, "clip_ratio/high_max": 0.07001307792961597, "clip_ratio/region_mean": 0.08974991925060749, "reward_total_mean": 0.24640285968780518, "reward_meter_mean": 0.5552480220794678, "reward_meter_std": 0.35175880789756775, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9113634824752808, "reward_lexical_plausibility_std": 0.16448672115802765, "reward_repeat_penalty_mean": 0.7949947118759155, "reward_repeat_penalty_std": 0.21434663236141205, "reward_near_duplicate_penalty_mean": 0.9128570556640625, "reward_near_duplicate_penalty_std": 0.06426502019166946, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8788214921951294, "reward_distinct_2_std": 0.14814431965351105, "reward_judge_quality_mean": 0.5375000238418579, "reward_judge_quality_std": 0.3681517541408539, "reward_total_composite_mean": 0.24640285968780518, "reward_total_composite_std": 0.20807690918445587} {"timestamp_utc": "2026-04-12T14:24:34Z", "mode": "eval", "global_step": 900, "epoch": 0.03614893360645861, "eval_loss": NaN, "eval_runtime": 142.7142, "eval_samples_per_second": 0.729, "eval_steps_per_second": 0.091, "eval_num_tokens": 1832644.0, "eval_completions/mean_length": 238.27884615384616, "eval_completions/min_length": 48.07692307692308, "eval_completions/max_length": 474.38461538461536, "eval_completions/clipped_ratio": 0.18269230769230768, "eval_completions/mean_terminated_length": 173.86658184344952, "eval_completions/min_terminated_length": 48.07692307692308, "eval_completions/max_terminated_length": 340.2307692307692, "eval_rewards/meter/mean": 0.4154845716861578, "eval_rewards/meter/std": 0.3006790383503987, "eval_rewards/count_adherence/mean": 0.8665537696618301, "eval_rewards/count_adherence/std": 0.18183370335743979, "eval_rewards/arabic_clean/mean": 0.9134615384615384, "eval_rewards/arabic_clean/std": 0.18420560084856474, "eval_rewards/lexical_plausibility/mean": 0.9800223708152771, "eval_rewards/lexical_plausibility/std": 0.04943215696570965, "eval_rewards/judge_quality/mean": 0.28105768675987536, "eval_rewards/judge_quality/std": 0.1960173398256302, "eval_rewards/repeat_penalty/mean": 0.4591149366818942, "eval_rewards/repeat_penalty/std": 0.3970482899592473, "eval_rewards/near_duplicate_penalty/mean": 0.8061947134824899, "eval_rewards/near_duplicate_penalty/std": 0.18771734489844397, "eval_rewards/opening_diversity/mean": 0.9105327587861282, "eval_rewards/opening_diversity/std": 0.17902263483175865, "eval_rewards/distinct_2/mean": 0.5257952282061944, "eval_rewards/distinct_2/std": 0.41410436767798203, "eval_rewards/total_composite/mean": 0.11126948721133746, "eval_rewards/total_composite/std": 0.13009287187686333, "eval_reward": 0.11126948721133746, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.040275223553180695, "eval_sampling/sampling_logp_difference/max": 1.0106278382814848, "eval_sampling/importance_sampling_ratio/min": 0.3774389555821052, "eval_sampling/importance_sampling_ratio/mean": 1.007907087986286, "eval_sampling/importance_sampling_ratio/max": 1.4787569687916682, "eval_entropy": 0.41509873362687916, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.11126948721133746, "eval_reward_meter_mean": 0.4154845716861578, "eval_reward_meter_std": 0.3006790383503987, "eval_reward_count_adherence_mean": 0.8665537696618301, "eval_reward_count_adherence_std": 0.18183370335743979, "eval_reward_arabic_clean_mean": 0.9134615384615384, "eval_reward_arabic_clean_std": 0.18420560084856474, "eval_reward_lexical_plausibility_mean": 0.9800223708152771, "eval_reward_lexical_plausibility_std": 0.04943215696570965, "eval_reward_repeat_penalty_mean": 0.4591149366818942, "eval_reward_repeat_penalty_std": 0.3970482899592473, "eval_reward_near_duplicate_penalty_mean": 0.8061947134824899, "eval_reward_near_duplicate_penalty_std": 0.18771734489844397, "eval_reward_opening_diversity_mean": 0.9105327587861282, "eval_reward_opening_diversity_std": 0.17902263483175865, "eval_reward_distinct_2_mean": 0.5257952282061944, "eval_reward_distinct_2_std": 0.41410436767798203, "eval_reward_judge_quality_mean": 0.28105768675987536, "eval_reward_judge_quality_std": 0.1960173398256302, "eval_reward_total_composite_mean": 0.11126948721133746, "eval_reward_total_composite_std": 0.13009287187686333} {"timestamp_utc": "2026-04-12T14:24:51Z", "mode": "train", "global_step": 901, "epoch": 0.03618909908824356, "loss": -0.0466, "grad_norm": 4.856034278869629, "learning_rate": 7.272727272727273e-06, "num_tokens": 1834218.0, "completions/mean_length": 106.75, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.85714340209961, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.5247308015823364, "rewards/meter/std": 0.41064566373825073, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9642213582992554, "rewards/lexical_plausibility/std": 0.10119719803333282, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3414648175239563, "rewards/repeat_penalty/mean": 0.9651439189910889, "rewards/repeat_penalty/std": 0.059345826506614685, "rewards/near_duplicate_penalty/mean": 0.9673627614974976, "rewards/near_duplicate_penalty/std": 0.05336698517203331, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9973656535148621, "rewards/distinct_2/std": 0.007451077923178673, "rewards/total_composite/mean": 0.38585364818573, "rewards/total_composite/std": 0.4109489619731903, "reward": 0.38585364818573, "reward_std": 0.4109489619731903, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10950043797492981, "sampling/sampling_logp_difference/max": 1.1998834609985352, "sampling/importance_sampling_ratio/min": 0.3012292981147766, "sampling/importance_sampling_ratio/mean": 1.0183032751083374, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.48758653923869133, "clip_ratio/low_mean": 0.057705594692379236, "clip_ratio/low_min": 0.057705594692379236, "clip_ratio/high_mean": 0.012655061902478337, "clip_ratio/high_max": 0.012655061902478337, "clip_ratio/region_mean": 0.07036065659485757, "reward_total_mean": 0.38585364818573, "reward_meter_mean": 0.5247308015823364, "reward_meter_std": 0.41064566373825073, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9642213582992554, "reward_lexical_plausibility_std": 0.10119719803333282, "reward_repeat_penalty_mean": 0.9651439189910889, "reward_repeat_penalty_std": 0.059345826506614685, "reward_near_duplicate_penalty_mean": 0.9673627614974976, "reward_near_duplicate_penalty_std": 0.05336698517203331, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9973656535148621, "reward_distinct_2_std": 0.007451077923178673, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3414648175239563, "reward_total_composite_mean": 0.38585364818573, "reward_total_composite_std": 0.4109489619731903} {"timestamp_utc": "2026-04-12T14:25:04Z", "mode": "train", "global_step": 902, "epoch": 0.036229264570028515, "loss": -0.0786, "grad_norm": 5.1406779289245605, "learning_rate": 7.26969696969697e-06, "num_tokens": 1836189.0, "completions/mean_length": 134.375, "completions/min_length": 67.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 80.42857360839844, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.6462476849555969, "rewards/meter/std": 0.3270873427391052, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9690636992454529, "rewards/lexical_plausibility/std": 0.08750104904174805, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.865140438079834, "rewards/repeat_penalty/std": 0.11856569349765778, "rewards/near_duplicate_penalty/mean": 0.9454061985015869, "rewards/near_duplicate_penalty/std": 0.053187109529972076, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9117323160171509, "rewards/distinct_2/std": 0.08192819356918335, "rewards/total_composite/mean": 0.17186760902404785, "rewards/total_composite/std": 0.11935804784297943, "reward": 0.17186760902404785, "reward_std": 0.11935804039239883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13567602634429932, "sampling/sampling_logp_difference/max": 1.5272159576416016, "sampling/importance_sampling_ratio/min": 0.2171393483877182, "sampling/importance_sampling_ratio/mean": 1.0106441974639893, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7391554228961468, "clip_ratio/low_mean": 0.0436558430083096, "clip_ratio/low_min": 0.0436558430083096, "clip_ratio/high_mean": 0.0703059108927846, "clip_ratio/high_max": 0.0703059108927846, "clip_ratio/region_mean": 0.1139617539010942, "reward_total_mean": 0.17186760902404785, "reward_meter_mean": 0.6462476849555969, "reward_meter_std": 0.3270873427391052, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9690636992454529, "reward_lexical_plausibility_std": 0.08750104904174805, "reward_repeat_penalty_mean": 0.865140438079834, "reward_repeat_penalty_std": 0.11856569349765778, "reward_near_duplicate_penalty_mean": 0.9454061985015869, "reward_near_duplicate_penalty_std": 0.053187109529972076, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9117323160171509, "reward_distinct_2_std": 0.08192819356918335, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.17186760902404785, "reward_total_composite_std": 0.11935804784297943} {"timestamp_utc": "2026-04-12T14:25:12Z", "mode": "train", "global_step": 903, "epoch": 0.03626943005181347, "loss": 0.0216, "grad_norm": 7.0134782791137695, "learning_rate": 7.266666666666668e-06, "num_tokens": 1838181.0, "completions/mean_length": 80.0, "completions/min_length": 71.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 80.0, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.6698614358901978, "rewards/meter/std": 0.3118594288825989, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.6805667877197266, "rewards/repeat_penalty/std": 0.17560771107673645, "rewards/near_duplicate_penalty/mean": 0.9137561917304993, "rewards/near_duplicate_penalty/std": 0.03349655121564865, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8141463994979858, "rewards/distinct_2/std": 0.10309074074029922, "rewards/total_composite/mean": 0.22637386620044708, "rewards/total_composite/std": 0.10816343128681183, "reward": 0.22637386620044708, "reward_std": 0.10816343128681183, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07582775503396988, "sampling/sampling_logp_difference/max": 2.568497657775879, "sampling/importance_sampling_ratio/min": 0.07665061205625534, "sampling/importance_sampling_ratio/mean": 1.0025361776351929, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3810967281460762, "clip_ratio/low_mean": 0.038531263009645045, "clip_ratio/low_min": 0.038531263009645045, "clip_ratio/high_mean": 0.03425446106120944, "clip_ratio/high_max": 0.03425446106120944, "clip_ratio/region_mean": 0.07278572407085449, "reward_total_mean": 0.22637386620044708, "reward_meter_mean": 0.6698614358901978, "reward_meter_std": 0.3118594288825989, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.6805667877197266, "reward_repeat_penalty_std": 0.17560771107673645, "reward_near_duplicate_penalty_mean": 0.9137561917304993, "reward_near_duplicate_penalty_std": 0.03349655121564865, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8141463994979858, "reward_distinct_2_std": 0.10309074074029922, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.22637386620044708, "reward_total_composite_std": 0.10816343128681183} {"timestamp_utc": "2026-04-12T14:25:26Z", "mode": "train", "global_step": 904, "epoch": 0.03630959553359842, "loss": -0.0198, "grad_norm": 2.0801613330841064, "learning_rate": 7.263636363636364e-06, "num_tokens": 1839657.0, "completions/mean_length": 202.5, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 16.80000114440918, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.3084750771522522, "rewards/meter/std": 0.4223470687866211, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9139069318771362, "rewards/lexical_plausibility/std": 0.11909569054841995, "rewards/judge_quality/mean": 0.3050000071525574, "rewards/judge_quality/std": 0.38239845633506775, "rewards/repeat_penalty/mean": 0.7804979085922241, "rewards/repeat_penalty/std": 0.08715314418077469, "rewards/near_duplicate_penalty/mean": 0.9996334314346313, "rewards/near_duplicate_penalty/std": 0.0010368125513195992, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9995228052139282, "rewards/distinct_2/std": 0.0013496896717697382, "rewards/total_composite/mean": 0.05777446925640106, "rewards/total_composite/std": 0.07636607438325882, "reward": 0.05777446925640106, "reward_std": 0.07636607438325882, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2103031724691391, "sampling/sampling_logp_difference/max": 2.262977123260498, "sampling/importance_sampling_ratio/min": 0.10404027998447418, "sampling/importance_sampling_ratio/mean": 0.9945732355117798, "sampling/importance_sampling_ratio/max": 1.6447299718856812, "entropy": 0.43526381626725197, "clip_ratio/low_mean": 0.030330882407724857, "clip_ratio/low_min": 0.030330882407724857, "clip_ratio/high_mean": 0.08346233330667019, "clip_ratio/high_max": 0.08346233330667019, "clip_ratio/region_mean": 0.11379321571439505, "reward_total_mean": 0.05777446925640106, "reward_meter_mean": 0.3084750771522522, "reward_meter_std": 0.4223470687866211, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9139069318771362, "reward_lexical_plausibility_std": 0.11909569054841995, "reward_repeat_penalty_mean": 0.7804979085922241, "reward_repeat_penalty_std": 0.08715314418077469, "reward_near_duplicate_penalty_mean": 0.9996334314346313, "reward_near_duplicate_penalty_std": 0.0010368125513195992, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9995228052139282, "reward_distinct_2_std": 0.0013496896717697382, "reward_judge_quality_mean": 0.3050000071525574, "reward_judge_quality_std": 0.38239845633506775, "reward_total_composite_mean": 0.05777446925640106, "reward_total_composite_std": 0.07636607438325882} {"timestamp_utc": "2026-04-12T14:25:35Z", "mode": "train", "global_step": 905, "epoch": 0.036349761015383376, "loss": 0.0094, "grad_norm": 10.159344673156738, "learning_rate": 7.260606060606061e-06, "num_tokens": 1841789.0, "completions/mean_length": 103.5, "completions/min_length": 97.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.5, "completions/min_terminated_length": 97.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.7616041898727417, "rewards/meter/std": 0.27403607964515686, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.4398246705532074, "rewards/repeat_penalty/std": 0.2828714847564697, "rewards/near_duplicate_penalty/mean": 0.8676952123641968, "rewards/near_duplicate_penalty/std": 0.07762881368398666, "rewards/opening_diversity/mean": 0.5859375, "rewards/opening_diversity/std": 0.2911214232444763, "rewards/distinct_2/mean": 0.7911661863327026, "rewards/distinct_2/std": 0.09991541504859924, "rewards/total_composite/mean": 0.24073660373687744, "rewards/total_composite/std": 0.11653447151184082, "reward": 0.24073660373687744, "reward_std": 0.11653447151184082, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10521750152111053, "sampling/sampling_logp_difference/max": 2.861323118209839, "sampling/importance_sampling_ratio/min": 0.05719303712248802, "sampling/importance_sampling_ratio/mean": 0.9967947602272034, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4639259986579418, "clip_ratio/low_mean": 0.024730920791625977, "clip_ratio/low_min": 0.024730920791625977, "clip_ratio/high_mean": 0.05875509697943926, "clip_ratio/high_max": 0.05875509697943926, "clip_ratio/region_mean": 0.08348601777106524, "reward_total_mean": 0.24073660373687744, "reward_meter_mean": 0.7616041898727417, "reward_meter_std": 0.27403607964515686, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4398246705532074, "reward_repeat_penalty_std": 0.2828714847564697, "reward_near_duplicate_penalty_mean": 0.8676952123641968, "reward_near_duplicate_penalty_std": 0.07762881368398666, "reward_opening_diversity_mean": 0.5859375, "reward_opening_diversity_std": 0.2911214232444763, "reward_distinct_2_mean": 0.7911661863327026, "reward_distinct_2_std": 0.09991541504859924, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.24073660373687744, "reward_total_composite_std": 0.11653447151184082} {"timestamp_utc": "2026-04-12T14:25:43Z", "mode": "train", "global_step": 906, "epoch": 0.03638992649716833, "loss": 0.0648, "grad_norm": 17.03221321105957, "learning_rate": 7.257575757575758e-06, "num_tokens": 1843224.0, "completions/mean_length": 24.375, "completions/min_length": 21.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.375, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.6680982112884521, "rewards/meter/std": 0.3179086148738861, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.3767886161804199, "rewards/repeat_penalty/mean": 0.7389006614685059, "rewards/repeat_penalty/std": 0.024166369810700417, "rewards/near_duplicate_penalty/mean": 0.9852008819580078, "rewards/near_duplicate_penalty/std": 0.03222181275486946, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27304381132125854, "rewards/total_composite/std": 0.18368299305438995, "reward": 0.27304381132125854, "reward_std": 0.18368297815322876, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11624179035425186, "sampling/sampling_logp_difference/max": 2.099454402923584, "sampling/importance_sampling_ratio/min": 0.12252325564622879, "sampling/importance_sampling_ratio/mean": 1.004376769065857, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5289847925305367, "clip_ratio/low_mean": 0.038920940831303596, "clip_ratio/low_min": 0.038920940831303596, "clip_ratio/high_mean": 0.03754787798970938, "clip_ratio/high_max": 0.03754787798970938, "clip_ratio/region_mean": 0.07646881882101297, "reward_total_mean": 0.27304381132125854, "reward_meter_mean": 0.6680982112884521, "reward_meter_std": 0.3179086148738861, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7389006614685059, "reward_repeat_penalty_std": 0.024166369810700417, "reward_near_duplicate_penalty_mean": 0.9852008819580078, "reward_near_duplicate_penalty_std": 0.03222181275486946, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.3767886161804199, "reward_total_composite_mean": 0.27304381132125854, "reward_total_composite_std": 0.18368299305438995} {"timestamp_utc": "2026-04-12T14:25:54Z", "mode": "train", "global_step": 907, "epoch": 0.036430091978953284, "loss": 0.0516, "grad_norm": 7.356684684753418, "learning_rate": 7.254545454545455e-06, "num_tokens": 1846165.0, "completions/mean_length": 177.625, "completions/min_length": 158.0, "completions/max_length": 215.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 177.625, "completions/min_terminated_length": 158.0, "completions/max_terminated_length": 215.0, "rewards/meter/mean": 0.26473280787467957, "rewards/meter/std": 0.2548903524875641, "rewards/count_adherence/mean": 0.9444444179534912, "rewards/count_adherence/std": 0.059391383081674576, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.10690448433160782, "rewards/repeat_penalty/mean": 0.739059567451477, "rewards/repeat_penalty/std": 0.21363458037376404, "rewards/near_duplicate_penalty/mean": 0.9342135787010193, "rewards/near_duplicate_penalty/std": 0.03609912469983101, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8026244640350342, "rewards/distinct_2/std": 0.183920755982399, "rewards/total_composite/mean": 0.06867167353630066, "rewards/total_composite/std": 0.0791734829545021, "reward": 0.06867167353630066, "reward_std": 0.0791734829545021, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11483689397573471, "sampling/sampling_logp_difference/max": 3.0560803413391113, "sampling/importance_sampling_ratio/min": 0.04707184061408043, "sampling/importance_sampling_ratio/mean": 1.0007380247116089, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5057728476822376, "clip_ratio/low_mean": 0.048943258821964264, "clip_ratio/low_min": 0.048943258821964264, "clip_ratio/high_mean": 0.06487262714654207, "clip_ratio/high_max": 0.06487262714654207, "clip_ratio/region_mean": 0.11381588596850634, "reward_total_mean": 0.06867167353630066, "reward_meter_mean": 0.26473280787467957, "reward_meter_std": 0.2548903524875641, "reward_count_adherence_mean": 0.9444444179534912, "reward_count_adherence_std": 0.059391383081674576, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.739059567451477, "reward_repeat_penalty_std": 0.21363458037376404, "reward_near_duplicate_penalty_mean": 0.9342135787010193, "reward_near_duplicate_penalty_std": 0.03609912469983101, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8026244640350342, "reward_distinct_2_std": 0.183920755982399, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.10690448433160782, "reward_total_composite_mean": 0.06867167353630066, "reward_total_composite_std": 0.0791734829545021} {"timestamp_utc": "2026-04-12T14:26:07Z", "mode": "train", "global_step": 908, "epoch": 0.03647025746073824, "loss": -0.0504, "grad_norm": 2.2303521633148193, "learning_rate": 7.251515151515151e-06, "num_tokens": 1847669.0, "completions/mean_length": 220.0, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 44.79999923706055, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.46474987268447876, "rewards/meter/std": 0.4497232139110565, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8987423181533813, "rewards/lexical_plausibility/std": 0.13027387857437134, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.19955307245254517, "rewards/repeat_penalty/mean": 0.8320578336715698, "rewards/repeat_penalty/std": 0.13103018701076508, "rewards/near_duplicate_penalty/mean": 0.9724264740943909, "rewards/near_duplicate_penalty/std": 0.025230664759874344, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9782222509384155, "rewards/distinct_2/std": 0.03798056021332741, "rewards/total_composite/mean": 0.1411353200674057, "rewards/total_composite/std": 0.18911324441432953, "reward": 0.1411353200674057, "reward_std": 0.18911321461200714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11839240789413452, "sampling/sampling_logp_difference/max": 1.9321202039718628, "sampling/importance_sampling_ratio/min": 0.1448407769203186, "sampling/importance_sampling_ratio/mean": 0.999984085559845, "sampling/importance_sampling_ratio/max": 1.786693811416626, "entropy": 0.3215724155306816, "clip_ratio/low_mean": 0.03264146577566862, "clip_ratio/low_min": 0.03264146577566862, "clip_ratio/high_mean": 0.03963867202401161, "clip_ratio/high_max": 0.03963867202401161, "clip_ratio/region_mean": 0.07228013779968023, "reward_total_mean": 0.1411353200674057, "reward_meter_mean": 0.46474987268447876, "reward_meter_std": 0.4497232139110565, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8987423181533813, "reward_lexical_plausibility_std": 0.13027387857437134, "reward_repeat_penalty_mean": 0.8320578336715698, "reward_repeat_penalty_std": 0.13103018701076508, "reward_near_duplicate_penalty_mean": 0.9724264740943909, "reward_near_duplicate_penalty_std": 0.025230664759874344, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9782222509384155, "reward_distinct_2_std": 0.03798056021332741, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.19955307245254517, "reward_total_composite_mean": 0.1411353200674057, "reward_total_composite_std": 0.18911324441432953} {"timestamp_utc": "2026-04-12T14:26:16Z", "mode": "train", "global_step": 909, "epoch": 0.03651042294252319, "loss": 0.0006, "grad_norm": 10.0469331741333, "learning_rate": 7.2484848484848495e-06, "num_tokens": 1849818.0, "completions/mean_length": 90.625, "completions/min_length": 83.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.625, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.46023374795913696, "rewards/meter/std": 0.33316048979759216, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.8125627636909485, "rewards/repeat_penalty/std": 0.12995557487010956, "rewards/near_duplicate_penalty/mean": 0.9248131513595581, "rewards/near_duplicate_penalty/std": 0.04308905452489853, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8911466598510742, "rewards/distinct_2/std": 0.09683087468147278, "rewards/total_composite/mean": 0.1353432834148407, "rewards/total_composite/std": 0.11111269891262054, "reward": 0.1353432834148407, "reward_std": 0.11111269891262054, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11659479141235352, "sampling/sampling_logp_difference/max": 3.9343385696411133, "sampling/importance_sampling_ratio/min": 0.019558632746338844, "sampling/importance_sampling_ratio/mean": 0.9950460195541382, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4510437734425068, "clip_ratio/low_mean": 0.04797249333932996, "clip_ratio/low_min": 0.04797249333932996, "clip_ratio/high_mean": 0.042016807943582535, "clip_ratio/high_max": 0.042016807943582535, "clip_ratio/region_mean": 0.08998930128291249, "reward_total_mean": 0.1353432834148407, "reward_meter_mean": 0.46023374795913696, "reward_meter_std": 0.33316048979759216, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8125627636909485, "reward_repeat_penalty_std": 0.12995557487010956, "reward_near_duplicate_penalty_mean": 0.9248131513595581, "reward_near_duplicate_penalty_std": 0.04308905452489853, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8911466598510742, "reward_distinct_2_std": 0.09683087468147278, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1353432834148407, "reward_total_composite_std": 0.11111269891262054} {"timestamp_utc": "2026-04-12T14:26:30Z", "mode": "train", "global_step": 910, "epoch": 0.03655058842430815, "loss": -0.0407, "grad_norm": 3.7108423709869385, "learning_rate": 7.245454545454546e-06, "num_tokens": 1853614.0, "completions/mean_length": 297.5, "completions/min_length": 208.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 266.8571472167969, "completions/min_terminated_length": 208.0, "completions/max_terminated_length": 341.0, "rewards/meter/mean": 0.26572930812835693, "rewards/meter/std": 0.20120589435100555, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.2086307406425476, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.961482584476471, "rewards/lexical_plausibility/std": 0.10894373059272766, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.4588620960712433, "rewards/repeat_penalty/std": 0.2753836512565613, "rewards/near_duplicate_penalty/mean": 0.876366376876831, "rewards/near_duplicate_penalty/std": 0.0673738643527031, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5448314547538757, "rewards/distinct_2/std": 0.2569446265697479, "rewards/total_composite/mean": 0.04977791756391525, "rewards/total_composite/std": 0.05664224550127983, "reward": 0.04977791756391525, "reward_std": 0.05664224550127983, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09329218417406082, "sampling/sampling_logp_difference/max": 3.3235740661621094, "sampling/importance_sampling_ratio/min": 0.03602385148406029, "sampling/importance_sampling_ratio/mean": 1.000282645225525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3965323455631733, "clip_ratio/low_mean": 0.029428347013890743, "clip_ratio/low_min": 0.029428347013890743, "clip_ratio/high_mean": 0.056563181802630424, "clip_ratio/high_max": 0.056563181802630424, "clip_ratio/region_mean": 0.08599152881652117, "reward_total_mean": 0.04977791756391525, "reward_meter_mean": 0.26572930812835693, "reward_meter_std": 0.20120589435100555, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.2086307406425476, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.961482584476471, "reward_lexical_plausibility_std": 0.10894373059272766, "reward_repeat_penalty_mean": 0.4588620960712433, "reward_repeat_penalty_std": 0.2753836512565613, "reward_near_duplicate_penalty_mean": 0.876366376876831, "reward_near_duplicate_penalty_std": 0.0673738643527031, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5448314547538757, "reward_distinct_2_std": 0.2569446265697479, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.04977791756391525, "reward_total_composite_std": 0.05664224550127983} {"timestamp_utc": "2026-04-12T14:26:39Z", "mode": "train", "global_step": 911, "epoch": 0.03659075390609311, "loss": -0.0177, "grad_norm": 13.395476341247559, "learning_rate": 7.242424242424243e-06, "num_tokens": 1855236.0, "completions/mean_length": 55.75, "completions/min_length": 45.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.75, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.3058864176273346, "rewards/meter/std": 0.3473019599914551, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9301947355270386, "rewards/repeat_penalty/std": 0.047629062086343765, "rewards/near_duplicate_penalty/mean": 0.9638501405715942, "rewards/near_duplicate_penalty/std": 0.027497611939907074, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9649626016616821, "rewards/distinct_2/std": 0.037533897906541824, "rewards/total_composite/mean": 0.17312057316303253, "rewards/total_composite/std": 0.1900882124900818, "reward": 0.17312057316303253, "reward_std": 0.1900882124900818, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1404111683368683, "sampling/sampling_logp_difference/max": 1.8854422569274902, "sampling/importance_sampling_ratio/min": 0.15176191926002502, "sampling/importance_sampling_ratio/mean": 1.002879023551941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7668841406702995, "clip_ratio/low_mean": 0.08556771744042635, "clip_ratio/low_min": 0.08556771744042635, "clip_ratio/high_mean": 0.0555866751819849, "clip_ratio/high_max": 0.0555866751819849, "clip_ratio/region_mean": 0.14115439262241125, "reward_total_mean": 0.17312057316303253, "reward_meter_mean": 0.3058864176273346, "reward_meter_std": 0.3473019599914551, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9301947355270386, "reward_repeat_penalty_std": 0.047629062086343765, "reward_near_duplicate_penalty_mean": 0.9638501405715942, "reward_near_duplicate_penalty_std": 0.027497611939907074, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9649626016616821, "reward_distinct_2_std": 0.037533897906541824, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.17312057316303253, "reward_total_composite_std": 0.1900882124900818} {"timestamp_utc": "2026-04-12T14:26:52Z", "mode": "train", "global_step": 912, "epoch": 0.03663091938787806, "loss": -0.0719, "grad_norm": 3.359111785888672, "learning_rate": 7.2393939393939404e-06, "num_tokens": 1857468.0, "completions/mean_length": 218.0, "completions/min_length": 109.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 120.0, "completions/min_terminated_length": 109.0, "completions/max_terminated_length": 132.0, "rewards/meter/mean": 0.22825634479522705, "rewards/meter/std": 0.3028012216091156, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.2976095378398895, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9280493855476379, "rewards/lexical_plausibility/std": 0.13533242046833038, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.7395656108856201, "rewards/repeat_penalty/std": 0.22323991358280182, "rewards/near_duplicate_penalty/mean": 0.9454048871994019, "rewards/near_duplicate_penalty/std": 0.060150161385536194, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.155838742852211, "rewards/distinct_2/mean": 0.8757848143577576, "rewards/distinct_2/std": 0.13074222207069397, "rewards/total_composite/mean": 0.07523701339960098, "rewards/total_composite/std": 0.10943896323442459, "reward": 0.07523701339960098, "reward_std": 0.10943896323442459, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1248907521367073, "sampling/sampling_logp_difference/max": 1.9808249473571777, "sampling/importance_sampling_ratio/min": 0.13795538246631622, "sampling/importance_sampling_ratio/mean": 0.9841961860656738, "sampling/importance_sampling_ratio/max": 1.9988473653793335, "entropy": 0.3965604715049267, "clip_ratio/low_mean": 0.0460313456133008, "clip_ratio/low_min": 0.0460313456133008, "clip_ratio/high_mean": 0.03056826815009117, "clip_ratio/high_max": 0.03056826815009117, "clip_ratio/region_mean": 0.07659961376339197, "reward_total_mean": 0.07523701339960098, "reward_meter_mean": 0.22825634479522705, "reward_meter_std": 0.3028012216091156, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.2976095378398895, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9280493855476379, "reward_lexical_plausibility_std": 0.13533242046833038, "reward_repeat_penalty_mean": 0.7395656108856201, "reward_repeat_penalty_std": 0.22323991358280182, "reward_near_duplicate_penalty_mean": 0.9454048871994019, "reward_near_duplicate_penalty_std": 0.060150161385536194, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.155838742852211, "reward_distinct_2_mean": 0.8757848143577576, "reward_distinct_2_std": 0.13074222207069397, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.07523701339960098, "reward_total_composite_std": 0.10943896323442459} {"timestamp_utc": "2026-04-12T14:27:06Z", "mode": "train", "global_step": 913, "epoch": 0.036671084869663015, "loss": 0.1245, "grad_norm": 1.2069638967514038, "learning_rate": 7.236363636363637e-06, "num_tokens": 1859761.0, "completions/mean_length": 507.625, "completions/min_length": 477.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 477.0, "completions/min_terminated_length": 477.0, "completions/max_terminated_length": 477.0, "rewards/meter/mean": 0.35045263171195984, "rewards/meter/std": 0.2506626546382904, "rewards/count_adherence/mean": 0.5340909361839294, "rewards/count_adherence/std": 0.09009373933076859, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0037082768976688385, "rewards/repeat_penalty/std": 0.00762829277664423, "rewards/near_duplicate_penalty/mean": 0.7244557738304138, "rewards/near_duplicate_penalty/std": 0.13442681729793549, "rewards/opening_diversity/mean": 0.9689275622367859, "rewards/opening_diversity/std": 0.07131610810756683, "rewards/distinct_2/mean": 0.005805698223412037, "rewards/distinct_2/std": 0.012150234542787075, "rewards/total_composite/mean": 0.02310771867632866, "rewards/total_composite/std": 0.02202078141272068, "reward": 0.02310771867632866, "reward_std": 0.02202078141272068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05831579491496086, "sampling/sampling_logp_difference/max": 1.9486279487609863, "sampling/importance_sampling_ratio/min": 0.1424694061279297, "sampling/importance_sampling_ratio/mean": 1.0042625665664673, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.026542680338025093, "clip_ratio/low_mean": 0.006813417188823223, "clip_ratio/low_min": 0.006813417188823223, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.006813417188823223, "reward_total_mean": 0.02310771867632866, "reward_meter_mean": 0.35045263171195984, "reward_meter_std": 0.2506626546382904, "reward_count_adherence_mean": 0.5340909361839294, "reward_count_adherence_std": 0.09009373933076859, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0037082768976688385, "reward_repeat_penalty_std": 0.00762829277664423, "reward_near_duplicate_penalty_mean": 0.7244557738304138, "reward_near_duplicate_penalty_std": 0.13442681729793549, "reward_opening_diversity_mean": 0.9689275622367859, "reward_opening_diversity_std": 0.07131610810756683, "reward_distinct_2_mean": 0.005805698223412037, "reward_distinct_2_std": 0.012150234542787075, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.02310771867632866, "reward_total_composite_std": 0.02202078141272068} {"timestamp_utc": "2026-04-12T14:27:20Z", "mode": "train", "global_step": 914, "epoch": 0.03671125035144797, "loss": -0.0787, "grad_norm": 3.3468692302703857, "learning_rate": 7.233333333333334e-06, "num_tokens": 1861285.0, "completions/mean_length": 108.5, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.85714340209961, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8519883155822754, "rewards/meter/std": 0.16690686345100403, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9645233750343323, "rewards/lexical_plausibility/std": 0.1003430113196373, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.5674265027046204, "rewards/repeat_penalty/std": 0.2832561433315277, "rewards/near_duplicate_penalty/mean": 0.7704793810844421, "rewards/near_duplicate_penalty/std": 0.1786900758743286, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.7631553411483765, "rewards/distinct_2/std": 0.18417690694332123, "rewards/total_composite/mean": 0.1603967249393463, "rewards/total_composite/std": 0.10251737385988235, "reward": 0.1603967249393463, "reward_std": 0.10251737385988235, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09863579273223877, "sampling/sampling_logp_difference/max": 1.2791244983673096, "sampling/importance_sampling_ratio/min": 0.2782808244228363, "sampling/importance_sampling_ratio/mean": 1.0042524337768555, "sampling/importance_sampling_ratio/max": 1.9618065357208252, "entropy": 0.49080899357795715, "clip_ratio/low_mean": 0.04609534703195095, "clip_ratio/low_min": 0.04609534703195095, "clip_ratio/high_mean": 0.05709380004554987, "clip_ratio/high_max": 0.05709380004554987, "clip_ratio/region_mean": 0.10318914707750082, "reward_total_mean": 0.1603967249393463, "reward_meter_mean": 0.8519883155822754, "reward_meter_std": 0.16690686345100403, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9645233750343323, "reward_lexical_plausibility_std": 0.1003430113196373, "reward_repeat_penalty_mean": 0.5674265027046204, "reward_repeat_penalty_std": 0.2832561433315277, "reward_near_duplicate_penalty_mean": 0.7704793810844421, "reward_near_duplicate_penalty_std": 0.1786900758743286, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.7631553411483765, "reward_distinct_2_std": 0.18417690694332123, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.1603967249393463, "reward_total_composite_std": 0.10251737385988235} {"timestamp_utc": "2026-04-12T14:27:34Z", "mode": "train", "global_step": 915, "epoch": 0.03675141583323292, "loss": 0.0211, "grad_norm": 3.023385763168335, "learning_rate": 7.2303030303030305e-06, "num_tokens": 1865865.0, "completions/mean_length": 357.5, "completions/min_length": 305.0, "completions/max_length": 494.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 357.5, "completions/min_terminated_length": 305.0, "completions/max_terminated_length": 494.0, "rewards/meter/mean": 0.3904086649417877, "rewards/meter/std": 0.23703508079051971, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.09848947077989578, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.09513363242149353, "rewards/repeat_penalty/std": 0.10595035552978516, "rewards/near_duplicate_penalty/mean": 0.7053005695343018, "rewards/near_duplicate_penalty/std": 0.13026690483093262, "rewards/opening_diversity/mean": 0.8410183191299438, "rewards/opening_diversity/std": 0.24256747961044312, "rewards/distinct_2/mean": 0.13615761697292328, "rewards/distinct_2/std": 0.15210334956645966, "rewards/total_composite/mean": 0.04659539461135864, "rewards/total_composite/std": 0.028762316331267357, "reward": 0.04659539461135864, "reward_std": 0.028762316331267357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05945450812578201, "sampling/sampling_logp_difference/max": 1.8852674961090088, "sampling/importance_sampling_ratio/min": 0.15178844332695007, "sampling/importance_sampling_ratio/mean": 1.0019183158874512, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.298257851973176, "clip_ratio/low_mean": 0.022474889643490314, "clip_ratio/low_min": 0.022474889643490314, "clip_ratio/high_mean": 0.04105802858248353, "clip_ratio/high_max": 0.04105802858248353, "clip_ratio/region_mean": 0.06353291822597384, "reward_total_mean": 0.04659539461135864, "reward_meter_mean": 0.3904086649417877, "reward_meter_std": 0.23703508079051971, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.09848947077989578, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.09513363242149353, "reward_repeat_penalty_std": 0.10595035552978516, "reward_near_duplicate_penalty_mean": 0.7053005695343018, "reward_near_duplicate_penalty_std": 0.13026690483093262, "reward_opening_diversity_mean": 0.8410183191299438, "reward_opening_diversity_std": 0.24256747961044312, "reward_distinct_2_mean": 0.13615761697292328, "reward_distinct_2_std": 0.15210334956645966, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.04659539461135864, "reward_total_composite_std": 0.028762316331267357} {"timestamp_utc": "2026-04-12T14:27:42Z", "mode": "train", "global_step": 916, "epoch": 0.03679158131501788, "loss": 0.0113, "grad_norm": 12.755487442016602, "learning_rate": 7.227272727272729e-06, "num_tokens": 1867292.0, "completions/mean_length": 34.375, "completions/min_length": 32.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.662441611289978, "rewards/meter/std": 0.3464275896549225, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9969915151596069, "rewards/repeat_penalty/std": 0.0043798936530947685, "rewards/near_duplicate_penalty/mean": 0.9969915151596069, "rewards/near_duplicate_penalty/std": 0.0043798936530947685, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32099583745002747, "rewards/total_composite/std": 0.1858326494693756, "reward": 0.32099583745002747, "reward_std": 0.1858326494693756, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12480656057596207, "sampling/sampling_logp_difference/max": 1.4419769048690796, "sampling/importance_sampling_ratio/min": 0.2364598512649536, "sampling/importance_sampling_ratio/mean": 1.016209363937378, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.568106759339571, "clip_ratio/low_mean": 0.051674108020961285, "clip_ratio/low_min": 0.051674108020961285, "clip_ratio/high_mean": 0.06877483334392309, "clip_ratio/high_max": 0.06877483334392309, "clip_ratio/region_mean": 0.12044894136488438, "reward_total_mean": 0.32099583745002747, "reward_meter_mean": 0.662441611289978, "reward_meter_std": 0.3464275896549225, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9969915151596069, "reward_repeat_penalty_std": 0.0043798936530947685, "reward_near_duplicate_penalty_mean": 0.9969915151596069, "reward_near_duplicate_penalty_std": 0.0043798936530947685, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.32099583745002747, "reward_total_composite_std": 0.1858326494693756} {"timestamp_utc": "2026-04-12T14:27:50Z", "mode": "train", "global_step": 917, "epoch": 0.03683174679680283, "loss": 0.0279, "grad_norm": 15.212775230407715, "learning_rate": 7.224242424242425e-06, "num_tokens": 1868871.0, "completions/mean_length": 45.375, "completions/min_length": 42.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.26263055205345154, "rewards/meter/std": 0.2262229025363922, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9237500429153442, "rewards/judge_quality/std": 0.01060659158974886, "rewards/repeat_penalty/mean": 0.9845319986343384, "rewards/repeat_penalty/std": 0.009524662047624588, "rewards/near_duplicate_penalty/mean": 0.9845319986343384, "rewards/near_duplicate_penalty/std": 0.009524662047624588, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.241818368434906, "rewards/total_composite/std": 0.20791561901569366, "reward": 0.241818368434906, "reward_std": 0.20791560411453247, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1435861587524414, "sampling/sampling_logp_difference/max": 1.8963546752929688, "sampling/importance_sampling_ratio/min": 0.15011483430862427, "sampling/importance_sampling_ratio/mean": 0.9993740320205688, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.49711066111922264, "clip_ratio/low_mean": 0.06246612127870321, "clip_ratio/low_min": 0.06246612127870321, "clip_ratio/high_mean": 0.06104932352900505, "clip_ratio/high_max": 0.06104932352900505, "clip_ratio/region_mean": 0.12351544480770826, "reward_total_mean": 0.241818368434906, "reward_meter_mean": 0.26263055205345154, "reward_meter_std": 0.2262229025363922, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9845319986343384, "reward_repeat_penalty_std": 0.009524662047624588, "reward_near_duplicate_penalty_mean": 0.9845319986343384, "reward_near_duplicate_penalty_std": 0.009524662047624588, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9237500429153442, "reward_judge_quality_std": 0.01060659158974886, "reward_total_composite_mean": 0.241818368434906, "reward_total_composite_std": 0.20791561901569366} {"timestamp_utc": "2026-04-12T14:27:58Z", "mode": "train", "global_step": 918, "epoch": 0.036871912278587785, "loss": 0.2797, "grad_norm": 18.46232032775879, "learning_rate": 7.221212121212122e-06, "num_tokens": 1870302.0, "completions/mean_length": 30.875, "completions/min_length": 24.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.875, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.8715851902961731, "rewards/meter/std": 0.2659103274345398, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.3123185336589813, "rewards/repeat_penalty/mean": 0.7571017146110535, "rewards/repeat_penalty/std": 0.07671567052602768, "rewards/near_duplicate_penalty/mean": 0.9705473780632019, "rewards/near_duplicate_penalty/std": 0.039805445820093155, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6072956323623657, "rewards/total_composite/std": 0.4061472713947296, "reward": 0.6072956323623657, "reward_std": 0.4061472713947296, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14646393060684204, "sampling/sampling_logp_difference/max": 2.408942461013794, "sampling/importance_sampling_ratio/min": 0.08991033583879471, "sampling/importance_sampling_ratio/mean": 0.9955363273620605, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7872043140232563, "clip_ratio/low_mean": 0.029315476771444082, "clip_ratio/low_min": 0.029315476771444082, "clip_ratio/high_mean": 0.06673535006120801, "clip_ratio/high_max": 0.06673535006120801, "clip_ratio/region_mean": 0.09605082683265209, "reward_total_mean": 0.6072956323623657, "reward_meter_mean": 0.8715851902961731, "reward_meter_std": 0.2659103274345398, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7571017146110535, "reward_repeat_penalty_std": 0.07671567052602768, "reward_near_duplicate_penalty_mean": 0.9705473780632019, "reward_near_duplicate_penalty_std": 0.039805445820093155, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.3123185336589813, "reward_total_composite_mean": 0.6072956323623657, "reward_total_composite_std": 0.4061472713947296} {"timestamp_utc": "2026-04-12T14:28:06Z", "mode": "train", "global_step": 919, "epoch": 0.03691207776037274, "loss": 0.037, "grad_norm": 13.303698539733887, "learning_rate": 7.218181818181819e-06, "num_tokens": 1872083.0, "completions/mean_length": 55.625, "completions/min_length": 50.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.625, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.7657922506332397, "rewards/meter/std": 0.3170587420463562, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3414648175239563, "rewards/repeat_penalty/mean": 0.9681443572044373, "rewards/repeat_penalty/std": 0.040724486112594604, "rewards/near_duplicate_penalty/mean": 0.9778196811676025, "rewards/near_duplicate_penalty/std": 0.020623713731765747, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.4392695426940918, "rewards/total_composite/std": 0.35829058289527893, "reward": 0.4392695426940918, "reward_std": 0.35829055309295654, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12620609998703003, "sampling/sampling_logp_difference/max": 1.7419829368591309, "sampling/importance_sampling_ratio/min": 0.17517270147800446, "sampling/importance_sampling_ratio/mean": 0.9975568056106567, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.591563381254673, "clip_ratio/low_mean": 0.07790672034025192, "clip_ratio/low_min": 0.07790672034025192, "clip_ratio/high_mean": 0.04094973113387823, "clip_ratio/high_max": 0.04094973113387823, "clip_ratio/region_mean": 0.11885645147413015, "reward_total_mean": 0.4392695426940918, "reward_meter_mean": 0.7657922506332397, "reward_meter_std": 0.3170587420463562, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9681443572044373, "reward_repeat_penalty_std": 0.040724486112594604, "reward_near_duplicate_penalty_mean": 0.9778196811676025, "reward_near_duplicate_penalty_std": 0.020623713731765747, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3414648175239563, "reward_total_composite_mean": 0.4392695426940918, "reward_total_composite_std": 0.35829058289527893} {"timestamp_utc": "2026-04-12T14:28:20Z", "mode": "train", "global_step": 920, "epoch": 0.03695224324215769, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.215151515151516e-06, "num_tokens": 1873699.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.4964003264904022, "rewards/meter/std": 0.3180677592754364, "rewards/count_adherence/mean": 0.5961538553237915, "rewards/count_adherence/std": 0.11446520686149597, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.08750000596046448, "rewards/judge_quality/std": 0.051754921674728394, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.38417744636535645, "rewards/near_duplicate_penalty/std": 0.19425716996192932, "rewards/opening_diversity/mean": 0.676510214805603, "rewards/opening_diversity/std": 0.2780837416648865, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.03293844312429428, "rewards/total_composite/std": 0.03485986962914467, "reward": 0.03293844312429428, "reward_std": 0.03485986962914467, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.03293844312429428, "reward_meter_mean": 0.4964003264904022, "reward_meter_std": 0.3180677592754364, "reward_count_adherence_mean": 0.5961538553237915, "reward_count_adherence_std": 0.11446520686149597, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.38417744636535645, "reward_near_duplicate_penalty_std": 0.19425716996192932, "reward_opening_diversity_mean": 0.676510214805603, "reward_opening_diversity_std": 0.2780837416648865, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.08750000596046448, "reward_judge_quality_std": 0.051754921674728394, "reward_total_composite_mean": 0.03293844312429428, "reward_total_composite_std": 0.03485986962914467} {"timestamp_utc": "2026-04-12T14:28:33Z", "mode": "train", "global_step": 921, "epoch": 0.036992408723942646, "loss": -0.0282, "grad_norm": 5.820071697235107, "learning_rate": 7.212121212121212e-06, "num_tokens": 1875251.0, "completions/mean_length": 114.0, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.142860412597656, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.39822918176651, "rewards/meter/std": 0.30069607496261597, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9511978030204773, "rewards/lexical_plausibility/std": 0.1380334198474884, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.76244056224823, "rewards/repeat_penalty/std": 0.18652881681919098, "rewards/near_duplicate_penalty/mean": 0.9035453796386719, "rewards/near_duplicate_penalty/std": 0.06584017723798752, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8878251314163208, "rewards/distinct_2/std": 0.13968020677566528, "rewards/total_composite/mean": 0.09247905761003494, "rewards/total_composite/std": 0.11585243046283722, "reward": 0.09247905761003494, "reward_std": 0.11585242301225662, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12907761335372925, "sampling/sampling_logp_difference/max": 2.7132649421691895, "sampling/importance_sampling_ratio/min": 0.06631992757320404, "sampling/importance_sampling_ratio/mean": 1.0065613985061646, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6461570747196674, "clip_ratio/low_mean": 0.07122299261391163, "clip_ratio/low_min": 0.07122299261391163, "clip_ratio/high_mean": 0.0369627233594656, "clip_ratio/high_max": 0.0369627233594656, "clip_ratio/region_mean": 0.10818571597337723, "reward_total_mean": 0.09247905761003494, "reward_meter_mean": 0.39822918176651, "reward_meter_std": 0.30069607496261597, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9511978030204773, "reward_lexical_plausibility_std": 0.1380334198474884, "reward_repeat_penalty_mean": 0.76244056224823, "reward_repeat_penalty_std": 0.18652881681919098, "reward_near_duplicate_penalty_mean": 0.9035453796386719, "reward_near_duplicate_penalty_std": 0.06584017723798752, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8878251314163208, "reward_distinct_2_std": 0.13968020677566528, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.09247905761003494, "reward_total_composite_std": 0.11585243046283722} {"timestamp_utc": "2026-04-12T14:28:45Z", "mode": "train", "global_step": 922, "epoch": 0.0370325742057276, "loss": 0.0752, "grad_norm": 5.726091384887695, "learning_rate": 7.2090909090909104e-06, "num_tokens": 1878305.0, "completions/mean_length": 198.75, "completions/min_length": 162.0, "completions/max_length": 260.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 198.75, "completions/min_terminated_length": 162.0, "completions/max_terminated_length": 260.0, "rewards/meter/mean": 0.035874683409929276, "rewards/meter/std": 0.03196307644248009, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9983552694320679, "rewards/lexical_plausibility/std": 0.004652021918445826, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.49264419078826904, "rewards/repeat_penalty/std": 0.24473358690738678, "rewards/near_duplicate_penalty/mean": 0.8307230472564697, "rewards/near_duplicate_penalty/std": 0.10259245336055756, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5891425609588623, "rewards/distinct_2/std": 0.23500944674015045, "rewards/total_composite/mean": 0.009451591409742832, "rewards/total_composite/std": 0.011937719769775867, "reward": 0.009451591409742832, "reward_std": 0.011937718838453293, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.108192577958107, "sampling/sampling_logp_difference/max": 3.4367706775665283, "sampling/importance_sampling_ratio/min": 0.032168399542570114, "sampling/importance_sampling_ratio/mean": 1.00033700466156, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.41789066791534424, "clip_ratio/low_mean": 0.05300997104495764, "clip_ratio/low_min": 0.05300997104495764, "clip_ratio/high_mean": 0.04982141498476267, "clip_ratio/high_max": 0.04982141498476267, "clip_ratio/region_mean": 0.1028313860297203, "reward_total_mean": 0.009451591409742832, "reward_meter_mean": 0.035874683409929276, "reward_meter_std": 0.03196307644248009, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9983552694320679, "reward_lexical_plausibility_std": 0.004652021918445826, "reward_repeat_penalty_mean": 0.49264419078826904, "reward_repeat_penalty_std": 0.24473358690738678, "reward_near_duplicate_penalty_mean": 0.8307230472564697, "reward_near_duplicate_penalty_std": 0.10259245336055756, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5891425609588623, "reward_distinct_2_std": 0.23500944674015045, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.009451591409742832, "reward_total_composite_std": 0.011937719769775867} {"timestamp_utc": "2026-04-12T14:28:52Z", "mode": "train", "global_step": 923, "epoch": 0.037072739687512554, "loss": 0.0251, "grad_norm": 12.965958595275879, "learning_rate": 7.206060606060606e-06, "num_tokens": 1879740.0, "completions/mean_length": 28.375, "completions/min_length": 25.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.375, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.47742098569869995, "rewards/meter/std": 0.28046905994415283, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.9661953449249268, "rewards/repeat_penalty/std": 0.02142074704170227, "rewards/near_duplicate_penalty/mean": 0.9661953449249268, "rewards/near_duplicate_penalty/std": 0.02142074704170227, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3213234543800354, "rewards/total_composite/std": 0.25986388325691223, "reward": 0.3213234543800354, "reward_std": 0.25986388325691223, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10668561607599258, "sampling/sampling_logp_difference/max": 1.1158335208892822, "sampling/importance_sampling_ratio/min": 0.3276420831680298, "sampling/importance_sampling_ratio/mean": 0.9958668351173401, "sampling/importance_sampling_ratio/max": 1.781607985496521, "entropy": 0.5035784058272839, "clip_ratio/low_mean": 0.05851545138284564, "clip_ratio/low_min": 0.05851545138284564, "clip_ratio/high_mean": 0.03166666720062494, "clip_ratio/high_max": 0.03166666720062494, "clip_ratio/region_mean": 0.09018211858347058, "reward_total_mean": 0.3213234543800354, "reward_meter_mean": 0.47742098569869995, "reward_meter_std": 0.28046905994415283, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9661953449249268, "reward_repeat_penalty_std": 0.02142074704170227, "reward_near_duplicate_penalty_mean": 0.9661953449249268, "reward_near_duplicate_penalty_std": 0.02142074704170227, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.3213234543800354, "reward_total_composite_std": 0.25986388325691223} {"timestamp_utc": "2026-04-12T14:29:00Z", "mode": "train", "global_step": 924, "epoch": 0.03711290516929751, "loss": -0.0666, "grad_norm": 12.38703727722168, "learning_rate": 7.203030303030304e-06, "num_tokens": 1881511.0, "completions/mean_length": 55.375, "completions/min_length": 13.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.375, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.5948243141174316, "rewards/meter/std": 0.3165298402309418, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9577116966247559, "rewards/repeat_penalty/std": 0.08491834253072739, "rewards/near_duplicate_penalty/mean": 0.9889616966247559, "rewards/near_duplicate_penalty/std": 0.013677472248673439, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23747003078460693, "rewards/total_composite/std": 0.28637459874153137, "reward": 0.23747003078460693, "reward_std": 0.28637459874153137, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14392393827438354, "sampling/sampling_logp_difference/max": 2.947516918182373, "sampling/importance_sampling_ratio/min": 0.052469830960035324, "sampling/importance_sampling_ratio/mean": 0.9821318984031677, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7739315181970596, "clip_ratio/low_mean": 0.08103625569492579, "clip_ratio/low_min": 0.08103625569492579, "clip_ratio/high_mean": 0.047786458395421505, "clip_ratio/high_max": 0.047786458395421505, "clip_ratio/region_mean": 0.1288227140903473, "reward_total_mean": 0.23747003078460693, "reward_meter_mean": 0.5948243141174316, "reward_meter_std": 0.3165298402309418, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9577116966247559, "reward_repeat_penalty_std": 0.08491834253072739, "reward_near_duplicate_penalty_mean": 0.9889616966247559, "reward_near_duplicate_penalty_std": 0.013677472248673439, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.23747003078460693, "reward_total_composite_std": 0.28637459874153137} {"timestamp_utc": "2026-04-12T14:29:08Z", "mode": "train", "global_step": 925, "epoch": 0.03715307065108246, "loss": 0.0148, "grad_norm": 14.689720153808594, "learning_rate": 7.2000000000000005e-06, "num_tokens": 1883157.0, "completions/mean_length": 34.75, "completions/min_length": 29.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.75, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.6108083724975586, "rewards/meter/std": 0.3183428943157196, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.29980650544166565, "rewards/repeat_penalty/mean": 0.7649840116500854, "rewards/repeat_penalty/std": 0.1884387731552124, "rewards/near_duplicate_penalty/mean": 0.890425980091095, "rewards/near_duplicate_penalty/std": 0.06859797984361649, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9339250326156616, "rewards/distinct_2/std": 0.05497466400265694, "rewards/total_composite/mean": 0.439907044172287, "rewards/total_composite/std": 0.3373517096042633, "reward": 0.439907044172287, "reward_std": 0.3373516798019409, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11248049885034561, "sampling/sampling_logp_difference/max": 2.1725354194641113, "sampling/importance_sampling_ratio/min": 0.11388850212097168, "sampling/importance_sampling_ratio/mean": 0.9933939576148987, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.37347858399152756, "clip_ratio/low_mean": 0.035378019558265805, "clip_ratio/low_min": 0.035378019558265805, "clip_ratio/high_mean": 0.021780303446576, "clip_ratio/high_max": 0.021780303446576, "clip_ratio/region_mean": 0.057158323004841805, "reward_total_mean": 0.439907044172287, "reward_meter_mean": 0.6108083724975586, "reward_meter_std": 0.3183428943157196, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7649840116500854, "reward_repeat_penalty_std": 0.1884387731552124, "reward_near_duplicate_penalty_mean": 0.890425980091095, "reward_near_duplicate_penalty_std": 0.06859797984361649, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9339250326156616, "reward_distinct_2_std": 0.05497466400265694, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.29980650544166565, "reward_total_composite_mean": 0.439907044172287, "reward_total_composite_std": 0.3373517096042633} {"timestamp_utc": "2026-04-12T14:29:16Z", "mode": "train", "global_step": 926, "epoch": 0.037193236132867416, "loss": 0.0084, "grad_norm": 10.720853805541992, "learning_rate": 7.196969696969698e-06, "num_tokens": 1884831.0, "completions/mean_length": 51.25, "completions/min_length": 49.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.25, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7739719152450562, "rewards/meter/std": 0.208439439535141, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.7172994017601013, "rewards/repeat_penalty/std": 0.17979948222637177, "rewards/near_duplicate_penalty/mean": 0.8759824633598328, "rewards/near_duplicate_penalty/std": 0.0668049231171608, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8574627041816711, "rewards/distinct_2/std": 0.07615248113870621, "rewards/total_composite/mean": 0.35127681493759155, "rewards/total_composite/std": 0.18588364124298096, "reward": 0.35127681493759155, "reward_std": 0.18588364124298096, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0793343037366867, "sampling/sampling_logp_difference/max": 1.1771677732467651, "sampling/importance_sampling_ratio/min": 0.3081502616405487, "sampling/importance_sampling_ratio/mean": 1.0158623456954956, "sampling/importance_sampling_ratio/max": 1.9797347784042358, "entropy": 0.4230548366904259, "clip_ratio/low_mean": 0.044617616571485996, "clip_ratio/low_min": 0.044617616571485996, "clip_ratio/high_mean": 0.028976240195333958, "clip_ratio/high_max": 0.028976240195333958, "clip_ratio/region_mean": 0.07359385676681995, "reward_total_mean": 0.35127681493759155, "reward_meter_mean": 0.7739719152450562, "reward_meter_std": 0.208439439535141, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7172994017601013, "reward_repeat_penalty_std": 0.17979948222637177, "reward_near_duplicate_penalty_mean": 0.8759824633598328, "reward_near_duplicate_penalty_std": 0.0668049231171608, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8574627041816711, "reward_distinct_2_std": 0.07615248113870621, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.35127681493759155, "reward_total_composite_std": 0.18588364124298096} {"timestamp_utc": "2026-04-12T14:29:30Z", "mode": "train", "global_step": 927, "epoch": 0.03723340161465237, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.193939393939394e-06, "num_tokens": 1886495.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.4074295163154602, "rewards/meter/std": 0.39044761657714844, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.45676958560943604, "rewards/near_duplicate_penalty/std": 0.12844498455524445, "rewards/opening_diversity/mean": 0.5761560201644897, "rewards/opening_diversity/std": 0.26298144459724426, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.03147437795996666, "rewards/total_composite/std": 0.03223505616188049, "reward": 0.03147437795996666, "reward_std": 0.03223505616188049, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.03147437795996666, "reward_meter_mean": 0.4074295163154602, "reward_meter_std": 0.39044761657714844, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.45676958560943604, "reward_near_duplicate_penalty_std": 0.12844498455524445, "reward_opening_diversity_mean": 0.5761560201644897, "reward_opening_diversity_std": 0.26298144459724426, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.03147437795996666, "reward_total_composite_std": 0.03223505616188049} {"timestamp_utc": "2026-04-12T14:29:39Z", "mode": "train", "global_step": 928, "epoch": 0.037273567096437324, "loss": 0.009, "grad_norm": 7.838740348815918, "learning_rate": 7.1909090909090914e-06, "num_tokens": 1888705.0, "completions/mean_length": 102.25, "completions/min_length": 92.0, "completions/max_length": 117.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.25, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.3131006956100464, "rewards/meter/std": 0.3299437463283539, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.3542599081993103, "rewards/repeat_penalty/std": 0.2581605017185211, "rewards/near_duplicate_penalty/mean": 0.7489602565765381, "rewards/near_duplicate_penalty/std": 0.11391827464103699, "rewards/opening_diversity/mean": 0.71875, "rewards/opening_diversity/std": 0.31160587072372437, "rewards/distinct_2/mean": 0.5697768926620483, "rewards/distinct_2/std": 0.19903554022312164, "rewards/total_composite/mean": 0.05202285945415497, "rewards/total_composite/std": 0.046992819756269455, "reward": 0.05202285945415497, "reward_std": 0.046992819756269455, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09348977357149124, "sampling/sampling_logp_difference/max": 1.4959441423416138, "sampling/importance_sampling_ratio/min": 0.22403699159622192, "sampling/importance_sampling_ratio/mean": 1.0101470947265625, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5535705722868443, "clip_ratio/low_mean": 0.06675353460013866, "clip_ratio/low_min": 0.06675353460013866, "clip_ratio/high_mean": 0.030395023990422487, "clip_ratio/high_max": 0.030395023990422487, "clip_ratio/region_mean": 0.09714855859056115, "reward_total_mean": 0.05202285945415497, "reward_meter_mean": 0.3131006956100464, "reward_meter_std": 0.3299437463283539, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3542599081993103, "reward_repeat_penalty_std": 0.2581605017185211, "reward_near_duplicate_penalty_mean": 0.7489602565765381, "reward_near_duplicate_penalty_std": 0.11391827464103699, "reward_opening_diversity_mean": 0.71875, "reward_opening_diversity_std": 0.31160587072372437, "reward_distinct_2_mean": 0.5697768926620483, "reward_distinct_2_std": 0.19903554022312164, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.05202285945415497, "reward_total_composite_std": 0.046992819756269455} {"timestamp_utc": "2026-04-12T14:29:48Z", "mode": "train", "global_step": 929, "epoch": 0.03731373257822228, "loss": -0.008, "grad_norm": 7.854971408843994, "learning_rate": 7.187878787878788e-06, "num_tokens": 1891248.0, "completions/mean_length": 122.875, "completions/min_length": 110.0, "completions/max_length": 130.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 122.875, "completions/min_terminated_length": 110.0, "completions/max_terminated_length": 130.0, "rewards/meter/mean": 0.21983212232589722, "rewards/meter/std": 0.28047528862953186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.7960772514343262, "rewards/repeat_penalty/std": 0.057195764034986496, "rewards/near_duplicate_penalty/mean": 0.9249674081802368, "rewards/near_duplicate_penalty/std": 0.01814199425280094, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8601083159446716, "rewards/distinct_2/std": 0.049564529210329056, "rewards/total_composite/mean": 0.053110234439373016, "rewards/total_composite/std": 0.04758154973387718, "reward": 0.053110234439373016, "reward_std": 0.04758154973387718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1227550134062767, "sampling/sampling_logp_difference/max": 2.042339324951172, "sampling/importance_sampling_ratio/min": 0.1297248899936676, "sampling/importance_sampling_ratio/mean": 0.9976509213447571, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5581958740949631, "clip_ratio/low_mean": 0.05808962322771549, "clip_ratio/low_min": 0.05808962322771549, "clip_ratio/high_mean": 0.044660214334726334, "clip_ratio/high_max": 0.044660214334726334, "clip_ratio/region_mean": 0.10274983756244183, "reward_total_mean": 0.053110234439373016, "reward_meter_mean": 0.21983212232589722, "reward_meter_std": 0.28047528862953186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7960772514343262, "reward_repeat_penalty_std": 0.057195764034986496, "reward_near_duplicate_penalty_mean": 0.9249674081802368, "reward_near_duplicate_penalty_std": 0.01814199425280094, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8601083159446716, "reward_distinct_2_std": 0.049564529210329056, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.053110234439373016, "reward_total_composite_std": 0.04758154973387718} {"timestamp_utc": "2026-04-12T14:30:02Z", "mode": "train", "global_step": 930, "epoch": 0.03735389806000723, "loss": -0.0485, "grad_norm": 2.702893018722534, "learning_rate": 7.184848484848486e-06, "num_tokens": 1892603.0, "completions/mean_length": 154.375, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.16666793823242, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.2841529846191406, "rewards/meter/std": 0.3785208761692047, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9299710988998413, "rewards/lexical_plausibility/std": 0.13694967329502106, "rewards/judge_quality/mean": 0.5387499928474426, "rewards/judge_quality/std": 0.3721918761730194, "rewards/repeat_penalty/mean": 0.9809141159057617, "rewards/repeat_penalty/std": 0.01658383198082447, "rewards/near_duplicate_penalty/mean": 0.9809141159057617, "rewards/near_duplicate_penalty/std": 0.01658383198082447, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12557420134544373, "rewards/total_composite/std": 0.14568524062633514, "reward": 0.12557420134544373, "reward_std": 0.14568524062633514, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14664356410503387, "sampling/sampling_logp_difference/max": 1.1234159469604492, "sampling/importance_sampling_ratio/min": 0.32516714930534363, "sampling/importance_sampling_ratio/mean": 0.9998031258583069, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6556182652711868, "clip_ratio/low_mean": 0.06884021684527397, "clip_ratio/low_min": 0.06884021684527397, "clip_ratio/high_mean": 0.06287707574665546, "clip_ratio/high_max": 0.06287707574665546, "clip_ratio/region_mean": 0.13171729259192944, "reward_total_mean": 0.12557420134544373, "reward_meter_mean": 0.2841529846191406, "reward_meter_std": 0.3785208761692047, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9299710988998413, "reward_lexical_plausibility_std": 0.13694967329502106, "reward_repeat_penalty_mean": 0.9809141159057617, "reward_repeat_penalty_std": 0.01658383198082447, "reward_near_duplicate_penalty_mean": 0.9809141159057617, "reward_near_duplicate_penalty_std": 0.01658383198082447, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5387499928474426, "reward_judge_quality_std": 0.3721918761730194, "reward_total_composite_mean": 0.12557420134544373, "reward_total_composite_std": 0.14568524062633514} {"timestamp_utc": "2026-04-12T14:30:15Z", "mode": "train", "global_step": 931, "epoch": 0.037394063541792186, "loss": 0.1002, "grad_norm": 3.4817070960998535, "learning_rate": 7.181818181818182e-06, "num_tokens": 1896890.0, "completions/mean_length": 379.875, "completions/min_length": 293.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 361.0000305175781, "completions/min_terminated_length": 293.0, "completions/max_terminated_length": 406.0, "rewards/meter/mean": 0.18033872544765472, "rewards/meter/std": 0.21552088856697083, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.13197055459022522, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.1096273884177208, "rewards/repeat_penalty/std": 0.1224500760436058, "rewards/near_duplicate_penalty/mean": 0.6284300088882446, "rewards/near_duplicate_penalty/std": 0.2059706598520279, "rewards/opening_diversity/mean": 0.8528807163238525, "rewards/opening_diversity/std": 0.29160863161087036, "rewards/distinct_2/mean": 0.1629660725593567, "rewards/distinct_2/std": 0.17277877032756805, "rewards/total_composite/mean": 0.014368465170264244, "rewards/total_composite/std": 0.016890034079551697, "reward": 0.014368465170264244, "reward_std": 0.016890034079551697, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06182783842086792, "sampling/sampling_logp_difference/max": 2.167691230773926, "sampling/importance_sampling_ratio/min": 0.11444152891635895, "sampling/importance_sampling_ratio/mean": 0.9986346364021301, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.26006957329809666, "clip_ratio/low_mean": 0.0391308874823153, "clip_ratio/low_min": 0.0391308874823153, "clip_ratio/high_mean": 0.007671734783798456, "clip_ratio/high_max": 0.007671734783798456, "clip_ratio/region_mean": 0.04680262226611376, "reward_total_mean": 0.014368465170264244, "reward_meter_mean": 0.18033872544765472, "reward_meter_std": 0.21552088856697083, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.13197055459022522, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.1096273884177208, "reward_repeat_penalty_std": 0.1224500760436058, "reward_near_duplicate_penalty_mean": 0.6284300088882446, "reward_near_duplicate_penalty_std": 0.2059706598520279, "reward_opening_diversity_mean": 0.8528807163238525, "reward_opening_diversity_std": 0.29160863161087036, "reward_distinct_2_mean": 0.1629660725593567, "reward_distinct_2_std": 0.17277877032756805, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.014368465170264244, "reward_total_composite_std": 0.016890034079551697} {"timestamp_utc": "2026-04-12T14:30:24Z", "mode": "train", "global_step": 932, "epoch": 0.03743422902357714, "loss": 0.1226, "grad_norm": 9.558558464050293, "learning_rate": 7.17878787878788e-06, "num_tokens": 1899269.0, "completions/mean_length": 91.375, "completions/min_length": 24.0, "completions/max_length": 120.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.375, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 120.0, "rewards/meter/mean": 0.5181161165237427, "rewards/meter/std": 0.33923208713531494, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.29693374037742615, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.29625001549720764, "rewards/judge_quality/std": 0.26773855090141296, "rewards/repeat_penalty/mean": 0.41542351245880127, "rewards/repeat_penalty/std": 0.23470863699913025, "rewards/near_duplicate_penalty/mean": 0.7675788402557373, "rewards/near_duplicate_penalty/std": 0.12486158311367035, "rewards/opening_diversity/mean": 0.734375, "rewards/opening_diversity/std": 0.16952534019947052, "rewards/distinct_2/mean": 0.6910839080810547, "rewards/distinct_2/std": 0.23947729170322418, "rewards/total_composite/mean": 0.09226329624652863, "rewards/total_composite/std": 0.08412240445613861, "reward": 0.09226329624652863, "reward_std": 0.08412240445613861, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11543485522270203, "sampling/sampling_logp_difference/max": 3.5148420333862305, "sampling/importance_sampling_ratio/min": 0.029752502217888832, "sampling/importance_sampling_ratio/mean": 1.0075103044509888, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5495680496096611, "clip_ratio/low_mean": 0.06268906686455011, "clip_ratio/low_min": 0.06268906686455011, "clip_ratio/high_mean": 0.05669376999139786, "clip_ratio/high_max": 0.05669376999139786, "clip_ratio/region_mean": 0.11938283685594797, "reward_total_mean": 0.09226329624652863, "reward_meter_mean": 0.5181161165237427, "reward_meter_std": 0.33923208713531494, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.29693374037742615, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.41542351245880127, "reward_repeat_penalty_std": 0.23470863699913025, "reward_near_duplicate_penalty_mean": 0.7675788402557373, "reward_near_duplicate_penalty_std": 0.12486158311367035, "reward_opening_diversity_mean": 0.734375, "reward_opening_diversity_std": 0.16952534019947052, "reward_distinct_2_mean": 0.6910839080810547, "reward_distinct_2_std": 0.23947729170322418, "reward_judge_quality_mean": 0.29625001549720764, "reward_judge_quality_std": 0.26773855090141296, "reward_total_composite_mean": 0.09226329624652863, "reward_total_composite_std": 0.08412240445613861} {"timestamp_utc": "2026-04-12T14:30:38Z", "mode": "train", "global_step": 933, "epoch": 0.037474394505362094, "loss": -0.0285, "grad_norm": 1.1851887702941895, "learning_rate": 7.175757575757576e-06, "num_tokens": 1900514.0, "completions/mean_length": 391.625, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 30.5, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.12094494700431824, "rewards/meter/std": 0.14149430394172668, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.8156816363334656, "rewards/lexical_plausibility/std": 0.12250631302595139, "rewards/judge_quality/mean": 0.20875000953674316, "rewards/judge_quality/std": 0.3196622431278229, "rewards/repeat_penalty/mean": 0.9620440006256104, "rewards/repeat_penalty/std": 0.04678796976804733, "rewards/near_duplicate_penalty/mean": 0.9620440006256104, "rewards/near_duplicate_penalty/std": 0.04678796976804733, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.014858603477478027, "rewards/total_composite/std": 0.029011141508817673, "reward": 0.014858603477478027, "reward_std": 0.029011141508817673, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1228853389620781, "sampling/sampling_logp_difference/max": 0.8168175220489502, "sampling/importance_sampling_ratio/min": 0.44183555245399475, "sampling/importance_sampling_ratio/mean": 1.0373996496200562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.21579509973526, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.029364224523305893, "clip_ratio/high_max": 0.029364224523305893, "clip_ratio/region_mean": 0.029364224523305893, "reward_total_mean": 0.014858603477478027, "reward_meter_mean": 0.12094494700431824, "reward_meter_std": 0.14149430394172668, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.8156816363334656, "reward_lexical_plausibility_std": 0.12250631302595139, "reward_repeat_penalty_mean": 0.9620440006256104, "reward_repeat_penalty_std": 0.04678796976804733, "reward_near_duplicate_penalty_mean": 0.9620440006256104, "reward_near_duplicate_penalty_std": 0.04678796976804733, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.20875000953674316, "reward_judge_quality_std": 0.3196622431278229, "reward_total_composite_mean": 0.014858603477478027, "reward_total_composite_std": 0.029011141508817673} {"timestamp_utc": "2026-04-12T14:30:45Z", "mode": "train", "global_step": 934, "epoch": 0.03751455998714705, "loss": 0.0235, "grad_norm": 14.033300399780273, "learning_rate": 7.172727272727273e-06, "num_tokens": 1902114.0, "completions/mean_length": 38.0, "completions/min_length": 30.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.2824785113334656, "rewards/meter/std": 0.20607887208461761, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9649622440338135, "rewards/repeat_penalty/std": 0.06368852406740189, "rewards/near_duplicate_penalty/mean": 0.9727731943130493, "rewards/near_duplicate_penalty/std": 0.04641183093190193, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.1959935575723648, "rewards/total_composite/std": 0.20038104057312012, "reward": 0.1959935575723648, "reward_std": 0.20038104057312012, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10428716242313385, "sampling/sampling_logp_difference/max": 1.5179781913757324, "sampling/importance_sampling_ratio/min": 0.21915455162525177, "sampling/importance_sampling_ratio/mean": 1.0003457069396973, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.47260911017656326, "clip_ratio/low_mean": 0.06179779674857855, "clip_ratio/low_min": 0.06179779674857855, "clip_ratio/high_mean": 0.04129189206287265, "clip_ratio/high_max": 0.04129189206287265, "clip_ratio/region_mean": 0.1030896888114512, "reward_total_mean": 0.1959935575723648, "reward_meter_mean": 0.2824785113334656, "reward_meter_std": 0.20607887208461761, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9649622440338135, "reward_repeat_penalty_std": 0.06368852406740189, "reward_near_duplicate_penalty_mean": 0.9727731943130493, "reward_near_duplicate_penalty_std": 0.04641183093190193, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.1959935575723648, "reward_total_composite_std": 0.20038104057312012} {"timestamp_utc": "2026-04-12T14:30:58Z", "mode": "train", "global_step": 935, "epoch": 0.037554725468932, "loss": -0.0372, "grad_norm": 5.022314071655273, "learning_rate": 7.16969696969697e-06, "num_tokens": 1903510.0, "completions/mean_length": 86.5, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 25.71428680419922, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.7247063517570496, "rewards/meter/std": 0.36471936106681824, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9480119943618774, "rewards/lexical_plausibility/std": 0.07770383358001709, "rewards/judge_quality/mean": 0.42625001072883606, "rewards/judge_quality/std": 0.41025906801223755, "rewards/repeat_penalty/mean": 0.7472584247589111, "rewards/repeat_penalty/std": 0.005680246744304895, "rewards/near_duplicate_penalty/mean": 0.9963445663452148, "rewards/near_duplicate_penalty/std": 0.007573677226901054, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32386279106140137, "rewards/total_composite/std": 0.34933874011039734, "reward": 0.32386279106140137, "reward_std": 0.34933874011039734, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12835799157619476, "sampling/sampling_logp_difference/max": 1.215287446975708, "sampling/importance_sampling_ratio/min": 0.3430015742778778, "sampling/importance_sampling_ratio/mean": 1.0257527828216553, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.639490369707346, "clip_ratio/low_mean": 0.07412842195481062, "clip_ratio/low_min": 0.07412842195481062, "clip_ratio/high_mean": 0.022241379134356976, "clip_ratio/high_max": 0.022241379134356976, "clip_ratio/region_mean": 0.0963698010891676, "reward_total_mean": 0.32386279106140137, "reward_meter_mean": 0.7247063517570496, "reward_meter_std": 0.36471936106681824, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9480119943618774, "reward_lexical_plausibility_std": 0.07770383358001709, "reward_repeat_penalty_mean": 0.7472584247589111, "reward_repeat_penalty_std": 0.005680246744304895, "reward_near_duplicate_penalty_mean": 0.9963445663452148, "reward_near_duplicate_penalty_std": 0.007573677226901054, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42625001072883606, "reward_judge_quality_std": 0.41025906801223755, "reward_total_composite_mean": 0.32386279106140137, "reward_total_composite_std": 0.34933874011039734} {"timestamp_utc": "2026-04-12T14:31:11Z", "mode": "train", "global_step": 936, "epoch": 0.037594890950716955, "loss": -0.043, "grad_norm": 2.588585138320923, "learning_rate": 7.166666666666667e-06, "num_tokens": 1905273.0, "completions/mean_length": 168.375, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 53.833335876464844, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.17356033623218536, "rewards/meter/std": 0.26151424646377563, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9430640935897827, "rewards/lexical_plausibility/std": 0.10776101052761078, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213627576828, "rewards/repeat_penalty/mean": 0.9473590850830078, "rewards/repeat_penalty/std": 0.09731647372245789, "rewards/near_duplicate_penalty/mean": 0.9724011421203613, "rewards/near_duplicate_penalty/std": 0.03113653138279915, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9725275039672852, "rewards/distinct_2/std": 0.0777040421962738, "rewards/total_composite/mean": 0.05963197350502014, "rewards/total_composite/std": 0.09231703728437424, "reward": 0.05963197350502014, "reward_std": 0.09231703728437424, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11515209823846817, "sampling/sampling_logp_difference/max": 2.6831960678100586, "sampling/importance_sampling_ratio/min": 0.0683443695306778, "sampling/importance_sampling_ratio/mean": 1.0075757503509521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.514962762594223, "clip_ratio/low_mean": 0.05297540035098791, "clip_ratio/low_min": 0.05297540035098791, "clip_ratio/high_mean": 0.02350427396595478, "clip_ratio/high_max": 0.02350427396595478, "clip_ratio/region_mean": 0.07647967431694269, "reward_total_mean": 0.05963197350502014, "reward_meter_mean": 0.17356033623218536, "reward_meter_std": 0.26151424646377563, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9430640935897827, "reward_lexical_plausibility_std": 0.10776101052761078, "reward_repeat_penalty_mean": 0.9473590850830078, "reward_repeat_penalty_std": 0.09731647372245789, "reward_near_duplicate_penalty_mean": 0.9724011421203613, "reward_near_duplicate_penalty_std": 0.03113653138279915, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9725275039672852, "reward_distinct_2_std": 0.0777040421962738, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213627576828, "reward_total_composite_mean": 0.05963197350502014, "reward_total_composite_std": 0.09231703728437424} {"timestamp_utc": "2026-04-12T14:31:24Z", "mode": "train", "global_step": 937, "epoch": 0.03763505643250191, "loss": -0.0473, "grad_norm": 4.610383033752441, "learning_rate": 7.163636363636363e-06, "num_tokens": 1906784.0, "completions/mean_length": 103.875, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.57143020629883, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.7783571481704712, "rewards/meter/std": 0.2534632682800293, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9749683141708374, "rewards/lexical_plausibility/std": 0.0708003044128418, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9211511015892029, "rewards/repeat_penalty/std": 0.07987295091152191, "rewards/near_duplicate_penalty/mean": 0.9524011015892029, "rewards/near_duplicate_penalty/std": 0.044352125376462936, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19262120127677917, "rewards/total_composite/std": 0.15365070104599, "reward": 0.19262120127677917, "reward_std": 0.1536506861448288, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12564300000667572, "sampling/sampling_logp_difference/max": 1.3577938079833984, "sampling/importance_sampling_ratio/min": 0.25722765922546387, "sampling/importance_sampling_ratio/mean": 1.003007173538208, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7043140381574631, "clip_ratio/low_mean": 0.04213165584951639, "clip_ratio/low_min": 0.04213165584951639, "clip_ratio/high_mean": 0.06418352574110031, "clip_ratio/high_max": 0.06418352574110031, "clip_ratio/region_mean": 0.1063151815906167, "reward_total_mean": 0.19262120127677917, "reward_meter_mean": 0.7783571481704712, "reward_meter_std": 0.2534632682800293, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9749683141708374, "reward_lexical_plausibility_std": 0.0708003044128418, "reward_repeat_penalty_mean": 0.9211511015892029, "reward_repeat_penalty_std": 0.07987295091152191, "reward_near_duplicate_penalty_mean": 0.9524011015892029, "reward_near_duplicate_penalty_std": 0.044352125376462936, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.19262120127677917, "reward_total_composite_std": 0.15365070104599} {"timestamp_utc": "2026-04-12T14:31:39Z", "mode": "train", "global_step": 938, "epoch": 0.03767522191428686, "loss": -0.1297, "grad_norm": 5.331589698791504, "learning_rate": 7.1606060606060615e-06, "num_tokens": 1908851.0, "completions/mean_length": 154.375, "completions/min_length": 92.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 103.28572082519531, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.4976578652858734, "rewards/meter/std": 0.23789002001285553, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9672771692276001, "rewards/lexical_plausibility/std": 0.09255408495664597, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.4873230457305908, "rewards/repeat_penalty/std": 0.28735053539276123, "rewards/near_duplicate_penalty/mean": 0.8268230557441711, "rewards/near_duplicate_penalty/std": 0.10564229637384415, "rewards/opening_diversity/mean": 0.7421875, "rewards/opening_diversity/std": 0.27024605870246887, "rewards/distinct_2/mean": 0.7422059178352356, "rewards/distinct_2/std": 0.1854390949010849, "rewards/total_composite/mean": 0.13141831755638123, "rewards/total_composite/std": 0.09342443943023682, "reward": 0.13141831755638123, "reward_std": 0.09342443943023682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10175381600856781, "sampling/sampling_logp_difference/max": 2.6185126304626465, "sampling/importance_sampling_ratio/min": 0.07291123270988464, "sampling/importance_sampling_ratio/mean": 1.0056135654449463, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4526893272995949, "clip_ratio/low_mean": 0.04729529097676277, "clip_ratio/low_min": 0.04729529097676277, "clip_ratio/high_mean": 0.04152615135535598, "clip_ratio/high_max": 0.04152615135535598, "clip_ratio/region_mean": 0.08882144233211875, "reward_total_mean": 0.13141831755638123, "reward_meter_mean": 0.4976578652858734, "reward_meter_std": 0.23789002001285553, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9672771692276001, "reward_lexical_plausibility_std": 0.09255408495664597, "reward_repeat_penalty_mean": 0.4873230457305908, "reward_repeat_penalty_std": 0.28735053539276123, "reward_near_duplicate_penalty_mean": 0.8268230557441711, "reward_near_duplicate_penalty_std": 0.10564229637384415, "reward_opening_diversity_mean": 0.7421875, "reward_opening_diversity_std": 0.27024605870246887, "reward_distinct_2_mean": 0.7422059178352356, "reward_distinct_2_std": 0.1854390949010849, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.13141831755638123, "reward_total_composite_std": 0.09342443943023682} {"timestamp_utc": "2026-04-12T14:31:46Z", "mode": "train", "global_step": 939, "epoch": 0.03771538739607182, "loss": -0.0013, "grad_norm": 22.774871826171875, "learning_rate": 7.157575757575758e-06, "num_tokens": 1910220.0, "completions/mean_length": 20.125, "completions/min_length": 17.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.125, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.24795836210250854, "rewards/meter/std": 0.3311229646205902, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.7350332736968994, "rewards/repeat_penalty/std": 0.028067149221897125, "rewards/near_duplicate_penalty/mean": 0.9800443649291992, "rewards/near_duplicate_penalty/std": 0.03742285817861557, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1447468101978302, "rewards/total_composite/std": 0.24127833545207977, "reward": 0.1447468101978302, "reward_std": 0.24127835035324097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1540123075246811, "sampling/sampling_logp_difference/max": 1.2895407676696777, "sampling/importance_sampling_ratio/min": 0.2892768085002899, "sampling/importance_sampling_ratio/mean": 1.0504430532455444, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8906053602695465, "clip_ratio/low_mean": 0.06446102540940046, "clip_ratio/low_min": 0.06446102540940046, "clip_ratio/high_mean": 0.01682194648310542, "clip_ratio/high_max": 0.01682194648310542, "clip_ratio/region_mean": 0.08128297189250588, "reward_total_mean": 0.1447468101978302, "reward_meter_mean": 0.24795836210250854, "reward_meter_std": 0.3311229646205902, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7350332736968994, "reward_repeat_penalty_std": 0.028067149221897125, "reward_near_duplicate_penalty_mean": 0.9800443649291992, "reward_near_duplicate_penalty_std": 0.03742285817861557, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.1447468101978302, "reward_total_composite_std": 0.24127833545207977} {"timestamp_utc": "2026-04-12T14:32:00Z", "mode": "train", "global_step": 940, "epoch": 0.03775555287785677, "loss": -0.1101, "grad_norm": 4.2889556884765625, "learning_rate": 7.154545454545455e-06, "num_tokens": 1912190.0, "completions/mean_length": 130.25, "completions/min_length": 70.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 75.71428680419922, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.7814749479293823, "rewards/meter/std": 0.21990275382995605, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9692437052726746, "rewards/lexical_plausibility/std": 0.08699192106723785, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.3619333505630493, "rewards/repeat_penalty/std": 0.2543255090713501, "rewards/near_duplicate_penalty/mean": 0.8193493485450745, "rewards/near_duplicate_penalty/std": 0.08180122077465057, "rewards/opening_diversity/mean": 0.550000011920929, "rewards/opening_diversity/std": 0.23603872954845428, "rewards/distinct_2/mean": 0.7278532385826111, "rewards/distinct_2/std": 0.14499174058437347, "rewards/total_composite/mean": 0.22237220406532288, "rewards/total_composite/std": 0.13187643885612488, "reward": 0.22237220406532288, "reward_std": 0.13187643885612488, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09415134787559509, "sampling/sampling_logp_difference/max": 1.5611095428466797, "sampling/importance_sampling_ratio/min": 0.2099030464887619, "sampling/importance_sampling_ratio/mean": 1.004854679107666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4102122113108635, "clip_ratio/low_mean": 0.012989203911274672, "clip_ratio/low_min": 0.012989203911274672, "clip_ratio/high_mean": 0.05385058419778943, "clip_ratio/high_max": 0.05385058419778943, "clip_ratio/region_mean": 0.0668397881090641, "reward_total_mean": 0.22237220406532288, "reward_meter_mean": 0.7814749479293823, "reward_meter_std": 0.21990275382995605, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9692437052726746, "reward_lexical_plausibility_std": 0.08699192106723785, "reward_repeat_penalty_mean": 0.3619333505630493, "reward_repeat_penalty_std": 0.2543255090713501, "reward_near_duplicate_penalty_mean": 0.8193493485450745, "reward_near_duplicate_penalty_std": 0.08180122077465057, "reward_opening_diversity_mean": 0.550000011920929, "reward_opening_diversity_std": 0.23603872954845428, "reward_distinct_2_mean": 0.7278532385826111, "reward_distinct_2_std": 0.14499174058437347, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.22237220406532288, "reward_total_composite_std": 0.13187643885612488} {"timestamp_utc": "2026-04-12T14:32:09Z", "mode": "train", "global_step": 941, "epoch": 0.037795718359641725, "loss": 0.0581, "grad_norm": 11.848057746887207, "learning_rate": 7.151515151515152e-06, "num_tokens": 1913816.0, "completions/mean_length": 49.25, "completions/min_length": 38.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.25, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.13591483235359192, "rewards/meter/std": 0.20749308168888092, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.8903137445449829, "rewards/repeat_penalty/std": 0.10477173328399658, "rewards/near_duplicate_penalty/mean": 0.9326732754707336, "rewards/near_duplicate_penalty/std": 0.04961961507797241, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9526861906051636, "rewards/distinct_2/std": 0.0784371942281723, "rewards/total_composite/mean": 0.062338780611753464, "rewards/total_composite/std": 0.0909540131688118, "reward": 0.062338780611753464, "reward_std": 0.0909540131688118, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11286266893148422, "sampling/sampling_logp_difference/max": 1.3823190927505493, "sampling/importance_sampling_ratio/min": 0.25099578499794006, "sampling/importance_sampling_ratio/mean": 1.012656569480896, "sampling/importance_sampling_ratio/max": 1.821945309638977, "entropy": 0.7676081731915474, "clip_ratio/low_mean": 0.04830078175291419, "clip_ratio/low_min": 0.04830078175291419, "clip_ratio/high_mean": 0.0328914150595665, "clip_ratio/high_max": 0.0328914150595665, "clip_ratio/region_mean": 0.08119219681248069, "reward_total_mean": 0.062338780611753464, "reward_meter_mean": 0.13591483235359192, "reward_meter_std": 0.20749308168888092, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8903137445449829, "reward_repeat_penalty_std": 0.10477173328399658, "reward_near_duplicate_penalty_mean": 0.9326732754707336, "reward_near_duplicate_penalty_std": 0.04961961507797241, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9526861906051636, "reward_distinct_2_std": 0.0784371942281723, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.062338780611753464, "reward_total_composite_std": 0.0909540131688118} {"timestamp_utc": "2026-04-12T14:32:21Z", "mode": "train", "global_step": 942, "epoch": 0.03783588384142668, "loss": -0.0129, "grad_norm": 4.764551162719727, "learning_rate": 7.148484848484849e-06, "num_tokens": 1915174.0, "completions/mean_length": 87.75, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 27.142858505249023, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.38765954971313477, "rewards/meter/std": 0.4857954978942871, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9662498235702515, "rewards/lexical_plausibility/std": 0.07353381812572479, "rewards/judge_quality/mean": 0.7437500357627869, "rewards/judge_quality/std": 0.3452095687389374, "rewards/repeat_penalty/mean": 0.7201552391052246, "rewards/repeat_penalty/std": 0.04834050312638283, "rewards/near_duplicate_penalty/mean": 0.9602069854736328, "rewards/near_duplicate_penalty/std": 0.06445399671792984, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.288032203912735, "rewards/total_composite/std": 0.39269784092903137, "reward": 0.288032203912735, "reward_std": 0.392697811126709, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1669926643371582, "sampling/sampling_logp_difference/max": 1.0322027206420898, "sampling/importance_sampling_ratio/min": 0.356221467256546, "sampling/importance_sampling_ratio/mean": 1.010698676109314, "sampling/importance_sampling_ratio/max": 1.8058912754058838, "entropy": 0.9434937760233879, "clip_ratio/low_mean": 0.08472261484712362, "clip_ratio/low_min": 0.08472261484712362, "clip_ratio/high_mean": 0.0729166679084301, "clip_ratio/high_max": 0.0729166679084301, "clip_ratio/region_mean": 0.15763928275555372, "reward_total_mean": 0.288032203912735, "reward_meter_mean": 0.38765954971313477, "reward_meter_std": 0.4857954978942871, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9662498235702515, "reward_lexical_plausibility_std": 0.07353381812572479, "reward_repeat_penalty_mean": 0.7201552391052246, "reward_repeat_penalty_std": 0.04834050312638283, "reward_near_duplicate_penalty_mean": 0.9602069854736328, "reward_near_duplicate_penalty_std": 0.06445399671792984, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437500357627869, "reward_judge_quality_std": 0.3452095687389374, "reward_total_composite_mean": 0.288032203912735, "reward_total_composite_std": 0.39269784092903137} {"timestamp_utc": "2026-04-12T14:32:35Z", "mode": "train", "global_step": 943, "epoch": 0.03787604932321163, "loss": -0.0233, "grad_norm": 1.1867685317993164, "learning_rate": 7.145454545454547e-06, "num_tokens": 1916600.0, "completions/mean_length": 207.25, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 24.399999618530273, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.2950335443019867, "rewards/meter/std": 0.3719969689846039, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9414190053939819, "rewards/lexical_plausibility/std": 0.08183559030294418, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.6808945536613464, "rewards/repeat_penalty/std": 0.09268177300691605, "rewards/near_duplicate_penalty/mean": 0.9078593254089355, "rewards/near_duplicate_penalty/std": 0.12357569485902786, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.06723420321941376, "rewards/total_composite/std": 0.10936981439590454, "reward": 0.06723420321941376, "reward_std": 0.10936981439590454, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13000689446926117, "sampling/sampling_logp_difference/max": 1.37107515335083, "sampling/importance_sampling_ratio/min": 0.2538338899612427, "sampling/importance_sampling_ratio/mean": 1.0033677816390991, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.44338732957839966, "clip_ratio/low_mean": 0.016304347664117813, "clip_ratio/low_min": 0.016304347664117813, "clip_ratio/high_mean": 0.04329085489735007, "clip_ratio/high_max": 0.04329085489735007, "clip_ratio/region_mean": 0.059595202561467886, "reward_total_mean": 0.06723420321941376, "reward_meter_mean": 0.2950335443019867, "reward_meter_std": 0.3719969689846039, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9414190053939819, "reward_lexical_plausibility_std": 0.08183559030294418, "reward_repeat_penalty_mean": 0.6808945536613464, "reward_repeat_penalty_std": 0.09268177300691605, "reward_near_duplicate_penalty_mean": 0.9078593254089355, "reward_near_duplicate_penalty_std": 0.12357569485902786, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.06723420321941376, "reward_total_composite_std": 0.10936981439590454} {"timestamp_utc": "2026-04-12T14:32:44Z", "mode": "train", "global_step": 944, "epoch": 0.03791621480499659, "loss": -0.0174, "grad_norm": 11.05018138885498, "learning_rate": 7.142424242424243e-06, "num_tokens": 1918757.0, "completions/mean_length": 82.625, "completions/min_length": 70.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.625, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.2062428742647171, "rewards/meter/std": 0.23885111510753632, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.798483669757843, "rewards/repeat_penalty/std": 0.1474352329969406, "rewards/near_duplicate_penalty/mean": 0.9184349775314331, "rewards/near_duplicate_penalty/std": 0.05811554938554764, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8801622986793518, "rewards/distinct_2/std": 0.10319699347019196, "rewards/total_composite/mean": 0.05402486026287079, "rewards/total_composite/std": 0.08079516142606735, "reward": 0.05402486026287079, "reward_std": 0.08079515397548676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11469532549381256, "sampling/sampling_logp_difference/max": 1.8357130289077759, "sampling/importance_sampling_ratio/min": 0.15949973464012146, "sampling/importance_sampling_ratio/mean": 0.9925374388694763, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4836905337870121, "clip_ratio/low_mean": 0.06299840891733766, "clip_ratio/low_min": 0.06299840891733766, "clip_ratio/high_mean": 0.03383559547364712, "clip_ratio/high_max": 0.03383559547364712, "clip_ratio/region_mean": 0.09683400439098477, "reward_total_mean": 0.05402486026287079, "reward_meter_mean": 0.2062428742647171, "reward_meter_std": 0.23885111510753632, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.798483669757843, "reward_repeat_penalty_std": 0.1474352329969406, "reward_near_duplicate_penalty_mean": 0.9184349775314331, "reward_near_duplicate_penalty_std": 0.05811554938554764, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8801622986793518, "reward_distinct_2_std": 0.10319699347019196, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.05402486026287079, "reward_total_composite_std": 0.08079516142606735} {"timestamp_utc": "2026-04-12T14:32:54Z", "mode": "train", "global_step": 945, "epoch": 0.03795638028678154, "loss": 0.1285, "grad_norm": 8.566617012023926, "learning_rate": 7.1393939393939405e-06, "num_tokens": 1920796.0, "completions/mean_length": 89.875, "completions/min_length": 61.0, "completions/max_length": 114.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 89.875, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.6206226944923401, "rewards/meter/std": 0.3615337014198303, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.5913224220275879, "rewards/repeat_penalty/std": 0.2933858633041382, "rewards/near_duplicate_penalty/mean": 0.870466947555542, "rewards/near_duplicate_penalty/std": 0.09446787089109421, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.6936204433441162, "rewards/distinct_2/std": 0.21726767718791962, "rewards/total_composite/mean": 0.1903325617313385, "rewards/total_composite/std": 0.11891020834445953, "reward": 0.1903325617313385, "reward_std": 0.11891020834445953, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1071522906422615, "sampling/sampling_logp_difference/max": 1.8659844398498535, "sampling/importance_sampling_ratio/min": 0.15474380552768707, "sampling/importance_sampling_ratio/mean": 1.0033358335494995, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5461409725248814, "clip_ratio/low_mean": 0.05647054733708501, "clip_ratio/low_min": 0.05647054733708501, "clip_ratio/high_mean": 0.048155056312680244, "clip_ratio/high_max": 0.048155056312680244, "clip_ratio/region_mean": 0.10462560364976525, "reward_total_mean": 0.1903325617313385, "reward_meter_mean": 0.6206226944923401, "reward_meter_std": 0.3615337014198303, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5913224220275879, "reward_repeat_penalty_std": 0.2933858633041382, "reward_near_duplicate_penalty_mean": 0.870466947555542, "reward_near_duplicate_penalty_std": 0.09446787089109421, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.6936204433441162, "reward_distinct_2_std": 0.21726767718791962, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.1903325617313385, "reward_total_composite_std": 0.11891020834445953} {"timestamp_utc": "2026-04-12T14:33:09Z", "mode": "train", "global_step": 946, "epoch": 0.037996545768566495, "loss": -0.0815, "grad_norm": 1.8252280950546265, "learning_rate": 7.136363636363637e-06, "num_tokens": 1922538.0, "completions/mean_length": 303.75, "completions/min_length": 90.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 95.5, "completions/min_terminated_length": 90.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.19692228734493256, "rewards/meter/std": 0.29822638630867004, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.33905068039894104, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8787853717803955, "rewards/lexical_plausibility/std": 0.1394978016614914, "rewards/judge_quality/mean": 0.17499999701976776, "rewards/judge_quality/std": 0.14880476891994476, "rewards/repeat_penalty/mean": 0.8171951770782471, "rewards/repeat_penalty/std": 0.18367989361286163, "rewards/near_duplicate_penalty/mean": 0.9615234136581421, "rewards/near_duplicate_penalty/std": 0.057910364121198654, "rewards/opening_diversity/mean": 0.8984375, "rewards/opening_diversity/std": 0.12472067028284073, "rewards/distinct_2/mean": 0.9353432059288025, "rewards/distinct_2/std": 0.10432393848896027, "rewards/total_composite/mean": 0.06001988798379898, "rewards/total_composite/std": 0.10479407012462616, "reward": 0.06001988798379898, "reward_std": 0.10479407757520676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09839633852243423, "sampling/sampling_logp_difference/max": 1.7060518264770508, "sampling/importance_sampling_ratio/min": 0.1815812885761261, "sampling/importance_sampling_ratio/mean": 1.0156311988830566, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.305150855332613, "clip_ratio/low_mean": 0.026577819138765335, "clip_ratio/low_min": 0.026577819138765335, "clip_ratio/high_mean": 0.03377659525722265, "clip_ratio/high_max": 0.03377659525722265, "clip_ratio/region_mean": 0.06035441439598799, "reward_total_mean": 0.06001988798379898, "reward_meter_mean": 0.19692228734493256, "reward_meter_std": 0.29822638630867004, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.33905068039894104, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8787853717803955, "reward_lexical_plausibility_std": 0.1394978016614914, "reward_repeat_penalty_mean": 0.8171951770782471, "reward_repeat_penalty_std": 0.18367989361286163, "reward_near_duplicate_penalty_mean": 0.9615234136581421, "reward_near_duplicate_penalty_std": 0.057910364121198654, "reward_opening_diversity_mean": 0.8984375, "reward_opening_diversity_std": 0.12472067028284073, "reward_distinct_2_mean": 0.9353432059288025, "reward_distinct_2_std": 0.10432393848896027, "reward_judge_quality_mean": 0.17499999701976776, "reward_judge_quality_std": 0.14880476891994476, "reward_total_composite_mean": 0.06001988798379898, "reward_total_composite_std": 0.10479407012462616} {"timestamp_utc": "2026-04-12T14:33:23Z", "mode": "train", "global_step": 947, "epoch": 0.03803671125035145, "loss": -0.0656, "grad_norm": 1.8696402311325073, "learning_rate": 7.133333333333334e-06, "num_tokens": 1926035.0, "completions/mean_length": 356.125, "completions/min_length": 261.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 304.16668701171875, "completions/min_terminated_length": 261.0, "completions/max_terminated_length": 429.0, "rewards/meter/mean": 0.13978762924671173, "rewards/meter/std": 0.2086712121963501, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9387198686599731, "rewards/lexical_plausibility/std": 0.11450379341840744, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.12997031211853027, "rewards/repeat_penalty/std": 0.22362232208251953, "rewards/near_duplicate_penalty/mean": 0.5348261594772339, "rewards/near_duplicate_penalty/std": 0.18436315655708313, "rewards/opening_diversity/mean": 0.6198718547821045, "rewards/opening_diversity/std": 0.40011414885520935, "rewards/distinct_2/mean": 0.24475617706775665, "rewards/distinct_2/std": 0.4018949568271637, "rewards/total_composite/mean": 0.008057091385126114, "rewards/total_composite/std": 0.016946634277701378, "reward": 0.008057091385126114, "reward_std": 0.016946634277701378, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.03187386691570282, "sampling/sampling_logp_difference/max": 1.3523850440979004, "sampling/importance_sampling_ratio/min": 0.2586227059364319, "sampling/importance_sampling_ratio/mean": 1.003147006034851, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.14334738068282604, "clip_ratio/low_mean": 0.015329252695664763, "clip_ratio/low_min": 0.015329252695664763, "clip_ratio/high_mean": 0.01003355672582984, "clip_ratio/high_max": 0.01003355672582984, "clip_ratio/region_mean": 0.025362809421494603, "reward_total_mean": 0.008057091385126114, "reward_meter_mean": 0.13978762924671173, "reward_meter_std": 0.2086712121963501, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9387198686599731, "reward_lexical_plausibility_std": 0.11450379341840744, "reward_repeat_penalty_mean": 0.12997031211853027, "reward_repeat_penalty_std": 0.22362232208251953, "reward_near_duplicate_penalty_mean": 0.5348261594772339, "reward_near_duplicate_penalty_std": 0.18436315655708313, "reward_opening_diversity_mean": 0.6198718547821045, "reward_opening_diversity_std": 0.40011414885520935, "reward_distinct_2_mean": 0.24475617706775665, "reward_distinct_2_std": 0.4018949568271637, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.008057091385126114, "reward_total_composite_std": 0.016946634277701378} {"timestamp_utc": "2026-04-12T14:33:38Z", "mode": "train", "global_step": 948, "epoch": 0.0380768767321364, "loss": -0.0581, "grad_norm": 2.3616604804992676, "learning_rate": 7.130303030303031e-06, "num_tokens": 1927508.0, "completions/mean_length": 220.125, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 45.0, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.4270865023136139, "rewards/meter/std": 0.3793179988861084, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.927239179611206, "rewards/lexical_plausibility/std": 0.10967455804347992, "rewards/judge_quality/mean": 0.4112499952316284, "rewards/judge_quality/std": 0.36883747577667236, "rewards/repeat_penalty/mean": 0.8529618382453918, "rewards/repeat_penalty/std": 0.17410176992416382, "rewards/near_duplicate_penalty/mean": 0.9479835629463196, "rewards/near_duplicate_penalty/std": 0.03856028988957405, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9498425722122192, "rewards/distinct_2/std": 0.07277485728263855, "rewards/total_composite/mean": 0.23201444745063782, "rewards/total_composite/std": 0.3258877992630005, "reward": 0.23201444745063782, "reward_std": 0.3258877992630005, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11583569645881653, "sampling/sampling_logp_difference/max": 1.135561466217041, "sampling/importance_sampling_ratio/min": 0.3562825918197632, "sampling/importance_sampling_ratio/mean": 1.0094397068023682, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.45324161648750305, "clip_ratio/low_mean": 0.026259436737746, "clip_ratio/low_min": 0.026259436737746, "clip_ratio/high_mean": 0.02660778909921646, "clip_ratio/high_max": 0.02660778909921646, "clip_ratio/region_mean": 0.05286722583696246, "reward_total_mean": 0.23201444745063782, "reward_meter_mean": 0.4270865023136139, "reward_meter_std": 0.3793179988861084, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.927239179611206, "reward_lexical_plausibility_std": 0.10967455804347992, "reward_repeat_penalty_mean": 0.8529618382453918, "reward_repeat_penalty_std": 0.17410176992416382, "reward_near_duplicate_penalty_mean": 0.9479835629463196, "reward_near_duplicate_penalty_std": 0.03856028988957405, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9498425722122192, "reward_distinct_2_std": 0.07277485728263855, "reward_judge_quality_mean": 0.4112499952316284, "reward_judge_quality_std": 0.36883747577667236, "reward_total_composite_mean": 0.23201444745063782, "reward_total_composite_std": 0.3258877992630005} {"timestamp_utc": "2026-04-12T14:33:51Z", "mode": "train", "global_step": 949, "epoch": 0.03811704221392136, "loss": -0.0584, "grad_norm": 4.325341701507568, "learning_rate": 7.127272727272728e-06, "num_tokens": 1929231.0, "completions/mean_length": 108.375, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.71428680419922, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.3215366303920746, "rewards/meter/std": 0.3922673463821411, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9545540809631348, "rewards/lexical_plausibility/std": 0.12854047119617462, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.23627692461013794, "rewards/repeat_penalty/mean": 0.9176186323165894, "rewards/repeat_penalty/std": 0.0858609676361084, "rewards/near_duplicate_penalty/mean": 0.9587317109107971, "rewards/near_duplicate_penalty/std": 0.04040151461958885, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.14552947878837585, "rewards/total_composite/std": 0.17575044929981232, "reward": 0.14552947878837585, "reward_std": 0.17575044929981232, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10548245906829834, "sampling/sampling_logp_difference/max": 1.2771339416503906, "sampling/importance_sampling_ratio/min": 0.2788352966308594, "sampling/importance_sampling_ratio/mean": 1.0009716749191284, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6781614795327187, "clip_ratio/low_mean": 0.05460147466510534, "clip_ratio/low_min": 0.05460147466510534, "clip_ratio/high_mean": 0.048864406533539295, "clip_ratio/high_max": 0.048864406533539295, "clip_ratio/region_mean": 0.10346588119864464, "reward_total_mean": 0.14552947878837585, "reward_meter_mean": 0.3215366303920746, "reward_meter_std": 0.3922673463821411, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9545540809631348, "reward_lexical_plausibility_std": 0.12854047119617462, "reward_repeat_penalty_mean": 0.9176186323165894, "reward_repeat_penalty_std": 0.0858609676361084, "reward_near_duplicate_penalty_mean": 0.9587317109107971, "reward_near_duplicate_penalty_std": 0.04040151461958885, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.23627692461013794, "reward_total_composite_mean": 0.14552947878837585, "reward_total_composite_std": 0.17575044929981232} {"timestamp_utc": "2026-04-12T14:34:04Z", "mode": "train", "global_step": 950, "epoch": 0.03815720769570631, "loss": -0.0819, "grad_norm": 2.9789159297943115, "learning_rate": 7.124242424242424e-06, "num_tokens": 1930938.0, "completions/mean_length": 177.375, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 65.83333587646484, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.3404233455657959, "rewards/meter/std": 0.3930603861808777, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9488165378570557, "rewards/lexical_plausibility/std": 0.09534463286399841, "rewards/judge_quality/mean": 0.3062499761581421, "rewards/judge_quality/std": 0.18015369772911072, "rewards/repeat_penalty/mean": 0.7187220454216003, "rewards/repeat_penalty/std": 0.18840491771697998, "rewards/near_duplicate_penalty/mean": 0.921018123626709, "rewards/near_duplicate_penalty/std": 0.045870207250118256, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9106107950210571, "rewards/distinct_2/std": 0.07955474406480789, "rewards/total_composite/mean": 0.08306921273469925, "rewards/total_composite/std": 0.1214752122759819, "reward": 0.08306921273469925, "reward_std": 0.1214752048254013, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1294136494398117, "sampling/sampling_logp_difference/max": 1.809103012084961, "sampling/importance_sampling_ratio/min": 0.16380098462104797, "sampling/importance_sampling_ratio/mean": 0.987536609172821, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5565838292241096, "clip_ratio/low_mean": 0.05406598933041096, "clip_ratio/low_min": 0.05406598933041096, "clip_ratio/high_mean": 0.03218851424753666, "clip_ratio/high_max": 0.03218851424753666, "clip_ratio/region_mean": 0.08625450357794762, "reward_total_mean": 0.08306921273469925, "reward_meter_mean": 0.3404233455657959, "reward_meter_std": 0.3930603861808777, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9488165378570557, "reward_lexical_plausibility_std": 0.09534463286399841, "reward_repeat_penalty_mean": 0.7187220454216003, "reward_repeat_penalty_std": 0.18840491771697998, "reward_near_duplicate_penalty_mean": 0.921018123626709, "reward_near_duplicate_penalty_std": 0.045870207250118256, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9106107950210571, "reward_distinct_2_std": 0.07955474406480789, "reward_judge_quality_mean": 0.3062499761581421, "reward_judge_quality_std": 0.18015369772911072, "reward_total_composite_mean": 0.08306921273469925, "reward_total_composite_std": 0.1214752122759819} {"timestamp_utc": "2026-04-12T14:36:37Z", "mode": "eval", "global_step": 950, "epoch": 0.03815720769570631, "eval_loss": NaN, "eval_runtime": 152.5201, "eval_samples_per_second": 0.682, "eval_steps_per_second": 0.085, "eval_num_tokens": 1930938.0, "eval_completions/mean_length": 233.10576923076923, "eval_completions/min_length": 38.38461538461539, "eval_completions/max_length": 512.0, "eval_completions/clipped_ratio": 0.25, "eval_completions/mean_terminated_length": 143.32930931678186, "eval_completions/min_terminated_length": 38.38461538461539, "eval_completions/max_terminated_length": 307.0769230769231, "eval_rewards/meter/mean": 0.32217265035097414, "eval_rewards/meter/std": 0.2959560568516071, "eval_rewards/count_adherence/mean": 0.8043372768622178, "eval_rewards/count_adherence/std": 0.23716447674311125, "eval_rewards/arabic_clean/mean": 0.8846153846153846, "eval_rewards/arabic_clean/std": 0.27000388273826015, "eval_rewards/lexical_plausibility/mean": 0.9768673640031081, "eval_rewards/lexical_plausibility/std": 0.05574091896414757, "eval_rewards/judge_quality/mean": 0.3065384649313413, "eval_rewards/judge_quality/std": 0.2255362610404308, "eval_rewards/repeat_penalty/mean": 0.53667335326855, "eval_rewards/repeat_penalty/std": 0.4180158216219682, "eval_rewards/near_duplicate_penalty/mean": 0.8241668664492093, "eval_rewards/near_duplicate_penalty/std": 0.19946125493599817, "eval_rewards/opening_diversity/mean": 0.8744724026093116, "eval_rewards/opening_diversity/std": 0.1949955070248017, "eval_rewards/distinct_2/mean": 0.6022984385490417, "eval_rewards/distinct_2/std": 0.4252288043498993, "eval_rewards/total_composite/mean": 0.09447776905905741, "eval_rewards/total_composite/std": 0.13474725057872441, "eval_reward": 0.09447776905905741, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.03659316138006174, "eval_sampling/sampling_logp_difference/max": 0.8933232013995831, "eval_sampling/importance_sampling_ratio/min": 0.41577648428770214, "eval_sampling/importance_sampling_ratio/mean": 1.0081675694538996, "eval_sampling/importance_sampling_ratio/max": 1.4964409516407893, "eval_entropy": 0.3762010381771968, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.09447776905905741, "eval_reward_meter_mean": 0.32217265035097414, "eval_reward_meter_std": 0.2959560568516071, "eval_reward_count_adherence_mean": 0.8043372768622178, "eval_reward_count_adherence_std": 0.23716447674311125, "eval_reward_arabic_clean_mean": 0.8846153846153846, "eval_reward_arabic_clean_std": 0.27000388273826015, "eval_reward_lexical_plausibility_mean": 0.9768673640031081, "eval_reward_lexical_plausibility_std": 0.05574091896414757, "eval_reward_repeat_penalty_mean": 0.53667335326855, "eval_reward_repeat_penalty_std": 0.4180158216219682, "eval_reward_near_duplicate_penalty_mean": 0.8241668664492093, "eval_reward_near_duplicate_penalty_std": 0.19946125493599817, "eval_reward_opening_diversity_mean": 0.8744724026093116, "eval_reward_opening_diversity_std": 0.1949955070248017, "eval_reward_distinct_2_mean": 0.6022984385490417, "eval_reward_distinct_2_std": 0.4252288043498993, "eval_reward_judge_quality_mean": 0.3065384649313413, "eval_reward_judge_quality_std": 0.2255362610404308, "eval_reward_total_composite_mean": 0.09447776905905741, "eval_reward_total_composite_std": 0.13474725057872441} {"timestamp_utc": "2026-04-12T14:36:54Z", "mode": "train", "global_step": 951, "epoch": 0.038197373177491264, "loss": -0.0131, "grad_norm": 3.081400156021118, "learning_rate": 7.121212121212122e-06, "num_tokens": 1932556.0, "completions/mean_length": 159.25, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 41.66666793823242, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.26195645332336426, "rewards/meter/std": 0.2873122990131378, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9349045157432556, "rewards/lexical_plausibility/std": 0.1212630644440651, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.27105283737182617, "rewards/repeat_penalty/mean": 0.9518330097198486, "rewards/repeat_penalty/std": 0.05202093720436096, "rewards/near_duplicate_penalty/mean": 0.9617048501968384, "rewards/near_duplicate_penalty/std": 0.036329396069049835, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893953800201416, "rewards/distinct_2/std": 0.028464725241065025, "rewards/total_composite/mean": 0.11356673389673233, "rewards/total_composite/std": 0.24205803871154785, "reward": 0.11356673389673233, "reward_std": 0.24205805361270905, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12151914089918137, "sampling/sampling_logp_difference/max": 1.5041049718856812, "sampling/importance_sampling_ratio/min": 0.22221609950065613, "sampling/importance_sampling_ratio/mean": 1.0223890542984009, "sampling/importance_sampling_ratio/max": 1.8228991031646729, "entropy": 0.6305864825844765, "clip_ratio/low_mean": 0.08601269917562604, "clip_ratio/low_min": 0.08601269917562604, "clip_ratio/high_mean": 0.0243055559694767, "clip_ratio/high_max": 0.0243055559694767, "clip_ratio/region_mean": 0.11031825514510274, "reward_total_mean": 0.11356673389673233, "reward_meter_mean": 0.26195645332336426, "reward_meter_std": 0.2873122990131378, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9349045157432556, "reward_lexical_plausibility_std": 0.1212630644440651, "reward_repeat_penalty_mean": 0.9518330097198486, "reward_repeat_penalty_std": 0.05202093720436096, "reward_near_duplicate_penalty_mean": 0.9617048501968384, "reward_near_duplicate_penalty_std": 0.036329396069049835, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893953800201416, "reward_distinct_2_std": 0.028464725241065025, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.27105283737182617, "reward_total_composite_mean": 0.11356673389673233, "reward_total_composite_std": 0.24205803871154785} {"timestamp_utc": "2026-04-12T14:37:11Z", "mode": "train", "global_step": 952, "epoch": 0.03823753865927622, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.118181818181819e-06, "num_tokens": 1934284.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.033693619072437286, "rewards/meter/std": 0.041362009942531586, "rewards/count_adherence/mean": 0.8092105388641357, "rewards/count_adherence/std": 0.26827728748321533, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9755375385284424, "rewards/lexical_plausibility/std": 0.060537829995155334, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.11993913352489471, "rewards/repeat_penalty/std": 0.33923912048339844, "rewards/near_duplicate_penalty/mean": 0.6990816593170166, "rewards/near_duplicate_penalty/std": 0.12835505604743958, "rewards/opening_diversity/mean": 0.8190094232559204, "rewards/opening_diversity/std": 0.2678840160369873, "rewards/distinct_2/mean": 0.12396050244569778, "rewards/distinct_2/std": 0.3506132662296295, "rewards/total_composite/mean": 0.0028742384165525436, "rewards/total_composite/std": 0.004440636839717627, "reward": 0.0028742384165525436, "reward_std": 0.004440636839717627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.0028742384165525436, "reward_meter_mean": 0.033693619072437286, "reward_meter_std": 0.041362009942531586, "reward_count_adherence_mean": 0.8092105388641357, "reward_count_adherence_std": 0.26827728748321533, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9755375385284424, "reward_lexical_plausibility_std": 0.060537829995155334, "reward_repeat_penalty_mean": 0.11993913352489471, "reward_repeat_penalty_std": 0.33923912048339844, "reward_near_duplicate_penalty_mean": 0.6990816593170166, "reward_near_duplicate_penalty_std": 0.12835505604743958, "reward_opening_diversity_mean": 0.8190094232559204, "reward_opening_diversity_std": 0.2678840160369873, "reward_distinct_2_mean": 0.12396050244569778, "reward_distinct_2_std": 0.3506132662296295, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.0028742384165525436, "reward_total_composite_std": 0.004440636839717627} {"timestamp_utc": "2026-04-12T14:37:20Z", "mode": "train", "global_step": 953, "epoch": 0.03827770414106117, "loss": 0.0394, "grad_norm": 10.656508445739746, "learning_rate": 7.115151515151516e-06, "num_tokens": 1936177.0, "completions/mean_length": 57.625, "completions/min_length": 54.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.625, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.0764944851398468, "rewards/meter/std": 0.07158287614583969, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9644724130630493, "rewards/repeat_penalty/std": 0.04163263365626335, "rewards/near_duplicate_penalty/mean": 0.9796984195709229, "rewards/near_duplicate_penalty/std": 0.02184489369392395, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.98424232006073, "rewards/distinct_2/std": 0.029250334948301315, "rewards/total_composite/mean": 0.0417882576584816, "rewards/total_composite/std": 0.049210358411073685, "reward": 0.0417882576584816, "reward_std": 0.049210354685783386, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14806905388832092, "sampling/sampling_logp_difference/max": 2.5004420280456543, "sampling/importance_sampling_ratio/min": 0.08204872161149979, "sampling/importance_sampling_ratio/mean": 1.0075268745422363, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7753765508532524, "clip_ratio/low_mean": 0.10691748559474945, "clip_ratio/low_min": 0.10691748559474945, "clip_ratio/high_mean": 0.026136363856494427, "clip_ratio/high_max": 0.026136363856494427, "clip_ratio/region_mean": 0.13305384945124388, "reward_total_mean": 0.0417882576584816, "reward_meter_mean": 0.0764944851398468, "reward_meter_std": 0.07158287614583969, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9644724130630493, "reward_repeat_penalty_std": 0.04163263365626335, "reward_near_duplicate_penalty_mean": 0.9796984195709229, "reward_near_duplicate_penalty_std": 0.02184489369392395, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.98424232006073, "reward_distinct_2_std": 0.029250334948301315, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.0417882576584816, "reward_total_composite_std": 0.049210358411073685} {"timestamp_utc": "2026-04-12T14:37:28Z", "mode": "train", "global_step": 954, "epoch": 0.038317869622846126, "loss": 0.0514, "grad_norm": 8.578009605407715, "learning_rate": 7.1121212121212125e-06, "num_tokens": 1938150.0, "completions/mean_length": 68.625, "completions/min_length": 62.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.625, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.13190773129463196, "rewards/meter/std": 0.13010066747665405, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.65625, "rewards/judge_quality/std": 0.3692052662372589, "rewards/repeat_penalty/mean": 0.9814157485961914, "rewards/repeat_penalty/std": 0.028654662892222404, "rewards/near_duplicate_penalty/mean": 0.9889107346534729, "rewards/near_duplicate_penalty/std": 0.01105500478297472, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.11594647169113159, "rewards/total_composite/std": 0.1248660460114479, "reward": 0.11594647169113159, "reward_std": 0.1248660460114479, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1447618156671524, "sampling/sampling_logp_difference/max": 2.5152437686920166, "sampling/importance_sampling_ratio/min": 0.08084320276975632, "sampling/importance_sampling_ratio/mean": 1.0090447664260864, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.793017815798521, "clip_ratio/low_mean": 0.10794812813401222, "clip_ratio/low_min": 0.10794812813401222, "clip_ratio/high_mean": 0.0504148630425334, "clip_ratio/high_max": 0.0504148630425334, "clip_ratio/region_mean": 0.15836299117654562, "reward_total_mean": 0.11594647169113159, "reward_meter_mean": 0.13190773129463196, "reward_meter_std": 0.13010066747665405, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9814157485961914, "reward_repeat_penalty_std": 0.028654662892222404, "reward_near_duplicate_penalty_mean": 0.9889107346534729, "reward_near_duplicate_penalty_std": 0.01105500478297472, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.65625, "reward_judge_quality_std": 0.3692052662372589, "reward_total_composite_mean": 0.11594647169113159, "reward_total_composite_std": 0.1248660460114479} {"timestamp_utc": "2026-04-12T14:37:37Z", "mode": "train", "global_step": 955, "epoch": 0.03835803510463108, "loss": -0.0061, "grad_norm": 9.538155555725098, "learning_rate": 7.10909090909091e-06, "num_tokens": 1940008.0, "completions/mean_length": 72.25, "completions/min_length": 54.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.25, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.017059937119483948, "rewards/meter/std": 0.014070441015064716, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.8316975235939026, "rewards/repeat_penalty/std": 0.14587804675102234, "rewards/near_duplicate_penalty/mean": 0.9541003108024597, "rewards/near_duplicate_penalty/std": 0.04002492502331734, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8881866931915283, "rewards/distinct_2/std": 0.09018554538488388, "rewards/total_composite/mean": 0.006688079796731472, "rewards/total_composite/std": 0.005313948728144169, "reward": 0.006688079796731472, "reward_std": 0.005313948728144169, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1290311962366104, "sampling/sampling_logp_difference/max": 1.8042993545532227, "sampling/importance_sampling_ratio/min": 0.16458973288536072, "sampling/importance_sampling_ratio/mean": 1.0029854774475098, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7239727079868317, "clip_ratio/low_mean": 0.06259495671838522, "clip_ratio/low_min": 0.06259495671838522, "clip_ratio/high_mean": 0.07459933403879404, "clip_ratio/high_max": 0.07459933403879404, "clip_ratio/region_mean": 0.13719429075717926, "reward_total_mean": 0.006688079796731472, "reward_meter_mean": 0.017059937119483948, "reward_meter_std": 0.014070441015064716, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8316975235939026, "reward_repeat_penalty_std": 0.14587804675102234, "reward_near_duplicate_penalty_mean": 0.9541003108024597, "reward_near_duplicate_penalty_std": 0.04002492502331734, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8881866931915283, "reward_distinct_2_std": 0.09018554538488388, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.006688079796731472, "reward_total_composite_std": 0.005313948728144169} {"timestamp_utc": "2026-04-12T14:37:45Z", "mode": "train", "global_step": 956, "epoch": 0.038398200586416034, "loss": -0.042, "grad_norm": 11.252642631530762, "learning_rate": 7.106060606060606e-06, "num_tokens": 1941691.0, "completions/mean_length": 56.375, "completions/min_length": 47.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.375, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.4514808654785156, "rewards/meter/std": 0.3470607101917267, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3072196841239929, "rewards/repeat_penalty/mean": 0.9487200975418091, "rewards/repeat_penalty/std": 0.07420414686203003, "rewards/near_duplicate_penalty/mean": 0.973534882068634, "rewards/near_duplicate_penalty/std": 0.039218008518218994, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9732379913330078, "rewards/distinct_2/std": 0.040286533534526825, "rewards/total_composite/mean": 0.20551379024982452, "rewards/total_composite/std": 0.16865909099578857, "reward": 0.20551379024982452, "reward_std": 0.16865909099578857, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10767313838005066, "sampling/sampling_logp_difference/max": 1.2054824829101562, "sampling/importance_sampling_ratio/min": 0.2995474338531494, "sampling/importance_sampling_ratio/mean": 1.0086873769760132, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6605033278465271, "clip_ratio/low_mean": 0.058079251088202, "clip_ratio/low_min": 0.058079251088202, "clip_ratio/high_mean": 0.052469510585069656, "clip_ratio/high_max": 0.052469510585069656, "clip_ratio/region_mean": 0.11054876167327166, "reward_total_mean": 0.20551379024982452, "reward_meter_mean": 0.4514808654785156, "reward_meter_std": 0.3470607101917267, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9487200975418091, "reward_repeat_penalty_std": 0.07420414686203003, "reward_near_duplicate_penalty_mean": 0.973534882068634, "reward_near_duplicate_penalty_std": 0.039218008518218994, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9732379913330078, "reward_distinct_2_std": 0.040286533534526825, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3072196841239929, "reward_total_composite_mean": 0.20551379024982452, "reward_total_composite_std": 0.16865909099578857} {"timestamp_utc": "2026-04-12T14:38:01Z", "mode": "train", "global_step": 957, "epoch": 0.03843836606820099, "loss": -0.019, "grad_norm": 5.3322529792785645, "learning_rate": 7.103030303030304e-06, "num_tokens": 1943585.0, "completions/mean_length": 106.75, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.85714340209961, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.12140878289937973, "rewards/meter/std": 0.22122637927532196, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.976222813129425, "rewards/lexical_plausibility/std": 0.047351494431495667, "rewards/judge_quality/mean": 0.4050000309944153, "rewards/judge_quality/std": 0.33713075518608093, "rewards/repeat_penalty/mean": 0.8990166187286377, "rewards/repeat_penalty/std": 0.1547994464635849, "rewards/near_duplicate_penalty/mean": 0.9588745832443237, "rewards/near_duplicate_penalty/std": 0.06519302725791931, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9624639749526978, "rewards/distinct_2/std": 0.07646677643060684, "rewards/total_composite/mean": 0.04643910378217697, "rewards/total_composite/std": 0.07654384523630142, "reward": 0.04643910378217697, "reward_std": 0.07654384523630142, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12295597046613693, "sampling/sampling_logp_difference/max": 1.3022866249084473, "sampling/importance_sampling_ratio/min": 0.3034486174583435, "sampling/importance_sampling_ratio/mean": 1.009828805923462, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6286008805036545, "clip_ratio/low_mean": 0.07907897792756557, "clip_ratio/low_min": 0.07907897792756557, "clip_ratio/high_mean": 0.0076530613005161285, "clip_ratio/high_max": 0.0076530613005161285, "clip_ratio/region_mean": 0.0867320392280817, "reward_total_mean": 0.04643910378217697, "reward_meter_mean": 0.12140878289937973, "reward_meter_std": 0.22122637927532196, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.976222813129425, "reward_lexical_plausibility_std": 0.047351494431495667, "reward_repeat_penalty_mean": 0.8990166187286377, "reward_repeat_penalty_std": 0.1547994464635849, "reward_near_duplicate_penalty_mean": 0.9588745832443237, "reward_near_duplicate_penalty_std": 0.06519302725791931, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9624639749526978, "reward_distinct_2_std": 0.07646677643060684, "reward_judge_quality_mean": 0.4050000309944153, "reward_judge_quality_std": 0.33713075518608093, "reward_total_composite_mean": 0.04643910378217697, "reward_total_composite_std": 0.07654384523630142} {"timestamp_utc": "2026-04-12T14:38:13Z", "mode": "train", "global_step": 958, "epoch": 0.03847853154998594, "loss": -0.0184, "grad_norm": 3.158085346221924, "learning_rate": 7.100000000000001e-06, "num_tokens": 1944944.0, "completions/mean_length": 147.875, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 26.5, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.012082438915967941, "rewards/meter/std": 0.01850433647632599, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9354345798492432, "rewards/lexical_plausibility/std": 0.12001435458660126, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.41427215933799744, "rewards/repeat_penalty/mean": 0.8417658805847168, "rewards/repeat_penalty/std": 0.1267436444759369, "rewards/near_duplicate_penalty/mean": 0.9980158805847168, "rewards/near_duplicate_penalty/std": 0.00561195844784379, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0044240341521799564, "rewards/total_composite/std": 0.0059194122441112995, "reward": 0.0044240341521799564, "reward_std": 0.005919411778450012, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14891193807125092, "sampling/sampling_logp_difference/max": 1.3504328727722168, "sampling/importance_sampling_ratio/min": 0.25912806391716003, "sampling/importance_sampling_ratio/mean": 1.0550377368927002, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9070471301674843, "clip_ratio/low_mean": 0.045018117409199476, "clip_ratio/low_min": 0.045018117409199476, "clip_ratio/high_mean": 0.036203380674123764, "clip_ratio/high_max": 0.036203380674123764, "clip_ratio/region_mean": 0.08122149808332324, "reward_total_mean": 0.0044240341521799564, "reward_meter_mean": 0.012082438915967941, "reward_meter_std": 0.01850433647632599, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9354345798492432, "reward_lexical_plausibility_std": 0.12001435458660126, "reward_repeat_penalty_mean": 0.8417658805847168, "reward_repeat_penalty_std": 0.1267436444759369, "reward_near_duplicate_penalty_mean": 0.9980158805847168, "reward_near_duplicate_penalty_std": 0.00561195844784379, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.41427215933799744, "reward_total_composite_mean": 0.0044240341521799564, "reward_total_composite_std": 0.0059194122441112995} {"timestamp_utc": "2026-04-12T14:38:25Z", "mode": "train", "global_step": 959, "epoch": 0.038518697031770896, "loss": 0.0287, "grad_norm": 3.0545456409454346, "learning_rate": 7.096969696969698e-06, "num_tokens": 1948817.0, "completions/mean_length": 261.125, "completions/min_length": 223.0, "completions/max_length": 331.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 261.125, "completions/min_terminated_length": 223.0, "completions/max_terminated_length": 331.0, "rewards/meter/mean": 0.6300451159477234, "rewards/meter/std": 0.27191361784935, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.07159321010112762, "rewards/repeat_penalty/std": 0.17123988270759583, "rewards/near_duplicate_penalty/mean": 0.5685834884643555, "rewards/near_duplicate_penalty/std": 0.2125176340341568, "rewards/opening_diversity/mean": 0.6187499761581421, "rewards/opening_diversity/std": 0.3405396640300751, "rewards/distinct_2/mean": 0.09342575818300247, "rewards/distinct_2/std": 0.2187979817390442, "rewards/total_composite/mean": 0.08568412065505981, "rewards/total_composite/std": 0.03065934032201767, "reward": 0.08568412065505981, "reward_std": 0.03065933845937252, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04350416362285614, "sampling/sampling_logp_difference/max": 1.3846819400787354, "sampling/importance_sampling_ratio/min": 0.28611454367637634, "sampling/importance_sampling_ratio/mean": 1.007127285003662, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.23359408043324947, "clip_ratio/low_mean": 0.015763788716867566, "clip_ratio/low_min": 0.015763788716867566, "clip_ratio/high_mean": 0.02359083783812821, "clip_ratio/high_max": 0.02359083783812821, "clip_ratio/region_mean": 0.039354626554995775, "reward_total_mean": 0.08568412065505981, "reward_meter_mean": 0.6300451159477234, "reward_meter_std": 0.27191361784935, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.07159321010112762, "reward_repeat_penalty_std": 0.17123988270759583, "reward_near_duplicate_penalty_mean": 0.5685834884643555, "reward_near_duplicate_penalty_std": 0.2125176340341568, "reward_opening_diversity_mean": 0.6187499761581421, "reward_opening_diversity_std": 0.3405396640300751, "reward_distinct_2_mean": 0.09342575818300247, "reward_distinct_2_std": 0.2187979817390442, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.08568412065505981, "reward_total_composite_std": 0.03065934032201767} {"timestamp_utc": "2026-04-12T14:38:35Z", "mode": "train", "global_step": 960, "epoch": 0.03855886251355585, "loss": -0.0094, "grad_norm": 9.392050743103027, "learning_rate": 7.093939393939394e-06, "num_tokens": 1951157.0, "completions/mean_length": 110.5, "completions/min_length": 86.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 110.5, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.11665292084217072, "rewards/meter/std": 0.12713173031806946, "rewards/count_adherence/mean": 0.9249999523162842, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.8226999640464783, "rewards/repeat_penalty/std": 0.0968579426407814, "rewards/near_duplicate_penalty/mean": 0.9547067880630493, "rewards/near_duplicate_penalty/std": 0.027048135176301003, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8600120544433594, "rewards/distinct_2/std": 0.0804043784737587, "rewards/total_composite/mean": 0.03970111533999443, "rewards/total_composite/std": 0.04452955722808838, "reward": 0.03970111533999443, "reward_std": 0.04452955722808838, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13223081827163696, "sampling/sampling_logp_difference/max": 2.8338468074798584, "sampling/importance_sampling_ratio/min": 0.05878628045320511, "sampling/importance_sampling_ratio/mean": 1.0135679244995117, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6751179546117783, "clip_ratio/low_mean": 0.1079489616677165, "clip_ratio/low_min": 0.1079489616677165, "clip_ratio/high_mean": 0.02451846096664667, "clip_ratio/high_max": 0.02451846096664667, "clip_ratio/region_mean": 0.13246742263436317, "reward_total_mean": 0.03970111533999443, "reward_meter_mean": 0.11665292084217072, "reward_meter_std": 0.12713173031806946, "reward_count_adherence_mean": 0.9249999523162842, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8226999640464783, "reward_repeat_penalty_std": 0.0968579426407814, "reward_near_duplicate_penalty_mean": 0.9547067880630493, "reward_near_duplicate_penalty_std": 0.027048135176301003, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8600120544433594, "reward_distinct_2_std": 0.0804043784737587, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.03970111533999443, "reward_total_composite_std": 0.04452955722808838} {"timestamp_utc": "2026-04-12T14:38:50Z", "mode": "train", "global_step": 961, "epoch": 0.038599027995340804, "loss": -0.0346, "grad_norm": 1.7038575410842896, "learning_rate": 7.0909090909090916e-06, "num_tokens": 1952589.0, "completions/mean_length": 277.0, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.19607043266296387, "rewards/meter/std": 0.27791333198547363, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.8551688194274902, "rewards/lexical_plausibility/std": 0.16290898621082306, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.2295181304216385, "rewards/repeat_penalty/mean": 0.989749550819397, "rewards/repeat_penalty/std": 0.010598878376185894, "rewards/near_duplicate_penalty/mean": 0.9902413487434387, "rewards/near_duplicate_penalty/std": 0.011016878299415112, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9995081424713135, "rewards/distinct_2/std": 0.0013911199057474732, "rewards/total_composite/mean": 0.06815202534198761, "rewards/total_composite/std": 0.1331692785024643, "reward": 0.06815202534198761, "reward_std": 0.1331692934036255, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12479446083307266, "sampling/sampling_logp_difference/max": 1.8015488386154175, "sampling/importance_sampling_ratio/min": 0.16504307091236115, "sampling/importance_sampling_ratio/mean": 0.995728075504303, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2866937965154648, "clip_ratio/low_mean": 0.03645499050617218, "clip_ratio/low_min": 0.03645499050617218, "clip_ratio/high_mean": 0.012195121496915817, "clip_ratio/high_max": 0.012195121496915817, "clip_ratio/region_mean": 0.048650112003088, "reward_total_mean": 0.06815202534198761, "reward_meter_mean": 0.19607043266296387, "reward_meter_std": 0.27791333198547363, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.8551688194274902, "reward_lexical_plausibility_std": 0.16290898621082306, "reward_repeat_penalty_mean": 0.989749550819397, "reward_repeat_penalty_std": 0.010598878376185894, "reward_near_duplicate_penalty_mean": 0.9902413487434387, "reward_near_duplicate_penalty_std": 0.011016878299415112, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9995081424713135, "reward_distinct_2_std": 0.0013911199057474732, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.2295181304216385, "reward_total_composite_mean": 0.06815202534198761, "reward_total_composite_std": 0.1331692785024643} {"timestamp_utc": "2026-04-12T14:38:58Z", "mode": "train", "global_step": 962, "epoch": 0.03863919347712576, "loss": 0.0015, "grad_norm": 14.421672821044922, "learning_rate": 7.087878787878788e-06, "num_tokens": 1954227.0, "completions/mean_length": 38.75, "completions/min_length": 37.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.75, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.31433728337287903, "rewards/meter/std": 0.3194902837276459, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.9965499639511108, "rewards/repeat_penalty/std": 0.009758218191564083, "rewards/near_duplicate_penalty/mean": 0.9965499639511108, "rewards/near_duplicate_penalty/std": 0.009758218191564083, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2631286382675171, "rewards/total_composite/std": 0.2899884879589081, "reward": 0.2631286382675171, "reward_std": 0.2899884879589081, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1244831308722496, "sampling/sampling_logp_difference/max": 2.097195625305176, "sampling/importance_sampling_ratio/min": 0.1228003203868866, "sampling/importance_sampling_ratio/mean": 1.0032366514205933, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5374925546348095, "clip_ratio/low_mean": 0.058975385734811425, "clip_ratio/low_min": 0.058975385734811425, "clip_ratio/high_mean": 0.035040403716266155, "clip_ratio/high_max": 0.035040403716266155, "clip_ratio/region_mean": 0.09401578945107758, "reward_total_mean": 0.2631286382675171, "reward_meter_mean": 0.31433728337287903, "reward_meter_std": 0.3194902837276459, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9965499639511108, "reward_repeat_penalty_std": 0.009758218191564083, "reward_near_duplicate_penalty_mean": 0.9965499639511108, "reward_near_duplicate_penalty_std": 0.009758218191564083, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.2631286382675171, "reward_total_composite_std": 0.2899884879589081} {"timestamp_utc": "2026-04-12T14:39:14Z", "mode": "train", "global_step": 963, "epoch": 0.03867935895891071, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 7.084848484848485e-06, "num_tokens": 1955987.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.5691717863082886, "rewards/meter/std": 0.3553476929664612, "rewards/count_adherence/mean": 0.680555522441864, "rewards/count_adherence/std": 0.07120777666568756, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.5089887380599976, "rewards/near_duplicate_penalty/std": 0.16914601624011993, "rewards/opening_diversity/mean": 0.48341435194015503, "rewards/opening_diversity/std": 0.33160334825515747, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.05718400701880455, "rewards/total_composite/std": 0.03486267477273941, "reward": 0.05718400701880455, "reward_std": 0.03486267104744911, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.05718400701880455, "reward_meter_mean": 0.5691717863082886, "reward_meter_std": 0.3553476929664612, "reward_count_adherence_mean": 0.680555522441864, "reward_count_adherence_std": 0.07120777666568756, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.5089887380599976, "reward_near_duplicate_penalty_std": 0.16914601624011993, "reward_opening_diversity_mean": 0.48341435194015503, "reward_opening_diversity_std": 0.33160334825515747, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.05718400701880455, "reward_total_composite_std": 0.03486267477273941} {"timestamp_utc": "2026-04-12T14:39:27Z", "mode": "train", "global_step": 964, "epoch": 0.038719524440695666, "loss": -0.1012, "grad_norm": 4.135992527008057, "learning_rate": 7.081818181818182e-06, "num_tokens": 1958828.0, "completions/mean_length": 224.125, "completions/min_length": 156.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 183.00001525878906, "completions/min_terminated_length": 156.0, "completions/max_terminated_length": 208.0, "rewards/meter/mean": 0.17350737750530243, "rewards/meter/std": 0.2247006595134735, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.14787118136882782, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9627944827079773, "rewards/lexical_plausibility/std": 0.1052330806851387, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.29925739765167236, "rewards/repeat_penalty/std": 0.3122396171092987, "rewards/near_duplicate_penalty/mean": 0.794903039932251, "rewards/near_duplicate_penalty/std": 0.11381615698337555, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.3779512643814087, "rewards/distinct_2/std": 0.3361009657382965, "rewards/total_composite/mean": 0.023813355714082718, "rewards/total_composite/std": 0.029519781470298767, "reward": 0.023813355714082718, "reward_std": 0.029519781470298767, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07010715454816818, "sampling/sampling_logp_difference/max": 1.66231107711792, "sampling/importance_sampling_ratio/min": 0.18970005214214325, "sampling/importance_sampling_ratio/mean": 1.005490779876709, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.323619969189167, "clip_ratio/low_mean": 0.0417193821631372, "clip_ratio/low_min": 0.0417193821631372, "clip_ratio/high_mean": 0.019327538553625345, "clip_ratio/high_max": 0.019327538553625345, "clip_ratio/region_mean": 0.06104692071676254, "reward_total_mean": 0.023813355714082718, "reward_meter_mean": 0.17350737750530243, "reward_meter_std": 0.2247006595134735, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.14787118136882782, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9627944827079773, "reward_lexical_plausibility_std": 0.1052330806851387, "reward_repeat_penalty_mean": 0.29925739765167236, "reward_repeat_penalty_std": 0.3122396171092987, "reward_near_duplicate_penalty_mean": 0.794903039932251, "reward_near_duplicate_penalty_std": 0.11381615698337555, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.3779512643814087, "reward_distinct_2_std": 0.3361009657382965, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.023813355714082718, "reward_total_composite_std": 0.029519781470298767} {"timestamp_utc": "2026-04-12T14:39:41Z", "mode": "train", "global_step": 965, "epoch": 0.03875968992248062, "loss": -0.0575, "grad_norm": 5.50330114364624, "learning_rate": 7.07878787878788e-06, "num_tokens": 1960719.0, "completions/mean_length": 109.375, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.85714340209961, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.1132308766245842, "rewards/meter/std": 0.16220051050186157, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9751843810081482, "rewards/lexical_plausibility/std": 0.07018919289112091, "rewards/judge_quality/mean": 0.4024999737739563, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9917764067649841, "rewards/repeat_penalty/std": 0.008495367132127285, "rewards/near_duplicate_penalty/mean": 0.9917764067649841, "rewards/near_duplicate_penalty/std": 0.008495367132127285, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.035123150795698166, "rewards/total_composite/std": 0.058510810136795044, "reward": 0.035123150795698166, "reward_std": 0.05851081386208534, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11546876281499863, "sampling/sampling_logp_difference/max": 1.2601149082183838, "sampling/importance_sampling_ratio/min": 0.2836214303970337, "sampling/importance_sampling_ratio/mean": 1.0052849054336548, "sampling/importance_sampling_ratio/max": 1.872101902961731, "entropy": 0.5949411317706108, "clip_ratio/low_mean": 0.03809253824874759, "clip_ratio/low_min": 0.03809253824874759, "clip_ratio/high_mean": 0.03663793113082647, "clip_ratio/high_max": 0.03663793113082647, "clip_ratio/region_mean": 0.07473046937957406, "reward_total_mean": 0.035123150795698166, "reward_meter_mean": 0.1132308766245842, "reward_meter_std": 0.16220051050186157, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9751843810081482, "reward_lexical_plausibility_std": 0.07018919289112091, "reward_repeat_penalty_mean": 0.9917764067649841, "reward_repeat_penalty_std": 0.008495367132127285, "reward_near_duplicate_penalty_mean": 0.9917764067649841, "reward_near_duplicate_penalty_std": 0.008495367132127285, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4024999737739563, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.035123150795698166, "reward_total_composite_std": 0.058510810136795044} {"timestamp_utc": "2026-04-12T14:39:54Z", "mode": "train", "global_step": 966, "epoch": 0.038799855404265574, "loss": -0.0374, "grad_norm": 5.198068141937256, "learning_rate": 7.075757575757576e-06, "num_tokens": 1962238.0, "completions/mean_length": 92.875, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.696131706237793, "rewards/meter/std": 0.3923903703689575, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9717143774032593, "rewards/lexical_plausibility/std": 0.08000387251377106, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.27105286717414856, "rewards/repeat_penalty/mean": 0.7120926380157471, "rewards/repeat_penalty/std": 0.3322259783744812, "rewards/near_duplicate_penalty/mean": 0.9344812631607056, "rewards/near_duplicate_penalty/std": 0.10806850343942642, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.2734534442424774, "rewards/distinct_2/mean": 0.9171851873397827, "rewards/distinct_2/std": 0.1039157435297966, "rewards/total_composite/mean": 0.2924169600009918, "rewards/total_composite/std": 0.2874559164047241, "reward": 0.2924169600009918, "reward_std": 0.2874559164047241, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13471461832523346, "sampling/sampling_logp_difference/max": 1.5890746116638184, "sampling/importance_sampling_ratio/min": 0.2041144073009491, "sampling/importance_sampling_ratio/mean": 1.0088549852371216, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5492743998765945, "clip_ratio/low_mean": 0.06577036995440722, "clip_ratio/low_min": 0.06577036995440722, "clip_ratio/high_mean": 0.0630174521356821, "clip_ratio/high_max": 0.0630174521356821, "clip_ratio/region_mean": 0.12878782209008932, "reward_total_mean": 0.2924169600009918, "reward_meter_mean": 0.696131706237793, "reward_meter_std": 0.3923903703689575, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9717143774032593, "reward_lexical_plausibility_std": 0.08000387251377106, "reward_repeat_penalty_mean": 0.7120926380157471, "reward_repeat_penalty_std": 0.3322259783744812, "reward_near_duplicate_penalty_mean": 0.9344812631607056, "reward_near_duplicate_penalty_std": 0.10806850343942642, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.2734534442424774, "reward_distinct_2_mean": 0.9171851873397827, "reward_distinct_2_std": 0.1039157435297966, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.27105286717414856, "reward_total_composite_mean": 0.2924169600009918, "reward_total_composite_std": 0.2874559164047241} {"timestamp_utc": "2026-04-12T14:40:04Z", "mode": "train", "global_step": 967, "epoch": 0.03884002088605053, "loss": 0.0089, "grad_norm": 6.549985885620117, "learning_rate": 7.072727272727273e-06, "num_tokens": 1964736.0, "completions/mean_length": 129.25, "completions/min_length": 118.0, "completions/max_length": 139.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.25, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 139.0, "rewards/meter/mean": 0.968479573726654, "rewards/meter/std": 0.03996254876255989, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.044766947627067566, "rewards/repeat_penalty/std": 0.02587527595460415, "rewards/near_duplicate_penalty/mean": 0.5779581665992737, "rewards/near_duplicate_penalty/std": 0.0901092141866684, "rewards/opening_diversity/mean": 0.26250001788139343, "rewards/opening_diversity/std": 0.06943651288747787, "rewards/distinct_2/mean": 0.2992805242538452, "rewards/distinct_2/std": 0.11232910305261612, "rewards/total_composite/mean": 0.33896785974502563, "rewards/total_composite/std": 0.013986884616315365, "reward": 0.33896785974502563, "reward_std": 0.013986876234412193, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0556277297437191, "sampling/sampling_logp_difference/max": 2.128795623779297, "sampling/importance_sampling_ratio/min": 0.11898049712181091, "sampling/importance_sampling_ratio/mean": 1.0075849294662476, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.32943726517260075, "clip_ratio/low_mean": 0.012544722761958838, "clip_ratio/low_min": 0.012544722761958838, "clip_ratio/high_mean": 0.03405781940091401, "clip_ratio/high_max": 0.03405781940091401, "clip_ratio/region_mean": 0.04660254216287285, "reward_total_mean": 0.33896785974502563, "reward_meter_mean": 0.968479573726654, "reward_meter_std": 0.03996254876255989, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.044766947627067566, "reward_repeat_penalty_std": 0.02587527595460415, "reward_near_duplicate_penalty_mean": 0.5779581665992737, "reward_near_duplicate_penalty_std": 0.0901092141866684, "reward_opening_diversity_mean": 0.26250001788139343, "reward_opening_diversity_std": 0.06943651288747787, "reward_distinct_2_mean": 0.2992805242538452, "reward_distinct_2_std": 0.11232910305261612, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.33896785974502563, "reward_total_composite_std": 0.013986884616315365} {"timestamp_utc": "2026-04-12T14:40:18Z", "mode": "train", "global_step": 968, "epoch": 0.03888018636783548, "loss": -0.0399, "grad_norm": 2.4287562370300293, "learning_rate": 7.06969696969697e-06, "num_tokens": 1966176.0, "completions/mean_length": 217.0, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 40.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.12095977365970612, "rewards/meter/std": 0.17009131610393524, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9163911938667297, "rewards/lexical_plausibility/std": 0.12047196924686432, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.19955307245254517, "rewards/repeat_penalty/mean": 0.9134237766265869, "rewards/repeat_penalty/std": 0.03889590501785278, "rewards/near_duplicate_penalty/mean": 0.9542394280433655, "rewards/near_duplicate_penalty/std": 0.04148237407207489, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9579815864562988, "rewards/distinct_2/std": 0.03885412588715553, "rewards/total_composite/mean": 0.05122220888733864, "rewards/total_composite/std": 0.07818522304296494, "reward": 0.05122220888733864, "reward_std": 0.07818521559238434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11332090198993683, "sampling/sampling_logp_difference/max": 1.26051664352417, "sampling/importance_sampling_ratio/min": 0.28350749611854553, "sampling/importance_sampling_ratio/mean": 0.9961549043655396, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3598831035196781, "clip_ratio/low_mean": 0.03147659823298454, "clip_ratio/low_min": 0.03147659823298454, "clip_ratio/high_mean": 0.039835166186094284, "clip_ratio/high_max": 0.039835166186094284, "clip_ratio/region_mean": 0.07131176441907883, "reward_total_mean": 0.05122220888733864, "reward_meter_mean": 0.12095977365970612, "reward_meter_std": 0.17009131610393524, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9163911938667297, "reward_lexical_plausibility_std": 0.12047196924686432, "reward_repeat_penalty_mean": 0.9134237766265869, "reward_repeat_penalty_std": 0.03889590501785278, "reward_near_duplicate_penalty_mean": 0.9542394280433655, "reward_near_duplicate_penalty_std": 0.04148237407207489, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9579815864562988, "reward_distinct_2_std": 0.03885412588715553, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.19955307245254517, "reward_total_composite_mean": 0.05122220888733864, "reward_total_composite_std": 0.07818522304296494} {"timestamp_utc": "2026-04-12T14:40:27Z", "mode": "train", "global_step": 969, "epoch": 0.038920351849620435, "loss": 0.0543, "grad_norm": 10.847005844116211, "learning_rate": 7.066666666666667e-06, "num_tokens": 1968034.0, "completions/mean_length": 69.25, "completions/min_length": 60.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.25, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.08024676144123077, "rewards/meter/std": 0.08288618922233582, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.8615816831588745, "rewards/repeat_penalty/std": 0.09671135246753693, "rewards/near_duplicate_penalty/mean": 0.9537315368652344, "rewards/near_duplicate_penalty/std": 0.022020557895302773, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9020715951919556, "rewards/distinct_2/std": 0.08497128635644913, "rewards/total_composite/mean": 0.03415246680378914, "rewards/total_composite/std": 0.037199120968580246, "reward": 0.03415246680378914, "reward_std": 0.037199124693870544, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1389940232038498, "sampling/sampling_logp_difference/max": 1.6286948919296265, "sampling/importance_sampling_ratio/min": 0.19618543982505798, "sampling/importance_sampling_ratio/mean": 1.0234410762786865, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6581175997853279, "clip_ratio/low_mean": 0.09743837546557188, "clip_ratio/low_min": 0.09743837546557188, "clip_ratio/high_mean": 0.03078396897763014, "clip_ratio/high_max": 0.03078396897763014, "clip_ratio/region_mean": 0.12822234444320202, "reward_total_mean": 0.03415246680378914, "reward_meter_mean": 0.08024676144123077, "reward_meter_std": 0.08288618922233582, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8615816831588745, "reward_repeat_penalty_std": 0.09671135246753693, "reward_near_duplicate_penalty_mean": 0.9537315368652344, "reward_near_duplicate_penalty_std": 0.022020557895302773, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9020715951919556, "reward_distinct_2_std": 0.08497128635644913, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.03415246680378914, "reward_total_composite_std": 0.037199120968580246} {"timestamp_utc": "2026-04-12T14:40:35Z", "mode": "train", "global_step": 970, "epoch": 0.03896051733140539, "loss": 0.0095, "grad_norm": 11.570093154907227, "learning_rate": 7.063636363636365e-06, "num_tokens": 1969902.0, "completions/mean_length": 57.5, "completions/min_length": 55.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.5, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.690869927406311, "rewards/meter/std": 0.4130357801914215, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9886363744735718, "rewards/lexical_plausibility/std": 0.03214120864868164, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9281680583953857, "rewards/repeat_penalty/std": 0.08725522458553314, "rewards/near_duplicate_penalty/mean": 0.9678975939750671, "rewards/near_duplicate_penalty/std": 0.033893290907144547, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.957433819770813, "rewards/distinct_2/std": 0.06260645389556885, "rewards/total_composite/mean": 0.30004560947418213, "rewards/total_composite/std": 0.18818852305412292, "reward": 0.30004560947418213, "reward_std": 0.18818852305412292, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10780466347932816, "sampling/sampling_logp_difference/max": 1.8387866020202637, "sampling/importance_sampling_ratio/min": 0.15901026129722595, "sampling/importance_sampling_ratio/mean": 0.9995007514953613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5267671011388302, "clip_ratio/low_mean": 0.029062713496387005, "clip_ratio/low_min": 0.029062713496387005, "clip_ratio/high_mean": 0.05143678281456232, "clip_ratio/high_max": 0.05143678281456232, "clip_ratio/region_mean": 0.08049949631094933, "reward_total_mean": 0.30004560947418213, "reward_meter_mean": 0.690869927406311, "reward_meter_std": 0.4130357801914215, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9886363744735718, "reward_lexical_plausibility_std": 0.03214120864868164, "reward_repeat_penalty_mean": 0.9281680583953857, "reward_repeat_penalty_std": 0.08725522458553314, "reward_near_duplicate_penalty_mean": 0.9678975939750671, "reward_near_duplicate_penalty_std": 0.033893290907144547, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.957433819770813, "reward_distinct_2_std": 0.06260645389556885, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.30004560947418213, "reward_total_composite_std": 0.18818852305412292} {"timestamp_utc": "2026-04-12T14:40:45Z", "mode": "train", "global_step": 971, "epoch": 0.03900068281319034, "loss": 0.0161, "grad_norm": 5.489332675933838, "learning_rate": 7.060606060606061e-06, "num_tokens": 1972720.0, "completions/mean_length": 157.25, "completions/min_length": 114.0, "completions/max_length": 172.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 157.25, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 172.0, "rewards/meter/mean": 0.35954898595809937, "rewards/meter/std": 0.26351335644721985, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9975490570068359, "rewards/lexical_plausibility/std": 0.006932419259101152, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.43385231494903564, "rewards/repeat_penalty/std": 0.20487482845783234, "rewards/near_duplicate_penalty/mean": 0.8501541018486023, "rewards/near_duplicate_penalty/std": 0.06414903700351715, "rewards/opening_diversity/mean": 0.9140625, "rewards/opening_diversity/std": 0.16682934761047363, "rewards/distinct_2/mean": 0.6013368964195251, "rewards/distinct_2/std": 0.1815468966960907, "rewards/total_composite/mean": 0.07021139562129974, "rewards/total_composite/std": 0.05332328751683235, "reward": 0.07021139562129974, "reward_std": 0.05332328379154205, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09675942361354828, "sampling/sampling_logp_difference/max": 2.3524839878082275, "sampling/importance_sampling_ratio/min": 0.09513255953788757, "sampling/importance_sampling_ratio/mean": 0.9920095801353455, "sampling/importance_sampling_ratio/max": 1.8275434970855713, "entropy": 0.5025036595761776, "clip_ratio/low_mean": 0.04403558745980263, "clip_ratio/low_min": 0.04403558745980263, "clip_ratio/high_mean": 0.03316158428788185, "clip_ratio/high_max": 0.03316158428788185, "clip_ratio/region_mean": 0.07719717174768448, "reward_total_mean": 0.07021139562129974, "reward_meter_mean": 0.35954898595809937, "reward_meter_std": 0.26351335644721985, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9975490570068359, "reward_lexical_plausibility_std": 0.006932419259101152, "reward_repeat_penalty_mean": 0.43385231494903564, "reward_repeat_penalty_std": 0.20487482845783234, "reward_near_duplicate_penalty_mean": 0.8501541018486023, "reward_near_duplicate_penalty_std": 0.06414903700351715, "reward_opening_diversity_mean": 0.9140625, "reward_opening_diversity_std": 0.16682934761047363, "reward_distinct_2_mean": 0.6013368964195251, "reward_distinct_2_std": 0.1815468966960907, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.07021139562129974, "reward_total_composite_std": 0.05332328751683235} {"timestamp_utc": "2026-04-12T14:40:55Z", "mode": "train", "global_step": 972, "epoch": 0.0390408482949753, "loss": -0.0668, "grad_norm": 4.7223100662231445, "learning_rate": 7.057575757575759e-06, "num_tokens": 1975886.0, "completions/mean_length": 211.75, "completions/min_length": 158.0, "completions/max_length": 268.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 211.75, "completions/min_terminated_length": 158.0, "completions/max_terminated_length": 268.0, "rewards/meter/mean": 0.23917627334594727, "rewards/meter/std": 0.2844199240207672, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.10000000149011612, "rewards/judge_quality/std": 0.053452253341674805, "rewards/repeat_penalty/mean": 8.849838195601478e-05, "rewards/repeat_penalty/std": 0.0002503112191334367, "rewards/near_duplicate_penalty/mean": 0.3626028895378113, "rewards/near_duplicate_penalty/std": 0.24472764134407043, "rewards/opening_diversity/mean": 0.4099264442920685, "rewards/opening_diversity/std": 0.3534538447856903, "rewards/distinct_2/mean": 0.0028586278203874826, "rewards/distinct_2/std": 0.008085420355200768, "rewards/total_composite/mean": 0.016795290634036064, "rewards/total_composite/std": 0.02730741538107395, "reward": 0.016795290634036064, "reward_std": 0.027307413518428802, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.036760326474905014, "sampling/sampling_logp_difference/max": 2.17226243019104, "sampling/importance_sampling_ratio/min": 0.11391958594322205, "sampling/importance_sampling_ratio/mean": 1.0065410137176514, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.25723590049892664, "clip_ratio/low_mean": 0.01981035154312849, "clip_ratio/low_min": 0.01981035154312849, "clip_ratio/high_mean": 0.010458126198500395, "clip_ratio/high_max": 0.010458126198500395, "clip_ratio/region_mean": 0.030268477741628885, "reward_total_mean": 0.016795290634036064, "reward_meter_mean": 0.23917627334594727, "reward_meter_std": 0.2844199240207672, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 8.849838195601478e-05, "reward_repeat_penalty_std": 0.0002503112191334367, "reward_near_duplicate_penalty_mean": 0.3626028895378113, "reward_near_duplicate_penalty_std": 0.24472764134407043, "reward_opening_diversity_mean": 0.4099264442920685, "reward_opening_diversity_std": 0.3534538447856903, "reward_distinct_2_mean": 0.0028586278203874826, "reward_distinct_2_std": 0.008085420355200768, "reward_judge_quality_mean": 0.10000000149011612, "reward_judge_quality_std": 0.053452253341674805, "reward_total_composite_mean": 0.016795290634036064, "reward_total_composite_std": 0.02730741538107395} {"timestamp_utc": "2026-04-12T14:41:08Z", "mode": "train", "global_step": 973, "epoch": 0.03908101377676025, "loss": -0.0355, "grad_norm": 2.1190357208251953, "learning_rate": 7.054545454545455e-06, "num_tokens": 1977325.0, "completions/mean_length": 220.875, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 46.20000076293945, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.2139018177986145, "rewards/meter/std": 0.3611465096473694, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.924515426158905, "rewards/lexical_plausibility/std": 0.1314423382282257, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3612182140350342, "rewards/repeat_penalty/mean": 0.9901825189590454, "rewards/repeat_penalty/std": 0.011737116612493992, "rewards/near_duplicate_penalty/mean": 0.9906794428825378, "rewards/near_duplicate_penalty/std": 0.011979267932474613, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9995018243789673, "rewards/distinct_2/std": 0.0014091377379372716, "rewards/total_composite/mean": 0.15802770853042603, "rewards/total_composite/std": 0.31189027428627014, "reward": 0.15802770853042603, "reward_std": 0.31189030408859253, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08841715008020401, "sampling/sampling_logp_difference/max": 1.142976999282837, "sampling/importance_sampling_ratio/min": 0.31886833906173706, "sampling/importance_sampling_ratio/mean": 0.992090106010437, "sampling/importance_sampling_ratio/max": 1.6711084842681885, "entropy": 0.2510576546192169, "clip_ratio/low_mean": 0.035811505280435085, "clip_ratio/low_min": 0.035811505280435085, "clip_ratio/high_mean": 0.01884828880429268, "clip_ratio/high_max": 0.01884828880429268, "clip_ratio/region_mean": 0.054659794084727764, "reward_total_mean": 0.15802770853042603, "reward_meter_mean": 0.2139018177986145, "reward_meter_std": 0.3611465096473694, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.924515426158905, "reward_lexical_plausibility_std": 0.1314423382282257, "reward_repeat_penalty_mean": 0.9901825189590454, "reward_repeat_penalty_std": 0.011737116612493992, "reward_near_duplicate_penalty_mean": 0.9906794428825378, "reward_near_duplicate_penalty_std": 0.011979267932474613, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9995018243789673, "reward_distinct_2_std": 0.0014091377379372716, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3612182140350342, "reward_total_composite_mean": 0.15802770853042603, "reward_total_composite_std": 0.31189027428627014} {"timestamp_utc": "2026-04-12T14:41:17Z", "mode": "train", "global_step": 974, "epoch": 0.039121179258545205, "loss": 0.0214, "grad_norm": 10.77816390991211, "learning_rate": 7.0515151515151525e-06, "num_tokens": 1979057.0, "completions/mean_length": 55.5, "completions/min_length": 50.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.5, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5139241218566895, "rewards/meter/std": 0.3450099527835846, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.8004724979400635, "rewards/repeat_penalty/std": 0.051337871700525284, "rewards/near_duplicate_penalty/mean": 0.8946834802627563, "rewards/near_duplicate_penalty/std": 0.04043261706829071, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8946537375450134, "rewards/distinct_2/std": 0.037854667752981186, "rewards/total_composite/mean": 0.14144492149353027, "rewards/total_composite/std": 0.11570578068494797, "reward": 0.14144492149353027, "reward_std": 0.11570577323436737, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07911837100982666, "sampling/sampling_logp_difference/max": 2.6304514408111572, "sampling/importance_sampling_ratio/min": 0.07204592972993851, "sampling/importance_sampling_ratio/mean": 1.0089739561080933, "sampling/importance_sampling_ratio/max": 1.8753541707992554, "entropy": 0.4026899226009846, "clip_ratio/low_mean": 0.05743443500250578, "clip_ratio/low_min": 0.05743443500250578, "clip_ratio/high_mean": 0.013762626331299543, "clip_ratio/high_max": 0.013762626331299543, "clip_ratio/region_mean": 0.07119706133380532, "reward_total_mean": 0.14144492149353027, "reward_meter_mean": 0.5139241218566895, "reward_meter_std": 0.3450099527835846, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8004724979400635, "reward_repeat_penalty_std": 0.051337871700525284, "reward_near_duplicate_penalty_mean": 0.8946834802627563, "reward_near_duplicate_penalty_std": 0.04043261706829071, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8946537375450134, "reward_distinct_2_std": 0.037854667752981186, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.14144492149353027, "reward_total_composite_std": 0.11570578068494797} {"timestamp_utc": "2026-04-12T14:41:25Z", "mode": "train", "global_step": 975, "epoch": 0.03916134474033016, "loss": 0.0847, "grad_norm": 11.016331672668457, "learning_rate": 7.048484848484849e-06, "num_tokens": 1980982.0, "completions/mean_length": 65.625, "completions/min_length": 44.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.625, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.7261991500854492, "rewards/meter/std": 0.3661386966705322, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.8570008277893066, "rewards/repeat_penalty/std": 0.05190880596637726, "rewards/near_duplicate_penalty/mean": 0.9380278587341309, "rewards/near_duplicate_penalty/std": 0.027473218739032745, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9130032658576965, "rewards/distinct_2/std": 0.033487122505903244, "rewards/total_composite/mean": 0.16555224359035492, "rewards/total_composite/std": 0.10530142486095428, "reward": 0.16555224359035492, "reward_std": 0.10530142486095428, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12798751890659332, "sampling/sampling_logp_difference/max": 2.6143364906311035, "sampling/importance_sampling_ratio/min": 0.07321634888648987, "sampling/importance_sampling_ratio/mean": 0.9907442927360535, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7357424721121788, "clip_ratio/low_mean": 0.06466997228562832, "clip_ratio/low_min": 0.06466997228562832, "clip_ratio/high_mean": 0.04606099613010883, "clip_ratio/high_max": 0.04606099613010883, "clip_ratio/region_mean": 0.11073096841573715, "reward_total_mean": 0.16555224359035492, "reward_meter_mean": 0.7261991500854492, "reward_meter_std": 0.3661386966705322, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8570008277893066, "reward_repeat_penalty_std": 0.05190880596637726, "reward_near_duplicate_penalty_mean": 0.9380278587341309, "reward_near_duplicate_penalty_std": 0.027473218739032745, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9130032658576965, "reward_distinct_2_std": 0.033487122505903244, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.16555224359035492, "reward_total_composite_std": 0.10530142486095428} {"timestamp_utc": "2026-04-12T14:41:35Z", "mode": "train", "global_step": 976, "epoch": 0.03920151022211511, "loss": -0.0092, "grad_norm": 11.58521556854248, "learning_rate": 7.045454545454546e-06, "num_tokens": 1982764.0, "completions/mean_length": 50.75, "completions/min_length": 44.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.75, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.307443767786026, "rewards/meter/std": 0.34788575768470764, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9914896488189697, "rewards/repeat_penalty/std": 0.013000753708183765, "rewards/near_duplicate_penalty/mean": 0.9914896488189697, "rewards/near_duplicate_penalty/std": 0.013000753708183765, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1296008825302124, "rewards/total_composite/std": 0.15783850848674774, "reward": 0.1296008825302124, "reward_std": 0.15783850848674774, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09777948260307312, "sampling/sampling_logp_difference/max": 1.714308738708496, "sampling/importance_sampling_ratio/min": 0.18008817732334137, "sampling/importance_sampling_ratio/mean": 1.0009520053863525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46424221247434616, "clip_ratio/low_mean": 0.053921748884022236, "clip_ratio/low_min": 0.053921748884022236, "clip_ratio/high_mean": 0.042861031368374825, "clip_ratio/high_max": 0.042861031368374825, "clip_ratio/region_mean": 0.09678278025239706, "reward_total_mean": 0.1296008825302124, "reward_meter_mean": 0.307443767786026, "reward_meter_std": 0.34788575768470764, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9914896488189697, "reward_repeat_penalty_std": 0.013000753708183765, "reward_near_duplicate_penalty_mean": 0.9914896488189697, "reward_near_duplicate_penalty_std": 0.013000753708183765, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.1296008825302124, "reward_total_composite_std": 0.15783850848674774} {"timestamp_utc": "2026-04-12T14:41:44Z", "mode": "train", "global_step": 977, "epoch": 0.03924167570390007, "loss": 0.0323, "grad_norm": 11.873543739318848, "learning_rate": 7.0424242424242426e-06, "num_tokens": 1984545.0, "completions/mean_length": 60.625, "completions/min_length": 55.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.625, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.5593838691711426, "rewards/meter/std": 0.40533238649368286, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.510095477104187, "rewards/repeat_penalty/std": 0.31443583965301514, "rewards/near_duplicate_penalty/mean": 0.8125889301300049, "rewards/near_duplicate_penalty/std": 0.14173707365989685, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.7150894999504089, "rewards/distinct_2/std": 0.22910983860492706, "rewards/total_composite/mean": 0.17091941833496094, "rewards/total_composite/std": 0.14195594191551208, "reward": 0.17091941833496094, "reward_std": 0.14195595681667328, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09142956882715225, "sampling/sampling_logp_difference/max": 1.9169671535491943, "sampling/importance_sampling_ratio/min": 0.14705228805541992, "sampling/importance_sampling_ratio/mean": 1.0105063915252686, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4898384101688862, "clip_ratio/low_mean": 0.059813302010297775, "clip_ratio/low_min": 0.059813302010297775, "clip_ratio/high_mean": 0.02513905195519328, "clip_ratio/high_max": 0.02513905195519328, "clip_ratio/region_mean": 0.08495235396549106, "reward_total_mean": 0.17091941833496094, "reward_meter_mean": 0.5593838691711426, "reward_meter_std": 0.40533238649368286, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.510095477104187, "reward_repeat_penalty_std": 0.31443583965301514, "reward_near_duplicate_penalty_mean": 0.8125889301300049, "reward_near_duplicate_penalty_std": 0.14173707365989685, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.7150894999504089, "reward_distinct_2_std": 0.22910983860492706, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.17091941833496094, "reward_total_composite_std": 0.14195594191551208} {"timestamp_utc": "2026-04-12T14:41:57Z", "mode": "train", "global_step": 978, "epoch": 0.03928184118568502, "loss": -0.0316, "grad_norm": 4.624334812164307, "learning_rate": 7.039393939393941e-06, "num_tokens": 1986310.0, "completions/mean_length": 125.625, "completions/min_length": 62.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 70.42857360839844, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.3001912534236908, "rewards/meter/std": 0.2824583351612091, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9679378867149353, "rewards/lexical_plausibility/std": 0.09068537503480911, "rewards/judge_quality/mean": 0.20875000953674316, "rewards/judge_quality/std": 0.12494999170303345, "rewards/repeat_penalty/mean": 0.4374067187309265, "rewards/repeat_penalty/std": 0.2799793779850006, "rewards/near_duplicate_penalty/mean": 0.776577889919281, "rewards/near_duplicate_penalty/std": 0.1323293000459671, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.24775780737400055, "rewards/distinct_2/mean": 0.6423899531364441, "rewards/distinct_2/std": 0.2421913743019104, "rewards/total_composite/mean": 0.07037614285945892, "rewards/total_composite/std": 0.10844790935516357, "reward": 0.07037614285945892, "reward_std": 0.10844790935516357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09270121157169342, "sampling/sampling_logp_difference/max": 2.46293568611145, "sampling/importance_sampling_ratio/min": 0.0851845070719719, "sampling/importance_sampling_ratio/mean": 0.992294430732727, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.33466818183660507, "clip_ratio/low_mean": 0.028240297455340624, "clip_ratio/low_min": 0.028240297455340624, "clip_ratio/high_mean": 0.018362977541983128, "clip_ratio/high_max": 0.018362977541983128, "clip_ratio/region_mean": 0.04660327499732375, "reward_total_mean": 0.07037614285945892, "reward_meter_mean": 0.3001912534236908, "reward_meter_std": 0.2824583351612091, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9679378867149353, "reward_lexical_plausibility_std": 0.09068537503480911, "reward_repeat_penalty_mean": 0.4374067187309265, "reward_repeat_penalty_std": 0.2799793779850006, "reward_near_duplicate_penalty_mean": 0.776577889919281, "reward_near_duplicate_penalty_std": 0.1323293000459671, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.24775780737400055, "reward_distinct_2_mean": 0.6423899531364441, "reward_distinct_2_std": 0.2421913743019104, "reward_judge_quality_mean": 0.20875000953674316, "reward_judge_quality_std": 0.12494999170303345, "reward_total_composite_mean": 0.07037614285945892, "reward_total_composite_std": 0.10844790935516357} {"timestamp_utc": "2026-04-12T14:42:10Z", "mode": "train", "global_step": 979, "epoch": 0.039322006667469975, "loss": -0.0143, "grad_norm": 7.157508850097656, "learning_rate": 7.036363636363637e-06, "num_tokens": 1987942.0, "completions/mean_length": 102.0, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.42857360839844, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.30481141805648804, "rewards/meter/std": 0.3104307949542999, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9627835750579834, "rewards/lexical_plausibility/std": 0.08294543623924255, "rewards/judge_quality/mean": 0.38999998569488525, "rewards/judge_quality/std": 0.2684878408908844, "rewards/repeat_penalty/mean": 0.6679938435554504, "rewards/repeat_penalty/std": 0.2514175474643707, "rewards/near_duplicate_penalty/mean": 0.8570210933685303, "rewards/near_duplicate_penalty/std": 0.09549296647310257, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8596557378768921, "rewards/distinct_2/std": 0.1111566424369812, "rewards/total_composite/mean": 0.15191224217414856, "rewards/total_composite/std": 0.1981995850801468, "reward": 0.15191224217414856, "reward_std": 0.1981995850801468, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13293837010860443, "sampling/sampling_logp_difference/max": 2.4101366996765137, "sampling/importance_sampling_ratio/min": 0.08980302512645721, "sampling/importance_sampling_ratio/mean": 1.008516788482666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4877931773662567, "clip_ratio/low_mean": 0.05374071467667818, "clip_ratio/low_min": 0.05374071467667818, "clip_ratio/high_mean": 0.035756501369178295, "clip_ratio/high_max": 0.035756501369178295, "clip_ratio/region_mean": 0.08949721604585648, "reward_total_mean": 0.15191224217414856, "reward_meter_mean": 0.30481141805648804, "reward_meter_std": 0.3104307949542999, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9627835750579834, "reward_lexical_plausibility_std": 0.08294543623924255, "reward_repeat_penalty_mean": 0.6679938435554504, "reward_repeat_penalty_std": 0.2514175474643707, "reward_near_duplicate_penalty_mean": 0.8570210933685303, "reward_near_duplicate_penalty_std": 0.09549296647310257, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8596557378768921, "reward_distinct_2_std": 0.1111566424369812, "reward_judge_quality_mean": 0.38999998569488525, "reward_judge_quality_std": 0.2684878408908844, "reward_total_composite_mean": 0.15191224217414856, "reward_total_composite_std": 0.1981995850801468} {"timestamp_utc": "2026-04-12T14:42:19Z", "mode": "train", "global_step": 980, "epoch": 0.03936217214925493, "loss": -0.0519, "grad_norm": 8.318925857543945, "learning_rate": 7.033333333333334e-06, "num_tokens": 1989996.0, "completions/mean_length": 87.75, "completions/min_length": 62.0, "completions/max_length": 107.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.75, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 107.0, "rewards/meter/mean": 0.6406745314598083, "rewards/meter/std": 0.3038019835948944, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.7011221647262573, "rewards/repeat_penalty/std": 0.19219118356704712, "rewards/near_duplicate_penalty/mean": 0.8614804148674011, "rewards/near_duplicate_penalty/std": 0.0857333168387413, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8023130893707275, "rewards/distinct_2/std": 0.15280494093894958, "rewards/total_composite/mean": 0.17078441381454468, "rewards/total_composite/std": 0.11170023679733276, "reward": 0.17078441381454468, "reward_std": 0.11170024424791336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11083410680294037, "sampling/sampling_logp_difference/max": 1.7277414798736572, "sampling/importance_sampling_ratio/min": 0.17768526077270508, "sampling/importance_sampling_ratio/mean": 0.9954089522361755, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.587139930576086, "clip_ratio/low_mean": 0.05488824797794223, "clip_ratio/low_min": 0.05488824797794223, "clip_ratio/high_mean": 0.04168161191046238, "clip_ratio/high_max": 0.04168161191046238, "clip_ratio/region_mean": 0.09656985988840461, "reward_total_mean": 0.17078441381454468, "reward_meter_mean": 0.6406745314598083, "reward_meter_std": 0.3038019835948944, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7011221647262573, "reward_repeat_penalty_std": 0.19219118356704712, "reward_near_duplicate_penalty_mean": 0.8614804148674011, "reward_near_duplicate_penalty_std": 0.0857333168387413, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8023130893707275, "reward_distinct_2_std": 0.15280494093894958, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.17078441381454468, "reward_total_composite_std": 0.11170023679733276} {"timestamp_utc": "2026-04-12T14:42:28Z", "mode": "train", "global_step": 981, "epoch": 0.03940233763103988, "loss": 0.0034, "grad_norm": 12.545379638671875, "learning_rate": 7.030303030303031e-06, "num_tokens": 1991690.0, "completions/mean_length": 53.75, "completions/min_length": 42.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.75, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.5458482503890991, "rewards/meter/std": 0.4694296717643738, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.8491734266281128, "rewards/repeat_penalty/std": 0.12976500391960144, "rewards/near_duplicate_penalty/mean": 0.9190741777420044, "rewards/near_duplicate_penalty/std": 0.04579726979136467, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9496719837188721, "rewards/distinct_2/std": 0.06028076633810997, "rewards/total_composite/mean": 0.13214111328125, "rewards/total_composite/std": 0.1428379863500595, "reward": 0.13214111328125, "reward_std": 0.1428380012512207, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10618890821933746, "sampling/sampling_logp_difference/max": 1.7462825775146484, "sampling/importance_sampling_ratio/min": 0.17442113161087036, "sampling/importance_sampling_ratio/mean": 1.0013306140899658, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7513331100344658, "clip_ratio/low_mean": 0.061195218469947577, "clip_ratio/low_min": 0.061195218469947577, "clip_ratio/high_mean": 0.06303606275469065, "clip_ratio/high_max": 0.06303606275469065, "clip_ratio/region_mean": 0.12423128122463822, "reward_total_mean": 0.13214111328125, "reward_meter_mean": 0.5458482503890991, "reward_meter_std": 0.4694296717643738, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8491734266281128, "reward_repeat_penalty_std": 0.12976500391960144, "reward_near_duplicate_penalty_mean": 0.9190741777420044, "reward_near_duplicate_penalty_std": 0.04579726979136467, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9496719837188721, "reward_distinct_2_std": 0.06028076633810997, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.13214111328125, "reward_total_composite_std": 0.1428379863500595} {"timestamp_utc": "2026-04-12T14:42:40Z", "mode": "train", "global_step": 982, "epoch": 0.03944250311282484, "loss": -0.0143, "grad_norm": 3.270921230316162, "learning_rate": 7.027272727272728e-06, "num_tokens": 1993399.0, "completions/mean_length": 96.625, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.28571701049805, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.26701539754867554, "rewards/meter/std": 0.31732940673828125, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9545800685882568, "rewards/lexical_plausibility/std": 0.12846696376800537, "rewards/judge_quality/mean": 0.5850000381469727, "rewards/judge_quality/std": 0.377548485994339, "rewards/repeat_penalty/mean": 0.9925603866577148, "rewards/repeat_penalty/std": 0.014823234640061855, "rewards/near_duplicate_penalty/mean": 0.9925603866577148, "rewards/near_duplicate_penalty/std": 0.014823234640061855, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17170283198356628, "rewards/total_composite/std": 0.28969505429267883, "reward": 0.17170283198356628, "reward_std": 0.28969505429267883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13185356557369232, "sampling/sampling_logp_difference/max": 1.8705167770385742, "sampling/importance_sampling_ratio/min": 0.32935336232185364, "sampling/importance_sampling_ratio/mean": 1.0352216958999634, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5752882957458496, "clip_ratio/low_mean": 0.08289665216580033, "clip_ratio/low_min": 0.08289665216580033, "clip_ratio/high_mean": 0.021557487081736326, "clip_ratio/high_max": 0.021557487081736326, "clip_ratio/region_mean": 0.10445413924753666, "reward_total_mean": 0.17170283198356628, "reward_meter_mean": 0.26701539754867554, "reward_meter_std": 0.31732940673828125, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9545800685882568, "reward_lexical_plausibility_std": 0.12846696376800537, "reward_repeat_penalty_mean": 0.9925603866577148, "reward_repeat_penalty_std": 0.014823234640061855, "reward_near_duplicate_penalty_mean": 0.9925603866577148, "reward_near_duplicate_penalty_std": 0.014823234640061855, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5850000381469727, "reward_judge_quality_std": 0.377548485994339, "reward_total_composite_mean": 0.17170283198356628, "reward_total_composite_std": 0.28969505429267883} {"timestamp_utc": "2026-04-12T14:42:48Z", "mode": "train", "global_step": 983, "epoch": 0.03948266859460979, "loss": 0.0233, "grad_norm": 13.882776260375977, "learning_rate": 7.024242424242424e-06, "num_tokens": 1995099.0, "completions/mean_length": 53.5, "completions/min_length": 44.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.5, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.6158996820449829, "rewards/meter/std": 0.39532360434532166, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.7647675275802612, "rewards/repeat_penalty/std": 0.27327078580856323, "rewards/near_duplicate_penalty/mean": 0.8891000747680664, "rewards/near_duplicate_penalty/std": 0.11054614186286926, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.8779939413070679, "rewards/distinct_2/std": 0.14640764892101288, "rewards/total_composite/mean": 0.2117781937122345, "rewards/total_composite/std": 0.16315396130084991, "reward": 0.2117781937122345, "reward_std": 0.16315394639968872, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12032093107700348, "sampling/sampling_logp_difference/max": 1.7155661582946777, "sampling/importance_sampling_ratio/min": 0.1798618584871292, "sampling/importance_sampling_ratio/mean": 1.0023165941238403, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5884692668914795, "clip_ratio/low_mean": 0.06312001775950193, "clip_ratio/low_min": 0.06312001775950193, "clip_ratio/high_mean": 0.041774327866733074, "clip_ratio/high_max": 0.041774327866733074, "clip_ratio/region_mean": 0.10489434562623501, "reward_total_mean": 0.2117781937122345, "reward_meter_mean": 0.6158996820449829, "reward_meter_std": 0.39532360434532166, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7647675275802612, "reward_repeat_penalty_std": 0.27327078580856323, "reward_near_duplicate_penalty_mean": 0.8891000747680664, "reward_near_duplicate_penalty_std": 0.11054614186286926, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.8779939413070679, "reward_distinct_2_std": 0.14640764892101288, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.2117781937122345, "reward_total_composite_std": 0.16315396130084991} {"timestamp_utc": "2026-04-12T14:42:56Z", "mode": "train", "global_step": 984, "epoch": 0.039522834076394744, "loss": 0.0716, "grad_norm": 26.248443603515625, "learning_rate": 7.021212121212122e-06, "num_tokens": 1996609.0, "completions/mean_length": 25.75, "completions/min_length": 23.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.75, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.7959403991699219, "rewards/meter/std": 0.3071911633014679, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.0289318785071373, "rewards/judge_quality/mean": 0.7275000214576721, "rewards/judge_quality/std": 0.3564407229423523, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6245854496955872, "rewards/total_composite/std": 0.360934853553772, "reward": 0.6245854496955872, "reward_std": 0.3609348237514496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14976392686367035, "sampling/sampling_logp_difference/max": 1.3163299560546875, "sampling/importance_sampling_ratio/min": 0.2681175172328949, "sampling/importance_sampling_ratio/mean": 1.0189403295516968, "sampling/importance_sampling_ratio/max": 1.968184471130371, "entropy": 0.8199795559048653, "clip_ratio/low_mean": 0.041183135006576777, "clip_ratio/low_min": 0.041183135006576777, "clip_ratio/high_mean": 0.07003465062007308, "clip_ratio/high_max": 0.07003465062007308, "clip_ratio/region_mean": 0.11121778562664986, "reward_total_mean": 0.6245854496955872, "reward_meter_mean": 0.7959403991699219, "reward_meter_std": 0.3071911633014679, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.0289318785071373, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7275000214576721, "reward_judge_quality_std": 0.3564407229423523, "reward_total_composite_mean": 0.6245854496955872, "reward_total_composite_std": 0.360934853553772} {"timestamp_utc": "2026-04-12T14:43:09Z", "mode": "train", "global_step": 985, "epoch": 0.0395629995581797, "loss": -0.0885, "grad_norm": 2.12365460395813, "learning_rate": 7.018181818181818e-06, "num_tokens": 1998284.0, "completions/mean_length": 172.375, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 59.16666793823242, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.6781532168388367, "rewards/meter/std": 0.3348863124847412, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9298042058944702, "rewards/lexical_plausibility/std": 0.11668843030929565, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.891778826713562, "rewards/repeat_penalty/std": 0.11939821392297745, "rewards/near_duplicate_penalty/mean": 0.9382267594337463, "rewards/near_duplicate_penalty/std": 0.05382538586854935, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9469859600067139, "rewards/distinct_2/std": 0.08032916486263275, "rewards/total_composite/mean": 0.13072469830513, "rewards/total_composite/std": 0.11394831538200378, "reward": 0.13072469830513, "reward_std": 0.11394830793142319, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1436917781829834, "sampling/sampling_logp_difference/max": 1.8405656814575195, "sampling/importance_sampling_ratio/min": 0.15872761607170105, "sampling/importance_sampling_ratio/mean": 1.003473162651062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5855006724596024, "clip_ratio/low_mean": 0.02892102301120758, "clip_ratio/low_min": 0.02892102301120758, "clip_ratio/high_mean": 0.05759432818740606, "clip_ratio/high_max": 0.05759432818740606, "clip_ratio/region_mean": 0.08651535119861364, "reward_total_mean": 0.13072469830513, "reward_meter_mean": 0.6781532168388367, "reward_meter_std": 0.3348863124847412, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9298042058944702, "reward_lexical_plausibility_std": 0.11668843030929565, "reward_repeat_penalty_mean": 0.891778826713562, "reward_repeat_penalty_std": 0.11939821392297745, "reward_near_duplicate_penalty_mean": 0.9382267594337463, "reward_near_duplicate_penalty_std": 0.05382538586854935, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9469859600067139, "reward_distinct_2_std": 0.08032916486263275, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.13072469830513, "reward_total_composite_std": 0.11394831538200378} {"timestamp_utc": "2026-04-12T14:43:23Z", "mode": "train", "global_step": 986, "epoch": 0.03960316503996465, "loss": -0.1223, "grad_norm": 2.4662036895751953, "learning_rate": 7.015151515151516e-06, "num_tokens": 2000193.0, "completions/mean_length": 185.625, "completions/min_length": 74.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 76.83333587646484, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.7226679921150208, "rewards/meter/std": 0.39732110500335693, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9465062022209167, "rewards/lexical_plausibility/std": 0.10204039514064789, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.3077075481414795, "rewards/repeat_penalty/mean": 0.680860161781311, "rewards/repeat_penalty/std": 0.2433183193206787, "rewards/near_duplicate_penalty/mean": 0.8877695798873901, "rewards/near_duplicate_penalty/std": 0.09313931316137314, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.8297022581100464, "rewards/distinct_2/std": 0.1726221740245819, "rewards/total_composite/mean": 0.37500452995300293, "rewards/total_composite/std": 0.3034655749797821, "reward": 0.37500452995300293, "reward_std": 0.3034655451774597, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1175990104675293, "sampling/sampling_logp_difference/max": 1.858527660369873, "sampling/importance_sampling_ratio/min": 0.15590199828147888, "sampling/importance_sampling_ratio/mean": 0.9983144998550415, "sampling/importance_sampling_ratio/max": 1.9845352172851562, "entropy": 0.4068913646042347, "clip_ratio/low_mean": 0.021170715801417828, "clip_ratio/low_min": 0.021170715801417828, "clip_ratio/high_mean": 0.05509928334504366, "clip_ratio/high_max": 0.05509928334504366, "clip_ratio/region_mean": 0.07626999914646149, "reward_total_mean": 0.37500452995300293, "reward_meter_mean": 0.7226679921150208, "reward_meter_std": 0.39732110500335693, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9465062022209167, "reward_lexical_plausibility_std": 0.10204039514064789, "reward_repeat_penalty_mean": 0.680860161781311, "reward_repeat_penalty_std": 0.2433183193206787, "reward_near_duplicate_penalty_mean": 0.8877695798873901, "reward_near_duplicate_penalty_std": 0.09313931316137314, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.8297022581100464, "reward_distinct_2_std": 0.1726221740245819, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.3077075481414795, "reward_total_composite_mean": 0.37500452995300293, "reward_total_composite_std": 0.3034655749797821} {"timestamp_utc": "2026-04-12T14:43:36Z", "mode": "train", "global_step": 987, "epoch": 0.039643330521749606, "loss": -0.0806, "grad_norm": 2.222475290298462, "learning_rate": 7.0121212121212126e-06, "num_tokens": 2001640.0, "completions/mean_length": 225.875, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 54.20000076293945, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.5086429119110107, "rewards/meter/std": 0.422344833612442, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.902845025062561, "rewards/lexical_plausibility/std": 0.13641053438186646, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.7505574226379395, "rewards/repeat_penalty/std": 0.15078061819076538, "rewards/near_duplicate_penalty/mean": 0.9147303700447083, "rewards/near_duplicate_penalty/std": 0.07815375179052353, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9087716341018677, "rewards/distinct_2/std": 0.12953445315361023, "rewards/total_composite/mean": 0.16314013302326202, "rewards/total_composite/std": 0.1624373346567154, "reward": 0.16314013302326202, "reward_std": 0.1624373346567154, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10534392297267914, "sampling/sampling_logp_difference/max": 0.9642497301101685, "sampling/importance_sampling_ratio/min": 0.3812691569328308, "sampling/importance_sampling_ratio/mean": 1.0275280475616455, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.424203522503376, "clip_ratio/low_mean": 0.01666666753590107, "clip_ratio/low_min": 0.01666666753590107, "clip_ratio/high_mean": 0.03353535337373614, "clip_ratio/high_max": 0.03353535337373614, "clip_ratio/region_mean": 0.05020202090963721, "reward_total_mean": 0.16314013302326202, "reward_meter_mean": 0.5086429119110107, "reward_meter_std": 0.422344833612442, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.902845025062561, "reward_lexical_plausibility_std": 0.13641053438186646, "reward_repeat_penalty_mean": 0.7505574226379395, "reward_repeat_penalty_std": 0.15078061819076538, "reward_near_duplicate_penalty_mean": 0.9147303700447083, "reward_near_duplicate_penalty_std": 0.07815375179052353, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9087716341018677, "reward_distinct_2_std": 0.12953445315361023, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.16314013302326202, "reward_total_composite_std": 0.1624373346567154} {"timestamp_utc": "2026-04-12T14:43:53Z", "mode": "train", "global_step": 988, "epoch": 0.03968349600353456, "loss": -0.0906, "grad_norm": 3.833721160888672, "learning_rate": 7.00909090909091e-06, "num_tokens": 2003407.0, "completions/mean_length": 185.875, "completions/min_length": 73.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 77.16667175292969, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.6221957206726074, "rewards/meter/std": 0.44464191794395447, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9379913210868835, "rewards/lexical_plausibility/std": 0.1160426214337349, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.3340979516506195, "rewards/repeat_penalty/mean": 0.8773944973945618, "rewards/repeat_penalty/std": 0.12275677174329758, "rewards/near_duplicate_penalty/mean": 0.9386776089668274, "rewards/near_duplicate_penalty/std": 0.051305800676345825, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9614783525466919, "rewards/distinct_2/std": 0.0421803779900074, "rewards/total_composite/mean": 0.36288678646087646, "rewards/total_composite/std": 0.37206077575683594, "reward": 0.36288678646087646, "reward_std": 0.37206074595451355, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1109168604016304, "sampling/sampling_logp_difference/max": 1.5353846549987793, "sampling/importance_sampling_ratio/min": 0.21537283062934875, "sampling/importance_sampling_ratio/mean": 1.0210031270980835, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4782083071768284, "clip_ratio/low_mean": 0.036940517369657755, "clip_ratio/low_min": 0.036940517369657755, "clip_ratio/high_mean": 0.04129467345774174, "clip_ratio/high_max": 0.04129467345774174, "clip_ratio/region_mean": 0.07823519082739949, "reward_total_mean": 0.36288678646087646, "reward_meter_mean": 0.6221957206726074, "reward_meter_std": 0.44464191794395447, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9379913210868835, "reward_lexical_plausibility_std": 0.1160426214337349, "reward_repeat_penalty_mean": 0.8773944973945618, "reward_repeat_penalty_std": 0.12275677174329758, "reward_near_duplicate_penalty_mean": 0.9386776089668274, "reward_near_duplicate_penalty_std": 0.051305800676345825, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9614783525466919, "reward_distinct_2_std": 0.0421803779900074, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.3340979516506195, "reward_total_composite_mean": 0.36288678646087646, "reward_total_composite_std": 0.37206077575683594} {"timestamp_utc": "2026-04-12T14:44:07Z", "mode": "train", "global_step": 989, "epoch": 0.039723661485319514, "loss": -0.0647, "grad_norm": 5.70667028427124, "learning_rate": 7.006060606060606e-06, "num_tokens": 2004873.0, "completions/mean_length": 223.25, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 50.0, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.45600587129592896, "rewards/meter/std": 0.4731103181838989, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/lexical_plausibility/mean": 0.9052602648735046, "rewards/lexical_plausibility/std": 0.13334181904792786, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.8469921350479126, "rewards/repeat_penalty/std": 0.13217680156230927, "rewards/near_duplicate_penalty/mean": 0.9327105283737183, "rewards/near_duplicate_penalty/std": 0.05177021771669388, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9046897888183594, "rewards/distinct_2/std": 0.10607904195785522, "rewards/total_composite/mean": 0.12616285681724548, "rewards/total_composite/std": 0.18038931488990784, "reward": 0.12616285681724548, "reward_std": 0.18038929998874664, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10798030346632004, "sampling/sampling_logp_difference/max": 1.5350217819213867, "sampling/importance_sampling_ratio/min": 0.21545101702213287, "sampling/importance_sampling_ratio/mean": 1.004711389541626, "sampling/importance_sampling_ratio/max": 1.9663946628570557, "entropy": 0.32983867451548576, "clip_ratio/low_mean": 0.02533244714140892, "clip_ratio/low_min": 0.02533244714140892, "clip_ratio/high_mean": 0.03373056510463357, "clip_ratio/high_max": 0.03373056510463357, "clip_ratio/region_mean": 0.05906301224604249, "reward_total_mean": 0.12616285681724548, "reward_meter_mean": 0.45600587129592896, "reward_meter_std": 0.4731103181838989, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_lexical_plausibility_mean": 0.9052602648735046, "reward_lexical_plausibility_std": 0.13334181904792786, "reward_repeat_penalty_mean": 0.8469921350479126, "reward_repeat_penalty_std": 0.13217680156230927, "reward_near_duplicate_penalty_mean": 0.9327105283737183, "reward_near_duplicate_penalty_std": 0.05177021771669388, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9046897888183594, "reward_distinct_2_std": 0.10607904195785522, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.12616285681724548, "reward_total_composite_std": 0.18038931488990784} {"timestamp_utc": "2026-04-12T14:44:20Z", "mode": "train", "global_step": 990, "epoch": 0.03976382696710447, "loss": -0.041, "grad_norm": 1.3340327739715576, "learning_rate": 7.0030303030303035e-06, "num_tokens": 2006295.0, "completions/mean_length": 337.75, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 47.333335876464844, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.3125881552696228, "rewards/meter/std": 0.34360480308532715, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.826207160949707, "rewards/lexical_plausibility/std": 0.1467028707265854, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1922609806060791, "rewards/repeat_penalty/mean": 0.928420901298523, "rewards/repeat_penalty/std": 0.059653110802173615, "rewards/near_duplicate_penalty/mean": 0.9394897222518921, "rewards/near_duplicate_penalty/std": 0.04542161524295807, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9878213405609131, "rewards/distinct_2/std": 0.02975465916097164, "rewards/total_composite/mean": 0.07774575054645538, "rewards/total_composite/std": 0.1380847990512848, "reward": 0.07774575054645538, "reward_std": 0.1380847841501236, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15079817175865173, "sampling/sampling_logp_difference/max": 1.9642105102539062, "sampling/importance_sampling_ratio/min": 0.14026658236980438, "sampling/importance_sampling_ratio/mean": 0.9765504598617554, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2385721057653427, "clip_ratio/low_mean": 0.006818181835114956, "clip_ratio/low_min": 0.006818181835114956, "clip_ratio/high_mean": 0.05799310840666294, "clip_ratio/high_max": 0.05799310840666294, "clip_ratio/region_mean": 0.0648112902417779, "reward_total_mean": 0.07774575054645538, "reward_meter_mean": 0.3125881552696228, "reward_meter_std": 0.34360480308532715, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.826207160949707, "reward_lexical_plausibility_std": 0.1467028707265854, "reward_repeat_penalty_mean": 0.928420901298523, "reward_repeat_penalty_std": 0.059653110802173615, "reward_near_duplicate_penalty_mean": 0.9394897222518921, "reward_near_duplicate_penalty_std": 0.04542161524295807, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9878213405609131, "reward_distinct_2_std": 0.02975465916097164, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1922609806060791, "reward_total_composite_mean": 0.07774575054645538, "reward_total_composite_std": 0.1380847990512848} {"timestamp_utc": "2026-04-12T14:44:34Z", "mode": "train", "global_step": 991, "epoch": 0.03980399244888942, "loss": -0.2059, "grad_norm": 1.2185224294662476, "learning_rate": 7e-06, "num_tokens": 2011194.0, "completions/mean_length": 467.375, "completions/min_length": 400.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 461.0000305175781, "completions/min_terminated_length": 400.0, "completions/max_terminated_length": 503.0, "rewards/meter/mean": 0.7228045463562012, "rewards/meter/std": 0.3669188320636749, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0971859022974968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.2874869406223297, "rewards/near_duplicate_penalty/std": 0.16659756004810333, "rewards/opening_diversity/mean": 0.46581366658210754, "rewards/opening_diversity/std": 0.3762345314025879, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0455997996032238, "rewards/total_composite/std": 0.025717701762914658, "reward": 0.0455997996032238, "reward_std": 0.02571769990026951, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.020445222035050392, "sampling/sampling_logp_difference/max": 4.094364643096924, "sampling/importance_sampling_ratio/min": 0.016666332259774208, "sampling/importance_sampling_ratio/mean": 1.001975417137146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.09206820605322719, "clip_ratio/low_mean": 0.00502943410538137, "clip_ratio/low_min": 0.00502943410538137, "clip_ratio/high_mean": 0.008704663021489978, "clip_ratio/high_max": 0.008704663021489978, "clip_ratio/region_mean": 0.013734097126871347, "reward_total_mean": 0.0455997996032238, "reward_meter_mean": 0.7228045463562012, "reward_meter_std": 0.3669188320636749, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0971859022974968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.2874869406223297, "reward_near_duplicate_penalty_std": 0.16659756004810333, "reward_opening_diversity_mean": 0.46581366658210754, "reward_opening_diversity_std": 0.3762345314025879, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.0455997996032238, "reward_total_composite_std": 0.025717701762914658} {"timestamp_utc": "2026-04-12T14:44:47Z", "mode": "train", "global_step": 992, "epoch": 0.039844157930674376, "loss": 0.0252, "grad_norm": 2.940246343612671, "learning_rate": 6.996969696969698e-06, "num_tokens": 2016326.0, "completions/mean_length": 422.5, "completions/min_length": 390.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 422.5, "completions/min_terminated_length": 390.0, "completions/max_terminated_length": 512.0, "rewards/meter/mean": 0.8226900696754456, "rewards/meter/std": 0.19365568459033966, "rewards/count_adherence/mean": 0.5795454978942871, "rewards/count_adherence/std": 0.06763851642608643, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.5123528838157654, "rewards/near_duplicate_penalty/std": 0.1367569863796234, "rewards/opening_diversity/mean": 0.77724289894104, "rewards/opening_diversity/std": 0.02403104119002819, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.06489282846450806, "rewards/total_composite/std": 0.024038584902882576, "reward": 0.06489282846450806, "reward_std": 0.024038584902882576, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.020665442571043968, "sampling/sampling_logp_difference/max": 1.7199337482452393, "sampling/importance_sampling_ratio/min": 0.18318268656730652, "sampling/importance_sampling_ratio/mean": 1.0008816719055176, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.10681440634652972, "clip_ratio/low_mean": 0.009256523801013827, "clip_ratio/low_min": 0.009256523801013827, "clip_ratio/high_mean": 0.012108491035178304, "clip_ratio/high_max": 0.012108491035178304, "clip_ratio/region_mean": 0.02136501483619213, "reward_total_mean": 0.06489282846450806, "reward_meter_mean": 0.8226900696754456, "reward_meter_std": 0.19365568459033966, "reward_count_adherence_mean": 0.5795454978942871, "reward_count_adherence_std": 0.06763851642608643, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.5123528838157654, "reward_near_duplicate_penalty_std": 0.1367569863796234, "reward_opening_diversity_mean": 0.77724289894104, "reward_opening_diversity_std": 0.02403104119002819, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.06489282846450806, "reward_total_composite_std": 0.024038584902882576} {"timestamp_utc": "2026-04-12T14:45:01Z", "mode": "train", "global_step": 993, "epoch": 0.03988432341245933, "loss": -0.0614, "grad_norm": 2.8004815578460693, "learning_rate": 6.993939393939394e-06, "num_tokens": 2017871.0, "completions/mean_length": 223.125, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 49.79999923706055, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.08863702416419983, "rewards/meter/std": 0.10776276886463165, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9058598875999451, "rewards/lexical_plausibility/std": 0.1252550631761551, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.20830951631069183, "rewards/repeat_penalty/mean": 0.9608862996101379, "rewards/repeat_penalty/std": 0.03716663271188736, "rewards/near_duplicate_penalty/mean": 0.9719347357749939, "rewards/near_duplicate_penalty/std": 0.034501202404499054, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9888646602630615, "rewards/distinct_2/std": 0.026741670444607735, "rewards/total_composite/mean": 0.03434469923377037, "rewards/total_composite/std": 0.051052313297986984, "reward": 0.03434469923377037, "reward_std": 0.05105230584740639, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13200277090072632, "sampling/sampling_logp_difference/max": 1.546842098236084, "sampling/importance_sampling_ratio/min": 0.3204887807369232, "sampling/importance_sampling_ratio/mean": 1.0063825845718384, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46162882447242737, "clip_ratio/low_mean": 0.024109620600938797, "clip_ratio/low_min": 0.024109620600938797, "clip_ratio/high_mean": 0.04244799492880702, "clip_ratio/high_max": 0.04244799492880702, "clip_ratio/region_mean": 0.06655761552974582, "reward_total_mean": 0.03434469923377037, "reward_meter_mean": 0.08863702416419983, "reward_meter_std": 0.10776276886463165, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9058598875999451, "reward_lexical_plausibility_std": 0.1252550631761551, "reward_repeat_penalty_mean": 0.9608862996101379, "reward_repeat_penalty_std": 0.03716663271188736, "reward_near_duplicate_penalty_mean": 0.9719347357749939, "reward_near_duplicate_penalty_std": 0.034501202404499054, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9888646602630615, "reward_distinct_2_std": 0.026741670444607735, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.20830951631069183, "reward_total_composite_mean": 0.03434469923377037, "reward_total_composite_std": 0.051052313297986984} {"timestamp_utc": "2026-04-12T14:45:16Z", "mode": "train", "global_step": 994, "epoch": 0.039924488894244284, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.990909090909092e-06, "num_tokens": 2019583.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.7204117774963379, "rewards/meter/std": 0.30648282170295715, "rewards/count_adherence/mean": 0.8602941036224365, "rewards/count_adherence/std": 0.10863599181175232, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.30068665742874146, "rewards/near_duplicate_penalty/std": 0.16507866978645325, "rewards/opening_diversity/mean": 0.29391634464263916, "rewards/opening_diversity/std": 0.3674202263355255, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08356542885303497, "rewards/total_composite/std": 0.045433610677719116, "reward": 0.08356542885303497, "reward_std": 0.04543360695242882, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.08356542885303497, "reward_meter_mean": 0.7204117774963379, "reward_meter_std": 0.30648282170295715, "reward_count_adherence_mean": 0.8602941036224365, "reward_count_adherence_std": 0.10863599181175232, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.30068665742874146, "reward_near_duplicate_penalty_std": 0.16507866978645325, "reward_opening_diversity_mean": 0.29391634464263916, "reward_opening_diversity_std": 0.3674202263355255, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.08356542885303497, "reward_total_composite_std": 0.045433610677719116} {"timestamp_utc": "2026-04-12T14:45:30Z", "mode": "train", "global_step": 995, "epoch": 0.03996465437602924, "loss": -0.0717, "grad_norm": 4.690229415893555, "learning_rate": 6.987878787878788e-06, "num_tokens": 2021367.0, "completions/mean_length": 112.0, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.857147216796875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.64249587059021, "rewards/meter/std": 0.37544283270835876, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9674509763717651, "rewards/lexical_plausibility/std": 0.09206251800060272, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464233487844467, "rewards/repeat_penalty/mean": 0.23540544509887695, "rewards/repeat_penalty/std": 0.06962842494249344, "rewards/near_duplicate_penalty/mean": 0.822376012802124, "rewards/near_duplicate_penalty/std": 0.08210719376802444, "rewards/opening_diversity/mean": 0.375, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7789473533630371, "rewards/distinct_2/std": 0.11217062175273895, "rewards/total_composite/mean": 0.24081265926361084, "rewards/total_composite/std": 0.15572069585323334, "reward": 0.24081265926361084, "reward_std": 0.15572069585323334, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11030396074056625, "sampling/sampling_logp_difference/max": 4.377264022827148, "sampling/importance_sampling_ratio/min": 0.012559674680233002, "sampling/importance_sampling_ratio/mean": 1.0015673637390137, "sampling/importance_sampling_ratio/max": 1.9557359218597412, "entropy": 0.41459524631500244, "clip_ratio/low_mean": 0.015321316663175821, "clip_ratio/low_min": 0.015321316663175821, "clip_ratio/high_mean": 0.06096663139760494, "clip_ratio/high_max": 0.06096663139760494, "clip_ratio/region_mean": 0.07628794806078076, "reward_total_mean": 0.24081265926361084, "reward_meter_mean": 0.64249587059021, "reward_meter_std": 0.37544283270835876, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9674509763717651, "reward_lexical_plausibility_std": 0.09206251800060272, "reward_repeat_penalty_mean": 0.23540544509887695, "reward_repeat_penalty_std": 0.06962842494249344, "reward_near_duplicate_penalty_mean": 0.822376012802124, "reward_near_duplicate_penalty_std": 0.08210719376802444, "reward_opening_diversity_mean": 0.375, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7789473533630371, "reward_distinct_2_std": 0.11217062175273895, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464233487844467, "reward_total_composite_mean": 0.24081265926361084, "reward_total_composite_std": 0.15572069585323334} {"timestamp_utc": "2026-04-12T14:45:43Z", "mode": "train", "global_step": 996, "epoch": 0.04000481985781419, "loss": -0.0734, "grad_norm": 5.3192524909973145, "learning_rate": 6.984848484848485e-06, "num_tokens": 2023094.0, "completions/mean_length": 115.875, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 59.28571701049805, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.6954101324081421, "rewards/meter/std": 0.4064273238182068, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9541934728622437, "rewards/lexical_plausibility/std": 0.1295604705810547, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.2111881971359253, "rewards/repeat_penalty/std": 0.08781961351633072, "rewards/near_duplicate_penalty/mean": 0.7852634787559509, "rewards/near_duplicate_penalty/std": 0.11110790073871613, "rewards/opening_diversity/mean": 0.375, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7237294912338257, "rewards/distinct_2/std": 0.1848858743906021, "rewards/total_composite/mean": 0.1936955749988556, "rewards/total_composite/std": 0.13327328860759735, "reward": 0.1936955749988556, "reward_std": 0.13327328860759735, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10754402726888657, "sampling/sampling_logp_difference/max": 1.513790488243103, "sampling/importance_sampling_ratio/min": 0.22007420659065247, "sampling/importance_sampling_ratio/mean": 1.0193158388137817, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5054878517985344, "clip_ratio/low_mean": 0.02899590227752924, "clip_ratio/low_min": 0.02899590227752924, "clip_ratio/high_mean": 0.034066562075167894, "clip_ratio/high_max": 0.034066562075167894, "clip_ratio/region_mean": 0.06306246435269713, "reward_total_mean": 0.1936955749988556, "reward_meter_mean": 0.6954101324081421, "reward_meter_std": 0.4064273238182068, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9541934728622437, "reward_lexical_plausibility_std": 0.1295604705810547, "reward_repeat_penalty_mean": 0.2111881971359253, "reward_repeat_penalty_std": 0.08781961351633072, "reward_near_duplicate_penalty_mean": 0.7852634787559509, "reward_near_duplicate_penalty_std": 0.11110790073871613, "reward_opening_diversity_mean": 0.375, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7237294912338257, "reward_distinct_2_std": 0.1848858743906021, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.1936955749988556, "reward_total_composite_std": 0.13327328860759735} {"timestamp_utc": "2026-04-12T14:45:56Z", "mode": "train", "global_step": 997, "epoch": 0.040044985339599146, "loss": -0.0604, "grad_norm": 5.503066539764404, "learning_rate": 6.981818181818183e-06, "num_tokens": 2024833.0, "completions/mean_length": 116.375, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 59.857147216796875, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.3735466003417969, "rewards/meter/std": 0.37652871012687683, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9714733362197876, "rewards/lexical_plausibility/std": 0.05957445502281189, "rewards/judge_quality/mean": 0.4312499761581421, "rewards/judge_quality/std": 0.2034303992986679, "rewards/repeat_penalty/mean": 0.9736570119857788, "rewards/repeat_penalty/std": 0.02958020195364952, "rewards/near_duplicate_penalty/mean": 0.9806067943572998, "rewards/near_duplicate_penalty/std": 0.020286794751882553, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.1606295257806778, "rewards/total_composite/std": 0.1760026067495346, "reward": 0.1606295257806778, "reward_std": 0.1760026067495346, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13005565106868744, "sampling/sampling_logp_difference/max": 2.1428146362304688, "sampling/importance_sampling_ratio/min": 0.11732415854930878, "sampling/importance_sampling_ratio/mean": 0.9885691404342651, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.35430509597063065, "clip_ratio/low_mean": 0.05167744169011712, "clip_ratio/low_min": 0.05167744169011712, "clip_ratio/high_mean": 0.01801715325564146, "clip_ratio/high_max": 0.01801715325564146, "clip_ratio/region_mean": 0.06969459494575858, "reward_total_mean": 0.1606295257806778, "reward_meter_mean": 0.3735466003417969, "reward_meter_std": 0.37652871012687683, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9714733362197876, "reward_lexical_plausibility_std": 0.05957445502281189, "reward_repeat_penalty_mean": 0.9736570119857788, "reward_repeat_penalty_std": 0.02958020195364952, "reward_near_duplicate_penalty_mean": 0.9806067943572998, "reward_near_duplicate_penalty_std": 0.020286794751882553, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.4312499761581421, "reward_judge_quality_std": 0.2034303992986679, "reward_total_composite_mean": 0.1606295257806778, "reward_total_composite_std": 0.1760026067495346} {"timestamp_utc": "2026-04-12T14:46:09Z", "mode": "train", "global_step": 998, "epoch": 0.0400851508213841, "loss": -0.0778, "grad_norm": 3.5188589096069336, "learning_rate": 6.978787878787879e-06, "num_tokens": 2026240.0, "completions/mean_length": 89.875, "completions/min_length": 27.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 29.571430206298828, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.9511470794677734, "rewards/meter/std": 0.05642685666680336, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9348700046539307, "rewards/lexical_plausibility/std": 0.1206575408577919, "rewards/judge_quality/mean": 0.752500057220459, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.6575287580490112, "rewards/repeat_penalty/std": 0.19856330752372742, "rewards/near_duplicate_penalty/mean": 0.9058570861816406, "rewards/near_duplicate_penalty/std": 0.11396578699350357, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.90974360704422, "rewards/distinct_2/std": 0.12743444740772247, "rewards/total_composite/mean": 0.7146866321563721, "rewards/total_composite/std": 0.329754114151001, "reward": 0.7146866321563721, "reward_std": 0.3297540843486786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11943802982568741, "sampling/sampling_logp_difference/max": 2.5625662803649902, "sampling/importance_sampling_ratio/min": 0.07710660994052887, "sampling/importance_sampling_ratio/mean": 0.9861419200897217, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3236630205065012, "clip_ratio/low_mean": 0.012096773833036423, "clip_ratio/low_min": 0.012096773833036423, "clip_ratio/high_mean": 0.08018164988607168, "clip_ratio/high_max": 0.08018164988607168, "clip_ratio/region_mean": 0.0922784237191081, "reward_total_mean": 0.7146866321563721, "reward_meter_mean": 0.9511470794677734, "reward_meter_std": 0.05642685666680336, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9348700046539307, "reward_lexical_plausibility_std": 0.1206575408577919, "reward_repeat_penalty_mean": 0.6575287580490112, "reward_repeat_penalty_std": 0.19856330752372742, "reward_near_duplicate_penalty_mean": 0.9058570861816406, "reward_near_duplicate_penalty_std": 0.11396578699350357, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.90974360704422, "reward_distinct_2_std": 0.12743444740772247, "reward_judge_quality_mean": 0.752500057220459, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.7146866321563721, "reward_total_composite_std": 0.329754114151001} {"timestamp_utc": "2026-04-12T14:46:23Z", "mode": "train", "global_step": 999, "epoch": 0.040125316303169054, "loss": -0.118, "grad_norm": 2.2460145950317383, "learning_rate": 6.975757575757577e-06, "num_tokens": 2027889.0, "completions/mean_length": 233.125, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 65.80000305175781, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.3810475468635559, "rewards/meter/std": 0.34137123823165894, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8971705436706543, "rewards/lexical_plausibility/std": 0.14915716648101807, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.22320714592933655, "rewards/repeat_penalty/mean": 0.9307105541229248, "rewards/repeat_penalty/std": 0.10673901438713074, "rewards/near_duplicate_penalty/mean": 0.9803764224052429, "rewards/near_duplicate_penalty/std": 0.025375651195645332, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9785828590393066, "rewards/distinct_2/std": 0.03611748293042183, "rewards/total_composite/mean": 0.11651533097028732, "rewards/total_composite/std": 0.13248947262763977, "reward": 0.11651533097028732, "reward_std": 0.13248947262763977, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1157555878162384, "sampling/sampling_logp_difference/max": 1.4340004920959473, "sampling/importance_sampling_ratio/min": 0.24378632009029388, "sampling/importance_sampling_ratio/mean": 1.005470633506775, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4111524745821953, "clip_ratio/low_mean": 0.023634454235434532, "clip_ratio/low_min": 0.023634454235434532, "clip_ratio/high_mean": 0.02964559430256486, "clip_ratio/high_max": 0.02964559430256486, "clip_ratio/region_mean": 0.05328004853799939, "reward_total_mean": 0.11651533097028732, "reward_meter_mean": 0.3810475468635559, "reward_meter_std": 0.34137123823165894, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8971705436706543, "reward_lexical_plausibility_std": 0.14915716648101807, "reward_repeat_penalty_mean": 0.9307105541229248, "reward_repeat_penalty_std": 0.10673901438713074, "reward_near_duplicate_penalty_mean": 0.9803764224052429, "reward_near_duplicate_penalty_std": 0.025375651195645332, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9785828590393066, "reward_distinct_2_std": 0.03611748293042183, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.22320714592933655, "reward_total_composite_mean": 0.11651533097028732, "reward_total_composite_std": 0.13248947262763977} {"timestamp_utc": "2026-04-12T14:46:33Z", "mode": "train", "global_step": 1000, "epoch": 0.04016548178495401, "loss": 0.0321, "grad_norm": 8.04367733001709, "learning_rate": 6.9727272727272735e-06, "num_tokens": 2029980.0, "completions/mean_length": 90.375, "completions/min_length": 86.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.375, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.4259508550167084, "rewards/meter/std": 0.33860698342323303, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.770172119140625, "rewards/repeat_penalty/std": 0.24134013056755066, "rewards/near_duplicate_penalty/mean": 0.9159718751907349, "rewards/near_duplicate_penalty/std": 0.06320098042488098, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8654276728630066, "rewards/distinct_2/std": 0.1894504278898239, "rewards/total_composite/mean": 0.14330320060253143, "rewards/total_composite/std": 0.15179672837257385, "reward": 0.14330320060253143, "reward_std": 0.15179671347141266, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11694381386041641, "sampling/sampling_logp_difference/max": 1.7405447959899902, "sampling/importance_sampling_ratio/min": 0.17542479932308197, "sampling/importance_sampling_ratio/mean": 1.0054761171340942, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7396683618426323, "clip_ratio/low_mean": 0.05706383567303419, "clip_ratio/low_min": 0.05706383567303419, "clip_ratio/high_mean": 0.06889655813574791, "clip_ratio/high_max": 0.06889655813574791, "clip_ratio/region_mean": 0.1259603938087821, "reward_total_mean": 0.14330320060253143, "reward_meter_mean": 0.4259508550167084, "reward_meter_std": 0.33860698342323303, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.770172119140625, "reward_repeat_penalty_std": 0.24134013056755066, "reward_near_duplicate_penalty_mean": 0.9159718751907349, "reward_near_duplicate_penalty_std": 0.06320098042488098, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8654276728630066, "reward_distinct_2_std": 0.1894504278898239, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.14330320060253143, "reward_total_composite_std": 0.15179672837257385} {"timestamp_utc": "2026-04-12T14:49:01Z", "mode": "eval", "global_step": 1000, "epoch": 0.04016548178495401, "eval_loss": NaN, "eval_runtime": 147.7034, "eval_samples_per_second": 0.704, "eval_steps_per_second": 0.088, "eval_num_tokens": 2029980.0, "eval_completions/mean_length": 256.96153846153845, "eval_completions/min_length": 44.07692307692308, "eval_completions/max_length": 512.0, "eval_completions/clipped_ratio": 0.27884615384615385, "eval_completions/mean_terminated_length": 157.76264190673828, "eval_completions/min_terminated_length": 44.07692307692308, "eval_completions/max_terminated_length": 308.3076923076923, "eval_rewards/meter/mean": 0.4314915342972829, "eval_rewards/meter/std": 0.36755329828995925, "eval_rewards/count_adherence/mean": 0.7969282819674566, "eval_rewards/count_adherence/std": 0.2405730955875837, "eval_rewards/arabic_clean/mean": 0.9615384615384616, "eval_rewards/arabic_clean/std": 0.06700789240690377, "eval_rewards/lexical_plausibility/mean": 0.981945853966933, "eval_rewards/lexical_plausibility/std": 0.03274063712272506, "eval_rewards/judge_quality/mean": 0.23701923053998214, "eval_rewards/judge_quality/std": 0.18446642962785867, "eval_rewards/repeat_penalty/mean": 0.3449514794808168, "eval_rewards/repeat_penalty/std": 0.3808590930241805, "eval_rewards/near_duplicate_penalty/mean": 0.6952358713516822, "eval_rewards/near_duplicate_penalty/std": 0.24378586560487747, "eval_rewards/opening_diversity/mean": 0.7192492668445294, "eval_rewards/opening_diversity/std": 0.3173264849644441, "eval_rewards/distinct_2/mean": 0.4128593011544301, "eval_rewards/distinct_2/std": 0.41273009318571824, "eval_rewards/total_composite/mean": 0.09094488534789819, "eval_rewards/total_composite/std": 0.1357112294779374, "eval_reward": 0.09094488534789819, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.03131374329901659, "eval_sampling/sampling_logp_difference/max": 0.8352567232572116, "eval_sampling/importance_sampling_ratio/min": 0.45060978027490467, "eval_sampling/importance_sampling_ratio/mean": 1.0072243763850286, "eval_sampling/importance_sampling_ratio/max": 1.5050187569398146, "eval_entropy": 0.32988868539149946, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.09094488534789819, "eval_reward_meter_mean": 0.4314915342972829, "eval_reward_meter_std": 0.36755329828995925, "eval_reward_count_adherence_mean": 0.7969282819674566, "eval_reward_count_adherence_std": 0.2405730955875837, "eval_reward_arabic_clean_mean": 0.9615384615384616, "eval_reward_arabic_clean_std": 0.06700789240690377, "eval_reward_lexical_plausibility_mean": 0.981945853966933, "eval_reward_lexical_plausibility_std": 0.03274063712272506, "eval_reward_repeat_penalty_mean": 0.3449514794808168, "eval_reward_repeat_penalty_std": 0.3808590930241805, "eval_reward_near_duplicate_penalty_mean": 0.6952358713516822, "eval_reward_near_duplicate_penalty_std": 0.24378586560487747, "eval_reward_opening_diversity_mean": 0.7192492668445294, "eval_reward_opening_diversity_std": 0.3173264849644441, "eval_reward_distinct_2_mean": 0.4128593011544301, "eval_reward_distinct_2_std": 0.41273009318571824, "eval_reward_judge_quality_mean": 0.23701923053998214, "eval_reward_judge_quality_std": 0.18446642962785867, "eval_reward_total_composite_mean": 0.09094488534789819, "eval_reward_total_composite_std": 0.1357112294779374} {"timestamp_utc": "2026-04-12T14:49:16Z", "mode": "train", "global_step": 1001, "epoch": 0.04020564726673896, "loss": -0.0375, "grad_norm": 3.9714503288269043, "learning_rate": 6.969696969696971e-06, "num_tokens": 2031511.0, "completions/mean_length": 105.375, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.28571701049805, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.28398823738098145, "rewards/meter/std": 0.2592170834541321, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.970693826675415, "rewards/lexical_plausibility/std": 0.08289031684398651, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.28972893953323364, "rewards/repeat_penalty/mean": 0.9407724142074585, "rewards/repeat_penalty/std": 0.10241445153951645, "rewards/near_duplicate_penalty/mean": 0.9902974963188171, "rewards/near_duplicate_penalty/std": 0.018226707354187965, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.1736394762992859, "rewards/total_composite/std": 0.19033192098140717, "reward": 0.1736394762992859, "reward_std": 0.19033192098140717, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13567040860652924, "sampling/sampling_logp_difference/max": 1.5328576564788818, "sampling/importance_sampling_ratio/min": 0.21591776609420776, "sampling/importance_sampling_ratio/mean": 0.9989410042762756, "sampling/importance_sampling_ratio/max": 1.9708611965179443, "entropy": 0.6063445881009102, "clip_ratio/low_mean": 0.08616565633565187, "clip_ratio/low_min": 0.08616565633565187, "clip_ratio/high_mean": 0.06323696300387383, "clip_ratio/high_max": 0.06323696300387383, "clip_ratio/region_mean": 0.1494026193395257, "reward_total_mean": 0.1736394762992859, "reward_meter_mean": 0.28398823738098145, "reward_meter_std": 0.2592170834541321, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.970693826675415, "reward_lexical_plausibility_std": 0.08289031684398651, "reward_repeat_penalty_mean": 0.9407724142074585, "reward_repeat_penalty_std": 0.10241445153951645, "reward_near_duplicate_penalty_mean": 0.9902974963188171, "reward_near_duplicate_penalty_std": 0.018226707354187965, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.28972893953323364, "reward_total_composite_mean": 0.1736394762992859, "reward_total_composite_std": 0.19033192098140717} {"timestamp_utc": "2026-04-12T14:49:30Z", "mode": "train", "global_step": 1002, "epoch": 0.040245812748523915, "loss": -0.0211, "grad_norm": 6.3390793800354, "learning_rate": 6.966666666666667e-06, "num_tokens": 2032904.0, "completions/mean_length": 98.125, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.18136833608150482, "rewards/meter/std": 0.3299355208873749, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9596225023269653, "rewards/lexical_plausibility/std": 0.11420483142137527, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.7080590724945068, "rewards/repeat_penalty/std": 0.12625540792942047, "rewards/near_duplicate_penalty/mean": 0.8970104455947876, "rewards/near_duplicate_penalty/std": 0.06268128752708435, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8180110454559326, "rewards/distinct_2/std": 0.13785549998283386, "rewards/total_composite/mean": 0.041882578283548355, "rewards/total_composite/std": 0.04958256706595421, "reward": 0.041882578283548355, "reward_std": 0.04958256706595421, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12469225376844406, "sampling/sampling_logp_difference/max": 2.209979772567749, "sampling/importance_sampling_ratio/min": 0.10970286279916763, "sampling/importance_sampling_ratio/mean": 0.9950018525123596, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5036148615181446, "clip_ratio/low_mean": 0.04411446349695325, "clip_ratio/low_min": 0.04411446349695325, "clip_ratio/high_mean": 0.048820249270647764, "clip_ratio/high_max": 0.048820249270647764, "clip_ratio/region_mean": 0.09293471276760101, "reward_total_mean": 0.041882578283548355, "reward_meter_mean": 0.18136833608150482, "reward_meter_std": 0.3299355208873749, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9596225023269653, "reward_lexical_plausibility_std": 0.11420483142137527, "reward_repeat_penalty_mean": 0.7080590724945068, "reward_repeat_penalty_std": 0.12625540792942047, "reward_near_duplicate_penalty_mean": 0.8970104455947876, "reward_near_duplicate_penalty_std": 0.06268128752708435, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8180110454559326, "reward_distinct_2_std": 0.13785549998283386, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.041882578283548355, "reward_total_composite_std": 0.04958256706595421} {"timestamp_utc": "2026-04-12T14:49:43Z", "mode": "train", "global_step": 1003, "epoch": 0.04028597823030887, "loss": -0.1572, "grad_norm": 3.547816276550293, "learning_rate": 6.963636363636364e-06, "num_tokens": 2035103.0, "completions/mean_length": 155.875, "completions/min_length": 85.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 105.00000762939453, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 120.0, "rewards/meter/mean": 0.7965437173843384, "rewards/meter/std": 0.30849045515060425, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9801627397537231, "rewards/lexical_plausibility/std": 0.056108247488737106, "rewards/judge_quality/mean": 0.17499999701976776, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.5346405506134033, "rewards/repeat_penalty/std": 0.22748194634914398, "rewards/near_duplicate_penalty/mean": 0.813302755355835, "rewards/near_duplicate_penalty/std": 0.1031440794467926, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.6712074279785156, "rewards/distinct_2/std": 0.21098695695400238, "rewards/total_composite/mean": 0.10118478536605835, "rewards/total_composite/std": 0.05983646959066391, "reward": 0.10118478536605835, "reward_std": 0.05983646959066391, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09340889751911163, "sampling/sampling_logp_difference/max": 1.6200447082519531, "sampling/importance_sampling_ratio/min": 0.19788984954357147, "sampling/importance_sampling_ratio/mean": 1.0012426376342773, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3998628482222557, "clip_ratio/low_mean": 0.012519201263785362, "clip_ratio/low_min": 0.012519201263785362, "clip_ratio/high_mean": 0.056228159461170435, "clip_ratio/high_max": 0.056228159461170435, "clip_ratio/region_mean": 0.0687473607249558, "reward_total_mean": 0.10118478536605835, "reward_meter_mean": 0.7965437173843384, "reward_meter_std": 0.30849045515060425, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9801627397537231, "reward_lexical_plausibility_std": 0.056108247488737106, "reward_repeat_penalty_mean": 0.5346405506134033, "reward_repeat_penalty_std": 0.22748194634914398, "reward_near_duplicate_penalty_mean": 0.813302755355835, "reward_near_duplicate_penalty_std": 0.1031440794467926, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.6712074279785156, "reward_distinct_2_std": 0.21098695695400238, "reward_judge_quality_mean": 0.17499999701976776, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.10118478536605835, "reward_total_composite_std": 0.05983646959066391} {"timestamp_utc": "2026-04-12T14:49:57Z", "mode": "train", "global_step": 1004, "epoch": 0.04032614371209382, "loss": -0.0675, "grad_norm": 2.0703108310699463, "learning_rate": 6.960606060606061e-06, "num_tokens": 2036618.0, "completions/mean_length": 228.375, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 58.20000076293945, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.34577107429504395, "rewards/meter/std": 0.40819546580314636, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8809272050857544, "rewards/lexical_plausibility/std": 0.18054750561714172, "rewards/judge_quality/mean": 0.20624999701976776, "rewards/judge_quality/std": 0.1590990275144577, "rewards/repeat_penalty/mean": 0.7737113237380981, "rewards/repeat_penalty/std": 0.23971515893936157, "rewards/near_duplicate_penalty/mean": 0.8543292284011841, "rewards/near_duplicate_penalty/std": 0.12977567315101624, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9022855162620544, "rewards/distinct_2/std": 0.13790582120418549, "rewards/total_composite/mean": 0.062010399997234344, "rewards/total_composite/std": 0.07427313923835754, "reward": 0.062010399997234344, "reward_std": 0.07427313923835754, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10309043526649475, "sampling/sampling_logp_difference/max": 3.445627450942993, "sampling/importance_sampling_ratio/min": 0.03188474848866463, "sampling/importance_sampling_ratio/mean": 1.0156586170196533, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2901155650615692, "clip_ratio/low_mean": 0.016960651613771915, "clip_ratio/low_min": 0.016960651613771915, "clip_ratio/high_mean": 0.030373553279787302, "clip_ratio/high_max": 0.030373553279787302, "clip_ratio/region_mean": 0.04733420489355922, "reward_total_mean": 0.062010399997234344, "reward_meter_mean": 0.34577107429504395, "reward_meter_std": 0.40819546580314636, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8809272050857544, "reward_lexical_plausibility_std": 0.18054750561714172, "reward_repeat_penalty_mean": 0.7737113237380981, "reward_repeat_penalty_std": 0.23971515893936157, "reward_near_duplicate_penalty_mean": 0.8543292284011841, "reward_near_duplicate_penalty_std": 0.12977567315101624, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9022855162620544, "reward_distinct_2_std": 0.13790582120418549, "reward_judge_quality_mean": 0.20624999701976776, "reward_judge_quality_std": 0.1590990275144577, "reward_total_composite_mean": 0.062010399997234344, "reward_total_composite_std": 0.07427313923835754} {"timestamp_utc": "2026-04-12T14:50:06Z", "mode": "train", "global_step": 1005, "epoch": 0.04036630919387878, "loss": -0.022, "grad_norm": 6.288625240325928, "learning_rate": 6.957575757575759e-06, "num_tokens": 2039289.0, "completions/mean_length": 132.875, "completions/min_length": 119.0, "completions/max_length": 148.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.875, "completions/min_terminated_length": 119.0, "completions/max_terminated_length": 148.0, "rewards/meter/mean": 0.5801243185997009, "rewards/meter/std": 0.43735790252685547, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.12380699813365936, "rewards/repeat_penalty/std": 0.12617744505405426, "rewards/near_duplicate_penalty/mean": 0.6660910844802856, "rewards/near_duplicate_penalty/std": 0.14987289905548096, "rewards/opening_diversity/mean": 0.8791666030883789, "rewards/opening_diversity/std": 0.09708039462566376, "rewards/distinct_2/mean": 0.21273569762706757, "rewards/distinct_2/std": 0.19339588284492493, "rewards/total_composite/mean": 0.12219199538230896, "rewards/total_composite/std": 0.11519946157932281, "reward": 0.12219199538230896, "reward_std": 0.11519946157932281, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.067280612885952, "sampling/sampling_logp_difference/max": 1.8679523468017578, "sampling/importance_sampling_ratio/min": 0.15443958342075348, "sampling/importance_sampling_ratio/mean": 1.0054123401641846, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.33262037485837936, "clip_ratio/low_mean": 0.03251151228323579, "clip_ratio/low_min": 0.03251151228323579, "clip_ratio/high_mean": 0.03645447944290936, "clip_ratio/high_max": 0.03645447944290936, "clip_ratio/region_mean": 0.06896599172614515, "reward_total_mean": 0.12219199538230896, "reward_meter_mean": 0.5801243185997009, "reward_meter_std": 0.43735790252685547, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.12380699813365936, "reward_repeat_penalty_std": 0.12617744505405426, "reward_near_duplicate_penalty_mean": 0.6660910844802856, "reward_near_duplicate_penalty_std": 0.14987289905548096, "reward_opening_diversity_mean": 0.8791666030883789, "reward_opening_diversity_std": 0.09708039462566376, "reward_distinct_2_mean": 0.21273569762706757, "reward_distinct_2_std": 0.19339588284492493, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.12219199538230896, "reward_total_composite_std": 0.11519946157932281} {"timestamp_utc": "2026-04-12T14:50:19Z", "mode": "train", "global_step": 1006, "epoch": 0.04040647467566374, "loss": -0.0034, "grad_norm": 4.988742351531982, "learning_rate": 6.954545454545455e-06, "num_tokens": 2041138.0, "completions/mean_length": 139.125, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 85.85714721679688, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.47990572452545166, "rewards/meter/std": 0.45544543862342834, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9599024057388306, "rewards/lexical_plausibility/std": 0.11341319233179092, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.5238727331161499, "rewards/repeat_penalty/std": 0.35384947061538696, "rewards/near_duplicate_penalty/mean": 0.79697585105896, "rewards/near_duplicate_penalty/std": 0.20894178748130798, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.29124119877815247, "rewards/distinct_2/mean": 0.6515576243400574, "rewards/distinct_2/std": 0.3078213334083557, "rewards/total_composite/mean": 0.08327089250087738, "rewards/total_composite/std": 0.08128806948661804, "reward": 0.08327089250087738, "reward_std": 0.08128806203603745, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08831564337015152, "sampling/sampling_logp_difference/max": 1.5496015548706055, "sampling/importance_sampling_ratio/min": 0.2123325616121292, "sampling/importance_sampling_ratio/mean": 1.0111733675003052, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4837537780404091, "clip_ratio/low_mean": 0.025016087107360363, "clip_ratio/low_min": 0.025016087107360363, "clip_ratio/high_mean": 0.07756210002116859, "clip_ratio/high_max": 0.07756210002116859, "clip_ratio/region_mean": 0.10257818712852895, "reward_total_mean": 0.08327089250087738, "reward_meter_mean": 0.47990572452545166, "reward_meter_std": 0.45544543862342834, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9599024057388306, "reward_lexical_plausibility_std": 0.11341319233179092, "reward_repeat_penalty_mean": 0.5238727331161499, "reward_repeat_penalty_std": 0.35384947061538696, "reward_near_duplicate_penalty_mean": 0.79697585105896, "reward_near_duplicate_penalty_std": 0.20894178748130798, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.29124119877815247, "reward_distinct_2_mean": 0.6515576243400574, "reward_distinct_2_std": 0.3078213334083557, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.08327089250087738, "reward_total_composite_std": 0.08128806948661804} {"timestamp_utc": "2026-04-12T14:50:33Z", "mode": "train", "global_step": 1007, "epoch": 0.04044664015744869, "loss": -0.0664, "grad_norm": 1.8367737531661987, "learning_rate": 6.951515151515153e-06, "num_tokens": 2042633.0, "completions/mean_length": 281.875, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 51.75, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7451859712600708, "rewards/meter/std": 0.3604169487953186, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.850554347038269, "rewards/lexical_plausibility/std": 0.16505010426044464, "rewards/judge_quality/mean": 0.20874999463558197, "rewards/judge_quality/std": 0.18098440766334534, "rewards/repeat_penalty/mean": 0.9535529613494873, "rewards/repeat_penalty/std": 0.09540250897407532, "rewards/near_duplicate_penalty/mean": 0.9853535890579224, "rewards/near_duplicate_penalty/std": 0.023111911490559578, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9983469247817993, "rewards/distinct_2/std": 0.0046756030060350895, "rewards/total_composite/mean": 0.11863739043474197, "rewards/total_composite/std": 0.16427050530910492, "reward": 0.11863739043474197, "reward_std": 0.16427049040794373, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11549889296293259, "sampling/sampling_logp_difference/max": 1.4535958766937256, "sampling/importance_sampling_ratio/min": 0.2337283194065094, "sampling/importance_sampling_ratio/mean": 1.0086487531661987, "sampling/importance_sampling_ratio/max": 1.9590433835983276, "entropy": 0.2860126793384552, "clip_ratio/low_mean": 0.010204081423580647, "clip_ratio/low_min": 0.010204081423580647, "clip_ratio/high_mean": 0.043494854122400284, "clip_ratio/high_max": 0.043494854122400284, "clip_ratio/region_mean": 0.05369893554598093, "reward_total_mean": 0.11863739043474197, "reward_meter_mean": 0.7451859712600708, "reward_meter_std": 0.3604169487953186, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.850554347038269, "reward_lexical_plausibility_std": 0.16505010426044464, "reward_repeat_penalty_mean": 0.9535529613494873, "reward_repeat_penalty_std": 0.09540250897407532, "reward_near_duplicate_penalty_mean": 0.9853535890579224, "reward_near_duplicate_penalty_std": 0.023111911490559578, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9983469247817993, "reward_distinct_2_std": 0.0046756030060350895, "reward_judge_quality_mean": 0.20874999463558197, "reward_judge_quality_std": 0.18098440766334534, "reward_total_composite_mean": 0.11863739043474197, "reward_total_composite_std": 0.16427050530910492} {"timestamp_utc": "2026-04-12T14:50:47Z", "mode": "train", "global_step": 1008, "epoch": 0.040486805639233646, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.948484848484849e-06, "num_tokens": 2044201.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.7862903475761414, "rewards/meter/std": 0.20163999497890472, "rewards/count_adherence/mean": 0.4553571343421936, "rewards/count_adherence/std": 0.16170331835746765, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9191277027130127, "rewards/lexical_plausibility/std": 0.15767855942249298, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.02640357054769993, "rewards/repeat_penalty/std": 0.06918352097272873, "rewards/near_duplicate_penalty/mean": 0.4383179545402527, "rewards/near_duplicate_penalty/std": 0.20757566392421722, "rewards/opening_diversity/mean": 0.38697630167007446, "rewards/opening_diversity/std": 0.3496139645576477, "rewards/distinct_2/mean": 0.19237789511680603, "rewards/distinct_2/std": 0.3637513518333435, "rewards/total_composite/mean": 0.04245631396770477, "rewards/total_composite/std": 0.02771882899105549, "reward": 0.04245631396770477, "reward_std": 0.02771882899105549, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.04245631396770477, "reward_meter_mean": 0.7862903475761414, "reward_meter_std": 0.20163999497890472, "reward_count_adherence_mean": 0.4553571343421936, "reward_count_adherence_std": 0.16170331835746765, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9191277027130127, "reward_lexical_plausibility_std": 0.15767855942249298, "reward_repeat_penalty_mean": 0.02640357054769993, "reward_repeat_penalty_std": 0.06918352097272873, "reward_near_duplicate_penalty_mean": 0.4383179545402527, "reward_near_duplicate_penalty_std": 0.20757566392421722, "reward_opening_diversity_mean": 0.38697630167007446, "reward_opening_diversity_std": 0.3496139645576477, "reward_distinct_2_mean": 0.19237789511680603, "reward_distinct_2_std": 0.3637513518333435, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.04245631396770477, "reward_total_composite_std": 0.02771882899105549} {"timestamp_utc": "2026-04-12T14:51:00Z", "mode": "train", "global_step": 1009, "epoch": 0.0405269711210186, "loss": -0.0533, "grad_norm": 6.875668048858643, "learning_rate": 6.945454545454546e-06, "num_tokens": 2046171.0, "completions/mean_length": 136.25, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 82.5714340209961, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.5190771222114563, "rewards/meter/std": 0.41183415055274963, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9531154632568359, "rewards/lexical_plausibility/std": 0.13260941207408905, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.7970947027206421, "rewards/repeat_penalty/std": 0.13408467173576355, "rewards/near_duplicate_penalty/mean": 0.92569899559021, "rewards/near_duplicate_penalty/std": 0.0491853728890419, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8782718181610107, "rewards/distinct_2/std": 0.08077096194028854, "rewards/total_composite/mean": 0.11063134670257568, "rewards/total_composite/std": 0.12931987643241882, "reward": 0.11063134670257568, "reward_std": 0.12931987643241882, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11841348558664322, "sampling/sampling_logp_difference/max": 1.5015144348144531, "sampling/importance_sampling_ratio/min": 0.22279250621795654, "sampling/importance_sampling_ratio/mean": 1.0072684288024902, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6490747630596161, "clip_ratio/low_mean": 0.062433586455881596, "clip_ratio/low_min": 0.062433586455881596, "clip_ratio/high_mean": 0.04343796148896217, "clip_ratio/high_max": 0.04343796148896217, "clip_ratio/region_mean": 0.10587154794484377, "reward_total_mean": 0.11063134670257568, "reward_meter_mean": 0.5190771222114563, "reward_meter_std": 0.41183415055274963, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9531154632568359, "reward_lexical_plausibility_std": 0.13260941207408905, "reward_repeat_penalty_mean": 0.7970947027206421, "reward_repeat_penalty_std": 0.13408467173576355, "reward_near_duplicate_penalty_mean": 0.92569899559021, "reward_near_duplicate_penalty_std": 0.0491853728890419, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8782718181610107, "reward_distinct_2_std": 0.08077096194028854, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.11063134670257568, "reward_total_composite_std": 0.12931987643241882} {"timestamp_utc": "2026-04-12T14:51:15Z", "mode": "train", "global_step": 1010, "epoch": 0.040567136602803554, "loss": -0.1126, "grad_norm": 1.9073106050491333, "learning_rate": 6.942424242424243e-06, "num_tokens": 2047701.0, "completions/mean_length": 167.25, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 52.333335876464844, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.6894205808639526, "rewards/meter/std": 0.3634391129016876, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9311843514442444, "rewards/lexical_plausibility/std": 0.12742556631565094, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.9380592107772827, "rewards/repeat_penalty/std": 0.0699658989906311, "rewards/near_duplicate_penalty/mean": 0.9716432094573975, "rewards/near_duplicate_penalty/std": 0.01796828769147396, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9655306339263916, "rewards/distinct_2/std": 0.07098367065191269, "rewards/total_composite/mean": 0.23814599215984344, "rewards/total_composite/std": 0.16449278593063354, "reward": 0.23814599215984344, "reward_std": 0.16449278593063354, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10613491386175156, "sampling/sampling_logp_difference/max": 1.6188807487487793, "sampling/importance_sampling_ratio/min": 0.1981203258037567, "sampling/importance_sampling_ratio/mean": 1.0171749591827393, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5171218290925026, "clip_ratio/low_mean": 0.0078125, "clip_ratio/low_min": 0.0078125, "clip_ratio/high_mean": 0.05042328080162406, "clip_ratio/high_max": 0.05042328080162406, "clip_ratio/region_mean": 0.05823578080162406, "reward_total_mean": 0.23814599215984344, "reward_meter_mean": 0.6894205808639526, "reward_meter_std": 0.3634391129016876, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9311843514442444, "reward_lexical_plausibility_std": 0.12742556631565094, "reward_repeat_penalty_mean": 0.9380592107772827, "reward_repeat_penalty_std": 0.0699658989906311, "reward_near_duplicate_penalty_mean": 0.9716432094573975, "reward_near_duplicate_penalty_std": 0.01796828769147396, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9655306339263916, "reward_distinct_2_std": 0.07098367065191269, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.23814599215984344, "reward_total_composite_std": 0.16449278593063354} {"timestamp_utc": "2026-04-12T14:51:28Z", "mode": "train", "global_step": 1011, "epoch": 0.04060730208458851, "loss": -0.0656, "grad_norm": 3.996352434158325, "learning_rate": 6.93939393939394e-06, "num_tokens": 2049358.0, "completions/mean_length": 109.125, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.57143020629883, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.7323673963546753, "rewards/meter/std": 0.3175550401210785, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9644086360931396, "rewards/lexical_plausibility/std": 0.1006675586104393, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.2133910059928894, "rewards/repeat_penalty/mean": 0.750518798828125, "rewards/repeat_penalty/std": 0.3046644628047943, "rewards/near_duplicate_penalty/mean": 0.9092114567756653, "rewards/near_duplicate_penalty/std": 0.06783723831176758, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8898155689239502, "rewards/distinct_2/std": 0.14818856120109558, "rewards/total_composite/mean": 0.327912300825119, "rewards/total_composite/std": 0.21722827851772308, "reward": 0.327912300825119, "reward_std": 0.21722827851772308, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1013401448726654, "sampling/sampling_logp_difference/max": 1.9297844171524048, "sampling/importance_sampling_ratio/min": 0.14517949521541595, "sampling/importance_sampling_ratio/mean": 1.0008724927902222, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4322999492287636, "clip_ratio/low_mean": 0.0066964286379516125, "clip_ratio/low_min": 0.0066964286379516125, "clip_ratio/high_mean": 0.07299076020717621, "clip_ratio/high_max": 0.07299076020717621, "clip_ratio/region_mean": 0.07968718884512782, "reward_total_mean": 0.327912300825119, "reward_meter_mean": 0.7323673963546753, "reward_meter_std": 0.3175550401210785, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9644086360931396, "reward_lexical_plausibility_std": 0.1006675586104393, "reward_repeat_penalty_mean": 0.750518798828125, "reward_repeat_penalty_std": 0.3046644628047943, "reward_near_duplicate_penalty_mean": 0.9092114567756653, "reward_near_duplicate_penalty_std": 0.06783723831176758, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8898155689239502, "reward_distinct_2_std": 0.14818856120109558, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.2133910059928894, "reward_total_composite_mean": 0.327912300825119, "reward_total_composite_std": 0.21722827851772308} {"timestamp_utc": "2026-04-12T14:51:38Z", "mode": "train", "global_step": 1012, "epoch": 0.04064746756637346, "loss": -0.0083, "grad_norm": 10.422324180603027, "learning_rate": 6.936363636363636e-06, "num_tokens": 2051407.0, "completions/mean_length": 84.125, "completions/min_length": 59.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.125, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.6902055144309998, "rewards/meter/std": 0.314127653837204, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.7271653413772583, "rewards/repeat_penalty/std": 0.2486673891544342, "rewards/near_duplicate_penalty/mean": 0.9066400527954102, "rewards/near_duplicate_penalty/std": 0.07484584301710129, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.84401535987854, "rewards/distinct_2/std": 0.14852824807167053, "rewards/total_composite/mean": 0.20311975479125977, "rewards/total_composite/std": 0.11119531095027924, "reward": 0.20311975479125977, "reward_std": 0.11119531095027924, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10833962261676788, "sampling/sampling_logp_difference/max": 1.4471979141235352, "sampling/importance_sampling_ratio/min": 0.2352285087108612, "sampling/importance_sampling_ratio/mean": 1.011983871459961, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5167733803391457, "clip_ratio/low_mean": 0.0486882459372282, "clip_ratio/low_min": 0.0486882459372282, "clip_ratio/high_mean": 0.042902862187474966, "clip_ratio/high_max": 0.042902862187474966, "clip_ratio/region_mean": 0.09159110812470317, "reward_total_mean": 0.20311975479125977, "reward_meter_mean": 0.6902055144309998, "reward_meter_std": 0.314127653837204, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.7271653413772583, "reward_repeat_penalty_std": 0.2486673891544342, "reward_near_duplicate_penalty_mean": 0.9066400527954102, "reward_near_duplicate_penalty_std": 0.07484584301710129, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.84401535987854, "reward_distinct_2_std": 0.14852824807167053, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.20311975479125977, "reward_total_composite_std": 0.11119531095027924} {"timestamp_utc": "2026-04-12T14:51:47Z", "mode": "train", "global_step": 1013, "epoch": 0.040687633048158416, "loss": 0.0269, "grad_norm": 9.366815567016602, "learning_rate": 6.9333333333333344e-06, "num_tokens": 2053473.0, "completions/mean_length": 90.25, "completions/min_length": 83.0, "completions/max_length": 99.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.25, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.7935206890106201, "rewards/meter/std": 0.1681874543428421, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.1927071362733841, "rewards/repeat_penalty/std": 0.0855286493897438, "rewards/near_duplicate_penalty/mean": 0.792396605014801, "rewards/near_duplicate_penalty/std": 0.0862075611948967, "rewards/opening_diversity/mean": 0.34375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.6951733231544495, "rewards/distinct_2/std": 0.0892522931098938, "rewards/total_composite/mean": 0.277732253074646, "rewards/total_composite/std": 0.05886560678482056, "reward": 0.277732253074646, "reward_std": 0.058865610510110855, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08801070600748062, "sampling/sampling_logp_difference/max": 1.9264554977416992, "sampling/importance_sampling_ratio/min": 0.14566358923912048, "sampling/importance_sampling_ratio/mean": 0.9931285381317139, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4531378522515297, "clip_ratio/low_mean": 0.046969751827418804, "clip_ratio/low_min": 0.046969751827418804, "clip_ratio/high_mean": 0.03944897651672363, "clip_ratio/high_max": 0.03944897651672363, "clip_ratio/region_mean": 0.08641872834414244, "reward_total_mean": 0.277732253074646, "reward_meter_mean": 0.7935206890106201, "reward_meter_std": 0.1681874543428421, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.1927071362733841, "reward_repeat_penalty_std": 0.0855286493897438, "reward_near_duplicate_penalty_mean": 0.792396605014801, "reward_near_duplicate_penalty_std": 0.0862075611948967, "reward_opening_diversity_mean": 0.34375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.6951733231544495, "reward_distinct_2_std": 0.0892522931098938, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.277732253074646, "reward_total_composite_std": 0.05886560678482056} {"timestamp_utc": "2026-04-12T14:52:00Z", "mode": "train", "global_step": 1014, "epoch": 0.04072779852994337, "loss": -0.0594, "grad_norm": 2.3424248695373535, "learning_rate": 6.930303030303031e-06, "num_tokens": 2055155.0, "completions/mean_length": 235.25, "completions/min_length": 63.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 69.20000457763672, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.4517163932323456, "rewards/meter/std": 0.42652854323387146, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8778268694877625, "rewards/lexical_plausibility/std": 0.13646115362644196, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.0707106813788414, "rewards/repeat_penalty/mean": 0.7431102991104126, "rewards/repeat_penalty/std": 0.24545390903949738, "rewards/near_duplicate_penalty/mean": 0.8971248865127563, "rewards/near_duplicate_penalty/std": 0.12238641828298569, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.838614821434021, "rewards/distinct_2/std": 0.21892930567264557, "rewards/total_composite/mean": 0.035518694669008255, "rewards/total_composite/std": 0.08521462231874466, "reward": 0.035518694669008255, "reward_std": 0.08521462231874466, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10896256566047668, "sampling/sampling_logp_difference/max": 1.5819063186645508, "sampling/importance_sampling_ratio/min": 0.20558282732963562, "sampling/importance_sampling_ratio/mean": 1.0058146715164185, "sampling/importance_sampling_ratio/max": 1.9902769327163696, "entropy": 0.3846058249473572, "clip_ratio/low_mean": 0.062063612043857574, "clip_ratio/low_min": 0.062063612043857574, "clip_ratio/high_mean": 0.009493670426309109, "clip_ratio/high_max": 0.009493670426309109, "clip_ratio/region_mean": 0.07155728247016668, "reward_total_mean": 0.035518694669008255, "reward_meter_mean": 0.4517163932323456, "reward_meter_std": 0.42652854323387146, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8778268694877625, "reward_lexical_plausibility_std": 0.13646115362644196, "reward_repeat_penalty_mean": 0.7431102991104126, "reward_repeat_penalty_std": 0.24545390903949738, "reward_near_duplicate_penalty_mean": 0.8971248865127563, "reward_near_duplicate_penalty_std": 0.12238641828298569, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.838614821434021, "reward_distinct_2_std": 0.21892930567264557, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.0707106813788414, "reward_total_composite_mean": 0.035518694669008255, "reward_total_composite_std": 0.08521462231874466} {"timestamp_utc": "2026-04-12T14:52:08Z", "mode": "train", "global_step": 1015, "epoch": 0.04076796401172832, "loss": 0.0297, "grad_norm": 29.638776779174805, "learning_rate": 6.927272727272728e-06, "num_tokens": 2056598.0, "completions/mean_length": 29.375, "completions/min_length": 26.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.375, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5122090578079224, "rewards/meter/std": 0.3878419101238251, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.7089154720306396, "rewards/repeat_penalty/std": 0.06865794956684113, "rewards/near_duplicate_penalty/mean": 0.9577081203460693, "rewards/near_duplicate_penalty/std": 0.06238333880901337, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.22760291397571564, "rewards/total_composite/std": 0.2543333172798157, "reward": 0.22760291397571564, "reward_std": 0.2543333172798157, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11825455725193024, "sampling/sampling_logp_difference/max": 1.5048630237579346, "sampling/importance_sampling_ratio/min": 0.22204771637916565, "sampling/importance_sampling_ratio/mean": 1.0244112014770508, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.630183719098568, "clip_ratio/low_mean": 0.08032241277396679, "clip_ratio/low_min": 0.08032241277396679, "clip_ratio/high_mean": 0.04841570556163788, "clip_ratio/high_max": 0.04841570556163788, "clip_ratio/region_mean": 0.12873811833560467, "reward_total_mean": 0.22760291397571564, "reward_meter_mean": 0.5122090578079224, "reward_meter_std": 0.3878419101238251, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7089154720306396, "reward_repeat_penalty_std": 0.06865794956684113, "reward_near_duplicate_penalty_mean": 0.9577081203460693, "reward_near_duplicate_penalty_std": 0.06238333880901337, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.22760291397571564, "reward_total_composite_std": 0.2543333172798157} {"timestamp_utc": "2026-04-12T14:52:23Z", "mode": "train", "global_step": 1016, "epoch": 0.04080812949351328, "loss": 0.0437, "grad_norm": 0.2444995641708374, "learning_rate": 6.9242424242424245e-06, "num_tokens": 2058807.0, "completions/mean_length": 495.125, "completions/min_length": 377.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 377.0, "completions/min_terminated_length": 377.0, "completions/max_terminated_length": 377.0, "rewards/meter/mean": 0.5891023874282837, "rewards/meter/std": 0.4049077332019806, "rewards/count_adherence/mean": 0.38333332538604736, "rewards/count_adherence/std": 0.13685818016529083, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.37742453813552856, "rewards/near_duplicate_penalty/std": 0.17442139983177185, "rewards/opening_diversity/mean": 0.3317132592201233, "rewards/opening_diversity/std": 0.2342468500137329, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.02793014608323574, "rewards/total_composite/std": 0.02007874846458435, "reward": 0.02793014608323574, "reward_std": 0.0200787466019392, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.029305048286914825, "sampling/sampling_logp_difference/max": 0.8253111839294434, "sampling/importance_sampling_ratio/min": 0.5166441202163696, "sampling/importance_sampling_ratio/mean": 1.0093629360198975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.01212412491440773, "clip_ratio/low_mean": 0.0039787800051271915, "clip_ratio/low_min": 0.0039787800051271915, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0039787800051271915, "reward_total_mean": 0.02793014608323574, "reward_meter_mean": 0.5891023874282837, "reward_meter_std": 0.4049077332019806, "reward_count_adherence_mean": 0.38333332538604736, "reward_count_adherence_std": 0.13685818016529083, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.37742453813552856, "reward_near_duplicate_penalty_std": 0.17442139983177185, "reward_opening_diversity_mean": 0.3317132592201233, "reward_opening_diversity_std": 0.2342468500137329, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.02793014608323574, "reward_total_composite_std": 0.02007874846458435} {"timestamp_utc": "2026-04-12T14:52:36Z", "mode": "train", "global_step": 1017, "epoch": 0.04084829497529823, "loss": -0.0729, "grad_norm": 4.517416954040527, "learning_rate": 6.921212121212122e-06, "num_tokens": 2060563.0, "completions/mean_length": 116.5, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.000003814697266, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.5273847579956055, "rewards/meter/std": 0.40735289454460144, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.962093710899353, "rewards/lexical_plausibility/std": 0.10721520334482193, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.6538918614387512, "rewards/repeat_penalty/std": 0.33201339840888977, "rewards/near_duplicate_penalty/mean": 0.8698864579200745, "rewards/near_duplicate_penalty/std": 0.1236475259065628, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.7783924341201782, "rewards/distinct_2/std": 0.21051128208637238, "rewards/total_composite/mean": 0.18891584873199463, "rewards/total_composite/std": 0.16921192407608032, "reward": 0.18891584873199463, "reward_std": 0.16921192407608032, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10032311081886292, "sampling/sampling_logp_difference/max": 2.389025926589966, "sampling/importance_sampling_ratio/min": 0.09171898663043976, "sampling/importance_sampling_ratio/mean": 1.007766604423523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5222587697207928, "clip_ratio/low_mean": 0.038829339668154716, "clip_ratio/low_min": 0.038829339668154716, "clip_ratio/high_mean": 0.04004096332937479, "clip_ratio/high_max": 0.04004096332937479, "clip_ratio/region_mean": 0.0788703029975295, "reward_total_mean": 0.18891584873199463, "reward_meter_mean": 0.5273847579956055, "reward_meter_std": 0.40735289454460144, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.962093710899353, "reward_lexical_plausibility_std": 0.10721520334482193, "reward_repeat_penalty_mean": 0.6538918614387512, "reward_repeat_penalty_std": 0.33201339840888977, "reward_near_duplicate_penalty_mean": 0.8698864579200745, "reward_near_duplicate_penalty_std": 0.1236475259065628, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.7783924341201782, "reward_distinct_2_std": 0.21051128208637238, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.18891584873199463, "reward_total_composite_std": 0.16921192407608032} {"timestamp_utc": "2026-04-12T14:52:44Z", "mode": "train", "global_step": 1018, "epoch": 0.040888460457083185, "loss": -0.0295, "grad_norm": 17.33719825744629, "learning_rate": 6.918181818181818e-06, "num_tokens": 2062195.0, "completions/mean_length": 47.0, "completions/min_length": 33.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7240685224533081, "rewards/meter/std": 0.33690762519836426, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.3644633889198303, "rewards/repeat_penalty/std": 0.20901869237422943, "rewards/near_duplicate_penalty/mean": 0.8008079528808594, "rewards/near_duplicate_penalty/std": 0.12227211892604828, "rewards/opening_diversity/mean": 0.671875, "rewards/opening_diversity/std": 0.14846687018871307, "rewards/distinct_2/mean": 0.6436425447463989, "rewards/distinct_2/std": 0.17683729529380798, "rewards/total_composite/mean": 0.19473877549171448, "rewards/total_composite/std": 0.11701270192861557, "reward": 0.19473877549171448, "reward_std": 0.11701269447803497, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09906559437513351, "sampling/sampling_logp_difference/max": 1.7095346450805664, "sampling/importance_sampling_ratio/min": 0.18094998598098755, "sampling/importance_sampling_ratio/mean": 1.0146312713623047, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6318059228360653, "clip_ratio/low_mean": 0.04329847078770399, "clip_ratio/low_min": 0.04329847078770399, "clip_ratio/high_mean": 0.053069054149091244, "clip_ratio/high_max": 0.053069054149091244, "clip_ratio/region_mean": 0.09636752493679523, "reward_total_mean": 0.19473877549171448, "reward_meter_mean": 0.7240685224533081, "reward_meter_std": 0.33690762519836426, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3644633889198303, "reward_repeat_penalty_std": 0.20901869237422943, "reward_near_duplicate_penalty_mean": 0.8008079528808594, "reward_near_duplicate_penalty_std": 0.12227211892604828, "reward_opening_diversity_mean": 0.671875, "reward_opening_diversity_std": 0.14846687018871307, "reward_distinct_2_mean": 0.6436425447463989, "reward_distinct_2_std": 0.17683729529380798, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.19473877549171448, "reward_total_composite_std": 0.11701270192861557} {"timestamp_utc": "2026-04-12T14:52:53Z", "mode": "train", "global_step": 1019, "epoch": 0.04092862593886814, "loss": 0.0571, "grad_norm": 9.505874633789062, "learning_rate": 6.915151515151515e-06, "num_tokens": 2063936.0, "completions/mean_length": 61.625, "completions/min_length": 54.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.625, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.7488036155700684, "rewards/meter/std": 0.2799701690673828, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.2980732023715973, "rewards/repeat_penalty/std": 0.1365506500005722, "rewards/near_duplicate_penalty/mean": 0.7738947868347168, "rewards/near_duplicate_penalty/std": 0.13323625922203064, "rewards/opening_diversity/mean": 0.515625, "rewards/opening_diversity/std": 0.19408094882965088, "rewards/distinct_2/mean": 0.7420055866241455, "rewards/distinct_2/std": 0.18532700836658478, "rewards/total_composite/mean": 0.18353229761123657, "rewards/total_composite/std": 0.1281534880399704, "reward": 0.18353229761123657, "reward_std": 0.1281534880399704, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08674348890781403, "sampling/sampling_logp_difference/max": 1.525856852531433, "sampling/importance_sampling_ratio/min": 0.21743467450141907, "sampling/importance_sampling_ratio/mean": 1.0050889253616333, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4259168542921543, "clip_ratio/low_mean": 0.03343175002373755, "clip_ratio/low_min": 0.03343175002373755, "clip_ratio/high_mean": 0.0341534954495728, "clip_ratio/high_max": 0.0341534954495728, "clip_ratio/region_mean": 0.06758524547331035, "reward_total_mean": 0.18353229761123657, "reward_meter_mean": 0.7488036155700684, "reward_meter_std": 0.2799701690673828, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2980732023715973, "reward_repeat_penalty_std": 0.1365506500005722, "reward_near_duplicate_penalty_mean": 0.7738947868347168, "reward_near_duplicate_penalty_std": 0.13323625922203064, "reward_opening_diversity_mean": 0.515625, "reward_opening_diversity_std": 0.19408094882965088, "reward_distinct_2_mean": 0.7420055866241455, "reward_distinct_2_std": 0.18532700836658478, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.18353229761123657, "reward_total_composite_std": 0.1281534880399704} {"timestamp_utc": "2026-04-12T14:53:06Z", "mode": "train", "global_step": 1020, "epoch": 0.04096879142065309, "loss": -0.1716, "grad_norm": 3.393901824951172, "learning_rate": 6.912121212121212e-06, "num_tokens": 2066177.0, "completions/mean_length": 155.125, "completions/min_length": 99.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 104.14286041259766, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 112.0, "rewards/meter/mean": 0.8688631057739258, "rewards/meter/std": 0.2380598783493042, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9745819568634033, "rewards/lexical_plausibility/std": 0.07189306616783142, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.2582615315914154, "rewards/repeat_penalty/std": 0.26931893825531006, "rewards/near_duplicate_penalty/mean": 0.668350338935852, "rewards/near_duplicate_penalty/std": 0.1923406720161438, "rewards/opening_diversity/mean": 0.734375, "rewards/opening_diversity/std": 0.2868976593017578, "rewards/distinct_2/mean": 0.47387489676475525, "rewards/distinct_2/std": 0.3142240047454834, "rewards/total_composite/mean": 0.11387498676776886, "rewards/total_composite/std": 0.0582408607006073, "reward": 0.11387498676776886, "reward_std": 0.0582408607006073, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07800491899251938, "sampling/sampling_logp_difference/max": 1.5665688514709473, "sampling/importance_sampling_ratio/min": 0.20876023173332214, "sampling/importance_sampling_ratio/mean": 1.01407790184021, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4713069386780262, "clip_ratio/low_mean": 0.010101010091602802, "clip_ratio/low_min": 0.010101010091602802, "clip_ratio/high_mean": 0.06296353740617633, "clip_ratio/high_max": 0.06296353740617633, "clip_ratio/region_mean": 0.07306454749777913, "reward_total_mean": 0.11387498676776886, "reward_meter_mean": 0.8688631057739258, "reward_meter_std": 0.2380598783493042, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9745819568634033, "reward_lexical_plausibility_std": 0.07189306616783142, "reward_repeat_penalty_mean": 0.2582615315914154, "reward_repeat_penalty_std": 0.26931893825531006, "reward_near_duplicate_penalty_mean": 0.668350338935852, "reward_near_duplicate_penalty_std": 0.1923406720161438, "reward_opening_diversity_mean": 0.734375, "reward_opening_diversity_std": 0.2868976593017578, "reward_distinct_2_mean": 0.47387489676475525, "reward_distinct_2_std": 0.3142240047454834, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.11387498676776886, "reward_total_composite_std": 0.0582408607006073} {"timestamp_utc": "2026-04-12T14:53:20Z", "mode": "train", "global_step": 1021, "epoch": 0.04100895690243805, "loss": -0.0346, "grad_norm": 4.435267448425293, "learning_rate": 6.90909090909091e-06, "num_tokens": 2067755.0, "completions/mean_length": 112.25, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 55.142860412597656, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.23766043782234192, "rewards/meter/std": 0.26641353964805603, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9752229452133179, "rewards/lexical_plausibility/std": 0.07008011639118195, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.6807931661605835, "rewards/repeat_penalty/std": 0.11142243444919586, "rewards/near_duplicate_penalty/mean": 0.846206545829773, "rewards/near_duplicate_penalty/std": 0.0366097055375576, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8587462902069092, "rewards/distinct_2/std": 0.07720057666301727, "rewards/total_composite/mean": 0.052861981093883514, "rewards/total_composite/std": 0.06511695683002472, "reward": 0.052861981093883514, "reward_std": 0.06511695683002472, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0928114801645279, "sampling/sampling_logp_difference/max": 1.0159813165664673, "sampling/importance_sampling_ratio/min": 0.3620469868183136, "sampling/importance_sampling_ratio/mean": 1.0031670331954956, "sampling/importance_sampling_ratio/max": 1.793241262435913, "entropy": 0.5795053467154503, "clip_ratio/low_mean": 0.04669883707538247, "clip_ratio/low_min": 0.04669883707538247, "clip_ratio/high_mean": 0.040712181478738785, "clip_ratio/high_max": 0.040712181478738785, "clip_ratio/region_mean": 0.08741101855412126, "reward_total_mean": 0.052861981093883514, "reward_meter_mean": 0.23766043782234192, "reward_meter_std": 0.26641353964805603, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9752229452133179, "reward_lexical_plausibility_std": 0.07008011639118195, "reward_repeat_penalty_mean": 0.6807931661605835, "reward_repeat_penalty_std": 0.11142243444919586, "reward_near_duplicate_penalty_mean": 0.846206545829773, "reward_near_duplicate_penalty_std": 0.0366097055375576, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8587462902069092, "reward_distinct_2_std": 0.07720057666301727, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.052861981093883514, "reward_total_composite_std": 0.06511695683002472} {"timestamp_utc": "2026-04-12T14:53:34Z", "mode": "train", "global_step": 1022, "epoch": 0.041049122384223, "loss": -0.1106, "grad_norm": 2.7205684185028076, "learning_rate": 6.906060606060606e-06, "num_tokens": 2069446.0, "completions/mean_length": 176.375, "completions/min_length": 58.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 64.5, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6154673099517822, "rewards/meter/std": 0.29473501443862915, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/lexical_plausibility/mean": 0.9299918413162231, "rewards/lexical_plausibility/std": 0.12978941202163696, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7901404500007629, "rewards/repeat_penalty/std": 0.2279074341058731, "rewards/near_duplicate_penalty/mean": 0.9328340291976929, "rewards/near_duplicate_penalty/std": 0.06356509774923325, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8766018152236938, "rewards/distinct_2/std": 0.11375460028648376, "rewards/total_composite/mean": 0.14203496277332306, "rewards/total_composite/std": 0.1235874742269516, "reward": 0.14203496277332306, "reward_std": 0.1235874742269516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09047681838274002, "sampling/sampling_logp_difference/max": 1.426063060760498, "sampling/importance_sampling_ratio/min": 0.24025292694568634, "sampling/importance_sampling_ratio/mean": 1.0126465559005737, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.42599399015307426, "clip_ratio/low_mean": 0.01293103490024805, "clip_ratio/low_min": 0.01293103490024805, "clip_ratio/high_mean": 0.049724617041647434, "clip_ratio/high_max": 0.049724617041647434, "clip_ratio/region_mean": 0.06265565194189548, "reward_total_mean": 0.14203496277332306, "reward_meter_mean": 0.6154673099517822, "reward_meter_std": 0.29473501443862915, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_lexical_plausibility_mean": 0.9299918413162231, "reward_lexical_plausibility_std": 0.12978941202163696, "reward_repeat_penalty_mean": 0.7901404500007629, "reward_repeat_penalty_std": 0.2279074341058731, "reward_near_duplicate_penalty_mean": 0.9328340291976929, "reward_near_duplicate_penalty_std": 0.06356509774923325, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8766018152236938, "reward_distinct_2_std": 0.11375460028648376, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.14203496277332306, "reward_total_composite_std": 0.1235874742269516} {"timestamp_utc": "2026-04-12T14:53:48Z", "mode": "train", "global_step": 1023, "epoch": 0.041089287866007955, "loss": -0.076, "grad_norm": 1.9131355285644531, "learning_rate": 6.903030303030304e-06, "num_tokens": 2071076.0, "completions/mean_length": 225.75, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 54.0, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.17156369984149933, "rewards/meter/std": 0.1722494512796402, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.9244678020477295, "rewards/lexical_plausibility/std": 0.12275119870901108, "rewards/judge_quality/mean": 0.13124999403953552, "rewards/judge_quality/std": 0.1066954955458641, "rewards/repeat_penalty/mean": 0.6404745578765869, "rewards/repeat_penalty/std": 0.22385944426059723, "rewards/near_duplicate_penalty/mean": 0.7799478769302368, "rewards/near_duplicate_penalty/std": 0.11074870824813843, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8301138877868652, "rewards/distinct_2/std": 0.1930258572101593, "rewards/total_composite/mean": 0.031589772552251816, "rewards/total_composite/std": 0.03598390519618988, "reward": 0.031589772552251816, "reward_std": 0.03598390147089958, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1007244810461998, "sampling/sampling_logp_difference/max": 1.2299976348876953, "sampling/importance_sampling_ratio/min": 0.2922932505607605, "sampling/importance_sampling_ratio/mean": 1.0003584623336792, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3576190359890461, "clip_ratio/low_mean": 0.013636363670229912, "clip_ratio/low_min": 0.013636363670229912, "clip_ratio/high_mean": 0.04884940106421709, "clip_ratio/high_max": 0.04884940106421709, "clip_ratio/region_mean": 0.062485764734447, "reward_total_mean": 0.031589772552251816, "reward_meter_mean": 0.17156369984149933, "reward_meter_std": 0.1722494512796402, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.9244678020477295, "reward_lexical_plausibility_std": 0.12275119870901108, "reward_repeat_penalty_mean": 0.6404745578765869, "reward_repeat_penalty_std": 0.22385944426059723, "reward_near_duplicate_penalty_mean": 0.7799478769302368, "reward_near_duplicate_penalty_std": 0.11074870824813843, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8301138877868652, "reward_distinct_2_std": 0.1930258572101593, "reward_judge_quality_mean": 0.13124999403953552, "reward_judge_quality_std": 0.1066954955458641, "reward_total_composite_mean": 0.031589772552251816, "reward_total_composite_std": 0.03598390519618988} {"timestamp_utc": "2026-04-12T14:54:02Z", "mode": "train", "global_step": 1024, "epoch": 0.04112945334779291, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 6.9e-06, "num_tokens": 2072628.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.7472419142723083, "rewards/meter/std": 0.23165880143642426, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.2645200192928314, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9739459753036499, "rewards/lexical_plausibility/std": 0.07369180768728256, "rewards/judge_quality/mean": 0.07500000298023224, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.037902988493442535, "rewards/repeat_penalty/std": 0.1072058379650116, "rewards/near_duplicate_penalty/mean": 0.256704717874527, "rewards/near_duplicate_penalty/std": 0.2252495139837265, "rewards/opening_diversity/mean": 0.2873000204563141, "rewards/opening_diversity/std": 0.28143349289894104, "rewards/distinct_2/mean": 0.11625874042510986, "rewards/distinct_2/std": 0.3288293778896332, "rewards/total_composite/mean": 0.04951168969273567, "rewards/total_composite/std": 0.04630482941865921, "reward": 0.04951168969273567, "reward_std": 0.04630482941865921, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.04951168969273567, "reward_meter_mean": 0.7472419142723083, "reward_meter_std": 0.23165880143642426, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.2645200192928314, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9739459753036499, "reward_lexical_plausibility_std": 0.07369180768728256, "reward_repeat_penalty_mean": 0.037902988493442535, "reward_repeat_penalty_std": 0.1072058379650116, "reward_near_duplicate_penalty_mean": 0.256704717874527, "reward_near_duplicate_penalty_std": 0.2252495139837265, "reward_opening_diversity_mean": 0.2873000204563141, "reward_opening_diversity_std": 0.28143349289894104, "reward_distinct_2_mean": 0.11625874042510986, "reward_distinct_2_std": 0.3288293778896332, "reward_judge_quality_mean": 0.07500000298023224, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.04951168969273567, "reward_total_composite_std": 0.04630482941865921} {"timestamp_utc": "2026-04-12T14:54:12Z", "mode": "train", "global_step": 1025, "epoch": 0.04116961882957786, "loss": 0.0041, "grad_norm": 7.720107078552246, "learning_rate": 6.896969696969697e-06, "num_tokens": 2074609.0, "completions/mean_length": 87.625, "completions/min_length": 74.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.625, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.5218161940574646, "rewards/meter/std": 0.3966940641403198, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9539638757705688, "rewards/lexical_plausibility/std": 0.06820890307426453, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.7015840411186218, "rewards/repeat_penalty/std": 0.2907060384750366, "rewards/near_duplicate_penalty/mean": 0.8775174617767334, "rewards/near_duplicate_penalty/std": 0.10983667522668839, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.7779926657676697, "rewards/distinct_2/std": 0.2638917565345764, "rewards/total_composite/mean": 0.13111929595470428, "rewards/total_composite/std": 0.09954511374235153, "reward": 0.13111929595470428, "reward_std": 0.09954510629177094, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10262478142976761, "sampling/sampling_logp_difference/max": 1.7458510398864746, "sampling/importance_sampling_ratio/min": 0.17449642717838287, "sampling/importance_sampling_ratio/mean": 0.9998663663864136, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5056793540716171, "clip_ratio/low_mean": 0.05708865029737353, "clip_ratio/low_min": 0.05708865029737353, "clip_ratio/high_mean": 0.04222492501139641, "clip_ratio/high_max": 0.04222492501139641, "clip_ratio/region_mean": 0.09931357530876994, "reward_total_mean": 0.13111929595470428, "reward_meter_mean": 0.5218161940574646, "reward_meter_std": 0.3966940641403198, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9539638757705688, "reward_lexical_plausibility_std": 0.06820890307426453, "reward_repeat_penalty_mean": 0.7015840411186218, "reward_repeat_penalty_std": 0.2907060384750366, "reward_near_duplicate_penalty_mean": 0.8775174617767334, "reward_near_duplicate_penalty_std": 0.10983667522668839, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.7779926657676697, "reward_distinct_2_std": 0.2638917565345764, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.13111929595470428, "reward_total_composite_std": 0.09954511374235153} {"timestamp_utc": "2026-04-12T14:54:20Z", "mode": "train", "global_step": 1026, "epoch": 0.04120978431136282, "loss": 0.0397, "grad_norm": 11.36959171295166, "learning_rate": 6.893939393939395e-06, "num_tokens": 2076528.0, "completions/mean_length": 61.875, "completions/min_length": 54.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.875, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.5908125042915344, "rewards/meter/std": 0.463847815990448, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.6685135960578918, "rewards/repeat_penalty/std": 0.23664137721061707, "rewards/near_duplicate_penalty/mean": 0.8620654344558716, "rewards/near_duplicate_penalty/std": 0.06888401508331299, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.829962432384491, "rewards/distinct_2/std": 0.1638273000717163, "rewards/total_composite/mean": 0.08959561586380005, "rewards/total_composite/std": 0.06829588115215302, "reward": 0.08959561586380005, "reward_std": 0.06829588115215302, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08918594568967819, "sampling/sampling_logp_difference/max": 2.104063034057617, "sampling/importance_sampling_ratio/min": 0.12195988744497299, "sampling/importance_sampling_ratio/mean": 1.0066965818405151, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.49786342680454254, "clip_ratio/low_mean": 0.02265835809521377, "clip_ratio/low_min": 0.02265835809521377, "clip_ratio/high_mean": 0.07138597592711449, "clip_ratio/high_max": 0.07138597592711449, "clip_ratio/region_mean": 0.09404433402232826, "reward_total_mean": 0.08959561586380005, "reward_meter_mean": 0.5908125042915344, "reward_meter_std": 0.463847815990448, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6685135960578918, "reward_repeat_penalty_std": 0.23664137721061707, "reward_near_duplicate_penalty_mean": 0.8620654344558716, "reward_near_duplicate_penalty_std": 0.06888401508331299, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.829962432384491, "reward_distinct_2_std": 0.1638273000717163, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.08959561586380005, "reward_total_composite_std": 0.06829588115215302} {"timestamp_utc": "2026-04-12T14:54:34Z", "mode": "train", "global_step": 1027, "epoch": 0.04124994979314777, "loss": -0.0743, "grad_norm": 3.760767936706543, "learning_rate": 6.890909090909092e-06, "num_tokens": 2078571.0, "completions/mean_length": 144.375, "completions/min_length": 81.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 91.85714721679688, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.8890489339828491, "rewards/meter/std": 0.13380175828933716, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9246917366981506, "rewards/lexical_plausibility/std": 0.11682187020778656, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.20516061782836914, "rewards/repeat_penalty/std": 0.2608588635921478, "rewards/near_duplicate_penalty/mean": 0.6434073448181152, "rewards/near_duplicate_penalty/std": 0.1436055600643158, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.18898223340511322, "rewards/distinct_2/mean": 0.38242679834365845, "rewards/distinct_2/std": 0.36785444617271423, "rewards/total_composite/mean": 0.13922297954559326, "rewards/total_composite/std": 0.10259076952934265, "reward": 0.13922297954559326, "reward_std": 0.10259077697992325, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0748460665345192, "sampling/sampling_logp_difference/max": 1.680635929107666, "sampling/importance_sampling_ratio/min": 0.18625548481941223, "sampling/importance_sampling_ratio/mean": 1.0046155452728271, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.33101135678589344, "clip_ratio/low_mean": 0.009350667241960764, "clip_ratio/low_min": 0.009350667241960764, "clip_ratio/high_mean": 0.04860563948750496, "clip_ratio/high_max": 0.04860563948750496, "clip_ratio/region_mean": 0.05795630672946572, "reward_total_mean": 0.13922297954559326, "reward_meter_mean": 0.8890489339828491, "reward_meter_std": 0.13380175828933716, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9246917366981506, "reward_lexical_plausibility_std": 0.11682187020778656, "reward_repeat_penalty_mean": 0.20516061782836914, "reward_repeat_penalty_std": 0.2608588635921478, "reward_near_duplicate_penalty_mean": 0.6434073448181152, "reward_near_duplicate_penalty_std": 0.1436055600643158, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.18898223340511322, "reward_distinct_2_mean": 0.38242679834365845, "reward_distinct_2_std": 0.36785444617271423, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.13922297954559326, "reward_total_composite_std": 0.10259076952934265} {"timestamp_utc": "2026-04-12T14:54:42Z", "mode": "train", "global_step": 1028, "epoch": 0.041290115274932725, "loss": 0.0749, "grad_norm": 17.88671112060547, "learning_rate": 6.887878787878789e-06, "num_tokens": 2080150.0, "completions/mean_length": 42.375, "completions/min_length": 36.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.4214051365852356, "rewards/meter/std": 0.394690603017807, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9633767008781433, "rewards/lexical_plausibility/std": 0.1035863608121872, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.15059404075145721, "rewards/repeat_penalty/mean": 0.8653683662414551, "rewards/repeat_penalty/std": 0.15469643473625183, "rewards/near_duplicate_penalty/mean": 0.9038918614387512, "rewards/near_duplicate_penalty/std": 0.12023397535085678, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.953242838382721, "rewards/distinct_2/std": 0.06967140734195709, "rewards/total_composite/mean": 0.15121299028396606, "rewards/total_composite/std": 0.18406309187412262, "reward": 0.15121299028396606, "reward_std": 0.18406307697296143, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16957247257232666, "sampling/sampling_logp_difference/max": 1.6085577011108398, "sampling/importance_sampling_ratio/min": 0.20017611980438232, "sampling/importance_sampling_ratio/mean": 1.0263725519180298, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7976130917668343, "clip_ratio/low_mean": 0.09178000781685114, "clip_ratio/low_min": 0.09178000781685114, "clip_ratio/high_mean": 0.04741337709128857, "clip_ratio/high_max": 0.04741337709128857, "clip_ratio/region_mean": 0.1391933849081397, "reward_total_mean": 0.15121299028396606, "reward_meter_mean": 0.4214051365852356, "reward_meter_std": 0.394690603017807, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9633767008781433, "reward_lexical_plausibility_std": 0.1035863608121872, "reward_repeat_penalty_mean": 0.8653683662414551, "reward_repeat_penalty_std": 0.15469643473625183, "reward_near_duplicate_penalty_mean": 0.9038918614387512, "reward_near_duplicate_penalty_std": 0.12023397535085678, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.953242838382721, "reward_distinct_2_std": 0.06967140734195709, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.15059404075145721, "reward_total_composite_mean": 0.15121299028396606, "reward_total_composite_std": 0.18406309187412262} {"timestamp_utc": "2026-04-12T14:54:50Z", "mode": "train", "global_step": 1029, "epoch": 0.04133028075671768, "loss": 0.0212, "grad_norm": 12.958258628845215, "learning_rate": 6.8848484848484854e-06, "num_tokens": 2081618.0, "completions/mean_length": 27.5, "completions/min_length": 24.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.5, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.7768885493278503, "rewards/meter/std": 0.30060726404190063, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4675000309944153, "rewards/judge_quality/std": 0.32056868076324463, "rewards/repeat_penalty/mean": 0.7310692071914673, "rewards/repeat_penalty/std": 0.03878411650657654, "rewards/near_duplicate_penalty/mean": 0.9747589826583862, "rewards/near_duplicate_penalty/std": 0.051712166517972946, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38241299986839294, "rewards/total_composite/std": 0.2848397195339203, "reward": 0.38241299986839294, "reward_std": 0.2848396897315979, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11901742219924927, "sampling/sampling_logp_difference/max": 1.1289299726486206, "sampling/importance_sampling_ratio/min": 0.3233790993690491, "sampling/importance_sampling_ratio/mean": 1.0196528434753418, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7172144502401352, "clip_ratio/low_mean": 0.07219195133075118, "clip_ratio/low_min": 0.07219195133075118, "clip_ratio/high_mean": 0.07204362191259861, "clip_ratio/high_max": 0.07204362191259861, "clip_ratio/region_mean": 0.1442355732433498, "reward_total_mean": 0.38241299986839294, "reward_meter_mean": 0.7768885493278503, "reward_meter_std": 0.30060726404190063, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7310692071914673, "reward_repeat_penalty_std": 0.03878411650657654, "reward_near_duplicate_penalty_mean": 0.9747589826583862, "reward_near_duplicate_penalty_std": 0.051712166517972946, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000309944153, "reward_judge_quality_std": 0.32056868076324463, "reward_total_composite_mean": 0.38241299986839294, "reward_total_composite_std": 0.2848397195339203} {"timestamp_utc": "2026-04-12T14:55:04Z", "mode": "train", "global_step": 1030, "epoch": 0.04137044623850263, "loss": -0.0034, "grad_norm": 3.967888832092285, "learning_rate": 6.881818181818183e-06, "num_tokens": 2083153.0, "completions/mean_length": 107.875, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.142860412597656, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.13707971572875977, "rewards/meter/std": 0.2192526012659073, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.968704104423523, "rewards/lexical_plausibility/std": 0.08851820975542068, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.7831759452819824, "rewards/repeat_penalty/std": 0.1511973887681961, "rewards/near_duplicate_penalty/mean": 0.8563976287841797, "rewards/near_duplicate_penalty/std": 0.07717317342758179, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9078867435455322, "rewards/distinct_2/std": 0.11104637384414673, "rewards/total_composite/mean": 0.042914994060993195, "rewards/total_composite/std": 0.07613904029130936, "reward": 0.042914994060993195, "reward_std": 0.07613903284072876, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11119411885738373, "sampling/sampling_logp_difference/max": 1.961724042892456, "sampling/importance_sampling_ratio/min": 0.1406157910823822, "sampling/importance_sampling_ratio/mean": 0.9975777268409729, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5121523290872574, "clip_ratio/low_mean": 0.06146345101296902, "clip_ratio/low_min": 0.06146345101296902, "clip_ratio/high_mean": 0.02526205498725176, "clip_ratio/high_max": 0.02526205498725176, "clip_ratio/region_mean": 0.08672550600022078, "reward_total_mean": 0.042914994060993195, "reward_meter_mean": 0.13707971572875977, "reward_meter_std": 0.2192526012659073, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.968704104423523, "reward_lexical_plausibility_std": 0.08851820975542068, "reward_repeat_penalty_mean": 0.7831759452819824, "reward_repeat_penalty_std": 0.1511973887681961, "reward_near_duplicate_penalty_mean": 0.8563976287841797, "reward_near_duplicate_penalty_std": 0.07717317342758179, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9078867435455322, "reward_distinct_2_std": 0.11104637384414673, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.042914994060993195, "reward_total_composite_std": 0.07613904029130936} {"timestamp_utc": "2026-04-12T14:55:14Z", "mode": "train", "global_step": 1031, "epoch": 0.041410611720287586, "loss": 0.0984, "grad_norm": 9.080733299255371, "learning_rate": 6.878787878787879e-06, "num_tokens": 2085561.0, "completions/mean_length": 119.0, "completions/min_length": 95.0, "completions/max_length": 132.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.0, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 132.0, "rewards/meter/mean": 0.19246211647987366, "rewards/meter/std": 0.2490117847919464, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9461076855659485, "rewards/lexical_plausibility/std": 0.09910210967063904, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.5193793177604675, "rewards/repeat_penalty/std": 0.32295694947242737, "rewards/near_duplicate_penalty/mean": 0.8403446674346924, "rewards/near_duplicate_penalty/std": 0.14314475655555725, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.17598575353622437, "rewards/distinct_2/mean": 0.6442869901657104, "rewards/distinct_2/std": 0.27760687470436096, "rewards/total_composite/mean": 0.039708416908979416, "rewards/total_composite/std": 0.039796024560928345, "reward": 0.039708416908979416, "reward_std": 0.039796024560928345, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.107515349984169, "sampling/sampling_logp_difference/max": 1.7417142391204834, "sampling/importance_sampling_ratio/min": 0.17521977424621582, "sampling/importance_sampling_ratio/mean": 0.9976531267166138, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4511689208447933, "clip_ratio/low_mean": 0.052274144254624844, "clip_ratio/low_min": 0.052274144254624844, "clip_ratio/high_mean": 0.041469668969511986, "clip_ratio/high_max": 0.041469668969511986, "clip_ratio/region_mean": 0.09374381322413683, "reward_total_mean": 0.039708416908979416, "reward_meter_mean": 0.19246211647987366, "reward_meter_std": 0.2490117847919464, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9461076855659485, "reward_lexical_plausibility_std": 0.09910210967063904, "reward_repeat_penalty_mean": 0.5193793177604675, "reward_repeat_penalty_std": 0.32295694947242737, "reward_near_duplicate_penalty_mean": 0.8403446674346924, "reward_near_duplicate_penalty_std": 0.14314475655555725, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.17598575353622437, "reward_distinct_2_mean": 0.6442869901657104, "reward_distinct_2_std": 0.27760687470436096, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.039708416908979416, "reward_total_composite_std": 0.039796024560928345} {"timestamp_utc": "2026-04-12T14:55:29Z", "mode": "train", "global_step": 1032, "epoch": 0.04145077720207254, "loss": 0.0006, "grad_norm": 1.7917559146881104, "learning_rate": 6.875757575757576e-06, "num_tokens": 2090237.0, "completions/mean_length": 377.5, "completions/min_length": 356.0, "completions/max_length": 400.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 377.5, "completions/min_terminated_length": 356.0, "completions/max_terminated_length": 400.0, "rewards/meter/mean": 0.4655001163482666, "rewards/meter/std": 0.3577215373516083, "rewards/count_adherence/mean": 0.4625000059604645, "rewards/count_adherence/std": 0.1597989946603775, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 0.28539353609085083, "rewards/near_duplicate_penalty/std": 0.19244235754013062, "rewards/opening_diversity/mean": 0.2334536910057068, "rewards/opening_diversity/std": 0.34575384855270386, "rewards/distinct_2/mean": 0.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.03236306086182594, "rewards/total_composite/std": 0.029856164008378983, "reward": 0.03236306086182594, "reward_std": 0.029856164008378983, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.016814591363072395, "sampling/sampling_logp_difference/max": 2.3987481594085693, "sampling/importance_sampling_ratio/min": 0.09083158522844315, "sampling/importance_sampling_ratio/mean": 1.0003407001495361, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.08910981006920338, "clip_ratio/low_mean": 0.0055707081919535995, "clip_ratio/low_min": 0.0055707081919535995, "clip_ratio/high_mean": 0.009129347803536803, "clip_ratio/high_max": 0.009129347803536803, "clip_ratio/region_mean": 0.014700055995490402, "reward_total_mean": 0.03236306086182594, "reward_meter_mean": 0.4655001163482666, "reward_meter_std": 0.3577215373516083, "reward_count_adherence_mean": 0.4625000059604645, "reward_count_adherence_std": 0.1597989946603775, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 0.28539353609085083, "reward_near_duplicate_penalty_std": 0.19244235754013062, "reward_opening_diversity_mean": 0.2334536910057068, "reward_opening_diversity_std": 0.34575384855270386, "reward_distinct_2_mean": 0.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.03236306086182594, "reward_total_composite_std": 0.029856164008378983} {"timestamp_utc": "2026-04-12T14:55:39Z", "mode": "train", "global_step": 1033, "epoch": 0.041490942683857494, "loss": 0.0266, "grad_norm": 15.333620071411133, "learning_rate": 6.872727272727273e-06, "num_tokens": 2091828.0, "completions/mean_length": 38.875, "completions/min_length": 33.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.5671983957290649, "rewards/meter/std": 0.3471923768520355, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.32702118158340454, "rewards/repeat_penalty/mean": 0.954290509223938, "rewards/repeat_penalty/std": 0.054342806339263916, "rewards/near_duplicate_penalty/mean": 0.9662845134735107, "rewards/near_duplicate_penalty/std": 0.03097359836101532, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.21451368927955627, "rewards/total_composite/std": 0.21267272531986237, "reward": 0.21451368927955627, "reward_std": 0.21267271041870117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1342097967863083, "sampling/sampling_logp_difference/max": 2.7786865234375, "sampling/importance_sampling_ratio/min": 0.062120046466588974, "sampling/importance_sampling_ratio/mean": 0.9889594912528992, "sampling/importance_sampling_ratio/max": 1.9090549945831299, "entropy": 0.6256684362888336, "clip_ratio/low_mean": 0.04960537515580654, "clip_ratio/low_min": 0.04960537515580654, "clip_ratio/high_mean": 0.08651018049567938, "clip_ratio/high_max": 0.08651018049567938, "clip_ratio/region_mean": 0.13611555565148592, "reward_total_mean": 0.21451368927955627, "reward_meter_mean": 0.5671983957290649, "reward_meter_std": 0.3471923768520355, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.954290509223938, "reward_repeat_penalty_std": 0.054342806339263916, "reward_near_duplicate_penalty_mean": 0.9662845134735107, "reward_near_duplicate_penalty_std": 0.03097359836101532, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.32702118158340454, "reward_total_composite_mean": 0.21451368927955627, "reward_total_composite_std": 0.21267272531986237} {"timestamp_utc": "2026-04-12T14:55:53Z", "mode": "train", "global_step": 1034, "epoch": 0.04153110816564245, "loss": -0.0362, "grad_norm": 1.901582956314087, "learning_rate": 6.869696969696971e-06, "num_tokens": 2093361.0, "completions/mean_length": 223.625, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 50.60000228881836, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.1044534295797348, "rewards/meter/std": 0.13273285329341888, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/lexical_plausibility/mean": 0.8923224210739136, "rewards/lexical_plausibility/std": 0.13520511984825134, "rewards/judge_quality/mean": 0.11249999701976776, "rewards/judge_quality/std": 0.051754921674728394, "rewards/repeat_penalty/mean": 0.46667566895484924, "rewards/repeat_penalty/std": 0.38008829951286316, "rewards/near_duplicate_penalty/mean": 0.7181737422943115, "rewards/near_duplicate_penalty/std": 0.22814202308654785, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.25877460837364197, "rewards/distinct_2/mean": 0.7104001045227051, "rewards/distinct_2/std": 0.2734965682029724, "rewards/total_composite/mean": 0.009760160930454731, "rewards/total_composite/std": 0.020280148833990097, "reward": 0.009760160930454731, "reward_std": 0.020280148833990097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08022608608007431, "sampling/sampling_logp_difference/max": 1.5839738845825195, "sampling/importance_sampling_ratio/min": 0.20515820384025574, "sampling/importance_sampling_ratio/mean": 1.0058679580688477, "sampling/importance_sampling_ratio/max": 1.6019577980041504, "entropy": 0.31564923003315926, "clip_ratio/low_mean": 0.04416412580758333, "clip_ratio/low_min": 0.04416412580758333, "clip_ratio/high_mean": 0.01785714365541935, "clip_ratio/high_max": 0.01785714365541935, "clip_ratio/region_mean": 0.06202126946300268, "reward_total_mean": 0.009760160930454731, "reward_meter_mean": 0.1044534295797348, "reward_meter_std": 0.13273285329341888, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_lexical_plausibility_mean": 0.8923224210739136, "reward_lexical_plausibility_std": 0.13520511984825134, "reward_repeat_penalty_mean": 0.46667566895484924, "reward_repeat_penalty_std": 0.38008829951286316, "reward_near_duplicate_penalty_mean": 0.7181737422943115, "reward_near_duplicate_penalty_std": 0.22814202308654785, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.25877460837364197, "reward_distinct_2_mean": 0.7104001045227051, "reward_distinct_2_std": 0.2734965682029724, "reward_judge_quality_mean": 0.11249999701976776, "reward_judge_quality_std": 0.051754921674728394, "reward_total_composite_mean": 0.009760160930454731, "reward_total_composite_std": 0.020280148833990097} {"timestamp_utc": "2026-04-12T14:56:06Z", "mode": "train", "global_step": 1035, "epoch": 0.0415712736474274, "loss": -0.0561, "grad_norm": 4.304089069366455, "learning_rate": 6.866666666666667e-06, "num_tokens": 2095503.0, "completions/mean_length": 160.75, "completions/min_length": 93.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 110.5714340209961, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.645095944404602, "rewards/meter/std": 0.45269909501075745, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.958979606628418, "rewards/lexical_plausibility/std": 0.07877527922391891, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.32624149322509766, "rewards/repeat_penalty/std": 0.22708722949028015, "rewards/near_duplicate_penalty/mean": 0.6438634395599365, "rewards/near_duplicate_penalty/std": 0.17047125101089478, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1530931144952774, "rewards/distinct_2/mean": 0.49744752049446106, "rewards/distinct_2/std": 0.27945196628570557, "rewards/total_composite/mean": 0.07263710349798203, "rewards/total_composite/std": 0.07002465426921844, "reward": 0.07263710349798203, "reward_std": 0.07002464681863785, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0699535682797432, "sampling/sampling_logp_difference/max": 1.0906991958618164, "sampling/importance_sampling_ratio/min": 0.33598148822784424, "sampling/importance_sampling_ratio/mean": 1.00955331325531, "sampling/importance_sampling_ratio/max": 1.9508916139602661, "entropy": 0.42657043412327766, "clip_ratio/low_mean": 0.017774964682757854, "clip_ratio/low_min": 0.017774964682757854, "clip_ratio/high_mean": 0.031890815356746316, "clip_ratio/high_max": 0.031890815356746316, "clip_ratio/region_mean": 0.04966578003950417, "reward_total_mean": 0.07263710349798203, "reward_meter_mean": 0.645095944404602, "reward_meter_std": 0.45269909501075745, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.958979606628418, "reward_lexical_plausibility_std": 0.07877527922391891, "reward_repeat_penalty_mean": 0.32624149322509766, "reward_repeat_penalty_std": 0.22708722949028015, "reward_near_duplicate_penalty_mean": 0.6438634395599365, "reward_near_duplicate_penalty_std": 0.17047125101089478, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1530931144952774, "reward_distinct_2_mean": 0.49744752049446106, "reward_distinct_2_std": 0.27945196628570557, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.07263710349798203, "reward_total_composite_std": 0.07002465426921844} {"timestamp_utc": "2026-04-12T14:56:13Z", "mode": "train", "global_step": 1036, "epoch": 0.041611439129212356, "loss": -0.0272, "grad_norm": 16.272716522216797, "learning_rate": 6.8636363636363645e-06, "num_tokens": 2096949.0, "completions/mean_length": 23.75, "completions/min_length": 21.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.75, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.29522714018821716, "rewards/meter/std": 0.4176274538040161, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9713541269302368, "rewards/lexical_plausibility/std": 0.05990393087267876, "rewards/judge_quality/mean": 0.8525000214576721, "rewards/judge_quality/std": 0.28469279408454895, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27898114919662476, "rewards/total_composite/std": 0.3970460295677185, "reward": 0.27898114919662476, "reward_std": 0.3970460295677185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1501610428094864, "sampling/sampling_logp_difference/max": 2.67525315284729, "sampling/importance_sampling_ratio/min": 0.06888938695192337, "sampling/importance_sampling_ratio/mean": 1.004130244255066, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6254268996417522, "clip_ratio/low_mean": 0.08184818085283041, "clip_ratio/low_min": 0.08184818085283041, "clip_ratio/high_mean": 0.030448718927800655, "clip_ratio/high_max": 0.030448718927800655, "clip_ratio/region_mean": 0.11229689978063107, "reward_total_mean": 0.27898114919662476, "reward_meter_mean": 0.29522714018821716, "reward_meter_std": 0.4176274538040161, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9713541269302368, "reward_lexical_plausibility_std": 0.05990393087267876, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8525000214576721, "reward_judge_quality_std": 0.28469279408454895, "reward_total_composite_mean": 0.27898114919662476, "reward_total_composite_std": 0.3970460295677185} {"timestamp_utc": "2026-04-12T14:56:22Z", "mode": "train", "global_step": 1037, "epoch": 0.04165160461099731, "loss": 0.0198, "grad_norm": 6.293120384216309, "learning_rate": 6.860606060606061e-06, "num_tokens": 2099287.0, "completions/mean_length": 107.25, "completions/min_length": 95.0, "completions/max_length": 116.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.25, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.6889856457710266, "rewards/meter/std": 0.37136074900627136, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9800558090209961, "rewards/lexical_plausibility/std": 0.041558220982551575, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.07567217946052551, "rewards/repeat_penalty/std": 0.10801900178194046, "rewards/near_duplicate_penalty/mean": 0.5517589449882507, "rewards/near_duplicate_penalty/std": 0.19355860352516174, "rewards/opening_diversity/mean": 0.3984375, "rewards/opening_diversity/std": 0.1858183592557907, "rewards/distinct_2/mean": 0.25030049681663513, "rewards/distinct_2/std": 0.2290385514497757, "rewards/total_composite/mean": 0.12731152772903442, "rewards/total_composite/std": 0.08997271209955215, "reward": 0.12731152772903442, "reward_std": 0.08997270464897156, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07115565985441208, "sampling/sampling_logp_difference/max": 1.5724859237670898, "sampling/importance_sampling_ratio/min": 0.20752863585948944, "sampling/importance_sampling_ratio/mean": 0.9952552318572998, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3931223377585411, "clip_ratio/low_mean": 0.028525335714221, "clip_ratio/low_min": 0.028525335714221, "clip_ratio/high_mean": 0.03271407098509371, "clip_ratio/high_max": 0.03271407098509371, "clip_ratio/region_mean": 0.061239406699314713, "reward_total_mean": 0.12731152772903442, "reward_meter_mean": 0.6889856457710266, "reward_meter_std": 0.37136074900627136, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9800558090209961, "reward_lexical_plausibility_std": 0.041558220982551575, "reward_repeat_penalty_mean": 0.07567217946052551, "reward_repeat_penalty_std": 0.10801900178194046, "reward_near_duplicate_penalty_mean": 0.5517589449882507, "reward_near_duplicate_penalty_std": 0.19355860352516174, "reward_opening_diversity_mean": 0.3984375, "reward_opening_diversity_std": 0.1858183592557907, "reward_distinct_2_mean": 0.25030049681663513, "reward_distinct_2_std": 0.2290385514497757, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.12731152772903442, "reward_total_composite_std": 0.08997271209955215} {"timestamp_utc": "2026-04-12T14:56:36Z", "mode": "train", "global_step": 1038, "epoch": 0.041691770092782264, "loss": 0.0065, "grad_norm": 3.965681791305542, "learning_rate": 6.857575757575758e-06, "num_tokens": 2100685.0, "completions/mean_length": 83.75, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.571430206298828, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.25796061754226685, "rewards/meter/std": 0.4418087601661682, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9571786522865295, "rewards/lexical_plausibility/std": 0.12111710757017136, "rewards/judge_quality/mean": 0.476250022649765, "rewards/judge_quality/std": 0.38119879364967346, "rewards/repeat_penalty/mean": 0.7451828122138977, "rewards/repeat_penalty/std": 0.013625085353851318, "rewards/near_duplicate_penalty/mean": 0.9935770630836487, "rewards/near_duplicate_penalty/std": 0.018166767433285713, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.06684528291225433, "rewards/total_composite/std": 0.12137099355459213, "reward": 0.06684528291225433, "reward_std": 0.12137098610401154, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13378006219863892, "sampling/sampling_logp_difference/max": 2.5705623626708984, "sampling/importance_sampling_ratio/min": 0.07649251818656921, "sampling/importance_sampling_ratio/mean": 0.9982591867446899, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.48402202129364014, "clip_ratio/low_mean": 0.04154491424560547, "clip_ratio/low_min": 0.04154491424560547, "clip_ratio/high_mean": 0.01883971318602562, "clip_ratio/high_max": 0.01883971318602562, "clip_ratio/region_mean": 0.06038462743163109, "reward_total_mean": 0.06684528291225433, "reward_meter_mean": 0.25796061754226685, "reward_meter_std": 0.4418087601661682, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9571786522865295, "reward_lexical_plausibility_std": 0.12111710757017136, "reward_repeat_penalty_mean": 0.7451828122138977, "reward_repeat_penalty_std": 0.013625085353851318, "reward_near_duplicate_penalty_mean": 0.9935770630836487, "reward_near_duplicate_penalty_std": 0.018166767433285713, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.476250022649765, "reward_judge_quality_std": 0.38119879364967346, "reward_total_composite_mean": 0.06684528291225433, "reward_total_composite_std": 0.12137099355459213} {"timestamp_utc": "2026-04-12T14:56:45Z", "mode": "train", "global_step": 1039, "epoch": 0.04173193557456722, "loss": 0.0758, "grad_norm": 11.13637924194336, "learning_rate": 6.854545454545455e-06, "num_tokens": 2102432.0, "completions/mean_length": 50.375, "completions/min_length": 35.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.375, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.4992498755455017, "rewards/meter/std": 0.38977953791618347, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9713541269302368, "rewards/lexical_plausibility/std": 0.05990393087267876, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.2796298861503601, "rewards/repeat_penalty/mean": 0.7816746234893799, "rewards/repeat_penalty/std": 0.19714240729808807, "rewards/near_duplicate_penalty/mean": 0.8836131691932678, "rewards/near_duplicate_penalty/std": 0.08969806879758835, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8982267379760742, "rewards/distinct_2/std": 0.10319311171770096, "rewards/total_composite/mean": 0.22295686602592468, "rewards/total_composite/std": 0.1913090944290161, "reward": 0.22295686602592468, "reward_std": 0.19130907952785492, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13055534660816193, "sampling/sampling_logp_difference/max": 2.1627912521362305, "sampling/importance_sampling_ratio/min": 0.11500366032123566, "sampling/importance_sampling_ratio/mean": 1.0089117288589478, "sampling/importance_sampling_ratio/max": 1.9326164722442627, "entropy": 0.688446007668972, "clip_ratio/low_mean": 0.039414272643625736, "clip_ratio/low_min": 0.039414272643625736, "clip_ratio/high_mean": 0.059787140460684896, "clip_ratio/high_max": 0.059787140460684896, "clip_ratio/region_mean": 0.09920141310431063, "reward_total_mean": 0.22295686602592468, "reward_meter_mean": 0.4992498755455017, "reward_meter_std": 0.38977953791618347, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9713541269302368, "reward_lexical_plausibility_std": 0.05990393087267876, "reward_repeat_penalty_mean": 0.7816746234893799, "reward_repeat_penalty_std": 0.19714240729808807, "reward_near_duplicate_penalty_mean": 0.8836131691932678, "reward_near_duplicate_penalty_std": 0.08969806879758835, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8982267379760742, "reward_distinct_2_std": 0.10319311171770096, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.2796298861503601, "reward_total_composite_mean": 0.22295686602592468, "reward_total_composite_std": 0.1913090944290161} {"timestamp_utc": "2026-04-12T14:56:54Z", "mode": "train", "global_step": 1040, "epoch": 0.04177210105635217, "loss": 0.0598, "grad_norm": 9.161330223083496, "learning_rate": 6.851515151515153e-06, "num_tokens": 2104675.0, "completions/mean_length": 98.375, "completions/min_length": 86.0, "completions/max_length": 134.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.375, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 134.0, "rewards/meter/mean": 0.6199376583099365, "rewards/meter/std": 0.29622992873191833, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.17406870424747467, "rewards/repeat_penalty/std": 0.14580193161964417, "rewards/near_duplicate_penalty/mean": 0.7089067697525024, "rewards/near_duplicate_penalty/std": 0.165482297539711, "rewards/opening_diversity/mean": 0.6491477489471436, "rewards/opening_diversity/std": 0.2793881595134735, "rewards/distinct_2/mean": 0.34906089305877686, "rewards/distinct_2/std": 0.25997501611709595, "rewards/total_composite/mean": 0.11755747348070145, "rewards/total_composite/std": 0.06578730046749115, "reward": 0.11755747348070145, "reward_std": 0.06578729301691055, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09282664209604263, "sampling/sampling_logp_difference/max": 2.5501863956451416, "sampling/importance_sampling_ratio/min": 0.0780671164393425, "sampling/importance_sampling_ratio/mean": 0.9970666766166687, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.34638754837214947, "clip_ratio/low_mean": 0.026927629485726357, "clip_ratio/low_min": 0.026927629485726357, "clip_ratio/high_mean": 0.05801033042371273, "clip_ratio/high_max": 0.05801033042371273, "clip_ratio/region_mean": 0.08493795990943909, "reward_total_mean": 0.11755747348070145, "reward_meter_mean": 0.6199376583099365, "reward_meter_std": 0.29622992873191833, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.17406870424747467, "reward_repeat_penalty_std": 0.14580193161964417, "reward_near_duplicate_penalty_mean": 0.7089067697525024, "reward_near_duplicate_penalty_std": 0.165482297539711, "reward_opening_diversity_mean": 0.6491477489471436, "reward_opening_diversity_std": 0.2793881595134735, "reward_distinct_2_mean": 0.34906089305877686, "reward_distinct_2_std": 0.25997501611709595, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.11755747348070145, "reward_total_composite_std": 0.06578730046749115} {"timestamp_utc": "2026-04-12T14:57:07Z", "mode": "train", "global_step": 1041, "epoch": 0.041812266538137126, "loss": -0.0489, "grad_norm": 3.3286194801330566, "learning_rate": 6.848484848484849e-06, "num_tokens": 2106082.0, "completions/mean_length": 85.875, "completions/min_length": 12.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 25.000001907348633, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.5926029682159424, "rewards/meter/std": 0.4901561141014099, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.8277760148048401, "rewards/lexical_plausibility/std": 0.3452592194080353, "rewards/judge_quality/mean": 0.6637499928474426, "rewards/judge_quality/std": 0.3867792785167694, "rewards/repeat_penalty/mean": 0.6132802367210388, "rewards/repeat_penalty/std": 0.28017112612724304, "rewards/near_duplicate_penalty/mean": 0.9526224136352539, "rewards/near_duplicate_penalty/std": 0.06800727546215057, "rewards/opening_diversity/mean": 0.6875, "rewards/opening_diversity/std": 0.29124119877815247, "rewards/distinct_2/mean": 0.9132781028747559, "rewards/distinct_2/std": 0.07122636586427689, "rewards/total_composite/mean": 0.49210023880004883, "rewards/total_composite/std": 0.43593814969062805, "reward": 0.49210023880004883, "reward_std": 0.43593811988830566, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10442553460597992, "sampling/sampling_logp_difference/max": 1.0248875617980957, "sampling/importance_sampling_ratio/min": 0.358836829662323, "sampling/importance_sampling_ratio/mean": 0.9949103593826294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.41358262300491333, "clip_ratio/low_mean": 0.020717463456094265, "clip_ratio/low_min": 0.020717463456094265, "clip_ratio/high_mean": 0.029761905316263437, "clip_ratio/high_max": 0.029761905316263437, "clip_ratio/region_mean": 0.0504793687723577, "reward_total_mean": 0.49210023880004883, "reward_meter_mean": 0.5926029682159424, "reward_meter_std": 0.4901561141014099, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.8277760148048401, "reward_lexical_plausibility_std": 0.3452592194080353, "reward_repeat_penalty_mean": 0.6132802367210388, "reward_repeat_penalty_std": 0.28017112612724304, "reward_near_duplicate_penalty_mean": 0.9526224136352539, "reward_near_duplicate_penalty_std": 0.06800727546215057, "reward_opening_diversity_mean": 0.6875, "reward_opening_diversity_std": 0.29124119877815247, "reward_distinct_2_mean": 0.9132781028747559, "reward_distinct_2_std": 0.07122636586427689, "reward_judge_quality_mean": 0.6637499928474426, "reward_judge_quality_std": 0.3867792785167694, "reward_total_composite_mean": 0.49210023880004883, "reward_total_composite_std": 0.43593814969062805} {"timestamp_utc": "2026-04-12T14:57:18Z", "mode": "train", "global_step": 1042, "epoch": 0.04185243201992208, "loss": 0.0202, "grad_norm": 5.643406391143799, "learning_rate": 6.845454545454546e-06, "num_tokens": 2108443.0, "completions/mean_length": 124.125, "completions/min_length": 118.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 124.125, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.3518877625465393, "rewards/meter/std": 0.40807414054870605, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.18866121768951416, "rewards/repeat_penalty/std": 0.1627783626317978, "rewards/near_duplicate_penalty/mean": 0.6615521907806396, "rewards/near_duplicate_penalty/std": 0.10860022902488708, "rewards/opening_diversity/mean": 0.8671875, "rewards/opening_diversity/std": 0.21505165100097656, "rewards/distinct_2/mean": 0.33811962604522705, "rewards/distinct_2/std": 0.20475278794765472, "rewards/total_composite/mean": 0.052783168852329254, "rewards/total_composite/std": 0.061211127787828445, "reward": 0.052783168852329254, "reward_std": 0.061211127787828445, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06198493763804436, "sampling/sampling_logp_difference/max": 2.6736860275268555, "sampling/importance_sampling_ratio/min": 0.06899742782115936, "sampling/importance_sampling_ratio/mean": 1.0036184787750244, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.39221990294754505, "clip_ratio/low_mean": 0.027916133869439363, "clip_ratio/low_min": 0.027916133869439363, "clip_ratio/high_mean": 0.032405747566372156, "clip_ratio/high_max": 0.032405747566372156, "clip_ratio/region_mean": 0.06032188143581152, "reward_total_mean": 0.052783168852329254, "reward_meter_mean": 0.3518877625465393, "reward_meter_std": 0.40807414054870605, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.18866121768951416, "reward_repeat_penalty_std": 0.1627783626317978, "reward_near_duplicate_penalty_mean": 0.6615521907806396, "reward_near_duplicate_penalty_std": 0.10860022902488708, "reward_opening_diversity_mean": 0.8671875, "reward_opening_diversity_std": 0.21505165100097656, "reward_distinct_2_mean": 0.33811962604522705, "reward_distinct_2_std": 0.20475278794765472, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.052783168852329254, "reward_total_composite_std": 0.061211127787828445} {"timestamp_utc": "2026-04-12T14:57:27Z", "mode": "train", "global_step": 1043, "epoch": 0.041892597501707034, "loss": -0.0035, "grad_norm": 11.984976768493652, "learning_rate": 6.842424242424243e-06, "num_tokens": 2110083.0, "completions/mean_length": 50.0, "completions/min_length": 43.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.0, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.497693806886673, "rewards/meter/std": 0.4275621771812439, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.7967106103897095, "rewards/repeat_penalty/std": 0.12067160755395889, "rewards/near_duplicate_penalty/mean": 0.8925138711929321, "rewards/near_duplicate_penalty/std": 0.058820899575948715, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8885694146156311, "rewards/distinct_2/std": 0.07826769351959229, "rewards/total_composite/mean": 0.14110656082630157, "rewards/total_composite/std": 0.14107048511505127, "reward": 0.14110656082630157, "reward_std": 0.14107047021389008, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11833526194095612, "sampling/sampling_logp_difference/max": 1.821230173110962, "sampling/importance_sampling_ratio/min": 0.16182655096054077, "sampling/importance_sampling_ratio/mean": 1.0077437162399292, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6130513288080692, "clip_ratio/low_mean": 0.06046593235805631, "clip_ratio/low_min": 0.06046593235805631, "clip_ratio/high_mean": 0.031651423778384924, "clip_ratio/high_max": 0.031651423778384924, "clip_ratio/region_mean": 0.09211735613644123, "reward_total_mean": 0.14110656082630157, "reward_meter_mean": 0.497693806886673, "reward_meter_std": 0.4275621771812439, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7967106103897095, "reward_repeat_penalty_std": 0.12067160755395889, "reward_near_duplicate_penalty_mean": 0.8925138711929321, "reward_near_duplicate_penalty_std": 0.058820899575948715, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8885694146156311, "reward_distinct_2_std": 0.07826769351959229, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.14110656082630157, "reward_total_composite_std": 0.14107048511505127} {"timestamp_utc": "2026-04-12T14:57:36Z", "mode": "train", "global_step": 1044, "epoch": 0.04193276298349199, "loss": 0.0425, "grad_norm": 9.679908752441406, "learning_rate": 6.83939393939394e-06, "num_tokens": 2111976.0, "completions/mean_length": 58.625, "completions/min_length": 49.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.625, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.953931450843811, "rewards/meter/std": 0.03660731762647629, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.2892645001411438, "rewards/repeat_penalty/std": 0.18122747540473938, "rewards/near_duplicate_penalty/mean": 0.6895205974578857, "rewards/near_duplicate_penalty/std": 0.17486591637134552, "rewards/opening_diversity/mean": 0.5625, "rewards/opening_diversity/std": 0.20044593513011932, "rewards/distinct_2/mean": 0.6810886859893799, "rewards/distinct_2/std": 0.17342659831047058, "rewards/total_composite/mean": 0.22390568256378174, "rewards/total_composite/std": 0.11150608211755753, "reward": 0.22390568256378174, "reward_std": 0.11150607466697693, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08960143476724625, "sampling/sampling_logp_difference/max": 1.7579872608184814, "sampling/importance_sampling_ratio/min": 0.17239150404930115, "sampling/importance_sampling_ratio/mean": 1.006904125213623, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4613865576684475, "clip_ratio/low_mean": 0.03758245659992099, "clip_ratio/low_min": 0.03758245659992099, "clip_ratio/high_mean": 0.03716727206483483, "clip_ratio/high_max": 0.03716727206483483, "clip_ratio/region_mean": 0.07474972866475582, "reward_total_mean": 0.22390568256378174, "reward_meter_mean": 0.953931450843811, "reward_meter_std": 0.03660731762647629, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2892645001411438, "reward_repeat_penalty_std": 0.18122747540473938, "reward_near_duplicate_penalty_mean": 0.6895205974578857, "reward_near_duplicate_penalty_std": 0.17486591637134552, "reward_opening_diversity_mean": 0.5625, "reward_opening_diversity_std": 0.20044593513011932, "reward_distinct_2_mean": 0.6810886859893799, "reward_distinct_2_std": 0.17342659831047058, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.22390568256378174, "reward_total_composite_std": 0.11150608211755753} {"timestamp_utc": "2026-04-12T14:57:44Z", "mode": "train", "global_step": 1045, "epoch": 0.04197292846527694, "loss": -0.0216, "grad_norm": 8.130537033081055, "learning_rate": 6.8363636363636364e-06, "num_tokens": 2113740.0, "completions/mean_length": 58.5, "completions/min_length": 53.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.5, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.9601110219955444, "rewards/meter/std": 0.05813397839665413, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.07559289038181305, "rewards/repeat_penalty/mean": 0.16896995902061462, "rewards/repeat_penalty/std": 0.10778757929801941, "rewards/near_duplicate_penalty/mean": 0.7068864107131958, "rewards/near_duplicate_penalty/std": 0.16768382489681244, "rewards/opening_diversity/mean": 0.375, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6246208548545837, "rewards/distinct_2/std": 0.25567397475242615, "rewards/total_composite/mean": 0.28806552290916443, "rewards/total_composite/std": 0.07587701082229614, "reward": 0.28806552290916443, "reward_std": 0.07587700337171555, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08639981597661972, "sampling/sampling_logp_difference/max": 1.9444198608398438, "sampling/importance_sampling_ratio/min": 0.14307019114494324, "sampling/importance_sampling_ratio/mean": 0.9960545301437378, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.41695987060666084, "clip_ratio/low_mean": 0.027110593393445015, "clip_ratio/low_min": 0.027110593393445015, "clip_ratio/high_mean": 0.04287410504184663, "clip_ratio/high_max": 0.04287410504184663, "clip_ratio/region_mean": 0.06998469843529165, "reward_total_mean": 0.28806552290916443, "reward_meter_mean": 0.9601110219955444, "reward_meter_std": 0.05813397839665413, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.16896995902061462, "reward_repeat_penalty_std": 0.10778757929801941, "reward_near_duplicate_penalty_mean": 0.7068864107131958, "reward_near_duplicate_penalty_std": 0.16768382489681244, "reward_opening_diversity_mean": 0.375, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6246208548545837, "reward_distinct_2_std": 0.25567397475242615, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.07559289038181305, "reward_total_composite_mean": 0.28806552290916443, "reward_total_composite_std": 0.07587701082229614} {"timestamp_utc": "2026-04-12T14:57:53Z", "mode": "train", "global_step": 1046, "epoch": 0.042013093947061896, "loss": 0.0385, "grad_norm": 12.937902450561523, "learning_rate": 6.833333333333334e-06, "num_tokens": 2115293.0, "completions/mean_length": 51.125, "completions/min_length": 45.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.125, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.16545015573501587, "rewards/meter/std": 0.10467123240232468, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8051742315292358, "rewards/repeat_penalty/std": 0.19072328507900238, "rewards/near_duplicate_penalty/mean": 0.9040540456771851, "rewards/near_duplicate_penalty/std": 0.060803644359111786, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9030629396438599, "rewards/distinct_2/std": 0.11608945578336716, "rewards/total_composite/mean": 0.054583821445703506, "rewards/total_composite/std": 0.028577309101819992, "reward": 0.054583821445703506, "reward_std": 0.02857731096446514, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12414848059415817, "sampling/sampling_logp_difference/max": 1.4196252822875977, "sampling/importance_sampling_ratio/min": 0.2418045997619629, "sampling/importance_sampling_ratio/mean": 0.9813938736915588, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5275466926395893, "clip_ratio/low_mean": 0.048214022535830736, "clip_ratio/low_min": 0.048214022535830736, "clip_ratio/high_mean": 0.05502551142126322, "clip_ratio/high_max": 0.05502551142126322, "clip_ratio/region_mean": 0.10323953395709395, "reward_total_mean": 0.054583821445703506, "reward_meter_mean": 0.16545015573501587, "reward_meter_std": 0.10467123240232468, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8051742315292358, "reward_repeat_penalty_std": 0.19072328507900238, "reward_near_duplicate_penalty_mean": 0.9040540456771851, "reward_near_duplicate_penalty_std": 0.060803644359111786, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9030629396438599, "reward_distinct_2_std": 0.11608945578336716, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.054583821445703506, "reward_total_composite_std": 0.028577309101819992} {"timestamp_utc": "2026-04-12T14:58:07Z", "mode": "train", "global_step": 1047, "epoch": 0.04205325942884685, "loss": -0.1305, "grad_norm": 2.625126600265503, "learning_rate": 6.83030303030303e-06, "num_tokens": 2117785.0, "completions/mean_length": 199.5, "completions/min_length": 143.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 154.85714721679688, "completions/min_terminated_length": 143.0, "completions/max_terminated_length": 190.0, "rewards/meter/mean": 0.6465119123458862, "rewards/meter/std": 0.47260215878486633, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.1178511381149292, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/lexical_plausibility/mean": 0.9783613681793213, "rewards/lexical_plausibility/std": 0.06120318919420242, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.11797183752059937, "rewards/repeat_penalty/std": 0.25789815187454224, "rewards/near_duplicate_penalty/mean": 0.4955127239227295, "rewards/near_duplicate_penalty/std": 0.23408250510692596, "rewards/opening_diversity/mean": 0.484375, "rewards/opening_diversity/std": 0.16952534019947052, "rewards/distinct_2/mean": 0.22648878395557404, "rewards/distinct_2/std": 0.3366652727127075, "rewards/total_composite/mean": 0.0628373920917511, "rewards/total_composite/std": 0.049676164984703064, "reward": 0.0628373920917511, "reward_std": 0.04967616870999336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.043361932039260864, "sampling/sampling_logp_difference/max": 1.4238332509994507, "sampling/importance_sampling_ratio/min": 0.2593633532524109, "sampling/importance_sampling_ratio/mean": 1.0077636241912842, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.2667356953024864, "clip_ratio/low_mean": 0.01226362632587552, "clip_ratio/low_min": 0.01226362632587552, "clip_ratio/high_mean": 0.022837560391053557, "clip_ratio/high_max": 0.022837560391053557, "clip_ratio/region_mean": 0.03510118671692908, "reward_total_mean": 0.0628373920917511, "reward_meter_mean": 0.6465119123458862, "reward_meter_std": 0.47260215878486633, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.1178511381149292, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_lexical_plausibility_mean": 0.9783613681793213, "reward_lexical_plausibility_std": 0.06120318919420242, "reward_repeat_penalty_mean": 0.11797183752059937, "reward_repeat_penalty_std": 0.25789815187454224, "reward_near_duplicate_penalty_mean": 0.4955127239227295, "reward_near_duplicate_penalty_std": 0.23408250510692596, "reward_opening_diversity_mean": 0.484375, "reward_opening_diversity_std": 0.16952534019947052, "reward_distinct_2_mean": 0.22648878395557404, "reward_distinct_2_std": 0.3366652727127075, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.0628373920917511, "reward_total_composite_std": 0.049676164984703064} {"timestamp_utc": "2026-04-12T14:58:15Z", "mode": "train", "global_step": 1048, "epoch": 0.0420934249106318, "loss": 0.02, "grad_norm": 17.605117797851562, "learning_rate": 6.827272727272728e-06, "num_tokens": 2119243.0, "completions/mean_length": 31.25, "completions/min_length": 28.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.25, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.895077109336853, "rewards/meter/std": 0.27064019441604614, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 0.9173212051391602, "rewards/lexical_plausibility/std": 0.209740549325943, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101404666900635, "rewards/repeat_penalty/mean": 0.640625, "rewards/repeat_penalty/std": 0.26252126693725586, "rewards/near_duplicate_penalty/mean": 0.9501262903213501, "rewards/near_duplicate_penalty/std": 0.09400057047605515, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.3957640826702118, "rewards/total_composite/std": 0.34027931094169617, "reward": 0.3957640826702118, "reward_std": 0.34027931094169617, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14961084723472595, "sampling/sampling_logp_difference/max": 3.684997797012329, "sampling/importance_sampling_ratio/min": 0.025097230449318886, "sampling/importance_sampling_ratio/mean": 0.9999329447746277, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8068030849099159, "clip_ratio/low_mean": 0.0725634228438139, "clip_ratio/low_min": 0.0725634228438139, "clip_ratio/high_mean": 0.040982948150485754, "clip_ratio/high_max": 0.040982948150485754, "clip_ratio/region_mean": 0.11354637099429965, "reward_total_mean": 0.3957640826702118, "reward_meter_mean": 0.895077109336853, "reward_meter_std": 0.27064019441604614, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 0.9173212051391602, "reward_lexical_plausibility_std": 0.209740549325943, "reward_repeat_penalty_mean": 0.640625, "reward_repeat_penalty_std": 0.26252126693725586, "reward_near_duplicate_penalty_mean": 0.9501262903213501, "reward_near_duplicate_penalty_std": 0.09400057047605515, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101404666900635, "reward_total_composite_mean": 0.3957640826702118, "reward_total_composite_std": 0.34027931094169617} {"timestamp_utc": "2026-04-12T14:58:25Z", "mode": "train", "global_step": 1049, "epoch": 0.04213359039241676, "loss": 0.1283, "grad_norm": 4.576805114746094, "learning_rate": 6.824242424242425e-06, "num_tokens": 2121287.0, "completions/mean_length": 97.5, "completions/min_length": 80.0, "completions/max_length": 131.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 97.5, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.8802154064178467, "rewards/meter/std": 0.16540750861167908, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.0048208110965788364, "rewards/repeat_penalty/std": 0.007432539016008377, "rewards/near_duplicate_penalty/mean": 0.3683338165283203, "rewards/near_duplicate_penalty/std": 0.06853021681308746, "rewards/opening_diversity/mean": 0.2265625, "rewards/opening_diversity/std": 0.032346826046705246, "rewards/distinct_2/mean": 0.06965675950050354, "rewards/distinct_2/std": 0.07852064073085785, "rewards/total_composite/mean": 0.11638369411230087, "rewards/total_composite/std": 0.033883191645145416, "reward": 0.11638369411230087, "reward_std": 0.033883191645145416, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.04824488237500191, "sampling/sampling_logp_difference/max": 2.618191719055176, "sampling/importance_sampling_ratio/min": 0.07293463498353958, "sampling/importance_sampling_ratio/mean": 1.0019862651824951, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.21380569599568844, "clip_ratio/low_mean": 0.02046280587092042, "clip_ratio/low_min": 0.02046280587092042, "clip_ratio/high_mean": 0.02666075900197029, "clip_ratio/high_max": 0.02666075900197029, "clip_ratio/region_mean": 0.04712356487289071, "reward_total_mean": 0.11638369411230087, "reward_meter_mean": 0.8802154064178467, "reward_meter_std": 0.16540750861167908, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.0048208110965788364, "reward_repeat_penalty_std": 0.007432539016008377, "reward_near_duplicate_penalty_mean": 0.3683338165283203, "reward_near_duplicate_penalty_std": 0.06853021681308746, "reward_opening_diversity_mean": 0.2265625, "reward_opening_diversity_std": 0.032346826046705246, "reward_distinct_2_mean": 0.06965675950050354, "reward_distinct_2_std": 0.07852064073085785, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.11638369411230087, "reward_total_composite_std": 0.033883191645145416} {"timestamp_utc": "2026-04-12T14:58:33Z", "mode": "train", "global_step": 1050, "epoch": 0.04217375587420171, "loss": 0.044, "grad_norm": 9.839877128601074, "learning_rate": 6.821212121212122e-06, "num_tokens": 2122944.0, "completions/mean_length": 45.125, "completions/min_length": 39.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.125, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.28557300567626953, "rewards/meter/std": 0.28182196617126465, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6225000023841858, "rewards/judge_quality/std": 0.3285357356071472, "rewards/repeat_penalty/mean": 0.7773823738098145, "rewards/repeat_penalty/std": 0.18026597797870636, "rewards/near_duplicate_penalty/mean": 0.9530285596847534, "rewards/near_duplicate_penalty/std": 0.043377574533224106, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.8699880838394165, "rewards/distinct_2/std": 0.096328504383564, "rewards/total_composite/mean": 0.126708984375, "rewards/total_composite/std": 0.09142221510410309, "reward": 0.126708984375, "reward_std": 0.09142221510410309, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11328752338886261, "sampling/sampling_logp_difference/max": 1.7761284112930298, "sampling/importance_sampling_ratio/min": 0.16929231584072113, "sampling/importance_sampling_ratio/mean": 1.0014660358428955, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4858452193439007, "clip_ratio/low_mean": 0.036599186481907964, "clip_ratio/low_min": 0.036599186481907964, "clip_ratio/high_mean": 0.050821324810385704, "clip_ratio/high_max": 0.050821324810385704, "clip_ratio/region_mean": 0.08742051129229367, "reward_total_mean": 0.126708984375, "reward_meter_mean": 0.28557300567626953, "reward_meter_std": 0.28182196617126465, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7773823738098145, "reward_repeat_penalty_std": 0.18026597797870636, "reward_near_duplicate_penalty_mean": 0.9530285596847534, "reward_near_duplicate_penalty_std": 0.043377574533224106, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.8699880838394165, "reward_distinct_2_std": 0.096328504383564, "reward_judge_quality_mean": 0.6225000023841858, "reward_judge_quality_std": 0.3285357356071472, "reward_total_composite_mean": 0.126708984375, "reward_total_composite_std": 0.09142221510410309} {"timestamp_utc": "2026-04-12T15:00:52Z", "mode": "eval", "global_step": 1050, "epoch": 0.04217375587420171, "eval_loss": NaN, "eval_runtime": 138.7371, "eval_samples_per_second": 0.75, "eval_steps_per_second": 0.094, "eval_num_tokens": 2122944.0, "eval_completions/mean_length": 276.0673076923077, "eval_completions/min_length": 48.53846153846154, "eval_completions/max_length": 488.6923076923077, "eval_completions/clipped_ratio": 0.33653846153846156, "eval_completions/mean_terminated_length": 157.61685356727014, "eval_completions/min_terminated_length": 48.53846153846154, "eval_completions/max_terminated_length": 287.7692307692308, "eval_rewards/meter/mean": 0.5317095586886773, "eval_rewards/meter/std": 0.42014962434768677, "eval_rewards/count_adherence/mean": 0.6783530253630418, "eval_rewards/count_adherence/std": 0.3206257911828848, "eval_rewards/arabic_clean/mean": 0.9615384615384616, "eval_rewards/arabic_clean/std": 0.10878565678229699, "eval_rewards/lexical_plausibility/mean": 0.9860358421619122, "eval_rewards/lexical_plausibility/std": 0.03762838330406409, "eval_rewards/judge_quality/mean": 0.16836538624304992, "eval_rewards/judge_quality/std": 0.13044744586715332, "eval_rewards/repeat_penalty/mean": 0.16069939271143924, "eval_rewards/repeat_penalty/std": 0.2769986059821139, "eval_rewards/near_duplicate_penalty/mean": 0.4656345316996941, "eval_rewards/near_duplicate_penalty/std": 0.29570043889375835, "eval_rewards/opening_diversity/mean": 0.5071448316940894, "eval_rewards/opening_diversity/std": 0.3606924471946863, "eval_rewards/distinct_2/mean": 0.2279228991112457, "eval_rewards/distinct_2/std": 0.34475924633443356, "eval_rewards/total_composite/mean": 0.06406389520718501, "eval_rewards/total_composite/std": 0.08801526576280594, "eval_reward": 0.06406389520718501, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.022444536336339437, "eval_sampling/sampling_logp_difference/max": 0.9237296397869403, "eval_sampling/importance_sampling_ratio/min": 0.4081879464479593, "eval_sampling/importance_sampling_ratio/mean": 1.0031032608105586, "eval_sampling/importance_sampling_ratio/max": 1.3501007832013643, "eval_entropy": 0.21908611574998269, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.06406389520718501, "eval_reward_meter_mean": 0.5317095586886773, "eval_reward_meter_std": 0.42014962434768677, "eval_reward_count_adherence_mean": 0.6783530253630418, "eval_reward_count_adherence_std": 0.3206257911828848, "eval_reward_arabic_clean_mean": 0.9615384615384616, "eval_reward_arabic_clean_std": 0.10878565678229699, "eval_reward_lexical_plausibility_mean": 0.9860358421619122, "eval_reward_lexical_plausibility_std": 0.03762838330406409, "eval_reward_repeat_penalty_mean": 0.16069939271143924, "eval_reward_repeat_penalty_std": 0.2769986059821139, "eval_reward_near_duplicate_penalty_mean": 0.4656345316996941, "eval_reward_near_duplicate_penalty_std": 0.29570043889375835, "eval_reward_opening_diversity_mean": 0.5071448316940894, "eval_reward_opening_diversity_std": 0.3606924471946863, "eval_reward_distinct_2_mean": 0.2279228991112457, "eval_reward_distinct_2_std": 0.34475924633443356, "eval_reward_judge_quality_mean": 0.16836538624304992, "eval_reward_judge_quality_std": 0.13044744586715332, "eval_reward_total_composite_mean": 0.06406389520718501, "eval_reward_total_composite_std": 0.08801526576280594}