{ "best_global_step": 650, "best_metric": 0.7413886831356928, "best_model_checkpoint": "/root/workspace/Shaer/grpo/outputs/train/shaer_grpo_20260411_192107/checkpoint-650", "epoch": 0.032132385427963206, "eval_steps": 50, "global_step": 800, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.1411083247512579, "clip_ratio/high_mean": 0.1411083247512579, "clip_ratio/low_mean": 0.05967577267438173, "clip_ratio/low_min": 0.05967577267438173, "clip_ratio/region_mean": 0.20078409742563963, "completions/clipped_ratio": 0.0, "completions/max_length": 122.0, "completions/max_terminated_length": 122.0, "completions/mean_length": 86.375, "completions/mean_terminated_length": 86.375, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 1.9424520283937454, "epoch": 3.861600247142416e-05, "frac_reward_zero_std": 0.0, "grad_norm": 12.506416320800781, "learning_rate": 1e-05, "loss": -0.0412, "num_tokens": 2187.0, "reward": 0.46589815616607666, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_meter_mean": 0.5479353666305542, "reward_meter_std": 0.42796453833580017, "reward_std": 0.35266923904418945, "reward_total_composite_mean": 0.46589815616607666, "reward_total_composite_std": 0.35266923904418945, "reward_total_mean": 0.46589815616607666, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/meter/mean": 0.5479353666305542, "rewards/meter/std": 0.42796453833580017, "rewards/total_composite/mean": 0.46589815616607666, "rewards/total_composite/std": 0.35266923904418945, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.005318284034729, "sampling/importance_sampling_ratio/min": 0.20743781328201294, "sampling/sampling_logp_difference/max": 1.5729236602783203, "sampling/sampling_logp_difference/mean": 0.20873695611953735, "step": 1 }, { "clip_ratio/high_max": 0.05052456725388765, "clip_ratio/high_mean": 0.05052456725388765, "clip_ratio/low_mean": 0.10001249238848686, "clip_ratio/low_min": 0.10001249238848686, "clip_ratio/region_mean": 0.15053705964237452, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 57.75, "completions/mean_terminated_length": 57.75, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9319793060421944, "epoch": 7.723200494284832e-05, "frac_reward_zero_std": 0.0, "grad_norm": 17.5363826751709, "learning_rate": 9.996969696969698e-06, "loss": 0.0621, "num_tokens": 4001.0, "reward": 0.6565604209899902, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6565604209899902, "reward_meter_std": 0.3700096607208252, "reward_std": 0.3700096607208252, "reward_total_composite_mean": 0.6565604209899902, "reward_total_composite_std": 0.3700096607208252, "reward_total_mean": 0.6565604209899902, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6565604209899902, "rewards/meter/std": 0.3700096607208252, "rewards/total_composite/mean": 0.6565604209899902, "rewards/total_composite/std": 0.3700096607208252, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0128601789474487, "sampling/importance_sampling_ratio/min": 0.1371382474899292, "sampling/sampling_logp_difference/max": 1.986765742301941, "sampling/sampling_logp_difference/mean": 0.16318750381469727, "step": 2 }, { "clip_ratio/high_max": 0.10511028952896595, "clip_ratio/high_mean": 0.10511028952896595, "clip_ratio/low_mean": 0.11367196403443813, "clip_ratio/low_min": 0.11367196403443813, "clip_ratio/region_mean": 0.21878225356340408, "completions/clipped_ratio": 0.0, "completions/max_length": 46.0, "completions/max_terminated_length": 46.0, "completions/mean_length": 41.75, "completions/mean_terminated_length": 41.75, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 1.6740138679742813, "epoch": 0.00011584800741427248, "frac_reward_zero_std": 0.0, "grad_norm": 17.113204956054688, "learning_rate": 9.993939393939395e-06, "loss": 0.0587, "num_tokens": 5663.0, "reward": 0.5669770240783691, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5669770240783691, "reward_meter_std": 0.42305904626846313, "reward_std": 0.42305904626846313, "reward_total_composite_mean": 0.5669770240783691, "reward_total_composite_std": 0.42305904626846313, "reward_total_mean": 0.5669770240783691, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5669770240783691, "rewards/meter/std": 0.42305904626846313, "rewards/total_composite/mean": 0.5669770240783691, "rewards/total_composite/std": 0.42305904626846313, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.04336678981781, "sampling/importance_sampling_ratio/min": 0.23251527547836304, "sampling/sampling_logp_difference/max": 1.4587993621826172, "sampling/sampling_logp_difference/mean": 0.1992362141609192, "step": 3 }, { "clip_ratio/high_max": 0.15018654288724065, "clip_ratio/high_mean": 0.15018654288724065, "clip_ratio/low_mean": 0.029411764815449715, "clip_ratio/low_min": 0.029411764815449715, "clip_ratio/region_mean": 0.17959830770269036, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 26.75, "completions/mean_terminated_length": 26.75, "completions/min_length": 17.0, "completions/min_terminated_length": 17.0, "entropy": 1.2625475600361824, "epoch": 0.00015446400988569664, "frac_reward_zero_std": 0.0, "grad_norm": 19.642213821411133, "learning_rate": 9.990909090909093e-06, "loss": -0.1025, "num_tokens": 7109.0, "reward": 0.856600284576416, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.856600284576416, "reward_meter_std": 0.34479716420173645, "reward_std": 0.34479716420173645, "reward_total_composite_mean": 0.856600284576416, "reward_total_composite_std": 0.34479716420173645, "reward_total_mean": 0.856600284576416, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.856600284576416, "rewards/meter/std": 0.34479716420173645, "rewards/total_composite/mean": 0.856600284576416, "rewards/total_composite/std": 0.34479716420173645, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0328437089920044, "sampling/importance_sampling_ratio/min": 0.2593540549278259, "sampling/sampling_logp_difference/max": 1.3495612144470215, "sampling/sampling_logp_difference/mean": 0.18150335550308228, "step": 4 }, { "clip_ratio/high_max": 0.08046106435358524, "clip_ratio/high_mean": 0.08046106435358524, "clip_ratio/low_mean": 0.15030906535685062, "clip_ratio/low_min": 0.15030906535685062, "clip_ratio/region_mean": 0.23077012971043587, "completions/clipped_ratio": 0.0, "completions/max_length": 227.0, "completions/max_terminated_length": 227.0, "completions/mean_length": 163.0, "completions/mean_terminated_length": 163.0, "completions/min_length": 105.0, "completions/min_terminated_length": 105.0, "entropy": 2.7085169553756714, "epoch": 0.0001930800123571208, "frac_reward_zero_std": 0.0, "grad_norm": 9.840316772460938, "learning_rate": 9.987878787878788e-06, "loss": -0.0437, "num_tokens": 10053.0, "reward": 0.2891073226928711, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.9642857313156128, "reward_count_adherence_std": 0.06613000482320786, "reward_meter_mean": 0.4093240201473236, "reward_meter_std": 0.3055945336818695, "reward_std": 0.30707788467407227, "reward_total_composite_mean": 0.2891073226928711, "reward_total_composite_std": 0.30707788467407227, "reward_total_mean": 0.2891073226928711, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.9642857313156128, "rewards/count_adherence/std": 0.06613000482320786, "rewards/meter/mean": 0.4093240201473236, "rewards/meter/std": 0.3055945336818695, "rewards/total_composite/mean": 0.2891073226928711, "rewards/total_composite/std": 0.30707788467407227, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0441721677780151, "sampling/importance_sampling_ratio/min": 0.0970935970544815, "sampling/sampling_logp_difference/max": 2.3320798873901367, "sampling/sampling_logp_difference/mean": 0.2513454854488373, "step": 5 }, { "clip_ratio/high_max": 0.11287152394652367, "clip_ratio/high_mean": 0.11287152394652367, "clip_ratio/low_mean": 0.1318096686154604, "clip_ratio/low_min": 0.1318096686154604, "clip_ratio/region_mean": 0.24468119256198406, "completions/clipped_ratio": 0.0, "completions/max_length": 146.0, "completions/max_terminated_length": 146.0, "completions/mean_length": 95.125, "completions/mean_terminated_length": 95.125, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 2.5477894991636276, "epoch": 0.00023169601482854495, "frac_reward_zero_std": 0.0, "grad_norm": 12.211259841918945, "learning_rate": 9.984848484848485e-06, "loss": -0.0554, "num_tokens": 12078.0, "reward": 0.5588854551315308, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5617634057998657, "reward_meter_std": 0.41573381423950195, "reward_std": 0.42005324363708496, "reward_total_composite_mean": 0.5588854551315308, "reward_total_composite_std": 0.42005324363708496, "reward_total_mean": 0.5588854551315308, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5617634057998657, "rewards/meter/std": 0.41573381423950195, "rewards/total_composite/mean": 0.5588854551315308, "rewards/total_composite/std": 0.42005324363708496, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0142629146575928, "sampling/importance_sampling_ratio/min": 0.17717412114143372, "sampling/sampling_logp_difference/max": 1.7306222915649414, "sampling/sampling_logp_difference/mean": 0.23301345109939575, "step": 6 }, { "clip_ratio/high_max": 0.12872153520584106, "clip_ratio/high_mean": 0.12872153520584106, "clip_ratio/low_mean": 0.10475845448672771, "clip_ratio/low_min": 0.10475845448672771, "clip_ratio/region_mean": 0.23347998969256878, "completions/clipped_ratio": 0.0, "completions/max_length": 146.0, "completions/max_terminated_length": 146.0, "completions/mean_length": 84.875, "completions/mean_terminated_length": 84.875, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 2.2808013558387756, "epoch": 0.0002703120172999691, "frac_reward_zero_std": 0.0, "grad_norm": 15.44117546081543, "learning_rate": 9.981818181818183e-06, "loss": 0.2296, "num_tokens": 14125.0, "reward": 0.6451665163040161, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6451665163040161, "reward_meter_std": 0.29868313670158386, "reward_std": 0.29868316650390625, "reward_total_composite_mean": 0.6451665163040161, "reward_total_composite_std": 0.29868313670158386, "reward_total_mean": 0.6451665163040161, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6451665163040161, "rewards/meter/std": 0.29868313670158386, "rewards/total_composite/mean": 0.6451665163040161, "rewards/total_composite/std": 0.29868313670158386, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0209758281707764, "sampling/importance_sampling_ratio/min": 0.1656799614429474, "sampling/sampling_logp_difference/max": 1.7976973056793213, "sampling/sampling_logp_difference/mean": 0.2560131847858429, "step": 7 }, { "clip_ratio/high_max": 0.19223029538989067, "clip_ratio/high_mean": 0.19223029538989067, "clip_ratio/low_mean": 0.03434433601796627, "clip_ratio/low_min": 0.03434433601796627, "clip_ratio/region_mean": 0.22657463140785694, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 56.25, "completions/mean_terminated_length": 56.25, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 1.992170736193657, "epoch": 0.00030892801977139327, "frac_reward_zero_std": 0.0, "grad_norm": 17.118240356445312, "learning_rate": 9.97878787878788e-06, "loss": 0.1614, "num_tokens": 15903.0, "reward": 0.8440761566162109, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8440761566162109, "reward_meter_std": 0.24688278138637543, "reward_std": 0.24688279628753662, "reward_total_composite_mean": 0.8440761566162109, "reward_total_composite_std": 0.24688278138637543, "reward_total_mean": 0.8440761566162109, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8440761566162109, "rewards/meter/std": 0.24688278138637543, "rewards/total_composite/mean": 0.8440761566162109, "rewards/total_composite/std": 0.24688278138637543, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0035207271575928, "sampling/importance_sampling_ratio/min": 0.1740655153989792, "sampling/sampling_logp_difference/max": 1.7483234405517578, "sampling/sampling_logp_difference/mean": 0.22910818457603455, "step": 8 }, { "clip_ratio/high_max": 0.10056564025580883, "clip_ratio/high_mean": 0.10056564025580883, "clip_ratio/low_mean": 0.07851519016548991, "clip_ratio/low_min": 0.07851519016548991, "clip_ratio/region_mean": 0.17908083042129874, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 47.0, "completions/mean_terminated_length": 47.0, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 1.6416602730751038, "epoch": 0.00034754402224281743, "frac_reward_zero_std": 0.0, "grad_norm": 16.50942039489746, "learning_rate": 9.975757575757577e-06, "loss": 0.0706, "num_tokens": 17535.0, "reward": 0.6138224601745605, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6138224601745605, "reward_meter_std": 0.3940174877643585, "reward_std": 0.3940175175666809, "reward_total_composite_mean": 0.6138224601745605, "reward_total_composite_std": 0.3940174877643585, "reward_total_mean": 0.6138224601745605, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6138224601745605, "rewards/meter/std": 0.3940174877643585, "rewards/total_composite/mean": 0.6138224601745605, "rewards/total_composite/std": 0.3940174877643585, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0077967643737793, "sampling/importance_sampling_ratio/min": 0.12568823993206024, "sampling/sampling_logp_difference/max": 2.07395076751709, "sampling/sampling_logp_difference/mean": 0.20549029111862183, "step": 9 }, { "clip_ratio/high_max": 0.1666986495256424, "clip_ratio/high_mean": 0.1666986495256424, "clip_ratio/low_mean": 0.05835868790745735, "clip_ratio/low_min": 0.05835868790745735, "clip_ratio/region_mean": 0.22505733743309975, "completions/clipped_ratio": 0.0, "completions/max_length": 102.0, "completions/max_terminated_length": 102.0, "completions/mean_length": 56.5, "completions/mean_terminated_length": 56.5, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 2.4850480556488037, "epoch": 0.0003861600247142416, "frac_reward_zero_std": 0.0, "grad_norm": 18.21146583557129, "learning_rate": 9.972727272727274e-06, "loss": 0.2066, "num_tokens": 19339.0, "reward": 0.7867398858070374, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8475043773651123, "reward_meter_std": 0.340963751077652, "reward_std": 0.35842904448509216, "reward_total_composite_mean": 0.7867398858070374, "reward_total_composite_std": 0.35842904448509216, "reward_total_mean": 0.7867398858070374, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8475043773651123, "rewards/meter/std": 0.340963751077652, "rewards/total_composite/mean": 0.7867398858070374, "rewards/total_composite/std": 0.35842904448509216, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.043230414390564, "sampling/importance_sampling_ratio/min": 0.30306050181388855, "sampling/sampling_logp_difference/max": 1.291860580444336, "sampling/sampling_logp_difference/mean": 0.22162646055221558, "step": 10 }, { "clip_ratio/high_max": 0.12178206816315651, "clip_ratio/high_mean": 0.12178206816315651, "clip_ratio/low_mean": 0.09850872680544853, "clip_ratio/low_min": 0.09850872680544853, "clip_ratio/region_mean": 0.22029079496860504, "completions/clipped_ratio": 0.0, "completions/max_length": 58.0, "completions/max_terminated_length": 58.0, "completions/mean_length": 44.125, "completions/mean_terminated_length": 44.125, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 1.80090893805027, "epoch": 0.00042477602718566575, "frac_reward_zero_std": 0.0, "grad_norm": 18.612279891967773, "learning_rate": 9.96969696969697e-06, "loss": -0.0602, "num_tokens": 21060.0, "reward": 0.3987988829612732, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3987988829612732, "reward_meter_std": 0.39860498905181885, "reward_std": 0.39860498905181885, "reward_total_composite_mean": 0.3987988829612732, "reward_total_composite_std": 0.39860498905181885, "reward_total_mean": 0.3987988829612732, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3987988829612732, "rewards/meter/std": 0.39860498905181885, "rewards/total_composite/mean": 0.3987988829612732, "rewards/total_composite/std": 0.39860498905181885, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0170056819915771, "sampling/importance_sampling_ratio/min": 0.15322603285312653, "sampling/sampling_logp_difference/max": 1.8758411407470703, "sampling/sampling_logp_difference/mean": 0.2347755879163742, "step": 11 }, { "clip_ratio/high_max": 0.05123806092888117, "clip_ratio/high_mean": 0.05123806092888117, "clip_ratio/low_mean": 0.12340508960187435, "clip_ratio/low_min": 0.12340508960187435, "clip_ratio/region_mean": 0.17464315053075552, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 66.125, "completions/mean_terminated_length": 66.125, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.9041207674890757, "epoch": 0.0004633920296570899, "frac_reward_zero_std": 0.0, "grad_norm": 18.964420318603516, "learning_rate": 9.966666666666667e-06, "loss": 0.0342, "num_tokens": 23077.0, "reward": 0.5058028697967529, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5058028697967529, "reward_meter_std": 0.40144890546798706, "reward_std": 0.40144890546798706, "reward_total_composite_mean": 0.5058028697967529, "reward_total_composite_std": 0.40144890546798706, "reward_total_mean": 0.5058028697967529, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5058028697967529, "rewards/meter/std": 0.40144890546798706, "rewards/total_composite/mean": 0.5058028697967529, "rewards/total_composite/std": 0.40144890546798706, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9842817783355713, "sampling/importance_sampling_ratio/min": 0.056828152388334274, "sampling/sampling_logp_difference/max": 2.8677234649658203, "sampling/sampling_logp_difference/mean": 0.21280689537525177, "step": 12 }, { "clip_ratio/high_max": 0.1320821400731802, "clip_ratio/high_mean": 0.1320821400731802, "clip_ratio/low_mean": 0.08375322818756104, "clip_ratio/low_min": 0.08375322818756104, "clip_ratio/region_mean": 0.21583536826074123, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 57.875, "completions/mean_terminated_length": 57.875, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 2.2102586179971695, "epoch": 0.000502008032128514, "frac_reward_zero_std": 0.0, "grad_norm": 15.997991561889648, "learning_rate": 9.963636363636364e-06, "loss": 0.2512, "num_tokens": 24884.0, "reward": 0.45139390230178833, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45139390230178833, "reward_meter_std": 0.43168777227401733, "reward_std": 0.4316878020763397, "reward_total_composite_mean": 0.45139390230178833, "reward_total_composite_std": 0.43168777227401733, "reward_total_mean": 0.45139390230178833, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45139390230178833, "rewards/meter/std": 0.43168777227401733, "rewards/total_composite/mean": 0.45139390230178833, "rewards/total_composite/std": 0.43168777227401733, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0242526531219482, "sampling/importance_sampling_ratio/min": 0.25717854499816895, "sampling/sampling_logp_difference/max": 1.3626043796539307, "sampling/sampling_logp_difference/mean": 0.2293073683977127, "step": 13 }, { "clip_ratio/high_max": 0.10542293824255466, "clip_ratio/high_mean": 0.10542293824255466, "clip_ratio/low_mean": 0.09186305850744247, "clip_ratio/low_min": 0.09186305850744247, "clip_ratio/region_mean": 0.19728599674999714, "completions/clipped_ratio": 0.0, "completions/max_length": 124.0, "completions/max_terminated_length": 124.0, "completions/mean_length": 107.375, "completions/mean_terminated_length": 107.375, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 1.8395927399396896, "epoch": 0.0005406240345999382, "frac_reward_zero_std": 0.0, "grad_norm": 12.638867378234863, "learning_rate": 9.960606060606062e-06, "loss": -0.029, "num_tokens": 27287.0, "reward": 0.5478648543357849, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5478648543357849, "reward_meter_std": 0.35016050934791565, "reward_std": 0.35016050934791565, "reward_total_composite_mean": 0.5478648543357849, "reward_total_composite_std": 0.35016050934791565, "reward_total_mean": 0.5478648543357849, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5478648543357849, "rewards/meter/std": 0.35016050934791565, "rewards/total_composite/mean": 0.5478648543357849, "rewards/total_composite/std": 0.35016050934791565, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.019142508506775, "sampling/importance_sampling_ratio/min": 0.15102817118167877, "sampling/sampling_logp_difference/max": 1.8902888298034668, "sampling/sampling_logp_difference/mean": 0.2364599108695984, "step": 14 }, { "clip_ratio/high_max": 0.1045012567192316, "clip_ratio/high_mean": 0.1045012567192316, "clip_ratio/low_mean": 0.08156565949320793, "clip_ratio/low_min": 0.08156565949320793, "clip_ratio/region_mean": 0.18606691621243954, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 25.125, "completions/mean_terminated_length": 25.125, "completions/min_length": 16.0, "completions/min_terminated_length": 16.0, "entropy": 1.8547815531492233, "epoch": 0.0005792400370713623, "frac_reward_zero_std": 0.0, "grad_norm": 23.416534423828125, "learning_rate": 9.957575757575757e-06, "loss": 0.0038, "num_tokens": 28664.0, "reward": 0.4547968804836273, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4547968804836273, "reward_meter_std": 0.4638686776161194, "reward_std": 0.463868647813797, "reward_total_composite_mean": 0.4547968804836273, "reward_total_composite_std": 0.4638686776161194, "reward_total_mean": 0.4547968804836273, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4547968804836273, "rewards/meter/std": 0.4638686776161194, "rewards/total_composite/mean": 0.4547968804836273, "rewards/total_composite/std": 0.4638686776161194, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0308705568313599, "sampling/importance_sampling_ratio/min": 0.34662288427352905, "sampling/sampling_logp_difference/max": 1.0595178604125977, "sampling/sampling_logp_difference/mean": 0.17740340530872345, "step": 15 }, { "clip_ratio/high_max": 0.17772199772298336, "clip_ratio/high_mean": 0.17772199772298336, "clip_ratio/low_mean": 0.02777777798473835, "clip_ratio/low_min": 0.02777777798473835, "clip_ratio/region_mean": 0.2054997757077217, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 42.125, "completions/mean_terminated_length": 42.125, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 1.8997105956077576, "epoch": 0.0006178560395427865, "frac_reward_zero_std": 0.0, "grad_norm": 17.291547775268555, "learning_rate": 9.954545454545456e-06, "loss": 0.1985, "num_tokens": 30313.0, "reward": 0.8227195143699646, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8227195143699646, "reward_meter_std": 0.30595460534095764, "reward_std": 0.30595454573631287, "reward_total_composite_mean": 0.8227195143699646, "reward_total_composite_std": 0.30595460534095764, "reward_total_mean": 0.8227195143699646, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8227195143699646, "rewards/meter/std": 0.30595460534095764, "rewards/total_composite/mean": 0.8227195143699646, "rewards/total_composite/std": 0.30595460534095764, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0267019271850586, "sampling/importance_sampling_ratio/min": 0.2083941400051117, "sampling/sampling_logp_difference/max": 1.568324089050293, "sampling/sampling_logp_difference/mean": 0.2161049097776413, "step": 16 }, { "clip_ratio/high_max": 0.02809617994353175, "clip_ratio/high_mean": 0.02809617994353175, "clip_ratio/low_mean": 0.05947580561041832, "clip_ratio/low_min": 0.05947580561041832, "clip_ratio/region_mean": 0.08757198555395007, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 44.375, "completions/mean_terminated_length": 44.375, "completions/min_length": 24.0, "completions/min_terminated_length": 24.0, "entropy": 0.43756548687815666, "epoch": 0.0006564720420142106, "frac_reward_zero_std": 0.0, "grad_norm": 14.35202693939209, "learning_rate": 9.951515151515152e-06, "loss": -0.0398, "num_tokens": 31900.0, "reward": 0.8780908584594727, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8780908584594727, "reward_meter_std": 0.1825910061597824, "reward_std": 0.1825910061597824, "reward_total_composite_mean": 0.8780908584594727, "reward_total_composite_std": 0.1825910061597824, "reward_total_mean": 0.8780908584594727, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8780908584594727, "rewards/meter/std": 0.1825910061597824, "rewards/total_composite/mean": 0.8780908584594727, "rewards/total_composite/std": 0.1825910061597824, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9951265454292297, "sampling/importance_sampling_ratio/min": 0.12622620165348053, "sampling/sampling_logp_difference/max": 2.0696797370910645, "sampling/sampling_logp_difference/mean": 0.09773284941911697, "step": 17 }, { "clip_ratio/high_max": 0.07820177916437387, "clip_ratio/high_mean": 0.07820177916437387, "clip_ratio/low_mean": 0.14138433896005154, "clip_ratio/low_min": 0.14138433896005154, "clip_ratio/region_mean": 0.2195861181244254, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 46.75, "completions/mean_terminated_length": 46.75, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 2.013083055615425, "epoch": 0.0006950880444856349, "frac_reward_zero_std": 0.0, "grad_norm": 17.070714950561523, "learning_rate": 9.948484848484849e-06, "loss": 0.2567, "num_tokens": 33490.0, "reward": 0.45992743968963623, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45992743968963623, "reward_meter_std": 0.3919222354888916, "reward_std": 0.3919222354888916, "reward_total_composite_mean": 0.45992743968963623, "reward_total_composite_std": 0.3919222354888916, "reward_total_mean": 0.45992743968963623, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45992743968963623, "rewards/meter/std": 0.3919222354888916, "rewards/total_composite/mean": 0.45992743968963623, "rewards/total_composite/std": 0.3919222354888916, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0427944660186768, "sampling/importance_sampling_ratio/min": 0.23565533757209778, "sampling/sampling_logp_difference/max": 1.4453849792480469, "sampling/sampling_logp_difference/mean": 0.21356253325939178, "step": 18 }, { "clip_ratio/high_max": 0.05499837175011635, "clip_ratio/high_mean": 0.05499837175011635, "clip_ratio/low_mean": 0.1405880395323038, "clip_ratio/low_min": 0.1405880395323038, "clip_ratio/region_mean": 0.19558641128242016, "completions/clipped_ratio": 0.0, "completions/max_length": 151.0, "completions/max_terminated_length": 151.0, "completions/mean_length": 118.25, "completions/mean_terminated_length": 118.25, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 2.113861307501793, "epoch": 0.000733704046957059, "frac_reward_zero_std": 0.0, "grad_norm": 8.703368186950684, "learning_rate": 9.945454545454546e-06, "loss": 0.045, "num_tokens": 35844.0, "reward": 0.22483205795288086, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2513314485549927, "reward_meter_std": 0.1909521371126175, "reward_std": 0.2108626812696457, "reward_total_composite_mean": 0.22483205795288086, "reward_total_composite_std": 0.2108626663684845, "reward_total_mean": 0.22483205795288086, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2513314485549927, "rewards/meter/std": 0.1909521371126175, "rewards/total_composite/mean": 0.22483205795288086, "rewards/total_composite/std": 0.2108626663684845, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0284098386764526, "sampling/importance_sampling_ratio/min": 0.1471317857503891, "sampling/sampling_logp_difference/max": 1.916426658630371, "sampling/sampling_logp_difference/mean": 0.20431792736053467, "step": 19 }, { "clip_ratio/high_max": 0.11636904999613762, "clip_ratio/high_mean": 0.11636904999613762, "clip_ratio/low_mean": 0.09608769603073597, "clip_ratio/low_min": 0.09608769603073597, "clip_ratio/region_mean": 0.2124567460268736, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 59.375, "completions/mean_terminated_length": 59.375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 2.4152235835790634, "epoch": 0.0007723200494284832, "frac_reward_zero_std": 0.0, "grad_norm": 14.549918174743652, "learning_rate": 9.942424242424244e-06, "loss": 0.0584, "num_tokens": 37711.0, "reward": 0.5284043550491333, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.5680004358291626, "reward_meter_std": 0.3963819742202759, "reward_std": 0.44208046793937683, "reward_total_composite_mean": 0.5284043550491333, "reward_total_composite_std": 0.44208046793937683, "reward_total_mean": 0.5284043550491333, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.5680004358291626, "rewards/meter/std": 0.3963819742202759, "rewards/total_composite/mean": 0.5284043550491333, "rewards/total_composite/std": 0.44208046793937683, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0309125185012817, "sampling/importance_sampling_ratio/min": 0.14759160578250885, "sampling/sampling_logp_difference/max": 1.9133062362670898, "sampling/sampling_logp_difference/mean": 0.24648143351078033, "step": 20 }, { "clip_ratio/high_max": 0.07960096746683121, "clip_ratio/high_mean": 0.07960096746683121, "clip_ratio/low_mean": 0.10977440886199474, "clip_ratio/low_min": 0.10977440886199474, "clip_ratio/region_mean": 0.18937537632882595, "completions/clipped_ratio": 0.0, "completions/max_length": 195.0, "completions/max_terminated_length": 195.0, "completions/mean_length": 171.625, "completions/mean_terminated_length": 171.625, "completions/min_length": 126.0, "completions/min_terminated_length": 126.0, "entropy": 2.130246579647064, "epoch": 0.0008109360518999073, "frac_reward_zero_std": 0.0, "grad_norm": 6.904236316680908, "learning_rate": 9.939393939393939e-06, "loss": 0.0205, "num_tokens": 40580.0, "reward": 0.22051820158958435, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.29830992221832275, "reward_meter_std": 0.28082314133644104, "reward_std": 0.3221690356731415, "reward_total_composite_mean": 0.22051820158958435, "reward_total_composite_std": 0.3221690356731415, "reward_total_mean": 0.22051820158958435, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.29830992221832275, "rewards/meter/std": 0.28082314133644104, "rewards/total_composite/mean": 0.22051820158958435, "rewards/total_composite/std": 0.3221690356731415, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0334407091140747, "sampling/importance_sampling_ratio/min": 0.24302920699119568, "sampling/sampling_logp_difference/max": 1.4145736694335938, "sampling/sampling_logp_difference/mean": 0.18756546080112457, "step": 21 }, { "clip_ratio/high_max": 0.07555159274488688, "clip_ratio/high_mean": 0.07555159274488688, "clip_ratio/low_mean": 0.12670023273676634, "clip_ratio/low_min": 0.12670023273676634, "clip_ratio/region_mean": 0.2022518254816532, "completions/clipped_ratio": 0.0, "completions/max_length": 61.0, "completions/max_terminated_length": 61.0, "completions/mean_length": 46.5, "completions/mean_terminated_length": 46.5, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 1.631166860461235, "epoch": 0.0008495520543713315, "frac_reward_zero_std": 0.0, "grad_norm": 15.95211124420166, "learning_rate": 9.936363636363638e-06, "loss": -0.151, "num_tokens": 42240.0, "reward": 0.48668479919433594, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.48668479919433594, "reward_meter_std": 0.44610869884490967, "reward_std": 0.4461086690425873, "reward_total_composite_mean": 0.48668479919433594, "reward_total_composite_std": 0.44610869884490967, "reward_total_mean": 0.48668479919433594, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.48668479919433594, "rewards/meter/std": 0.44610869884490967, "rewards/total_composite/mean": 0.48668479919433594, "rewards/total_composite/std": 0.44610869884490967, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.032152533531189, "sampling/importance_sampling_ratio/min": 0.13872095942497253, "sampling/sampling_logp_difference/max": 1.9752907752990723, "sampling/sampling_logp_difference/mean": 0.19472216069698334, "step": 22 }, { "clip_ratio/high_max": 0.12303969636559486, "clip_ratio/high_mean": 0.12303969636559486, "clip_ratio/low_mean": 0.09274027217179537, "clip_ratio/low_min": 0.09274027217179537, "clip_ratio/region_mean": 0.21577996853739023, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 59.875, "completions/mean_terminated_length": 59.875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 2.0983588993549347, "epoch": 0.0008881680568427556, "frac_reward_zero_std": 0.0, "grad_norm": 12.759511947631836, "learning_rate": 9.933333333333334e-06, "loss": 0.0144, "num_tokens": 44023.0, "reward": 0.5005471706390381, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5005471706390381, "reward_meter_std": 0.4535389840602875, "reward_std": 0.4535389840602875, "reward_total_composite_mean": 0.5005471706390381, "reward_total_composite_std": 0.4535389840602875, "reward_total_mean": 0.5005471706390381, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5005471706390381, "rewards/meter/std": 0.4535389840602875, "rewards/total_composite/mean": 0.5005471706390381, "rewards/total_composite/std": 0.4535389840602875, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0337328910827637, "sampling/importance_sampling_ratio/min": 0.2599697709083557, "sampling/sampling_logp_difference/max": 1.3471899032592773, "sampling/sampling_logp_difference/mean": 0.20020200312137604, "step": 23 }, { "clip_ratio/high_max": 0.11741364374756813, "clip_ratio/high_mean": 0.11741364374756813, "clip_ratio/low_mean": 0.09042087476700544, "clip_ratio/low_min": 0.09042087476700544, "clip_ratio/region_mean": 0.20783451851457357, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 50.625, "completions/mean_terminated_length": 50.625, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 2.2059893161058426, "epoch": 0.0009267840593141798, "frac_reward_zero_std": 0.0, "grad_norm": 18.0654354095459, "learning_rate": 9.930303030303031e-06, "loss": 0.0997, "num_tokens": 45780.0, "reward": 0.4580531120300293, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.6220148801803589, "reward_meter_std": 0.4630615711212158, "reward_std": 0.46495571732521057, "reward_total_composite_mean": 0.4580531120300293, "reward_total_composite_std": 0.46495571732521057, "reward_total_mean": 0.4580531120300293, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.6220148801803589, "rewards/meter/std": 0.4630615711212158, "rewards/total_composite/mean": 0.4580531120300293, "rewards/total_composite/std": 0.46495571732521057, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0300155878067017, "sampling/importance_sampling_ratio/min": 0.22524529695510864, "sampling/sampling_logp_difference/max": 1.490565299987793, "sampling/sampling_logp_difference/mean": 0.2604425549507141, "step": 24 }, { "clip_ratio/high_max": 0.08282828330993652, "clip_ratio/high_mean": 0.08282828330993652, "clip_ratio/low_mean": 0.09993548225611448, "clip_ratio/low_min": 0.09993548225611448, "clip_ratio/region_mean": 0.182763765566051, "completions/clipped_ratio": 0.0, "completions/max_length": 55.0, "completions/max_terminated_length": 55.0, "completions/mean_length": 44.375, "completions/mean_terminated_length": 44.375, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 1.3184484615921974, "epoch": 0.0009654000617856039, "frac_reward_zero_std": 0.0, "grad_norm": 15.530243873596191, "learning_rate": 9.927272727272728e-06, "loss": 0.0988, "num_tokens": 47479.0, "reward": 0.3527180254459381, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3527180254459381, "reward_meter_std": 0.4116312861442566, "reward_std": 0.4116312563419342, "reward_total_composite_mean": 0.3527180254459381, "reward_total_composite_std": 0.4116312861442566, "reward_total_mean": 0.3527180254459381, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3527180254459381, "rewards/meter/std": 0.4116312861442566, "rewards/total_composite/mean": 0.3527180254459381, "rewards/total_composite/std": 0.4116312861442566, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.016542911529541, "sampling/importance_sampling_ratio/min": 0.20795388519763947, "sampling/sampling_logp_difference/max": 1.5704388618469238, "sampling/sampling_logp_difference/mean": 0.17016799747943878, "step": 25 }, { "clip_ratio/high_max": 0.17995928972959518, "clip_ratio/high_mean": 0.17995928972959518, "clip_ratio/low_mean": 0.02651515230536461, "clip_ratio/low_min": 0.02651515230536461, "clip_ratio/region_mean": 0.2064744420349598, "completions/clipped_ratio": 0.0, "completions/max_length": 56.0, "completions/max_terminated_length": 56.0, "completions/mean_length": 44.5, "completions/mean_terminated_length": 44.5, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 1.9691928625106812, "epoch": 0.001004016064257028, "frac_reward_zero_std": 0.0, "grad_norm": 21.890466690063477, "learning_rate": 9.924242424242425e-06, "loss": -0.082, "num_tokens": 49115.0, "reward": 0.8331155776977539, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8464770913124084, "reward_meter_std": 0.3041004538536072, "reward_std": 0.3413103222846985, "reward_total_composite_mean": 0.8331155776977539, "reward_total_composite_std": 0.3413103222846985, "reward_total_mean": 0.8331155776977539, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8464770913124084, "rewards/meter/std": 0.3041004538536072, "rewards/total_composite/mean": 0.8331155776977539, "rewards/total_composite/std": 0.3413103222846985, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0382486581802368, "sampling/importance_sampling_ratio/min": 0.14871208369731903, "sampling/sampling_logp_difference/max": 1.90574312210083, "sampling/sampling_logp_difference/mean": 0.25624310970306396, "step": 26 }, { "clip_ratio/high_max": 0.15723814070224762, "clip_ratio/high_mean": 0.15723814070224762, "clip_ratio/low_mean": 0.04641487076878548, "clip_ratio/low_min": 0.04641487076878548, "clip_ratio/region_mean": 0.2036530114710331, "completions/clipped_ratio": 0.0, "completions/max_length": 176.0, "completions/max_terminated_length": 176.0, "completions/mean_length": 159.875, "completions/mean_terminated_length": 159.875, "completions/min_length": 145.0, "completions/min_terminated_length": 145.0, "entropy": 1.940888598561287, "epoch": 0.0010426320667284523, "frac_reward_zero_std": 0.0, "grad_norm": 8.763998031616211, "learning_rate": 9.921212121212121e-06, "loss": 0.0432, "num_tokens": 51914.0, "reward": 0.44596123695373535, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.44596123695373535, "reward_meter_std": 0.3097141981124878, "reward_std": 0.3097141981124878, "reward_total_composite_mean": 0.44596123695373535, "reward_total_composite_std": 0.3097141981124878, "reward_total_mean": 0.44596123695373535, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.44596123695373535, "rewards/meter/std": 0.3097141981124878, "rewards/total_composite/mean": 0.44596123695373535, "rewards/total_composite/std": 0.3097141981124878, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0340567827224731, "sampling/importance_sampling_ratio/min": 0.16828162968158722, "sampling/sampling_logp_difference/max": 1.782116413116455, "sampling/sampling_logp_difference/mean": 0.19997085630893707, "step": 27 }, { "clip_ratio/high_max": 0.08741745911538601, "clip_ratio/high_mean": 0.08741745911538601, "clip_ratio/low_mean": 0.10222199466079473, "clip_ratio/low_min": 0.10222199466079473, "clip_ratio/region_mean": 0.18963945377618074, "completions/clipped_ratio": 0.0, "completions/max_length": 223.0, "completions/max_terminated_length": 223.0, "completions/mean_length": 122.125, "completions/mean_terminated_length": 122.125, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "entropy": 1.0821578055620193, "epoch": 0.0010812480691998764, "frac_reward_zero_std": 0.0, "grad_norm": 16.314180374145508, "learning_rate": 9.918181818181818e-06, "loss": -0.0001, "num_tokens": 54507.0, "reward": 0.06344515830278397, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0578637570142746, "reward_meter_mean": 0.4260466396808624, "reward_meter_std": 0.2623087763786316, "reward_std": 0.09849678725004196, "reward_total_composite_mean": 0.06344515830278397, "reward_total_composite_std": 0.09849678725004196, "reward_total_mean": 0.06344515830278397, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0578637570142746, "rewards/meter/mean": 0.4260466396808624, "rewards/meter/std": 0.2623087763786316, "rewards/total_composite/mean": 0.06344515830278397, "rewards/total_composite/std": 0.09849678725004196, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9840916395187378, "sampling/importance_sampling_ratio/min": 0.03912108764052391, "sampling/sampling_logp_difference/max": 3.241093635559082, "sampling/sampling_logp_difference/mean": 0.2858719229698181, "step": 28 }, { "clip_ratio/high_max": 0.17736977525055408, "clip_ratio/high_mean": 0.17736977525055408, "clip_ratio/low_mean": 0.05003259517252445, "clip_ratio/low_min": 0.05003259517252445, "clip_ratio/region_mean": 0.22740237042307854, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 44.75, "completions/mean_terminated_length": 44.75, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 1.6001797169446945, "epoch": 0.0011198640716713006, "frac_reward_zero_std": 0.0, "grad_norm": 18.285869598388672, "learning_rate": 9.915151515151515e-06, "loss": 0.0883, "num_tokens": 56313.0, "reward": 0.7853162884712219, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7853162884712219, "reward_meter_std": 0.29714658856391907, "reward_std": 0.29714658856391907, "reward_total_composite_mean": 0.7853162884712219, "reward_total_composite_std": 0.29714658856391907, "reward_total_mean": 0.7853162884712219, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7853162884712219, "rewards/meter/std": 0.29714658856391907, "rewards/total_composite/mean": 0.7853162884712219, "rewards/total_composite/std": 0.29714658856391907, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9876272082328796, "sampling/importance_sampling_ratio/min": 0.10404817014932632, "sampling/sampling_logp_difference/max": 2.2629013061523438, "sampling/sampling_logp_difference/mean": 0.20776626467704773, "step": 29 }, { "clip_ratio/high_max": 0.1195354238152504, "clip_ratio/high_mean": 0.1195354238152504, "clip_ratio/low_mean": 0.09173617325723171, "clip_ratio/low_min": 0.09173617325723171, "clip_ratio/region_mean": 0.2112715970724821, "completions/clipped_ratio": 0.0, "completions/max_length": 220.0, "completions/max_terminated_length": 220.0, "completions/mean_length": 169.625, "completions/mean_terminated_length": 169.625, "completions/min_length": 127.0, "completions/min_terminated_length": 127.0, "entropy": 2.6212728768587112, "epoch": 0.0011584800741427247, "frac_reward_zero_std": 0.0, "grad_norm": 8.281560897827148, "learning_rate": 9.912121212121213e-06, "loss": 0.0412, "num_tokens": 59278.0, "reward": 0.48327285051345825, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5359864234924316, "reward_meter_std": 0.21292957663536072, "reward_std": 0.2851979732513428, "reward_total_composite_mean": 0.48327285051345825, "reward_total_composite_std": 0.28519800305366516, "reward_total_mean": 0.48327285051345825, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5359864234924316, "rewards/meter/std": 0.21292957663536072, "rewards/total_composite/mean": 0.48327285051345825, "rewards/total_composite/std": 0.28519800305366516, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0370231866836548, "sampling/importance_sampling_ratio/min": 0.1704005002975464, "sampling/sampling_logp_difference/max": 1.7696037292480469, "sampling/sampling_logp_difference/mean": 0.227935329079628, "step": 30 }, { "clip_ratio/high_max": 0.16296951659023762, "clip_ratio/high_mean": 0.16296951659023762, "clip_ratio/low_mean": 0.06649214401841164, "clip_ratio/low_min": 0.06649214401841164, "clip_ratio/region_mean": 0.22946166060864925, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 67.875, "completions/mean_terminated_length": 67.875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 2.164387509226799, "epoch": 0.001197096076614149, "frac_reward_zero_std": 0.0, "grad_norm": 14.505411148071289, "learning_rate": 9.90909090909091e-06, "loss": 0.0224, "num_tokens": 61117.0, "reward": 0.6783833503723145, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6783833503723145, "reward_meter_std": 0.4296880066394806, "reward_std": 0.4296879768371582, "reward_total_composite_mean": 0.6783833503723145, "reward_total_composite_std": 0.4296880066394806, "reward_total_mean": 0.6783833503723145, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6783833503723145, "rewards/meter/std": 0.4296880066394806, "rewards/total_composite/mean": 0.6783833503723145, "rewards/total_composite/std": 0.4296880066394806, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0112130641937256, "sampling/importance_sampling_ratio/min": 0.2134408801794052, "sampling/sampling_logp_difference/max": 1.5443954467773438, "sampling/sampling_logp_difference/mean": 0.24672164022922516, "step": 31 }, { "clip_ratio/high_max": 0.02909391513094306, "clip_ratio/high_mean": 0.02909391513094306, "clip_ratio/low_mean": 0.03902714978903532, "clip_ratio/low_min": 0.03902714978903532, "clip_ratio/region_mean": 0.06812106491997838, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 27.625, "completions/mean_terminated_length": 27.625, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 0.44207035191357136, "epoch": 0.001235712079085573, "frac_reward_zero_std": 0.0, "grad_norm": 22.633512496948242, "learning_rate": 9.906060606060607e-06, "loss": 0.0377, "num_tokens": 62698.0, "reward": 0.9473069310188293, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9473069310188293, "reward_meter_std": 0.03623950853943825, "reward_std": 0.03623950108885765, "reward_total_composite_mean": 0.9473069310188293, "reward_total_composite_std": 0.03623950853943825, "reward_total_mean": 0.9473069310188293, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9473069310188293, "rewards/meter/std": 0.03623950853943825, "rewards/total_composite/mean": 0.9473069310188293, "rewards/total_composite/std": 0.03623950853943825, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9921619892120361, "sampling/importance_sampling_ratio/min": 0.0969339981675148, "sampling/sampling_logp_difference/max": 2.3337249755859375, "sampling/sampling_logp_difference/mean": 0.09311103075742722, "step": 32 }, { "clip_ratio/high_max": 0.08508810587227345, "clip_ratio/high_mean": 0.08508810587227345, "clip_ratio/low_mean": 0.14664593152701855, "clip_ratio/low_min": 0.14664593152701855, "clip_ratio/region_mean": 0.231734037399292, "completions/clipped_ratio": 0.0, "completions/max_length": 274.0, "completions/max_terminated_length": 274.0, "completions/mean_length": 181.125, "completions/mean_terminated_length": 181.125, "completions/min_length": 134.0, "completions/min_terminated_length": 134.0, "entropy": 2.361170306801796, "epoch": 0.0012743280815569972, "frac_reward_zero_std": 0.0, "grad_norm": 9.995526313781738, "learning_rate": 9.903030303030305e-06, "loss": -0.1309, "num_tokens": 65811.0, "reward": 0.19121383130550385, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.05750546231865883, "reward_meter_mean": 0.2281605750322342, "reward_meter_std": 0.13796716928482056, "reward_std": 0.15800805389881134, "reward_total_composite_mean": 0.19121383130550385, "reward_total_composite_std": 0.15800805389881134, "reward_total_mean": 0.19121383130550385, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.05750546231865883, "rewards/meter/mean": 0.2281605750322342, "rewards/meter/std": 0.13796716928482056, "rewards/total_composite/mean": 0.19121383130550385, "rewards/total_composite/std": 0.15800805389881134, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0408287048339844, "sampling/importance_sampling_ratio/min": 0.10168811678886414, "sampling/sampling_logp_difference/max": 2.2858448028564453, "sampling/sampling_logp_difference/mean": 0.26636290550231934, "step": 33 }, { "clip_ratio/high_max": 0.03525641094893217, "clip_ratio/high_mean": 0.03525641094893217, "clip_ratio/low_mean": 0.09407370304688811, "clip_ratio/low_min": 0.09407370304688811, "clip_ratio/region_mean": 0.12933011399582028, "completions/clipped_ratio": 0.0, "completions/max_length": 31.0, "completions/max_terminated_length": 31.0, "completions/mean_length": 26.375, "completions/mean_terminated_length": 26.375, "completions/min_length": 23.0, "completions/min_terminated_length": 23.0, "entropy": 0.5113434419035912, "epoch": 0.0013129440840284213, "frac_reward_zero_std": 0.0, "grad_norm": 21.821182250976562, "learning_rate": 9.9e-06, "loss": 0.0783, "num_tokens": 67182.0, "reward": 0.1796203851699829, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.1796203851699829, "reward_meter_std": 0.330172061920166, "reward_std": 0.330172061920166, "reward_total_composite_mean": 0.1796203851699829, "reward_total_composite_std": 0.330172061920166, "reward_total_mean": 0.1796203851699829, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.1796203851699829, "rewards/meter/std": 0.330172061920166, "rewards/total_composite/mean": 0.1796203851699829, "rewards/total_composite/std": 0.330172061920166, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0188137292861938, "sampling/importance_sampling_ratio/min": 0.12298180162906647, "sampling/sampling_logp_difference/max": 2.0957188606262207, "sampling/sampling_logp_difference/mean": 0.18016308546066284, "step": 34 }, { "clip_ratio/high_max": 0.07765224599279463, "clip_ratio/high_mean": 0.07765224599279463, "clip_ratio/low_mean": 0.05922202859073877, "clip_ratio/low_min": 0.05922202859073877, "clip_ratio/region_mean": 0.1368742745835334, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 45.875, "completions/mean_terminated_length": 45.875, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 1.3972373455762863, "epoch": 0.0013515600864998456, "frac_reward_zero_std": 0.0, "grad_norm": 14.014320373535156, "learning_rate": 9.896969696969699e-06, "loss": -0.0922, "num_tokens": 68837.0, "reward": 0.5994056463241577, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5994056463241577, "reward_meter_std": 0.40437188744544983, "reward_std": 0.40437188744544983, "reward_total_composite_mean": 0.5994056463241577, "reward_total_composite_std": 0.40437188744544983, "reward_total_mean": 0.5994056463241577, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5994056463241577, "rewards/meter/std": 0.40437188744544983, "rewards/total_composite/mean": 0.5994056463241577, "rewards/total_composite/std": 0.40437188744544983, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0345124006271362, "sampling/importance_sampling_ratio/min": 0.31121668219566345, "sampling/sampling_logp_difference/max": 1.3427734375, "sampling/sampling_logp_difference/mean": 0.1685187667608261, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.02442893385887146, "clip_ratio/low_min": 0.02442893385887146, "clip_ratio/region_mean": 0.02442893385887146, "completions/clipped_ratio": 0.875, "completions/max_length": 512.0, "completions/max_terminated_length": 394.0, "completions/mean_length": 497.25, "completions/mean_terminated_length": 394.0, "completions/min_length": 394.0, "completions/min_terminated_length": 394.0, "entropy": 0.48652103543281555, "epoch": 0.0013901760889712697, "frac_reward_zero_std": 0.0, "grad_norm": 3.0867953300476074, "learning_rate": 9.893939393939395e-06, "loss": 0.2225, "num_tokens": 70919.0, "reward": 0.6741494536399841, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9264706373214722, "reward_count_adherence_std": 0.08753220736980438, "reward_meter_mean": 0.86127769947052, "reward_meter_std": 0.20221967995166779, "reward_std": 0.3219583332538605, "reward_total_composite_mean": 0.6741494536399841, "reward_total_composite_std": 0.3219583332538605, "reward_total_mean": 0.6741494536399841, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9264706373214722, "rewards/count_adherence/std": 0.08753220736980438, "rewards/meter/mean": 0.86127769947052, "rewards/meter/std": 0.20221967995166779, "rewards/total_composite/mean": 0.6741494536399841, "rewards/total_composite/std": 0.3219583332538605, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0490732192993164, "sampling/importance_sampling_ratio/min": 0.2985435426235199, "sampling/sampling_logp_difference/max": 1.2088394165039062, "sampling/sampling_logp_difference/mean": 0.2478996217250824, "step": 36 }, { "clip_ratio/high_max": 0.1309125702828169, "clip_ratio/high_mean": 0.1309125702828169, "clip_ratio/low_mean": 0.09653645940124989, "clip_ratio/low_min": 0.09653645940124989, "clip_ratio/region_mean": 0.22744902968406677, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 66.75, "completions/mean_terminated_length": 66.75, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 2.081456035375595, "epoch": 0.0014287920914426938, "frac_reward_zero_std": 0.0, "grad_norm": 15.039297103881836, "learning_rate": 9.890909090909092e-06, "loss": 0.0523, "num_tokens": 72813.0, "reward": 0.5642927289009094, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_meter_mean": 0.6241669654846191, "reward_meter_std": 0.3833092451095581, "reward_std": 0.3661707043647766, "reward_total_composite_mean": 0.5642927289009094, "reward_total_composite_std": 0.3661707043647766, "reward_total_mean": 0.5642927289009094, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/meter/mean": 0.6241669654846191, "rewards/meter/std": 0.3833092451095581, "rewards/total_composite/mean": 0.5642927289009094, "rewards/total_composite/std": 0.3661707043647766, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.026777744293213, "sampling/importance_sampling_ratio/min": 0.2108944207429886, "sampling/sampling_logp_difference/max": 1.5563976764678955, "sampling/sampling_logp_difference/mean": 0.2267686128616333, "step": 37 }, { "clip_ratio/high_max": 0.13196256244555116, "clip_ratio/high_mean": 0.13196256244555116, "clip_ratio/low_mean": 0.0223214291036129, "clip_ratio/low_min": 0.0223214291036129, "clip_ratio/region_mean": 0.15428399154916406, "completions/clipped_ratio": 0.0, "completions/max_length": 28.0, "completions/max_terminated_length": 28.0, "completions/mean_length": 26.25, "completions/mean_terminated_length": 26.25, "completions/min_length": 23.0, "completions/min_terminated_length": 23.0, "entropy": 1.365403652191162, "epoch": 0.001467408093914118, "frac_reward_zero_std": 0.0, "grad_norm": 17.81291389465332, "learning_rate": 9.887878787878789e-06, "loss": 0.0441, "num_tokens": 74327.0, "reward": 0.9193331003189087, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9193331003189087, "reward_meter_std": 0.18450921773910522, "reward_std": 0.18450923264026642, "reward_total_composite_mean": 0.9193331003189087, "reward_total_composite_std": 0.18450921773910522, "reward_total_mean": 0.9193331003189087, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9193331003189087, "rewards/meter/std": 0.18450921773910522, "rewards/total_composite/mean": 0.9193331003189087, "rewards/total_composite/std": 0.18450921773910522, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9957528710365295, "sampling/importance_sampling_ratio/min": 0.07545739412307739, "sampling/sampling_logp_difference/max": 2.5841870307922363, "sampling/sampling_logp_difference/mean": 0.18091736733913422, "step": 38 }, { "clip_ratio/high_max": 0.03838060609996319, "clip_ratio/high_mean": 0.03838060609996319, "clip_ratio/low_mean": 0.10097905434668064, "clip_ratio/low_min": 0.10097905434668064, "clip_ratio/region_mean": 0.13935966044664383, "completions/clipped_ratio": 0.0, "completions/max_length": 89.0, "completions/max_terminated_length": 89.0, "completions/mean_length": 82.875, "completions/mean_terminated_length": 82.875, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "entropy": 0.739346232265234, "epoch": 0.0015060240963855422, "frac_reward_zero_std": 0.0, "grad_norm": 11.80769157409668, "learning_rate": 9.884848484848486e-06, "loss": 0.0578, "num_tokens": 76302.0, "reward": 0.2587703466415405, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2643655240535736, "reward_meter_std": 0.3247142732143402, "reward_std": 0.3293907940387726, "reward_total_composite_mean": 0.2587703466415405, "reward_total_composite_std": 0.32939082384109497, "reward_total_mean": 0.2587703466415405, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2643655240535736, "rewards/meter/std": 0.3247142732143402, "rewards/total_composite/mean": 0.2587703466415405, "rewards/total_composite/std": 0.32939082384109497, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9873656630516052, "sampling/importance_sampling_ratio/min": 1.2175244592071977e-05, "sampling/sampling_logp_difference/max": 11.316105842590332, "sampling/sampling_logp_difference/mean": 0.20199847221374512, "step": 39 }, { "clip_ratio/high_max": 0.18653450906276703, "clip_ratio/high_mean": 0.18653450906276703, "clip_ratio/low_mean": 0.031887754797935486, "clip_ratio/low_min": 0.031887754797935486, "clip_ratio/region_mean": 0.21842226386070251, "completions/clipped_ratio": 0.0, "completions/max_length": 146.0, "completions/max_terminated_length": 146.0, "completions/mean_length": 107.5, "completions/mean_terminated_length": 107.5, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 2.759167045354843, "epoch": 0.0015446400988569664, "frac_reward_zero_std": 0.0, "grad_norm": 9.70837116241455, "learning_rate": 9.881818181818182e-06, "loss": -0.0041, "num_tokens": 78586.0, "reward": 0.8742237687110901, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8742237687110901, "reward_meter_std": 0.31200793385505676, "reward_std": 0.31200793385505676, "reward_total_composite_mean": 0.8742237687110901, "reward_total_composite_std": 0.31200793385505676, "reward_total_mean": 0.8742237687110901, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8742237687110901, "rewards/meter/std": 0.31200793385505676, "rewards/total_composite/mean": 0.8742237687110901, "rewards/total_composite/std": 0.31200793385505676, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.039535641670227, "sampling/importance_sampling_ratio/min": 0.1948380321264267, "sampling/sampling_logp_difference/max": 1.6355867385864258, "sampling/sampling_logp_difference/mean": 0.21297502517700195, "step": 40 }, { "clip_ratio/high_max": 0.09009376727044582, "clip_ratio/high_mean": 0.09009376727044582, "clip_ratio/low_mean": 0.08622571267187595, "clip_ratio/low_min": 0.08622571267187595, "clip_ratio/region_mean": 0.17631947994232178, "completions/clipped_ratio": 0.0, "completions/max_length": 433.0, "completions/max_terminated_length": 433.0, "completions/mean_length": 390.875, "completions/mean_terminated_length": 390.875, "completions/min_length": 322.0, "completions/min_terminated_length": 322.0, "entropy": 2.349475011229515, "epoch": 0.0015832561013283905, "frac_reward_zero_std": 0.0, "grad_norm": 5.116574287414551, "learning_rate": 9.87878787878788e-06, "loss": 0.0665, "num_tokens": 83433.0, "reward": 0.6314187049865723, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.07559289038181305, "reward_meter_mean": 0.7916162014007568, "reward_meter_std": 0.1887982189655304, "reward_std": 0.3165914714336395, "reward_total_composite_mean": 0.6314187049865723, "reward_total_composite_std": 0.3165915012359619, "reward_total_mean": 0.6314187049865723, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.07559289038181305, "rewards/meter/mean": 0.7916162014007568, "rewards/meter/std": 0.1887982189655304, "rewards/total_composite/mean": 0.6314187049865723, "rewards/total_composite/std": 0.3165915012359619, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0329089164733887, "sampling/importance_sampling_ratio/min": 0.1791851669549942, "sampling/sampling_logp_difference/max": 1.7193355560302734, "sampling/sampling_logp_difference/mean": 0.19484373927116394, "step": 41 }, { "clip_ratio/high_max": 0.09933997690677643, "clip_ratio/high_mean": 0.09933997690677643, "clip_ratio/low_mean": 0.12379511073231697, "clip_ratio/low_min": 0.12379511073231697, "clip_ratio/region_mean": 0.2231350876390934, "completions/clipped_ratio": 0.0, "completions/max_length": 100.0, "completions/max_terminated_length": 100.0, "completions/mean_length": 71.5, "completions/mean_terminated_length": 71.5, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 2.382046639919281, "epoch": 0.0016218721037998146, "frac_reward_zero_std": 0.0, "grad_norm": 13.098201751708984, "learning_rate": 9.875757575757576e-06, "loss": 0.1992, "num_tokens": 85365.0, "reward": 0.384579598903656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.384579598903656, "reward_meter_std": 0.38699981570243835, "reward_std": 0.38699978590011597, "reward_total_composite_mean": 0.384579598903656, "reward_total_composite_std": 0.38699981570243835, "reward_total_mean": 0.384579598903656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.384579598903656, "rewards/meter/std": 0.38699981570243835, "rewards/total_composite/mean": 0.384579598903656, "rewards/total_composite/std": 0.38699981570243835, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0288784503936768, "sampling/importance_sampling_ratio/min": 0.11336687952280045, "sampling/sampling_logp_difference/max": 2.177125930786133, "sampling/sampling_logp_difference/mean": 0.216371089220047, "step": 42 }, { "clip_ratio/high_max": 0.07029963098466396, "clip_ratio/high_mean": 0.07029963098466396, "clip_ratio/low_mean": 0.14910552836954594, "clip_ratio/low_min": 0.14910552836954594, "clip_ratio/region_mean": 0.2194051593542099, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 52.875, "completions/mean_terminated_length": 52.875, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 1.689612329006195, "epoch": 0.0016604881062712389, "frac_reward_zero_std": 0.0, "grad_norm": 19.66609764099121, "learning_rate": 9.872727272727274e-06, "loss": -0.0628, "num_tokens": 87028.0, "reward": 0.40058913826942444, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.40058913826942444, "reward_meter_std": 0.4409148097038269, "reward_std": 0.4409147799015045, "reward_total_composite_mean": 0.40058913826942444, "reward_total_composite_std": 0.4409148097038269, "reward_total_mean": 0.40058913826942444, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.40058913826942444, "rewards/meter/std": 0.4409148097038269, "rewards/total_composite/mean": 0.40058913826942444, "rewards/total_composite/std": 0.4409148097038269, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0391393899917603, "sampling/importance_sampling_ratio/min": 0.2228635996580124, "sampling/sampling_logp_difference/max": 1.5011954307556152, "sampling/sampling_logp_difference/mean": 0.22723107039928436, "step": 43 }, { "clip_ratio/high_max": 0.041567519307136536, "clip_ratio/high_mean": 0.041567519307136536, "clip_ratio/low_mean": 0.0339520201086998, "clip_ratio/low_min": 0.0339520201086998, "clip_ratio/region_mean": 0.07551953941583633, "completions/clipped_ratio": 0.0, "completions/max_length": 50.0, "completions/max_terminated_length": 50.0, "completions/mean_length": 45.375, "completions/mean_terminated_length": 45.375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.40569959953427315, "epoch": 0.001699104108742663, "frac_reward_zero_std": 0.0, "grad_norm": 20.52503204345703, "learning_rate": 9.869696969696971e-06, "loss": 0.0541, "num_tokens": 88767.0, "reward": 0.6814202070236206, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6814202070236206, "reward_meter_std": 0.4100963771343231, "reward_std": 0.4100963771343231, "reward_total_composite_mean": 0.6814202070236206, "reward_total_composite_std": 0.4100963771343231, "reward_total_mean": 0.6814202070236206, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6814202070236206, "rewards/meter/std": 0.4100963771343231, "rewards/total_composite/mean": 0.6814202070236206, "rewards/total_composite/std": 0.4100963771343231, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9983127117156982, "sampling/importance_sampling_ratio/min": 0.18328185379505157, "sampling/sampling_logp_difference/max": 1.696730136871338, "sampling/sampling_logp_difference/mean": 0.10806272178888321, "step": 44 }, { "clip_ratio/high_max": 0.12581374496221542, "clip_ratio/high_mean": 0.12581374496221542, "clip_ratio/low_mean": 0.07070140354335308, "clip_ratio/low_min": 0.07070140354335308, "clip_ratio/region_mean": 0.1965151485055685, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 48.625, "completions/mean_terminated_length": 48.625, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 2.1141539961099625, "epoch": 0.001737720111214087, "frac_reward_zero_std": 0.0, "grad_norm": 19.593364715576172, "learning_rate": 9.866666666666668e-06, "loss": 0.2204, "num_tokens": 90628.0, "reward": 0.6895775198936462, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6895775198936462, "reward_meter_std": 0.43211013078689575, "reward_std": 0.43211016058921814, "reward_total_composite_mean": 0.6895775198936462, "reward_total_composite_std": 0.43211013078689575, "reward_total_mean": 0.6895775198936462, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6895775198936462, "rewards/meter/std": 0.43211013078689575, "rewards/total_composite/mean": 0.6895775198936462, "rewards/total_composite/std": 0.43211013078689575, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0464413166046143, "sampling/importance_sampling_ratio/min": 0.21060624718666077, "sampling/sampling_logp_difference/max": 1.557765007019043, "sampling/sampling_logp_difference/mean": 0.22784224152565002, "step": 45 }, { "clip_ratio/high_max": 0.09895163122564554, "clip_ratio/high_mean": 0.09895163122564554, "clip_ratio/low_mean": 0.11509755253791809, "clip_ratio/low_min": 0.11509755253791809, "clip_ratio/region_mean": 0.21404918376356363, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 36.0, "completions/mean_terminated_length": 36.0, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 1.3433509916067123, "epoch": 0.0017763361136855112, "frac_reward_zero_std": 0.0, "grad_norm": 24.487468719482422, "learning_rate": 9.863636363636364e-06, "loss": 0.0451, "num_tokens": 92020.0, "reward": 0.2181696593761444, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.22091448307037354, "reward_meter_std": 0.17998214066028595, "reward_std": 0.18358123302459717, "reward_total_composite_mean": 0.2181696593761444, "reward_total_composite_std": 0.18358123302459717, "reward_total_mean": 0.2181696593761444, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.22091448307037354, "rewards/meter/std": 0.17998214066028595, "rewards/total_composite/mean": 0.2181696593761444, "rewards/total_composite/std": 0.18358123302459717, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9994174242019653, "sampling/importance_sampling_ratio/min": 0.17236579954624176, "sampling/sampling_logp_difference/max": 1.75813627243042, "sampling/sampling_logp_difference/mean": 0.22377783060073853, "step": 46 }, { "clip_ratio/high_max": 0.0347222238779068, "clip_ratio/high_mean": 0.0347222238779068, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0347222238779068, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 25.5, "completions/mean_terminated_length": 25.5, "completions/min_length": 24.0, "completions/min_terminated_length": 24.0, "entropy": 0.1728968620300293, "epoch": 0.0018149521161569355, "frac_reward_zero_std": 0.0, "grad_norm": 19.872201919555664, "learning_rate": 9.860606060606061e-06, "loss": -0.0284, "num_tokens": 93400.0, "reward": 0.8368544578552246, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8368544578552246, "reward_meter_std": 0.035664137452840805, "reward_std": 0.0356641449034214, "reward_total_composite_mean": 0.8368544578552246, "reward_total_composite_std": 0.035664137452840805, "reward_total_mean": 0.8368544578552246, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8368544578552246, "rewards/meter/std": 0.035664137452840805, "rewards/total_composite/mean": 0.8368544578552246, "rewards/total_composite/std": 0.035664137452840805, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9922424554824829, "sampling/importance_sampling_ratio/min": 0.0397215262055397, "sampling/sampling_logp_difference/max": 3.2258620262145996, "sampling/sampling_logp_difference/mean": 0.07806604355573654, "step": 47 }, { "clip_ratio/high_max": 0.13037441484630108, "clip_ratio/high_mean": 0.13037441484630108, "clip_ratio/low_mean": 0.09916602075099945, "clip_ratio/low_min": 0.09916602075099945, "clip_ratio/region_mean": 0.22954043559730053, "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 95.125, "completions/mean_terminated_length": 95.125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 2.133227914571762, "epoch": 0.0018535681186283596, "frac_reward_zero_std": 0.0, "grad_norm": 13.035599708557129, "learning_rate": 9.857575757575758e-06, "loss": 0.0975, "num_tokens": 95529.0, "reward": 0.3589945435523987, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3589945435523987, "reward_meter_std": 0.3197920322418213, "reward_std": 0.3197920024394989, "reward_total_composite_mean": 0.3589945435523987, "reward_total_composite_std": 0.3197920322418213, "reward_total_mean": 0.3589945435523987, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3589945435523987, "rewards/meter/std": 0.3197920322418213, "rewards/total_composite/mean": 0.3589945435523987, "rewards/total_composite/std": 0.3197920322418213, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0021162033081055, "sampling/importance_sampling_ratio/min": 0.12261507660150528, "sampling/sampling_logp_difference/max": 2.098705291748047, "sampling/sampling_logp_difference/mean": 0.23110564053058624, "step": 48 }, { "clip_ratio/high_max": 0.13691459875553846, "clip_ratio/high_mean": 0.13691459875553846, "clip_ratio/low_mean": 0.0817372314631939, "clip_ratio/low_min": 0.0817372314631939, "clip_ratio/region_mean": 0.21865183021873236, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 48.5, "completions/mean_terminated_length": 48.5, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 2.332765683531761, "epoch": 0.0018921841210997837, "frac_reward_zero_std": 0.0, "grad_norm": 15.745153427124023, "learning_rate": 9.854545454545456e-06, "loss": 0.0542, "num_tokens": 97325.0, "reward": 0.5693104267120361, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5693104267120361, "reward_meter_std": 0.4606866240501404, "reward_std": 0.460686594247818, "reward_total_composite_mean": 0.5693104267120361, "reward_total_composite_std": 0.4606866240501404, "reward_total_mean": 0.5693104267120361, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5693104267120361, "rewards/meter/std": 0.4606866240501404, "rewards/total_composite/mean": 0.5693104267120361, "rewards/total_composite/std": 0.4606866240501404, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031612515449524, "sampling/importance_sampling_ratio/min": 0.15585720539093018, "sampling/sampling_logp_difference/max": 1.8588149547576904, "sampling/sampling_logp_difference/mean": 0.2219070941209793, "step": 49 }, { "clip_ratio/high_max": 0.13284815661609173, "clip_ratio/high_mean": 0.13284815661609173, "clip_ratio/low_mean": 0.06395815405994654, "clip_ratio/low_min": 0.06395815405994654, "clip_ratio/region_mean": 0.19680631067603827, "completions/clipped_ratio": 0.0, "completions/max_length": 214.0, "completions/max_terminated_length": 214.0, "completions/mean_length": 176.625, "completions/mean_terminated_length": 176.625, "completions/min_length": 93.0, "completions/min_terminated_length": 93.0, "entropy": 2.019968628883362, "epoch": 0.0019308001235712078, "frac_reward_zero_std": 0.0, "grad_norm": 7.936125755310059, "learning_rate": 9.851515151515151e-06, "loss": -0.0192, "num_tokens": 100154.0, "reward": 0.5725899934768677, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.7158485651016235, "reward_meter_std": 0.3752211630344391, "reward_std": 0.41487547755241394, "reward_total_composite_mean": 0.5725899934768677, "reward_total_composite_std": 0.41487547755241394, "reward_total_mean": 0.5725899934768677, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.7158485651016235, "rewards/meter/std": 0.3752211630344391, "rewards/total_composite/mean": 0.5725899934768677, "rewards/total_composite/std": 0.41487547755241394, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.021142601966858, "sampling/importance_sampling_ratio/min": 0.10096535831689835, "sampling/sampling_logp_difference/max": 2.292977809906006, "sampling/sampling_logp_difference/mean": 0.19521863758563995, "step": 50 }, { "epoch": 0.0019308001235712078, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/max_length": 426.38461538461536, "eval_completions/max_terminated_length": 346.46153846153845, "eval_completions/mean_length": 184.7403846153846, "eval_completions/mean_terminated_length": 164.79945608285757, "eval_completions/min_length": 49.30769230769231, "eval_completions/min_terminated_length": 49.30769230769231, "eval_entropy": 2.3565903168458204, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 100154.0, "eval_reward": 0.3838638663291931, "eval_reward_arabic_clean_mean": 0.9230769230769231, "eval_reward_arabic_clean_std": 0.1987869510283837, "eval_reward_count_adherence_mean": 0.9684277910452622, "eval_reward_count_adherence_std": 0.059289679647638246, "eval_reward_meter_mean": 0.4141139342234685, "eval_reward_meter_std": 0.3737386694321266, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.3838638663291931, "eval_reward_total_composite_std": 0.3831195647899921, "eval_reward_total_mean": 0.3838638663291931, "eval_rewards/arabic_clean/mean": 0.9230769230769231, "eval_rewards/arabic_clean/std": 0.1987869510283837, "eval_rewards/count_adherence/mean": 0.9684277910452622, "eval_rewards/count_adherence/std": 0.059289679647638246, "eval_rewards/meter/mean": 0.4141139342234685, "eval_rewards/meter/std": 0.3737386694321266, "eval_rewards/total_composite/mean": 0.3838638663291931, "eval_rewards/total_composite/std": 0.3831195647899921, "eval_runtime": 79.1676, "eval_samples_per_second": 1.314, "eval_sampling/importance_sampling_ratio/max": 1.6281351492955134, "eval_sampling/importance_sampling_ratio/mean": 1.0421396860709558, "eval_sampling/importance_sampling_ratio/min": 0.31346100110274094, "eval_sampling/sampling_logp_difference/max": 1.170855081998385, "eval_sampling/sampling_logp_difference/mean": 0.14078256086661264, "eval_steps_per_second": 0.164, "step": 50 }, { "clip_ratio/high_max": 0.06337687559425831, "clip_ratio/high_mean": 0.06337687559425831, "clip_ratio/low_mean": 0.16671104542911053, "clip_ratio/low_min": 0.16671104542911053, "clip_ratio/region_mean": 0.23008792102336884, "completions/clipped_ratio": 0.0, "completions/max_length": 55.0, "completions/max_terminated_length": 55.0, "completions/mean_length": 41.875, "completions/mean_terminated_length": 41.875, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 1.8089727088809013, "epoch": 0.001969416126042632, "frac_reward_zero_std": 0.0, "grad_norm": 18.508319854736328, "learning_rate": 9.84848484848485e-06, "loss": 0.0165, "num_tokens": 101753.0, "reward": 0.23897752165794373, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.23897752165794373, "reward_meter_std": 0.3632267415523529, "reward_std": 0.3632267415523529, "reward_total_composite_mean": 0.23897752165794373, "reward_total_composite_std": 0.3632267415523529, "reward_total_mean": 0.23897752165794373, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.23897752165794373, "rewards/meter/std": 0.3632267415523529, "rewards/total_composite/mean": 0.23897752165794373, "rewards/total_composite/std": 0.3632267415523529, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0173118114471436, "sampling/importance_sampling_ratio/min": 0.08802343904972076, "sampling/sampling_logp_difference/max": 2.430152177810669, "sampling/sampling_logp_difference/mean": 0.2588263154029846, "step": 51 }, { "clip_ratio/high_max": 0.14840957894921303, "clip_ratio/high_mean": 0.14840957894921303, "clip_ratio/low_mean": 0.048903508111834526, "clip_ratio/low_min": 0.048903508111834526, "clip_ratio/region_mean": 0.19731308706104755, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 67.375, "completions/mean_terminated_length": 67.375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 2.2769337445497513, "epoch": 0.002008032128514056, "frac_reward_zero_std": 0.0, "grad_norm": 11.88036060333252, "learning_rate": 9.845454545454546e-06, "loss": -0.048, "num_tokens": 103684.0, "reward": 0.9933522939682007, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9933522939682007, "reward_meter_std": 0.004396223928779364, "reward_std": 0.004396222531795502, "reward_total_composite_mean": 0.9933522939682007, "reward_total_composite_std": 0.004396223928779364, "reward_total_mean": 0.9933522939682007, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9933522939682007, "rewards/meter/std": 0.004396223928779364, "rewards/total_composite/mean": 0.9933522939682007, "rewards/total_composite/std": 0.004396223928779364, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0523029565811157, "sampling/importance_sampling_ratio/min": 0.22250288724899292, "sampling/sampling_logp_difference/max": 1.5028152465820312, "sampling/sampling_logp_difference/mean": 0.20311212539672852, "step": 52 }, { "clip_ratio/high_max": 0.1322573497891426, "clip_ratio/high_mean": 0.1322573497891426, "clip_ratio/low_mean": 0.06783267110586166, "clip_ratio/low_min": 0.06783267110586166, "clip_ratio/region_mean": 0.20009002089500427, "completions/clipped_ratio": 0.0, "completions/max_length": 52.0, "completions/max_terminated_length": 52.0, "completions/mean_length": 37.125, "completions/mean_terminated_length": 37.125, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 1.6774490028619766, "epoch": 0.0020466481309854806, "frac_reward_zero_std": 0.0, "grad_norm": 19.141048431396484, "learning_rate": 9.842424242424243e-06, "loss": 0.0962, "num_tokens": 105125.0, "reward": 0.5976195335388184, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5984563231468201, "reward_meter_std": 0.42879587411880493, "reward_std": 0.43012017011642456, "reward_total_composite_mean": 0.5976195335388184, "reward_total_composite_std": 0.43012017011642456, "reward_total_mean": 0.5976195335388184, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5984563231468201, "rewards/meter/std": 0.42879587411880493, "rewards/total_composite/mean": 0.5976195335388184, "rewards/total_composite/std": 0.43012017011642456, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0220152139663696, "sampling/importance_sampling_ratio/min": 0.255797803401947, "sampling/sampling_logp_difference/max": 1.363368034362793, "sampling/sampling_logp_difference/mean": 0.2187996506690979, "step": 53 }, { "clip_ratio/high_max": 0.12507456727325916, "clip_ratio/high_mean": 0.12507456727325916, "clip_ratio/low_mean": 0.08917682990431786, "clip_ratio/low_min": 0.08917682990431786, "clip_ratio/region_mean": 0.21425139717757702, "completions/clipped_ratio": 0.0, "completions/max_length": 81.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 52.125, "completions/mean_terminated_length": 52.125, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 2.4166207313537598, "epoch": 0.0020852641334569047, "frac_reward_zero_std": 0.0, "grad_norm": 15.735599517822266, "learning_rate": 9.83939393939394e-06, "loss": -0.066, "num_tokens": 106862.0, "reward": 0.6028301119804382, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6028301119804382, "reward_meter_std": 0.4117062985897064, "reward_std": 0.41170626878738403, "reward_total_composite_mean": 0.6028301119804382, "reward_total_composite_std": 0.4117062985897064, "reward_total_mean": 0.6028301119804382, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6028301119804382, "rewards/meter/std": 0.4117062985897064, "rewards/total_composite/mean": 0.6028301119804382, "rewards/total_composite/std": 0.4117062985897064, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0488487482070923, "sampling/importance_sampling_ratio/min": 0.19384431838989258, "sampling/sampling_logp_difference/max": 1.640699863433838, "sampling/sampling_logp_difference/mean": 0.21817506849765778, "step": 54 }, { "clip_ratio/high_max": 0.07919401116669178, "clip_ratio/high_mean": 0.07919401116669178, "clip_ratio/low_mean": 0.1296012494713068, "clip_ratio/low_min": 0.1296012494713068, "clip_ratio/region_mean": 0.20879526063799858, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 57.875, "completions/mean_terminated_length": 57.875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.436240643262863, "epoch": 0.002123880135928329, "frac_reward_zero_std": 0.0, "grad_norm": 16.236080169677734, "learning_rate": 9.836363636363637e-06, "loss": 0.0736, "num_tokens": 108605.0, "reward": 0.2679245173931122, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2679245173931122, "reward_meter_std": 0.29882389307022095, "reward_std": 0.29882386326789856, "reward_total_composite_mean": 0.2679245173931122, "reward_total_composite_std": 0.29882389307022095, "reward_total_mean": 0.2679245173931122, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2679245173931122, "rewards/meter/std": 0.29882389307022095, "rewards/total_composite/mean": 0.2679245173931122, "rewards/total_composite/std": 0.29882389307022095, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0213844776153564, "sampling/importance_sampling_ratio/min": 0.13746440410614014, "sampling/sampling_logp_difference/max": 1.9843902587890625, "sampling/sampling_logp_difference/mean": 0.2685631215572357, "step": 55 }, { "clip_ratio/high_max": 0.09804818406701088, "clip_ratio/high_mean": 0.09804818406701088, "clip_ratio/low_mean": 0.054613095708191395, "clip_ratio/low_min": 0.054613095708191395, "clip_ratio/region_mean": 0.15266127977520227, "completions/clipped_ratio": 0.0, "completions/max_length": 74.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 42.75, "completions/mean_terminated_length": 42.75, "completions/min_length": 24.0, "completions/min_terminated_length": 24.0, "entropy": 1.5369336754083633, "epoch": 0.002162496138399753, "frac_reward_zero_std": 0.0, "grad_norm": 17.529335021972656, "learning_rate": 9.833333333333333e-06, "loss": -0.1085, "num_tokens": 110163.0, "reward": 0.6618984937667847, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7218412160873413, "reward_meter_std": 0.4222549796104431, "reward_std": 0.4177789092063904, "reward_total_composite_mean": 0.6618984937667847, "reward_total_composite_std": 0.41777893900871277, "reward_total_mean": 0.6618984937667847, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7218412160873413, "rewards/meter/std": 0.4222549796104431, "rewards/total_composite/mean": 0.6618984937667847, "rewards/total_composite/std": 0.41777893900871277, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0329205989837646, "sampling/importance_sampling_ratio/min": 0.1972530037164688, "sampling/sampling_logp_difference/max": 1.8073515892028809, "sampling/sampling_logp_difference/mean": 0.20614919066429138, "step": 56 }, { "clip_ratio/high_max": 0.1381522510200739, "clip_ratio/high_mean": 0.1381522510200739, "clip_ratio/low_mean": 0.07145614549517632, "clip_ratio/low_min": 0.07145614549517632, "clip_ratio/region_mean": 0.2096083965152502, "completions/clipped_ratio": 0.0, "completions/max_length": 266.0, "completions/max_terminated_length": 266.0, "completions/mean_length": 211.875, "completions/mean_terminated_length": 211.875, "completions/min_length": 156.0, "completions/min_terminated_length": 156.0, "entropy": 3.097422182559967, "epoch": 0.002201112140871177, "frac_reward_zero_std": 0.0, "grad_norm": 7.2061991691589355, "learning_rate": 9.830303030303032e-06, "loss": 0.0427, "num_tokens": 113546.0, "reward": 0.7174510955810547, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0578637570142746, "reward_meter_mean": 0.8386244773864746, "reward_meter_std": 0.1593872308731079, "reward_std": 0.33248570561408997, "reward_total_composite_mean": 0.7174510955810547, "reward_total_composite_std": 0.33248570561408997, "reward_total_mean": 0.7174510955810547, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0578637570142746, "rewards/meter/mean": 0.8386244773864746, "rewards/meter/std": 0.1593872308731079, "rewards/total_composite/mean": 0.7174510955810547, "rewards/total_composite/std": 0.33248570561408997, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0385682582855225, "sampling/importance_sampling_ratio/min": 0.17200742661952972, "sampling/sampling_logp_difference/max": 1.7602176666259766, "sampling/sampling_logp_difference/mean": 0.2227792590856552, "step": 57 }, { "clip_ratio/high_max": 0.20505854487419128, "clip_ratio/high_mean": 0.20505854487419128, "clip_ratio/low_mean": 0.01875000074505806, "clip_ratio/low_min": 0.01875000074505806, "clip_ratio/region_mean": 0.22380854561924934, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 66.5, "completions/mean_terminated_length": 66.5, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 2.203368306159973, "epoch": 0.002239728143342601, "frac_reward_zero_std": 0.0, "grad_norm": 10.99088191986084, "learning_rate": 9.827272727272729e-06, "loss": 0.0085, "num_tokens": 115430.0, "reward": 0.8916192054748535, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8916192054748535, "reward_meter_std": 0.292441725730896, "reward_std": 0.292441725730896, "reward_total_composite_mean": 0.8916192054748535, "reward_total_composite_std": 0.292441725730896, "reward_total_mean": 0.8916192054748535, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8916192054748535, "rewards/meter/std": 0.292441725730896, "rewards/total_composite/mean": 0.8916192054748535, "rewards/total_composite/std": 0.292441725730896, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0151267051696777, "sampling/importance_sampling_ratio/min": 0.0522882305085659, "sampling/sampling_logp_difference/max": 2.950984001159668, "sampling/sampling_logp_difference/mean": 0.2055407166481018, "step": 58 }, { "clip_ratio/high_max": 0.07533212564885616, "clip_ratio/high_mean": 0.07533212564885616, "clip_ratio/low_mean": 0.13746320828795433, "clip_ratio/low_min": 0.13746320828795433, "clip_ratio/region_mean": 0.2127953339368105, "completions/clipped_ratio": 0.0, "completions/max_length": 122.0, "completions/max_terminated_length": 122.0, "completions/mean_length": 100.5, "completions/mean_terminated_length": 100.5, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "entropy": 2.076779752969742, "epoch": 0.002278344145814025, "frac_reward_zero_std": 0.0, "grad_norm": 13.52698040008545, "learning_rate": 9.824242424242425e-06, "loss": 0.1166, "num_tokens": 117834.0, "reward": 0.3059839606285095, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.30988091230392456, "reward_meter_std": 0.22690658271312714, "reward_std": 0.2295694798231125, "reward_total_composite_mean": 0.3059839606285095, "reward_total_composite_std": 0.22956949472427368, "reward_total_mean": 0.3059839606285095, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.30988091230392456, "rewards/meter/std": 0.22690658271312714, "rewards/total_composite/mean": 0.3059839606285095, "rewards/total_composite/std": 0.22956949472427368, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9983330368995667, "sampling/importance_sampling_ratio/min": 0.08552319556474686, "sampling/sampling_logp_difference/max": 2.458967685699463, "sampling/sampling_logp_difference/mean": 0.2522209882736206, "step": 59 }, { "clip_ratio/high_max": 0.11208062618970871, "clip_ratio/high_mean": 0.11208062618970871, "clip_ratio/low_mean": 0.12309817224740982, "clip_ratio/low_min": 0.12309817224740982, "clip_ratio/region_mean": 0.23517879843711853, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 53.125, "completions/mean_terminated_length": 53.125, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 2.3633119463920593, "epoch": 0.0023169601482854493, "frac_reward_zero_std": 0.0, "grad_norm": 13.342586517333984, "learning_rate": 9.821212121212122e-06, "loss": 0.0991, "num_tokens": 119499.0, "reward": 0.3410363793373108, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3410363793373108, "reward_meter_std": 0.28698158264160156, "reward_std": 0.28698158264160156, "reward_total_composite_mean": 0.3410363793373108, "reward_total_composite_std": 0.28698158264160156, "reward_total_mean": 0.3410363793373108, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3410363793373108, "rewards/meter/std": 0.28698158264160156, "rewards/total_composite/mean": 0.3410363793373108, "rewards/total_composite/std": 0.28698158264160156, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0315275192260742, "sampling/importance_sampling_ratio/min": 0.2565752863883972, "sampling/sampling_logp_difference/max": 1.3603332042694092, "sampling/sampling_logp_difference/mean": 0.21170011162757874, "step": 60 }, { "clip_ratio/high_max": 0.17636545840650797, "clip_ratio/high_mean": 0.17636545840650797, "clip_ratio/low_mean": 0.036764707416296005, "clip_ratio/low_min": 0.036764707416296005, "clip_ratio/region_mean": 0.21313016582280397, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 29.75, "completions/mean_terminated_length": 29.75, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 2.489090621471405, "epoch": 0.002355576150756874, "frac_reward_zero_std": 0.0, "grad_norm": 25.383638381958008, "learning_rate": 9.81818181818182e-06, "loss": 0.062, "num_tokens": 121057.0, "reward": 0.9133638143539429, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9133638143539429, "reward_meter_std": 0.2053176313638687, "reward_std": 0.2053176462650299, "reward_total_composite_mean": 0.9133638143539429, "reward_total_composite_std": 0.2053176313638687, "reward_total_mean": 0.9133638143539429, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9133638143539429, "rewards/meter/std": 0.2053176313638687, "rewards/total_composite/mean": 0.9133638143539429, "rewards/total_composite/std": 0.2053176313638687, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0374253988265991, "sampling/importance_sampling_ratio/min": 0.25975415110588074, "sampling/sampling_logp_difference/max": 1.3480195999145508, "sampling/sampling_logp_difference/mean": 0.19405041635036469, "step": 61 }, { "clip_ratio/high_max": 0.09878450445830822, "clip_ratio/high_mean": 0.09878450445830822, "clip_ratio/low_mean": 0.100760068744421, "clip_ratio/low_min": 0.100760068744421, "clip_ratio/region_mean": 0.19954457320272923, "completions/clipped_ratio": 0.0, "completions/max_length": 128.0, "completions/max_terminated_length": 128.0, "completions/mean_length": 99.375, "completions/mean_terminated_length": 99.375, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 2.4795138239860535, "epoch": 0.002394192153228298, "frac_reward_zero_std": 0.0, "grad_norm": 12.204435348510742, "learning_rate": 9.815151515151516e-06, "loss": 0.1325, "num_tokens": 123204.0, "reward": 0.4881056547164917, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4881056547164917, "reward_meter_std": 0.2547048330307007, "reward_std": 0.2547048032283783, "reward_total_composite_mean": 0.4881056547164917, "reward_total_composite_std": 0.2547048330307007, "reward_total_mean": 0.4881056547164917, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4881056547164917, "rewards/meter/std": 0.2547048330307007, "rewards/total_composite/mean": 0.4881056547164917, "rewards/total_composite/std": 0.2547048330307007, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.041177749633789, "sampling/importance_sampling_ratio/min": 0.15324591100215912, "sampling/sampling_logp_difference/max": 1.875711441040039, "sampling/sampling_logp_difference/mean": 0.21773025393486023, "step": 62 }, { "clip_ratio/high_max": 0.1503895577043295, "clip_ratio/high_mean": 0.1503895577043295, "clip_ratio/low_mean": 0.02020994247868657, "clip_ratio/low_min": 0.02020994247868657, "clip_ratio/region_mean": 0.17059950018301606, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 60.875, "completions/mean_terminated_length": 60.875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 2.3204995840787888, "epoch": 0.002432808155699722, "frac_reward_zero_std": 0.0, "grad_norm": 18.67860221862793, "learning_rate": 9.812121212121212e-06, "loss": 0.0373, "num_tokens": 124939.0, "reward": 0.9198144674301147, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9198144674301147, "reward_meter_std": 0.13751091063022614, "reward_std": 0.13751091063022614, "reward_total_composite_mean": 0.9198144674301147, "reward_total_composite_std": 0.13751091063022614, "reward_total_mean": 0.9198144674301147, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9198144674301147, "rewards/meter/std": 0.13751091063022614, "rewards/total_composite/mean": 0.9198144674301147, "rewards/total_composite/std": 0.13751091063022614, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0526179075241089, "sampling/importance_sampling_ratio/min": 0.23382781445980072, "sampling/sampling_logp_difference/max": 1.4531702995300293, "sampling/sampling_logp_difference/mean": 0.19855335354804993, "step": 63 }, { "clip_ratio/high_max": 0.1345098316669464, "clip_ratio/high_mean": 0.1345098316669464, "clip_ratio/low_mean": 0.06851893290877342, "clip_ratio/low_min": 0.06851893290877342, "clip_ratio/region_mean": 0.20302876457571983, "completions/clipped_ratio": 0.0, "completions/max_length": 410.0, "completions/max_terminated_length": 410.0, "completions/mean_length": 308.875, "completions/mean_terminated_length": 308.875, "completions/min_length": 248.0, "completions/min_terminated_length": 248.0, "entropy": 3.1392965018749237, "epoch": 0.002471424158171146, "frac_reward_zero_std": 0.0, "grad_norm": 5.2523932456970215, "learning_rate": 9.809090909090911e-06, "loss": -0.052, "num_tokens": 129130.0, "reward": 0.5670943260192871, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.05175492912530899, "reward_meter_mean": 0.9247400164604187, "reward_meter_std": 0.13669492304325104, "reward_std": 0.47056710720062256, "reward_total_composite_mean": 0.5670943260192871, "reward_total_composite_std": 0.47056710720062256, "reward_total_mean": 0.5670943260192871, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.05175492912530899, "rewards/meter/mean": 0.9247400164604187, "rewards/meter/std": 0.13669492304325104, "rewards/total_composite/mean": 0.5670943260192871, "rewards/total_composite/std": 0.47056710720062256, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0358939170837402, "sampling/importance_sampling_ratio/min": 0.15853774547576904, "sampling/sampling_logp_difference/max": 1.8417625427246094, "sampling/sampling_logp_difference/mean": 0.21920810639858246, "step": 64 }, { "clip_ratio/high_max": 0.08198772463947535, "clip_ratio/high_mean": 0.08198772463947535, "clip_ratio/low_mean": 0.11948978900909424, "clip_ratio/low_min": 0.11948978900909424, "clip_ratio/region_mean": 0.20147751364856958, "completions/clipped_ratio": 0.0, "completions/max_length": 48.0, "completions/max_terminated_length": 48.0, "completions/mean_length": 35.875, "completions/mean_terminated_length": 35.875, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 1.4370453506708145, "epoch": 0.0025100401606425703, "frac_reward_zero_std": 0.0, "grad_norm": 26.357711791992188, "learning_rate": 9.806060606060607e-06, "loss": 0.2664, "num_tokens": 130721.0, "reward": 0.5192750096321106, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5192750096321106, "reward_meter_std": 0.47312480211257935, "reward_std": 0.47312480211257935, "reward_total_composite_mean": 0.5192750096321106, "reward_total_composite_std": 0.47312480211257935, "reward_total_mean": 0.5192750096321106, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5192750096321106, "rewards/meter/std": 0.47312480211257935, "rewards/total_composite/mean": 0.5192750096321106, "rewards/total_composite/std": 0.47312480211257935, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0055742263793945, "sampling/importance_sampling_ratio/min": 0.13099518418312073, "sampling/sampling_logp_difference/max": 2.032594680786133, "sampling/sampling_logp_difference/mean": 0.2368556261062622, "step": 65 }, { "clip_ratio/high_max": 0.13170645385980606, "clip_ratio/high_mean": 0.13170645385980606, "clip_ratio/low_mean": 0.046164773404598236, "clip_ratio/low_min": 0.046164773404598236, "clip_ratio/region_mean": 0.1778712272644043, "completions/clipped_ratio": 0.0, "completions/max_length": 96.0, "completions/max_terminated_length": 96.0, "completions/mean_length": 66.875, "completions/mean_terminated_length": 66.875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 1.377866268157959, "epoch": 0.0025486561631139944, "frac_reward_zero_std": 0.0, "grad_norm": 27.630306243896484, "learning_rate": 9.803030303030304e-06, "loss": 0.137, "num_tokens": 132488.0, "reward": 0.7682692408561707, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7682692408561707, "reward_meter_std": 0.3781956434249878, "reward_std": 0.3781956434249878, "reward_total_composite_mean": 0.7682692408561707, "reward_total_composite_std": 0.3781956434249878, "reward_total_mean": 0.7682692408561707, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7682692408561707, "rewards/meter/std": 0.3781956434249878, "rewards/total_composite/mean": 0.7682692408561707, "rewards/total_composite/std": 0.3781956434249878, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.000638723373413, "sampling/importance_sampling_ratio/min": 0.1309218853712082, "sampling/sampling_logp_difference/max": 2.0331544876098633, "sampling/sampling_logp_difference/mean": 0.21417810022830963, "step": 66 }, { "clip_ratio/high_max": 0.13258693367242813, "clip_ratio/high_mean": 0.13258693367242813, "clip_ratio/low_mean": 0.08497239649295807, "clip_ratio/low_min": 0.08497239649295807, "clip_ratio/region_mean": 0.2175593301653862, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 48.875, "completions/mean_terminated_length": 48.875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.8289676904678345, "epoch": 0.0025872721655854185, "frac_reward_zero_std": 0.0, "grad_norm": 14.999178886413574, "learning_rate": 9.800000000000001e-06, "loss": 0.0209, "num_tokens": 134295.0, "reward": 0.6665328741073608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8183262348175049, "reward_meter_std": 0.32211264967918396, "reward_std": 0.43555328249931335, "reward_total_composite_mean": 0.6665328741073608, "reward_total_composite_std": 0.43555328249931335, "reward_total_mean": 0.6665328741073608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8183262348175049, "rewards/meter/std": 0.32211264967918396, "rewards/total_composite/mean": 0.6665328741073608, "rewards/total_composite/std": 0.43555328249931335, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0471768379211426, "sampling/importance_sampling_ratio/min": 0.23626382648944855, "sampling/sampling_logp_difference/max": 1.4428062438964844, "sampling/sampling_logp_difference/mean": 0.2460046112537384, "step": 67 }, { "clip_ratio/high_max": 0.10875347442924976, "clip_ratio/high_mean": 0.10875347442924976, "clip_ratio/low_mean": 0.08730671741068363, "clip_ratio/low_min": 0.08730671741068363, "clip_ratio/region_mean": 0.1960601918399334, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 52.75, "completions/mean_terminated_length": 52.75, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 1.6037258356809616, "epoch": 0.0026258881680568426, "frac_reward_zero_std": 0.0, "grad_norm": 15.564022064208984, "learning_rate": 9.796969696969698e-06, "loss": 0.1484, "num_tokens": 135997.0, "reward": 0.35390323400497437, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4771120548248291, "reward_meter_std": 0.3203728497028351, "reward_std": 0.28436198830604553, "reward_total_composite_mean": 0.35390323400497437, "reward_total_composite_std": 0.28436195850372314, "reward_total_mean": 0.35390323400497437, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4771120548248291, "rewards/meter/std": 0.3203728497028351, "rewards/total_composite/mean": 0.35390323400497437, "rewards/total_composite/std": 0.28436195850372314, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0302598476409912, "sampling/importance_sampling_ratio/min": 0.23306208848953247, "sampling/sampling_logp_difference/max": 1.4564504623413086, "sampling/sampling_logp_difference/mean": 0.22163131833076477, "step": 68 }, { "clip_ratio/high_max": 0.15749920904636383, "clip_ratio/high_mean": 0.15749920904636383, "clip_ratio/low_mean": 0.06984523870050907, "clip_ratio/low_min": 0.06984523870050907, "clip_ratio/region_mean": 0.2273444477468729, "completions/clipped_ratio": 0.0, "completions/max_length": 147.0, "completions/max_terminated_length": 147.0, "completions/mean_length": 112.5, "completions/mean_terminated_length": 112.5, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 3.092645615339279, "epoch": 0.002664504170528267, "frac_reward_zero_std": 0.0, "grad_norm": 8.40172290802002, "learning_rate": 9.793939393939394e-06, "loss": 0.1465, "num_tokens": 138233.0, "reward": 0.5694236159324646, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6559433937072754, "reward_meter_std": 0.3531401455402374, "reward_std": 0.4212261736392975, "reward_total_composite_mean": 0.5694236159324646, "reward_total_composite_std": 0.4212262034416199, "reward_total_mean": 0.5694236159324646, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6559433937072754, "rewards/meter/std": 0.3531401455402374, "rewards/total_composite/mean": 0.5694236159324646, "rewards/total_composite/std": 0.4212262034416199, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0383771657943726, "sampling/importance_sampling_ratio/min": 0.18941885232925415, "sampling/sampling_logp_difference/max": 1.6637945175170898, "sampling/sampling_logp_difference/mean": 0.21621394157409668, "step": 69 }, { "clip_ratio/high_max": 0.07498700357973576, "clip_ratio/high_mean": 0.07498700357973576, "clip_ratio/low_mean": 0.10936851240694523, "clip_ratio/low_min": 0.10936851240694523, "clip_ratio/region_mean": 0.18435551598668098, "completions/clipped_ratio": 0.0, "completions/max_length": 91.0, "completions/max_terminated_length": 91.0, "completions/mean_length": 78.625, "completions/mean_terminated_length": 78.625, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 2.6834762394428253, "epoch": 0.0027031201729996912, "frac_reward_zero_std": 0.0, "grad_norm": 12.81651782989502, "learning_rate": 9.790909090909093e-06, "loss": 0.0207, "num_tokens": 140310.0, "reward": 0.4240095019340515, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.43477553129196167, "reward_meter_std": 0.332572340965271, "reward_std": 0.337272584438324, "reward_total_composite_mean": 0.4240095019340515, "reward_total_composite_std": 0.337272584438324, "reward_total_mean": 0.4240095019340515, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.43477553129196167, "rewards/meter/std": 0.332572340965271, "rewards/total_composite/mean": 0.4240095019340515, "rewards/total_composite/std": 0.337272584438324, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031362533569336, "sampling/importance_sampling_ratio/min": 0.2754969000816345, "sampling/sampling_logp_difference/max": 1.2891788482666016, "sampling/sampling_logp_difference/mean": 0.2150382101535797, "step": 70 }, { "clip_ratio/high_max": 0.12004932574927807, "clip_ratio/high_mean": 0.12004932574927807, "clip_ratio/low_mean": 0.07749529182910919, "clip_ratio/low_min": 0.07749529182910919, "clip_ratio/region_mean": 0.19754461757838726, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 77.5, "completions/mean_terminated_length": 77.5, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 2.1531532555818558, "epoch": 0.0027417361754711153, "frac_reward_zero_std": 0.0, "grad_norm": 13.432793617248535, "learning_rate": 9.787878787878788e-06, "loss": 0.0109, "num_tokens": 142298.0, "reward": 0.7772670984268188, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7772670984268188, "reward_meter_std": 0.3389206826686859, "reward_std": 0.3389207124710083, "reward_total_composite_mean": 0.7772670984268188, "reward_total_composite_std": 0.3389206826686859, "reward_total_mean": 0.7772670984268188, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7772670984268188, "rewards/meter/std": 0.3389206826686859, "rewards/total_composite/mean": 0.7772670984268188, "rewards/total_composite/std": 0.3389206826686859, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0325590372085571, "sampling/importance_sampling_ratio/min": 0.2021116316318512, "sampling/sampling_logp_difference/max": 1.5989351272583008, "sampling/sampling_logp_difference/mean": 0.1868724375963211, "step": 71 }, { "clip_ratio/high_max": 0.11257654242217541, "clip_ratio/high_mean": 0.11257654242217541, "clip_ratio/low_mean": 0.0991472564637661, "clip_ratio/low_min": 0.0991472564637661, "clip_ratio/region_mean": 0.2117237988859415, "completions/clipped_ratio": 0.0, "completions/max_length": 175.0, "completions/max_terminated_length": 175.0, "completions/mean_length": 153.375, "completions/mean_terminated_length": 153.375, "completions/min_length": 138.0, "completions/min_terminated_length": 138.0, "entropy": 2.355428859591484, "epoch": 0.0027803521779425394, "frac_reward_zero_std": 0.0, "grad_norm": 9.057010650634766, "learning_rate": 9.784848484848486e-06, "loss": 0.1169, "num_tokens": 144949.0, "reward": 0.5220509767532349, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.1414213478565216, "reward_meter_mean": 0.5224494934082031, "reward_meter_std": 0.4397116005420685, "reward_std": 0.4402455985546112, "reward_total_composite_mean": 0.5220509767532349, "reward_total_composite_std": 0.4402455985546112, "reward_total_mean": 0.5220509767532349, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.1414213478565216, "rewards/meter/mean": 0.5224494934082031, "rewards/meter/std": 0.4397116005420685, "rewards/total_composite/mean": 0.5220509767532349, "rewards/total_composite/std": 0.4402455985546112, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0310229063034058, "sampling/importance_sampling_ratio/min": 0.16696415841579437, "sampling/sampling_logp_difference/max": 1.7899761199951172, "sampling/sampling_logp_difference/mean": 0.2253074198961258, "step": 72 }, { "clip_ratio/high_max": 0.11561089940369129, "clip_ratio/high_mean": 0.11561089940369129, "clip_ratio/low_mean": 0.10295584239065647, "clip_ratio/low_min": 0.10295584239065647, "clip_ratio/region_mean": 0.21856674179434776, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 56.875, "completions/mean_terminated_length": 56.875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 2.409619852900505, "epoch": 0.0028189681804139635, "frac_reward_zero_std": 0.0, "grad_norm": 14.417825698852539, "learning_rate": 9.781818181818183e-06, "loss": 0.025, "num_tokens": 146868.0, "reward": 0.40673646330833435, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.44528478384017944, "reward_meter_std": 0.402529776096344, "reward_std": 0.43125417828559875, "reward_total_composite_mean": 0.40673646330833435, "reward_total_composite_std": 0.43125420808792114, "reward_total_mean": 0.40673646330833435, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.44528478384017944, "rewards/meter/std": 0.402529776096344, "rewards/total_composite/mean": 0.40673646330833435, "rewards/total_composite/std": 0.43125420808792114, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.008949637413025, "sampling/importance_sampling_ratio/min": 0.16759149730205536, "sampling/sampling_logp_difference/max": 1.7862257957458496, "sampling/sampling_logp_difference/mean": 0.2235013246536255, "step": 73 }, { "clip_ratio/high_max": 0.02222863771021366, "clip_ratio/high_mean": 0.02222863771021366, "clip_ratio/low_mean": 0.05759216099977493, "clip_ratio/low_min": 0.05759216099977493, "clip_ratio/region_mean": 0.0798207987099886, "completions/clipped_ratio": 0.5, "completions/max_length": 512.0, "completions/max_terminated_length": 465.0, "completions/mean_length": 479.375, "completions/mean_terminated_length": 446.75, "completions/min_length": 426.0, "completions/min_terminated_length": 426.0, "entropy": 1.72447469830513, "epoch": 0.0028575841828853876, "frac_reward_zero_std": 0.0, "grad_norm": 1.7615196704864502, "learning_rate": 9.77878787878788e-06, "loss": -0.011, "num_tokens": 150527.0, "reward": 0.5821076035499573, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8833333253860474, "reward_count_adherence_std": 0.077664315700531, "reward_meter_mean": 0.6778547763824463, "reward_meter_std": 0.2513851225376129, "reward_std": 0.29507479071617126, "reward_total_composite_mean": 0.5821076035499573, "reward_total_composite_std": 0.29507479071617126, "reward_total_mean": 0.5821076035499573, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8833333253860474, "rewards/count_adherence/std": 0.077664315700531, "rewards/meter/mean": 0.6778547763824463, "rewards/meter/std": 0.2513851225376129, "rewards/total_composite/mean": 0.5821076035499573, "rewards/total_composite/std": 0.29507479071617126, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.039528250694275, "sampling/importance_sampling_ratio/min": 0.17914791405200958, "sampling/sampling_logp_difference/max": 1.71954345703125, "sampling/sampling_logp_difference/mean": 0.22136430442333221, "step": 74 }, { "clip_ratio/high_max": 0.08039004355669022, "clip_ratio/high_mean": 0.08039004355669022, "clip_ratio/low_mean": 0.11534719914197922, "clip_ratio/low_min": 0.11534719914197922, "clip_ratio/region_mean": 0.19573724269866943, "completions/clipped_ratio": 0.0, "completions/max_length": 154.0, "completions/max_terminated_length": 154.0, "completions/mean_length": 116.625, "completions/mean_terminated_length": 116.625, "completions/min_length": 87.0, "completions/min_terminated_length": 87.0, "entropy": 2.2147320955991745, "epoch": 0.0028962001853568117, "frac_reward_zero_std": 0.0, "grad_norm": 10.22510051727295, "learning_rate": 9.775757575757576e-06, "loss": 0.0601, "num_tokens": 152828.0, "reward": 0.43358057737350464, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.449047327041626, "reward_meter_std": 0.3430718183517456, "reward_std": 0.3434963822364807, "reward_total_composite_mean": 0.43358057737350464, "reward_total_composite_std": 0.3434963822364807, "reward_total_mean": 0.43358057737350464, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.449047327041626, "rewards/meter/std": 0.3430718183517456, "rewards/total_composite/mean": 0.43358057737350464, "rewards/total_composite/std": 0.3434963822364807, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.027030110359192, "sampling/importance_sampling_ratio/min": 0.1412452757358551, "sampling/sampling_logp_difference/max": 1.9572572708129883, "sampling/sampling_logp_difference/mean": 0.22043807804584503, "step": 75 }, { "clip_ratio/high_max": 0.12531227804720402, "clip_ratio/high_mean": 0.12531227804720402, "clip_ratio/low_mean": 0.09451080299913883, "clip_ratio/low_min": 0.09451080299913883, "clip_ratio/region_mean": 0.21982308104634285, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 55.25, "completions/mean_terminated_length": 55.25, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 3.0069815814495087, "epoch": 0.002934816187828236, "frac_reward_zero_std": 0.0, "grad_norm": 14.32852840423584, "learning_rate": 9.772727272727273e-06, "loss": 0.126, "num_tokens": 154686.0, "reward": 0.7078003883361816, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7078003883361816, "reward_meter_std": 0.4165555238723755, "reward_std": 0.4165555238723755, "reward_total_composite_mean": 0.7078003883361816, "reward_total_composite_std": 0.4165555238723755, "reward_total_mean": 0.7078003883361816, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7078003883361816, "rewards/meter/std": 0.4165555238723755, "rewards/total_composite/mean": 0.7078003883361816, "rewards/total_composite/std": 0.4165555238723755, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0568245649337769, "sampling/importance_sampling_ratio/min": 0.15894815325737, "sampling/sampling_logp_difference/max": 1.839177131652832, "sampling/sampling_logp_difference/mean": 0.22555997967720032, "step": 76 }, { "clip_ratio/high_max": 0.15934639982879162, "clip_ratio/high_mean": 0.15934639982879162, "clip_ratio/low_mean": 0.08010341972112656, "clip_ratio/low_min": 0.08010341972112656, "clip_ratio/region_mean": 0.23944981954991817, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 48.875, "completions/mean_terminated_length": 48.875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 2.4677112847566605, "epoch": 0.0029734321902996604, "frac_reward_zero_std": 0.0, "grad_norm": 16.326507568359375, "learning_rate": 9.76969696969697e-06, "loss": 0.0662, "num_tokens": 156293.0, "reward": 0.6651355624198914, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6651355624198914, "reward_meter_std": 0.39970725774765015, "reward_std": 0.39970725774765015, "reward_total_composite_mean": 0.6651355624198914, "reward_total_composite_std": 0.39970725774765015, "reward_total_mean": 0.6651355624198914, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6651355624198914, "rewards/meter/std": 0.39970725774765015, "rewards/total_composite/mean": 0.6651355624198914, "rewards/total_composite/std": 0.39970725774765015, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.023947834968567, "sampling/importance_sampling_ratio/min": 0.20041508972644806, "sampling/sampling_logp_difference/max": 1.6073646545410156, "sampling/sampling_logp_difference/mean": 0.22144979238510132, "step": 77 }, { "clip_ratio/high_max": 0.06962481327354908, "clip_ratio/high_mean": 0.06962481327354908, "clip_ratio/low_mean": 0.1108522079885006, "clip_ratio/low_min": 0.1108522079885006, "clip_ratio/region_mean": 0.18047702126204967, "completions/clipped_ratio": 0.0, "completions/max_length": 197.0, "completions/max_terminated_length": 197.0, "completions/mean_length": 148.75, "completions/mean_terminated_length": 148.75, "completions/min_length": 127.0, "completions/min_terminated_length": 127.0, "entropy": 2.010555699467659, "epoch": 0.0030120481927710845, "frac_reward_zero_std": 0.0, "grad_norm": 8.249039649963379, "learning_rate": 9.766666666666667e-06, "loss": 0.073, "num_tokens": 159067.0, "reward": 0.35600364208221436, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.3600383400917053, "reward_meter_std": 0.2478063702583313, "reward_std": 0.2517344057559967, "reward_total_composite_mean": 0.35600364208221436, "reward_total_composite_std": 0.2517344057559967, "reward_total_mean": 0.35600364208221436, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.3600383400917053, "rewards/meter/std": 0.2478063702583313, "rewards/total_composite/mean": 0.35600364208221436, "rewards/total_composite/std": 0.2517344057559967, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0375880002975464, "sampling/importance_sampling_ratio/min": 0.1594703197479248, "sampling/sampling_logp_difference/max": 1.835897445678711, "sampling/sampling_logp_difference/mean": 0.20435652136802673, "step": 78 }, { "clip_ratio/high_max": 0.06808187626302242, "clip_ratio/high_mean": 0.06808187626302242, "clip_ratio/low_mean": 0.11126292496919632, "clip_ratio/low_min": 0.11126292496919632, "clip_ratio/region_mean": 0.17934480123221874, "completions/clipped_ratio": 0.0, "completions/max_length": 384.0, "completions/max_terminated_length": 384.0, "completions/mean_length": 315.0, "completions/mean_terminated_length": 315.0, "completions/min_length": 211.0, "completions/min_terminated_length": 211.0, "entropy": 2.524102747440338, "epoch": 0.0030506641952425086, "frac_reward_zero_std": 0.0, "grad_norm": 5.221505165100098, "learning_rate": 9.763636363636365e-06, "loss": -0.0364, "num_tokens": 163339.0, "reward": 0.4219393730163574, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.10690447688102722, "reward_meter_mean": 0.4919300973415375, "reward_meter_std": 0.2810616195201874, "reward_std": 0.2564575970172882, "reward_total_composite_mean": 0.4219393730163574, "reward_total_composite_std": 0.2564575970172882, "reward_total_mean": 0.4219393730163574, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.10690447688102722, "rewards/meter/mean": 0.4919300973415375, "rewards/meter/std": 0.2810616195201874, "rewards/total_composite/mean": 0.4219393730163574, "rewards/total_composite/std": 0.2564575970172882, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0315507650375366, "sampling/importance_sampling_ratio/min": 0.13987872004508972, "sampling/sampling_logp_difference/max": 1.9669795036315918, "sampling/sampling_logp_difference/mean": 0.20352312922477722, "step": 79 }, { "clip_ratio/high_max": 0.1331654218956828, "clip_ratio/high_mean": 0.1331654218956828, "clip_ratio/low_mean": 0.05844542942941189, "clip_ratio/low_min": 0.05844542942941189, "clip_ratio/region_mean": 0.1916108513250947, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 55.25, "completions/mean_terminated_length": 55.25, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 2.6958227306604385, "epoch": 0.0030892801977139327, "frac_reward_zero_std": 0.0, "grad_norm": 15.532655715942383, "learning_rate": 9.760606060606062e-06, "loss": 0.0304, "num_tokens": 165053.0, "reward": 0.7070286273956299, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7070286273956299, "reward_meter_std": 0.3917587697505951, "reward_std": 0.3917587697505951, "reward_total_composite_mean": 0.7070286273956299, "reward_total_composite_std": 0.3917587697505951, "reward_total_mean": 0.7070286273956299, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7070286273956299, "rewards/meter/std": 0.3917587697505951, "rewards/total_composite/mean": 0.7070286273956299, "rewards/total_composite/std": 0.3917587697505951, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0330888032913208, "sampling/importance_sampling_ratio/min": 0.3348976671695709, "sampling/sampling_logp_difference/max": 1.0939302444458008, "sampling/sampling_logp_difference/mean": 0.2240315079689026, "step": 80 }, { "clip_ratio/high_max": 0.14205198176205158, "clip_ratio/high_mean": 0.14205198176205158, "clip_ratio/low_mean": 0.05491071380674839, "clip_ratio/low_min": 0.05491071380674839, "clip_ratio/region_mean": 0.19696269556879997, "completions/clipped_ratio": 0.0, "completions/max_length": 48.0, "completions/max_terminated_length": 48.0, "completions/mean_length": 40.875, "completions/mean_terminated_length": 40.875, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.8825555518269539, "epoch": 0.003127896200185357, "frac_reward_zero_std": 0.0, "grad_norm": 20.511795043945312, "learning_rate": 9.757575757575758e-06, "loss": -0.0475, "num_tokens": 166596.0, "reward": 0.6753016710281372, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6753016710281372, "reward_meter_std": 0.3897930681705475, "reward_std": 0.3897930681705475, "reward_total_composite_mean": 0.6753016710281372, "reward_total_composite_std": 0.3897930681705475, "reward_total_mean": 0.6753016710281372, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6753016710281372, "rewards/meter/std": 0.3897930681705475, "rewards/total_composite/mean": 0.6753016710281372, "rewards/total_composite/std": 0.3897930681705475, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9999099969863892, "sampling/importance_sampling_ratio/min": 0.11286209523677826, "sampling/sampling_logp_difference/max": 2.181588649749756, "sampling/sampling_logp_difference/mean": 0.17763756215572357, "step": 81 }, { "clip_ratio/high_max": 0.13331562653183937, "clip_ratio/high_mean": 0.13331562653183937, "clip_ratio/low_mean": 0.07035921700298786, "clip_ratio/low_min": 0.07035921700298786, "clip_ratio/region_mean": 0.20367484353482723, "completions/clipped_ratio": 0.0, "completions/max_length": 142.0, "completions/max_terminated_length": 142.0, "completions/mean_length": 74.75, "completions/mean_terminated_length": 74.75, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 2.4969915598630905, "epoch": 0.003166512202656781, "frac_reward_zero_std": 0.0, "grad_norm": 11.253849029541016, "learning_rate": 9.754545454545455e-06, "loss": 0.1511, "num_tokens": 168602.0, "reward": 0.6087316870689392, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7240955233573914, "reward_meter_std": 0.410367876291275, "reward_std": 0.4716724455356598, "reward_total_composite_mean": 0.6087316870689392, "reward_total_composite_std": 0.4716724455356598, "reward_total_mean": 0.6087316870689392, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7240955233573914, "rewards/meter/std": 0.410367876291275, "rewards/total_composite/mean": 0.6087316870689392, "rewards/total_composite/std": 0.4716724455356598, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0235908031463623, "sampling/importance_sampling_ratio/min": 0.17788389325141907, "sampling/sampling_logp_difference/max": 1.7266242504119873, "sampling/sampling_logp_difference/mean": 0.2147466540336609, "step": 82 }, { "clip_ratio/high_max": 0.10117011703550816, "clip_ratio/high_mean": 0.10117011703550816, "clip_ratio/low_mean": 0.09328041970729828, "clip_ratio/low_min": 0.09328041970729828, "clip_ratio/region_mean": 0.19445053674280643, "completions/clipped_ratio": 0.0, "completions/max_length": 264.0, "completions/max_terminated_length": 264.0, "completions/mean_length": 179.0, "completions/mean_terminated_length": 179.0, "completions/min_length": 100.0, "completions/min_terminated_length": 100.0, "entropy": 2.964230954647064, "epoch": 0.003205128205128205, "frac_reward_zero_std": 0.0, "grad_norm": 7.257972240447998, "learning_rate": 9.751515151515152e-06, "loss": -0.0125, "num_tokens": 171482.0, "reward": 0.4665340185165405, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.07715168595314026, "reward_meter_mean": 0.5834420323371887, "reward_meter_std": 0.35952043533325195, "reward_std": 0.38863876461982727, "reward_total_composite_mean": 0.4665340185165405, "reward_total_composite_std": 0.38863879442214966, "reward_total_mean": 0.4665340185165405, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.07715168595314026, "rewards/meter/mean": 0.5834420323371887, "rewards/meter/std": 0.35952043533325195, "rewards/total_composite/mean": 0.4665340185165405, "rewards/total_composite/std": 0.38863879442214966, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.048352599143982, "sampling/importance_sampling_ratio/min": 0.12926006317138672, "sampling/sampling_logp_difference/max": 2.045928955078125, "sampling/sampling_logp_difference/mean": 0.20953215658664703, "step": 83 }, { "clip_ratio/high_max": 0.06479034759104252, "clip_ratio/high_mean": 0.06479034759104252, "clip_ratio/low_mean": 0.10067356191575527, "clip_ratio/low_min": 0.10067356191575527, "clip_ratio/region_mean": 0.1654639095067978, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 51.75, "completions/mean_terminated_length": 51.75, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 2.0957568138837814, "epoch": 0.003243744207599629, "frac_reward_zero_std": 0.0, "grad_norm": 20.633411407470703, "learning_rate": 9.74848484848485e-06, "loss": 0.1851, "num_tokens": 173072.0, "reward": 0.36928117275238037, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.36928117275238037, "reward_meter_std": 0.413564532995224, "reward_std": 0.413564532995224, "reward_total_composite_mean": 0.36928117275238037, "reward_total_composite_std": 0.413564532995224, "reward_total_mean": 0.36928117275238037, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.36928117275238037, "rewards/meter/std": 0.413564532995224, "rewards/total_composite/mean": 0.36928117275238037, "rewards/total_composite/std": 0.413564532995224, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0323539972305298, "sampling/importance_sampling_ratio/min": 0.176025852560997, "sampling/sampling_logp_difference/max": 1.7371244430541992, "sampling/sampling_logp_difference/mean": 0.20136907696723938, "step": 84 }, { "clip_ratio/high_max": 0.10693838447332382, "clip_ratio/high_mean": 0.10693838447332382, "clip_ratio/low_mean": 0.0852907095104456, "clip_ratio/low_min": 0.0852907095104456, "clip_ratio/region_mean": 0.19222909398376942, "completions/clipped_ratio": 0.0, "completions/max_length": 117.0, "completions/max_terminated_length": 117.0, "completions/mean_length": 90.125, "completions/mean_terminated_length": 90.125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 3.0091913044452667, "epoch": 0.0032823602100710537, "frac_reward_zero_std": 0.0, "grad_norm": 9.771239280700684, "learning_rate": 9.745454545454547e-06, "loss": -0.0541, "num_tokens": 175025.0, "reward": 0.6992344260215759, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6992344260215759, "reward_meter_std": 0.35877659916877747, "reward_std": 0.3587765693664551, "reward_total_composite_mean": 0.6992344260215759, "reward_total_composite_std": 0.35877659916877747, "reward_total_mean": 0.6992344260215759, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6992344260215759, "rewards/meter/std": 0.35877659916877747, "rewards/total_composite/mean": 0.6992344260215759, "rewards/total_composite/std": 0.35877659916877747, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0352109670639038, "sampling/importance_sampling_ratio/min": 0.15173391997814178, "sampling/sampling_logp_difference/max": 1.8856267929077148, "sampling/sampling_logp_difference/mean": 0.22157631814479828, "step": 85 }, { "clip_ratio/high_max": 0.05019771121442318, "clip_ratio/high_mean": 0.05019771121442318, "clip_ratio/low_mean": 0.13297666609287262, "clip_ratio/low_min": 0.13297666609287262, "clip_ratio/region_mean": 0.1831743773072958, "completions/clipped_ratio": 0.0, "completions/max_length": 254.0, "completions/max_terminated_length": 254.0, "completions/mean_length": 230.5, "completions/mean_terminated_length": 230.5, "completions/min_length": 198.0, "completions/min_terminated_length": 198.0, "entropy": 2.359074369072914, "epoch": 0.0033209762125424778, "frac_reward_zero_std": 0.0, "grad_norm": 6.172459125518799, "learning_rate": 9.742424242424244e-06, "loss": 0.0244, "num_tokens": 178525.0, "reward": 0.2985811233520508, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9821428656578064, "reward_count_adherence_std": 0.05050762742757797, "reward_meter_mean": 0.2989215552806854, "reward_meter_std": 0.2961769700050354, "reward_std": 0.29654595255851746, "reward_total_composite_mean": 0.2985811233520508, "reward_total_composite_std": 0.29654595255851746, "reward_total_mean": 0.2985811233520508, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9821428656578064, "rewards/count_adherence/std": 0.05050762742757797, "rewards/meter/mean": 0.2989215552806854, "rewards/meter/std": 0.2961769700050354, "rewards/total_composite/mean": 0.2985811233520508, "rewards/total_composite/std": 0.29654595255851746, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0293720960617065, "sampling/importance_sampling_ratio/min": 0.09872201830148697, "sampling/sampling_logp_difference/max": 2.3154473304748535, "sampling/sampling_logp_difference/mean": 0.20698504149913788, "step": 86 }, { "clip_ratio/high_max": 0.09015538915991783, "clip_ratio/high_mean": 0.09015538915991783, "clip_ratio/low_mean": 0.07651033625006676, "clip_ratio/low_min": 0.07651033625006676, "clip_ratio/region_mean": 0.1666657254099846, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 45.5, "completions/mean_terminated_length": 45.5, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 1.9420476108789444, "epoch": 0.003359592215013902, "frac_reward_zero_std": 0.0, "grad_norm": 16.136564254760742, "learning_rate": 9.739393939393941e-06, "loss": 0.049, "num_tokens": 180121.0, "reward": 0.5413487553596497, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5413487553596497, "reward_meter_std": 0.41876327991485596, "reward_std": 0.41876330971717834, "reward_total_composite_mean": 0.5413487553596497, "reward_total_composite_std": 0.41876327991485596, "reward_total_mean": 0.5413487553596497, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5413487553596497, "rewards/meter/std": 0.41876327991485596, "rewards/total_composite/mean": 0.5413487553596497, "rewards/total_composite/std": 0.41876327991485596, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0214216709136963, "sampling/importance_sampling_ratio/min": 0.1677062213420868, "sampling/sampling_logp_difference/max": 1.7855415344238281, "sampling/sampling_logp_difference/mean": 0.20200753211975098, "step": 87 }, { "clip_ratio/high_max": 0.09816804714500904, "clip_ratio/high_mean": 0.09816804714500904, "clip_ratio/low_mean": 0.0701658520847559, "clip_ratio/low_min": 0.0701658520847559, "clip_ratio/region_mean": 0.16833389922976494, "completions/clipped_ratio": 0.0, "completions/max_length": 196.0, "completions/max_terminated_length": 196.0, "completions/mean_length": 171.75, "completions/mean_terminated_length": 171.75, "completions/min_length": 156.0, "completions/min_terminated_length": 156.0, "entropy": 1.721228078007698, "epoch": 0.003398208217485326, "frac_reward_zero_std": 0.0, "grad_norm": 7.712515830993652, "learning_rate": 9.736363636363637e-06, "loss": 0.0501, "num_tokens": 183183.0, "reward": 0.773547887802124, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_meter_mean": 0.8209783434867859, "reward_meter_std": 0.20396688580513, "reward_std": 0.18800680339336395, "reward_total_composite_mean": 0.773547887802124, "reward_total_composite_std": 0.18800683319568634, "reward_total_mean": 0.773547887802124, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/meter/mean": 0.8209783434867859, "rewards/meter/std": 0.20396688580513, "rewards/total_composite/mean": 0.773547887802124, "rewards/total_composite/std": 0.18800683319568634, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0262449979782104, "sampling/importance_sampling_ratio/min": 0.23252680897712708, "sampling/sampling_logp_difference/max": 1.458749771118164, "sampling/sampling_logp_difference/mean": 0.17306587100028992, "step": 88 }, { "clip_ratio/high_max": 0.12146328948438168, "clip_ratio/high_mean": 0.12146328948438168, "clip_ratio/low_mean": 0.07750886678695679, "clip_ratio/low_min": 0.07750886678695679, "clip_ratio/region_mean": 0.19897215627133846, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 88.625, "completions/mean_terminated_length": 88.625, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 2.467219904065132, "epoch": 0.00343682421995675, "frac_reward_zero_std": 0.0, "grad_norm": 11.22130298614502, "learning_rate": 9.733333333333334e-06, "loss": 0.0546, "num_tokens": 185260.0, "reward": 0.6381306648254395, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6381306648254395, "reward_meter_std": 0.44584599137306213, "reward_std": 0.44584596157073975, "reward_total_composite_mean": 0.6381306648254395, "reward_total_composite_std": 0.44584599137306213, "reward_total_mean": 0.6381306648254395, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6381306648254395, "rewards/meter/std": 0.44584599137306213, "rewards/total_composite/mean": 0.6381306648254395, "rewards/total_composite/std": 0.44584599137306213, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0421054363250732, "sampling/importance_sampling_ratio/min": 0.10935594886541367, "sampling/sampling_logp_difference/max": 2.2131471633911133, "sampling/sampling_logp_difference/mean": 0.19463911652565002, "step": 89 }, { "clip_ratio/high_max": 0.1579482052475214, "clip_ratio/high_mean": 0.1579482052475214, "clip_ratio/low_mean": 0.05007575824856758, "clip_ratio/low_min": 0.05007575824856758, "clip_ratio/region_mean": 0.20802396349608898, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 66.5, "completions/mean_terminated_length": 66.5, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 2.0693052262067795, "epoch": 0.003475440222428174, "frac_reward_zero_std": 0.0, "grad_norm": 12.855581283569336, "learning_rate": 9.730303030303031e-06, "loss": 0.0647, "num_tokens": 187088.0, "reward": 0.7145688533782959, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7145688533782959, "reward_meter_std": 0.3503323197364807, "reward_std": 0.3503322899341583, "reward_total_composite_mean": 0.7145688533782959, "reward_total_composite_std": 0.3503323197364807, "reward_total_mean": 0.7145688533782959, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7145688533782959, "rewards/meter/std": 0.3503323197364807, "rewards/total_composite/mean": 0.7145688533782959, "rewards/total_composite/std": 0.3503323197364807, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0224878787994385, "sampling/importance_sampling_ratio/min": 0.2688736319541931, "sampling/sampling_logp_difference/max": 1.3135137557983398, "sampling/sampling_logp_difference/mean": 0.18930701911449432, "step": 90 }, { "clip_ratio/high_max": 0.12906558997929096, "clip_ratio/high_mean": 0.12906558997929096, "clip_ratio/low_mean": 0.06466159597039223, "clip_ratio/low_min": 0.06466159597039223, "clip_ratio/region_mean": 0.1937271859496832, "completions/clipped_ratio": 0.0, "completions/max_length": 231.0, "completions/max_terminated_length": 231.0, "completions/mean_length": 192.125, "completions/mean_terminated_length": 192.125, "completions/min_length": 116.0, "completions/min_terminated_length": 116.0, "entropy": 3.0097380578517914, "epoch": 0.0035140562248995983, "frac_reward_zero_std": 0.0, "grad_norm": 6.48668909072876, "learning_rate": 9.727272727272728e-06, "loss": 0.1231, "num_tokens": 190233.0, "reward": 0.6788178086280823, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.9338054656982422, "reward_meter_std": 0.08479016274213791, "reward_std": 0.43503525853157043, "reward_total_composite_mean": 0.6788178086280823, "reward_total_composite_std": 0.43503525853157043, "reward_total_mean": 0.6788178086280823, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.9338054656982422, "rewards/meter/std": 0.08479016274213791, "rewards/total_composite/mean": 0.6788178086280823, "rewards/total_composite/std": 0.43503525853157043, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0515210628509521, "sampling/importance_sampling_ratio/min": 0.22454887628555298, "sampling/sampling_logp_difference/max": 1.493661880493164, "sampling/sampling_logp_difference/mean": 0.21253235638141632, "step": 91 }, { "clip_ratio/high_max": 0.11539113149046898, "clip_ratio/high_mean": 0.11539113149046898, "clip_ratio/low_mean": 0.13832124322652817, "clip_ratio/low_min": 0.13832124322652817, "clip_ratio/region_mean": 0.25371237471699715, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 54.125, "completions/mean_terminated_length": 54.125, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 1.927680492401123, "epoch": 0.0035526722273710224, "frac_reward_zero_std": 0.0, "grad_norm": 15.7993745803833, "learning_rate": 9.724242424242426e-06, "loss": -0.0808, "num_tokens": 191874.0, "reward": 0.532722532749176, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5675693154335022, "reward_meter_std": 0.4166634678840637, "reward_std": 0.4542304277420044, "reward_total_composite_mean": 0.532722532749176, "reward_total_composite_std": 0.4542304575443268, "reward_total_mean": 0.532722532749176, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5675693154335022, "rewards/meter/std": 0.4166634678840637, "rewards/total_composite/mean": 0.532722532749176, "rewards/total_composite/std": 0.4542304575443268, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.004146695137024, "sampling/importance_sampling_ratio/min": 0.18035022914409637, "sampling/sampling_logp_difference/max": 1.7128546237945557, "sampling/sampling_logp_difference/mean": 0.22817404568195343, "step": 92 }, { "clip_ratio/high_max": 0.06774244643747807, "clip_ratio/high_mean": 0.06774244643747807, "clip_ratio/low_mean": 0.10987469553947449, "clip_ratio/low_min": 0.10987469553947449, "clip_ratio/region_mean": 0.17761714197695255, "completions/clipped_ratio": 0.0, "completions/max_length": 310.0, "completions/max_terminated_length": 310.0, "completions/mean_length": 286.125, "completions/mean_terminated_length": 286.125, "completions/min_length": 259.0, "completions/min_terminated_length": 259.0, "entropy": 2.5551420152187347, "epoch": 0.0035912882298424465, "frac_reward_zero_std": 0.0, "grad_norm": 5.356238842010498, "learning_rate": 9.721212121212123e-06, "loss": 0.0068, "num_tokens": 196019.0, "reward": 0.3027617931365967, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.921875, "reward_count_adherence_std": 0.06469365209341049, "reward_meter_mean": 0.42547568678855896, "reward_meter_std": 0.28940528631210327, "reward_std": 0.2622292637825012, "reward_total_composite_mean": 0.3027617931365967, "reward_total_composite_std": 0.2622292935848236, "reward_total_mean": 0.3027617931365967, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.921875, "rewards/count_adherence/std": 0.06469365209341049, "rewards/meter/mean": 0.42547568678855896, "rewards/meter/std": 0.28940528631210327, "rewards/total_composite/mean": 0.3027617931365967, "rewards/total_composite/std": 0.2622292935848236, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0348670482635498, "sampling/importance_sampling_ratio/min": 0.17745541036128998, "sampling/sampling_logp_difference/max": 1.7290358543395996, "sampling/sampling_logp_difference/mean": 0.19459845125675201, "step": 93 }, { "clip_ratio/high_max": 0.14526595920324326, "clip_ratio/high_mean": 0.14526595920324326, "clip_ratio/low_mean": 0.049512987956404686, "clip_ratio/low_min": 0.049512987956404686, "clip_ratio/region_mean": 0.19477894715964794, "completions/clipped_ratio": 0.0, "completions/max_length": 123.0, "completions/max_terminated_length": 123.0, "completions/mean_length": 98.625, "completions/mean_terminated_length": 98.625, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 2.608750492334366, "epoch": 0.003629904232313871, "frac_reward_zero_std": 0.0, "grad_norm": 11.193428993225098, "learning_rate": 9.718181818181818e-06, "loss": -0.1159, "num_tokens": 198136.0, "reward": 0.6645107269287109, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8099383115768433, "reward_meter_std": 0.26826685667037964, "reward_std": 0.4238337576389313, "reward_total_composite_mean": 0.6645107269287109, "reward_total_composite_std": 0.4238337576389313, "reward_total_mean": 0.6645107269287109, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8099383115768433, "rewards/meter/std": 0.26826685667037964, "rewards/total_composite/mean": 0.6645107269287109, "rewards/total_composite/std": 0.4238337576389313, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0548158884048462, "sampling/importance_sampling_ratio/min": 0.1488121896982193, "sampling/sampling_logp_difference/max": 1.9050703048706055, "sampling/sampling_logp_difference/mean": 0.22230523824691772, "step": 94 }, { "clip_ratio/high_max": 0.047514619305729866, "clip_ratio/high_mean": 0.047514619305729866, "clip_ratio/low_mean": 0.02777777798473835, "clip_ratio/low_min": 0.02777777798473835, "clip_ratio/region_mean": 0.07529239729046822, "completions/clipped_ratio": 0.0, "completions/max_length": 27.0, "completions/max_terminated_length": 27.0, "completions/mean_length": 19.25, "completions/mean_terminated_length": 19.25, "completions/min_length": 18.0, "completions/min_terminated_length": 18.0, "entropy": 0.30344432033598423, "epoch": 0.003668520234785295, "frac_reward_zero_std": 0.0, "grad_norm": 55.388946533203125, "learning_rate": 9.715151515151516e-06, "loss": 0.1865, "num_tokens": 199458.0, "reward": 0.9113181829452515, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9113181829452515, "reward_meter_std": 0.23739001154899597, "reward_std": 0.23739001154899597, "reward_total_composite_mean": 0.9113181829452515, "reward_total_composite_std": 0.23739001154899597, "reward_total_mean": 0.9113181829452515, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9113181829452515, "rewards/meter/std": 0.23739001154899597, "rewards/total_composite/mean": 0.9113181829452515, "rewards/total_composite/std": 0.23739001154899597, "sampling/importance_sampling_ratio/max": 1.5570424795150757, "sampling/importance_sampling_ratio/mean": 0.9945163726806641, "sampling/importance_sampling_ratio/min": 0.36467787623405457, "sampling/sampling_logp_difference/max": 1.0087409019470215, "sampling/sampling_logp_difference/mean": 0.08319995552301407, "step": 95 }, { "clip_ratio/high_max": 0.12667790986597538, "clip_ratio/high_mean": 0.12667790986597538, "clip_ratio/low_mean": 0.07653119787573814, "clip_ratio/low_min": 0.07653119787573814, "clip_ratio/region_mean": 0.20320910774171352, "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 94.5, "completions/mean_terminated_length": 94.5, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 3.304069072008133, "epoch": 0.0037071362372567192, "frac_reward_zero_std": 0.0, "grad_norm": 11.280510902404785, "learning_rate": 9.712121212121213e-06, "loss": 0.1775, "num_tokens": 201486.0, "reward": 0.6954616904258728, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6954616904258728, "reward_meter_std": 0.28914839029312134, "reward_std": 0.28914836049079895, "reward_total_composite_mean": 0.6954616904258728, "reward_total_composite_std": 0.28914839029312134, "reward_total_mean": 0.6954616904258728, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6954616904258728, "rewards/meter/std": 0.28914839029312134, "rewards/total_composite/mean": 0.6954616904258728, "rewards/total_composite/std": 0.28914839029312134, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.037481665611267, "sampling/importance_sampling_ratio/min": 0.13818837702274323, "sampling/sampling_logp_difference/max": 1.9791374206542969, "sampling/sampling_logp_difference/mean": 0.2430281937122345, "step": 96 }, { "clip_ratio/high_max": 0.11797327920794487, "clip_ratio/high_mean": 0.11797327920794487, "clip_ratio/low_mean": 0.10330966301262379, "clip_ratio/low_min": 0.10330966301262379, "clip_ratio/region_mean": 0.22128294222056866, "completions/clipped_ratio": 0.0, "completions/max_length": 92.0, "completions/max_terminated_length": 92.0, "completions/mean_length": 77.75, "completions/mean_terminated_length": 77.75, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 2.470811814069748, "epoch": 0.0037457522397281433, "frac_reward_zero_std": 0.0, "grad_norm": 11.798491477966309, "learning_rate": 9.70909090909091e-06, "loss": 0.046, "num_tokens": 203468.0, "reward": 0.44233888387680054, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.44233888387680054, "reward_meter_std": 0.3354645371437073, "reward_std": 0.3354645073413849, "reward_total_composite_mean": 0.44233888387680054, "reward_total_composite_std": 0.3354645371437073, "reward_total_mean": 0.44233888387680054, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.44233888387680054, "rewards/meter/std": 0.3354645371437073, "rewards/total_composite/mean": 0.44233888387680054, "rewards/total_composite/std": 0.3354645371437073, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0586459636688232, "sampling/importance_sampling_ratio/min": 0.20629987120628357, "sampling/sampling_logp_difference/max": 1.5784244537353516, "sampling/sampling_logp_difference/mean": 0.23818424344062805, "step": 97 }, { "clip_ratio/high_max": 0.08083950355648994, "clip_ratio/high_mean": 0.08083950355648994, "clip_ratio/low_mean": 0.12072680331766605, "clip_ratio/low_min": 0.12072680331766605, "clip_ratio/region_mean": 0.201566306874156, "completions/clipped_ratio": 0.0, "completions/max_length": 91.0, "completions/max_terminated_length": 91.0, "completions/mean_length": 79.5, "completions/mean_terminated_length": 79.5, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 2.8207843005657196, "epoch": 0.0037843682421995675, "frac_reward_zero_std": 0.0, "grad_norm": 10.285151481628418, "learning_rate": 9.706060606060606e-06, "loss": -0.0341, "num_tokens": 205368.0, "reward": 0.364272803068161, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_meter_mean": 0.458587646484375, "reward_meter_std": 0.4029514789581299, "reward_std": 0.41265976428985596, "reward_total_composite_mean": 0.364272803068161, "reward_total_composite_std": 0.41265976428985596, "reward_total_mean": 0.364272803068161, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/meter/mean": 0.458587646484375, "rewards/meter/std": 0.4029514789581299, "rewards/total_composite/mean": 0.364272803068161, "rewards/total_composite/std": 0.41265976428985596, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0597635507583618, "sampling/importance_sampling_ratio/min": 0.22730112075805664, "sampling/sampling_logp_difference/max": 1.4814796447753906, "sampling/sampling_logp_difference/mean": 0.22706757485866547, "step": 98 }, { "clip_ratio/high_max": 0.06744235754013062, "clip_ratio/high_mean": 0.06744235754013062, "clip_ratio/low_mean": 0.062378629110753536, "clip_ratio/low_min": 0.062378629110753536, "clip_ratio/region_mean": 0.12982098665088415, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 89.125, "completions/mean_terminated_length": 89.125, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "entropy": 1.236207775771618, "epoch": 0.0038229842446709916, "frac_reward_zero_std": 0.0, "grad_norm": 11.669129371643066, "learning_rate": 9.703030303030305e-06, "loss": 0.0857, "num_tokens": 207481.0, "reward": 0.796177864074707, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.796177864074707, "reward_meter_std": 0.30666306614875793, "reward_std": 0.30666306614875793, "reward_total_composite_mean": 0.796177864074707, "reward_total_composite_std": 0.30666306614875793, "reward_total_mean": 0.796177864074707, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.796177864074707, "rewards/meter/std": 0.30666306614875793, "rewards/total_composite/mean": 0.796177864074707, "rewards/total_composite/std": 0.30666306614875793, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0176408290863037, "sampling/importance_sampling_ratio/min": 0.21204693615436554, "sampling/sampling_logp_difference/max": 1.550947666168213, "sampling/sampling_logp_difference/mean": 0.16059812903404236, "step": 99 }, { "clip_ratio/high_max": 0.10258511640131474, "clip_ratio/high_mean": 0.10258511640131474, "clip_ratio/low_mean": 0.0948890820145607, "clip_ratio/low_min": 0.0948890820145607, "clip_ratio/region_mean": 0.19747419841587543, "completions/clipped_ratio": 0.0, "completions/max_length": 56.0, "completions/max_terminated_length": 56.0, "completions/mean_length": 51.125, "completions/mean_terminated_length": 51.125, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 2.0875614881515503, "epoch": 0.0038616002471424157, "frac_reward_zero_std": 0.0, "grad_norm": 16.21261978149414, "learning_rate": 9.7e-06, "loss": 0.0274, "num_tokens": 209138.0, "reward": 0.4757336378097534, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4757336378097534, "reward_meter_std": 0.39768749475479126, "reward_std": 0.39768749475479126, "reward_total_composite_mean": 0.4757336378097534, "reward_total_composite_std": 0.39768749475479126, "reward_total_mean": 0.4757336378097534, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4757336378097534, "rewards/meter/std": 0.39768749475479126, "rewards/total_composite/mean": 0.4757336378097534, "rewards/total_composite/std": 0.39768749475479126, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.024910569190979, "sampling/importance_sampling_ratio/min": 0.2545141875743866, "sampling/sampling_logp_difference/max": 1.368398666381836, "sampling/sampling_logp_difference/mean": 0.2088787704706192, "step": 100 }, { "epoch": 0.0038616002471424157, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.038461538461538464, "eval_completions/max_length": 412.9230769230769, "eval_completions/max_terminated_length": 374.53846153846155, "eval_completions/mean_length": 189.1153846153846, "eval_completions/mean_terminated_length": 176.4835181603065, "eval_completions/min_length": 39.15384615384615, "eval_completions/min_terminated_length": 39.15384615384615, "eval_entropy": 2.585876281444843, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 209138.0, "eval_reward": 0.36039777329334843, "eval_reward_arabic_clean_mean": 0.9519230769230769, "eval_reward_arabic_clean_std": 0.13598207097787124, "eval_reward_count_adherence_mean": 0.9531642427811255, "eval_reward_count_adherence_std": 0.06681363327571979, "eval_reward_meter_mean": 0.38446200467073, "eval_reward_meter_std": 0.3474533214018895, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.36039777329334843, "eval_reward_total_composite_std": 0.34838862602527326, "eval_reward_total_mean": 0.36039777329334843, "eval_rewards/arabic_clean/mean": 0.9519230769230769, "eval_rewards/arabic_clean/std": 0.13598207097787124, "eval_rewards/count_adherence/mean": 0.9531642427811255, "eval_rewards/count_adherence/std": 0.06681363327571979, "eval_rewards/meter/mean": 0.38446200467073, "eval_rewards/meter/std": 0.3474533214018895, "eval_rewards/total_composite/mean": 0.36039777329334843, "eval_rewards/total_composite/std": 0.34838862602527326, "eval_runtime": 76.843, "eval_samples_per_second": 1.353, "eval_sampling/importance_sampling_ratio/max": 1.6659116469896758, "eval_sampling/importance_sampling_ratio/mean": 1.043038276525644, "eval_sampling/importance_sampling_ratio/min": 0.2675319703725668, "eval_sampling/sampling_logp_difference/max": 1.3432146219106822, "eval_sampling/sampling_logp_difference/mean": 0.1495220626776035, "eval_steps_per_second": 0.169, "step": 100 }, { "clip_ratio/high_max": 0.06029390636831522, "clip_ratio/high_mean": 0.06029390636831522, "clip_ratio/low_mean": 0.10309341456741095, "clip_ratio/low_min": 0.10309341456741095, "clip_ratio/region_mean": 0.16338732093572617, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 64.875, "completions/mean_terminated_length": 64.875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.11554679274559, "epoch": 0.0039002162496138398, "frac_reward_zero_std": 0.0, "grad_norm": 13.529213905334473, "learning_rate": 9.696969696969698e-06, "loss": -0.0129, "num_tokens": 210953.0, "reward": 0.3698737621307373, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_meter_mean": 0.40993648767471313, "reward_meter_std": 0.29322153329849243, "reward_std": 0.26750627160072327, "reward_total_composite_mean": 0.3698737621307373, "reward_total_composite_std": 0.26750627160072327, "reward_total_mean": 0.3698737621307373, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/meter/mean": 0.40993648767471313, "rewards/meter/std": 0.29322153329849243, "rewards/total_composite/mean": 0.3698737621307373, "rewards/total_composite/std": 0.26750627160072327, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0172652006149292, "sampling/importance_sampling_ratio/min": 0.2798984944820404, "sampling/sampling_logp_difference/max": 1.2733283042907715, "sampling/sampling_logp_difference/mean": 0.203210711479187, "step": 101 }, { "clip_ratio/high_max": 0.10505400598049164, "clip_ratio/high_mean": 0.10505400598049164, "clip_ratio/low_mean": 0.09572393447160721, "clip_ratio/low_min": 0.09572393447160721, "clip_ratio/region_mean": 0.20077794045209885, "completions/clipped_ratio": 0.0, "completions/max_length": 139.0, "completions/max_terminated_length": 139.0, "completions/mean_length": 109.125, "completions/mean_terminated_length": 109.125, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 2.91497141122818, "epoch": 0.003938832252085264, "frac_reward_zero_std": 0.0, "grad_norm": 9.461191177368164, "learning_rate": 9.693939393939395e-06, "loss": -0.0229, "num_tokens": 213210.0, "reward": 0.3811372220516205, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5020676851272583, "reward_meter_std": 0.33497413992881775, "reward_std": 0.3171204626560211, "reward_total_composite_mean": 0.3811372220516205, "reward_total_composite_std": 0.3171204626560211, "reward_total_mean": 0.3811372220516205, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5020676851272583, "rewards/meter/std": 0.33497413992881775, "rewards/total_composite/mean": 0.3811372220516205, "rewards/total_composite/std": 0.3171204626560211, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0544703006744385, "sampling/importance_sampling_ratio/min": 0.2506718039512634, "sampling/sampling_logp_difference/max": 1.383610725402832, "sampling/sampling_logp_difference/mean": 0.2128397673368454, "step": 102 }, { "clip_ratio/high_max": 0.08475394546985626, "clip_ratio/high_mean": 0.08475394546985626, "clip_ratio/low_mean": 0.10796530079096556, "clip_ratio/low_min": 0.10796530079096556, "clip_ratio/region_mean": 0.19271924626082182, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 51.75, "completions/mean_terminated_length": 51.75, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 2.3894866704940796, "epoch": 0.003977448254556688, "frac_reward_zero_std": 0.0, "grad_norm": 13.193228721618652, "learning_rate": 9.690909090909092e-06, "loss": 0.0772, "num_tokens": 215040.0, "reward": 0.48240411281585693, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.48240411281585693, "reward_meter_std": 0.4074939489364624, "reward_std": 0.4074939489364624, "reward_total_composite_mean": 0.48240411281585693, "reward_total_composite_std": 0.4074939489364624, "reward_total_mean": 0.48240411281585693, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.48240411281585693, "rewards/meter/std": 0.4074939489364624, "rewards/total_composite/mean": 0.48240411281585693, "rewards/total_composite/std": 0.4074939489364624, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0494117736816406, "sampling/importance_sampling_ratio/min": 0.19952771067619324, "sampling/sampling_logp_difference/max": 1.611802101135254, "sampling/sampling_logp_difference/mean": 0.217100128531456, "step": 103 }, { "clip_ratio/high_max": 0.1372815314680338, "clip_ratio/high_mean": 0.1372815314680338, "clip_ratio/low_mean": 0.07232538796961308, "clip_ratio/low_min": 0.07232538796961308, "clip_ratio/region_mean": 0.20960691943764687, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 46.5, "completions/mean_terminated_length": 46.5, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 2.75657719373703, "epoch": 0.004016064257028112, "frac_reward_zero_std": 0.0, "grad_norm": 14.126129150390625, "learning_rate": 9.687878787878788e-06, "loss": -0.0086, "num_tokens": 216684.0, "reward": 0.6793533563613892, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6793533563613892, "reward_meter_std": 0.37877920269966125, "reward_std": 0.37877923250198364, "reward_total_composite_mean": 0.6793533563613892, "reward_total_composite_std": 0.37877920269966125, "reward_total_mean": 0.6793533563613892, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6793533563613892, "rewards/meter/std": 0.37877920269966125, "rewards/total_composite/mean": 0.6793533563613892, "rewards/total_composite/std": 0.37877920269966125, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0407179594039917, "sampling/importance_sampling_ratio/min": 0.22745074331760406, "sampling/sampling_logp_difference/max": 1.4808216094970703, "sampling/sampling_logp_difference/mean": 0.22054526209831238, "step": 104 }, { "clip_ratio/high_max": 0.06583333387970924, "clip_ratio/high_mean": 0.06583333387970924, "clip_ratio/low_mean": 0.144812298938632, "clip_ratio/low_min": 0.144812298938632, "clip_ratio/region_mean": 0.21064563281834126, "completions/clipped_ratio": 0.0, "completions/max_length": 51.0, "completions/max_terminated_length": 51.0, "completions/mean_length": 44.125, "completions/mean_terminated_length": 44.125, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 1.7920314818620682, "epoch": 0.004054680259499536, "frac_reward_zero_std": 0.0, "grad_norm": 16.32758140563965, "learning_rate": 9.684848484848487e-06, "loss": 0.0212, "num_tokens": 218277.0, "reward": 0.4026336967945099, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4026336967945099, "reward_meter_std": 0.35716599225997925, "reward_std": 0.35716599225997925, "reward_total_composite_mean": 0.4026336967945099, "reward_total_composite_std": 0.35716599225997925, "reward_total_mean": 0.4026336967945099, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4026336967945099, "rewards/meter/std": 0.35716599225997925, "rewards/total_composite/mean": 0.4026336967945099, "rewards/total_composite/std": 0.35716599225997925, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0534363985061646, "sampling/importance_sampling_ratio/min": 0.2275705188512802, "sampling/sampling_logp_difference/max": 1.480295181274414, "sampling/sampling_logp_difference/mean": 0.16692768037319183, "step": 105 }, { "clip_ratio/high_max": 0.10586144216358662, "clip_ratio/high_mean": 0.10586144216358662, "clip_ratio/low_mean": 0.13967670314013958, "clip_ratio/low_min": 0.13967670314013958, "clip_ratio/region_mean": 0.2455381453037262, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 76.875, "completions/mean_terminated_length": 76.875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 3.015815883874893, "epoch": 0.004093296261970961, "frac_reward_zero_std": 0.0, "grad_norm": 13.200583457946777, "learning_rate": 9.681818181818182e-06, "loss": -0.0234, "num_tokens": 220292.0, "reward": 0.3593082129955292, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.3820000886917114, "reward_meter_std": 0.3840147852897644, "reward_std": 0.3966972529888153, "reward_total_composite_mean": 0.3593082129955292, "reward_total_composite_std": 0.3966972827911377, "reward_total_mean": 0.3593082129955292, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.3820000886917114, "rewards/meter/std": 0.3840147852897644, "rewards/total_composite/mean": 0.3593082129955292, "rewards/total_composite/std": 0.3966972827911377, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0527663230895996, "sampling/importance_sampling_ratio/min": 0.21993055939674377, "sampling/sampling_logp_difference/max": 1.5144433975219727, "sampling/sampling_logp_difference/mean": 0.24001426994800568, "step": 106 }, { "clip_ratio/high_max": 0.1405453272163868, "clip_ratio/high_mean": 0.1405453272163868, "clip_ratio/low_mean": 0.06378891877830029, "clip_ratio/low_min": 0.06378891877830029, "clip_ratio/region_mean": 0.20433424599468708, "completions/clipped_ratio": 0.0, "completions/max_length": 355.0, "completions/max_terminated_length": 355.0, "completions/mean_length": 270.875, "completions/mean_terminated_length": 270.875, "completions/min_length": 164.0, "completions/min_terminated_length": 164.0, "entropy": 3.4069304764270782, "epoch": 0.004131912264442385, "frac_reward_zero_std": 0.0, "grad_norm": 5.8178300857543945, "learning_rate": 9.67878787878788e-06, "loss": 0.0184, "num_tokens": 223987.0, "reward": 0.5568721294403076, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_meter_mean": 0.6609253883361816, "reward_meter_std": 0.2803538143634796, "reward_std": 0.3528820872306824, "reward_total_composite_mean": 0.5568721294403076, "reward_total_composite_std": 0.3528820872306824, "reward_total_mean": 0.5568721294403076, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/meter/mean": 0.6609253883361816, "rewards/meter/std": 0.2803538143634796, "rewards/total_composite/mean": 0.5568721294403076, "rewards/total_composite/std": 0.3528820872306824, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0432038307189941, "sampling/importance_sampling_ratio/min": 0.2048678696155548, "sampling/sampling_logp_difference/max": 1.5853900909423828, "sampling/sampling_logp_difference/mean": 0.22177748382091522, "step": 107 }, { "clip_ratio/high_max": 0.10650285705924034, "clip_ratio/high_mean": 0.10650285705924034, "clip_ratio/low_mean": 0.08765609562397003, "clip_ratio/low_min": 0.08765609562397003, "clip_ratio/region_mean": 0.19415895268321037, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 49.375, "completions/mean_terminated_length": 49.375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 2.991265833377838, "epoch": 0.004170528266913809, "frac_reward_zero_std": 0.0, "grad_norm": 16.24658203125, "learning_rate": 9.675757575757577e-06, "loss": 0.0163, "num_tokens": 225574.0, "reward": 0.4669821858406067, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4785667061805725, "reward_meter_std": 0.40862172842025757, "reward_std": 0.4222123324871063, "reward_total_composite_mean": 0.4669821858406067, "reward_total_composite_std": 0.4222123324871063, "reward_total_mean": 0.4669821858406067, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4785667061805725, "rewards/meter/std": 0.40862172842025757, "rewards/total_composite/mean": 0.4669821858406067, "rewards/total_composite/std": 0.4222123324871063, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0536181926727295, "sampling/importance_sampling_ratio/min": 0.2530842125415802, "sampling/sampling_logp_difference/max": 1.374032974243164, "sampling/sampling_logp_difference/mean": 0.22205865383148193, "step": 108 }, { "clip_ratio/high_max": 0.09419741854071617, "clip_ratio/high_mean": 0.09419741854071617, "clip_ratio/low_mean": 0.07784751430153847, "clip_ratio/low_min": 0.07784751430153847, "clip_ratio/region_mean": 0.17204493284225464, "completions/clipped_ratio": 0.0, "completions/max_length": 137.0, "completions/max_terminated_length": 137.0, "completions/mean_length": 97.0, "completions/mean_terminated_length": 97.0, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 3.290193408727646, "epoch": 0.0042091442693852335, "frac_reward_zero_std": 0.0, "grad_norm": 10.769991874694824, "learning_rate": 9.672727272727274e-06, "loss": -0.0954, "num_tokens": 227646.0, "reward": 0.525036096572876, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.525036096572876, "reward_meter_std": 0.32685554027557373, "reward_std": 0.32685554027557373, "reward_total_composite_mean": 0.525036096572876, "reward_total_composite_std": 0.32685554027557373, "reward_total_mean": 0.525036096572876, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.525036096572876, "rewards/meter/std": 0.32685554027557373, "rewards/total_composite/mean": 0.525036096572876, "rewards/total_composite/std": 0.32685554027557373, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.024579405784607, "sampling/importance_sampling_ratio/min": 0.292019248008728, "sampling/sampling_logp_difference/max": 1.2309355735778809, "sampling/sampling_logp_difference/mean": 0.230497807264328, "step": 109 }, { "clip_ratio/high_max": 0.11844915337860584, "clip_ratio/high_mean": 0.11844915337860584, "clip_ratio/low_mean": 0.0400856789201498, "clip_ratio/low_min": 0.0400856789201498, "clip_ratio/region_mean": 0.15853483229875565, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 62.375, "completions/mean_terminated_length": 62.375, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 2.1576623022556305, "epoch": 0.004247760271856658, "frac_reward_zero_std": 0.0, "grad_norm": 13.498187065124512, "learning_rate": 9.66969696969697e-06, "loss": -0.0629, "num_tokens": 229401.0, "reward": 0.7822655439376831, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7822750210762024, "reward_meter_std": 0.3426264226436615, "reward_std": 0.3426511585712433, "reward_total_composite_mean": 0.7822655439376831, "reward_total_composite_std": 0.3426511585712433, "reward_total_mean": 0.7822655439376831, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7822750210762024, "rewards/meter/std": 0.3426264226436615, "rewards/total_composite/mean": 0.7822655439376831, "rewards/total_composite/std": 0.3426511585712433, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0487669706344604, "sampling/importance_sampling_ratio/min": 0.3012003004550934, "sampling/sampling_logp_difference/max": 1.3505010604858398, "sampling/sampling_logp_difference/mean": 0.20653371512889862, "step": 110 }, { "clip_ratio/high_max": 0.10812411084771156, "clip_ratio/high_mean": 0.10812411084771156, "clip_ratio/low_mean": 0.07732126116752625, "clip_ratio/low_min": 0.07732126116752625, "clip_ratio/region_mean": 0.1854453720152378, "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 112.625, "completions/mean_terminated_length": 112.625, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 2.363381966948509, "epoch": 0.004286376274328082, "frac_reward_zero_std": 0.0, "grad_norm": 9.501466751098633, "learning_rate": 9.666666666666667e-06, "loss": 0.0631, "num_tokens": 231622.0, "reward": 0.5836721062660217, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.6113415956497192, "reward_meter_std": 0.39460012316703796, "reward_std": 0.3801315128803253, "reward_total_composite_mean": 0.5836721062660217, "reward_total_composite_std": 0.3801315426826477, "reward_total_mean": 0.5836721062660217, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.6113415956497192, "rewards/meter/std": 0.39460012316703796, "rewards/total_composite/mean": 0.5836721062660217, "rewards/total_composite/std": 0.3801315426826477, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0375341176986694, "sampling/importance_sampling_ratio/min": 0.22895215451717377, "sampling/sampling_logp_difference/max": 1.4742422103881836, "sampling/sampling_logp_difference/mean": 0.1836644411087036, "step": 111 }, { "clip_ratio/high_max": 0.03674242552369833, "clip_ratio/high_mean": 0.03674242552369833, "clip_ratio/low_mean": 0.10191993555054069, "clip_ratio/low_min": 0.10191993555054069, "clip_ratio/region_mean": 0.13866236107423902, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 26.5, "completions/mean_terminated_length": 26.5, "completions/min_length": 18.0, "completions/min_terminated_length": 18.0, "entropy": 1.8556535243988037, "epoch": 0.004324992276799506, "frac_reward_zero_std": 0.0, "grad_norm": 21.516904830932617, "learning_rate": 9.663636363636364e-06, "loss": 0.1002, "num_tokens": 233106.0, "reward": 0.30022066831588745, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.30022066831588745, "reward_meter_std": 0.3768041133880615, "reward_std": 0.3768041133880615, "reward_total_composite_mean": 0.30022066831588745, "reward_total_composite_std": 0.3768041133880615, "reward_total_mean": 0.30022066831588745, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.30022066831588745, "rewards/meter/std": 0.3768041133880615, "rewards/total_composite/mean": 0.30022066831588745, "rewards/total_composite/std": 0.3768041133880615, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.041845679283142, "sampling/importance_sampling_ratio/min": 0.3161206543445587, "sampling/sampling_logp_difference/max": 1.1516313552856445, "sampling/sampling_logp_difference/mean": 0.20119836926460266, "step": 112 }, { "clip_ratio/high_max": 0.12023117486387491, "clip_ratio/high_mean": 0.12023117486387491, "clip_ratio/low_mean": 0.0982854887843132, "clip_ratio/low_min": 0.0982854887843132, "clip_ratio/region_mean": 0.21851666364818811, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 54.5, "completions/mean_terminated_length": 54.5, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 2.915360987186432, "epoch": 0.00436360827927093, "frac_reward_zero_std": 0.0, "grad_norm": 13.721908569335938, "learning_rate": 9.660606060606061e-06, "loss": -0.0059, "num_tokens": 234710.0, "reward": 0.543341875076294, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.543341875076294, "reward_meter_std": 0.3554902970790863, "reward_std": 0.3554903268814087, "reward_total_composite_mean": 0.543341875076294, "reward_total_composite_std": 0.3554902970790863, "reward_total_mean": 0.543341875076294, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.543341875076294, "rewards/meter/std": 0.3554902970790863, "rewards/total_composite/mean": 0.543341875076294, "rewards/total_composite/std": 0.3554902970790863, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0506563186645508, "sampling/importance_sampling_ratio/min": 0.3279053270816803, "sampling/sampling_logp_difference/max": 1.115030288696289, "sampling/sampling_logp_difference/mean": 0.22269107401371002, "step": 113 }, { "clip_ratio/high_max": 0.0366877019405365, "clip_ratio/high_mean": 0.0366877019405365, "clip_ratio/low_mean": 0.11057115998119116, "clip_ratio/low_min": 0.11057115998119116, "clip_ratio/region_mean": 0.14725886192172766, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 85.875, "completions/mean_terminated_length": 85.875, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 2.166059359908104, "epoch": 0.004402224281742354, "frac_reward_zero_std": 0.0, "grad_norm": 10.23147964477539, "learning_rate": 9.657575757575758e-06, "loss": -0.0029, "num_tokens": 236805.0, "reward": 0.21646319329738617, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.21813370287418365, "reward_meter_std": 0.3496148884296417, "reward_std": 0.35061758756637573, "reward_total_composite_mean": 0.21646319329738617, "reward_total_composite_std": 0.35061758756637573, "reward_total_mean": 0.21646319329738617, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.21813370287418365, "rewards/meter/std": 0.3496148884296417, "rewards/total_composite/mean": 0.21646319329738617, "rewards/total_composite/std": 0.35061758756637573, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0350022315979004, "sampling/importance_sampling_ratio/min": 0.295941025018692, "sampling/sampling_logp_difference/max": 1.217595100402832, "sampling/sampling_logp_difference/mean": 0.19407296180725098, "step": 114 }, { "clip_ratio/high_max": 0.08701479807496071, "clip_ratio/high_mean": 0.08701479807496071, "clip_ratio/low_mean": 0.11949973180890083, "clip_ratio/low_min": 0.11949973180890083, "clip_ratio/region_mean": 0.20651452988386154, "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 117.75, "completions/mean_terminated_length": 117.75, "completions/min_length": 98.0, "completions/min_terminated_length": 98.0, "entropy": 2.1785334795713425, "epoch": 0.004440840284213778, "frac_reward_zero_std": 0.0, "grad_norm": 9.909034729003906, "learning_rate": 9.654545454545456e-06, "loss": 0.0735, "num_tokens": 239099.0, "reward": 0.4193575978279114, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4193575978279114, "reward_meter_std": 0.3706149458885193, "reward_std": 0.3706149160861969, "reward_total_composite_mean": 0.4193575978279114, "reward_total_composite_std": 0.3706149458885193, "reward_total_mean": 0.4193575978279114, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4193575978279114, "rewards/meter/std": 0.3706149458885193, "rewards/total_composite/mean": 0.4193575978279114, "rewards/total_composite/std": 0.3706149458885193, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.024393916130066, "sampling/importance_sampling_ratio/min": 0.13901562988758087, "sampling/sampling_logp_difference/max": 1.9731688499450684, "sampling/sampling_logp_difference/mean": 0.21766838431358337, "step": 115 }, { "clip_ratio/high_max": 0.15062034130096436, "clip_ratio/high_mean": 0.15062034130096436, "clip_ratio/low_mean": 0.05248366016894579, "clip_ratio/low_min": 0.05248366016894579, "clip_ratio/region_mean": 0.20310400146991014, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 56.125, "completions/mean_terminated_length": 56.125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 2.4604494273662567, "epoch": 0.004479456286685202, "frac_reward_zero_std": 0.0, "grad_norm": 13.37387752532959, "learning_rate": 9.651515151515153e-06, "loss": 0.0996, "num_tokens": 240788.0, "reward": 0.6912834644317627, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6912834644317627, "reward_meter_std": 0.39879509806632996, "reward_std": 0.39879506826400757, "reward_total_composite_mean": 0.6912834644317627, "reward_total_composite_std": 0.39879509806632996, "reward_total_mean": 0.6912834644317627, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6912834644317627, "rewards/meter/std": 0.39879509806632996, "rewards/total_composite/mean": 0.6912834644317627, "rewards/total_composite/std": 0.39879509806632996, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0366685390472412, "sampling/importance_sampling_ratio/min": 0.216609388589859, "sampling/sampling_logp_difference/max": 1.529659628868103, "sampling/sampling_logp_difference/mean": 0.18541668355464935, "step": 116 }, { "clip_ratio/high_max": 0.0818505771458149, "clip_ratio/high_mean": 0.0818505771458149, "clip_ratio/low_mean": 0.15885628014802933, "clip_ratio/low_min": 0.15885628014802933, "clip_ratio/region_mean": 0.24070685729384422, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 24.875, "completions/mean_terminated_length": 24.875, "completions/min_length": 16.0, "completions/min_terminated_length": 16.0, "entropy": 2.409518927335739, "epoch": 0.004518072289156626, "frac_reward_zero_std": 0.0, "grad_norm": 22.580102920532227, "learning_rate": 9.648484848484849e-06, "loss": 0.1027, "num_tokens": 242291.0, "reward": 0.4115869998931885, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4409791827201843, "reward_meter_std": 0.46491894125938416, "reward_std": 0.48671311140060425, "reward_total_composite_mean": 0.4115869998931885, "reward_total_composite_std": 0.48671314120292664, "reward_total_mean": 0.4115869998931885, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4409791827201843, "rewards/meter/std": 0.46491894125938416, "rewards/total_composite/mean": 0.4115869998931885, "rewards/total_composite/std": 0.48671314120292664, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0259357690811157, "sampling/importance_sampling_ratio/min": 0.20900969207286835, "sampling/sampling_logp_difference/max": 1.5653746128082275, "sampling/sampling_logp_difference/mean": 0.2450607866048813, "step": 117 }, { "clip_ratio/high_max": 0.14602509513497353, "clip_ratio/high_mean": 0.14602509513497353, "clip_ratio/low_mean": 0.0561376241967082, "clip_ratio/low_min": 0.0561376241967082, "clip_ratio/region_mean": 0.20216271933168173, "completions/clipped_ratio": 0.0, "completions/max_length": 180.0, "completions/max_terminated_length": 180.0, "completions/mean_length": 159.5, "completions/mean_terminated_length": 159.5, "completions/min_length": 124.0, "completions/min_terminated_length": 124.0, "entropy": 2.5699357092380524, "epoch": 0.00455668829162805, "frac_reward_zero_std": 0.0, "grad_norm": 8.194822311401367, "learning_rate": 9.645454545454548e-06, "loss": 0.0803, "num_tokens": 244935.0, "reward": 0.6134665012359619, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.6182658672332764, "reward_meter_std": 0.35096442699432373, "reward_std": 0.3578221797943115, "reward_total_composite_mean": 0.6134665012359619, "reward_total_composite_std": 0.3578221797943115, "reward_total_mean": 0.6134665012359619, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.6182658672332764, "rewards/meter/std": 0.35096442699432373, "rewards/total_composite/mean": 0.6134665012359619, "rewards/total_composite/std": 0.3578221797943115, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.02511465549469, "sampling/importance_sampling_ratio/min": 0.1597553789615631, "sampling/sampling_logp_difference/max": 1.8341115713119507, "sampling/sampling_logp_difference/mean": 0.20374369621276855, "step": 118 }, { "clip_ratio/high_max": 0.18722888734191656, "clip_ratio/high_mean": 0.18722888734191656, "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.012500000186264515, "clip_ratio/region_mean": 0.19972888752818108, "completions/clipped_ratio": 0.0, "completions/max_length": 43.0, "completions/max_terminated_length": 43.0, "completions/mean_length": 29.125, "completions/mean_terminated_length": 29.125, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 2.4730520844459534, "epoch": 0.0045953042940994745, "frac_reward_zero_std": 0.0, "grad_norm": 15.294441223144531, "learning_rate": 9.642424242424243e-06, "loss": -0.0893, "num_tokens": 246392.0, "reward": 0.8526638150215149, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9771455526351929, "reward_meter_std": 0.02793486975133419, "reward_std": 0.3455761969089508, "reward_total_composite_mean": 0.8526638150215149, "reward_total_composite_std": 0.3455761969089508, "reward_total_mean": 0.8526638150215149, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9771455526351929, "rewards/meter/std": 0.02793486975133419, "rewards/total_composite/mean": 0.8526638150215149, "rewards/total_composite/std": 0.3455761969089508, "sampling/importance_sampling_ratio/max": 1.9315763711929321, "sampling/importance_sampling_ratio/mean": 1.0416526794433594, "sampling/importance_sampling_ratio/min": 0.13522395491600037, "sampling/sampling_logp_difference/max": 2.0008230209350586, "sampling/sampling_logp_difference/mean": 0.21847626566886902, "step": 119 }, { "clip_ratio/high_max": 0.0674145333468914, "clip_ratio/high_mean": 0.0674145333468914, "clip_ratio/low_mean": 0.16581876948475838, "clip_ratio/low_min": 0.16581876948475838, "clip_ratio/region_mean": 0.23323330283164978, "completions/clipped_ratio": 0.0, "completions/max_length": 112.0, "completions/max_terminated_length": 112.0, "completions/mean_length": 72.875, "completions/mean_terminated_length": 72.875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 2.9914455711841583, "epoch": 0.004633920296570899, "frac_reward_zero_std": 0.0, "grad_norm": 13.367688179016113, "learning_rate": 9.63939393939394e-06, "loss": 0.1424, "num_tokens": 248367.0, "reward": 0.30540409684181213, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3219662308692932, "reward_meter_std": 0.37545910477638245, "reward_std": 0.3886590600013733, "reward_total_composite_mean": 0.30540409684181213, "reward_total_composite_std": 0.3886590600013733, "reward_total_mean": 0.30540409684181213, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3219662308692932, "rewards/meter/std": 0.37545910477638245, "rewards/total_composite/mean": 0.30540409684181213, "rewards/total_composite/std": 0.3886590600013733, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0693588256835938, "sampling/importance_sampling_ratio/min": 0.1549416035413742, "sampling/sampling_logp_difference/max": 1.8647069931030273, "sampling/sampling_logp_difference/mean": 0.23424479365348816, "step": 120 }, { "clip_ratio/high_max": 0.11291690729558468, "clip_ratio/high_mean": 0.11291690729558468, "clip_ratio/low_mean": 0.07312539592385292, "clip_ratio/low_min": 0.07312539592385292, "clip_ratio/region_mean": 0.1860423032194376, "completions/clipped_ratio": 0.0, "completions/max_length": 174.0, "completions/max_terminated_length": 174.0, "completions/mean_length": 164.5, "completions/mean_terminated_length": 164.5, "completions/min_length": 157.0, "completions/min_terminated_length": 157.0, "entropy": 1.8652900010347366, "epoch": 0.004672536299042323, "frac_reward_zero_std": 0.0, "grad_norm": 8.033286094665527, "learning_rate": 9.636363636363638e-06, "loss": 0.0533, "num_tokens": 251459.0, "reward": 0.7737554907798767, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7737554907798767, "reward_meter_std": 0.31233546137809753, "reward_std": 0.31233546137809753, "reward_total_composite_mean": 0.7737554907798767, "reward_total_composite_std": 0.31233546137809753, "reward_total_mean": 0.7737554907798767, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7737554907798767, "rewards/meter/std": 0.31233546137809753, "rewards/total_composite/mean": 0.7737554907798767, "rewards/total_composite/std": 0.31233546137809753, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0243695974349976, "sampling/importance_sampling_ratio/min": 0.1459781974554062, "sampling/sampling_logp_difference/max": 1.9242980480194092, "sampling/sampling_logp_difference/mean": 0.17217814922332764, "step": 121 }, { "clip_ratio/high_max": 0.10151049681007862, "clip_ratio/high_mean": 0.10151049681007862, "clip_ratio/low_mean": 0.12684562429785728, "clip_ratio/low_min": 0.12684562429785728, "clip_ratio/region_mean": 0.2283561211079359, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 29.375, "completions/mean_terminated_length": 29.375, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 1.7652578055858612, "epoch": 0.004711152301513748, "frac_reward_zero_std": 0.0, "grad_norm": 21.118961334228516, "learning_rate": 9.633333333333335e-06, "loss": 0.0725, "num_tokens": 252974.0, "reward": 0.4754229187965393, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4754229187965393, "reward_meter_std": 0.4443075954914093, "reward_std": 0.4443075358867645, "reward_total_composite_mean": 0.4754229187965393, "reward_total_composite_std": 0.4443075954914093, "reward_total_mean": 0.4754229187965393, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4754229187965393, "rewards/meter/std": 0.4443075954914093, "rewards/total_composite/mean": 0.4754229187965393, "rewards/total_composite/std": 0.4443075954914093, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0281100273132324, "sampling/importance_sampling_ratio/min": 0.25924697518348694, "sampling/sampling_logp_difference/max": 1.3499740362167358, "sampling/sampling_logp_difference/mean": 0.2008654922246933, "step": 122 }, { "clip_ratio/high_max": 0.14564990997314453, "clip_ratio/high_mean": 0.14564990997314453, "clip_ratio/low_mean": 0.033740474842488766, "clip_ratio/low_min": 0.033740474842488766, "clip_ratio/region_mean": 0.1793903848156333, "completions/clipped_ratio": 0.0, "completions/max_length": 131.0, "completions/max_terminated_length": 131.0, "completions/mean_length": 106.625, "completions/mean_terminated_length": 106.625, "completions/min_length": 86.0, "completions/min_terminated_length": 86.0, "entropy": 2.5758557319641113, "epoch": 0.004749768303985172, "frac_reward_zero_std": 0.0, "grad_norm": 10.26867961883545, "learning_rate": 9.63030303030303e-06, "loss": -0.0038, "num_tokens": 255275.0, "reward": 0.9178913831710815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9178913831710815, "reward_meter_std": 0.17877134680747986, "reward_std": 0.17877133190631866, "reward_total_composite_mean": 0.9178913831710815, "reward_total_composite_std": 0.17877134680747986, "reward_total_mean": 0.9178913831710815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9178913831710815, "rewards/meter/std": 0.17877134680747986, "rewards/total_composite/mean": 0.9178913831710815, "rewards/total_composite/std": 0.17877134680747986, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0357023477554321, "sampling/importance_sampling_ratio/min": 0.2035515457391739, "sampling/sampling_logp_difference/max": 1.5918359756469727, "sampling/sampling_logp_difference/mean": 0.20389947295188904, "step": 123 }, { "clip_ratio/high_max": 0.07448212616145611, "clip_ratio/high_mean": 0.07448212616145611, "clip_ratio/low_mean": 0.09205890912562609, "clip_ratio/low_min": 0.09205890912562609, "clip_ratio/region_mean": 0.1665410352870822, "completions/clipped_ratio": 0.0, "completions/max_length": 474.0, "completions/max_terminated_length": 474.0, "completions/mean_length": 340.875, "completions/mean_terminated_length": 340.875, "completions/min_length": 158.0, "completions/min_terminated_length": 158.0, "entropy": 3.0468600690364838, "epoch": 0.004788384306456596, "frac_reward_zero_std": 0.0, "grad_norm": 4.5853095054626465, "learning_rate": 9.627272727272728e-06, "loss": 0.0314, "num_tokens": 259818.0, "reward": 0.3518419861793518, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.1679842174053192, "reward_meter_mean": 0.5577775239944458, "reward_meter_std": 0.29362478852272034, "reward_std": 0.3233281970024109, "reward_total_composite_mean": 0.3518419861793518, "reward_total_composite_std": 0.3233281672000885, "reward_total_mean": 0.3518419861793518, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.1679842174053192, "rewards/meter/mean": 0.5577775239944458, "rewards/meter/std": 0.29362478852272034, "rewards/total_composite/mean": 0.3518419861793518, "rewards/total_composite/std": 0.3233281672000885, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.033653974533081, "sampling/importance_sampling_ratio/min": 0.18730992078781128, "sampling/sampling_logp_difference/max": 1.6749906539916992, "sampling/sampling_logp_difference/mean": 0.2014904022216797, "step": 124 }, { "clip_ratio/high_max": 0.15175942331552505, "clip_ratio/high_mean": 0.15175942331552505, "clip_ratio/low_mean": 0.03829259052872658, "clip_ratio/low_min": 0.03829259052872658, "clip_ratio/region_mean": 0.19005201384425163, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 54.75, "completions/mean_terminated_length": 54.75, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.44717738032341, "epoch": 0.00482700030892802, "frac_reward_zero_std": 0.0, "grad_norm": 17.506608963012695, "learning_rate": 9.624242424242425e-06, "loss": 0.1625, "num_tokens": 261528.0, "reward": 0.7977160215377808, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7977160215377808, "reward_meter_std": 0.3083810806274414, "reward_std": 0.308381050825119, "reward_total_composite_mean": 0.7977160215377808, "reward_total_composite_std": 0.3083810806274414, "reward_total_mean": 0.7977160215377808, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7977160215377808, "rewards/meter/std": 0.3083810806274414, "rewards/total_composite/mean": 0.7977160215377808, "rewards/total_composite/std": 0.3083810806274414, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0523124933242798, "sampling/importance_sampling_ratio/min": 0.2609032988548279, "sampling/sampling_logp_difference/max": 1.3436055183410645, "sampling/sampling_logp_difference/mean": 0.22570040822029114, "step": 125 }, { "clip_ratio/high_max": 0.026411979109980166, "clip_ratio/high_mean": 0.026411979109980166, "clip_ratio/low_mean": 0.10175232589244843, "clip_ratio/low_min": 0.10175232589244843, "clip_ratio/region_mean": 0.1281643050024286, "completions/clipped_ratio": 0.0, "completions/max_length": 153.0, "completions/max_terminated_length": 153.0, "completions/mean_length": 108.125, "completions/mean_terminated_length": 108.125, "completions/min_length": 85.0, "completions/min_terminated_length": 85.0, "entropy": 1.7009220086038113, "epoch": 0.004865616311399444, "frac_reward_zero_std": 0.0, "grad_norm": 13.348600387573242, "learning_rate": 9.621212121212122e-06, "loss": 0.2206, "num_tokens": 263761.0, "reward": 0.5052797198295593, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9285714626312256, "reward_count_adherence_std": 0.07636035233736038, "reward_meter_mean": 0.5293493866920471, "reward_meter_std": 0.396657794713974, "reward_std": 0.39642462134361267, "reward_total_composite_mean": 0.5052797198295593, "reward_total_composite_std": 0.39642462134361267, "reward_total_mean": 0.5052797198295593, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9285714626312256, "rewards/count_adherence/std": 0.07636035233736038, "rewards/meter/mean": 0.5293493866920471, "rewards/meter/std": 0.396657794713974, "rewards/total_composite/mean": 0.5052797198295593, "rewards/total_composite/std": 0.39642462134361267, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.02097487449646, "sampling/importance_sampling_ratio/min": 0.06007884442806244, "sampling/sampling_logp_difference/max": 2.8120975494384766, "sampling/sampling_logp_difference/mean": 0.18913644552230835, "step": 126 }, { "clip_ratio/high_max": 0.08253205195069313, "clip_ratio/high_mean": 0.08253205195069313, "clip_ratio/low_mean": 0.11877263803035021, "clip_ratio/low_min": 0.11877263803035021, "clip_ratio/region_mean": 0.20130468998104334, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 48.0, "completions/mean_terminated_length": 48.0, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 2.404453784227371, "epoch": 0.004904232313870868, "frac_reward_zero_std": 0.0, "grad_norm": 14.61343002319336, "learning_rate": 9.61818181818182e-06, "loss": 0.0506, "num_tokens": 265393.0, "reward": 0.3801646828651428, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3801646828651428, "reward_meter_std": 0.4593394994735718, "reward_std": 0.4593394994735718, "reward_total_composite_mean": 0.3801646828651428, "reward_total_composite_std": 0.4593394994735718, "reward_total_mean": 0.3801646828651428, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3801646828651428, "rewards/meter/std": 0.4593394994735718, "rewards/total_composite/mean": 0.3801646828651428, "rewards/total_composite/std": 0.4593394994735718, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0501198768615723, "sampling/importance_sampling_ratio/min": 0.3086847960948944, "sampling/sampling_logp_difference/max": 1.1754345893859863, "sampling/sampling_logp_difference/mean": 0.19850540161132812, "step": 127 }, { "clip_ratio/high_max": 0.14333923161029816, "clip_ratio/high_mean": 0.14333923161029816, "clip_ratio/low_mean": 0.04620295576751232, "clip_ratio/low_min": 0.04620295576751232, "clip_ratio/region_mean": 0.18954218737781048, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 55.125, "completions/mean_terminated_length": 55.125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 2.133269816637039, "epoch": 0.004942848316342292, "frac_reward_zero_std": 0.0, "grad_norm": 14.53402042388916, "learning_rate": 9.615151515151517e-06, "loss": 0.035, "num_tokens": 267018.0, "reward": 0.7447742223739624, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7447742223739624, "reward_meter_std": 0.3583148717880249, "reward_std": 0.3583148717880249, "reward_total_composite_mean": 0.7447742223739624, "reward_total_composite_std": 0.3583148717880249, "reward_total_mean": 0.7447742223739624, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7447742223739624, "rewards/meter/std": 0.3583148717880249, "rewards/total_composite/mean": 0.7447742223739624, "rewards/total_composite/std": 0.3583148717880249, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.042881965637207, "sampling/importance_sampling_ratio/min": 0.2833141088485718, "sampling/sampling_logp_difference/max": 1.2611989974975586, "sampling/sampling_logp_difference/mean": 0.20606549084186554, "step": 128 }, { "clip_ratio/high_max": 0.10729072242975235, "clip_ratio/high_mean": 0.10729072242975235, "clip_ratio/low_mean": 0.05078725144267082, "clip_ratio/low_min": 0.05078725144267082, "clip_ratio/region_mean": 0.15807797387242317, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 24.0, "completions/mean_terminated_length": 24.0, "completions/min_length": 15.0, "completions/min_terminated_length": 15.0, "entropy": 1.7079626321792603, "epoch": 0.004981464318813716, "frac_reward_zero_std": 0.0, "grad_norm": 23.683666229248047, "learning_rate": 9.612121212121212e-06, "loss": 0.2607, "num_tokens": 268338.0, "reward": 0.6895738840103149, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6895738840103149, "reward_meter_std": 0.3600609004497528, "reward_std": 0.3600608706474304, "reward_total_composite_mean": 0.6895738840103149, "reward_total_composite_std": 0.3600609004497528, "reward_total_mean": 0.6895738840103149, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6895738840103149, "rewards/meter/std": 0.3600609004497528, "rewards/total_composite/mean": 0.6895738840103149, "rewards/total_composite/std": 0.3600609004497528, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.022581696510315, "sampling/importance_sampling_ratio/min": 0.2624211013317108, "sampling/sampling_logp_difference/max": 1.3378047943115234, "sampling/sampling_logp_difference/mean": 0.21219754219055176, "step": 129 }, { "clip_ratio/high_max": 0.07609842158854008, "clip_ratio/high_mean": 0.07609842158854008, "clip_ratio/low_mean": 0.10636867955327034, "clip_ratio/low_min": 0.10636867955327034, "clip_ratio/region_mean": 0.18246710114181042, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 53.0, "completions/mean_terminated_length": 53.0, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 2.128389284014702, "epoch": 0.0050200803212851405, "frac_reward_zero_std": 0.0, "grad_norm": 13.415695190429688, "learning_rate": 9.60909090909091e-06, "loss": 0.0564, "num_tokens": 270058.0, "reward": 0.2599804103374481, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2599804103374481, "reward_meter_std": 0.33920830488204956, "reward_std": 0.33920830488204956, "reward_total_composite_mean": 0.2599804103374481, "reward_total_composite_std": 0.33920830488204956, "reward_total_mean": 0.2599804103374481, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2599804103374481, "rewards/meter/std": 0.33920830488204956, "rewards/total_composite/mean": 0.2599804103374481, "rewards/total_composite/std": 0.33920830488204956, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0430470705032349, "sampling/importance_sampling_ratio/min": 0.2772029638290405, "sampling/sampling_logp_difference/max": 1.2830052375793457, "sampling/sampling_logp_difference/mean": 0.2094995379447937, "step": 130 }, { "clip_ratio/high_max": 0.1310401326045394, "clip_ratio/high_mean": 0.1310401326045394, "clip_ratio/low_mean": 0.07387228682637215, "clip_ratio/low_min": 0.07387228682637215, "clip_ratio/region_mean": 0.20491241943091154, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 54.75, "completions/mean_terminated_length": 54.75, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 2.6511287838220596, "epoch": 0.005058696323756565, "frac_reward_zero_std": 0.0, "grad_norm": 17.473791122436523, "learning_rate": 9.606060606060607e-06, "loss": 0.0505, "num_tokens": 271776.0, "reward": 0.6479246616363525, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6479246616363525, "reward_meter_std": 0.4171454906463623, "reward_std": 0.41714543104171753, "reward_total_composite_mean": 0.6479246616363525, "reward_total_composite_std": 0.4171454906463623, "reward_total_mean": 0.6479246616363525, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6479246616363525, "rewards/meter/std": 0.4171454906463623, "rewards/total_composite/mean": 0.6479246616363525, "rewards/total_composite/std": 0.4171454906463623, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0370509624481201, "sampling/importance_sampling_ratio/min": 0.2412000447511673, "sampling/sampling_logp_difference/max": 1.422128677368164, "sampling/sampling_logp_difference/mean": 0.21375833451747894, "step": 131 }, { "clip_ratio/high_max": 0.07182539906352758, "clip_ratio/high_mean": 0.07182539906352758, "clip_ratio/low_mean": 0.09321646392345428, "clip_ratio/low_min": 0.09321646392345428, "clip_ratio/region_mean": 0.16504186298698187, "completions/clipped_ratio": 0.0, "completions/max_length": 56.0, "completions/max_terminated_length": 56.0, "completions/mean_length": 45.25, "completions/mean_terminated_length": 45.25, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 2.1410828977823257, "epoch": 0.005097312326227989, "frac_reward_zero_std": 0.0, "grad_norm": 15.81747817993164, "learning_rate": 9.603030303030304e-06, "loss": 0.0909, "num_tokens": 273490.0, "reward": 0.2023978978395462, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2023978978395462, "reward_meter_std": 0.27117809653282166, "reward_std": 0.27117806673049927, "reward_total_composite_mean": 0.2023978978395462, "reward_total_composite_std": 0.27117809653282166, "reward_total_mean": 0.2023978978395462, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2023978978395462, "rewards/meter/std": 0.27117809653282166, "rewards/total_composite/mean": 0.2023978978395462, "rewards/total_composite/std": 0.27117809653282166, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0494537353515625, "sampling/importance_sampling_ratio/min": 0.2672046720981598, "sampling/sampling_logp_difference/max": 1.3197402954101562, "sampling/sampling_logp_difference/mean": 0.2216556966304779, "step": 132 }, { "clip_ratio/high_max": 0.10300109349191189, "clip_ratio/high_mean": 0.10300109349191189, "clip_ratio/low_mean": 0.10132601391524076, "clip_ratio/low_min": 0.10132601391524076, "clip_ratio/region_mean": 0.20432710740715265, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 49.0, "completions/mean_terminated_length": 49.0, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 2.9459713995456696, "epoch": 0.005135928328699413, "frac_reward_zero_std": 0.0, "grad_norm": 15.763381004333496, "learning_rate": 9.600000000000001e-06, "loss": -0.0793, "num_tokens": 275138.0, "reward": 0.5731572508811951, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5731572508811951, "reward_meter_std": 0.42340850830078125, "reward_std": 0.42340850830078125, "reward_total_composite_mean": 0.5731572508811951, "reward_total_composite_std": 0.42340850830078125, "reward_total_mean": 0.5731572508811951, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5731572508811951, "rewards/meter/std": 0.42340850830078125, "rewards/total_composite/mean": 0.5731572508811951, "rewards/total_composite/std": 0.42340850830078125, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0395585298538208, "sampling/importance_sampling_ratio/min": 0.254414439201355, "sampling/sampling_logp_difference/max": 1.368790626525879, "sampling/sampling_logp_difference/mean": 0.21350626647472382, "step": 133 }, { "clip_ratio/high_max": 0.1634557507932186, "clip_ratio/high_mean": 0.1634557507932186, "clip_ratio/low_mean": 0.05536198429763317, "clip_ratio/low_min": 0.05536198429763317, "clip_ratio/region_mean": 0.21881773509085178, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 57.125, "completions/mean_terminated_length": 57.125, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.2369899600744247, "epoch": 0.005174544331170837, "frac_reward_zero_std": 0.0, "grad_norm": 15.412650108337402, "learning_rate": 9.596969696969699e-06, "loss": -0.0251, "num_tokens": 276875.0, "reward": 0.7134405970573425, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7134405970573425, "reward_meter_std": 0.36172330379486084, "reward_std": 0.36172330379486084, "reward_total_composite_mean": 0.7134405970573425, "reward_total_composite_std": 0.36172330379486084, "reward_total_mean": 0.7134405970573425, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7134405970573425, "rewards/meter/std": 0.36172330379486084, "rewards/total_composite/mean": 0.7134405970573425, "rewards/total_composite/std": 0.36172330379486084, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0319643020629883, "sampling/importance_sampling_ratio/min": 0.18233875930309296, "sampling/sampling_logp_difference/max": 1.7018890380859375, "sampling/sampling_logp_difference/mean": 0.20017951726913452, "step": 134 }, { "clip_ratio/high_max": 0.07667344622313976, "clip_ratio/high_mean": 0.07667344622313976, "clip_ratio/low_mean": 0.09396191779524088, "clip_ratio/low_min": 0.09396191779524088, "clip_ratio/region_mean": 0.17063536401838064, "completions/clipped_ratio": 0.0, "completions/max_length": 281.0, "completions/max_terminated_length": 281.0, "completions/mean_length": 194.875, "completions/mean_terminated_length": 194.875, "completions/min_length": 125.0, "completions/min_terminated_length": 125.0, "entropy": 3.0369058549404144, "epoch": 0.005213160333642261, "frac_reward_zero_std": 0.0, "grad_norm": 6.406003952026367, "learning_rate": 9.593939393939394e-06, "loss": 0.009, "num_tokens": 279842.0, "reward": 0.3583834171295166, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9464285969734192, "reward_count_adherence_std": 0.07393559068441391, "reward_meter_mean": 0.3760119676589966, "reward_meter_std": 0.4099160134792328, "reward_std": 0.4076659679412842, "reward_total_composite_mean": 0.3583834171295166, "reward_total_composite_std": 0.4076659679412842, "reward_total_mean": 0.3583834171295166, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9464285969734192, "rewards/count_adherence/std": 0.07393559068441391, "rewards/meter/mean": 0.3760119676589966, "rewards/meter/std": 0.4099160134792328, "rewards/total_composite/mean": 0.3583834171295166, "rewards/total_composite/std": 0.4076659679412842, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0401254892349243, "sampling/importance_sampling_ratio/min": 0.21446330845355988, "sampling/sampling_logp_difference/max": 1.539616584777832, "sampling/sampling_logp_difference/mean": 0.1984342634677887, "step": 135 }, { "clip_ratio/high_max": 0.11762434057891369, "clip_ratio/high_mean": 0.11762434057891369, "clip_ratio/low_mean": 0.06984265986829996, "clip_ratio/low_min": 0.06984265986829996, "clip_ratio/region_mean": 0.18746700044721365, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 51.25, "completions/mean_terminated_length": 51.25, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 2.2263315618038177, "epoch": 0.005251776336113685, "frac_reward_zero_std": 0.0, "grad_norm": 13.780417442321777, "learning_rate": 9.590909090909091e-06, "loss": -0.0186, "num_tokens": 281484.0, "reward": 0.6177759170532227, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6177759170532227, "reward_meter_std": 0.46374326944351196, "reward_std": 0.4637432098388672, "reward_total_composite_mean": 0.6177759170532227, "reward_total_composite_std": 0.46374326944351196, "reward_total_mean": 0.6177759170532227, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6177759170532227, "rewards/meter/std": 0.46374326944351196, "rewards/total_composite/mean": 0.6177759170532227, "rewards/total_composite/std": 0.46374326944351196, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0363706350326538, "sampling/importance_sampling_ratio/min": 0.15855665504932404, "sampling/sampling_logp_difference/max": 1.8416433334350586, "sampling/sampling_logp_difference/mean": 0.210972860455513, "step": 136 }, { "clip_ratio/high_max": 0.1296451175585389, "clip_ratio/high_mean": 0.1296451175585389, "clip_ratio/low_mean": 0.037981835193932056, "clip_ratio/low_min": 0.037981835193932056, "clip_ratio/region_mean": 0.16762695275247097, "completions/clipped_ratio": 0.0, "completions/max_length": 45.0, "completions/max_terminated_length": 45.0, "completions/mean_length": 32.25, "completions/mean_terminated_length": 32.25, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 1.1308462470769882, "epoch": 0.005290392338585109, "frac_reward_zero_std": 0.0, "grad_norm": 21.104068756103516, "learning_rate": 9.587878787878789e-06, "loss": 0.0346, "num_tokens": 282990.0, "reward": 0.6098703145980835, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6098703145980835, "reward_meter_std": 0.3275175094604492, "reward_std": 0.3275175392627716, "reward_total_composite_mean": 0.6098703145980835, "reward_total_composite_std": 0.3275175094604492, "reward_total_mean": 0.6098703145980835, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6098703145980835, "rewards/meter/std": 0.3275175094604492, "rewards/total_composite/mean": 0.6098703145980835, "rewards/total_composite/std": 0.3275175094604492, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9829218983650208, "sampling/importance_sampling_ratio/min": 0.2552906572818756, "sampling/sampling_logp_difference/max": 1.3653526306152344, "sampling/sampling_logp_difference/mean": 0.15988147258758545, "step": 137 }, { "clip_ratio/high_max": 0.08452141657471657, "clip_ratio/high_mean": 0.08452141657471657, "clip_ratio/low_mean": 0.11034664139151573, "clip_ratio/low_min": 0.11034664139151573, "clip_ratio/region_mean": 0.1948680579662323, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 27.125, "completions/mean_terminated_length": 27.125, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 2.293392300605774, "epoch": 0.005329008341056534, "frac_reward_zero_std": 0.0, "grad_norm": 19.138347625732422, "learning_rate": 9.584848484848486e-06, "loss": 0.0749, "num_tokens": 284471.0, "reward": 0.3993714153766632, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.3993714153766632, "reward_meter_std": 0.3401057720184326, "reward_std": 0.34010574221611023, "reward_total_composite_mean": 0.3993714153766632, "reward_total_composite_std": 0.3401057720184326, "reward_total_mean": 0.3993714153766632, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.3993714153766632, "rewards/meter/std": 0.3401057720184326, "rewards/total_composite/mean": 0.3993714153766632, "rewards/total_composite/std": 0.3401057720184326, "sampling/importance_sampling_ratio/max": 1.970318078994751, "sampling/importance_sampling_ratio/mean": 1.050313949584961, "sampling/importance_sampling_ratio/min": 0.4154578745365143, "sampling/sampling_logp_difference/max": 0.8783740997314453, "sampling/sampling_logp_difference/mean": 0.19733576476573944, "step": 138 }, { "clip_ratio/high_max": 0.13470745086669922, "clip_ratio/high_mean": 0.13470745086669922, "clip_ratio/low_mean": 0.03914893604815006, "clip_ratio/low_min": 0.03914893604815006, "clip_ratio/region_mean": 0.17385638691484928, "completions/clipped_ratio": 0.0, "completions/max_length": 335.0, "completions/max_terminated_length": 335.0, "completions/mean_length": 292.0, "completions/mean_terminated_length": 292.0, "completions/min_length": 235.0, "completions/min_terminated_length": 235.0, "entropy": 3.159882366657257, "epoch": 0.005367624343527958, "frac_reward_zero_std": 0.0, "grad_norm": 4.607113838195801, "learning_rate": 9.581818181818181e-06, "loss": -0.0421, "num_tokens": 288591.0, "reward": 0.7447197437286377, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_meter_mean": 0.8927704095840454, "reward_meter_std": 0.13047616183757782, "reward_std": 0.3232608437538147, "reward_total_composite_mean": 0.7447197437286377, "reward_total_composite_std": 0.3232608437538147, "reward_total_mean": 0.7447197437286377, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/meter/mean": 0.8927704095840454, "rewards/meter/std": 0.13047616183757782, "rewards/total_composite/mean": 0.7447197437286377, "rewards/total_composite/std": 0.3232608437538147, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0477176904678345, "sampling/importance_sampling_ratio/min": 0.2002381682395935, "sampling/sampling_logp_difference/max": 1.6082477569580078, "sampling/sampling_logp_difference/mean": 0.19803562760353088, "step": 139 }, { "clip_ratio/high_max": 0.10052786208689213, "clip_ratio/high_mean": 0.10052786208689213, "clip_ratio/low_mean": 0.084076764062047, "clip_ratio/low_min": 0.084076764062047, "clip_ratio/region_mean": 0.18460462614893913, "completions/clipped_ratio": 0.0, "completions/max_length": 369.0, "completions/max_terminated_length": 369.0, "completions/mean_length": 304.5, "completions/mean_terminated_length": 304.5, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "entropy": 2.8953827619552612, "epoch": 0.0054062403459993824, "frac_reward_zero_std": 0.0, "grad_norm": 5.223753929138184, "learning_rate": 9.57878787878788e-06, "loss": 0.0406, "num_tokens": 292571.0, "reward": 0.5782480835914612, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.0534522607922554, "reward_meter_mean": 0.609697163105011, "reward_meter_std": 0.17199508845806122, "reward_std": 0.16025982797145844, "reward_total_composite_mean": 0.5782480835914612, "reward_total_composite_std": 0.16025982797145844, "reward_total_mean": 0.5782480835914612, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.0534522607922554, "rewards/meter/mean": 0.609697163105011, "rewards/meter/std": 0.17199508845806122, "rewards/total_composite/mean": 0.5782480835914612, "rewards/total_composite/std": 0.16025982797145844, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.034401535987854, "sampling/importance_sampling_ratio/min": 0.14130491018295288, "sampling/sampling_logp_difference/max": 1.9568352699279785, "sampling/sampling_logp_difference/mean": 0.19511224329471588, "step": 140 }, { "clip_ratio/high_max": 0.06570382788777351, "clip_ratio/high_mean": 0.06570382788777351, "clip_ratio/low_mean": 0.08571217767894268, "clip_ratio/low_min": 0.08571217767894268, "clip_ratio/region_mean": 0.1514160055667162, "completions/clipped_ratio": 0.0, "completions/max_length": 97.0, "completions/max_terminated_length": 97.0, "completions/mean_length": 86.5, "completions/mean_terminated_length": 86.5, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 2.2329191118478775, "epoch": 0.0054448563484708066, "frac_reward_zero_std": 0.0, "grad_norm": 10.004317283630371, "learning_rate": 9.575757575757576e-06, "loss": -0.0092, "num_tokens": 294679.0, "reward": 0.414273202419281, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.414273202419281, "reward_meter_std": 0.41314172744750977, "reward_std": 0.41314172744750977, "reward_total_composite_mean": 0.414273202419281, "reward_total_composite_std": 0.41314172744750977, "reward_total_mean": 0.414273202419281, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.414273202419281, "rewards/meter/std": 0.41314172744750977, "rewards/total_composite/mean": 0.414273202419281, "rewards/total_composite/std": 0.41314172744750977, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0314459800720215, "sampling/importance_sampling_ratio/min": 0.35211867094039917, "sampling/sampling_logp_difference/max": 1.0437870025634766, "sampling/sampling_logp_difference/mean": 0.17779497802257538, "step": 141 }, { "clip_ratio/high_max": 0.06938760355114937, "clip_ratio/high_mean": 0.06938760355114937, "clip_ratio/low_mean": 0.11229986138641834, "clip_ratio/low_min": 0.11229986138641834, "clip_ratio/region_mean": 0.1816874649375677, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 47.625, "completions/mean_terminated_length": 47.625, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 2.629018932580948, "epoch": 0.005483472350942231, "frac_reward_zero_std": 0.0, "grad_norm": 13.359566688537598, "learning_rate": 9.572727272727273e-06, "loss": -0.0499, "num_tokens": 296372.0, "reward": 0.4189656376838684, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4189656376838684, "reward_meter_std": 0.3781832754611969, "reward_std": 0.3781832456588745, "reward_total_composite_mean": 0.4189656376838684, "reward_total_composite_std": 0.3781832754611969, "reward_total_mean": 0.4189656376838684, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4189656376838684, "rewards/meter/std": 0.3781832754611969, "rewards/total_composite/mean": 0.4189656376838684, "rewards/total_composite/std": 0.3781832754611969, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0515532493591309, "sampling/importance_sampling_ratio/min": 0.1484287977218628, "sampling/sampling_logp_difference/max": 1.9076499938964844, "sampling/sampling_logp_difference/mean": 0.22827744483947754, "step": 142 }, { "clip_ratio/high_max": 0.0911912564188242, "clip_ratio/high_mean": 0.0911912564188242, "clip_ratio/low_mean": 0.096000537276268, "clip_ratio/low_min": 0.096000537276268, "clip_ratio/region_mean": 0.1871917936950922, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 84.875, "completions/mean_terminated_length": 84.875, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 2.4079796075820923, "epoch": 0.005522088353413655, "frac_reward_zero_std": 0.0, "grad_norm": 9.326652526855469, "learning_rate": 9.56969696969697e-06, "loss": -0.005, "num_tokens": 298243.0, "reward": 0.5255526304244995, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5255526304244995, "reward_meter_std": 0.3781281113624573, "reward_std": 0.3781280815601349, "reward_total_composite_mean": 0.5255526304244995, "reward_total_composite_std": 0.3781281113624573, "reward_total_mean": 0.5255526304244995, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5255526304244995, "rewards/meter/std": 0.3781281113624573, "rewards/total_composite/mean": 0.5255526304244995, "rewards/total_composite/std": 0.3781281113624573, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0423548221588135, "sampling/importance_sampling_ratio/min": 0.2729393243789673, "sampling/sampling_logp_difference/max": 1.2985057830810547, "sampling/sampling_logp_difference/mean": 0.20440031588077545, "step": 143 }, { "clip_ratio/high_max": 0.08965095691382885, "clip_ratio/high_mean": 0.08965095691382885, "clip_ratio/low_mean": 0.09224239364266396, "clip_ratio/low_min": 0.09224239364266396, "clip_ratio/region_mean": 0.1818933505564928, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 58.0, "completions/mean_terminated_length": 58.0, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.5128345042467117, "epoch": 0.005560704355885079, "frac_reward_zero_std": 0.0, "grad_norm": 12.313883781433105, "learning_rate": 9.566666666666668e-06, "loss": 0.1133, "num_tokens": 299963.0, "reward": 0.6259543299674988, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6259543299674988, "reward_meter_std": 0.40781956911087036, "reward_std": 0.40781959891319275, "reward_total_composite_mean": 0.6259543299674988, "reward_total_composite_std": 0.40781956911087036, "reward_total_mean": 0.6259543299674988, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6259543299674988, "rewards/meter/std": 0.40781956911087036, "rewards/total_composite/mean": 0.6259543299674988, "rewards/total_composite/std": 0.40781956911087036, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0449057817459106, "sampling/importance_sampling_ratio/min": 0.2863829731941223, "sampling/sampling_logp_difference/max": 1.2504253387451172, "sampling/sampling_logp_difference/mean": 0.1947186291217804, "step": 144 }, { "clip_ratio/high_max": 0.12736221216619015, "clip_ratio/high_mean": 0.12736221216619015, "clip_ratio/low_mean": 0.07416711933910847, "clip_ratio/low_min": 0.07416711933910847, "clip_ratio/region_mean": 0.20152933150529861, "completions/clipped_ratio": 0.0, "completions/max_length": 130.0, "completions/max_terminated_length": 130.0, "completions/mean_length": 108.0, "completions/mean_terminated_length": 108.0, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 2.594912603497505, "epoch": 0.005599320358356503, "frac_reward_zero_std": 0.0, "grad_norm": 9.220316886901855, "learning_rate": 9.563636363636365e-06, "loss": -0.0099, "num_tokens": 302259.0, "reward": 0.6794947385787964, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_meter_mean": 0.7156338095664978, "reward_meter_std": 0.3621709942817688, "reward_std": 0.3623289465904236, "reward_total_composite_mean": 0.6794947385787964, "reward_total_composite_std": 0.3623289465904236, "reward_total_mean": 0.6794947385787964, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/meter/mean": 0.7156338095664978, "rewards/meter/std": 0.3621709942817688, "rewards/total_composite/mean": 0.6794947385787964, "rewards/total_composite/std": 0.3623289465904236, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0389753580093384, "sampling/importance_sampling_ratio/min": 0.19741055369377136, "sampling/sampling_logp_difference/max": 1.6224696636199951, "sampling/sampling_logp_difference/mean": 0.20363517105579376, "step": 145 }, { "clip_ratio/high_max": 0.06477605737745762, "clip_ratio/high_mean": 0.06477605737745762, "clip_ratio/low_mean": 0.09793206304311752, "clip_ratio/low_min": 0.09793206304311752, "clip_ratio/region_mean": 0.16270812042057514, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 85.0, "completions/mean_terminated_length": 85.0, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.9736258126795292, "epoch": 0.005637936360827927, "frac_reward_zero_std": 0.0, "grad_norm": 21.128833770751953, "learning_rate": 9.56060606060606e-06, "loss": 0.0802, "num_tokens": 304531.0, "reward": 0.4409075975418091, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.5389710068702698, "reward_meter_std": 0.36102810502052307, "reward_std": 0.28550228476524353, "reward_total_composite_mean": 0.4409075975418091, "reward_total_composite_std": 0.28550228476524353, "reward_total_mean": 0.4409075975418091, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.5389710068702698, "rewards/meter/std": 0.36102810502052307, "rewards/total_composite/mean": 0.4409075975418091, "rewards/total_composite/std": 0.28550228476524353, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0029895305633545, "sampling/importance_sampling_ratio/min": 0.029469041153788567, "sampling/sampling_logp_difference/max": 3.5244150161743164, "sampling/sampling_logp_difference/mean": 0.20141077041625977, "step": 146 }, { "clip_ratio/high_max": 0.11702838353812695, "clip_ratio/high_mean": 0.11702838353812695, "clip_ratio/low_mean": 0.07888335548341274, "clip_ratio/low_min": 0.07888335548341274, "clip_ratio/region_mean": 0.1959117390215397, "completions/clipped_ratio": 0.0, "completions/max_length": 112.0, "completions/max_terminated_length": 112.0, "completions/mean_length": 93.125, "completions/mean_terminated_length": 93.125, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 2.3368784189224243, "epoch": 0.005676552363299351, "frac_reward_zero_std": 0.0, "grad_norm": 9.888257026672363, "learning_rate": 9.55757575757576e-06, "loss": 0.0747, "num_tokens": 306668.0, "reward": 0.6462192535400391, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7655929327011108, "reward_meter_std": 0.3509427309036255, "reward_std": 0.43067827820777893, "reward_total_composite_mean": 0.6462192535400391, "reward_total_composite_std": 0.43067827820777893, "reward_total_mean": 0.6462192535400391, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7655929327011108, "rewards/meter/std": 0.3509427309036255, "rewards/total_composite/mean": 0.6462192535400391, "rewards/total_composite/std": 0.43067827820777893, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0265202522277832, "sampling/importance_sampling_ratio/min": 0.2604142129421234, "sampling/sampling_logp_difference/max": 1.3454818725585938, "sampling/sampling_logp_difference/mean": 0.19887900352478027, "step": 147 }, { "clip_ratio/high_max": 0.18514032009989023, "clip_ratio/high_mean": 0.18514032009989023, "clip_ratio/low_mean": 0.02163461595773697, "clip_ratio/low_min": 0.02163461595773697, "clip_ratio/region_mean": 0.2067749360576272, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 53.625, "completions/mean_terminated_length": 53.625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 2.712312787771225, "epoch": 0.005715168365770775, "frac_reward_zero_std": 0.0, "grad_norm": 13.740280151367188, "learning_rate": 9.554545454545455e-06, "loss": 0.0131, "num_tokens": 308289.0, "reward": 0.8362427353858948, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9531986117362976, "reward_meter_std": 0.048368558287620544, "reward_std": 0.3412637710571289, "reward_total_composite_mean": 0.8362427353858948, "reward_total_composite_std": 0.3412637710571289, "reward_total_mean": 0.8362427353858948, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9531986117362976, "rewards/meter/std": 0.048368558287620544, "rewards/total_composite/mean": 0.8362427353858948, "rewards/total_composite/std": 0.3412637710571289, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0660349130630493, "sampling/importance_sampling_ratio/min": 0.07845636457204819, "sampling/sampling_logp_difference/max": 2.545212745666504, "sampling/sampling_logp_difference/mean": 0.22549496591091156, "step": 148 }, { "clip_ratio/high_max": 0.06303809583187103, "clip_ratio/high_mean": 0.06303809583187103, "clip_ratio/low_mean": 0.052138859406113625, "clip_ratio/low_min": 0.052138859406113625, "clip_ratio/region_mean": 0.11517695523798466, "completions/clipped_ratio": 0.0, "completions/max_length": 98.0, "completions/max_terminated_length": 98.0, "completions/mean_length": 72.5, "completions/mean_terminated_length": 72.5, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.622876338660717, "epoch": 0.005753784368242199, "frac_reward_zero_std": 0.0, "grad_norm": 30.763076782226562, "learning_rate": 9.551515151515152e-06, "loss": 0.1423, "num_tokens": 310181.0, "reward": 0.764354407787323, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.764354407787323, "reward_meter_std": 0.35320577025413513, "reward_std": 0.35320577025413513, "reward_total_composite_mean": 0.764354407787323, "reward_total_composite_std": 0.35320577025413513, "reward_total_mean": 0.764354407787323, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.764354407787323, "rewards/meter/std": 0.35320577025413513, "rewards/total_composite/mean": 0.764354407787323, "rewards/total_composite/std": 0.35320577025413513, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0017551183700562, "sampling/importance_sampling_ratio/min": 0.09305361658334732, "sampling/sampling_logp_difference/max": 2.374579429626465, "sampling/sampling_logp_difference/mean": 0.14173762500286102, "step": 149 }, { "clip_ratio/high_max": 0.06511373445391655, "clip_ratio/high_mean": 0.06511373445391655, "clip_ratio/low_mean": 0.11349504999816418, "clip_ratio/low_min": 0.11349504999816418, "clip_ratio/region_mean": 0.17860878445208073, "completions/clipped_ratio": 0.0, "completions/max_length": 319.0, "completions/max_terminated_length": 319.0, "completions/mean_length": 255.25, "completions/mean_terminated_length": 255.25, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "entropy": 3.1247769594192505, "epoch": 0.0057924003707136235, "frac_reward_zero_std": 0.0, "grad_norm": 5.072005748748779, "learning_rate": 9.54848484848485e-06, "loss": -0.0588, "num_tokens": 313791.0, "reward": 0.32547223567962646, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.9861111044883728, "reward_count_adherence_std": 0.03928370773792267, "reward_meter_mean": 0.4467889070510864, "reward_meter_std": 0.29338762164115906, "reward_std": 0.2992675006389618, "reward_total_composite_mean": 0.32547223567962646, "reward_total_composite_std": 0.2992675006389618, "reward_total_mean": 0.32547223567962646, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.9861111044883728, "rewards/count_adherence/std": 0.03928370773792267, "rewards/meter/mean": 0.4467889070510864, "rewards/meter/std": 0.29338762164115906, "rewards/total_composite/mean": 0.32547223567962646, "rewards/total_composite/std": 0.2992675006389618, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0436980724334717, "sampling/importance_sampling_ratio/min": 0.20569318532943726, "sampling/sampling_logp_difference/max": 1.5813696384429932, "sampling/sampling_logp_difference/mean": 0.20325259864330292, "step": 150 }, { "epoch": 0.0057924003707136235, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.038461538461538464, "eval_completions/max_length": 435.3076923076923, "eval_completions/max_terminated_length": 406.38461538461536, "eval_completions/mean_length": 195.05769230769232, "eval_completions/mean_terminated_length": 182.7815962571364, "eval_completions/min_length": 42.92307692307692, "eval_completions/min_terminated_length": 42.92307692307692, "eval_entropy": 2.4764969715705285, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 313791.0, "eval_reward": 0.4012144311116292, "eval_reward_arabic_clean_mean": 0.9423076923076923, "eval_reward_arabic_clean_std": 0.1631784851734455, "eval_reward_count_adherence_mean": 0.9416975012192359, "eval_reward_count_adherence_std": 0.08222452465158242, "eval_reward_meter_mean": 0.45025052244846636, "eval_reward_meter_std": 0.34984474113354314, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.4012144311116292, "eval_reward_total_composite_std": 0.3435493845206041, "eval_reward_total_mean": 0.4012144311116292, "eval_rewards/arabic_clean/mean": 0.9423076923076923, "eval_rewards/arabic_clean/std": 0.1631784851734455, "eval_rewards/count_adherence/mean": 0.9416975012192359, "eval_rewards/count_adherence/std": 0.08222452465158242, "eval_rewards/meter/mean": 0.45025052244846636, "eval_rewards/meter/std": 0.34984474113354314, "eval_rewards/total_composite/mean": 0.4012144311116292, "eval_rewards/total_composite/std": 0.3435493845206041, "eval_runtime": 80.4379, "eval_samples_per_second": 1.293, "eval_sampling/importance_sampling_ratio/max": 1.593602758187514, "eval_sampling/importance_sampling_ratio/mean": 1.0403164625167847, "eval_sampling/importance_sampling_ratio/min": 0.27021744961921984, "eval_sampling/sampling_logp_difference/max": 1.3218139501718373, "eval_sampling/sampling_logp_difference/mean": 0.14192955310528094, "eval_steps_per_second": 0.162, "step": 150 }, { "clip_ratio/high_max": 0.10548157431185246, "clip_ratio/high_mean": 0.10548157431185246, "clip_ratio/low_mean": 0.05626178905367851, "clip_ratio/low_min": 0.05626178905367851, "clip_ratio/region_mean": 0.16174336336553097, "completions/clipped_ratio": 0.0, "completions/max_length": 360.0, "completions/max_terminated_length": 360.0, "completions/mean_length": 328.5, "completions/mean_terminated_length": 328.5, "completions/min_length": 272.0, "completions/min_terminated_length": 272.0, "entropy": 2.69022598862648, "epoch": 0.005831016373185048, "frac_reward_zero_std": 0.0, "grad_norm": 4.5317206382751465, "learning_rate": 9.545454545454547e-06, "loss": -0.0419, "num_tokens": 318003.0, "reward": 0.9565757513046265, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9722222089767456, "reward_count_adherence_std": 0.05143444985151291, "reward_meter_mean": 0.9837745428085327, "reward_meter_std": 0.0232550036162138, "reward_std": 0.0579642690718174, "reward_total_composite_mean": 0.9565757513046265, "reward_total_composite_std": 0.05796428769826889, "reward_total_mean": 0.9565757513046265, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9722222089767456, "rewards/count_adherence/std": 0.05143444985151291, "rewards/meter/mean": 0.9837745428085327, "rewards/meter/std": 0.0232550036162138, "rewards/total_composite/mean": 0.9565757513046265, "rewards/total_composite/std": 0.05796428769826889, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0254464149475098, "sampling/importance_sampling_ratio/min": 0.2590313255786896, "sampling/sampling_logp_difference/max": 1.3508062362670898, "sampling/sampling_logp_difference/mean": 0.18240459263324738, "step": 151 }, { "clip_ratio/high_max": 0.10017775557935238, "clip_ratio/high_mean": 0.10017775557935238, "clip_ratio/low_mean": 0.08865037560462952, "clip_ratio/low_min": 0.08865037560462952, "clip_ratio/region_mean": 0.1888281311839819, "completions/clipped_ratio": 0.0, "completions/max_length": 260.0, "completions/max_terminated_length": 260.0, "completions/mean_length": 222.5, "completions/mean_terminated_length": 222.5, "completions/min_length": 196.0, "completions/min_terminated_length": 196.0, "entropy": 2.6781843453645706, "epoch": 0.005869632375656472, "frac_reward_zero_std": 0.0, "grad_norm": 6.531708240509033, "learning_rate": 9.542424242424242e-06, "loss": 0.0225, "num_tokens": 321511.0, "reward": 0.6029950380325317, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.984375, "reward_count_adherence_std": 0.04419417306780815, "reward_meter_mean": 0.6115673780441284, "reward_meter_std": 0.26747360825538635, "reward_std": 0.2708563804626465, "reward_total_composite_mean": 0.6029950380325317, "reward_total_composite_std": 0.2708563804626465, "reward_total_mean": 0.6029950380325317, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.984375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/meter/mean": 0.6115673780441284, "rewards/meter/std": 0.26747360825538635, "rewards/total_composite/mean": 0.6029950380325317, "rewards/total_composite/std": 0.2708563804626465, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0410678386688232, "sampling/importance_sampling_ratio/min": 0.20417055487632751, "sampling/sampling_logp_difference/max": 1.5887994766235352, "sampling/sampling_logp_difference/mean": 0.20755378901958466, "step": 152 }, { "clip_ratio/high_max": 0.15194394160062075, "clip_ratio/high_mean": 0.15194394160062075, "clip_ratio/low_mean": 0.05802265927195549, "clip_ratio/low_min": 0.05802265927195549, "clip_ratio/region_mean": 0.20996660087257624, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 50.75, "completions/mean_terminated_length": 50.75, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 2.6396835446357727, "epoch": 0.005908248378127896, "frac_reward_zero_std": 0.0, "grad_norm": 15.966812133789062, "learning_rate": 9.539393939393941e-06, "loss": 0.1928, "num_tokens": 323205.0, "reward": 0.7692294716835022, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7692294716835022, "reward_meter_std": 0.3993333876132965, "reward_std": 0.3993334174156189, "reward_total_composite_mean": 0.7692294716835022, "reward_total_composite_std": 0.3993333876132965, "reward_total_mean": 0.7692294716835022, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7692294716835022, "rewards/meter/std": 0.3993333876132965, "rewards/total_composite/mean": 0.7692294716835022, "rewards/total_composite/std": 0.3993333876132965, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0662130117416382, "sampling/importance_sampling_ratio/min": 0.23212644457817078, "sampling/sampling_logp_difference/max": 1.4604730606079102, "sampling/sampling_logp_difference/mean": 0.21327464282512665, "step": 153 }, { "clip_ratio/high_max": 0.14308988489210606, "clip_ratio/high_mean": 0.14308988489210606, "clip_ratio/low_mean": 0.047645075246691704, "clip_ratio/low_min": 0.047645075246691704, "clip_ratio/region_mean": 0.19073496013879776, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 72.375, "completions/mean_terminated_length": 72.375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 2.7783928215503693, "epoch": 0.005946864380599321, "frac_reward_zero_std": 0.0, "grad_norm": 9.946159362792969, "learning_rate": 9.536363636363637e-06, "loss": -0.069, "num_tokens": 324984.0, "reward": 0.666408896446228, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7901514172554016, "reward_meter_std": 0.3216681182384491, "reward_std": 0.4116549491882324, "reward_total_composite_mean": 0.666408896446228, "reward_total_composite_std": 0.4116549491882324, "reward_total_mean": 0.666408896446228, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7901514172554016, "rewards/meter/std": 0.3216681182384491, "rewards/total_composite/mean": 0.666408896446228, "rewards/total_composite/std": 0.4116549491882324, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0114688873291016, "sampling/importance_sampling_ratio/min": 0.1386878341436386, "sampling/sampling_logp_difference/max": 1.975529670715332, "sampling/sampling_logp_difference/mean": 0.20986607670783997, "step": 154 }, { "clip_ratio/high_max": 0.08849271759390831, "clip_ratio/high_mean": 0.08849271759390831, "clip_ratio/low_mean": 0.06773262470960617, "clip_ratio/low_min": 0.06773262470960617, "clip_ratio/region_mean": 0.15622534230351448, "completions/clipped_ratio": 0.0, "completions/max_length": 276.0, "completions/max_terminated_length": 276.0, "completions/mean_length": 235.5, "completions/mean_terminated_length": 235.5, "completions/min_length": 126.0, "completions/min_terminated_length": 126.0, "entropy": 2.7660705894231796, "epoch": 0.005985480383070745, "frac_reward_zero_std": 0.0, "grad_norm": 5.41533899307251, "learning_rate": 9.533333333333334e-06, "loss": -0.0834, "num_tokens": 328524.0, "reward": 0.6477268934249878, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9821428656578064, "reward_count_adherence_std": 0.05050762742757797, "reward_meter_mean": 0.7103838920593262, "reward_meter_std": 0.29926469922065735, "reward_std": 0.3904498219490051, "reward_total_composite_mean": 0.6477268934249878, "reward_total_composite_std": 0.3904498517513275, "reward_total_mean": 0.6477268934249878, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9821428656578064, "rewards/count_adherence/std": 0.05050762742757797, "rewards/meter/mean": 0.7103838920593262, "rewards/meter/std": 0.29926469922065735, "rewards/total_composite/mean": 0.6477268934249878, "rewards/total_composite/std": 0.3904498517513275, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0317730903625488, "sampling/importance_sampling_ratio/min": 0.1159641370177269, "sampling/sampling_logp_difference/max": 2.1544742584228516, "sampling/sampling_logp_difference/mean": 0.19282367825508118, "step": 155 }, { "clip_ratio/high_max": 0.08997475728392601, "clip_ratio/high_mean": 0.08997475728392601, "clip_ratio/low_mean": 0.05361151322722435, "clip_ratio/low_min": 0.05361151322722435, "clip_ratio/region_mean": 0.14358627051115036, "completions/clipped_ratio": 0.0, "completions/max_length": 117.0, "completions/max_terminated_length": 117.0, "completions/mean_length": 105.625, "completions/mean_terminated_length": 105.625, "completions/min_length": 90.0, "completions/min_terminated_length": 90.0, "entropy": 1.4543365985155106, "epoch": 0.006024096385542169, "frac_reward_zero_std": 0.0, "grad_norm": 8.701234817504883, "learning_rate": 9.530303030303031e-06, "loss": 0.0523, "num_tokens": 330785.0, "reward": 0.5999155044555664, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.6397774815559387, "reward_meter_std": 0.31731224060058594, "reward_std": 0.2907305359840393, "reward_total_composite_mean": 0.5999155044555664, "reward_total_composite_std": 0.2907305359840393, "reward_total_mean": 0.5999155044555664, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.6397774815559387, "rewards/meter/std": 0.31731224060058594, "rewards/total_composite/mean": 0.5999155044555664, "rewards/total_composite/std": 0.2907305359840393, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0126723051071167, "sampling/importance_sampling_ratio/min": 0.18579503893852234, "sampling/sampling_logp_difference/max": 1.6831111907958984, "sampling/sampling_logp_difference/mean": 0.16831091046333313, "step": 156 }, { "clip_ratio/high_max": 0.14061870239675045, "clip_ratio/high_mean": 0.14061870239675045, "clip_ratio/low_mean": 0.026209676638245583, "clip_ratio/low_min": 0.026209676638245583, "clip_ratio/region_mean": 0.16682837903499603, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 62.625, "completions/mean_terminated_length": 62.625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 2.5809740722179413, "epoch": 0.006062712388013593, "frac_reward_zero_std": 0.0, "grad_norm": 9.539356231689453, "learning_rate": 9.527272727272729e-06, "loss": 0.0172, "num_tokens": 332526.0, "reward": 0.8717015385627747, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8717015385627747, "reward_meter_std": 0.322393000125885, "reward_std": 0.322393000125885, "reward_total_composite_mean": 0.8717015385627747, "reward_total_composite_std": 0.322393000125885, "reward_total_mean": 0.8717015385627747, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8717015385627747, "rewards/meter/std": 0.322393000125885, "rewards/total_composite/mean": 0.8717015385627747, "rewards/total_composite/std": 0.322393000125885, "sampling/importance_sampling_ratio/max": 1.7814452648162842, "sampling/importance_sampling_ratio/mean": 1.0461691617965698, "sampling/importance_sampling_ratio/min": 0.20349915325641632, "sampling/sampling_logp_difference/max": 1.5920934677124023, "sampling/sampling_logp_difference/mean": 0.18296034634113312, "step": 157 }, { "clip_ratio/high_max": 0.11192020168527961, "clip_ratio/high_mean": 0.11192020168527961, "clip_ratio/low_mean": 0.03427810175344348, "clip_ratio/low_min": 0.03427810175344348, "clip_ratio/region_mean": 0.1461983034387231, "completions/clipped_ratio": 0.0, "completions/max_length": 43.0, "completions/max_terminated_length": 43.0, "completions/mean_length": 32.375, "completions/mean_terminated_length": 32.375, "completions/min_length": 21.0, "completions/min_terminated_length": 21.0, "entropy": 1.62221197783947, "epoch": 0.006101328390485017, "frac_reward_zero_std": 0.0, "grad_norm": 13.795117378234863, "learning_rate": 9.524242424242424e-06, "loss": 0.1023, "num_tokens": 334145.0, "reward": 0.86896812915802, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.86896812915802, "reward_meter_std": 0.2910270094871521, "reward_std": 0.2910270094871521, "reward_total_composite_mean": 0.86896812915802, "reward_total_composite_std": 0.2910270094871521, "reward_total_mean": 0.86896812915802, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.86896812915802, "rewards/meter/std": 0.2910270094871521, "rewards/total_composite/mean": 0.86896812915802, "rewards/total_composite/std": 0.2910270094871521, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0380147695541382, "sampling/importance_sampling_ratio/min": 0.24247469007968903, "sampling/sampling_logp_difference/max": 1.4168579578399658, "sampling/sampling_logp_difference/mean": 0.19816143810749054, "step": 158 }, { "clip_ratio/high_max": 0.13957421202212572, "clip_ratio/high_mean": 0.13957421202212572, "clip_ratio/low_mean": 0.043226663023233414, "clip_ratio/low_min": 0.043226663023233414, "clip_ratio/region_mean": 0.18280087504535913, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 56.5, "completions/mean_terminated_length": 56.5, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 2.072466492652893, "epoch": 0.006139944392956441, "frac_reward_zero_std": 0.0, "grad_norm": 11.608582496643066, "learning_rate": 9.521212121212121e-06, "loss": 0.0781, "num_tokens": 335861.0, "reward": 0.6755526065826416, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6755526065826416, "reward_meter_std": 0.40379220247268677, "reward_std": 0.40379223227500916, "reward_total_composite_mean": 0.6755526065826416, "reward_total_composite_std": 0.40379220247268677, "reward_total_mean": 0.6755526065826416, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6755526065826416, "rewards/meter/std": 0.40379220247268677, "rewards/total_composite/mean": 0.6755526065826416, "rewards/total_composite/std": 0.40379220247268677, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0527642965316772, "sampling/importance_sampling_ratio/min": 0.32885676622390747, "sampling/sampling_logp_difference/max": 1.1121330261230469, "sampling/sampling_logp_difference/mean": 0.1799980252981186, "step": 159 }, { "clip_ratio/high_max": 0.08933841064572334, "clip_ratio/high_mean": 0.08933841064572334, "clip_ratio/low_mean": 0.07780237961560488, "clip_ratio/low_min": 0.07780237961560488, "clip_ratio/region_mean": 0.16714079026132822, "completions/clipped_ratio": 0.0, "completions/max_length": 113.0, "completions/max_terminated_length": 113.0, "completions/mean_length": 81.625, "completions/mean_terminated_length": 81.625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 2.947203129529953, "epoch": 0.006178560395427865, "frac_reward_zero_std": 0.0, "grad_norm": 9.607455253601074, "learning_rate": 9.518181818181819e-06, "loss": -0.1254, "num_tokens": 337794.0, "reward": 0.5209656357765198, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5209656357765198, "reward_meter_std": 0.3587253987789154, "reward_std": 0.358725368976593, "reward_total_composite_mean": 0.5209656357765198, "reward_total_composite_std": 0.3587253987789154, "reward_total_mean": 0.5209656357765198, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5209656357765198, "rewards/meter/std": 0.3587253987789154, "rewards/total_composite/mean": 0.5209656357765198, "rewards/total_composite/std": 0.3587253987789154, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.049707293510437, "sampling/importance_sampling_ratio/min": 0.35801321268081665, "sampling/sampling_logp_difference/max": 1.0271854400634766, "sampling/sampling_logp_difference/mean": 0.20390784740447998, "step": 160 }, { "clip_ratio/high_max": 0.15176175348460674, "clip_ratio/high_mean": 0.15176175348460674, "clip_ratio/low_mean": 0.0405045822262764, "clip_ratio/low_min": 0.0405045822262764, "clip_ratio/region_mean": 0.19226633571088314, "completions/clipped_ratio": 0.0, "completions/max_length": 206.0, "completions/max_terminated_length": 206.0, "completions/mean_length": 173.5, "completions/mean_terminated_length": 173.5, "completions/min_length": 139.0, "completions/min_terminated_length": 139.0, "entropy": 3.2587929368019104, "epoch": 0.0062171763978992895, "frac_reward_zero_std": 0.0, "grad_norm": 6.381593704223633, "learning_rate": 9.515151515151516e-06, "loss": -0.0557, "num_tokens": 340718.0, "reward": 0.8628791570663452, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.8734483122825623, "reward_meter_std": 0.19228114187717438, "reward_std": 0.2208014875650406, "reward_total_composite_mean": 0.8628791570663452, "reward_total_composite_std": 0.2208014875650406, "reward_total_mean": 0.8628791570663452, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.8734483122825623, "rewards/meter/std": 0.19228114187717438, "rewards/total_composite/mean": 0.8628791570663452, "rewards/total_composite/std": 0.2208014875650406, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.044055700302124, "sampling/importance_sampling_ratio/min": 0.3062398135662079, "sampling/sampling_logp_difference/max": 1.1833868026733398, "sampling/sampling_logp_difference/mean": 0.20080114901065826, "step": 161 }, { "clip_ratio/high_max": 0.15742158330976963, "clip_ratio/high_mean": 0.15742158330976963, "clip_ratio/low_mean": 0.07329358533024788, "clip_ratio/low_min": 0.07329358533024788, "clip_ratio/region_mean": 0.2307151686400175, "completions/clipped_ratio": 0.0, "completions/max_length": 91.0, "completions/max_terminated_length": 91.0, "completions/mean_length": 76.625, "completions/mean_terminated_length": 76.625, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 2.3186896294355392, "epoch": 0.006255792400370714, "frac_reward_zero_std": 0.0, "grad_norm": 12.352027893066406, "learning_rate": 9.512121212121213e-06, "loss": -0.0145, "num_tokens": 342611.0, "reward": 0.7090976238250732, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7090976238250732, "reward_meter_std": 0.351256400346756, "reward_std": 0.3512563705444336, "reward_total_composite_mean": 0.7090976238250732, "reward_total_composite_std": 0.351256400346756, "reward_total_mean": 0.7090976238250732, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7090976238250732, "rewards/meter/std": 0.351256400346756, "rewards/total_composite/mean": 0.7090976238250732, "rewards/total_composite/std": 0.351256400346756, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0393997430801392, "sampling/importance_sampling_ratio/min": 0.2703118920326233, "sampling/sampling_logp_difference/max": 1.341689109802246, "sampling/sampling_logp_difference/mean": 0.2120855152606964, "step": 162 }, { "clip_ratio/high_max": 0.09156403131783009, "clip_ratio/high_mean": 0.09156403131783009, "clip_ratio/low_mean": 0.04785826615989208, "clip_ratio/low_min": 0.04785826615989208, "clip_ratio/region_mean": 0.13942229747772217, "completions/clipped_ratio": 0.0, "completions/max_length": 504.0, "completions/max_terminated_length": 504.0, "completions/mean_length": 451.0, "completions/mean_terminated_length": 451.0, "completions/min_length": 392.0, "completions/min_terminated_length": 392.0, "entropy": 3.1186185479164124, "epoch": 0.006294408402842138, "frac_reward_zero_std": 0.0, "grad_norm": 3.614668846130371, "learning_rate": 9.50909090909091e-06, "loss": 0.0554, "num_tokens": 347883.0, "reward": 0.5725052356719971, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8181818127632141, "reward_count_adherence_std": 0.06872081756591797, "reward_meter_mean": 0.8174892663955688, "reward_meter_std": 0.28463214635849, "reward_std": 0.3688006103038788, "reward_total_composite_mean": 0.5725052356719971, "reward_total_composite_std": 0.36880064010620117, "reward_total_mean": 0.5725052356719971, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8181818127632141, "rewards/count_adherence/std": 0.06872081756591797, "rewards/meter/mean": 0.8174892663955688, "rewards/meter/std": 0.28463214635849, "rewards/total_composite/mean": 0.5725052356719971, "rewards/total_composite/std": 0.36880064010620117, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.045919418334961, "sampling/importance_sampling_ratio/min": 0.09532421082258224, "sampling/sampling_logp_difference/max": 2.3504714965820312, "sampling/sampling_logp_difference/mean": 0.1946493536233902, "step": 163 }, { "clip_ratio/high_max": 0.09482496604323387, "clip_ratio/high_mean": 0.09482496604323387, "clip_ratio/low_mean": 0.11853201128542423, "clip_ratio/low_min": 0.11853201128542423, "clip_ratio/region_mean": 0.2133569773286581, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 65.0, "completions/mean_terminated_length": 65.0, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 3.003392845392227, "epoch": 0.006333024405313562, "frac_reward_zero_std": 0.0, "grad_norm": 10.339271545410156, "learning_rate": 9.506060606060606e-06, "loss": 0.0587, "num_tokens": 349747.0, "reward": 0.47777289152145386, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.47777289152145386, "reward_meter_std": 0.44221097230911255, "reward_std": 0.44221097230911255, "reward_total_composite_mean": 0.47777289152145386, "reward_total_composite_std": 0.44221097230911255, "reward_total_mean": 0.47777289152145386, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.47777289152145386, "rewards/meter/std": 0.44221097230911255, "rewards/total_composite/mean": 0.47777289152145386, "rewards/total_composite/std": 0.44221097230911255, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0429495573043823, "sampling/importance_sampling_ratio/min": 0.2992764711380005, "sampling/sampling_logp_difference/max": 1.2063875198364258, "sampling/sampling_logp_difference/mean": 0.2009221911430359, "step": 164 }, { "clip_ratio/high_max": 0.07877860497683287, "clip_ratio/high_mean": 0.07877860497683287, "clip_ratio/low_mean": 0.08252524584531784, "clip_ratio/low_min": 0.08252524584531784, "clip_ratio/region_mean": 0.1613038508221507, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 61.5, "completions/mean_terminated_length": 61.5, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 2.010311871767044, "epoch": 0.006371640407784986, "frac_reward_zero_std": 0.0, "grad_norm": 13.097195625305176, "learning_rate": 9.503030303030303e-06, "loss": 0.0353, "num_tokens": 351519.0, "reward": 0.5606287121772766, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5606287121772766, "reward_meter_std": 0.3949960768222809, "reward_std": 0.39499610662460327, "reward_total_composite_mean": 0.5606287121772766, "reward_total_composite_std": 0.3949960768222809, "reward_total_mean": 0.5606287121772766, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5606287121772766, "rewards/meter/std": 0.3949960768222809, "rewards/total_composite/mean": 0.5606287121772766, "rewards/total_composite/std": 0.3949960768222809, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0260679721832275, "sampling/importance_sampling_ratio/min": 0.20480231940746307, "sampling/sampling_logp_difference/max": 1.585710048675537, "sampling/sampling_logp_difference/mean": 0.18365828692913055, "step": 165 }, { "clip_ratio/high_max": 0.13404671289026737, "clip_ratio/high_mean": 0.13404671289026737, "clip_ratio/low_mean": 0.0659086387604475, "clip_ratio/low_min": 0.0659086387604475, "clip_ratio/region_mean": 0.19995535165071487, "completions/clipped_ratio": 0.0, "completions/max_length": 159.0, "completions/max_terminated_length": 159.0, "completions/mean_length": 123.625, "completions/mean_terminated_length": 123.625, "completions/min_length": 99.0, "completions/min_terminated_length": 99.0, "entropy": 3.55351784825325, "epoch": 0.00641025641025641, "frac_reward_zero_std": 0.0, "grad_norm": 7.968050956726074, "learning_rate": 9.5e-06, "loss": -0.0261, "num_tokens": 353796.0, "reward": 0.35550376772880554, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.37855178117752075, "reward_meter_std": 0.23558726906776428, "reward_std": 0.26453739404678345, "reward_total_composite_mean": 0.35550376772880554, "reward_total_composite_std": 0.26453739404678345, "reward_total_mean": 0.35550376772880554, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.37855178117752075, "rewards/meter/std": 0.23558726906776428, "rewards/total_composite/mean": 0.35550376772880554, "rewards/total_composite/std": 0.26453739404678345, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0575261116027832, "sampling/importance_sampling_ratio/min": 0.24354171752929688, "sampling/sampling_logp_difference/max": 1.4124670028686523, "sampling/sampling_logp_difference/mean": 0.23242639005184174, "step": 166 }, { "clip_ratio/high_max": 0.11530855856835842, "clip_ratio/high_mean": 0.11530855856835842, "clip_ratio/low_mean": 0.06835224945098162, "clip_ratio/low_min": 0.06835224945098162, "clip_ratio/region_mean": 0.18366080801934004, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 53.625, "completions/mean_terminated_length": 53.625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 2.5232774317264557, "epoch": 0.006448872412727834, "frac_reward_zero_std": 0.0, "grad_norm": 12.225397109985352, "learning_rate": 9.496969696969698e-06, "loss": 0.128, "num_tokens": 355489.0, "reward": 0.541317880153656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.541317880153656, "reward_meter_std": 0.35997992753982544, "reward_std": 0.35997989773750305, "reward_total_composite_mean": 0.541317880153656, "reward_total_composite_std": 0.35997992753982544, "reward_total_mean": 0.541317880153656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.541317880153656, "rewards/meter/std": 0.35997992753982544, "rewards/total_composite/mean": 0.541317880153656, "rewards/total_composite/std": 0.35997992753982544, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0362927913665771, "sampling/importance_sampling_ratio/min": 0.2710648775100708, "sampling/sampling_logp_difference/max": 1.56561279296875, "sampling/sampling_logp_difference/mean": 0.19463400542736053, "step": 167 }, { "clip_ratio/high_max": 0.08096018619835377, "clip_ratio/high_mean": 0.08096018619835377, "clip_ratio/low_mean": 0.08560106623917818, "clip_ratio/low_min": 0.08560106623917818, "clip_ratio/region_mean": 0.16656125243753195, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 72.375, "completions/mean_terminated_length": 72.375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 2.740328684449196, "epoch": 0.006487488415199258, "frac_reward_zero_std": 0.0, "grad_norm": 9.189430236816406, "learning_rate": 9.493939393939395e-06, "loss": 0.0174, "num_tokens": 357276.0, "reward": 0.521911084651947, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.521911084651947, "reward_meter_std": 0.40068677067756653, "reward_std": 0.40068677067756653, "reward_total_composite_mean": 0.521911084651947, "reward_total_composite_std": 0.40068677067756653, "reward_total_mean": 0.521911084651947, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.521911084651947, "rewards/meter/std": 0.40068677067756653, "rewards/total_composite/mean": 0.521911084651947, "rewards/total_composite/std": 0.40068677067756653, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0414764881134033, "sampling/importance_sampling_ratio/min": 0.2703523635864258, "sampling/sampling_logp_difference/max": 1.3080291748046875, "sampling/sampling_logp_difference/mean": 0.19903360307216644, "step": 168 }, { "clip_ratio/high_max": 0.12107311747968197, "clip_ratio/high_mean": 0.12107311747968197, "clip_ratio/low_mean": 0.08651185780763626, "clip_ratio/low_min": 0.08651185780763626, "clip_ratio/region_mean": 0.20758497528731823, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 47.875, "completions/mean_terminated_length": 47.875, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 3.0451967269182205, "epoch": 0.006526104417670682, "frac_reward_zero_std": 0.0, "grad_norm": 13.522438049316406, "learning_rate": 9.490909090909092e-06, "loss": 0.2465, "num_tokens": 358907.0, "reward": 0.4249013066291809, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4249013066291809, "reward_meter_std": 0.4389844834804535, "reward_std": 0.4389844834804535, "reward_total_composite_mean": 0.4249013066291809, "reward_total_composite_std": 0.4389844834804535, "reward_total_mean": 0.4249013066291809, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4249013066291809, "rewards/meter/std": 0.4389844834804535, "rewards/total_composite/mean": 0.4249013066291809, "rewards/total_composite/std": 0.4389844834804535, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0431842803955078, "sampling/importance_sampling_ratio/min": 0.3039137125015259, "sampling/sampling_logp_difference/max": 1.1910114288330078, "sampling/sampling_logp_difference/mean": 0.2200341522693634, "step": 169 }, { "clip_ratio/high_max": 0.08509290590882301, "clip_ratio/high_mean": 0.08509290590882301, "clip_ratio/low_mean": 0.0997670404613018, "clip_ratio/low_min": 0.0997670404613018, "clip_ratio/region_mean": 0.18485994637012482, "completions/clipped_ratio": 0.0, "completions/max_length": 41.0, "completions/max_terminated_length": 41.0, "completions/mean_length": 33.375, "completions/mean_terminated_length": 33.375, "completions/min_length": 23.0, "completions/min_terminated_length": 23.0, "entropy": 3.248675227165222, "epoch": 0.006564720420142107, "frac_reward_zero_std": 0.0, "grad_norm": 16.293785095214844, "learning_rate": 9.487878787878788e-06, "loss": 0.0794, "num_tokens": 360430.0, "reward": 0.33747631311416626, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.46223390102386475, "reward_meter_std": 0.4552871286869049, "reward_std": 0.423090398311615, "reward_total_composite_mean": 0.33747631311416626, "reward_total_composite_std": 0.423090398311615, "reward_total_mean": 0.33747631311416626, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.46223390102386475, "rewards/meter/std": 0.4552871286869049, "rewards/total_composite/mean": 0.33747631311416626, "rewards/total_composite/std": 0.423090398311615, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0465396642684937, "sampling/importance_sampling_ratio/min": 0.3476763367652893, "sampling/sampling_logp_difference/max": 1.056483268737793, "sampling/sampling_logp_difference/mean": 0.21340948343276978, "step": 170 }, { "clip_ratio/high_max": 0.09890040010213852, "clip_ratio/high_mean": 0.09890040010213852, "clip_ratio/low_mean": 0.045382389798760414, "clip_ratio/low_min": 0.045382389798760414, "clip_ratio/region_mean": 0.14428278990089893, "completions/clipped_ratio": 0.0, "completions/max_length": 393.0, "completions/max_terminated_length": 393.0, "completions/mean_length": 372.5, "completions/mean_terminated_length": 372.5, "completions/min_length": 346.0, "completions/min_terminated_length": 346.0, "entropy": 2.7181632220745087, "epoch": 0.006603336422613531, "frac_reward_zero_std": 0.0, "grad_norm": 3.9159412384033203, "learning_rate": 9.484848484848485e-06, "loss": 0.0339, "num_tokens": 364930.0, "reward": 0.6796014308929443, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.05143444612622261, "reward_meter_mean": 0.8391759395599365, "reward_meter_std": 0.14736339449882507, "reward_std": 0.3177638053894043, "reward_total_composite_mean": 0.6796014308929443, "reward_total_composite_std": 0.3177638053894043, "reward_total_mean": 0.6796014308929443, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.05143444612622261, "rewards/meter/mean": 0.8391759395599365, "rewards/meter/std": 0.14736339449882507, "rewards/total_composite/mean": 0.6796014308929443, "rewards/total_composite/std": 0.3177638053894043, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0409563779830933, "sampling/importance_sampling_ratio/min": 0.2202359437942505, "sampling/sampling_logp_difference/max": 1.5130558013916016, "sampling/sampling_logp_difference/mean": 0.18074527382850647, "step": 171 }, { "clip_ratio/high_max": 0.04081328213214874, "clip_ratio/high_mean": 0.04081328213214874, "clip_ratio/low_mean": 0.13063165172934532, "clip_ratio/low_min": 0.13063165172934532, "clip_ratio/region_mean": 0.17144493386149406, "completions/clipped_ratio": 0.0, "completions/max_length": 141.0, "completions/max_terminated_length": 141.0, "completions/mean_length": 93.5, "completions/mean_terminated_length": 93.5, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 2.3088208436965942, "epoch": 0.0066419524250849555, "frac_reward_zero_std": 0.0, "grad_norm": 10.551653861999512, "learning_rate": 9.481818181818182e-06, "loss": -0.0949, "num_tokens": 367070.0, "reward": 0.3134363889694214, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3134363889694214, "reward_meter_std": 0.3427402675151825, "reward_std": 0.3427402675151825, "reward_total_composite_mean": 0.3134363889694214, "reward_total_composite_std": 0.3427402675151825, "reward_total_mean": 0.3134363889694214, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3134363889694214, "rewards/meter/std": 0.3427402675151825, "rewards/total_composite/mean": 0.3134363889694214, "rewards/total_composite/std": 0.3427402675151825, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0271856784820557, "sampling/importance_sampling_ratio/min": 0.2899644374847412, "sampling/sampling_logp_difference/max": 1.237997055053711, "sampling/sampling_logp_difference/mean": 0.209889754652977, "step": 172 }, { "clip_ratio/high_max": 0.06190796010196209, "clip_ratio/high_mean": 0.06190796010196209, "clip_ratio/low_mean": 0.05308797210454941, "clip_ratio/low_min": 0.05308797210454941, "clip_ratio/region_mean": 0.1149959322065115, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 504.0, "completions/mean_length": 451.0, "completions/mean_terminated_length": 442.2857360839844, "completions/min_length": 316.0, "completions/min_terminated_length": 316.0, "entropy": 2.9574913382530212, "epoch": 0.00668056842755638, "frac_reward_zero_std": 0.0, "grad_norm": 3.27034068107605, "learning_rate": 9.47878787878788e-06, "loss": 0.1304, "num_tokens": 371854.0, "reward": 0.43490633368492126, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.9204545617103577, "reward_count_adherence_std": 0.058260902762413025, "reward_meter_mean": 0.6058165431022644, "reward_meter_std": 0.27364325523376465, "reward_std": 0.3389948904514313, "reward_total_composite_mean": 0.43490633368492126, "reward_total_composite_std": 0.33899492025375366, "reward_total_mean": 0.43490633368492126, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.9204545617103577, "rewards/count_adherence/std": 0.058260902762413025, "rewards/meter/mean": 0.6058165431022644, "rewards/meter/std": 0.27364325523376465, "rewards/total_composite/mean": 0.43490633368492126, "rewards/total_composite/std": 0.33899492025375366, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0502684116363525, "sampling/importance_sampling_ratio/min": 0.22345705330371857, "sampling/sampling_logp_difference/max": 1.4985361099243164, "sampling/sampling_logp_difference/mean": 0.19972197711467743, "step": 173 }, { "clip_ratio/high_max": 0.13539652153849602, "clip_ratio/high_mean": 0.13539652153849602, "clip_ratio/low_mean": 0.05789176933467388, "clip_ratio/low_min": 0.05789176933467388, "clip_ratio/region_mean": 0.1932882908731699, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 55.875, "completions/mean_terminated_length": 55.875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.167596936225891, "epoch": 0.006719184430027804, "frac_reward_zero_std": 0.0, "grad_norm": 11.655610084533691, "learning_rate": 9.475757575757577e-06, "loss": 0.0781, "num_tokens": 373685.0, "reward": 0.7013630867004395, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7013630867004395, "reward_meter_std": 0.37237003445625305, "reward_std": 0.37237003445625305, "reward_total_composite_mean": 0.7013630867004395, "reward_total_composite_std": 0.37237003445625305, "reward_total_mean": 0.7013630867004395, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7013630867004395, "rewards/meter/std": 0.37237003445625305, "rewards/total_composite/mean": 0.7013630867004395, "rewards/total_composite/std": 0.37237003445625305, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0189765691757202, "sampling/importance_sampling_ratio/min": 0.16070450842380524, "sampling/sampling_logp_difference/max": 1.8281879425048828, "sampling/sampling_logp_difference/mean": 0.19981878995895386, "step": 174 }, { "clip_ratio/high_max": 0.1139191659167409, "clip_ratio/high_mean": 0.1139191659167409, "clip_ratio/low_mean": 0.05846922844648361, "clip_ratio/low_min": 0.05846922844648361, "clip_ratio/region_mean": 0.1723883943632245, "completions/clipped_ratio": 0.0, "completions/max_length": 122.0, "completions/max_terminated_length": 122.0, "completions/mean_length": 99.25, "completions/mean_terminated_length": 99.25, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 3.0380934178829193, "epoch": 0.006757800432499228, "frac_reward_zero_std": 0.0, "grad_norm": 8.652692794799805, "learning_rate": 9.472727272727274e-06, "loss": -0.0845, "num_tokens": 375783.0, "reward": 0.8306900858879089, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8306900858879089, "reward_meter_std": 0.2705877721309662, "reward_std": 0.2705877721309662, "reward_total_composite_mean": 0.8306900858879089, "reward_total_composite_std": 0.2705877721309662, "reward_total_mean": 0.8306900858879089, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8306900858879089, "rewards/meter/std": 0.2705877721309662, "rewards/total_composite/mean": 0.8306900858879089, "rewards/total_composite/std": 0.2705877721309662, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0498780012130737, "sampling/importance_sampling_ratio/min": 0.1981683075428009, "sampling/sampling_logp_difference/max": 1.618638515472412, "sampling/sampling_logp_difference/mean": 0.20954445004463196, "step": 175 }, { "clip_ratio/high_max": 0.10677518881857395, "clip_ratio/high_mean": 0.10677518881857395, "clip_ratio/low_mean": 0.07028611842542887, "clip_ratio/low_min": 0.07028611842542887, "clip_ratio/region_mean": 0.17706130724400282, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 55.75, "completions/mean_terminated_length": 55.75, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 1.1572269052267075, "epoch": 0.006796416434970652, "frac_reward_zero_std": 0.0, "grad_norm": 18.11098861694336, "learning_rate": 9.469696969696971e-06, "loss": 0.0503, "num_tokens": 377613.0, "reward": 0.5684157609939575, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5684157609939575, "reward_meter_std": 0.3562447726726532, "reward_std": 0.3562447726726532, "reward_total_composite_mean": 0.5684157609939575, "reward_total_composite_std": 0.3562447726726532, "reward_total_mean": 0.5684157609939575, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5684157609939575, "rewards/meter/std": 0.3562447726726532, "rewards/total_composite/mean": 0.5684157609939575, "rewards/total_composite/std": 0.3562447726726532, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9817885756492615, "sampling/importance_sampling_ratio/min": 0.15001113712787628, "sampling/sampling_logp_difference/max": 1.8970457315444946, "sampling/sampling_logp_difference/mean": 0.18087293207645416, "step": 176 }, { "clip_ratio/high_max": 0.10677864961326122, "clip_ratio/high_mean": 0.10677864961326122, "clip_ratio/low_mean": 0.07266573421657085, "clip_ratio/low_min": 0.07266573421657085, "clip_ratio/region_mean": 0.17944438382983208, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 65.625, "completions/mean_terminated_length": 65.625, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 2.025869235396385, "epoch": 0.006835032437442076, "frac_reward_zero_std": 0.0, "grad_norm": 11.097681999206543, "learning_rate": 9.466666666666667e-06, "loss": 0.0261, "num_tokens": 379410.0, "reward": 0.6728242039680481, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6728242039680481, "reward_meter_std": 0.35246020555496216, "reward_std": 0.35246017575263977, "reward_total_composite_mean": 0.6728242039680481, "reward_total_composite_std": 0.35246020555496216, "reward_total_mean": 0.6728242039680481, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6728242039680481, "rewards/meter/std": 0.35246020555496216, "rewards/total_composite/mean": 0.6728242039680481, "rewards/total_composite/std": 0.35246020555496216, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0345712900161743, "sampling/importance_sampling_ratio/min": 0.21794182062149048, "sampling/sampling_logp_difference/max": 1.5235271453857422, "sampling/sampling_logp_difference/mean": 0.1819072812795639, "step": 177 }, { "clip_ratio/high_max": 0.053513072431087494, "clip_ratio/high_mean": 0.053513072431087494, "clip_ratio/low_mean": 0.1264551393687725, "clip_ratio/low_min": 0.1264551393687725, "clip_ratio/region_mean": 0.17996821179986, "completions/clipped_ratio": 0.0, "completions/max_length": 112.0, "completions/max_terminated_length": 112.0, "completions/mean_length": 95.375, "completions/mean_terminated_length": 95.375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 2.3764619678258896, "epoch": 0.0068736484399135, "frac_reward_zero_std": 0.0, "grad_norm": 8.50960636138916, "learning_rate": 9.463636363636364e-06, "loss": 0.1003, "num_tokens": 381389.0, "reward": 0.2792768180370331, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2792768180370331, "reward_meter_std": 0.3471120297908783, "reward_std": 0.3471120595932007, "reward_total_composite_mean": 0.2792768180370331, "reward_total_composite_std": 0.3471120297908783, "reward_total_mean": 0.2792768180370331, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2792768180370331, "rewards/meter/std": 0.3471120297908783, "rewards/total_composite/mean": 0.2792768180370331, "rewards/total_composite/std": 0.3471120297908783, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0582326650619507, "sampling/importance_sampling_ratio/min": 0.331091970205307, "sampling/sampling_logp_difference/max": 1.1053590774536133, "sampling/sampling_logp_difference/mean": 0.18758107721805573, "step": 178 }, { "clip_ratio/high_max": 0.15819299593567848, "clip_ratio/high_mean": 0.15819299593567848, "clip_ratio/low_mean": 0.05450693517923355, "clip_ratio/low_min": 0.05450693517923355, "clip_ratio/region_mean": 0.21269993111491203, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 39.0, "completions/mean_terminated_length": 39.0, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 2.807357758283615, "epoch": 0.006912264442384924, "frac_reward_zero_std": 0.0, "grad_norm": 13.35677433013916, "learning_rate": 9.460606060606061e-06, "loss": 0.0501, "num_tokens": 382901.0, "reward": 0.742904782295227, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.742904782295227, "reward_meter_std": 0.4480074644088745, "reward_std": 0.4480074346065521, "reward_total_composite_mean": 0.742904782295227, "reward_total_composite_std": 0.4480074644088745, "reward_total_mean": 0.742904782295227, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.742904782295227, "rewards/meter/std": 0.4480074644088745, "rewards/total_composite/mean": 0.742904782295227, "rewards/total_composite/std": 0.4480074644088745, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0228500366210938, "sampling/importance_sampling_ratio/min": 0.21225318312644958, "sampling/sampling_logp_difference/max": 1.5499753952026367, "sampling/sampling_logp_difference/mean": 0.2040482759475708, "step": 179 }, { "clip_ratio/high_max": 0.0775204561650753, "clip_ratio/high_mean": 0.0775204561650753, "clip_ratio/low_mean": 0.10372502729296684, "clip_ratio/low_min": 0.10372502729296684, "clip_ratio/region_mean": 0.18124548345804214, "completions/clipped_ratio": 0.0, "completions/max_length": 140.0, "completions/max_terminated_length": 140.0, "completions/mean_length": 118.875, "completions/mean_terminated_length": 118.875, "completions/min_length": 91.0, "completions/min_terminated_length": 91.0, "entropy": 2.9363907277584076, "epoch": 0.006950880444856348, "frac_reward_zero_std": 0.0, "grad_norm": 7.980728626251221, "learning_rate": 9.457575757575759e-06, "loss": -0.0462, "num_tokens": 385212.0, "reward": 0.4976061284542084, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.6352285146713257, "reward_meter_std": 0.3728267252445221, "reward_std": 0.40696853399276733, "reward_total_composite_mean": 0.4976061284542084, "reward_total_composite_std": 0.40696853399276733, "reward_total_mean": 0.4976061284542084, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.6352285146713257, "rewards/meter/std": 0.3728267252445221, "rewards/total_composite/mean": 0.4976061284542084, "rewards/total_composite/std": 0.40696853399276733, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0363506078720093, "sampling/importance_sampling_ratio/min": 0.2866778075695038, "sampling/sampling_logp_difference/max": 1.2493963241577148, "sampling/sampling_logp_difference/mean": 0.20611317455768585, "step": 180 }, { "clip_ratio/high_max": 0.11146864108741283, "clip_ratio/high_mean": 0.11146864108741283, "clip_ratio/low_mean": 0.051841133274137974, "clip_ratio/low_min": 0.051841133274137974, "clip_ratio/region_mean": 0.1633097743615508, "completions/clipped_ratio": 0.0, "completions/max_length": 204.0, "completions/max_terminated_length": 204.0, "completions/mean_length": 174.625, "completions/mean_terminated_length": 174.625, "completions/min_length": 141.0, "completions/min_terminated_length": 141.0, "entropy": 3.1949117481708527, "epoch": 0.0069894964473277725, "frac_reward_zero_std": 0.0, "grad_norm": 5.923155784606934, "learning_rate": 9.454545454545456e-06, "loss": 0.0206, "num_tokens": 388081.0, "reward": 0.5388948917388916, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.6006770133972168, "reward_meter_std": 0.31185153126716614, "reward_std": 0.3470546305179596, "reward_total_composite_mean": 0.5388948917388916, "reward_total_composite_std": 0.3470546007156372, "reward_total_mean": 0.5388948917388916, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.6006770133972168, "rewards/meter/std": 0.31185153126716614, "rewards/total_composite/mean": 0.5388948917388916, "rewards/total_composite/std": 0.3470546007156372, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0360268354415894, "sampling/importance_sampling_ratio/min": 0.25199154019355774, "sampling/sampling_logp_difference/max": 1.3783597946166992, "sampling/sampling_logp_difference/mean": 0.2052806168794632, "step": 181 }, { "clip_ratio/high_max": 0.1037982078269124, "clip_ratio/high_mean": 0.1037982078269124, "clip_ratio/low_mean": 0.06412622984498739, "clip_ratio/low_min": 0.06412622984498739, "clip_ratio/region_mean": 0.1679244376718998, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 84.75, "completions/mean_terminated_length": 84.75, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 2.674738720059395, "epoch": 0.007028112449799197, "frac_reward_zero_std": 0.0, "grad_norm": 8.314396858215332, "learning_rate": 9.451515151515153e-06, "loss": -0.0381, "num_tokens": 390055.0, "reward": 0.8241270780563354, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8241270780563354, "reward_meter_std": 0.21255002915859222, "reward_std": 0.21255002915859222, "reward_total_composite_mean": 0.8241270780563354, "reward_total_composite_std": 0.21255002915859222, "reward_total_mean": 0.8241270780563354, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8241270780563354, "rewards/meter/std": 0.21255002915859222, "rewards/total_composite/mean": 0.8241270780563354, "rewards/total_composite/std": 0.21255002915859222, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0361807346343994, "sampling/importance_sampling_ratio/min": 0.211969792842865, "sampling/sampling_logp_difference/max": 1.5513114929199219, "sampling/sampling_logp_difference/mean": 0.1786930412054062, "step": 182 }, { "clip_ratio/high_max": 0.016119910404086113, "clip_ratio/high_mean": 0.016119910404086113, "clip_ratio/low_mean": 0.031273381784558296, "clip_ratio/low_min": 0.031273381784558296, "clip_ratio/region_mean": 0.04739329218864441, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 486.0, "completions/mean_length": 485.5, "completions/mean_terminated_length": 441.3333435058594, "completions/min_length": 396.0, "completions/min_terminated_length": 396.0, "entropy": 1.6914453506469727, "epoch": 0.007066728452270621, "frac_reward_zero_std": 0.0, "grad_norm": 3.2879745960235596, "learning_rate": 9.448484848484849e-06, "loss": -0.2128, "num_tokens": 393147.0, "reward": 0.023662419989705086, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.7767857313156128, "reward_count_adherence_std": 0.21407301723957062, "reward_meter_mean": 0.26494020223617554, "reward_meter_std": 0.2154451161623001, "reward_std": 0.06692743301391602, "reward_total_composite_mean": 0.023662419989705086, "reward_total_composite_std": 0.06692743301391602, "reward_total_mean": 0.023662419989705086, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.7767857313156128, "rewards/count_adherence/std": 0.21407301723957062, "rewards/meter/mean": 0.26494020223617554, "rewards/meter/std": 0.2154451161623001, "rewards/total_composite/mean": 0.023662419989705086, "rewards/total_composite/std": 0.06692743301391602, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0776352882385254, "sampling/importance_sampling_ratio/min": 0.24409537017345428, "sampling/sampling_logp_difference/max": 1.410196304321289, "sampling/sampling_logp_difference/mean": 0.22992289066314697, "step": 183 }, { "clip_ratio/high_max": 0.12044411525130272, "clip_ratio/high_mean": 0.12044411525130272, "clip_ratio/low_mean": 0.06921044550836086, "clip_ratio/low_min": 0.06921044550836086, "clip_ratio/region_mean": 0.18965456075966358, "completions/clipped_ratio": 0.0, "completions/max_length": 199.0, "completions/max_terminated_length": 199.0, "completions/mean_length": 151.375, "completions/mean_terminated_length": 151.375, "completions/min_length": 109.0, "completions/min_terminated_length": 109.0, "entropy": 3.480381518602371, "epoch": 0.007105344454742045, "frac_reward_zero_std": 0.0, "grad_norm": 7.487835884094238, "learning_rate": 9.445454545454546e-06, "loss": 0.0335, "num_tokens": 395894.0, "reward": 0.7357177734375, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.7551294565200806, "reward_meter_std": 0.2453630119562149, "reward_std": 0.23533061146736145, "reward_total_composite_mean": 0.7357177734375, "reward_total_composite_std": 0.23533061146736145, "reward_total_mean": 0.7357177734375, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.7551294565200806, "rewards/meter/std": 0.2453630119562149, "rewards/total_composite/mean": 0.7357177734375, "rewards/total_composite/std": 0.23533061146736145, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0623719692230225, "sampling/importance_sampling_ratio/min": 0.1513015180826187, "sampling/sampling_logp_difference/max": 1.888480544090271, "sampling/sampling_logp_difference/mean": 0.22830148041248322, "step": 184 }, { "clip_ratio/high_max": 0.04156912490725517, "clip_ratio/high_mean": 0.04156912490725517, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.04156912490725517, "completions/clipped_ratio": 0.75, "completions/max_length": 512.0, "completions/max_terminated_length": 434.0, "completions/mean_length": 485.125, "completions/mean_terminated_length": 404.5, "completions/min_length": 375.0, "completions/min_terminated_length": 375.0, "entropy": 1.180066168308258, "epoch": 0.007143960457213469, "frac_reward_zero_std": 0.0, "grad_norm": 1.9176102876663208, "learning_rate": 9.442424242424243e-06, "loss": -0.2352, "num_tokens": 398431.0, "reward": 0.36697742342948914, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.7647058963775635, "reward_count_adherence_std": 0.2037706971168518, "reward_meter_mean": 0.6249135732650757, "reward_meter_std": 0.15311351418495178, "reward_std": 0.280710369348526, "reward_total_composite_mean": 0.36697742342948914, "reward_total_composite_std": 0.280710369348526, "reward_total_mean": 0.36697742342948914, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.7647058963775635, "rewards/count_adherence/std": 0.2037706971168518, "rewards/meter/mean": 0.6249135732650757, "rewards/meter/std": 0.15311351418495178, "rewards/total_composite/mean": 0.36697742342948914, "rewards/total_composite/std": 0.280710369348526, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0640817880630493, "sampling/importance_sampling_ratio/min": 0.2796296775341034, "sampling/sampling_logp_difference/max": 1.2742891311645508, "sampling/sampling_logp_difference/mean": 0.22530639171600342, "step": 185 }, { "clip_ratio/high_max": 0.08783877268433571, "clip_ratio/high_mean": 0.08783877268433571, "clip_ratio/low_mean": 0.14540163800120354, "clip_ratio/low_min": 0.14540163800120354, "clip_ratio/region_mean": 0.23324041068553925, "completions/clipped_ratio": 0.0, "completions/max_length": 159.0, "completions/max_terminated_length": 159.0, "completions/mean_length": 118.75, "completions/mean_terminated_length": 118.75, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 1.863920621573925, "epoch": 0.007182576459684893, "frac_reward_zero_std": 0.0, "grad_norm": 13.209904670715332, "learning_rate": 9.43939393939394e-06, "loss": -0.0388, "num_tokens": 400845.0, "reward": 0.33415091037750244, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625821024179459, "reward_meter_mean": 0.4079614281654358, "reward_meter_std": 0.2506245970726013, "reward_std": 0.2877470552921295, "reward_total_composite_mean": 0.33415091037750244, "reward_total_composite_std": 0.2877470552921295, "reward_total_mean": 0.33415091037750244, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625821024179459, "rewards/meter/mean": 0.4079614281654358, "rewards/meter/std": 0.2506245970726013, "rewards/total_composite/mean": 0.33415091037750244, "rewards/total_composite/std": 0.2877470552921295, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.018273115158081, "sampling/importance_sampling_ratio/min": 0.05264463275671005, "sampling/sampling_logp_difference/max": 2.9441909790039062, "sampling/sampling_logp_difference/mean": 0.25658828020095825, "step": 186 }, { "clip_ratio/high_max": 0.05676225572824478, "clip_ratio/high_mean": 0.05676225572824478, "clip_ratio/low_mean": 0.08290823642164469, "clip_ratio/low_min": 0.08290823642164469, "clip_ratio/region_mean": 0.13967049214988947, "completions/clipped_ratio": 0.0, "completions/max_length": 175.0, "completions/max_terminated_length": 175.0, "completions/mean_length": 163.0, "completions/mean_terminated_length": 163.0, "completions/min_length": 155.0, "completions/min_terminated_length": 155.0, "entropy": 1.991146519780159, "epoch": 0.007221192462156318, "frac_reward_zero_std": 0.0, "grad_norm": 6.4664082527160645, "learning_rate": 9.436363636363636e-06, "loss": 0.0416, "num_tokens": 403557.0, "reward": 0.5632787346839905, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9249999523162842, "reward_count_adherence_std": 0.1035098284482956, "reward_meter_mean": 0.582764744758606, "reward_meter_std": 0.3457765281200409, "reward_std": 0.3654842972755432, "reward_total_composite_mean": 0.5632787346839905, "reward_total_composite_std": 0.3654843270778656, "reward_total_mean": 0.5632787346839905, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9249999523162842, "rewards/count_adherence/std": 0.1035098284482956, "rewards/meter/mean": 0.582764744758606, "rewards/meter/std": 0.3457765281200409, "rewards/total_composite/mean": 0.5632787346839905, "rewards/total_composite/std": 0.3654843270778656, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0383338928222656, "sampling/importance_sampling_ratio/min": 0.2662302553653717, "sampling/sampling_logp_difference/max": 1.3233938217163086, "sampling/sampling_logp_difference/mean": 0.1593349426984787, "step": 187 }, { "clip_ratio/high_max": 0.1269478127360344, "clip_ratio/high_mean": 0.1269478127360344, "clip_ratio/low_mean": 0.04282732866704464, "clip_ratio/low_min": 0.04282732866704464, "clip_ratio/region_mean": 0.16977514140307903, "completions/clipped_ratio": 0.0, "completions/max_length": 113.0, "completions/max_terminated_length": 113.0, "completions/mean_length": 93.625, "completions/mean_terminated_length": 93.625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 1.5476962476968765, "epoch": 0.007259808464627742, "frac_reward_zero_std": 0.0, "grad_norm": 13.624017715454102, "learning_rate": 9.433333333333335e-06, "loss": 0.0815, "num_tokens": 405714.0, "reward": 0.5144075155258179, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_meter_mean": 0.6261414885520935, "reward_meter_std": 0.19565246999263763, "reward_std": 0.2748170793056488, "reward_total_composite_mean": 0.5144075155258179, "reward_total_composite_std": 0.2748170793056488, "reward_total_mean": 0.5144075155258179, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/meter/mean": 0.6261414885520935, "rewards/meter/std": 0.19565246999263763, "rewards/total_composite/mean": 0.5144075155258179, "rewards/total_composite/std": 0.2748170793056488, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.026123285293579, "sampling/importance_sampling_ratio/min": 0.1549825519323349, "sampling/sampling_logp_difference/max": 1.8644428253173828, "sampling/sampling_logp_difference/mean": 0.19976428151130676, "step": 188 }, { "clip_ratio/high_max": 0.07970546465367079, "clip_ratio/high_mean": 0.07970546465367079, "clip_ratio/low_mean": 0.08321618381887674, "clip_ratio/low_min": 0.08321618381887674, "clip_ratio/region_mean": 0.16292164847254753, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 55.875, "completions/mean_terminated_length": 55.875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 1.7971455752849579, "epoch": 0.007298424467099166, "frac_reward_zero_std": 0.0, "grad_norm": 11.650201797485352, "learning_rate": 9.43030303030303e-06, "loss": 0.0495, "num_tokens": 407329.0, "reward": 0.5849356055259705, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5849356055259705, "reward_meter_std": 0.39748692512512207, "reward_std": 0.39748692512512207, "reward_total_composite_mean": 0.5849356055259705, "reward_total_composite_std": 0.39748692512512207, "reward_total_mean": 0.5849356055259705, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5849356055259705, "rewards/meter/std": 0.39748692512512207, "rewards/total_composite/mean": 0.5849356055259705, "rewards/total_composite/std": 0.39748692512512207, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0523135662078857, "sampling/importance_sampling_ratio/min": 0.25276920199394226, "sampling/sampling_logp_difference/max": 1.3752784729003906, "sampling/sampling_logp_difference/mean": 0.16425088047981262, "step": 189 }, { "clip_ratio/high_max": 0.08876706939190626, "clip_ratio/high_mean": 0.08876706939190626, "clip_ratio/low_mean": 0.049503629095852375, "clip_ratio/low_min": 0.049503629095852375, "clip_ratio/region_mean": 0.13827069848775864, "completions/clipped_ratio": 0.0, "completions/max_length": 83.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 69.75, "completions/mean_terminated_length": 69.75, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 2.6996882259845734, "epoch": 0.00733704046957059, "frac_reward_zero_std": 0.0, "grad_norm": 10.552634239196777, "learning_rate": 9.427272727272728e-06, "loss": 0.1149, "num_tokens": 409327.0, "reward": 0.6193662881851196, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6343156695365906, "reward_meter_std": 0.4757094979286194, "reward_std": 0.4956565201282501, "reward_total_composite_mean": 0.6193662881851196, "reward_total_composite_std": 0.4956565201282501, "reward_total_mean": 0.6193662881851196, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6343156695365906, "rewards/meter/std": 0.4757094979286194, "rewards/total_composite/mean": 0.6193662881851196, "rewards/total_composite/std": 0.4956565201282501, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0550477504730225, "sampling/importance_sampling_ratio/min": 0.24255730211734772, "sampling/sampling_logp_difference/max": 1.4165172576904297, "sampling/sampling_logp_difference/mean": 0.20032422244548798, "step": 190 }, { "clip_ratio/high_max": 0.10810728743672371, "clip_ratio/high_mean": 0.10810728743672371, "clip_ratio/low_mean": 0.029843377880752087, "clip_ratio/low_min": 0.029843377880752087, "clip_ratio/region_mean": 0.1379506653174758, "completions/clipped_ratio": 0.0, "completions/max_length": 356.0, "completions/max_terminated_length": 356.0, "completions/mean_length": 323.875, "completions/mean_terminated_length": 323.875, "completions/min_length": 305.0, "completions/min_terminated_length": 305.0, "entropy": 2.755393832921982, "epoch": 0.007375656472042014, "frac_reward_zero_std": 0.0, "grad_norm": 4.086877822875977, "learning_rate": 9.424242424242425e-06, "loss": 0.0501, "num_tokens": 413518.0, "reward": 0.8315606117248535, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8315606117248535, "reward_meter_std": 0.19411730766296387, "reward_std": 0.19411730766296387, "reward_total_composite_mean": 0.8315606117248535, "reward_total_composite_std": 0.19411730766296387, "reward_total_mean": 0.8315606117248535, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8315606117248535, "rewards/meter/std": 0.19411730766296387, "rewards/total_composite/mean": 0.8315606117248535, "rewards/total_composite/std": 0.19411730766296387, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0462325811386108, "sampling/importance_sampling_ratio/min": 0.19589684903621674, "sampling/sampling_logp_difference/max": 1.630167007446289, "sampling/sampling_logp_difference/mean": 0.1796930879354477, "step": 191 }, { "clip_ratio/high_max": 0.16411421447992325, "clip_ratio/high_mean": 0.16411421447992325, "clip_ratio/low_mean": 0.01315789483487606, "clip_ratio/low_min": 0.01315789483487606, "clip_ratio/region_mean": 0.1772721093147993, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 27.375, "completions/mean_terminated_length": 27.375, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 2.018664211034775, "epoch": 0.0074142724745134385, "frac_reward_zero_std": 0.0, "grad_norm": 18.393901824951172, "learning_rate": 9.421212121212122e-06, "loss": 0.153, "num_tokens": 414921.0, "reward": 0.9494917392730713, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9494917392730713, "reward_meter_std": 0.08201512694358826, "reward_std": 0.08201511204242706, "reward_total_composite_mean": 0.9494917392730713, "reward_total_composite_std": 0.08201512694358826, "reward_total_mean": 0.9494917392730713, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9494917392730713, "rewards/meter/std": 0.08201512694358826, "rewards/total_composite/mean": 0.9494917392730713, "rewards/total_composite/std": 0.08201512694358826, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0469014644622803, "sampling/importance_sampling_ratio/min": 0.22913827002048492, "sampling/sampling_logp_difference/max": 1.4734296798706055, "sampling/sampling_logp_difference/mean": 0.1969519406557083, "step": 192 }, { "clip_ratio/high_max": 0.07883104495704174, "clip_ratio/high_mean": 0.07883104495704174, "clip_ratio/low_mean": 0.07560309767723083, "clip_ratio/low_min": 0.07560309767723083, "clip_ratio/region_mean": 0.15443414263427258, "completions/clipped_ratio": 0.0, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 95.25, "completions/mean_terminated_length": 95.25, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 2.2031291872262955, "epoch": 0.007452888476984863, "frac_reward_zero_std": 0.0, "grad_norm": 8.817331314086914, "learning_rate": 9.418181818181818e-06, "loss": 0.0298, "num_tokens": 416883.0, "reward": 0.6673023104667664, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6673023104667664, "reward_meter_std": 0.2610948383808136, "reward_std": 0.2610948085784912, "reward_total_composite_mean": 0.6673023104667664, "reward_total_composite_std": 0.2610948383808136, "reward_total_mean": 0.6673023104667664, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6673023104667664, "rewards/meter/std": 0.2610948383808136, "rewards/total_composite/mean": 0.6673023104667664, "rewards/total_composite/std": 0.2610948383808136, "sampling/importance_sampling_ratio/max": 1.9678956270217896, "sampling/importance_sampling_ratio/mean": 1.0500800609588623, "sampling/importance_sampling_ratio/min": 0.21263186633586884, "sampling/sampling_logp_difference/max": 1.5481929779052734, "sampling/sampling_logp_difference/mean": 0.18318572640419006, "step": 193 }, { "clip_ratio/high_max": 0.10805463790893555, "clip_ratio/high_mean": 0.10805463790893555, "clip_ratio/low_mean": 0.09499397501349449, "clip_ratio/low_min": 0.09499397501349449, "clip_ratio/region_mean": 0.20304861292243004, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 66.375, "completions/mean_terminated_length": 66.375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 2.68495112657547, "epoch": 0.007491504479456287, "frac_reward_zero_std": 0.0, "grad_norm": 9.746423721313477, "learning_rate": 9.415151515151515e-06, "loss": -0.0527, "num_tokens": 418806.0, "reward": 0.5814144611358643, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7032723426818848, "reward_meter_std": 0.39979878067970276, "reward_std": 0.45054084062576294, "reward_total_composite_mean": 0.5814144611358643, "reward_total_composite_std": 0.45054084062576294, "reward_total_mean": 0.5814144611358643, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7032723426818848, "rewards/meter/std": 0.39979878067970276, "rewards/total_composite/mean": 0.5814144611358643, "rewards/total_composite/std": 0.45054084062576294, "sampling/importance_sampling_ratio/max": 1.9423279762268066, "sampling/importance_sampling_ratio/mean": 1.0394792556762695, "sampling/importance_sampling_ratio/min": 0.3289699852466583, "sampling/sampling_logp_difference/max": 1.1117887496948242, "sampling/sampling_logp_difference/mean": 0.1895114779472351, "step": 194 }, { "clip_ratio/high_max": 0.054079256020486355, "clip_ratio/high_mean": 0.054079256020486355, "clip_ratio/low_mean": 0.09933342039585114, "clip_ratio/low_min": 0.09933342039585114, "clip_ratio/region_mean": 0.1534126764163375, "completions/clipped_ratio": 0.0, "completions/max_length": 43.0, "completions/max_terminated_length": 43.0, "completions/mean_length": 33.125, "completions/mean_terminated_length": 33.125, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 1.359821267426014, "epoch": 0.007530120481927711, "frac_reward_zero_std": 0.0, "grad_norm": 22.751644134521484, "learning_rate": 9.412121212121212e-06, "loss": 0.1632, "num_tokens": 420399.0, "reward": 0.5200808048248291, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5200808048248291, "reward_meter_std": 0.43741583824157715, "reward_std": 0.43741583824157715, "reward_total_composite_mean": 0.5200808048248291, "reward_total_composite_std": 0.43741583824157715, "reward_total_mean": 0.5200808048248291, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5200808048248291, "rewards/meter/std": 0.43741583824157715, "rewards/total_composite/mean": 0.5200808048248291, "rewards/total_composite/std": 0.43741583824157715, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.015283226966858, "sampling/importance_sampling_ratio/min": 0.027538040652871132, "sampling/sampling_logp_difference/max": 3.59218692779541, "sampling/sampling_logp_difference/mean": 0.2031438797712326, "step": 195 }, { "clip_ratio/high_max": 0.13002329412847757, "clip_ratio/high_mean": 0.13002329412847757, "clip_ratio/low_mean": 0.04345930367708206, "clip_ratio/low_min": 0.04345930367708206, "clip_ratio/region_mean": 0.17348259780555964, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 61.375, "completions/mean_terminated_length": 61.375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 2.188107267022133, "epoch": 0.007568736484399135, "frac_reward_zero_std": 0.0, "grad_norm": 14.902490615844727, "learning_rate": 9.40909090909091e-06, "loss": 0.0894, "num_tokens": 422210.0, "reward": 0.6541217565536499, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6579214334487915, "reward_meter_std": 0.34652820229530334, "reward_std": 0.3544676601886749, "reward_total_composite_mean": 0.6541217565536499, "reward_total_composite_std": 0.3544676899909973, "reward_total_mean": 0.6541217565536499, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6579214334487915, "rewards/meter/std": 0.34652820229530334, "rewards/total_composite/mean": 0.6541217565536499, "rewards/total_composite/std": 0.3544676899909973, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0256552696228027, "sampling/importance_sampling_ratio/min": 0.32179901003837585, "sampling/sampling_logp_difference/max": 1.1338281631469727, "sampling/sampling_logp_difference/mean": 0.19266894459724426, "step": 196 }, { "clip_ratio/high_max": 0.1163166556507349, "clip_ratio/high_mean": 0.1163166556507349, "clip_ratio/low_mean": 0.03474697098135948, "clip_ratio/low_min": 0.03474697098135948, "clip_ratio/region_mean": 0.15106362663209438, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 73.875, "completions/mean_terminated_length": 73.875, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 2.119014173746109, "epoch": 0.007607352486870559, "frac_reward_zero_std": 0.0, "grad_norm": 8.72506332397461, "learning_rate": 9.406060606060607e-06, "loss": -0.0611, "num_tokens": 423961.0, "reward": 0.7566624879837036, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7866647243499756, "reward_meter_std": 0.33512723445892334, "reward_std": 0.3962303400039673, "reward_total_composite_mean": 0.7566624879837036, "reward_total_composite_std": 0.3962303102016449, "reward_total_mean": 0.7566624879837036, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7866647243499756, "rewards/meter/std": 0.33512723445892334, "rewards/total_composite/mean": 0.7566624879837036, "rewards/total_composite/std": 0.3962303102016449, "sampling/importance_sampling_ratio/max": 1.8759212493896484, "sampling/importance_sampling_ratio/mean": 1.0307003259658813, "sampling/importance_sampling_ratio/min": 0.23423144221305847, "sampling/sampling_logp_difference/max": 1.4514455795288086, "sampling/sampling_logp_difference/mean": 0.16485705971717834, "step": 197 }, { "clip_ratio/high_max": 0.11953294090926647, "clip_ratio/high_mean": 0.11953294090926647, "clip_ratio/low_mean": 0.02056962065398693, "clip_ratio/low_min": 0.02056962065398693, "clip_ratio/region_mean": 0.1401025615632534, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 72.875, "completions/mean_terminated_length": 72.875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 2.166542023420334, "epoch": 0.007645968489341983, "frac_reward_zero_std": 0.0, "grad_norm": 8.083459854125977, "learning_rate": 9.403030303030304e-06, "loss": 0.0372, "num_tokens": 425728.0, "reward": 0.8608720302581787, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8608720302581787, "reward_meter_std": 0.3337464928627014, "reward_std": 0.33374646306037903, "reward_total_composite_mean": 0.8608720302581787, "reward_total_composite_std": 0.3337464928627014, "reward_total_mean": 0.8608720302581787, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8608720302581787, "rewards/meter/std": 0.3337464928627014, "rewards/total_composite/mean": 0.8608720302581787, "rewards/total_composite/std": 0.3337464928627014, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0441133975982666, "sampling/importance_sampling_ratio/min": 0.27538660168647766, "sampling/sampling_logp_difference/max": 1.2895793914794922, "sampling/sampling_logp_difference/mean": 0.181260883808136, "step": 198 }, { "clip_ratio/high_max": 0.11455865763127804, "clip_ratio/high_mean": 0.11455865763127804, "clip_ratio/low_mean": 0.0449892720207572, "clip_ratio/low_min": 0.0449892720207572, "clip_ratio/region_mean": 0.15954792965203524, "completions/clipped_ratio": 0.0, "completions/max_length": 149.0, "completions/max_terminated_length": 149.0, "completions/mean_length": 140.375, "completions/mean_terminated_length": 140.375, "completions/min_length": 133.0, "completions/min_terminated_length": 133.0, "entropy": 2.1282119899988174, "epoch": 0.007684584491813407, "frac_reward_zero_std": 0.0, "grad_norm": 6.834539890289307, "learning_rate": 9.4e-06, "loss": 0.0447, "num_tokens": 428283.0, "reward": 0.8193603754043579, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.8502488136291504, "reward_meter_std": 0.2549903690814972, "reward_std": 0.250792533159256, "reward_total_composite_mean": 0.8193603754043579, "reward_total_composite_std": 0.250792533159256, "reward_total_mean": 0.8193603754043579, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.8502488136291504, "rewards/meter/std": 0.2549903690814972, "rewards/total_composite/mean": 0.8193603754043579, "rewards/total_composite/std": 0.250792533159256, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0295875072479248, "sampling/importance_sampling_ratio/min": 0.14527681469917297, "sampling/sampling_logp_difference/max": 1.9291143417358398, "sampling/sampling_logp_difference/mean": 0.17601756751537323, "step": 199 }, { "clip_ratio/high_max": 0.14806674886494875, "clip_ratio/high_mean": 0.14806674886494875, "clip_ratio/low_mean": 0.010593220591545105, "clip_ratio/low_min": 0.010593220591545105, "clip_ratio/region_mean": 0.15865996945649385, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 55.375, "completions/mean_terminated_length": 55.375, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 2.2072382867336273, "epoch": 0.007723200494284831, "frac_reward_zero_std": 0.0, "grad_norm": 14.159527778625488, "learning_rate": 9.396969696969697e-06, "loss": 0.0566, "num_tokens": 430070.0, "reward": 0.8980928659439087, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8980928659439087, "reward_meter_std": 0.20199771225452423, "reward_std": 0.20199769735336304, "reward_total_composite_mean": 0.8980928659439087, "reward_total_composite_std": 0.20199771225452423, "reward_total_mean": 0.8980928659439087, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8980928659439087, "rewards/meter/std": 0.20199771225452423, "rewards/total_composite/mean": 0.8980928659439087, "rewards/total_composite/std": 0.20199771225452423, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031834602355957, "sampling/importance_sampling_ratio/min": 0.24137245118618011, "sampling/sampling_logp_difference/max": 1.4214141368865967, "sampling/sampling_logp_difference/mean": 0.17297667264938354, "step": 200 }, { "epoch": 0.007723200494284831, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.07692307692307693, "eval_completions/max_length": 457.3076923076923, "eval_completions/max_terminated_length": 368.0, "eval_completions/mean_length": 217.46153846153845, "eval_completions/mean_terminated_length": 192.05220383864182, "eval_completions/min_length": 56.0, "eval_completions/min_terminated_length": 56.0, "eval_entropy": 2.1048372708834133, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 430070.0, "eval_reward": 0.4151367247104645, "eval_reward_arabic_clean_mean": 0.9423076923076923, "eval_reward_arabic_clean_std": 0.12560976010102493, "eval_reward_count_adherence_mean": 0.9569021555093619, "eval_reward_count_adherence_std": 0.07193636994522351, "eval_reward_meter_mean": 0.4592640560406905, "eval_reward_meter_std": 0.3293467943484967, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.4151367247104645, "eval_reward_total_composite_std": 0.3096239452178662, "eval_reward_total_mean": 0.4151367247104645, "eval_rewards/arabic_clean/mean": 0.9423076923076923, "eval_rewards/arabic_clean/std": 0.12560976010102493, "eval_rewards/count_adherence/mean": 0.9569021555093619, "eval_rewards/count_adherence/std": 0.07193636994522351, "eval_rewards/meter/mean": 0.4592640560406905, "eval_rewards/meter/std": 0.3293467943484967, "eval_rewards/total_composite/mean": 0.4151367247104645, "eval_rewards/total_composite/std": 0.3096239452178662, "eval_runtime": 84.7428, "eval_samples_per_second": 1.227, "eval_sampling/importance_sampling_ratio/max": 1.5931972448642437, "eval_sampling/importance_sampling_ratio/mean": 1.0360724650896513, "eval_sampling/importance_sampling_ratio/min": 0.28642855469997114, "eval_sampling/sampling_logp_difference/max": 1.260967914874737, "eval_sampling/sampling_logp_difference/mean": 0.1303755704026956, "eval_steps_per_second": 0.153, "step": 200 }, { "clip_ratio/high_max": 0.08195106312632561, "clip_ratio/high_mean": 0.08195106312632561, "clip_ratio/low_mean": 0.0364175159484148, "clip_ratio/low_min": 0.0364175159484148, "clip_ratio/region_mean": 0.11836857907474041, "completions/clipped_ratio": 0.0, "completions/max_length": 33.0, "completions/max_terminated_length": 33.0, "completions/mean_length": 31.875, "completions/mean_terminated_length": 31.875, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 0.9935045540332794, "epoch": 0.007761816496756255, "frac_reward_zero_std": 0.0, "grad_norm": 12.455371856689453, "learning_rate": 9.393939393939396e-06, "loss": 0.0034, "num_tokens": 431437.0, "reward": 0.9721503257751465, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9721503257751465, "reward_meter_std": 0.02047812007367611, "reward_std": 0.02047811821103096, "reward_total_composite_mean": 0.9721503257751465, "reward_total_composite_std": 0.02047812007367611, "reward_total_mean": 0.9721503257751465, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9721503257751465, "rewards/meter/std": 0.02047812007367611, "rewards/total_composite/mean": 0.9721503257751465, "rewards/total_composite/std": 0.02047812007367611, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.007079839706421, "sampling/importance_sampling_ratio/min": 0.3022264838218689, "sampling/sampling_logp_difference/max": 1.1965785026550293, "sampling/sampling_logp_difference/mean": 0.13416853547096252, "step": 201 }, { "clip_ratio/high_max": 0.05716947093605995, "clip_ratio/high_mean": 0.05716947093605995, "clip_ratio/low_mean": 0.046742528676986694, "clip_ratio/low_min": 0.046742528676986694, "clip_ratio/region_mean": 0.10391199961304665, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 494.0, "completions/mean_length": 443.5, "completions/mean_terminated_length": 433.71429443359375, "completions/min_length": 371.0, "completions/min_terminated_length": 371.0, "entropy": 2.633182942867279, "epoch": 0.0078004324992276795, "frac_reward_zero_std": 0.0, "grad_norm": 2.5677430629730225, "learning_rate": 9.390909090909092e-06, "loss": -0.126, "num_tokens": 436473.0, "reward": 0.3806021213531494, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9318181872367859, "reward_count_adherence_std": 0.06428243219852448, "reward_meter_mean": 0.4077759385108948, "reward_meter_std": 0.2577785849571228, "reward_std": 0.23827768862247467, "reward_total_composite_mean": 0.3806021213531494, "reward_total_composite_std": 0.23827770352363586, "reward_total_mean": 0.3806021213531494, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9318181872367859, "rewards/count_adherence/std": 0.06428243219852448, "rewards/meter/mean": 0.4077759385108948, "rewards/meter/std": 0.2577785849571228, "rewards/total_composite/mean": 0.3806021213531494, "rewards/total_composite/std": 0.23827770352363586, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0397894382476807, "sampling/importance_sampling_ratio/min": 0.2143089473247528, "sampling/sampling_logp_difference/max": 1.5403366088867188, "sampling/sampling_logp_difference/mean": 0.1868906170129776, "step": 202 }, { "clip_ratio/high_max": 0.05425724573433399, "clip_ratio/high_mean": 0.05425724573433399, "clip_ratio/low_mean": 0.13778485730290413, "clip_ratio/low_min": 0.13778485730290413, "clip_ratio/region_mean": 0.19204210303723812, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 54.875, "completions/mean_terminated_length": 54.875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 1.969245657324791, "epoch": 0.007839048501699104, "frac_reward_zero_std": 0.0, "grad_norm": 10.374756813049316, "learning_rate": 9.387878787878789e-06, "loss": 0.0063, "num_tokens": 438144.0, "reward": 0.18955467641353607, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.18955467641353607, "reward_meter_std": 0.2376922219991684, "reward_std": 0.2376922219991684, "reward_total_composite_mean": 0.18955467641353607, "reward_total_composite_std": 0.2376922219991684, "reward_total_mean": 0.18955467641353607, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.18955467641353607, "rewards/meter/std": 0.2376922219991684, "rewards/total_composite/mean": 0.18955467641353607, "rewards/total_composite/std": 0.2376922219991684, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0263407230377197, "sampling/importance_sampling_ratio/min": 0.24083620309829712, "sampling/sampling_logp_difference/max": 1.4236383438110352, "sampling/sampling_logp_difference/mean": 0.19148828089237213, "step": 203 }, { "clip_ratio/high_max": 0.05784035939723253, "clip_ratio/high_mean": 0.05784035939723253, "clip_ratio/low_mean": 0.05318944435566664, "clip_ratio/low_min": 0.05318944435566664, "clip_ratio/region_mean": 0.11102980375289917, "completions/clipped_ratio": 0.0, "completions/max_length": 341.0, "completions/max_terminated_length": 341.0, "completions/mean_length": 316.75, "completions/mean_terminated_length": 316.75, "completions/min_length": 280.0, "completions/min_terminated_length": 280.0, "entropy": 1.8388848304748535, "epoch": 0.007877664504170528, "frac_reward_zero_std": 0.0, "grad_norm": 3.7568657398223877, "learning_rate": 9.384848484848486e-06, "loss": 0.0447, "num_tokens": 442326.0, "reward": 0.6847348213195801, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9722222089767456, "reward_count_adherence_std": 0.05143444985151291, "reward_meter_mean": 0.7115911245346069, "reward_meter_std": 0.30422648787498474, "reward_std": 0.28163081407546997, "reward_total_composite_mean": 0.6847348213195801, "reward_total_composite_std": 0.28163081407546997, "reward_total_mean": 0.6847348213195801, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9722222089767456, "rewards/count_adherence/std": 0.05143444985151291, "rewards/meter/mean": 0.7115911245346069, "rewards/meter/std": 0.30422648787498474, "rewards/total_composite/mean": 0.6847348213195801, "rewards/total_composite/std": 0.28163081407546997, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0315098762512207, "sampling/importance_sampling_ratio/min": 0.09864851087331772, "sampling/sampling_logp_difference/max": 2.316192150115967, "sampling/sampling_logp_difference/mean": 0.14612703025341034, "step": 204 }, { "clip_ratio/high_max": 0.04085497930645943, "clip_ratio/high_mean": 0.04085497930645943, "clip_ratio/low_mean": 0.04515550099313259, "clip_ratio/low_min": 0.04515550099313259, "clip_ratio/region_mean": 0.08601048029959202, "completions/clipped_ratio": 0.0, "completions/max_length": 22.0, "completions/max_terminated_length": 22.0, "completions/mean_length": 20.75, "completions/mean_terminated_length": 20.75, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 0.47789650596678257, "epoch": 0.007916280506641952, "frac_reward_zero_std": 0.0, "grad_norm": 22.554645538330078, "learning_rate": 9.381818181818183e-06, "loss": -0.0141, "num_tokens": 443612.0, "reward": 0.2569815218448639, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.2569815218448639, "reward_meter_std": 0.17644450068473816, "reward_std": 0.17644448578357697, "reward_total_composite_mean": 0.2569815218448639, "reward_total_composite_std": 0.17644450068473816, "reward_total_mean": 0.2569815218448639, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.2569815218448639, "rewards/meter/std": 0.17644450068473816, "rewards/total_composite/mean": 0.2569815218448639, "rewards/total_composite/std": 0.17644450068473816, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.010235071182251, "sampling/importance_sampling_ratio/min": 0.09870558977127075, "sampling/sampling_logp_difference/max": 2.3156137466430664, "sampling/sampling_logp_difference/mean": 0.11848119646310806, "step": 205 }, { "clip_ratio/high_max": 0.08172544464468956, "clip_ratio/high_mean": 0.08172544464468956, "clip_ratio/low_mean": 0.02254154160618782, "clip_ratio/low_min": 0.02254154160618782, "clip_ratio/region_mean": 0.10426698625087738, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 502.0, "completions/mean_length": 459.125, "completions/mean_terminated_length": 451.5714416503906, "completions/min_length": 410.0, "completions/min_terminated_length": 410.0, "entropy": 2.3715617954730988, "epoch": 0.007954896509113376, "frac_reward_zero_std": 0.0, "grad_norm": 2.1156201362609863, "learning_rate": 9.378787878787879e-06, "loss": -0.2172, "num_tokens": 448589.0, "reward": 0.542489767074585, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8928571343421936, "reward_count_adherence_std": 0.05399491637945175, "reward_meter_mean": 0.5943694114685059, "reward_meter_std": 0.28580430150032043, "reward_std": 0.2698879539966583, "reward_total_composite_mean": 0.542489767074585, "reward_total_composite_std": 0.26988792419433594, "reward_total_mean": 0.542489767074585, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8928571343421936, "rewards/count_adherence/std": 0.05399491637945175, "rewards/meter/mean": 0.5943694114685059, "rewards/meter/std": 0.28580430150032043, "rewards/total_composite/mean": 0.542489767074585, "rewards/total_composite/std": 0.26988792419433594, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0428776741027832, "sampling/importance_sampling_ratio/min": 0.2488904893398285, "sampling/sampling_logp_difference/max": 1.390742301940918, "sampling/sampling_logp_difference/mean": 0.16989928483963013, "step": 206 }, { "clip_ratio/high_max": 0.09698447678238153, "clip_ratio/high_mean": 0.09698447678238153, "clip_ratio/low_mean": 0.03460816852748394, "clip_ratio/low_min": 0.03460816852748394, "clip_ratio/region_mean": 0.13159264530986547, "completions/clipped_ratio": 0.0, "completions/max_length": 223.0, "completions/max_terminated_length": 223.0, "completions/mean_length": 200.625, "completions/mean_terminated_length": 200.625, "completions/min_length": 185.0, "completions/min_terminated_length": 185.0, "entropy": 2.5693641006946564, "epoch": 0.0079935125115848, "frac_reward_zero_std": 0.0, "grad_norm": 5.197041988372803, "learning_rate": 9.375757575757576e-06, "loss": 0.0262, "num_tokens": 451666.0, "reward": 0.5297455787658691, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.5436156988143921, "reward_meter_std": 0.36589959263801575, "reward_std": 0.3861840069293976, "reward_total_composite_mean": 0.5297455787658691, "reward_total_composite_std": 0.3861840069293976, "reward_total_mean": 0.5297455787658691, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.5436156988143921, "rewards/meter/std": 0.36589959263801575, "rewards/total_composite/mean": 0.5297455787658691, "rewards/total_composite/std": 0.3861840069293976, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0335437059402466, "sampling/importance_sampling_ratio/min": 0.25058552622795105, "sampling/sampling_logp_difference/max": 1.3839550018310547, "sampling/sampling_logp_difference/mean": 0.17878292500972748, "step": 207 }, { "clip_ratio/high_max": 0.08172481320798397, "clip_ratio/high_mean": 0.08172481320798397, "clip_ratio/low_mean": 0.04633831046521664, "clip_ratio/low_min": 0.04633831046521664, "clip_ratio/region_mean": 0.1280631236732006, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 112.0, "completions/mean_terminated_length": 54.857147216796875, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 1.829095020890236, "epoch": 0.008032128514056224, "frac_reward_zero_std": 0.0, "grad_norm": 4.907017707824707, "learning_rate": 9.372727272727273e-06, "loss": -0.0625, "num_tokens": 453242.0, "reward": 0.5157449841499329, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.5209001302719116, "reward_meter_std": 0.4826778173446655, "reward_std": 0.48821765184402466, "reward_total_composite_mean": 0.5157449841499329, "reward_total_composite_std": 0.48821765184402466, "reward_total_mean": 0.5157449841499329, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.5209001302719116, "rewards/meter/std": 0.4826778173446655, "rewards/total_composite/mean": 0.5157449841499329, "rewards/total_composite/std": 0.48821765184402466, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0225262641906738, "sampling/importance_sampling_ratio/min": 0.16763810813426971, "sampling/sampling_logp_difference/max": 1.7859477996826172, "sampling/sampling_logp_difference/mean": 0.1978602260351181, "step": 208 }, { "clip_ratio/high_max": 0.07205317448824644, "clip_ratio/high_mean": 0.07205317448824644, "clip_ratio/low_mean": 0.05209819972515106, "clip_ratio/low_min": 0.05209819972515106, "clip_ratio/region_mean": 0.1241513742133975, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 65.125, "completions/mean_terminated_length": 65.125, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 1.5745535343885422, "epoch": 0.008070744516527648, "frac_reward_zero_std": 0.0, "grad_norm": 10.775023460388184, "learning_rate": 9.36969696969697e-06, "loss": 0.0425, "num_tokens": 455075.0, "reward": 0.687164843082428, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.687164843082428, "reward_meter_std": 0.42298591136932373, "reward_std": 0.42298588156700134, "reward_total_composite_mean": 0.687164843082428, "reward_total_composite_std": 0.42298591136932373, "reward_total_mean": 0.687164843082428, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.687164843082428, "rewards/meter/std": 0.42298591136932373, "rewards/total_composite/mean": 0.687164843082428, "rewards/total_composite/std": 0.42298591136932373, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031755805015564, "sampling/importance_sampling_ratio/min": 0.2617337703704834, "sampling/sampling_logp_difference/max": 1.3404273986816406, "sampling/sampling_logp_difference/mean": 0.1489512026309967, "step": 209 }, { "clip_ratio/high_max": 0.0914016654714942, "clip_ratio/high_mean": 0.0914016654714942, "clip_ratio/low_mean": 0.06012810207903385, "clip_ratio/low_min": 0.06012810207903385, "clip_ratio/region_mean": 0.15152976755052805, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 94.75, "completions/mean_terminated_length": 94.75, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 2.1869092285633087, "epoch": 0.008109360518999072, "frac_reward_zero_std": 0.0, "grad_norm": 8.813285827636719, "learning_rate": 9.366666666666668e-06, "loss": 0.0918, "num_tokens": 457201.0, "reward": 0.8014340400695801, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8014340400695801, "reward_meter_std": 0.26059165596961975, "reward_std": 0.26059165596961975, "reward_total_composite_mean": 0.8014340400695801, "reward_total_composite_std": 0.26059165596961975, "reward_total_mean": 0.8014340400695801, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8014340400695801, "rewards/meter/std": 0.26059165596961975, "rewards/total_composite/mean": 0.8014340400695801, "rewards/total_composite/std": 0.26059165596961975, "sampling/importance_sampling_ratio/max": 1.846545934677124, "sampling/importance_sampling_ratio/mean": 1.0492236614227295, "sampling/importance_sampling_ratio/min": 0.22778037190437317, "sampling/sampling_logp_difference/max": 1.4793734550476074, "sampling/sampling_logp_difference/mean": 0.16893059015274048, "step": 210 }, { "clip_ratio/high_max": 0.06869588885456324, "clip_ratio/high_mean": 0.06869588885456324, "clip_ratio/low_mean": 0.0616428735665977, "clip_ratio/low_min": 0.0616428735665977, "clip_ratio/region_mean": 0.13033876242116094, "completions/clipped_ratio": 0.0, "completions/max_length": 35.0, "completions/max_terminated_length": 35.0, "completions/mean_length": 31.0, "completions/mean_terminated_length": 31.0, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 2.1823814064264297, "epoch": 0.008147976521470498, "frac_reward_zero_std": 0.0, "grad_norm": 14.590749740600586, "learning_rate": 9.363636363636365e-06, "loss": 0.043, "num_tokens": 458609.0, "reward": 0.3326827883720398, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3326827883720398, "reward_meter_std": 0.391814649105072, "reward_std": 0.39181461930274963, "reward_total_composite_mean": 0.3326827883720398, "reward_total_composite_std": 0.391814649105072, "reward_total_mean": 0.3326827883720398, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3326827883720398, "rewards/meter/std": 0.391814649105072, "rewards/total_composite/mean": 0.3326827883720398, "rewards/total_composite/std": 0.391814649105072, "sampling/importance_sampling_ratio/max": 1.9337586164474487, "sampling/importance_sampling_ratio/mean": 1.0280555486679077, "sampling/importance_sampling_ratio/min": 0.3309429883956909, "sampling/sampling_logp_difference/max": 1.105809211730957, "sampling/sampling_logp_difference/mean": 0.17955826222896576, "step": 211 }, { "clip_ratio/high_max": 0.0721238311380148, "clip_ratio/high_mean": 0.0721238311380148, "clip_ratio/low_mean": 0.10219099884852767, "clip_ratio/low_min": 0.10219099884852767, "clip_ratio/region_mean": 0.17431482998654246, "completions/clipped_ratio": 0.0, "completions/max_length": 51.0, "completions/max_terminated_length": 51.0, "completions/mean_length": 35.125, "completions/mean_terminated_length": 35.125, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 1.3654158115386963, "epoch": 0.008186592523941922, "frac_reward_zero_std": 0.0, "grad_norm": 20.575647354125977, "learning_rate": 9.36060606060606e-06, "loss": 0.1396, "num_tokens": 460114.0, "reward": 0.45719897747039795, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45719897747039795, "reward_meter_std": 0.3513868451118469, "reward_std": 0.35138681530952454, "reward_total_composite_mean": 0.45719897747039795, "reward_total_composite_std": 0.3513868451118469, "reward_total_mean": 0.45719897747039795, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45719897747039795, "rewards/meter/std": 0.3513868451118469, "rewards/total_composite/mean": 0.45719897747039795, "rewards/total_composite/std": 0.3513868451118469, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9953309297561646, "sampling/importance_sampling_ratio/min": 0.1695476919412613, "sampling/sampling_logp_difference/max": 1.7746210098266602, "sampling/sampling_logp_difference/mean": 0.18254390358924866, "step": 212 }, { "clip_ratio/high_max": 0.09881766140460968, "clip_ratio/high_mean": 0.09881766140460968, "clip_ratio/low_mean": 0.039724151603877544, "clip_ratio/low_min": 0.039724151603877544, "clip_ratio/region_mean": 0.13854181300848722, "completions/clipped_ratio": 0.0, "completions/max_length": 119.0, "completions/max_terminated_length": 119.0, "completions/mean_length": 106.25, "completions/mean_terminated_length": 106.25, "completions/min_length": 85.0, "completions/min_terminated_length": 85.0, "entropy": 2.2049818336963654, "epoch": 0.008225208526413346, "frac_reward_zero_std": 0.0, "grad_norm": 7.170069694519043, "learning_rate": 9.357575757575758e-06, "loss": 0.0285, "num_tokens": 462364.0, "reward": 0.6657600998878479, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6657600998878479, "reward_meter_std": 0.4287368059158325, "reward_std": 0.4287368059158325, "reward_total_composite_mean": 0.6657600998878479, "reward_total_composite_std": 0.4287368059158325, "reward_total_mean": 0.6657600998878479, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6657600998878479, "rewards/meter/std": 0.4287368059158325, "rewards/total_composite/mean": 0.6657600998878479, "rewards/total_composite/std": 0.4287368059158325, "sampling/importance_sampling_ratio/max": 1.96308434009552, "sampling/importance_sampling_ratio/mean": 1.0314472913742065, "sampling/importance_sampling_ratio/min": 0.20997050404548645, "sampling/sampling_logp_difference/max": 1.5607881546020508, "sampling/sampling_logp_difference/mean": 0.16524526476860046, "step": 213 }, { "clip_ratio/high_max": 0.08606619853526354, "clip_ratio/high_mean": 0.08606619853526354, "clip_ratio/low_mean": 0.02658250369131565, "clip_ratio/low_min": 0.02658250369131565, "clip_ratio/region_mean": 0.11264870222657919, "completions/clipped_ratio": 0.0, "completions/max_length": 44.0, "completions/max_terminated_length": 44.0, "completions/mean_length": 37.25, "completions/mean_terminated_length": 37.25, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 1.585478514432907, "epoch": 0.00826382452888477, "frac_reward_zero_std": 0.0, "grad_norm": 12.966662406921387, "learning_rate": 9.354545454545455e-06, "loss": 0.0144, "num_tokens": 463910.0, "reward": 0.9338778257369995, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9338778257369995, "reward_meter_std": 0.12218131124973297, "reward_std": 0.12218130379915237, "reward_total_composite_mean": 0.9338778257369995, "reward_total_composite_std": 0.12218131124973297, "reward_total_mean": 0.9338778257369995, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9338778257369995, "rewards/meter/std": 0.12218131124973297, "rewards/total_composite/mean": 0.9338778257369995, "rewards/total_composite/std": 0.12218131124973297, "sampling/importance_sampling_ratio/max": 1.8531534671783447, "sampling/importance_sampling_ratio/mean": 1.0329978466033936, "sampling/importance_sampling_ratio/min": 0.2841220498085022, "sampling/sampling_logp_difference/max": 1.2583513259887695, "sampling/sampling_logp_difference/mean": 0.15117491781711578, "step": 214 }, { "clip_ratio/high_max": 0.09631683025509119, "clip_ratio/high_mean": 0.09631683025509119, "clip_ratio/low_mean": 0.04079106356948614, "clip_ratio/low_min": 0.04079106356948614, "clip_ratio/region_mean": 0.13710789382457733, "completions/clipped_ratio": 0.0, "completions/max_length": 46.0, "completions/max_terminated_length": 46.0, "completions/mean_length": 34.375, "completions/mean_terminated_length": 34.375, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 1.831810086965561, "epoch": 0.008302440531356195, "frac_reward_zero_std": 0.0, "grad_norm": 16.243061065673828, "learning_rate": 9.351515151515152e-06, "loss": 0.239, "num_tokens": 465457.0, "reward": 0.6347050666809082, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.6347050666809082, "reward_meter_std": 0.485779345035553, "reward_std": 0.485779345035553, "reward_total_composite_mean": 0.6347050666809082, "reward_total_composite_std": 0.485779345035553, "reward_total_mean": 0.6347050666809082, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.6347050666809082, "rewards/meter/std": 0.485779345035553, "rewards/total_composite/mean": 0.6347050666809082, "rewards/total_composite/std": 0.485779345035553, "sampling/importance_sampling_ratio/max": 1.7199817895889282, "sampling/importance_sampling_ratio/mean": 1.0188474655151367, "sampling/importance_sampling_ratio/min": 0.31832820177078247, "sampling/sampling_logp_difference/max": 1.1446723937988281, "sampling/sampling_logp_difference/mean": 0.17325210571289062, "step": 215 }, { "clip_ratio/high_max": 0.015360169112682343, "clip_ratio/high_mean": 0.015360169112682343, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.015360169112682343, "completions/clipped_ratio": 0.875, "completions/max_length": 512.0, "completions/max_terminated_length": 472.0, "completions/mean_length": 507.0, "completions/mean_terminated_length": 472.0, "completions/min_length": 472.0, "completions/min_terminated_length": 472.0, "entropy": 0.36599498987197876, "epoch": 0.008341056533827619, "frac_reward_zero_std": 0.0, "grad_norm": 0.7487542033195496, "learning_rate": 9.34848484848485e-06, "loss": -0.0905, "num_tokens": 467753.0, "reward": 0.18635782599449158, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.637499988079071, "reward_count_adherence_std": 0.06408698856830597, "reward_meter_mean": 0.3023744523525238, "reward_meter_std": 0.17562586069107056, "reward_std": 0.1041322648525238, "reward_total_composite_mean": 0.18635782599449158, "reward_total_composite_std": 0.1041322648525238, "reward_total_mean": 0.18635782599449158, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.637499988079071, "rewards/count_adherence/std": 0.06408698856830597, "rewards/meter/mean": 0.3023744523525238, "rewards/meter/std": 0.17562586069107056, "rewards/total_composite/mean": 0.18635782599449158, "rewards/total_composite/std": 0.1041322648525238, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.041240930557251, "sampling/importance_sampling_ratio/min": 0.2798839509487152, "sampling/sampling_logp_difference/max": 1.2733802795410156, "sampling/sampling_logp_difference/mean": 0.18534618616104126, "step": 216 }, { "clip_ratio/high_max": 0.0961015336215496, "clip_ratio/high_mean": 0.0961015336215496, "clip_ratio/low_mean": 0.08761653117835522, "clip_ratio/low_min": 0.08761653117835522, "clip_ratio/region_mean": 0.18371806479990482, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 52.0, "completions/mean_terminated_length": 52.0, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 2.0648878514766693, "epoch": 0.008379672536299043, "frac_reward_zero_std": 0.0, "grad_norm": 11.847907066345215, "learning_rate": 9.345454545454547e-06, "loss": -0.0148, "num_tokens": 469457.0, "reward": 0.5340137481689453, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5340137481689453, "reward_meter_std": 0.3664604425430298, "reward_std": 0.3664604127407074, "reward_total_composite_mean": 0.5340137481689453, "reward_total_composite_std": 0.3664604425430298, "reward_total_mean": 0.5340137481689453, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5340137481689453, "rewards/meter/std": 0.3664604425430298, "rewards/total_composite/mean": 0.5340137481689453, "rewards/total_composite/std": 0.3664604425430298, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0360443592071533, "sampling/importance_sampling_ratio/min": 0.1973160207271576, "sampling/sampling_logp_difference/max": 1.6229486465454102, "sampling/sampling_logp_difference/mean": 0.19996923208236694, "step": 217 }, { "clip_ratio/high_max": 0.07770076114684343, "clip_ratio/high_mean": 0.07770076114684343, "clip_ratio/low_mean": 0.05961098615080118, "clip_ratio/low_min": 0.05961098615080118, "clip_ratio/region_mean": 0.13731174729764462, "completions/clipped_ratio": 0.0, "completions/max_length": 134.0, "completions/max_terminated_length": 134.0, "completions/mean_length": 105.5, "completions/mean_terminated_length": 105.5, "completions/min_length": 97.0, "completions/min_terminated_length": 97.0, "entropy": 1.9123822152614594, "epoch": 0.008418288538770467, "frac_reward_zero_std": 0.0, "grad_norm": 8.575998306274414, "learning_rate": 9.342424242424243e-06, "loss": -0.0238, "num_tokens": 471653.0, "reward": 0.5959634184837341, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5959634184837341, "reward_meter_std": 0.32533523440361023, "reward_std": 0.32533523440361023, "reward_total_composite_mean": 0.5959634184837341, "reward_total_composite_std": 0.32533523440361023, "reward_total_mean": 0.5959634184837341, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5959634184837341, "rewards/meter/std": 0.32533523440361023, "rewards/total_composite/mean": 0.5959634184837341, "rewards/total_composite/std": 0.32533523440361023, "sampling/importance_sampling_ratio/max": 1.9590723514556885, "sampling/importance_sampling_ratio/mean": 1.0328844785690308, "sampling/importance_sampling_ratio/min": 0.2482338696718216, "sampling/sampling_logp_difference/max": 1.3933839797973633, "sampling/sampling_logp_difference/mean": 0.16784748435020447, "step": 218 }, { "clip_ratio/high_max": 0.08742227591574192, "clip_ratio/high_mean": 0.08742227591574192, "clip_ratio/low_mean": 0.07042216509580612, "clip_ratio/low_min": 0.07042216509580612, "clip_ratio/region_mean": 0.15784444101154804, "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 132.125, "completions/mean_terminated_length": 132.125, "completions/min_length": 125.0, "completions/min_terminated_length": 125.0, "entropy": 1.5948337465524673, "epoch": 0.008456904541241891, "frac_reward_zero_std": 0.0, "grad_norm": 7.932456016540527, "learning_rate": 9.33939393939394e-06, "loss": 0.0253, "num_tokens": 474198.0, "reward": 0.4994851350784302, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4994851350784302, "reward_meter_std": 0.3480455279350281, "reward_std": 0.3480455279350281, "reward_total_composite_mean": 0.4994851350784302, "reward_total_composite_std": 0.3480455279350281, "reward_total_mean": 0.4994851350784302, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4994851350784302, "rewards/meter/std": 0.3480455279350281, "rewards/total_composite/mean": 0.4994851350784302, "rewards/total_composite/std": 0.3480455279350281, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0123792886734009, "sampling/importance_sampling_ratio/min": 0.17448177933692932, "sampling/sampling_logp_difference/max": 1.7459349632263184, "sampling/sampling_logp_difference/mean": 0.17217673361301422, "step": 219 }, { "clip_ratio/high_max": 0.06848039291799068, "clip_ratio/high_mean": 0.06848039291799068, "clip_ratio/low_mean": 0.06260535214096308, "clip_ratio/low_min": 0.06260535214096308, "clip_ratio/region_mean": 0.13108574505895376, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 66.375, "completions/mean_terminated_length": 66.375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 1.6451235264539719, "epoch": 0.008495520543713315, "frac_reward_zero_std": 0.0, "grad_norm": 9.201763153076172, "learning_rate": 9.336363636363637e-06, "loss": -0.0252, "num_tokens": 475969.0, "reward": 0.5444612503051758, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5444612503051758, "reward_meter_std": 0.46134647727012634, "reward_std": 0.46134647727012634, "reward_total_composite_mean": 0.5444612503051758, "reward_total_composite_std": 0.46134647727012634, "reward_total_mean": 0.5444612503051758, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5444612503051758, "rewards/meter/std": 0.46134647727012634, "rewards/total_composite/mean": 0.5444612503051758, "rewards/total_composite/std": 0.46134647727012634, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0116194486618042, "sampling/importance_sampling_ratio/min": 0.31130722165107727, "sampling/sampling_logp_difference/max": 1.1669750213623047, "sampling/sampling_logp_difference/mean": 0.15713398158550262, "step": 220 }, { "clip_ratio/high_max": 0.07579075917601585, "clip_ratio/high_mean": 0.07579075917601585, "clip_ratio/low_mean": 0.07524601556360722, "clip_ratio/low_min": 0.07524601556360722, "clip_ratio/region_mean": 0.15103677473962307, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 58.625, "completions/mean_terminated_length": 58.625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 1.5837604850530624, "epoch": 0.00853413654618474, "frac_reward_zero_std": 0.0, "grad_norm": 11.238251686096191, "learning_rate": 9.333333333333334e-06, "loss": -0.0093, "num_tokens": 477742.0, "reward": 0.5600961446762085, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5600961446762085, "reward_meter_std": 0.4695318341255188, "reward_std": 0.4695318341255188, "reward_total_composite_mean": 0.5600961446762085, "reward_total_composite_std": 0.4695318341255188, "reward_total_mean": 0.5600961446762085, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5600961446762085, "rewards/meter/std": 0.4695318341255188, "rewards/total_composite/mean": 0.5600961446762085, "rewards/total_composite/std": 0.4695318341255188, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.021318793296814, "sampling/importance_sampling_ratio/min": 0.14270596206188202, "sampling/sampling_logp_difference/max": 1.9469690322875977, "sampling/sampling_logp_difference/mean": 0.16859595477581024, "step": 221 }, { "clip_ratio/high_max": 0.09998656460084021, "clip_ratio/high_mean": 0.09998656460084021, "clip_ratio/low_mean": 0.022727273404598236, "clip_ratio/low_min": 0.022727273404598236, "clip_ratio/region_mean": 0.12271383800543845, "completions/clipped_ratio": 0.0, "completions/max_length": 41.0, "completions/max_terminated_length": 41.0, "completions/mean_length": 36.0, "completions/mean_terminated_length": 36.0, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 1.5899460166692734, "epoch": 0.008572752548656163, "frac_reward_zero_std": 0.0, "grad_norm": 11.750017166137695, "learning_rate": 9.33030303030303e-06, "loss": -0.147, "num_tokens": 479254.0, "reward": 0.8671466112136841, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8671466112136841, "reward_meter_std": 0.3500947654247284, "reward_std": 0.3500947654247284, "reward_total_composite_mean": 0.8671466112136841, "reward_total_composite_std": 0.3500947654247284, "reward_total_mean": 0.8671466112136841, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8671466112136841, "rewards/meter/std": 0.3500947654247284, "rewards/total_composite/mean": 0.8671466112136841, "rewards/total_composite/std": 0.3500947654247284, "sampling/importance_sampling_ratio/max": 1.9629331827163696, "sampling/importance_sampling_ratio/mean": 1.0165225267410278, "sampling/importance_sampling_ratio/min": 0.13546092808246613, "sampling/sampling_logp_difference/max": 1.9990720748901367, "sampling/sampling_logp_difference/mean": 0.16731053590774536, "step": 222 }, { "clip_ratio/high_max": 0.07255261763930321, "clip_ratio/high_mean": 0.07255261763930321, "clip_ratio/low_mean": 0.05262349545955658, "clip_ratio/low_min": 0.05262349545955658, "clip_ratio/region_mean": 0.1251761130988598, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 73.75, "completions/mean_terminated_length": 73.75, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 1.9959132969379425, "epoch": 0.008611368551127587, "frac_reward_zero_std": 0.0, "grad_norm": 7.995184421539307, "learning_rate": 9.327272727272729e-06, "loss": -0.0678, "num_tokens": 481092.0, "reward": 0.8009564280509949, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8009564280509949, "reward_meter_std": 0.26855042576789856, "reward_std": 0.26855039596557617, "reward_total_composite_mean": 0.8009564280509949, "reward_total_composite_std": 0.26855042576789856, "reward_total_mean": 0.8009564280509949, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8009564280509949, "rewards/meter/std": 0.26855042576789856, "rewards/total_composite/mean": 0.8009564280509949, "rewards/total_composite/std": 0.26855042576789856, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0155538320541382, "sampling/importance_sampling_ratio/min": 0.2769174873828888, "sampling/sampling_logp_difference/max": 1.2840356826782227, "sampling/sampling_logp_difference/mean": 0.17098720371723175, "step": 223 }, { "clip_ratio/high_max": 0.10716481134295464, "clip_ratio/high_mean": 0.10716481134295464, "clip_ratio/low_mean": 0.04744089301675558, "clip_ratio/low_min": 0.04744089301675558, "clip_ratio/region_mean": 0.15460570435971022, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 102.125, "completions/mean_terminated_length": 102.125, "completions/min_length": 98.0, "completions/min_terminated_length": 98.0, "entropy": 1.7342596799135208, "epoch": 0.008649984553599012, "frac_reward_zero_std": 0.0, "grad_norm": 8.910178184509277, "learning_rate": 9.324242424242424e-06, "loss": 0.0128, "num_tokens": 483221.0, "reward": 0.7856420278549194, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7856420278549194, "reward_meter_std": 0.2833492159843445, "reward_std": 0.2833492159843445, "reward_total_composite_mean": 0.7856420278549194, "reward_total_composite_std": 0.2833492159843445, "reward_total_mean": 0.7856420278549194, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7856420278549194, "rewards/meter/std": 0.2833492159843445, "rewards/total_composite/mean": 0.7856420278549194, "rewards/total_composite/std": 0.2833492159843445, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.028478741645813, "sampling/importance_sampling_ratio/min": 0.1979585438966751, "sampling/sampling_logp_difference/max": 1.6196975708007812, "sampling/sampling_logp_difference/mean": 0.16320450603961945, "step": 224 }, { "clip_ratio/high_max": 0.0867786854505539, "clip_ratio/high_mean": 0.0867786854505539, "clip_ratio/low_mean": 0.04819977842271328, "clip_ratio/low_min": 0.04819977842271328, "clip_ratio/region_mean": 0.13497846387326717, "completions/clipped_ratio": 0.0, "completions/max_length": 211.0, "completions/max_terminated_length": 211.0, "completions/mean_length": 190.375, "completions/mean_terminated_length": 190.375, "completions/min_length": 153.0, "completions/min_terminated_length": 153.0, "entropy": 2.218223586678505, "epoch": 0.008688600556070436, "frac_reward_zero_std": 0.0, "grad_norm": 5.88389253616333, "learning_rate": 9.321212121212122e-06, "loss": 0.0627, "num_tokens": 486360.0, "reward": 0.6395675539970398, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625820279121399, "reward_meter_mean": 0.680176854133606, "reward_meter_std": 0.38275107741355896, "reward_std": 0.3551376461982727, "reward_total_composite_mean": 0.6395675539970398, "reward_total_composite_std": 0.3551376760005951, "reward_total_mean": 0.6395675539970398, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625820279121399, "rewards/meter/mean": 0.680176854133606, "rewards/meter/std": 0.38275107741355896, "rewards/total_composite/mean": 0.6395675539970398, "rewards/total_composite/std": 0.3551376760005951, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.033612608909607, "sampling/importance_sampling_ratio/min": 0.1116233542561531, "sampling/sampling_logp_difference/max": 2.192625045776367, "sampling/sampling_logp_difference/mean": 0.16371257603168488, "step": 225 }, { "clip_ratio/high_max": 0.09920443315058947, "clip_ratio/high_mean": 0.09920443315058947, "clip_ratio/low_mean": 0.030824373476207256, "clip_ratio/low_min": 0.030824373476207256, "clip_ratio/region_mean": 0.13002880662679672, "completions/clipped_ratio": 0.0, "completions/max_length": 170.0, "completions/max_terminated_length": 170.0, "completions/mean_length": 157.75, "completions/mean_terminated_length": 157.75, "completions/min_length": 140.0, "completions/min_terminated_length": 140.0, "entropy": 1.9846401810646057, "epoch": 0.00872721655854186, "frac_reward_zero_std": 0.0, "grad_norm": 4.9813737869262695, "learning_rate": 9.318181818181819e-06, "loss": 0.0006, "num_tokens": 489110.0, "reward": 0.8852719068527222, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8852719068527222, "reward_meter_std": 0.17902569472789764, "reward_std": 0.17902567982673645, "reward_total_composite_mean": 0.8852719068527222, "reward_total_composite_std": 0.17902569472789764, "reward_total_mean": 0.8852719068527222, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8852719068527222, "rewards/meter/std": 0.17902569472789764, "rewards/total_composite/mean": 0.8852719068527222, "rewards/total_composite/std": 0.17902569472789764, "sampling/importance_sampling_ratio/max": 1.984347939491272, "sampling/importance_sampling_ratio/mean": 1.0297491550445557, "sampling/importance_sampling_ratio/min": 0.2885850667953491, "sampling/sampling_logp_difference/max": 1.2427654266357422, "sampling/sampling_logp_difference/mean": 0.14676453173160553, "step": 226 }, { "clip_ratio/high_max": 0.09229664131999016, "clip_ratio/high_mean": 0.09229664131999016, "clip_ratio/low_mean": 0.07808315567672253, "clip_ratio/low_min": 0.07808315567672253, "clip_ratio/region_mean": 0.17037979699671268, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 56.25, "completions/mean_terminated_length": 56.25, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 2.041958436369896, "epoch": 0.008765832561013284, "frac_reward_zero_std": 0.0, "grad_norm": 10.270444869995117, "learning_rate": 9.315151515151516e-06, "loss": 0.1164, "num_tokens": 490872.0, "reward": 0.36732152104377747, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.36732152104377747, "reward_meter_std": 0.30656546354293823, "reward_std": 0.30656546354293823, "reward_total_composite_mean": 0.36732152104377747, "reward_total_composite_std": 0.30656546354293823, "reward_total_mean": 0.36732152104377747, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.36732152104377747, "rewards/meter/std": 0.30656546354293823, "rewards/total_composite/mean": 0.36732152104377747, "rewards/total_composite/std": 0.30656546354293823, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0084258317947388, "sampling/importance_sampling_ratio/min": 0.21239109337329865, "sampling/sampling_logp_difference/max": 1.549325942993164, "sampling/sampling_logp_difference/mean": 0.18055380880832672, "step": 227 }, { "clip_ratio/high_max": 0.1098766503855586, "clip_ratio/high_mean": 0.1098766503855586, "clip_ratio/low_mean": 0.027772237546741962, "clip_ratio/low_min": 0.027772237546741962, "clip_ratio/region_mean": 0.13764888793230057, "completions/clipped_ratio": 0.0, "completions/max_length": 109.0, "completions/max_terminated_length": 109.0, "completions/mean_length": 91.25, "completions/mean_terminated_length": 91.25, "completions/min_length": 82.0, "completions/min_terminated_length": 82.0, "entropy": 1.5294092446565628, "epoch": 0.008804448563484708, "frac_reward_zero_std": 0.0, "grad_norm": 9.097184181213379, "learning_rate": 9.312121212121212e-06, "loss": 0.0772, "num_tokens": 492930.0, "reward": 0.8796967267990112, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8796967267990112, "reward_meter_std": 0.2009752243757248, "reward_std": 0.2009752094745636, "reward_total_composite_mean": 0.8796967267990112, "reward_total_composite_std": 0.2009752243757248, "reward_total_mean": 0.8796967267990112, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8796967267990112, "rewards/meter/std": 0.2009752243757248, "rewards/total_composite/mean": 0.8796967267990112, "rewards/total_composite/std": 0.2009752243757248, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.02587890625, "sampling/importance_sampling_ratio/min": 0.15230019390583038, "sampling/sampling_logp_difference/max": 1.881901741027832, "sampling/sampling_logp_difference/mean": 0.14313152432441711, "step": 228 }, { "clip_ratio/high_max": 0.04163628350943327, "clip_ratio/high_mean": 0.04163628350943327, "clip_ratio/low_mean": 0.0690256292000413, "clip_ratio/low_min": 0.0690256292000413, "clip_ratio/region_mean": 0.11066191270947456, "completions/clipped_ratio": 0.0, "completions/max_length": 232.0, "completions/max_terminated_length": 232.0, "completions/mean_length": 215.0, "completions/mean_terminated_length": 215.0, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "entropy": 1.8009164333343506, "epoch": 0.008843064565956132, "frac_reward_zero_std": 0.0, "grad_norm": 4.891687393188477, "learning_rate": 9.30909090909091e-06, "loss": 0.0304, "num_tokens": 496362.0, "reward": 0.4802461862564087, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_meter_mean": 0.5281928777694702, "reward_meter_std": 0.36326658725738525, "reward_std": 0.3348220884799957, "reward_total_composite_mean": 0.4802461862564087, "reward_total_composite_std": 0.3348220884799957, "reward_total_mean": 0.4802461862564087, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/meter/mean": 0.5281928777694702, "rewards/meter/std": 0.36326658725738525, "rewards/total_composite/mean": 0.4802461862564087, "rewards/total_composite/std": 0.3348220884799957, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.028792381286621, "sampling/importance_sampling_ratio/min": 0.24842379987239838, "sampling/sampling_logp_difference/max": 1.3926191329956055, "sampling/sampling_logp_difference/mean": 0.14938952028751373, "step": 229 }, { "clip_ratio/high_max": 0.12172973342239857, "clip_ratio/high_mean": 0.12172973342239857, "clip_ratio/low_mean": 0.03780912980437279, "clip_ratio/low_min": 0.03780912980437279, "clip_ratio/region_mean": 0.15953886322677135, "completions/clipped_ratio": 0.0, "completions/max_length": 133.0, "completions/max_terminated_length": 133.0, "completions/mean_length": 117.625, "completions/mean_terminated_length": 117.625, "completions/min_length": 83.0, "completions/min_terminated_length": 83.0, "entropy": 1.9786228984594345, "epoch": 0.008881680568427556, "frac_reward_zero_std": 0.0, "grad_norm": 8.536412239074707, "learning_rate": 9.306060606060608e-06, "loss": -0.0263, "num_tokens": 498671.0, "reward": 0.723436713218689, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.723436713218689, "reward_meter_std": 0.3901357650756836, "reward_std": 0.3901357650756836, "reward_total_composite_mean": 0.723436713218689, "reward_total_composite_std": 0.3901357650756836, "reward_total_mean": 0.723436713218689, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.723436713218689, "rewards/meter/std": 0.3901357650756836, "rewards/total_composite/mean": 0.723436713218689, "rewards/total_composite/std": 0.3901357650756836, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0375686883926392, "sampling/importance_sampling_ratio/min": 0.3272934556007385, "sampling/sampling_logp_difference/max": 1.1610007286071777, "sampling/sampling_logp_difference/mean": 0.17858588695526123, "step": 230 }, { "clip_ratio/high_max": 0.07807724550366402, "clip_ratio/high_mean": 0.07807724550366402, "clip_ratio/low_mean": 0.06935460586100817, "clip_ratio/low_min": 0.06935460586100817, "clip_ratio/region_mean": 0.14743185136467218, "completions/clipped_ratio": 0.0, "completions/max_length": 126.0, "completions/max_terminated_length": 126.0, "completions/mean_length": 115.75, "completions/mean_terminated_length": 115.75, "completions/min_length": 106.0, "completions/min_terminated_length": 106.0, "entropy": 2.1323368698358536, "epoch": 0.00892029657089898, "frac_reward_zero_std": 0.0, "grad_norm": 6.538661003112793, "learning_rate": 9.303030303030303e-06, "loss": 0.0366, "num_tokens": 500877.0, "reward": 0.6978538036346436, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6978538036346436, "reward_meter_std": 0.3173922300338745, "reward_std": 0.3173922002315521, "reward_total_composite_mean": 0.6978538036346436, "reward_total_composite_std": 0.3173922300338745, "reward_total_mean": 0.6978538036346436, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6978538036346436, "rewards/meter/std": 0.3173922300338745, "rewards/total_composite/mean": 0.6978538036346436, "rewards/total_composite/std": 0.3173922300338745, "sampling/importance_sampling_ratio/max": 1.9082386493682861, "sampling/importance_sampling_ratio/mean": 1.036413550376892, "sampling/importance_sampling_ratio/min": 0.2662426829338074, "sampling/sampling_logp_difference/max": 1.3233470916748047, "sampling/sampling_logp_difference/mean": 0.15994611382484436, "step": 231 }, { "clip_ratio/high_max": 0.12983744032680988, "clip_ratio/high_mean": 0.12983744032680988, "clip_ratio/low_mean": 0.03656993992626667, "clip_ratio/low_min": 0.03656993992626667, "clip_ratio/region_mean": 0.16640738025307655, "completions/clipped_ratio": 0.0, "completions/max_length": 168.0, "completions/max_terminated_length": 168.0, "completions/mean_length": 147.875, "completions/mean_terminated_length": 147.875, "completions/min_length": 122.0, "completions/min_terminated_length": 122.0, "entropy": 1.93074631690979, "epoch": 0.008958912573370404, "frac_reward_zero_std": 0.0, "grad_norm": 6.832438945770264, "learning_rate": 9.3e-06, "loss": 0.0737, "num_tokens": 503508.0, "reward": 0.7425558567047119, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.7667824029922485, "reward_meter_std": 0.29820093512535095, "reward_std": 0.2870854139328003, "reward_total_composite_mean": 0.7425558567047119, "reward_total_composite_std": 0.2870854437351227, "reward_total_mean": 0.7425558567047119, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.7667824029922485, "rewards/meter/std": 0.29820093512535095, "rewards/total_composite/mean": 0.7425558567047119, "rewards/total_composite/std": 0.2870854437351227, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031022071838379, "sampling/importance_sampling_ratio/min": 0.20527270436286926, "sampling/sampling_logp_difference/max": 1.5834159851074219, "sampling/sampling_logp_difference/mean": 0.1671251356601715, "step": 232 }, { "clip_ratio/high_max": 0.023773369379341602, "clip_ratio/high_mean": 0.023773369379341602, "clip_ratio/low_mean": 0.009834368713200092, "clip_ratio/low_min": 0.009834368713200092, "clip_ratio/region_mean": 0.033607738092541695, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 497.0, "completions/mean_length": 502.5, "completions/mean_terminated_length": 486.66668701171875, "completions/min_length": 480.0, "completions/min_terminated_length": 480.0, "entropy": 0.6105214804410934, "epoch": 0.008997528575841829, "frac_reward_zero_std": 0.0, "grad_norm": 1.5289084911346436, "learning_rate": 9.296969696969698e-06, "loss": -0.0188, "num_tokens": 506784.0, "reward": 0.3117174506187439, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.53125, "reward_count_adherence_std": 0.25877460837364197, "reward_meter_mean": 0.6105531454086304, "reward_meter_std": 0.27458783984184265, "reward_std": 0.19874344766139984, "reward_total_composite_mean": 0.3117174506187439, "reward_total_composite_std": 0.19874346256256104, "reward_total_mean": 0.3117174506187439, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.53125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/meter/mean": 0.6105531454086304, "rewards/meter/std": 0.27458783984184265, "rewards/total_composite/mean": 0.3117174506187439, "rewards/total_composite/std": 0.19874346256256104, "sampling/importance_sampling_ratio/max": 1.9305408000946045, "sampling/importance_sampling_ratio/mean": 1.0306029319763184, "sampling/importance_sampling_ratio/min": 0.19593879580497742, "sampling/sampling_logp_difference/max": 1.6299529075622559, "sampling/sampling_logp_difference/mean": 0.12929628789424896, "step": 233 }, { "clip_ratio/high_max": 0.09212539158761501, "clip_ratio/high_mean": 0.09212539158761501, "clip_ratio/low_mean": 0.09165013581514359, "clip_ratio/low_min": 0.09165013581514359, "clip_ratio/region_mean": 0.1837755274027586, "completions/clipped_ratio": 0.0, "completions/max_length": 48.0, "completions/max_terminated_length": 48.0, "completions/mean_length": 42.25, "completions/mean_terminated_length": 42.25, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 1.387149639427662, "epoch": 0.009036144578313253, "frac_reward_zero_std": 0.0, "grad_norm": 17.917465209960938, "learning_rate": 9.293939393939395e-06, "loss": 0.1226, "num_tokens": 508394.0, "reward": 0.44727417826652527, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.44727417826652527, "reward_meter_std": 0.3157028555870056, "reward_std": 0.3157028555870056, "reward_total_composite_mean": 0.44727417826652527, "reward_total_composite_std": 0.3157028555870056, "reward_total_mean": 0.44727417826652527, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.44727417826652527, "rewards/meter/std": 0.3157028555870056, "rewards/total_composite/mean": 0.44727417826652527, "rewards/total_composite/std": 0.3157028555870056, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9895703792572021, "sampling/importance_sampling_ratio/min": 0.10507524758577347, "sampling/sampling_logp_difference/max": 2.2530784606933594, "sampling/sampling_logp_difference/mean": 0.20457275211811066, "step": 234 }, { "clip_ratio/high_max": 0.10756326653063297, "clip_ratio/high_mean": 0.10756326653063297, "clip_ratio/low_mean": 0.02009246125817299, "clip_ratio/low_min": 0.02009246125817299, "clip_ratio/region_mean": 0.12765572778880596, "completions/clipped_ratio": 0.0, "completions/max_length": 81.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 73.875, "completions/mean_terminated_length": 73.875, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 1.776310458779335, "epoch": 0.009074760580784677, "frac_reward_zero_std": 0.0, "grad_norm": 9.29736042022705, "learning_rate": 9.29090909090909e-06, "loss": 0.034, "num_tokens": 510345.0, "reward": 0.9192884564399719, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9192884564399719, "reward_meter_std": 0.1364532858133316, "reward_std": 0.1364532709121704, "reward_total_composite_mean": 0.9192884564399719, "reward_total_composite_std": 0.1364532858133316, "reward_total_mean": 0.9192884564399719, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9192884564399719, "rewards/meter/std": 0.1364532858133316, "rewards/total_composite/mean": 0.9192884564399719, "rewards/total_composite/std": 0.1364532858133316, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0462172031402588, "sampling/importance_sampling_ratio/min": 0.16506147384643555, "sampling/sampling_logp_difference/max": 1.8014373779296875, "sampling/sampling_logp_difference/mean": 0.15465568006038666, "step": 235 }, { "clip_ratio/high_max": 0.07200214825570583, "clip_ratio/high_mean": 0.07200214825570583, "clip_ratio/low_mean": 0.06175778992474079, "clip_ratio/low_min": 0.06175778992474079, "clip_ratio/region_mean": 0.13375993818044662, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 75.625, "completions/mean_terminated_length": 75.625, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 1.796240046620369, "epoch": 0.0091133765832561, "frac_reward_zero_std": 0.0, "grad_norm": 8.880298614501953, "learning_rate": 9.28787878787879e-06, "loss": 0.01, "num_tokens": 512262.0, "reward": 0.6458913087844849, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6458913087844849, "reward_meter_std": 0.33680447936058044, "reward_std": 0.33680450916290283, "reward_total_composite_mean": 0.6458913087844849, "reward_total_composite_std": 0.33680447936058044, "reward_total_mean": 0.6458913087844849, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6458913087844849, "rewards/meter/std": 0.33680447936058044, "rewards/total_composite/mean": 0.6458913087844849, "rewards/total_composite/std": 0.33680447936058044, "sampling/importance_sampling_ratio/max": 1.9332317113876343, "sampling/importance_sampling_ratio/mean": 1.0316869020462036, "sampling/importance_sampling_ratio/min": 0.26908063888549805, "sampling/sampling_logp_difference/max": 1.312744140625, "sampling/sampling_logp_difference/mean": 0.14490646123886108, "step": 236 }, { "clip_ratio/high_max": 0.05680421367287636, "clip_ratio/high_mean": 0.05680421367287636, "clip_ratio/low_mean": 0.08504617214202881, "clip_ratio/low_min": 0.08504617214202881, "clip_ratio/region_mean": 0.14185038581490517, "completions/clipped_ratio": 0.0, "completions/max_length": 102.0, "completions/max_terminated_length": 102.0, "completions/mean_length": 95.625, "completions/mean_terminated_length": 95.625, "completions/min_length": 87.0, "completions/min_terminated_length": 87.0, "entropy": 1.7081756442785263, "epoch": 0.009151992585727525, "frac_reward_zero_std": 0.0, "grad_norm": 8.00853443145752, "learning_rate": 9.284848484848485e-06, "loss": 0.0414, "num_tokens": 514491.0, "reward": 0.4599551856517792, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.4600679576396942, "reward_meter_std": 0.4352971911430359, "reward_std": 0.43543270230293274, "reward_total_composite_mean": 0.4599551856517792, "reward_total_composite_std": 0.43543270230293274, "reward_total_mean": 0.4599551856517792, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.4600679576396942, "rewards/meter/std": 0.4352971911430359, "rewards/total_composite/mean": 0.4599551856517792, "rewards/total_composite/std": 0.43543270230293274, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.032072901725769, "sampling/importance_sampling_ratio/min": 0.3347611427307129, "sampling/sampling_logp_difference/max": 1.0943379402160645, "sampling/sampling_logp_difference/mean": 0.1568225622177124, "step": 237 }, { "clip_ratio/high_max": 0.09207058418542147, "clip_ratio/high_mean": 0.09207058418542147, "clip_ratio/low_mean": 0.03305934276431799, "clip_ratio/low_min": 0.03305934276431799, "clip_ratio/region_mean": 0.12512992694973946, "completions/clipped_ratio": 0.0, "completions/max_length": 221.0, "completions/max_terminated_length": 221.0, "completions/mean_length": 166.25, "completions/mean_terminated_length": 166.25, "completions/min_length": 128.0, "completions/min_terminated_length": 128.0, "entropy": 2.2700495421886444, "epoch": 0.009190608588198949, "frac_reward_zero_std": 0.0, "grad_norm": 5.644252300262451, "learning_rate": 9.281818181818183e-06, "loss": 0.1335, "num_tokens": 517253.0, "reward": 0.5001842379570007, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.7250000238418579, "reward_count_adherence_std": 0.14880476891994476, "reward_meter_mean": 0.7441527843475342, "reward_meter_std": 0.38449952006340027, "reward_std": 0.37060803174972534, "reward_total_composite_mean": 0.5001842379570007, "reward_total_composite_std": 0.37060803174972534, "reward_total_mean": 0.5001842379570007, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.7250000238418579, "rewards/count_adherence/std": 0.14880476891994476, "rewards/meter/mean": 0.7441527843475342, "rewards/meter/std": 0.38449952006340027, "rewards/total_composite/mean": 0.5001842379570007, "rewards/total_composite/std": 0.37060803174972534, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0297116041183472, "sampling/importance_sampling_ratio/min": 0.23600395023822784, "sampling/sampling_logp_difference/max": 1.4439067840576172, "sampling/sampling_logp_difference/mean": 0.16780243813991547, "step": 238 }, { "clip_ratio/high_max": 0.07056730799376965, "clip_ratio/high_mean": 0.07056730799376965, "clip_ratio/low_mean": 0.06852707732468843, "clip_ratio/low_min": 0.06852707732468843, "clip_ratio/region_mean": 0.13909438531845808, "completions/clipped_ratio": 0.0, "completions/max_length": 144.0, "completions/max_terminated_length": 144.0, "completions/mean_length": 118.875, "completions/mean_terminated_length": 118.875, "completions/min_length": 106.0, "completions/min_terminated_length": 106.0, "entropy": 2.404376655817032, "epoch": 0.009229224590670373, "frac_reward_zero_std": 0.0, "grad_norm": 6.0654401779174805, "learning_rate": 9.27878787878788e-06, "loss": 0.0538, "num_tokens": 519716.0, "reward": 0.5465434193611145, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.5814238786697388, "reward_meter_std": 0.36550426483154297, "reward_std": 0.35062772035598755, "reward_total_composite_mean": 0.5465434193611145, "reward_total_composite_std": 0.35062775015830994, "reward_total_mean": 0.5465434193611145, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.5814238786697388, "rewards/meter/std": 0.36550426483154297, "rewards/total_composite/mean": 0.5465434193611145, "rewards/total_composite/std": 0.35062775015830994, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.043744683265686, "sampling/importance_sampling_ratio/min": 0.301893949508667, "sampling/sampling_logp_difference/max": 1.1976795196533203, "sampling/sampling_logp_difference/mean": 0.17544740438461304, "step": 239 }, { "clip_ratio/high_max": 0.0725616067647934, "clip_ratio/high_mean": 0.0725616067647934, "clip_ratio/low_mean": 0.04993662517517805, "clip_ratio/low_min": 0.04993662517517805, "clip_ratio/region_mean": 0.12249823193997145, "completions/clipped_ratio": 0.0, "completions/max_length": 115.0, "completions/max_terminated_length": 115.0, "completions/mean_length": 101.375, "completions/mean_terminated_length": 101.375, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 2.066037192940712, "epoch": 0.009267840593141797, "frac_reward_zero_std": 0.0, "grad_norm": 8.986166000366211, "learning_rate": 9.275757575757577e-06, "loss": 0.0204, "num_tokens": 521863.0, "reward": 0.9709064960479736, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9709064960479736, "reward_meter_std": 0.027551084756851196, "reward_std": 0.02755107544362545, "reward_total_composite_mean": 0.9709064960479736, "reward_total_composite_std": 0.027551084756851196, "reward_total_mean": 0.9709064960479736, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9709064960479736, "rewards/meter/std": 0.027551084756851196, "rewards/total_composite/mean": 0.9709064960479736, "rewards/total_composite/std": 0.027551084756851196, "sampling/importance_sampling_ratio/max": 1.8251866102218628, "sampling/importance_sampling_ratio/mean": 1.0282772779464722, "sampling/importance_sampling_ratio/min": 0.3129824995994568, "sampling/sampling_logp_difference/max": 1.1616079807281494, "sampling/sampling_logp_difference/mean": 0.16349507868289948, "step": 240 }, { "clip_ratio/high_max": 0.06964285857975483, "clip_ratio/high_mean": 0.06964285857975483, "clip_ratio/low_mean": 0.0722261555492878, "clip_ratio/low_min": 0.0722261555492878, "clip_ratio/region_mean": 0.14186901412904263, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 85.0, "completions/mean_terminated_length": 85.0, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 2.1117777675390244, "epoch": 0.009306456595613221, "frac_reward_zero_std": 0.0, "grad_norm": 8.806304931640625, "learning_rate": 9.272727272727273e-06, "loss": 0.0892, "num_tokens": 523847.0, "reward": 0.2626701593399048, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_meter_mean": 0.45606791973114014, "reward_meter_std": 0.38195329904556274, "reward_std": 0.22439199686050415, "reward_total_composite_mean": 0.2626701593399048, "reward_total_composite_std": 0.22439196705818176, "reward_total_mean": 0.2626701593399048, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/meter/mean": 0.45606791973114014, "rewards/meter/std": 0.38195329904556274, "rewards/total_composite/mean": 0.2626701593399048, "rewards/total_composite/std": 0.22439196705818176, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031845211982727, "sampling/importance_sampling_ratio/min": 0.20610834658145905, "sampling/sampling_logp_difference/max": 1.5793533325195312, "sampling/sampling_logp_difference/mean": 0.1751883327960968, "step": 241 }, { "clip_ratio/high_max": 0.11791071016341448, "clip_ratio/high_mean": 0.11791071016341448, "clip_ratio/low_mean": 0.03575989790260792, "clip_ratio/low_min": 0.03575989790260792, "clip_ratio/region_mean": 0.1536706080660224, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 83.25, "completions/mean_terminated_length": 83.25, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 2.2592698484659195, "epoch": 0.009345072598084645, "frac_reward_zero_std": 0.0, "grad_norm": 8.190821647644043, "learning_rate": 9.26969696969697e-06, "loss": 0.0767, "num_tokens": 525777.0, "reward": 0.800595223903656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8624944686889648, "reward_meter_std": 0.33260369300842285, "reward_std": 0.35097363591194153, "reward_total_composite_mean": 0.800595223903656, "reward_total_composite_std": 0.3509736657142639, "reward_total_mean": 0.800595223903656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8624944686889648, "rewards/meter/std": 0.33260369300842285, "rewards/total_composite/mean": 0.800595223903656, "rewards/total_composite/std": 0.3509736657142639, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0372215509414673, "sampling/importance_sampling_ratio/min": 0.26800885796546936, "sampling/sampling_logp_difference/max": 1.3167352676391602, "sampling/sampling_logp_difference/mean": 0.16949887573719025, "step": 242 }, { "clip_ratio/high_max": 0.14678451232612133, "clip_ratio/high_mean": 0.14678451232612133, "clip_ratio/low_mean": 0.01953125, "clip_ratio/low_min": 0.01953125, "clip_ratio/region_mean": 0.16631576232612133, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 62.875, "completions/mean_terminated_length": 62.875, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 1.626624509692192, "epoch": 0.009383688600556071, "frac_reward_zero_std": 0.0, "grad_norm": 9.102118492126465, "learning_rate": 9.266666666666667e-06, "loss": 0.0226, "num_tokens": 527584.0, "reward": 0.969333827495575, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.969333827495575, "reward_meter_std": 0.05763925239443779, "reward_std": 0.0576392337679863, "reward_total_composite_mean": 0.969333827495575, "reward_total_composite_std": 0.05763925239443779, "reward_total_mean": 0.969333827495575, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.969333827495575, "rewards/meter/std": 0.05763925239443779, "rewards/total_composite/mean": 0.969333827495575, "rewards/total_composite/std": 0.05763925239443779, "sampling/importance_sampling_ratio/max": 1.6970453262329102, "sampling/importance_sampling_ratio/mean": 1.0088082551956177, "sampling/importance_sampling_ratio/min": 0.2735597789287567, "sampling/sampling_logp_difference/max": 1.2962350845336914, "sampling/sampling_logp_difference/mean": 0.15184138715267181, "step": 243 }, { "clip_ratio/high_max": 0.074860580265522, "clip_ratio/high_mean": 0.074860580265522, "clip_ratio/low_mean": 0.07911759708076715, "clip_ratio/low_min": 0.07911759708076715, "clip_ratio/region_mean": 0.15397817734628916, "completions/clipped_ratio": 0.0, "completions/max_length": 138.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 118.5, "completions/mean_terminated_length": 118.5, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 2.060980185866356, "epoch": 0.009422304603027495, "frac_reward_zero_std": 0.0, "grad_norm": 7.276552677154541, "learning_rate": 9.263636363636364e-06, "loss": 0.0658, "num_tokens": 529780.0, "reward": 0.356499046087265, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.3871627748012543, "reward_meter_std": 0.4140600562095642, "reward_std": 0.3705804646015167, "reward_total_composite_mean": 0.356499046087265, "reward_total_composite_std": 0.3705804646015167, "reward_total_mean": 0.356499046087265, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.3871627748012543, "rewards/meter/std": 0.4140600562095642, "rewards/total_composite/mean": 0.356499046087265, "rewards/total_composite/std": 0.3705804646015167, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0257729291915894, "sampling/importance_sampling_ratio/min": 0.2939786911010742, "sampling/sampling_logp_difference/max": 1.224247932434082, "sampling/sampling_logp_difference/mean": 0.17408481240272522, "step": 244 }, { "clip_ratio/high_max": 0.05074426345527172, "clip_ratio/high_mean": 0.05074426345527172, "clip_ratio/low_mean": 0.07482307218015194, "clip_ratio/low_min": 0.07482307218015194, "clip_ratio/region_mean": 0.12556733563542366, "completions/clipped_ratio": 0.0, "completions/max_length": 139.0, "completions/max_terminated_length": 139.0, "completions/mean_length": 122.875, "completions/mean_terminated_length": 122.875, "completions/min_length": 101.0, "completions/min_terminated_length": 101.0, "entropy": 1.7008240818977356, "epoch": 0.00946092060549892, "frac_reward_zero_std": 0.0, "grad_norm": 7.2777557373046875, "learning_rate": 9.260606060606062e-06, "loss": -0.024, "num_tokens": 532179.0, "reward": 0.6617265939712524, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_meter_mean": 0.6986033320426941, "reward_meter_std": 0.25926199555397034, "reward_std": 0.2768361568450928, "reward_total_composite_mean": 0.6617265939712524, "reward_total_composite_std": 0.27683618664741516, "reward_total_mean": 0.6617265939712524, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/meter/mean": 0.6986033320426941, "rewards/meter/std": 0.25926199555397034, "rewards/total_composite/mean": 0.6617265939712524, "rewards/total_composite/std": 0.27683618664741516, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0323891639709473, "sampling/importance_sampling_ratio/min": 0.29009345173835754, "sampling/sampling_logp_difference/max": 1.3864390850067139, "sampling/sampling_logp_difference/mean": 0.15021459758281708, "step": 245 }, { "clip_ratio/high_max": 0.05021729413419962, "clip_ratio/high_mean": 0.05021729413419962, "clip_ratio/low_mean": 0.05107419705018401, "clip_ratio/low_min": 0.05107419705018401, "clip_ratio/region_mean": 0.10129149118438363, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 186.0, "completions/mean_length": 208.5, "completions/mean_terminated_length": 165.1428680419922, "completions/min_length": 147.0, "completions/min_terminated_length": 147.0, "entropy": 2.3770622611045837, "epoch": 0.009499536607970344, "frac_reward_zero_std": 0.0, "grad_norm": 4.300860404968262, "learning_rate": 9.257575757575759e-06, "loss": 0.0104, "num_tokens": 535079.0, "reward": 0.39897841215133667, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.16690459847450256, "reward_meter_mean": 0.622548520565033, "reward_meter_std": 0.3121766746044159, "reward_std": 0.22350633144378662, "reward_total_composite_mean": 0.39897841215133667, "reward_total_composite_std": 0.22350633144378662, "reward_total_mean": 0.39897841215133667, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.16690459847450256, "rewards/meter/mean": 0.622548520565033, "rewards/meter/std": 0.3121766746044159, "rewards/total_composite/mean": 0.39897841215133667, "rewards/total_composite/std": 0.22350633144378662, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0414752960205078, "sampling/importance_sampling_ratio/min": 0.19777174293994904, "sampling/sampling_logp_difference/max": 1.6206417083740234, "sampling/sampling_logp_difference/mean": 0.1846722960472107, "step": 246 }, { "clip_ratio/high_max": 0.13099952787160873, "clip_ratio/high_mean": 0.13099952787160873, "clip_ratio/low_mean": 0.017326733097434044, "clip_ratio/low_min": 0.017326733097434044, "clip_ratio/region_mean": 0.14832626096904278, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 73.5, "completions/mean_terminated_length": 73.5, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 2.306705191731453, "epoch": 0.009538152610441768, "frac_reward_zero_std": 0.0, "grad_norm": 9.519201278686523, "learning_rate": 9.254545454545454e-06, "loss": 0.1449, "num_tokens": 536963.0, "reward": 0.7730816006660461, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7730816006660461, "reward_meter_std": 0.314135879278183, "reward_std": 0.314135879278183, "reward_total_composite_mean": 0.7730816006660461, "reward_total_composite_std": 0.314135879278183, "reward_total_mean": 0.7730816006660461, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7730816006660461, "rewards/meter/std": 0.314135879278183, "rewards/total_composite/mean": 0.7730816006660461, "rewards/total_composite/std": 0.314135879278183, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.046431541442871, "sampling/importance_sampling_ratio/min": 0.2123212218284607, "sampling/sampling_logp_difference/max": 1.5778687000274658, "sampling/sampling_logp_difference/mean": 0.18582503497600555, "step": 247 }, { "clip_ratio/high_max": 0.08469811640679836, "clip_ratio/high_mean": 0.08469811640679836, "clip_ratio/low_mean": 0.051101832650601864, "clip_ratio/low_min": 0.051101832650601864, "clip_ratio/region_mean": 0.13579994905740023, "completions/clipped_ratio": 0.0, "completions/max_length": 244.0, "completions/max_terminated_length": 244.0, "completions/mean_length": 224.875, "completions/mean_terminated_length": 224.875, "completions/min_length": 187.0, "completions/min_terminated_length": 187.0, "entropy": 1.9894641190767288, "epoch": 0.009576768612913192, "frac_reward_zero_std": 0.0, "grad_norm": 4.550097942352295, "learning_rate": 9.251515151515152e-06, "loss": -0.0386, "num_tokens": 540434.0, "reward": 0.782259464263916, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.828125, "reward_count_adherence_std": 0.09300298243761063, "reward_meter_mean": 0.9458253979682922, "reward_meter_std": 0.07403269410133362, "reward_std": 0.10182006657123566, "reward_total_composite_mean": 0.782259464263916, "reward_total_composite_std": 0.10182006657123566, "reward_total_mean": 0.782259464263916, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.828125, "rewards/count_adherence/std": 0.09300298243761063, "rewards/meter/mean": 0.9458253979682922, "rewards/meter/std": 0.07403269410133362, "rewards/total_composite/mean": 0.782259464263916, "rewards/total_composite/std": 0.10182006657123566, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0300755500793457, "sampling/importance_sampling_ratio/min": 0.23511166870594025, "sampling/sampling_logp_difference/max": 1.4476947784423828, "sampling/sampling_logp_difference/mean": 0.15468242764472961, "step": 248 }, { "clip_ratio/high_max": 0.05096696317195892, "clip_ratio/high_mean": 0.05096696317195892, "clip_ratio/low_mean": 0.08824052847921848, "clip_ratio/low_min": 0.08824052847921848, "clip_ratio/region_mean": 0.1392074916511774, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 72.625, "completions/mean_terminated_length": 72.625, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 2.432593807578087, "epoch": 0.009615384615384616, "frac_reward_zero_std": 0.0, "grad_norm": 10.006518363952637, "learning_rate": 9.248484848484849e-06, "loss": 0.0622, "num_tokens": 542207.0, "reward": 0.39560720324516296, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.3977659046649933, "reward_meter_std": 0.394779771566391, "reward_std": 0.3970900774002075, "reward_total_composite_mean": 0.39560720324516296, "reward_total_composite_std": 0.3970901072025299, "reward_total_mean": 0.39560720324516296, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.3977659046649933, "rewards/meter/std": 0.394779771566391, "rewards/total_composite/mean": 0.39560720324516296, "rewards/total_composite/std": 0.3970901072025299, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0430378913879395, "sampling/importance_sampling_ratio/min": 0.1660993993282318, "sampling/sampling_logp_difference/max": 1.7951688766479492, "sampling/sampling_logp_difference/mean": 0.20861367881298065, "step": 249 }, { "clip_ratio/high_max": 0.1064140466041863, "clip_ratio/high_mean": 0.1064140466041863, "clip_ratio/low_mean": 0.03012663428671658, "clip_ratio/low_min": 0.03012663428671658, "clip_ratio/region_mean": 0.13654068089090288, "completions/clipped_ratio": 0.0, "completions/max_length": 37.0, "completions/max_terminated_length": 37.0, "completions/mean_length": 34.75, "completions/mean_terminated_length": 34.75, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 1.6636070609092712, "epoch": 0.00965400061785604, "frac_reward_zero_std": 0.0, "grad_norm": 13.965093612670898, "learning_rate": 9.245454545454546e-06, "loss": 0.0013, "num_tokens": 543733.0, "reward": 0.7543537616729736, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7543537616729736, "reward_meter_std": 0.32807299494743347, "reward_std": 0.32807299494743347, "reward_total_composite_mean": 0.7543537616729736, "reward_total_composite_std": 0.32807299494743347, "reward_total_mean": 0.7543537616729736, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7543537616729736, "rewards/meter/std": 0.32807299494743347, "rewards/total_composite/mean": 0.7543537616729736, "rewards/total_composite/std": 0.32807299494743347, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9995890259742737, "sampling/importance_sampling_ratio/min": 0.2496013343334198, "sampling/sampling_logp_difference/max": 1.6727294921875, "sampling/sampling_logp_difference/mean": 0.17254644632339478, "step": 250 }, { "epoch": 0.00965400061785604, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.17307692307692307, "eval_completions/max_length": 494.7692307692308, "eval_completions/max_terminated_length": 335.0, "eval_completions/mean_length": 228.9903846153846, "eval_completions/mean_terminated_length": 168.23443838266226, "eval_completions/min_length": 53.38461538461539, "eval_completions/min_terminated_length": 53.38461538461539, "eval_entropy": 1.889658808708191, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 543733.0, "eval_reward": 0.3687195135996892, "eval_reward_arabic_clean_mean": 0.8942307692307693, "eval_reward_arabic_clean_std": 0.21981406670350295, "eval_reward_count_adherence_mean": 0.7803410750169021, "eval_reward_count_adherence_std": 0.24469699080173785, "eval_reward_meter_mean": 0.47416638411008394, "eval_reward_meter_std": 0.3508666604757309, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.3687195135996892, "eval_reward_total_composite_std": 0.32943402574612546, "eval_reward_total_mean": 0.3687195135996892, "eval_rewards/arabic_clean/mean": 0.8942307692307693, "eval_rewards/arabic_clean/std": 0.21981406670350295, "eval_rewards/count_adherence/mean": 0.7803410750169021, "eval_rewards/count_adherence/std": 0.24469699080173785, "eval_rewards/meter/mean": 0.47416638411008394, "eval_rewards/meter/std": 0.3508666604757309, "eval_rewards/total_composite/mean": 0.3687195135996892, "eval_rewards/total_composite/std": 0.32943402574612546, "eval_runtime": 90.6589, "eval_samples_per_second": 1.147, "eval_sampling/importance_sampling_ratio/max": 1.5637650306408222, "eval_sampling/importance_sampling_ratio/mean": 1.034668812384972, "eval_sampling/importance_sampling_ratio/min": 0.29775738372252536, "eval_sampling/sampling_logp_difference/max": 1.2276372909545898, "eval_sampling/sampling_logp_difference/mean": 0.12459980008693841, "eval_steps_per_second": 0.143, "step": 250 }, { "clip_ratio/high_max": 0.10757232829928398, "clip_ratio/high_mean": 0.10757232829928398, "clip_ratio/low_mean": 0.04646642506122589, "clip_ratio/low_min": 0.04646642506122589, "clip_ratio/region_mean": 0.15403875336050987, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 65.625, "completions/mean_terminated_length": 65.625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 2.0140078961849213, "epoch": 0.009692616620327464, "frac_reward_zero_std": 0.0, "grad_norm": 11.79161262512207, "learning_rate": 9.242424242424244e-06, "loss": 0.0119, "num_tokens": 545690.0, "reward": 0.5393182635307312, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.6017528176307678, "reward_meter_std": 0.44121459126472473, "reward_std": 0.41130462288856506, "reward_total_composite_mean": 0.5393182635307312, "reward_total_composite_std": 0.41130462288856506, "reward_total_mean": 0.5393182635307312, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.6017528176307678, "rewards/meter/std": 0.44121459126472473, "rewards/total_composite/mean": 0.5393182635307312, "rewards/total_composite/std": 0.41130462288856506, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.021461844444275, "sampling/importance_sampling_ratio/min": 0.21941626071929932, "sampling/sampling_logp_difference/max": 1.51678466796875, "sampling/sampling_logp_difference/mean": 0.1789507418870926, "step": 251 }, { "clip_ratio/high_max": 0.08756711520254612, "clip_ratio/high_mean": 0.08756711520254612, "clip_ratio/low_mean": 0.05587371252477169, "clip_ratio/low_min": 0.05587371252477169, "clip_ratio/region_mean": 0.1434408277273178, "completions/clipped_ratio": 0.0, "completions/max_length": 143.0, "completions/max_terminated_length": 143.0, "completions/mean_length": 109.5, "completions/mean_terminated_length": 109.5, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "entropy": 2.3438350409269333, "epoch": 0.009731232622798888, "frac_reward_zero_std": 0.0, "grad_norm": 6.874846935272217, "learning_rate": 9.23939393939394e-06, "loss": 0.0093, "num_tokens": 547982.0, "reward": 0.6217153668403625, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.7877767086029053, "reward_meter_std": 0.299540638923645, "reward_std": 0.2621327042579651, "reward_total_composite_mean": 0.6217153668403625, "reward_total_composite_std": 0.2621327042579651, "reward_total_mean": 0.6217153668403625, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.7877767086029053, "rewards/meter/std": 0.299540638923645, "rewards/total_composite/mean": 0.6217153668403625, "rewards/total_composite/std": 0.2621327042579651, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0337904691696167, "sampling/importance_sampling_ratio/min": 0.2464926689863205, "sampling/sampling_logp_difference/max": 1.4004230499267578, "sampling/sampling_logp_difference/mean": 0.1741628497838974, "step": 252 }, { "clip_ratio/high_max": 0.07423552963882685, "clip_ratio/high_mean": 0.07423552963882685, "clip_ratio/low_mean": 0.0667356732301414, "clip_ratio/low_min": 0.0667356732301414, "clip_ratio/region_mean": 0.14097120286896825, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 34.375, "completions/mean_terminated_length": 34.375, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 2.204130381345749, "epoch": 0.009769848625270312, "frac_reward_zero_std": 0.0, "grad_norm": 14.97449016571045, "learning_rate": 9.236363636363636e-06, "loss": 0.0319, "num_tokens": 549313.0, "reward": 0.98116135597229, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.98116135597229, "reward_meter_std": 0.015678538009524345, "reward_std": 0.01567855291068554, "reward_total_composite_mean": 0.98116135597229, "reward_total_composite_std": 0.015678538009524345, "reward_total_mean": 0.98116135597229, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.98116135597229, "rewards/meter/std": 0.015678538009524345, "rewards/total_composite/mean": 0.98116135597229, "rewards/total_composite/std": 0.015678538009524345, "sampling/importance_sampling_ratio/max": 1.7639540433883667, "sampling/importance_sampling_ratio/mean": 1.0338517427444458, "sampling/importance_sampling_ratio/min": 0.2695971727371216, "sampling/sampling_logp_difference/max": 1.310826301574707, "sampling/sampling_logp_difference/mean": 0.17273853719234467, "step": 253 }, { "clip_ratio/high_max": 0.09618495963513851, "clip_ratio/high_mean": 0.09618495963513851, "clip_ratio/low_mean": 0.036308735609054565, "clip_ratio/low_min": 0.036308735609054565, "clip_ratio/region_mean": 0.13249369524419308, "completions/clipped_ratio": 0.0, "completions/max_length": 93.0, "completions/max_terminated_length": 93.0, "completions/mean_length": 77.875, "completions/mean_terminated_length": 77.875, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 1.8999166786670685, "epoch": 0.009808464627741736, "frac_reward_zero_std": 0.0, "grad_norm": 8.44826602935791, "learning_rate": 9.233333333333334e-06, "loss": 0.0434, "num_tokens": 551128.0, "reward": 0.8029962182044983, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8029962182044983, "reward_meter_std": 0.34782952070236206, "reward_std": 0.34782955050468445, "reward_total_composite_mean": 0.8029962182044983, "reward_total_composite_std": 0.34782952070236206, "reward_total_mean": 0.8029962182044983, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8029962182044983, "rewards/meter/std": 0.34782952070236206, "rewards/total_composite/mean": 0.8029962182044983, "rewards/total_composite/std": 0.34782952070236206, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0570210218429565, "sampling/importance_sampling_ratio/min": 0.41547152400016785, "sampling/sampling_logp_difference/max": 0.89579176902771, "sampling/sampling_logp_difference/mean": 0.15848758816719055, "step": 254 }, { "clip_ratio/high_max": 0.0770185561850667, "clip_ratio/high_mean": 0.0770185561850667, "clip_ratio/low_mean": 0.03721843124367297, "clip_ratio/low_min": 0.03721843124367297, "clip_ratio/region_mean": 0.11423698742873967, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 46.0, "completions/mean_length": 98.25, "completions/mean_terminated_length": 39.142860412597656, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 2.0371719151735306, "epoch": 0.00984708063021316, "frac_reward_zero_std": 0.0, "grad_norm": 9.855134963989258, "learning_rate": 9.23030303030303e-06, "loss": 0.0437, "num_tokens": 552746.0, "reward": 0.8700155019760132, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8700155019760132, "reward_meter_std": 0.2133215367794037, "reward_std": 0.2133215218782425, "reward_total_composite_mean": 0.8700155019760132, "reward_total_composite_std": 0.2133215367794037, "reward_total_mean": 0.8700155019760132, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8700155019760132, "rewards/meter/std": 0.2133215367794037, "rewards/total_composite/mean": 0.8700155019760132, "rewards/total_composite/std": 0.2133215367794037, "sampling/importance_sampling_ratio/max": 1.803825855255127, "sampling/importance_sampling_ratio/mean": 1.0299566984176636, "sampling/importance_sampling_ratio/min": 0.29903537034988403, "sampling/sampling_logp_difference/max": 1.207193374633789, "sampling/sampling_logp_difference/mean": 0.17322853207588196, "step": 255 }, { "clip_ratio/high_max": 0.042327309027314186, "clip_ratio/high_mean": 0.042327309027314186, "clip_ratio/low_mean": 0.06572701199911535, "clip_ratio/low_min": 0.06572701199911535, "clip_ratio/region_mean": 0.10805432102642953, "completions/clipped_ratio": 0.0, "completions/max_length": 365.0, "completions/max_terminated_length": 365.0, "completions/mean_length": 162.0, "completions/mean_terminated_length": 162.0, "completions/min_length": 106.0, "completions/min_terminated_length": 106.0, "entropy": 1.8008338958024979, "epoch": 0.009885696632684585, "frac_reward_zero_std": 0.0, "grad_norm": 4.932265758514404, "learning_rate": 9.227272727272728e-06, "loss": 0.169, "num_tokens": 555578.0, "reward": 0.6166548728942871, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_meter_mean": 0.7288707494735718, "reward_meter_std": 0.32933905720710754, "reward_std": 0.34062808752059937, "reward_total_composite_mean": 0.6166548728942871, "reward_total_composite_std": 0.34062808752059937, "reward_total_mean": 0.6166548728942871, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/meter/mean": 0.7288707494735718, "rewards/meter/std": 0.32933905720710754, "rewards/total_composite/mean": 0.6166548728942871, "rewards/total_composite/std": 0.34062808752059937, "sampling/importance_sampling_ratio/max": 1.7278470993041992, "sampling/importance_sampling_ratio/mean": 1.0188031196594238, "sampling/importance_sampling_ratio/min": 0.2302752137184143, "sampling/sampling_logp_difference/max": 1.468480110168457, "sampling/sampling_logp_difference/mean": 0.1348879486322403, "step": 256 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.009924312635156009, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 9.224242424242424e-06, "loss": 0.0, "num_tokens": 557386.0, "reward": 0.10419389605522156, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.18269231915473938, "reward_count_adherence_std": 0.05723259970545769, "reward_meter_mean": 0.6820703744888306, "reward_meter_std": 0.41173163056373596, "reward_std": 0.10859484225511551, "reward_total_composite_mean": 0.10419389605522156, "reward_total_composite_std": 0.1085948497056961, "reward_total_mean": 0.10419389605522156, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.18269231915473938, "rewards/count_adherence/std": 0.05723259970545769, "rewards/meter/mean": 0.6820703744888306, "rewards/meter/std": 0.41173163056373596, "rewards/total_composite/mean": 0.10419389605522156, "rewards/total_composite/std": 0.1085948497056961, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 257 }, { "clip_ratio/high_max": 0.09665837325155735, "clip_ratio/high_mean": 0.09665837325155735, "clip_ratio/low_mean": 0.03242044895887375, "clip_ratio/low_min": 0.03242044895887375, "clip_ratio/region_mean": 0.1290788222104311, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 135.0, "completions/mean_length": 133.125, "completions/mean_terminated_length": 79.0, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 2.3317447006702423, "epoch": 0.009962928637627433, "frac_reward_zero_std": 0.0, "grad_norm": 4.445526123046875, "learning_rate": 9.221212121212123e-06, "loss": -0.0052, "num_tokens": 559259.0, "reward": 0.5477786660194397, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_meter_mean": 0.5733773708343506, "reward_meter_std": 0.37895193696022034, "reward_std": 0.4160669445991516, "reward_total_composite_mean": 0.5477786660194397, "reward_total_composite_std": 0.4160669445991516, "reward_total_mean": 0.5477786660194397, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/meter/mean": 0.5733773708343506, "rewards/meter/std": 0.37895193696022034, "rewards/total_composite/mean": 0.5477786660194397, "rewards/total_composite/std": 0.4160669445991516, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0478163957595825, "sampling/importance_sampling_ratio/min": 0.19116009771823883, "sampling/sampling_logp_difference/max": 1.6546440124511719, "sampling/sampling_logp_difference/mean": 0.197053000330925, "step": 258 }, { "clip_ratio/high_max": 0.12396811135113239, "clip_ratio/high_mean": 0.12396811135113239, "clip_ratio/low_mean": 0.031775956973433495, "clip_ratio/low_min": 0.031775956973433495, "clip_ratio/region_mean": 0.1557440683245659, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 64.5, "completions/mean_terminated_length": 64.5, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 2.7183807939291, "epoch": 0.010001544640098857, "frac_reward_zero_std": 0.0, "grad_norm": 11.931998252868652, "learning_rate": 9.21818181818182e-06, "loss": 0.0631, "num_tokens": 561151.0, "reward": 0.7427696585655212, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7427696585655212, "reward_meter_std": 0.428190141916275, "reward_std": 0.4281901717185974, "reward_total_composite_mean": 0.7427696585655212, "reward_total_composite_std": 0.428190141916275, "reward_total_mean": 0.7427696585655212, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7427696585655212, "rewards/meter/std": 0.428190141916275, "rewards/total_composite/mean": 0.7427696585655212, "rewards/total_composite/std": 0.428190141916275, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0478657484054565, "sampling/importance_sampling_ratio/min": 0.248060405254364, "sampling/sampling_logp_difference/max": 1.394083023071289, "sampling/sampling_logp_difference/mean": 0.19922052323818207, "step": 259 }, { "clip_ratio/high_max": 0.09239057265222073, "clip_ratio/high_mean": 0.09239057265222073, "clip_ratio/low_mean": 0.04702932108193636, "clip_ratio/low_min": 0.04702932108193636, "clip_ratio/region_mean": 0.13941989373415709, "completions/clipped_ratio": 0.0, "completions/max_length": 100.0, "completions/max_terminated_length": 100.0, "completions/mean_length": 78.0, "completions/mean_terminated_length": 78.0, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 2.69622403383255, "epoch": 0.010040160642570281, "frac_reward_zero_std": 0.0, "grad_norm": 8.251180648803711, "learning_rate": 9.215151515151515e-06, "loss": 0.0645, "num_tokens": 563063.0, "reward": 0.7421708106994629, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9256542325019836, "reward_meter_std": 0.16513100266456604, "reward_std": 0.3694427013397217, "reward_total_composite_mean": 0.7421708106994629, "reward_total_composite_std": 0.3694427013397217, "reward_total_mean": 0.7421708106994629, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9256542325019836, "rewards/meter/std": 0.16513100266456604, "rewards/total_composite/mean": 0.7421708106994629, "rewards/total_composite/std": 0.3694427013397217, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0489428043365479, "sampling/importance_sampling_ratio/min": 0.15505114197731018, "sampling/sampling_logp_difference/max": 1.8640003204345703, "sampling/sampling_logp_difference/mean": 0.18370838463306427, "step": 260 }, { "clip_ratio/high_max": 0.18774798419326544, "clip_ratio/high_mean": 0.18774798419326544, "clip_ratio/low_mean": 0.023148147389292717, "clip_ratio/low_min": 0.023148147389292717, "clip_ratio/region_mean": 0.21089613158255816, "completions/clipped_ratio": 0.0, "completions/max_length": 40.0, "completions/max_terminated_length": 40.0, "completions/mean_length": 34.25, "completions/mean_terminated_length": 34.25, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 2.57423797249794, "epoch": 0.010078776645041705, "frac_reward_zero_std": 0.0, "grad_norm": 23.678274154663086, "learning_rate": 9.212121212121213e-06, "loss": -0.0436, "num_tokens": 564601.0, "reward": 0.9117841720581055, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9117841720581055, "reward_meter_std": 0.18696558475494385, "reward_std": 0.18696556985378265, "reward_total_composite_mean": 0.9117841720581055, "reward_total_composite_std": 0.18696558475494385, "reward_total_mean": 0.9117841720581055, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9117841720581055, "rewards/meter/std": 0.18696558475494385, "rewards/total_composite/mean": 0.9117841720581055, "rewards/total_composite/std": 0.18696558475494385, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0213043689727783, "sampling/importance_sampling_ratio/min": 0.2197856903076172, "sampling/sampling_logp_difference/max": 1.5957603454589844, "sampling/sampling_logp_difference/mean": 0.20806393027305603, "step": 261 }, { "clip_ratio/high_max": 0.09604987595230341, "clip_ratio/high_mean": 0.09604987595230341, "clip_ratio/low_mean": 0.04403977282345295, "clip_ratio/low_min": 0.04403977282345295, "clip_ratio/region_mean": 0.14008964877575636, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 67.875, "completions/mean_terminated_length": 67.875, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 2.2145213186740875, "epoch": 0.01011739264751313, "frac_reward_zero_std": 0.0, "grad_norm": 8.469246864318848, "learning_rate": 9.20909090909091e-06, "loss": 0.027, "num_tokens": 566352.0, "reward": 0.746609091758728, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7471080422401428, "reward_meter_std": 0.37732023000717163, "reward_std": 0.37844428420066833, "reward_total_composite_mean": 0.746609091758728, "reward_total_composite_std": 0.3784443438053131, "reward_total_mean": 0.746609091758728, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7471080422401428, "rewards/meter/std": 0.37732023000717163, "rewards/total_composite/mean": 0.746609091758728, "rewards/total_composite/std": 0.3784443438053131, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0465917587280273, "sampling/importance_sampling_ratio/min": 0.2786925435066223, "sampling/sampling_logp_difference/max": 1.2776460647583008, "sampling/sampling_logp_difference/mean": 0.180844247341156, "step": 262 }, { "clip_ratio/high_max": 0.022365196608006954, "clip_ratio/high_mean": 0.022365196608006954, "clip_ratio/low_mean": 0.007675438653677702, "clip_ratio/low_min": 0.007675438653677702, "clip_ratio/region_mean": 0.030040635261684656, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 364.75, "completions/mean_terminated_length": 119.33333587646484, "completions/min_length": 108.0, "completions/min_terminated_length": 108.0, "entropy": 0.768448993563652, "epoch": 0.010156008649984553, "frac_reward_zero_std": 0.0, "grad_norm": 1.5207958221435547, "learning_rate": 9.206060606060607e-06, "loss": -0.0374, "num_tokens": 568030.0, "reward": 0.4171389043331146, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.18898223340511322, "reward_meter_mean": 0.548949122428894, "reward_meter_std": 0.3854943811893463, "reward_std": 0.4122898578643799, "reward_total_composite_mean": 0.4171389043331146, "reward_total_composite_std": 0.4122898578643799, "reward_total_mean": 0.4171389043331146, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.18898223340511322, "rewards/meter/mean": 0.548949122428894, "rewards/meter/std": 0.3854943811893463, "rewards/total_composite/mean": 0.4171389043331146, "rewards/total_composite/std": 0.4122898578643799, "sampling/importance_sampling_ratio/max": 1.990702748298645, "sampling/importance_sampling_ratio/mean": 1.0653656721115112, "sampling/importance_sampling_ratio/min": 0.43710729479789734, "sampling/sampling_logp_difference/max": 0.8275766372680664, "sampling/sampling_logp_difference/mean": 0.14995871484279633, "step": 263 }, { "clip_ratio/high_max": 0.052887228317558765, "clip_ratio/high_mean": 0.052887228317558765, "clip_ratio/low_mean": 0.04904576577246189, "clip_ratio/low_min": 0.04904576577246189, "clip_ratio/region_mean": 0.10193299409002066, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 172.0, "completions/mean_length": 190.0, "completions/mean_terminated_length": 144.0, "completions/min_length": 101.0, "completions/min_terminated_length": 101.0, "entropy": 1.793292224407196, "epoch": 0.010194624652455977, "frac_reward_zero_std": 0.0, "grad_norm": 3.842879056930542, "learning_rate": 9.203030303030304e-06, "loss": 0.0244, "num_tokens": 570502.0, "reward": 0.2761991024017334, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.18898223340511322, "reward_meter_mean": 0.3928939700126648, "reward_meter_std": 0.41266870498657227, "reward_std": 0.37751540541648865, "reward_total_composite_mean": 0.2761991024017334, "reward_total_composite_std": 0.37751540541648865, "reward_total_mean": 0.2761991024017334, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.18898223340511322, "rewards/meter/mean": 0.3928939700126648, "rewards/meter/std": 0.41266870498657227, "rewards/total_composite/mean": 0.2761991024017334, "rewards/total_composite/std": 0.37751540541648865, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.032580018043518, "sampling/importance_sampling_ratio/min": 0.2537790536880493, "sampling/sampling_logp_difference/max": 1.371291160583496, "sampling/sampling_logp_difference/mean": 0.15981298685073853, "step": 264 }, { "clip_ratio/high_max": 0.05313897877931595, "clip_ratio/high_mean": 0.05313897877931595, "clip_ratio/low_mean": 0.047125319950282574, "clip_ratio/low_min": 0.047125319950282574, "clip_ratio/region_mean": 0.10026429872959852, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 184.25, "completions/mean_terminated_length": 75.0, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 1.5678513646125793, "epoch": 0.010233240654927402, "frac_reward_zero_std": 0.0, "grad_norm": 3.180842876434326, "learning_rate": 9.200000000000002e-06, "loss": -0.0242, "num_tokens": 572168.0, "reward": 0.3810850977897644, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_meter_mean": 0.3811070919036865, "reward_meter_std": 0.4830027222633362, "reward_std": 0.483022540807724, "reward_total_composite_mean": 0.3810850977897644, "reward_total_composite_std": 0.483022540807724, "reward_total_mean": 0.3810850977897644, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/meter/mean": 0.3811070919036865, "rewards/meter/std": 0.4830027222633362, "rewards/total_composite/mean": 0.3810850977897644, "rewards/total_composite/std": 0.483022540807724, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0414031744003296, "sampling/importance_sampling_ratio/min": 0.30413204431533813, "sampling/sampling_logp_difference/max": 1.190293312072754, "sampling/sampling_logp_difference/mean": 0.17107190191745758, "step": 265 }, { "clip_ratio/high_max": 0.021464127115905285, "clip_ratio/high_mean": 0.021464127115905285, "clip_ratio/low_mean": 0.01574307307600975, "clip_ratio/low_min": 0.01574307307600975, "clip_ratio/region_mean": 0.037207200191915035, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 397.0, "completions/mean_length": 452.5, "completions/mean_terminated_length": 353.3333435058594, "completions/min_length": 309.0, "completions/min_terminated_length": 309.0, "entropy": 0.6620796918869019, "epoch": 0.010271856657398826, "frac_reward_zero_std": 0.0, "grad_norm": 2.051448345184326, "learning_rate": 9.196969696969697e-06, "loss": -0.2009, "num_tokens": 574908.0, "reward": 0.14004071056842804, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.1836577206850052, "reward_meter_mean": 0.2717985510826111, "reward_meter_std": 0.30201706290245056, "reward_std": 0.2556873857975006, "reward_total_composite_mean": 0.14004071056842804, "reward_total_composite_std": 0.255687415599823, "reward_total_mean": 0.14004071056842804, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.1836577206850052, "rewards/meter/mean": 0.2717985510826111, "rewards/meter/std": 0.30201706290245056, "rewards/total_composite/mean": 0.14004071056842804, "rewards/total_composite/std": 0.255687415599823, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0511150360107422, "sampling/importance_sampling_ratio/min": 0.3106938600540161, "sampling/sampling_logp_difference/max": 1.1689472198486328, "sampling/sampling_logp_difference/mean": 0.15083111822605133, "step": 266 }, { "clip_ratio/high_max": 0.12783648911863565, "clip_ratio/high_mean": 0.12783648911863565, "clip_ratio/low_mean": 0.04466869868338108, "clip_ratio/low_min": 0.04466869868338108, "clip_ratio/region_mean": 0.17250518780201674, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 70.5, "completions/mean_terminated_length": 70.5, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 2.6592743396759033, "epoch": 0.01031047265987025, "frac_reward_zero_std": 0.0, "grad_norm": 10.749847412109375, "learning_rate": 9.193939393939395e-06, "loss": 0.1645, "num_tokens": 576616.0, "reward": 0.7857815027236938, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7857816219329834, "reward_meter_std": 0.35958775877952576, "reward_std": 0.35958805680274963, "reward_total_composite_mean": 0.7857815027236938, "reward_total_composite_std": 0.359588086605072, "reward_total_mean": 0.7857815027236938, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7857816219329834, "rewards/meter/std": 0.35958775877952576, "rewards/total_composite/mean": 0.7857815027236938, "rewards/total_composite/std": 0.359588086605072, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.053087830543518, "sampling/importance_sampling_ratio/min": 0.2771447002887726, "sampling/sampling_logp_difference/max": 1.2832155227661133, "sampling/sampling_logp_difference/mean": 0.19864748418331146, "step": 267 }, { "clip_ratio/high_max": 0.1120001059025526, "clip_ratio/high_mean": 0.1120001059025526, "clip_ratio/low_mean": 0.06932727806270123, "clip_ratio/low_min": 0.06932727806270123, "clip_ratio/region_mean": 0.18132738396525383, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 51.375, "completions/mean_terminated_length": 51.375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 1.0063387379050255, "epoch": 0.010349088662341674, "frac_reward_zero_std": 0.0, "grad_norm": 18.469411849975586, "learning_rate": 9.190909090909092e-06, "loss": 0.0142, "num_tokens": 578371.0, "reward": 0.6911875009536743, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6911875009536743, "reward_meter_std": 0.36712267994880676, "reward_std": 0.3671226501464844, "reward_total_composite_mean": 0.6911875009536743, "reward_total_composite_std": 0.36712267994880676, "reward_total_mean": 0.6911875009536743, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6911875009536743, "rewards/meter/std": 0.36712267994880676, "rewards/total_composite/mean": 0.6911875009536743, "rewards/total_composite/std": 0.36712267994880676, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.980422854423523, "sampling/importance_sampling_ratio/min": 0.04933354631066322, "sampling/sampling_logp_difference/max": 3.009150981903076, "sampling/sampling_logp_difference/mean": 0.23253513872623444, "step": 268 }, { "clip_ratio/high_max": 0.09056044183671474, "clip_ratio/high_mean": 0.09056044183671474, "clip_ratio/low_mean": 0.049313412979245186, "clip_ratio/low_min": 0.049313412979245186, "clip_ratio/region_mean": 0.13987385481595993, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 92.75, "completions/mean_terminated_length": 92.75, "completions/min_length": 83.0, "completions/min_terminated_length": 83.0, "entropy": 2.058430328965187, "epoch": 0.010387704664813098, "frac_reward_zero_std": 0.0, "grad_norm": 7.486761569976807, "learning_rate": 9.187878787878789e-06, "loss": 0.0128, "num_tokens": 580441.0, "reward": 0.7411905527114868, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8626927137374878, "reward_meter_std": 0.2941436171531677, "reward_std": 0.41744592785835266, "reward_total_composite_mean": 0.7411905527114868, "reward_total_composite_std": 0.41744595766067505, "reward_total_mean": 0.7411905527114868, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8626927137374878, "rewards/meter/std": 0.2941436171531677, "rewards/total_composite/mean": 0.7411905527114868, "rewards/total_composite/std": 0.41744595766067505, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0476194620132446, "sampling/importance_sampling_ratio/min": 0.17622657120227814, "sampling/sampling_logp_difference/max": 1.7359848022460938, "sampling/sampling_logp_difference/mean": 0.1645209938287735, "step": 269 }, { "clip_ratio/high_max": 0.019736841320991516, "clip_ratio/high_mean": 0.019736841320991516, "clip_ratio/low_mean": 0.013358778320252895, "clip_ratio/low_min": 0.013358778320252895, "clip_ratio/region_mean": 0.03309561964124441, "completions/clipped_ratio": 0.75, "completions/max_length": 512.0, "completions/max_terminated_length": 262.0, "completions/mean_length": 445.25, "completions/mean_terminated_length": 245.0, "completions/min_length": 228.0, "completions/min_terminated_length": 228.0, "entropy": 0.48567473888397217, "epoch": 0.010426320667284522, "frac_reward_zero_std": 0.0, "grad_norm": 1.4978303909301758, "learning_rate": 9.184848484848485e-06, "loss": -0.0971, "num_tokens": 582411.0, "reward": 0.030055876821279526, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.1157275140285492, "reward_meter_mean": 0.07851605117321014, "reward_meter_std": 0.06109999120235443, "reward_std": 0.040369123220443726, "reward_total_composite_mean": 0.030055876821279526, "reward_total_composite_std": 0.040369123220443726, "reward_total_mean": 0.030055876821279526, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.1157275140285492, "rewards/meter/mean": 0.07851605117321014, "rewards/meter/std": 0.06109999120235443, "rewards/total_composite/mean": 0.030055876821279526, "rewards/total_composite/std": 0.040369123220443726, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0170917510986328, "sampling/importance_sampling_ratio/min": 0.22663357853889465, "sampling/sampling_logp_difference/max": 1.4844207763671875, "sampling/sampling_logp_difference/mean": 0.1704261153936386, "step": 270 }, { "clip_ratio/high_max": 0.09404239989817142, "clip_ratio/high_mean": 0.09404239989817142, "clip_ratio/low_mean": 0.07794231548905373, "clip_ratio/low_min": 0.07794231548905373, "clip_ratio/region_mean": 0.17198471538722515, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 59.0, "completions/mean_terminated_length": 59.0, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 1.7888787239789963, "epoch": 0.010464936669755946, "frac_reward_zero_std": 0.0, "grad_norm": 10.39463996887207, "learning_rate": 9.181818181818184e-06, "loss": 0.0604, "num_tokens": 584259.0, "reward": 0.6009393930435181, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6009393930435181, "reward_meter_std": 0.41454699635505676, "reward_std": 0.41454702615737915, "reward_total_composite_mean": 0.6009393930435181, "reward_total_composite_std": 0.41454699635505676, "reward_total_mean": 0.6009393930435181, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6009393930435181, "rewards/meter/std": 0.41454699635505676, "rewards/total_composite/mean": 0.6009393930435181, "rewards/total_composite/std": 0.41454699635505676, "sampling/importance_sampling_ratio/max": 1.8810900449752808, "sampling/importance_sampling_ratio/mean": 1.017964482307434, "sampling/importance_sampling_ratio/min": 0.3745101988315582, "sampling/sampling_logp_difference/max": 0.9821362495422363, "sampling/sampling_logp_difference/mean": 0.16193664073944092, "step": 271 }, { "clip_ratio/high_max": 0.07653909968212247, "clip_ratio/high_mean": 0.07653909968212247, "clip_ratio/low_mean": 0.059118627570569515, "clip_ratio/low_min": 0.059118627570569515, "clip_ratio/region_mean": 0.13565772725269198, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 37.625, "completions/mean_terminated_length": 37.625, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 2.1982433944940567, "epoch": 0.01050355267222737, "frac_reward_zero_std": 0.0, "grad_norm": 16.354007720947266, "learning_rate": 9.178787878787879e-06, "loss": 0.239, "num_tokens": 585848.0, "reward": 0.5806645154953003, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.6360828876495361, "reward_meter_std": 0.43516474962234497, "reward_std": 0.4882129728794098, "reward_total_composite_mean": 0.5806645154953003, "reward_total_composite_std": 0.4882129728794098, "reward_total_mean": 0.5806645154953003, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.6360828876495361, "rewards/meter/std": 0.43516474962234497, "rewards/total_composite/mean": 0.5806645154953003, "rewards/total_composite/std": 0.4882129728794098, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0565941333770752, "sampling/importance_sampling_ratio/min": 0.19141019880771637, "sampling/sampling_logp_difference/max": 1.653336524963379, "sampling/sampling_logp_difference/mean": 0.1913789063692093, "step": 272 }, { "clip_ratio/high_max": 0.006777108646929264, "clip_ratio/high_mean": 0.006777108646929264, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006777108646929264, "completions/clipped_ratio": 0.875, "completions/max_length": 512.0, "completions/max_terminated_length": 498.0, "completions/mean_length": 510.25, "completions/mean_terminated_length": 498.0, "completions/min_length": 498.0, "completions/min_terminated_length": 498.0, "entropy": 0.12209701538085938, "epoch": 0.010542168674698794, "frac_reward_zero_std": 0.0, "grad_norm": 1.6592974662780762, "learning_rate": 9.175757575757576e-06, "loss": -0.2266, "num_tokens": 588010.0, "reward": 0.11888930201530457, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_count_adherence_mean": 0.4821428656578064, "reward_count_adherence_std": 0.23458294570446014, "reward_meter_mean": 0.31048354506492615, "reward_meter_std": 0.3288111686706543, "reward_std": 0.20482073724269867, "reward_total_composite_mean": 0.11888930201530457, "reward_total_composite_std": 0.20482075214385986, "reward_total_mean": 0.11888930201530457, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/count_adherence/mean": 0.4821428656578064, "rewards/count_adherence/std": 0.23458294570446014, "rewards/meter/mean": 0.31048354506492615, "rewards/meter/std": 0.3288111686706543, "rewards/total_composite/mean": 0.11888930201530457, "rewards/total_composite/std": 0.20482075214385986, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0267904996871948, "sampling/importance_sampling_ratio/min": 0.3580196797847748, "sampling/sampling_logp_difference/max": 1.0271673202514648, "sampling/sampling_logp_difference/mean": 0.08662550151348114, "step": 273 }, { "clip_ratio/high_max": 0.06644443050026894, "clip_ratio/high_mean": 0.06644443050026894, "clip_ratio/low_mean": 0.024902896489948034, "clip_ratio/low_min": 0.024902896489948034, "clip_ratio/region_mean": 0.09134732699021697, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 213.0, "completions/mean_length": 229.75, "completions/mean_terminated_length": 189.42857360839844, "completions/min_length": 160.0, "completions/min_terminated_length": 160.0, "entropy": 1.431438848376274, "epoch": 0.010580784677170219, "frac_reward_zero_std": 0.0, "grad_norm": 3.6858744621276855, "learning_rate": 9.172727272727274e-06, "loss": -0.1042, "num_tokens": 590872.0, "reward": 0.39238011837005615, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8035714626312256, "reward_count_adherence_std": 0.15152288973331451, "reward_meter_mean": 0.46854132413864136, "reward_meter_std": 0.38436928391456604, "reward_std": 0.34078967571258545, "reward_total_composite_mean": 0.39238011837005615, "reward_total_composite_std": 0.34078967571258545, "reward_total_mean": 0.39238011837005615, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8035714626312256, "rewards/count_adherence/std": 0.15152288973331451, "rewards/meter/mean": 0.46854132413864136, "rewards/meter/std": 0.38436928391456604, "rewards/total_composite/mean": 0.39238011837005615, "rewards/total_composite/std": 0.34078967571258545, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0281857252120972, "sampling/importance_sampling_ratio/min": 0.3060767352581024, "sampling/sampling_logp_difference/max": 1.1839194297790527, "sampling/sampling_logp_difference/mean": 0.14069926738739014, "step": 274 }, { "clip_ratio/high_max": 0.0879957852885127, "clip_ratio/high_mean": 0.0879957852885127, "clip_ratio/low_mean": 0.017326733097434044, "clip_ratio/low_min": 0.017326733097434044, "clip_ratio/region_mean": 0.10532251838594675, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 198.625, "completions/mean_terminated_length": 94.16667175292969, "completions/min_length": 81.0, "completions/min_terminated_length": 81.0, "entropy": 1.5135751068592072, "epoch": 0.010619400679641643, "frac_reward_zero_std": 0.0, "grad_norm": 3.059723138809204, "learning_rate": 9.169696969696971e-06, "loss": -0.1344, "num_tokens": 592749.0, "reward": 0.5918634533882141, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.6977724432945251, "reward_meter_std": 0.38409724831581116, "reward_std": 0.4484126567840576, "reward_total_composite_mean": 0.5918634533882141, "reward_total_composite_std": 0.44841268658638, "reward_total_mean": 0.5918634533882141, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.6977724432945251, "rewards/meter/std": 0.38409724831581116, "rewards/total_composite/mean": 0.5918634533882141, "rewards/total_composite/std": 0.44841268658638, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.050614833831787, "sampling/importance_sampling_ratio/min": 0.2916625738143921, "sampling/sampling_logp_difference/max": 1.2321577072143555, "sampling/sampling_logp_difference/mean": 0.17513571679592133, "step": 275 }, { "clip_ratio/high_max": 0.06428467482328415, "clip_ratio/high_mean": 0.06428467482328415, "clip_ratio/low_mean": 0.05223934445530176, "clip_ratio/low_min": 0.05223934445530176, "clip_ratio/region_mean": 0.11652401927858591, "completions/clipped_ratio": 0.0, "completions/max_length": 148.0, "completions/max_terminated_length": 148.0, "completions/mean_length": 116.125, "completions/mean_terminated_length": 116.125, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "entropy": 2.8212269842624664, "epoch": 0.010658016682113068, "frac_reward_zero_std": 0.0, "grad_norm": 6.9882683753967285, "learning_rate": 9.166666666666666e-06, "loss": 0.062, "num_tokens": 594942.0, "reward": 0.47085532546043396, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.8023958206176758, "reward_meter_std": 0.32191282510757446, "reward_std": 0.46588125824928284, "reward_total_composite_mean": 0.47085532546043396, "reward_total_composite_std": 0.4658812880516052, "reward_total_mean": 0.47085532546043396, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.8023958206176758, "rewards/meter/std": 0.32191282510757446, "rewards/total_composite/mean": 0.47085532546043396, "rewards/total_composite/std": 0.4658812880516052, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0579421520233154, "sampling/importance_sampling_ratio/min": 0.21824216842651367, "sampling/sampling_logp_difference/max": 1.5221500396728516, "sampling/sampling_logp_difference/mean": 0.18583007156848907, "step": 276 }, { "clip_ratio/high_max": 0.12392107397317886, "clip_ratio/high_mean": 0.12392107397317886, "clip_ratio/low_mean": 0.04722222313284874, "clip_ratio/low_min": 0.04722222313284874, "clip_ratio/region_mean": 0.1711432971060276, "completions/clipped_ratio": 0.0, "completions/max_length": 58.0, "completions/max_terminated_length": 58.0, "completions/mean_length": 46.375, "completions/mean_terminated_length": 46.375, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 1.2117373794317245, "epoch": 0.010696632684584493, "frac_reward_zero_std": 0.0, "grad_norm": 16.393516540527344, "learning_rate": 9.163636363636365e-06, "loss": 0.0701, "num_tokens": 596617.0, "reward": 0.5784964561462402, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5784964561462402, "reward_meter_std": 0.3392086327075958, "reward_std": 0.3392086327075958, "reward_total_composite_mean": 0.5784964561462402, "reward_total_composite_std": 0.3392086327075958, "reward_total_mean": 0.5784964561462402, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5784964561462402, "rewards/meter/std": 0.3392086327075958, "rewards/total_composite/mean": 0.5784964561462402, "rewards/total_composite/std": 0.3392086327075958, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0258041620254517, "sampling/importance_sampling_ratio/min": 0.12757723033428192, "sampling/sampling_logp_difference/max": 2.0590333938598633, "sampling/sampling_logp_difference/mean": 0.2193935364484787, "step": 277 }, { "clip_ratio/high_max": 0.0827424954622984, "clip_ratio/high_mean": 0.0827424954622984, "clip_ratio/low_mean": 0.03383508883416653, "clip_ratio/low_min": 0.03383508883416653, "clip_ratio/region_mean": 0.11657758429646492, "completions/clipped_ratio": 0.0, "completions/max_length": 120.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 111.625, "completions/mean_terminated_length": 111.625, "completions/min_length": 99.0, "completions/min_terminated_length": 99.0, "entropy": 1.7266891598701477, "epoch": 0.010735248687055917, "frac_reward_zero_std": 0.0, "grad_norm": 7.285430431365967, "learning_rate": 9.160606060606061e-06, "loss": 0.0379, "num_tokens": 598870.0, "reward": 0.8526768684387207, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8526768684387207, "reward_meter_std": 0.27573806047439575, "reward_std": 0.27573806047439575, "reward_total_composite_mean": 0.8526768684387207, "reward_total_composite_std": 0.27573806047439575, "reward_total_mean": 0.8526768684387207, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8526768684387207, "rewards/meter/std": 0.27573806047439575, "rewards/total_composite/mean": 0.8526768684387207, "rewards/total_composite/std": 0.27573806047439575, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0367151498794556, "sampling/importance_sampling_ratio/min": 0.2770197093486786, "sampling/sampling_logp_difference/max": 1.2836666107177734, "sampling/sampling_logp_difference/mean": 0.14818187057971954, "step": 278 }, { "clip_ratio/high_max": 0.05927513726055622, "clip_ratio/high_mean": 0.05927513726055622, "clip_ratio/low_mean": 0.08847619779407978, "clip_ratio/low_min": 0.08847619779407978, "clip_ratio/region_mean": 0.147751335054636, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 59.875, "completions/mean_terminated_length": 59.875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 1.8726500868797302, "epoch": 0.01077386468952734, "frac_reward_zero_std": 0.0, "grad_norm": 11.760062217712402, "learning_rate": 9.157575757575758e-06, "loss": 0.0423, "num_tokens": 600549.0, "reward": 0.45295605063438416, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45295605063438416, "reward_meter_std": 0.416568398475647, "reward_std": 0.416568398475647, "reward_total_composite_mean": 0.45295605063438416, "reward_total_composite_std": 0.416568398475647, "reward_total_mean": 0.45295605063438416, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45295605063438416, "rewards/meter/std": 0.416568398475647, "rewards/total_composite/mean": 0.45295605063438416, "rewards/total_composite/std": 0.416568398475647, "sampling/importance_sampling_ratio/max": 1.9151904582977295, "sampling/importance_sampling_ratio/mean": 1.029968023300171, "sampling/importance_sampling_ratio/min": 0.35172298550605774, "sampling/sampling_logp_difference/max": 1.0449113845825195, "sampling/sampling_logp_difference/mean": 0.16330303251743317, "step": 279 }, { "clip_ratio/high_max": 0.08833360858261585, "clip_ratio/high_mean": 0.08833360858261585, "clip_ratio/low_mean": 0.06699808966368437, "clip_ratio/low_min": 0.06699808966368437, "clip_ratio/region_mean": 0.15533169824630022, "completions/clipped_ratio": 0.0, "completions/max_length": 187.0, "completions/max_terminated_length": 187.0, "completions/mean_length": 154.0, "completions/mean_terminated_length": 154.0, "completions/min_length": 125.0, "completions/min_terminated_length": 125.0, "entropy": 1.5907130688428879, "epoch": 0.010812480691998765, "frac_reward_zero_std": 0.0, "grad_norm": 7.997870922088623, "learning_rate": 9.154545454545455e-06, "loss": 0.0106, "num_tokens": 603365.0, "reward": 0.404763400554657, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8958333134651184, "reward_count_adherence_std": 0.08625820279121399, "reward_meter_mean": 0.4514502286911011, "reward_meter_std": 0.3197373151779175, "reward_std": 0.32716503739356995, "reward_total_composite_mean": 0.404763400554657, "reward_total_composite_std": 0.32716503739356995, "reward_total_mean": 0.404763400554657, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8958333134651184, "rewards/count_adherence/std": 0.08625820279121399, "rewards/meter/mean": 0.4514502286911011, "rewards/meter/std": 0.3197373151779175, "rewards/total_composite/mean": 0.404763400554657, "rewards/total_composite/std": 0.32716503739356995, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0190558433532715, "sampling/importance_sampling_ratio/min": 0.19574791193008423, "sampling/sampling_logp_difference/max": 1.630927562713623, "sampling/sampling_logp_difference/mean": 0.1659134477376938, "step": 280 }, { "clip_ratio/high_max": 0.07967114355415106, "clip_ratio/high_mean": 0.07967114355415106, "clip_ratio/low_mean": 0.02150537632405758, "clip_ratio/low_min": 0.02150537632405758, "clip_ratio/region_mean": 0.10117651987820864, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 205.0, "completions/mean_terminated_length": 102.66667175292969, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 1.8442810326814651, "epoch": 0.010851096694470189, "frac_reward_zero_std": 0.0, "grad_norm": 1.4875062704086304, "learning_rate": 9.151515151515153e-06, "loss": -0.1226, "num_tokens": 605333.0, "reward": 0.8265775442123413, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.8328183889389038, "reward_meter_std": 0.3320009410381317, "reward_std": 0.34886112809181213, "reward_total_composite_mean": 0.8265775442123413, "reward_total_composite_std": 0.3488611578941345, "reward_total_mean": 0.8265775442123413, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.8328183889389038, "rewards/meter/std": 0.3320009410381317, "rewards/total_composite/mean": 0.8265775442123413, "rewards/total_composite/std": 0.3488611578941345, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0586100816726685, "sampling/importance_sampling_ratio/min": 0.16476187109947205, "sampling/sampling_logp_difference/max": 1.8032541275024414, "sampling/sampling_logp_difference/mean": 0.17393165826797485, "step": 281 }, { "clip_ratio/high_max": 0.05353208538144827, "clip_ratio/high_mean": 0.05353208538144827, "clip_ratio/low_mean": 0.023917971178889275, "clip_ratio/low_min": 0.023917971178889275, "clip_ratio/region_mean": 0.07745005656033754, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 193.0, "completions/mean_length": 308.125, "completions/mean_terminated_length": 185.8000030517578, "completions/min_length": 179.0, "completions/min_terminated_length": 179.0, "entropy": 1.0763673335313797, "epoch": 0.010889712696941613, "frac_reward_zero_std": 0.0, "grad_norm": 2.2956902980804443, "learning_rate": 9.148484848484848e-06, "loss": -0.2053, "num_tokens": 607958.0, "reward": 0.27106142044067383, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.15430334210395813, "reward_meter_mean": 0.3302040994167328, "reward_meter_std": 0.34381669759750366, "reward_std": 0.29077771306037903, "reward_total_composite_mean": 0.27106142044067383, "reward_total_composite_std": 0.29077771306037903, "reward_total_mean": 0.27106142044067383, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.15430334210395813, "rewards/meter/mean": 0.3302040994167328, "rewards/meter/std": 0.34381669759750366, "rewards/total_composite/mean": 0.27106142044067383, "rewards/total_composite/std": 0.29077771306037903, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0214406251907349, "sampling/importance_sampling_ratio/min": 0.1493440419435501, "sampling/sampling_logp_difference/max": 1.9015026092529297, "sampling/sampling_logp_difference/mean": 0.1307448148727417, "step": 282 }, { "clip_ratio/high_max": 0.11775326356291771, "clip_ratio/high_mean": 0.11775326356291771, "clip_ratio/low_mean": 0.01697530783712864, "clip_ratio/low_min": 0.01697530783712864, "clip_ratio/region_mean": 0.13472857140004635, "completions/clipped_ratio": 0.0, "completions/max_length": 167.0, "completions/max_terminated_length": 167.0, "completions/mean_length": 140.375, "completions/mean_terminated_length": 140.375, "completions/min_length": 120.0, "completions/min_terminated_length": 120.0, "entropy": 1.7298996597528458, "epoch": 0.010928328699413037, "frac_reward_zero_std": 0.0, "grad_norm": 6.667464256286621, "learning_rate": 9.145454545454546e-06, "loss": 0.0578, "num_tokens": 610721.0, "reward": 0.7411341667175293, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.09258200973272324, "reward_meter_mean": 0.8891458511352539, "reward_meter_std": 0.24647405743598938, "reward_std": 0.1899271160364151, "reward_total_composite_mean": 0.7411341667175293, "reward_total_composite_std": 0.1899271160364151, "reward_total_mean": 0.7411341667175293, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.09258200973272324, "rewards/meter/mean": 0.8891458511352539, "rewards/meter/std": 0.24647405743598938, "rewards/total_composite/mean": 0.7411341667175293, "rewards/total_composite/std": 0.1899271160364151, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0217300653457642, "sampling/importance_sampling_ratio/min": 0.2201007455587387, "sampling/sampling_logp_difference/max": 1.6330780982971191, "sampling/sampling_logp_difference/mean": 0.15236106514930725, "step": 283 }, { "clip_ratio/high_max": 0.09173304960131645, "clip_ratio/high_mean": 0.09173304960131645, "clip_ratio/low_mean": 0.03779107145965099, "clip_ratio/low_min": 0.03779107145965099, "clip_ratio/region_mean": 0.12952412106096745, "completions/clipped_ratio": 0.0, "completions/max_length": 104.0, "completions/max_terminated_length": 104.0, "completions/mean_length": 96.125, "completions/mean_terminated_length": 96.125, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "entropy": 1.9220721423625946, "epoch": 0.010966944701884461, "frac_reward_zero_std": 0.0, "grad_norm": 7.729722499847412, "learning_rate": 9.142424242424243e-06, "loss": 0.0181, "num_tokens": 612706.0, "reward": 0.9732859134674072, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9732859134674072, "reward_meter_std": 0.022573497146368027, "reward_std": 0.02257349155843258, "reward_total_composite_mean": 0.9732859134674072, "reward_total_composite_std": 0.022573497146368027, "reward_total_mean": 0.9732859134674072, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9732859134674072, "rewards/meter/std": 0.022573497146368027, "rewards/total_composite/mean": 0.9732859134674072, "rewards/total_composite/std": 0.022573497146368027, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.028389573097229, "sampling/importance_sampling_ratio/min": 0.3058738112449646, "sampling/sampling_logp_difference/max": 1.1845827102661133, "sampling/sampling_logp_difference/mean": 0.14632542431354523, "step": 284 }, { "clip_ratio/high_max": 0.05674981512129307, "clip_ratio/high_mean": 0.05674981512129307, "clip_ratio/low_mean": 0.0852982671931386, "clip_ratio/low_min": 0.0852982671931386, "clip_ratio/region_mean": 0.14204808231443167, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 59.375, "completions/mean_terminated_length": 59.375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 1.934165135025978, "epoch": 0.011005560704355885, "frac_reward_zero_std": 0.0, "grad_norm": 10.306532859802246, "learning_rate": 9.13939393939394e-06, "loss": 0.0231, "num_tokens": 614381.0, "reward": 0.47206586599349976, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.47206586599349976, "reward_meter_std": 0.39846837520599365, "reward_std": 0.39846834540367126, "reward_total_composite_mean": 0.47206586599349976, "reward_total_composite_std": 0.39846837520599365, "reward_total_mean": 0.47206586599349976, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.47206586599349976, "rewards/meter/std": 0.39846837520599365, "rewards/total_composite/mean": 0.47206586599349976, "rewards/total_composite/std": 0.39846837520599365, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0313324928283691, "sampling/importance_sampling_ratio/min": 0.17719048261642456, "sampling/sampling_logp_difference/max": 1.7305299043655396, "sampling/sampling_logp_difference/mean": 0.16083520650863647, "step": 285 }, { "clip_ratio/high_max": 0.07367282547056675, "clip_ratio/high_mean": 0.07367282547056675, "clip_ratio/low_mean": 0.0790464598685503, "clip_ratio/low_min": 0.0790464598685503, "clip_ratio/region_mean": 0.15271928533911705, "completions/clipped_ratio": 0.0, "completions/max_length": 225.0, "completions/max_terminated_length": 225.0, "completions/mean_length": 177.25, "completions/mean_terminated_length": 177.25, "completions/min_length": 149.0, "completions/min_terminated_length": 149.0, "entropy": 0.8629858121275902, "epoch": 0.01104417670682731, "frac_reward_zero_std": 0.0, "grad_norm": 8.738157272338867, "learning_rate": 9.136363636363637e-06, "loss": 0.1343, "num_tokens": 617527.0, "reward": 0.3599608540534973, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.05050762742757797, "reward_meter_mean": 0.4146118462085724, "reward_meter_std": 0.2753751873970032, "reward_std": 0.23337014019489288, "reward_total_composite_mean": 0.3599608540534973, "reward_total_composite_std": 0.2333701252937317, "reward_total_mean": 0.3599608540534973, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.05050762742757797, "rewards/meter/mean": 0.4146118462085724, "rewards/meter/std": 0.2753751873970032, "rewards/total_composite/mean": 0.3599608540534973, "rewards/total_composite/std": 0.2333701252937317, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9998421669006348, "sampling/importance_sampling_ratio/min": 0.0186123289167881, "sampling/sampling_logp_difference/max": 3.983931064605713, "sampling/sampling_logp_difference/mean": 0.17458735406398773, "step": 286 }, { "clip_ratio/high_max": 0.03732517547905445, "clip_ratio/high_mean": 0.03732517547905445, "clip_ratio/low_mean": 0.1001923680305481, "clip_ratio/low_min": 0.1001923680305481, "clip_ratio/region_mean": 0.13751754350960255, "completions/clipped_ratio": 0.0, "completions/max_length": 143.0, "completions/max_terminated_length": 143.0, "completions/mean_length": 129.5, "completions/mean_terminated_length": 129.5, "completions/min_length": 120.0, "completions/min_terminated_length": 120.0, "entropy": 1.8472711890935898, "epoch": 0.011082792709298734, "frac_reward_zero_std": 0.0, "grad_norm": 7.0826334953308105, "learning_rate": 9.133333333333335e-06, "loss": -0.003, "num_tokens": 619875.0, "reward": 0.30439293384552, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.38049113750457764, "reward_meter_std": 0.30704429745674133, "reward_std": 0.24563542008399963, "reward_total_composite_mean": 0.30439293384552, "reward_total_composite_std": 0.24563542008399963, "reward_total_mean": 0.30439293384552, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.38049113750457764, "rewards/meter/std": 0.30704429745674133, "rewards/total_composite/mean": 0.30439293384552, "rewards/total_composite/std": 0.24563542008399963, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.029800295829773, "sampling/importance_sampling_ratio/min": 0.230813667178154, "sampling/sampling_logp_difference/max": 1.4661445617675781, "sampling/sampling_logp_difference/mean": 0.1677759736776352, "step": 287 }, { "clip_ratio/high_max": 0.07457270473241806, "clip_ratio/high_mean": 0.07457270473241806, "clip_ratio/low_mean": 0.0725222835317254, "clip_ratio/low_min": 0.0725222835317254, "clip_ratio/region_mean": 0.14709498826414347, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 61.0, "completions/mean_terminated_length": 61.0, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 1.9991831853985786, "epoch": 0.011121408711770158, "frac_reward_zero_std": 0.0, "grad_norm": 9.476400375366211, "learning_rate": 9.130303030303032e-06, "loss": -0.0746, "num_tokens": 621483.0, "reward": 0.6926716566085815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6926716566085815, "reward_meter_std": 0.32063576579093933, "reward_std": 0.32063573598861694, "reward_total_composite_mean": 0.6926716566085815, "reward_total_composite_std": 0.32063576579093933, "reward_total_mean": 0.6926716566085815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6926716566085815, "rewards/meter/std": 0.32063576579093933, "rewards/total_composite/mean": 0.6926716566085815, "rewards/total_composite/std": 0.32063576579093933, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.02389657497406, "sampling/importance_sampling_ratio/min": 0.31524786353111267, "sampling/sampling_logp_difference/max": 1.1543960571289062, "sampling/sampling_logp_difference/mean": 0.1627330631017685, "step": 288 }, { "clip_ratio/high_max": 0.08544671628624201, "clip_ratio/high_mean": 0.08544671628624201, "clip_ratio/low_mean": 0.03081388957798481, "clip_ratio/low_min": 0.03081388957798481, "clip_ratio/region_mean": 0.11626060586422682, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 56.5, "completions/mean_terminated_length": 56.5, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 1.427998036146164, "epoch": 0.011160024714241582, "frac_reward_zero_std": 0.0, "grad_norm": 10.661824226379395, "learning_rate": 9.127272727272727e-06, "loss": 0.093, "num_tokens": 623327.0, "reward": 0.6810826063156128, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6810826063156128, "reward_meter_std": 0.39801594614982605, "reward_std": 0.39801594614982605, "reward_total_composite_mean": 0.6810826063156128, "reward_total_composite_std": 0.39801594614982605, "reward_total_mean": 0.6810826063156128, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6810826063156128, "rewards/meter/std": 0.39801594614982605, "rewards/total_composite/mean": 0.6810826063156128, "rewards/total_composite/std": 0.39801594614982605, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0323865413665771, "sampling/importance_sampling_ratio/min": 0.2761779725551605, "sampling/sampling_logp_difference/max": 1.2867097854614258, "sampling/sampling_logp_difference/mean": 0.12699994444847107, "step": 289 }, { "clip_ratio/high_max": 0.08129793964326382, "clip_ratio/high_mean": 0.08129793964326382, "clip_ratio/low_mean": 0.036112773232162, "clip_ratio/low_min": 0.036112773232162, "clip_ratio/region_mean": 0.11741071287542582, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 91.0, "completions/mean_terminated_length": 91.0, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "entropy": 1.5821717530488968, "epoch": 0.011198640716713006, "frac_reward_zero_std": 0.0, "grad_norm": 8.565241813659668, "learning_rate": 9.124242424242425e-06, "loss": -0.0217, "num_tokens": 625439.0, "reward": 0.7161059379577637, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7161059379577637, "reward_meter_std": 0.37380164861679077, "reward_std": 0.37380164861679077, "reward_total_composite_mean": 0.7161059379577637, "reward_total_composite_std": 0.37380164861679077, "reward_total_mean": 0.7161059379577637, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7161059379577637, "rewards/meter/std": 0.37380164861679077, "rewards/total_composite/mean": 0.7161059379577637, "rewards/total_composite/std": 0.37380164861679077, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0219635963439941, "sampling/importance_sampling_ratio/min": 0.24008767306804657, "sampling/sampling_logp_difference/max": 1.4267511367797852, "sampling/sampling_logp_difference/mean": 0.1450376659631729, "step": 290 }, { "clip_ratio/high_max": 0.15774553548544645, "clip_ratio/high_mean": 0.15774553548544645, "clip_ratio/low_mean": 0.019999999552965164, "clip_ratio/low_min": 0.019999999552965164, "clip_ratio/region_mean": 0.17774553503841162, "completions/clipped_ratio": 0.0, "completions/max_length": 100.0, "completions/max_terminated_length": 100.0, "completions/mean_length": 84.875, "completions/mean_terminated_length": 84.875, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 2.2144875079393387, "epoch": 0.01123725671918443, "frac_reward_zero_std": 0.0, "grad_norm": 9.695059776306152, "learning_rate": 9.121212121212122e-06, "loss": 0.0824, "num_tokens": 627518.0, "reward": 0.8615293502807617, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8615293502807617, "reward_meter_std": 0.3134516179561615, "reward_std": 0.3134515881538391, "reward_total_composite_mean": 0.8615293502807617, "reward_total_composite_std": 0.3134516179561615, "reward_total_mean": 0.8615293502807617, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8615293502807617, "rewards/meter/std": 0.3134516179561615, "rewards/total_composite/mean": 0.8615293502807617, "rewards/total_composite/std": 0.3134516179561615, "sampling/importance_sampling_ratio/max": 1.9597175121307373, "sampling/importance_sampling_ratio/mean": 1.020525574684143, "sampling/importance_sampling_ratio/min": 0.27043434977531433, "sampling/sampling_logp_difference/max": 1.3077259063720703, "sampling/sampling_logp_difference/mean": 0.17841492593288422, "step": 291 }, { "clip_ratio/high_max": 0.050237943418323994, "clip_ratio/high_mean": 0.050237943418323994, "clip_ratio/low_mean": 0.04759177938103676, "clip_ratio/low_min": 0.04759177938103676, "clip_ratio/region_mean": 0.09782972279936075, "completions/clipped_ratio": 0.0, "completions/max_length": 222.0, "completions/max_terminated_length": 222.0, "completions/mean_length": 199.25, "completions/mean_terminated_length": 199.25, "completions/min_length": 179.0, "completions/min_terminated_length": 179.0, "entropy": 1.7579984441399574, "epoch": 0.011275872721655854, "frac_reward_zero_std": 0.0, "grad_norm": 4.9265546798706055, "learning_rate": 9.118181818181819e-06, "loss": 0.0485, "num_tokens": 630696.0, "reward": 0.4524690806865692, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5907192230224609, "reward_meter_std": 0.3661164939403534, "reward_std": 0.37379953265190125, "reward_total_composite_mean": 0.4524690806865692, "reward_total_composite_std": 0.37379953265190125, "reward_total_mean": 0.4524690806865692, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5907192230224609, "rewards/meter/std": 0.3661164939403534, "rewards/total_composite/mean": 0.4524690806865692, "rewards/total_composite/std": 0.37379953265190125, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0290663242340088, "sampling/importance_sampling_ratio/min": 0.2462177872657776, "sampling/sampling_logp_difference/max": 1.4015388488769531, "sampling/sampling_logp_difference/mean": 0.14518797397613525, "step": 292 }, { "clip_ratio/high_max": 0.10475165769457817, "clip_ratio/high_mean": 0.10475165769457817, "clip_ratio/low_mean": 0.051651342771947384, "clip_ratio/low_min": 0.051651342771947384, "clip_ratio/region_mean": 0.15640300046652555, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 64.25, "completions/mean_terminated_length": 64.25, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 1.85820072889328, "epoch": 0.011314488724127278, "frac_reward_zero_std": 0.0, "grad_norm": 9.675642967224121, "learning_rate": 9.115151515151516e-06, "loss": 0.0185, "num_tokens": 632410.0, "reward": 0.9181022047996521, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9181022047996521, "reward_meter_std": 0.09518402069807053, "reward_std": 0.09518400579690933, "reward_total_composite_mean": 0.9181022047996521, "reward_total_composite_std": 0.09518402069807053, "reward_total_mean": 0.9181022047996521, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9181022047996521, "rewards/meter/std": 0.09518402069807053, "rewards/total_composite/mean": 0.9181022047996521, "rewards/total_composite/std": 0.09518402069807053, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.036954402923584, "sampling/importance_sampling_ratio/min": 0.16399513185024261, "sampling/sampling_logp_difference/max": 1.8079185485839844, "sampling/sampling_logp_difference/mean": 0.15963061153888702, "step": 293 }, { "clip_ratio/high_max": 0.15911428444087505, "clip_ratio/high_mean": 0.15911428444087505, "clip_ratio/low_mean": 0.008928571827709675, "clip_ratio/low_min": 0.008928571827709675, "clip_ratio/region_mean": 0.16804285626858473, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 31.0, "completions/mean_terminated_length": 31.0, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 2.2211313992738724, "epoch": 0.011353104726598702, "frac_reward_zero_std": 0.0, "grad_norm": 22.611948013305664, "learning_rate": 9.112121212121214e-06, "loss": -0.022, "num_tokens": 633858.0, "reward": 0.8932417631149292, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8932417631149292, "reward_meter_std": 0.2514517903327942, "reward_std": 0.2514517605304718, "reward_total_composite_mean": 0.8932417631149292, "reward_total_composite_std": 0.2514517903327942, "reward_total_mean": 0.8932417631149292, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8932417631149292, "rewards/meter/std": 0.2514517903327942, "rewards/total_composite/mean": 0.8932417631149292, "rewards/total_composite/std": 0.2514517903327942, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0493816137313843, "sampling/importance_sampling_ratio/min": 0.11040541529655457, "sampling/sampling_logp_difference/max": 2.2035961151123047, "sampling/sampling_logp_difference/mean": 0.18085245788097382, "step": 294 }, { "clip_ratio/high_max": 0.08510276302695274, "clip_ratio/high_mean": 0.08510276302695274, "clip_ratio/low_mean": 0.05079313600435853, "clip_ratio/low_min": 0.05079313600435853, "clip_ratio/region_mean": 0.13589589903131127, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 63.375, "completions/mean_terminated_length": 63.375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 1.5011917799711227, "epoch": 0.011391720729070126, "frac_reward_zero_std": 0.0, "grad_norm": 11.888802528381348, "learning_rate": 9.10909090909091e-06, "loss": 0.05, "num_tokens": 635653.0, "reward": 0.7532914876937866, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7532914876937866, "reward_meter_std": 0.3347664475440979, "reward_std": 0.3347664773464203, "reward_total_composite_mean": 0.7532914876937866, "reward_total_composite_std": 0.3347664475440979, "reward_total_mean": 0.7532914876937866, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7532914876937866, "rewards/meter/std": 0.3347664475440979, "rewards/total_composite/mean": 0.7532914876937866, "rewards/total_composite/std": 0.3347664475440979, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0173488855361938, "sampling/importance_sampling_ratio/min": 0.20713002979755402, "sampling/sampling_logp_difference/max": 1.5744085311889648, "sampling/sampling_logp_difference/mean": 0.1385606974363327, "step": 295 }, { "clip_ratio/high_max": 0.054404761642217636, "clip_ratio/high_mean": 0.054404761642217636, "clip_ratio/low_mean": 0.06392320711165667, "clip_ratio/low_min": 0.06392320711165667, "clip_ratio/region_mean": 0.1183279687538743, "completions/clipped_ratio": 0.0, "completions/max_length": 43.0, "completions/max_terminated_length": 43.0, "completions/mean_length": 25.875, "completions/mean_terminated_length": 25.875, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 0.7283558156341314, "epoch": 0.01143033673154155, "frac_reward_zero_std": 0.0, "grad_norm": 37.00153732299805, "learning_rate": 9.106060606060606e-06, "loss": 0.1775, "num_tokens": 637188.0, "reward": 0.8021076321601868, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8021076321601868, "reward_meter_std": 0.21438796818256378, "reward_std": 0.21438796818256378, "reward_total_composite_mean": 0.8021076321601868, "reward_total_composite_std": 0.21438796818256378, "reward_total_mean": 0.8021076321601868, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8021076321601868, "rewards/meter/std": 0.21438796818256378, "rewards/total_composite/mean": 0.8021076321601868, "rewards/total_composite/std": 0.21438796818256378, "sampling/importance_sampling_ratio/max": 1.9617925882339478, "sampling/importance_sampling_ratio/mean": 0.9893893003463745, "sampling/importance_sampling_ratio/min": 0.07945267111063004, "sampling/sampling_logp_difference/max": 2.5325937271118164, "sampling/sampling_logp_difference/mean": 0.15415281057357788, "step": 296 }, { "clip_ratio/high_max": 0.06547143869102001, "clip_ratio/high_mean": 0.06547143869102001, "clip_ratio/low_mean": 0.046736557967960835, "clip_ratio/low_min": 0.046736557967960835, "clip_ratio/region_mean": 0.11220799665898085, "completions/clipped_ratio": 0.0, "completions/max_length": 102.0, "completions/max_terminated_length": 102.0, "completions/mean_length": 90.125, "completions/mean_terminated_length": 90.125, "completions/min_length": 81.0, "completions/min_terminated_length": 81.0, "entropy": 1.3437079191207886, "epoch": 0.011468952734012975, "frac_reward_zero_std": 0.0, "grad_norm": 10.021339416503906, "learning_rate": 9.103030303030304e-06, "loss": 0.0003, "num_tokens": 639349.0, "reward": 0.6162939667701721, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6162939667701721, "reward_meter_std": 0.46589404344558716, "reward_std": 0.46589401364326477, "reward_total_composite_mean": 0.6162939667701721, "reward_total_composite_std": 0.46589404344558716, "reward_total_mean": 0.6162939667701721, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6162939667701721, "rewards/meter/std": 0.46589404344558716, "rewards/total_composite/mean": 0.6162939667701721, "rewards/total_composite/std": 0.46589404344558716, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0367764234542847, "sampling/importance_sampling_ratio/min": 0.24083733558654785, "sampling/sampling_logp_difference/max": 1.4236335754394531, "sampling/sampling_logp_difference/mean": 0.13409848511219025, "step": 297 }, { "clip_ratio/high_max": 0.0976903848350048, "clip_ratio/high_mean": 0.0976903848350048, "clip_ratio/low_mean": 0.03513659443706274, "clip_ratio/low_min": 0.03513659443706274, "clip_ratio/region_mean": 0.13282697927206755, "completions/clipped_ratio": 0.0, "completions/max_length": 212.0, "completions/max_terminated_length": 212.0, "completions/mean_length": 183.25, "completions/mean_terminated_length": 183.25, "completions/min_length": 151.0, "completions/min_terminated_length": 151.0, "entropy": 1.7826667726039886, "epoch": 0.011507568736484399, "frac_reward_zero_std": 0.0, "grad_norm": 6.047693729400635, "learning_rate": 9.100000000000001e-06, "loss": 0.0128, "num_tokens": 642375.0, "reward": 0.7657866477966309, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8214285373687744, "reward_count_adherence_std": 0.06613000482320786, "reward_meter_mean": 0.9324739575386047, "reward_meter_std": 0.09105537831783295, "reward_std": 0.09787716716527939, "reward_total_composite_mean": 0.7657866477966309, "reward_total_composite_std": 0.09787718951702118, "reward_total_mean": 0.7657866477966309, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8214285373687744, "rewards/count_adherence/std": 0.06613000482320786, "rewards/meter/mean": 0.9324739575386047, "rewards/meter/std": 0.09105537831783295, "rewards/total_composite/mean": 0.7657866477966309, "rewards/total_composite/std": 0.09787718951702118, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0216869115829468, "sampling/importance_sampling_ratio/min": 0.02991897612810135, "sampling/sampling_logp_difference/max": 3.5092623233795166, "sampling/sampling_logp_difference/mean": 0.14809899032115936, "step": 298 }, { "clip_ratio/high_max": 0.10818896908313036, "clip_ratio/high_mean": 0.10818896908313036, "clip_ratio/low_mean": 0.046733343973755836, "clip_ratio/low_min": 0.046733343973755836, "clip_ratio/region_mean": 0.1549223130568862, "completions/clipped_ratio": 0.0, "completions/max_length": 96.0, "completions/max_terminated_length": 96.0, "completions/mean_length": 65.25, "completions/mean_terminated_length": 65.25, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 1.74993297457695, "epoch": 0.011546184738955823, "frac_reward_zero_std": 0.0, "grad_norm": 12.910846710205078, "learning_rate": 9.096969696969698e-06, "loss": 0.1033, "num_tokens": 644161.0, "reward": 0.7445110082626343, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8054907917976379, "reward_meter_std": 0.36134690046310425, "reward_std": 0.3695930242538452, "reward_total_composite_mean": 0.7445110082626343, "reward_total_composite_std": 0.3695930540561676, "reward_total_mean": 0.7445110082626343, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8054907917976379, "rewards/meter/std": 0.36134690046310425, "rewards/total_composite/mean": 0.7445110082626343, "rewards/total_composite/std": 0.3695930540561676, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0238062143325806, "sampling/importance_sampling_ratio/min": 0.26225021481513977, "sampling/sampling_logp_difference/max": 1.338456153869629, "sampling/sampling_logp_difference/mean": 0.16549576818943024, "step": 299 }, { "clip_ratio/high_max": 0.09760686475783587, "clip_ratio/high_mean": 0.09760686475783587, "clip_ratio/low_mean": 0.06600985117256641, "clip_ratio/low_min": 0.06600985117256641, "clip_ratio/region_mean": 0.16361671593040228, "completions/clipped_ratio": 0.0, "completions/max_length": 35.0, "completions/max_terminated_length": 35.0, "completions/mean_length": 28.875, "completions/mean_terminated_length": 28.875, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 2.053573176264763, "epoch": 0.011584800741427247, "frac_reward_zero_std": 0.0, "grad_norm": 13.964972496032715, "learning_rate": 9.093939393939395e-06, "loss": 0.0899, "num_tokens": 645560.0, "reward": 0.6676859259605408, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6676859259605408, "reward_meter_std": 0.40630266070365906, "reward_std": 0.40630266070365906, "reward_total_composite_mean": 0.6676859259605408, "reward_total_composite_std": 0.40630266070365906, "reward_total_mean": 0.6676859259605408, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6676859259605408, "rewards/meter/std": 0.40630266070365906, "rewards/total_composite/mean": 0.6676859259605408, "rewards/total_composite/std": 0.40630266070365906, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0266624689102173, "sampling/importance_sampling_ratio/min": 0.29776731133461, "sampling/sampling_logp_difference/max": 1.2114429473876953, "sampling/sampling_logp_difference/mean": 0.17699161171913147, "step": 300 }, { "epoch": 0.011584800741427247, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/max_length": 413.84615384615387, "eval_completions/max_terminated_length": 332.6923076923077, "eval_completions/mean_length": 189.27884615384616, "eval_completions/mean_terminated_length": 169.91621281550482, "eval_completions/min_length": 48.69230769230769, "eval_completions/min_terminated_length": 48.69230769230769, "eval_entropy": 1.6832339671941905, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 645560.0, "eval_reward": 0.47910642050779784, "eval_reward_arabic_clean_mean": 0.9326923076923077, "eval_reward_arabic_clean_std": 0.19037489936901972, "eval_reward_count_adherence_mean": 0.8583941322106582, "eval_reward_count_adherence_std": 0.16477382297699267, "eval_reward_meter_mean": 0.5671234520582052, "eval_reward_meter_std": 0.3898524023019351, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.47910642050779784, "eval_reward_total_composite_std": 0.3604818215736976, "eval_reward_total_mean": 0.47910642050779784, "eval_rewards/arabic_clean/mean": 0.9326923076923077, "eval_rewards/arabic_clean/std": 0.19037489936901972, "eval_rewards/count_adherence/mean": 0.8583941322106582, "eval_rewards/count_adherence/std": 0.16477382297699267, "eval_rewards/meter/mean": 0.5671234520582052, "eval_rewards/meter/std": 0.3898524023019351, "eval_rewards/total_composite/mean": 0.47910642050779784, "eval_rewards/total_composite/std": 0.3604818215736976, "eval_runtime": 76.9936, "eval_samples_per_second": 1.351, "eval_sampling/importance_sampling_ratio/max": 1.5635485924207246, "eval_sampling/importance_sampling_ratio/mean": 1.0292121997246375, "eval_sampling/importance_sampling_ratio/min": 0.32239050360826343, "eval_sampling/sampling_logp_difference/max": 1.1390617810762846, "eval_sampling/sampling_logp_difference/mean": 0.10725439225251858, "eval_steps_per_second": 0.169, "step": 300 }, { "clip_ratio/high_max": 0.021113280206918716, "clip_ratio/high_mean": 0.021113280206918716, "clip_ratio/low_mean": 0.012804877944290638, "clip_ratio/low_min": 0.012804877944290638, "clip_ratio/region_mean": 0.033918158151209354, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 471.0, "completions/mean_length": 462.625, "completions/mean_terminated_length": 380.3333435058594, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "entropy": 0.7612107247114182, "epoch": 0.011623416743898671, "frac_reward_zero_std": 0.0, "grad_norm": 1.71794855594635, "learning_rate": 9.090909090909091e-06, "loss": -0.313, "num_tokens": 648373.0, "reward": 0.21318131685256958, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_count_adherence_mean": 0.4375, "reward_count_adherence_std": 0.18169663846492767, "reward_meter_mean": 0.6754355430603027, "reward_meter_std": 0.3314078450202942, "reward_std": 0.2553112506866455, "reward_total_composite_mean": 0.21318131685256958, "reward_total_composite_std": 0.2553112804889679, "reward_total_mean": 0.21318131685256958, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/count_adherence/mean": 0.4375, "rewards/count_adherence/std": 0.18169663846492767, "rewards/meter/mean": 0.6754355430603027, "rewards/meter/std": 0.3314078450202942, "rewards/total_composite/mean": 0.21318131685256958, "rewards/total_composite/std": 0.2553112804889679, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0243096351623535, "sampling/importance_sampling_ratio/min": 0.2710690200328827, "sampling/sampling_logp_difference/max": 1.3053817749023438, "sampling/sampling_logp_difference/mean": 0.13692021369934082, "step": 301 }, { "clip_ratio/high_max": 0.10167329479008913, "clip_ratio/high_mean": 0.10167329479008913, "clip_ratio/low_mean": 0.06732289679348469, "clip_ratio/low_min": 0.06732289679348469, "clip_ratio/region_mean": 0.16899619158357382, "completions/clipped_ratio": 0.0, "completions/max_length": 156.0, "completions/max_terminated_length": 156.0, "completions/mean_length": 131.875, "completions/mean_terminated_length": 131.875, "completions/min_length": 117.0, "completions/min_terminated_length": 117.0, "entropy": 1.9741446822881699, "epoch": 0.011662032746370095, "frac_reward_zero_std": 0.0, "grad_norm": 6.904706954956055, "learning_rate": 9.087878787878788e-06, "loss": -0.0483, "num_tokens": 651028.0, "reward": 0.3257467448711395, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.407183438539505, "reward_meter_std": 0.17483185231685638, "reward_std": 0.1398654729127884, "reward_total_composite_mean": 0.3257467448711395, "reward_total_composite_std": 0.1398654729127884, "reward_total_mean": 0.3257467448711395, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.407183438539505, "rewards/meter/std": 0.17483185231685638, "rewards/total_composite/mean": 0.3257467448711395, "rewards/total_composite/std": 0.1398654729127884, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.031490445137024, "sampling/importance_sampling_ratio/min": 0.20558007061481476, "sampling/sampling_logp_difference/max": 2.081483840942383, "sampling/sampling_logp_difference/mean": 0.17297177016735077, "step": 302 }, { "clip_ratio/high_max": 0.0840634061023593, "clip_ratio/high_mean": 0.0840634061023593, "clip_ratio/low_mean": 0.03281614277511835, "clip_ratio/low_min": 0.03281614277511835, "clip_ratio/region_mean": 0.11687954887747765, "completions/clipped_ratio": 0.0, "completions/max_length": 39.0, "completions/max_terminated_length": 39.0, "completions/mean_length": 35.375, "completions/mean_terminated_length": 35.375, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 1.5965645760297775, "epoch": 0.01170064874884152, "frac_reward_zero_std": 0.0, "grad_norm": 13.510102272033691, "learning_rate": 9.084848484848486e-06, "loss": -0.0003, "num_tokens": 652679.0, "reward": 0.6417617797851562, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6417617797851562, "reward_meter_std": 0.47610655426979065, "reward_std": 0.47610652446746826, "reward_total_composite_mean": 0.6417617797851562, "reward_total_composite_std": 0.47610655426979065, "reward_total_mean": 0.6417617797851562, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6417617797851562, "rewards/meter/std": 0.47610655426979065, "rewards/total_composite/mean": 0.6417617797851562, "rewards/total_composite/std": 0.47610655426979065, "sampling/importance_sampling_ratio/max": 1.849202036857605, "sampling/importance_sampling_ratio/mean": 1.001904010772705, "sampling/importance_sampling_ratio/min": 0.16444538533687592, "sampling/sampling_logp_difference/max": 1.8051767349243164, "sampling/sampling_logp_difference/mean": 0.16745901107788086, "step": 303 }, { "clip_ratio/high_max": 0.08884815126657486, "clip_ratio/high_mean": 0.08884815126657486, "clip_ratio/low_mean": 0.033333334140479565, "clip_ratio/low_min": 0.033333334140479565, "clip_ratio/region_mean": 0.12218148540705442, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 65.5, "completions/mean_terminated_length": 65.5, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 1.989267036318779, "epoch": 0.011739264751312943, "frac_reward_zero_std": 0.0, "grad_norm": 9.380762100219727, "learning_rate": 9.081818181818183e-06, "loss": -0.0536, "num_tokens": 654531.0, "reward": 0.5989729166030884, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6257134079933167, "reward_meter_std": 0.39615458250045776, "reward_std": 0.43339118361473083, "reward_total_composite_mean": 0.5989729166030884, "reward_total_composite_std": 0.43339118361473083, "reward_total_mean": 0.5989729166030884, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6257134079933167, "rewards/meter/std": 0.39615458250045776, "rewards/total_composite/mean": 0.5989729166030884, "rewards/total_composite/std": 0.43339118361473083, "sampling/importance_sampling_ratio/max": 1.9768328666687012, "sampling/importance_sampling_ratio/mean": 1.0195375680923462, "sampling/importance_sampling_ratio/min": 0.1475263237953186, "sampling/sampling_logp_difference/max": 1.9137487411499023, "sampling/sampling_logp_difference/mean": 0.174082413315773, "step": 304 }, { "clip_ratio/high_max": 0.10270242113620043, "clip_ratio/high_mean": 0.10270242113620043, "clip_ratio/low_mean": 0.027922078035771847, "clip_ratio/low_min": 0.027922078035771847, "clip_ratio/region_mean": 0.13062449917197227, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 63.0, "completions/mean_terminated_length": 63.0, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 1.5056721195578575, "epoch": 0.011777880753784368, "frac_reward_zero_std": 0.0, "grad_norm": 10.915406227111816, "learning_rate": 9.078787878787878e-06, "loss": 0.0498, "num_tokens": 656283.0, "reward": 0.8347302079200745, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8347302079200745, "reward_meter_std": 0.3262871503829956, "reward_std": 0.3262871503829956, "reward_total_composite_mean": 0.8347302079200745, "reward_total_composite_std": 0.3262871503829956, "reward_total_mean": 0.8347302079200745, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8347302079200745, "rewards/meter/std": 0.3262871503829956, "rewards/total_composite/mean": 0.8347302079200745, "rewards/total_composite/std": 0.3262871503829956, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0057920217514038, "sampling/importance_sampling_ratio/min": 0.21743382513523102, "sampling/sampling_logp_difference/max": 1.5258607864379883, "sampling/sampling_logp_difference/mean": 0.1379973143339157, "step": 305 }, { "clip_ratio/high_max": 0.10306308604776859, "clip_ratio/high_mean": 0.10306308604776859, "clip_ratio/low_mean": 0.09684343822300434, "clip_ratio/low_min": 0.09684343822300434, "clip_ratio/region_mean": 0.19990652427077293, "completions/clipped_ratio": 0.0, "completions/max_length": 32.0, "completions/max_terminated_length": 32.0, "completions/mean_length": 21.75, "completions/mean_terminated_length": 21.75, "completions/min_length": 15.0, "completions/min_terminated_length": 15.0, "entropy": 2.3475464656949043, "epoch": 0.011816496756255792, "frac_reward_zero_std": 0.0, "grad_norm": 15.107892036437988, "learning_rate": 9.075757575757577e-06, "loss": -0.0637, "num_tokens": 657681.0, "reward": 0.6698324680328369, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6698324680328369, "reward_meter_std": 0.42919304966926575, "reward_std": 0.42919301986694336, "reward_total_composite_mean": 0.6698324680328369, "reward_total_composite_std": 0.42919304966926575, "reward_total_mean": 0.6698324680328369, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6698324680328369, "rewards/meter/std": 0.42919304966926575, "rewards/total_composite/mean": 0.6698324680328369, "rewards/total_composite/std": 0.42919304966926575, "sampling/importance_sampling_ratio/max": 1.7879084348678589, "sampling/importance_sampling_ratio/mean": 1.038679838180542, "sampling/importance_sampling_ratio/min": 0.3113321363925934, "sampling/sampling_logp_difference/max": 1.1668949127197266, "sampling/sampling_logp_difference/mean": 0.18782852590084076, "step": 306 }, { "clip_ratio/high_max": 0.064244344830513, "clip_ratio/high_mean": 0.064244344830513, "clip_ratio/low_mean": 0.08673457149416208, "clip_ratio/low_min": 0.08673457149416208, "clip_ratio/region_mean": 0.15097891632467508, "completions/clipped_ratio": 0.0, "completions/max_length": 131.0, "completions/max_terminated_length": 131.0, "completions/mean_length": 103.5, "completions/mean_terminated_length": 103.5, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "entropy": 2.192972496151924, "epoch": 0.011855112758727216, "frac_reward_zero_std": 0.0, "grad_norm": 7.24405574798584, "learning_rate": 9.072727272727273e-06, "loss": 0.0343, "num_tokens": 659813.0, "reward": 0.4702509343624115, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5797778367996216, "reward_meter_std": 0.4139650762081146, "reward_std": 0.4394586980342865, "reward_total_composite_mean": 0.4702509343624115, "reward_total_composite_std": 0.4394587278366089, "reward_total_mean": 0.4702509343624115, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5797778367996216, "rewards/meter/std": 0.4139650762081146, "rewards/total_composite/mean": 0.4702509343624115, "rewards/total_composite/std": 0.4394587278366089, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0307226181030273, "sampling/importance_sampling_ratio/min": 0.19179849326610565, "sampling/sampling_logp_difference/max": 1.6513099670410156, "sampling/sampling_logp_difference/mean": 0.16522862017154694, "step": 307 }, { "clip_ratio/high_max": 0.05581671930849552, "clip_ratio/high_mean": 0.05581671930849552, "clip_ratio/low_mean": 0.07120703207328916, "clip_ratio/low_min": 0.07120703207328916, "clip_ratio/region_mean": 0.12702375138178468, "completions/clipped_ratio": 0.0, "completions/max_length": 98.0, "completions/max_terminated_length": 98.0, "completions/mean_length": 86.5, "completions/mean_terminated_length": 86.5, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 1.4088008925318718, "epoch": 0.011893728761198642, "frac_reward_zero_std": 0.0, "grad_norm": 12.200899124145508, "learning_rate": 9.06969696969697e-06, "loss": -0.0505, "num_tokens": 661897.0, "reward": 0.5569584369659424, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.5630761384963989, "reward_meter_std": 0.37055954337120056, "reward_std": 0.3778226375579834, "reward_total_composite_mean": 0.5569584369659424, "reward_total_composite_std": 0.3778226375579834, "reward_total_mean": 0.5569584369659424, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.5630761384963989, "rewards/meter/std": 0.37055954337120056, "rewards/total_composite/mean": 0.5569584369659424, "rewards/total_composite/std": 0.3778226375579834, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0206682682037354, "sampling/importance_sampling_ratio/min": 0.13020169734954834, "sampling/sampling_logp_difference/max": 2.038670539855957, "sampling/sampling_logp_difference/mean": 0.16500020027160645, "step": 308 }, { "clip_ratio/high_max": 0.08292348962277174, "clip_ratio/high_mean": 0.08292348962277174, "clip_ratio/low_mean": 0.06721637584269047, "clip_ratio/low_min": 0.06721637584269047, "clip_ratio/region_mean": 0.1501398654654622, "completions/clipped_ratio": 0.0, "completions/max_length": 104.0, "completions/max_terminated_length": 104.0, "completions/mean_length": 84.875, "completions/mean_terminated_length": 84.875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 2.261012151837349, "epoch": 0.011932344763670066, "frac_reward_zero_std": 0.0, "grad_norm": 9.461854934692383, "learning_rate": 9.066666666666667e-06, "loss": -0.0083, "num_tokens": 663904.0, "reward": 0.607955813407898, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.6280455589294434, "reward_meter_std": 0.17267122864723206, "reward_std": 0.19935740530490875, "reward_total_composite_mean": 0.607955813407898, "reward_total_composite_std": 0.19935742020606995, "reward_total_mean": 0.607955813407898, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.6280455589294434, "rewards/meter/std": 0.17267122864723206, "rewards/total_composite/mean": 0.607955813407898, "rewards/total_composite/std": 0.19935742020606995, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0375332832336426, "sampling/importance_sampling_ratio/min": 0.2669237554073334, "sampling/sampling_logp_difference/max": 1.3207921981811523, "sampling/sampling_logp_difference/mean": 0.17172668874263763, "step": 309 }, { "clip_ratio/high_max": 0.06727708876132965, "clip_ratio/high_mean": 0.06727708876132965, "clip_ratio/low_mean": 0.061003027483820915, "clip_ratio/low_min": 0.061003027483820915, "clip_ratio/region_mean": 0.12828011624515057, "completions/clipped_ratio": 0.0, "completions/max_length": 145.0, "completions/max_terminated_length": 145.0, "completions/mean_length": 129.125, "completions/mean_terminated_length": 129.125, "completions/min_length": 111.0, "completions/min_terminated_length": 111.0, "entropy": 1.74216927587986, "epoch": 0.01197096076614149, "frac_reward_zero_std": 0.0, "grad_norm": 6.23518705368042, "learning_rate": 9.063636363636365e-06, "loss": -0.0331, "num_tokens": 666273.0, "reward": 0.6215674877166748, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.7603760957717896, "reward_meter_std": 0.25764790177345276, "reward_std": 0.19575539231300354, "reward_total_composite_mean": 0.6215674877166748, "reward_total_composite_std": 0.19575539231300354, "reward_total_mean": 0.6215674877166748, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.7603760957717896, "rewards/meter/std": 0.25764790177345276, "rewards/total_composite/mean": 0.6215674877166748, "rewards/total_composite/std": 0.19575539231300354, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0316812992095947, "sampling/importance_sampling_ratio/min": 0.21927233040332794, "sampling/sampling_logp_difference/max": 1.5174407958984375, "sampling/sampling_logp_difference/mean": 0.14828266203403473, "step": 310 }, { "clip_ratio/high_max": 0.1306404136121273, "clip_ratio/high_mean": 0.1306404136121273, "clip_ratio/low_mean": 0.06916317716240883, "clip_ratio/low_min": 0.06916317716240883, "clip_ratio/region_mean": 0.19980359077453613, "completions/clipped_ratio": 0.0, "completions/max_length": 203.0, "completions/max_terminated_length": 203.0, "completions/mean_length": 141.625, "completions/mean_terminated_length": 141.625, "completions/min_length": 103.0, "completions/min_terminated_length": 103.0, "entropy": 1.3266419470310211, "epoch": 0.012009576768612914, "frac_reward_zero_std": 0.0, "grad_norm": 15.047697067260742, "learning_rate": 9.06060606060606e-06, "loss": 0.1673, "num_tokens": 668998.0, "reward": 0.7146421670913696, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.953125, "reward_count_adherence_std": 0.06469365209341049, "reward_meter_mean": 0.7493094205856323, "reward_meter_std": 0.22875480353832245, "reward_std": 0.2316495180130005, "reward_total_composite_mean": 0.7146421670913696, "reward_total_composite_std": 0.2316495180130005, "reward_total_mean": 0.7146421670913696, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.953125, "rewards/count_adherence/std": 0.06469365209341049, "rewards/meter/mean": 0.7493094205856323, "rewards/meter/std": 0.22875480353832245, "rewards/total_composite/mean": 0.7146421670913696, "rewards/total_composite/std": 0.2316495180130005, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9966016411781311, "sampling/importance_sampling_ratio/min": 0.041286900639534, "sampling/sampling_logp_difference/max": 3.1872100830078125, "sampling/sampling_logp_difference/mean": 0.21245455741882324, "step": 311 }, { "clip_ratio/high_max": 0.15273912716656923, "clip_ratio/high_mean": 0.15273912716656923, "clip_ratio/low_mean": 0.030448718927800655, "clip_ratio/low_min": 0.030448718927800655, "clip_ratio/region_mean": 0.1831878460943699, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 30.375, "completions/mean_terminated_length": 30.375, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 1.9258029609918594, "epoch": 0.012048192771084338, "frac_reward_zero_std": 0.0, "grad_norm": 19.782384872436523, "learning_rate": 9.057575757575759e-06, "loss": -0.011, "num_tokens": 670353.0, "reward": 0.7651474475860596, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7651474475860596, "reward_meter_std": 0.3580241799354553, "reward_std": 0.35802415013313293, "reward_total_composite_mean": 0.7651474475860596, "reward_total_composite_std": 0.3580241799354553, "reward_total_mean": 0.7651474475860596, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7651474475860596, "rewards/meter/std": 0.3580241799354553, "rewards/total_composite/mean": 0.7651474475860596, "rewards/total_composite/std": 0.3580241799354553, "sampling/importance_sampling_ratio/max": 1.8821232318878174, "sampling/importance_sampling_ratio/mean": 1.0236084461212158, "sampling/importance_sampling_ratio/min": 0.33582067489624023, "sampling/sampling_logp_difference/max": 1.0911779403686523, "sampling/sampling_logp_difference/mean": 0.16778768599033356, "step": 312 }, { "clip_ratio/high_max": 0.10207792790606618, "clip_ratio/high_mean": 0.10207792790606618, "clip_ratio/low_mean": 0.03583333361893892, "clip_ratio/low_min": 0.03583333361893892, "clip_ratio/region_mean": 0.1379112615250051, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 62.0, "completions/mean_terminated_length": 62.0, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 2.047884911298752, "epoch": 0.012086808773555762, "frac_reward_zero_std": 0.0, "grad_norm": 10.562493324279785, "learning_rate": 9.054545454545455e-06, "loss": -0.0656, "num_tokens": 671977.0, "reward": 0.9314479231834412, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9314479231834412, "reward_meter_std": 0.10455489158630371, "reward_std": 0.10455489158630371, "reward_total_composite_mean": 0.9314479231834412, "reward_total_composite_std": 0.10455489158630371, "reward_total_mean": 0.9314479231834412, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9314479231834412, "rewards/meter/std": 0.10455489158630371, "rewards/total_composite/mean": 0.9314479231834412, "rewards/total_composite/std": 0.10455489158630371, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0549638271331787, "sampling/importance_sampling_ratio/min": 0.23077911138534546, "sampling/sampling_logp_difference/max": 1.466294288635254, "sampling/sampling_logp_difference/mean": 0.1677490621805191, "step": 313 }, { "clip_ratio/high_max": 0.12252288311719894, "clip_ratio/high_mean": 0.12252288311719894, "clip_ratio/low_mean": 0.02873883955180645, "clip_ratio/low_min": 0.02873883955180645, "clip_ratio/region_mean": 0.1512617226690054, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 62.125, "completions/mean_terminated_length": 62.125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 1.8069640547037125, "epoch": 0.012125424776027186, "frac_reward_zero_std": 0.0, "grad_norm": 16.10173797607422, "learning_rate": 9.051515151515152e-06, "loss": -0.0042, "num_tokens": 673690.0, "reward": 0.8384339809417725, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8384339809417725, "reward_meter_std": 0.33158746361732483, "reward_std": 0.33158746361732483, "reward_total_composite_mean": 0.8384339809417725, "reward_total_composite_std": 0.33158746361732483, "reward_total_mean": 0.8384339809417725, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8384339809417725, "rewards/meter/std": 0.33158746361732483, "rewards/total_composite/mean": 0.8384339809417725, "rewards/total_composite/std": 0.33158746361732483, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0274717807769775, "sampling/importance_sampling_ratio/min": 0.19091176986694336, "sampling/sampling_logp_difference/max": 1.6559438705444336, "sampling/sampling_logp_difference/mean": 0.15842776000499725, "step": 314 }, { "clip_ratio/high_max": 0.09765755478292704, "clip_ratio/high_mean": 0.09765755478292704, "clip_ratio/low_mean": 0.016509434208273888, "clip_ratio/low_min": 0.016509434208273888, "clip_ratio/region_mean": 0.11416698899120092, "completions/clipped_ratio": 0.0, "completions/max_length": 120.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 111.75, "completions/mean_terminated_length": 111.75, "completions/min_length": 103.0, "completions/min_terminated_length": 103.0, "entropy": 1.6218044012784958, "epoch": 0.01216404077849861, "frac_reward_zero_std": 0.0, "grad_norm": 6.204983234405518, "learning_rate": 9.04848484848485e-06, "loss": -0.01, "num_tokens": 676000.0, "reward": 0.9871163368225098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9871163368225098, "reward_meter_std": 0.022878479212522507, "reward_std": 0.022878482937812805, "reward_total_composite_mean": 0.9871163368225098, "reward_total_composite_std": 0.022878479212522507, "reward_total_mean": 0.9871163368225098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9871163368225098, "rewards/meter/std": 0.022878479212522507, "rewards/total_composite/mean": 0.9871163368225098, "rewards/total_composite/std": 0.022878479212522507, "sampling/importance_sampling_ratio/max": 1.6907645463943481, "sampling/importance_sampling_ratio/mean": 1.0214686393737793, "sampling/importance_sampling_ratio/min": 0.27453866600990295, "sampling/sampling_logp_difference/max": 1.2926632165908813, "sampling/sampling_logp_difference/mean": 0.13204924762248993, "step": 315 }, { "clip_ratio/high_max": 0.0503198578953743, "clip_ratio/high_mean": 0.0503198578953743, "clip_ratio/low_mean": 0.0671336529776454, "clip_ratio/low_min": 0.0671336529776454, "clip_ratio/region_mean": 0.1174535108730197, "completions/clipped_ratio": 0.0, "completions/max_length": 173.0, "completions/max_terminated_length": 173.0, "completions/mean_length": 161.0, "completions/mean_terminated_length": 161.0, "completions/min_length": 153.0, "completions/min_terminated_length": 153.0, "entropy": 1.385835349559784, "epoch": 0.012202656780970034, "frac_reward_zero_std": 0.0, "grad_norm": 6.30336332321167, "learning_rate": 9.045454545454546e-06, "loss": 0.0004, "num_tokens": 678856.0, "reward": 0.343695729970932, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.412434846162796, "reward_meter_std": 0.3995774984359741, "reward_std": 0.3329812288284302, "reward_total_composite_mean": 0.343695729970932, "reward_total_composite_std": 0.33298125863075256, "reward_total_mean": 0.343695729970932, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.412434846162796, "rewards/meter/std": 0.3995774984359741, "rewards/total_composite/mean": 0.343695729970932, "rewards/total_composite/std": 0.33298125863075256, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0196648836135864, "sampling/importance_sampling_ratio/min": 0.18164780735969543, "sampling/sampling_logp_difference/max": 1.7056856155395508, "sampling/sampling_logp_difference/mean": 0.14012373983860016, "step": 316 }, { "clip_ratio/high_max": 0.13084796536713839, "clip_ratio/high_mean": 0.13084796536713839, "clip_ratio/low_mean": 0.020408162847161293, "clip_ratio/low_min": 0.020408162847161293, "clip_ratio/region_mean": 0.15125612821429968, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 59.125, "completions/mean_terminated_length": 59.125, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 1.7790979892015457, "epoch": 0.012241272783441458, "frac_reward_zero_std": 0.0, "grad_norm": 11.422844886779785, "learning_rate": 9.042424242424244e-06, "loss": -0.0392, "num_tokens": 680465.0, "reward": 0.9061346650123596, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9061346650123596, "reward_meter_std": 0.22870448231697083, "reward_std": 0.22870448231697083, "reward_total_composite_mean": 0.9061346650123596, "reward_total_composite_std": 0.22870448231697083, "reward_total_mean": 0.9061346650123596, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9061346650123596, "rewards/meter/std": 0.22870448231697083, "rewards/total_composite/mean": 0.9061346650123596, "rewards/total_composite/std": 0.22870448231697083, "sampling/importance_sampling_ratio/max": 1.9018646478652954, "sampling/importance_sampling_ratio/mean": 1.0229982137680054, "sampling/importance_sampling_ratio/min": 0.29680660367012024, "sampling/sampling_logp_difference/max": 1.214674472808838, "sampling/sampling_logp_difference/mean": 0.14648805558681488, "step": 317 }, { "clip_ratio/high_max": 0.13356309290975332, "clip_ratio/high_mean": 0.13356309290975332, "clip_ratio/low_mean": 0.015384615398943424, "clip_ratio/low_min": 0.015384615398943424, "clip_ratio/region_mean": 0.14894770830869675, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 70.375, "completions/mean_terminated_length": 70.375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 2.0886534601449966, "epoch": 0.012279888785912883, "frac_reward_zero_std": 0.0, "grad_norm": 8.7025728225708, "learning_rate": 9.03939393939394e-06, "loss": -0.0306, "num_tokens": 682172.0, "reward": 0.9199281930923462, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9199281930923462, "reward_meter_std": 0.17555859684944153, "reward_std": 0.17555858194828033, "reward_total_composite_mean": 0.9199281930923462, "reward_total_composite_std": 0.17555859684944153, "reward_total_mean": 0.9199281930923462, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9199281930923462, "rewards/meter/std": 0.17555859684944153, "rewards/total_composite/mean": 0.9199281930923462, "rewards/total_composite/std": 0.17555859684944153, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0345814228057861, "sampling/importance_sampling_ratio/min": 0.22520792484283447, "sampling/sampling_logp_difference/max": 1.4907312393188477, "sampling/sampling_logp_difference/mean": 0.1701533943414688, "step": 318 }, { "clip_ratio/high_max": 0.035777142737060785, "clip_ratio/high_mean": 0.035777142737060785, "clip_ratio/low_mean": 0.014423076994717121, "clip_ratio/low_min": 0.014423076994717121, "clip_ratio/region_mean": 0.050200219731777906, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 213.0, "completions/mean_length": 309.75, "completions/mean_terminated_length": 188.40000915527344, "completions/min_length": 163.0, "completions/min_terminated_length": 163.0, "entropy": 0.8439691588282585, "epoch": 0.012318504788384307, "frac_reward_zero_std": 0.0, "grad_norm": 2.1287405490875244, "learning_rate": 9.036363636363638e-06, "loss": -0.1669, "num_tokens": 684570.0, "reward": 0.6160376071929932, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.14880475401878357, "reward_meter_mean": 0.6731476783752441, "reward_meter_std": 0.4353531301021576, "reward_std": 0.4165080487728119, "reward_total_composite_mean": 0.6160376071929932, "reward_total_composite_std": 0.4165080785751343, "reward_total_mean": 0.6160376071929932, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.14880475401878357, "rewards/meter/mean": 0.6731476783752441, "rewards/meter/std": 0.4353531301021576, "rewards/total_composite/mean": 0.6160376071929932, "rewards/total_composite/std": 0.4165080785751343, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0229874849319458, "sampling/importance_sampling_ratio/min": 0.23035407066345215, "sampling/sampling_logp_difference/max": 1.4681377410888672, "sampling/sampling_logp_difference/mean": 0.11113591492176056, "step": 319 }, { "clip_ratio/high_max": 0.09262609737925231, "clip_ratio/high_mean": 0.09262609737925231, "clip_ratio/low_mean": 0.04342320282012224, "clip_ratio/low_min": 0.04342320282012224, "clip_ratio/region_mean": 0.13604930019937456, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 65.75, "completions/mean_terminated_length": 65.75, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 1.4357076957821846, "epoch": 0.01235712079085573, "frac_reward_zero_std": 0.0, "grad_norm": 8.374490737915039, "learning_rate": 9.033333333333334e-06, "loss": -0.0737, "num_tokens": 686384.0, "reward": 0.7428368330001831, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7547735571861267, "reward_meter_std": 0.39120492339134216, "reward_std": 0.4117808938026428, "reward_total_composite_mean": 0.7428368330001831, "reward_total_composite_std": 0.4117808938026428, "reward_total_mean": 0.7428368330001831, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7547735571861267, "rewards/meter/std": 0.39120492339134216, "rewards/total_composite/mean": 0.7428368330001831, "rewards/total_composite/std": 0.4117808938026428, "sampling/importance_sampling_ratio/max": 1.9665664434432983, "sampling/importance_sampling_ratio/mean": 1.0321924686431885, "sampling/importance_sampling_ratio/min": 0.4012553095817566, "sampling/sampling_logp_difference/max": 0.9131574630737305, "sampling/sampling_logp_difference/mean": 0.11435320973396301, "step": 320 }, { "clip_ratio/high_max": 0.05931214243173599, "clip_ratio/high_mean": 0.05931214243173599, "clip_ratio/low_mean": 0.029992205556482077, "clip_ratio/low_min": 0.029992205556482077, "clip_ratio/region_mean": 0.08930434798821807, "completions/clipped_ratio": 0.0, "completions/max_length": 152.0, "completions/max_terminated_length": 152.0, "completions/mean_length": 146.875, "completions/mean_terminated_length": 146.875, "completions/min_length": 140.0, "completions/min_terminated_length": 140.0, "entropy": 1.4031646698713303, "epoch": 0.012395736793327155, "frac_reward_zero_std": 0.0, "grad_norm": 5.670385837554932, "learning_rate": 9.030303030303031e-06, "loss": 0.0131, "num_tokens": 688887.0, "reward": 0.8293708562850952, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8293708562850952, "reward_meter_std": 0.18216241896152496, "reward_std": 0.18216243386268616, "reward_total_composite_mean": 0.8293708562850952, "reward_total_composite_std": 0.18216241896152496, "reward_total_mean": 0.8293708562850952, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8293708562850952, "rewards/meter/std": 0.18216241896152496, "rewards/total_composite/mean": 0.8293708562850952, "rewards/total_composite/std": 0.18216241896152496, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.028894305229187, "sampling/importance_sampling_ratio/min": 0.16879475116729736, "sampling/sampling_logp_difference/max": 1.7790718078613281, "sampling/sampling_logp_difference/mean": 0.11904244869947433, "step": 321 }, { "clip_ratio/high_max": 0.10488645080476999, "clip_ratio/high_mean": 0.10488645080476999, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.10488645080476999, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 127.5, "completions/mean_terminated_length": 72.5714340209961, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 1.4858018308877945, "epoch": 0.012434352795798579, "frac_reward_zero_std": 0.0, "grad_norm": 1.3999040126800537, "learning_rate": 9.027272727272728e-06, "loss": -0.1778, "num_tokens": 690651.0, "reward": 0.8692903518676758, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.8722488880157471, "reward_meter_std": 0.34294039011001587, "reward_std": 0.3513069152832031, "reward_total_composite_mean": 0.8692903518676758, "reward_total_composite_std": 0.3513069450855255, "reward_total_mean": 0.8692903518676758, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.8722488880157471, "rewards/meter/std": 0.34294039011001587, "rewards/total_composite/mean": 0.8692903518676758, "rewards/total_composite/std": 0.3513069450855255, "sampling/importance_sampling_ratio/max": 1.8177605867385864, "sampling/importance_sampling_ratio/mean": 1.0229562520980835, "sampling/importance_sampling_ratio/min": 0.33121734857559204, "sampling/sampling_logp_difference/max": 1.10498046875, "sampling/sampling_logp_difference/mean": 0.1413571685552597, "step": 322 }, { "clip_ratio/high_max": 0.05869516870006919, "clip_ratio/high_mean": 0.05869516870006919, "clip_ratio/low_mean": 0.0364344846457243, "clip_ratio/low_min": 0.0364344846457243, "clip_ratio/region_mean": 0.09512965334579349, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 71.25, "completions/mean_terminated_length": 71.25, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 1.1599989607930183, "epoch": 0.012472968798270003, "frac_reward_zero_std": 0.0, "grad_norm": 8.688957214355469, "learning_rate": 9.024242424242426e-06, "loss": -0.0546, "num_tokens": 692669.0, "reward": 0.9870597720146179, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9870597720146179, "reward_meter_std": 0.012377563863992691, "reward_std": 0.012377569451928139, "reward_total_composite_mean": 0.9870597720146179, "reward_total_composite_std": 0.012377563863992691, "reward_total_mean": 0.9870597720146179, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9870597720146179, "rewards/meter/std": 0.012377563863992691, "rewards/total_composite/mean": 0.9870597720146179, "rewards/total_composite/std": 0.012377563863992691, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0185412168502808, "sampling/importance_sampling_ratio/min": 0.3850115239620209, "sampling/sampling_logp_difference/max": 0.9544820785522461, "sampling/sampling_logp_difference/mean": 0.11397970467805862, "step": 323 }, { "clip_ratio/high_max": 0.0074130878783762455, "clip_ratio/high_mean": 0.0074130878783762455, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0074130878783762455, "completions/clipped_ratio": 0.875, "completions/max_length": 512.0, "completions/max_terminated_length": 489.0, "completions/mean_length": 509.125, "completions/mean_terminated_length": 489.0, "completions/min_length": 489.0, "completions/min_terminated_length": 489.0, "entropy": 0.09911523014307022, "epoch": 0.012511584800741427, "frac_reward_zero_std": 0.0, "grad_norm": 0.7056026458740234, "learning_rate": 9.021212121212121e-06, "loss": -0.1171, "num_tokens": 694598.0, "reward": 0.33366143703460693, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_count_adherence_mean": 0.6180555820465088, "reward_count_adherence_std": 0.20452874898910522, "reward_meter_mean": 0.5128244161605835, "reward_meter_std": 0.40451905131340027, "reward_std": 0.3783239722251892, "reward_total_composite_mean": 0.33366143703460693, "reward_total_composite_std": 0.3783239722251892, "reward_total_mean": 0.33366143703460693, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/count_adherence/mean": 0.6180555820465088, "rewards/count_adherence/std": 0.20452874898910522, "rewards/meter/mean": 0.5128244161605835, "rewards/meter/std": 0.40451905131340027, "rewards/total_composite/mean": 0.33366143703460693, "rewards/total_composite/std": 0.3783239722251892, "sampling/importance_sampling_ratio/max": 1.636110782623291, "sampling/importance_sampling_ratio/mean": 1.012312650680542, "sampling/importance_sampling_ratio/min": 0.40183717012405396, "sampling/sampling_logp_difference/max": 0.9117083549499512, "sampling/sampling_logp_difference/mean": 0.07055795192718506, "step": 324 }, { "clip_ratio/high_max": 0.07463606260716915, "clip_ratio/high_mean": 0.07463606260716915, "clip_ratio/low_mean": 0.027904992923140526, "clip_ratio/low_min": 0.027904992923140526, "clip_ratio/region_mean": 0.10254105553030968, "completions/clipped_ratio": 0.0, "completions/max_length": 192.0, "completions/max_terminated_length": 192.0, "completions/mean_length": 173.875, "completions/mean_terminated_length": 173.875, "completions/min_length": 145.0, "completions/min_terminated_length": 145.0, "entropy": 1.7032774537801743, "epoch": 0.012550200803212851, "frac_reward_zero_std": 0.0, "grad_norm": 5.355256080627441, "learning_rate": 9.01818181818182e-06, "loss": -0.0167, "num_tokens": 697565.0, "reward": 0.7156921625137329, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_meter_mean": 0.7737569212913513, "reward_meter_std": 0.38154885172843933, "reward_std": 0.37208291888237, "reward_total_composite_mean": 0.7156921625137329, "reward_total_composite_std": 0.37208291888237, "reward_total_mean": 0.7156921625137329, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/meter/mean": 0.7737569212913513, "rewards/meter/std": 0.38154885172843933, "rewards/total_composite/mean": 0.7156921625137329, "rewards/total_composite/std": 0.37208291888237, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0292820930480957, "sampling/importance_sampling_ratio/min": 0.14826318621635437, "sampling/sampling_logp_difference/max": 1.908766269683838, "sampling/sampling_logp_difference/mean": 0.13555942475795746, "step": 325 }, { "clip_ratio/high_max": 0.019201413029804826, "clip_ratio/high_mean": 0.019201413029804826, "clip_ratio/low_mean": 0.00886194035410881, "clip_ratio/low_min": 0.00886194035410881, "clip_ratio/region_mean": 0.028063353383913636, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 361.0, "completions/mean_length": 340.375, "completions/mean_terminated_length": 283.16668701171875, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "entropy": 0.34993776120245457, "epoch": 0.012588816805684275, "frac_reward_zero_std": 0.0, "grad_norm": 0.9641727209091187, "learning_rate": 9.015151515151516e-06, "loss": -0.3057, "num_tokens": 700832.0, "reward": 0.642575740814209, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.2531938850879669, "reward_meter_mean": 0.9441099166870117, "reward_meter_std": 0.12238472700119019, "reward_std": 0.2958056628704071, "reward_total_composite_mean": 0.642575740814209, "reward_total_composite_std": 0.2958056926727295, "reward_total_mean": 0.642575740814209, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.2531938850879669, "rewards/meter/mean": 0.9441099166870117, "rewards/meter/std": 0.12238472700119019, "rewards/total_composite/mean": 0.642575740814209, "rewards/total_composite/std": 0.2958056926727295, "sampling/importance_sampling_ratio/max": 1.7436391115188599, "sampling/importance_sampling_ratio/mean": 1.008855938911438, "sampling/importance_sampling_ratio/min": 0.35944268107414246, "sampling/sampling_logp_difference/max": 1.0232006311416626, "sampling/sampling_logp_difference/mean": 0.04643620178103447, "step": 326 }, { "clip_ratio/high_max": 0.03814008738845587, "clip_ratio/high_mean": 0.03814008738845587, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.03814008738845587, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 311.0, "completions/mean_length": 309.625, "completions/mean_terminated_length": 280.71429443359375, "completions/min_length": 256.0, "completions/min_terminated_length": 256.0, "entropy": 0.48327015712857246, "epoch": 0.0126274328081557, "frac_reward_zero_std": 0.0, "grad_norm": 0.8649334907531738, "learning_rate": 9.012121212121213e-06, "loss": -0.2768, "num_tokens": 704333.0, "reward": 0.7233796119689941, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7361111640930176, "reward_count_adherence_std": 0.25845491886138916, "reward_meter_mean": 0.9838745594024658, "reward_meter_std": 0.026461318135261536, "reward_std": 0.252864271402359, "reward_total_composite_mean": 0.7233796119689941, "reward_total_composite_std": 0.2528642416000366, "reward_total_mean": 0.7233796119689941, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7361111640930176, "rewards/count_adherence/std": 0.25845491886138916, "rewards/meter/mean": 0.9838745594024658, "rewards/meter/std": 0.026461318135261536, "rewards/total_composite/mean": 0.7233796119689941, "rewards/total_composite/std": 0.2528642416000366, "sampling/importance_sampling_ratio/max": 1.7859697341918945, "sampling/importance_sampling_ratio/mean": 1.010648488998413, "sampling/importance_sampling_ratio/min": 0.17294643819332123, "sampling/sampling_logp_difference/max": 1.7547733783721924, "sampling/sampling_logp_difference/mean": 0.05245785042643547, "step": 327 }, { "clip_ratio/high_max": 0.11218475922942162, "clip_ratio/high_mean": 0.11218475922942162, "clip_ratio/low_mean": 0.05930484738200903, "clip_ratio/low_min": 0.05930484738200903, "clip_ratio/region_mean": 0.17148960661143064, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 34.125, "completions/mean_terminated_length": 34.125, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 1.6025570929050446, "epoch": 0.012666048810627124, "frac_reward_zero_std": 0.0, "grad_norm": 11.575224876403809, "learning_rate": 9.00909090909091e-06, "loss": 0.0311, "num_tokens": 705878.0, "reward": 0.7254409790039062, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7254409790039062, "reward_meter_std": 0.31982889771461487, "reward_std": 0.31982889771461487, "reward_total_composite_mean": 0.7254409790039062, "reward_total_composite_std": 0.31982889771461487, "reward_total_mean": 0.7254409790039062, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7254409790039062, "rewards/meter/std": 0.31982889771461487, "rewards/total_composite/mean": 0.7254409790039062, "rewards/total_composite/std": 0.31982889771461487, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0245475769042969, "sampling/importance_sampling_ratio/min": 0.2002735137939453, "sampling/sampling_logp_difference/max": 1.6080713272094727, "sampling/sampling_logp_difference/mean": 0.16250382363796234, "step": 328 }, { "clip_ratio/high_max": 0.07188303023576736, "clip_ratio/high_mean": 0.07188303023576736, "clip_ratio/low_mean": 0.024105392396450043, "clip_ratio/low_min": 0.024105392396450043, "clip_ratio/region_mean": 0.09598842263221741, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 154.0, "completions/mean_length": 193.125, "completions/mean_terminated_length": 147.57144165039062, "completions/min_length": 136.0, "completions/min_terminated_length": 136.0, "entropy": 1.2332377284765244, "epoch": 0.012704664813098548, "frac_reward_zero_std": 0.0, "grad_norm": 4.62138032913208, "learning_rate": 9.006060606060607e-06, "loss": 0.0049, "num_tokens": 708351.0, "reward": 0.7189717292785645, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.7495023012161255, "reward_meter_std": 0.3558323085308075, "reward_std": 0.3438011407852173, "reward_total_composite_mean": 0.7189717292785645, "reward_total_composite_std": 0.3438011407852173, "reward_total_mean": 0.7189717292785645, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.7495023012161255, "rewards/meter/std": 0.3558323085308075, "rewards/total_composite/mean": 0.7189717292785645, "rewards/total_composite/std": 0.3438011407852173, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0160291194915771, "sampling/importance_sampling_ratio/min": 0.3046167492866516, "sampling/sampling_logp_difference/max": 1.1887009143829346, "sampling/sampling_logp_difference/mean": 0.12337387353181839, "step": 329 }, { "clip_ratio/high_max": 0.10720423050224781, "clip_ratio/high_mean": 0.10720423050224781, "clip_ratio/low_mean": 0.025510204955935478, "clip_ratio/low_min": 0.025510204955935478, "clip_ratio/region_mean": 0.1327144354581833, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 113.25, "completions/mean_terminated_length": 56.28571701049805, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 1.7517335712909698, "epoch": 0.012743280815569972, "frac_reward_zero_std": 0.0, "grad_norm": 2.0594024658203125, "learning_rate": 9.003030303030303e-06, "loss": -0.155, "num_tokens": 709897.0, "reward": 0.8302444815635681, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8331777453422546, "reward_meter_std": 0.3333028256893158, "reward_std": 0.34145045280456543, "reward_total_composite_mean": 0.8302444815635681, "reward_total_composite_std": 0.34145042300224304, "reward_total_mean": 0.8302444815635681, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8331777453422546, "rewards/meter/std": 0.3333028256893158, "rewards/total_composite/mean": 0.8302444815635681, "rewards/total_composite/std": 0.34145042300224304, "sampling/importance_sampling_ratio/max": 1.7736172676086426, "sampling/importance_sampling_ratio/mean": 1.0383025407791138, "sampling/importance_sampling_ratio/min": 0.07492611557245255, "sampling/sampling_logp_difference/max": 2.5912528038024902, "sampling/sampling_logp_difference/mean": 0.1602991372346878, "step": 330 }, { "clip_ratio/high_max": 0.06826505670323968, "clip_ratio/high_mean": 0.06826505670323968, "clip_ratio/low_mean": 0.03799927420914173, "clip_ratio/low_min": 0.03799927420914173, "clip_ratio/region_mean": 0.10626433091238141, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 72.375, "completions/mean_terminated_length": 72.375, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.6253799833357334, "epoch": 0.012781896818041396, "frac_reward_zero_std": 0.0, "grad_norm": 19.114912033081055, "learning_rate": 9e-06, "loss": 0.1271, "num_tokens": 712092.0, "reward": 0.665668785572052, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.7024174928665161, "reward_meter_std": 0.4215409457683563, "reward_std": 0.41643577814102173, "reward_total_composite_mean": 0.665668785572052, "reward_total_composite_std": 0.41643577814102173, "reward_total_mean": 0.665668785572052, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.7024174928665161, "rewards/meter/std": 0.4215409457683563, "rewards/total_composite/mean": 0.665668785572052, "rewards/total_composite/std": 0.41643577814102173, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9930925965309143, "sampling/importance_sampling_ratio/min": 0.15829293429851532, "sampling/sampling_logp_difference/max": 1.8433079719543457, "sampling/sampling_logp_difference/mean": 0.12084802985191345, "step": 331 }, { "clip_ratio/high_max": 0.05861414410173893, "clip_ratio/high_mean": 0.05861414410173893, "clip_ratio/low_mean": 0.11972531583160162, "clip_ratio/low_min": 0.11972531583160162, "clip_ratio/region_mean": 0.17833945993334055, "completions/clipped_ratio": 0.0, "completions/max_length": 49.0, "completions/max_terminated_length": 49.0, "completions/mean_length": 40.375, "completions/mean_terminated_length": 40.375, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 1.166979692876339, "epoch": 0.01282051282051282, "frac_reward_zero_std": 0.0, "grad_norm": 17.004131317138672, "learning_rate": 8.996969696969697e-06, "loss": -0.0274, "num_tokens": 713551.0, "reward": 0.4543929100036621, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4543929100036621, "reward_meter_std": 0.32974186539649963, "reward_std": 0.32974183559417725, "reward_total_composite_mean": 0.4543929100036621, "reward_total_composite_std": 0.32974186539649963, "reward_total_mean": 0.4543929100036621, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4543929100036621, "rewards/meter/std": 0.32974186539649963, "rewards/total_composite/mean": 0.4543929100036621, "rewards/total_composite/std": 0.32974186539649963, "sampling/importance_sampling_ratio/max": 1.9088724851608276, "sampling/importance_sampling_ratio/mean": 1.0065240859985352, "sampling/importance_sampling_ratio/min": 0.05844109505414963, "sampling/sampling_logp_difference/max": 2.839735984802246, "sampling/sampling_logp_difference/mean": 0.1603153944015503, "step": 332 }, { "clip_ratio/high_max": 0.04428324103355408, "clip_ratio/high_mean": 0.04428324103355408, "clip_ratio/low_mean": 0.024796965066343546, "clip_ratio/low_min": 0.024796965066343546, "clip_ratio/region_mean": 0.06908020609989762, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 87.625, "completions/mean_terminated_length": 87.625, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.8614702522754669, "epoch": 0.012859128822984244, "frac_reward_zero_std": 0.0, "grad_norm": 5.926055908203125, "learning_rate": 8.993939393939395e-06, "loss": 0.0326, "num_tokens": 715540.0, "reward": 0.8005719184875488, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8005719184875488, "reward_meter_std": 0.2811793088912964, "reward_std": 0.2811793386936188, "reward_total_composite_mean": 0.8005719184875488, "reward_total_composite_std": 0.2811793088912964, "reward_total_mean": 0.8005719184875488, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8005719184875488, "rewards/meter/std": 0.2811793088912964, "rewards/total_composite/mean": 0.8005719184875488, "rewards/total_composite/std": 0.2811793088912964, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.023775577545166, "sampling/importance_sampling_ratio/min": 0.12364701926708221, "sampling/sampling_logp_difference/max": 2.0903244018554688, "sampling/sampling_logp_difference/mean": 0.093291737139225, "step": 333 }, { "clip_ratio/high_max": 0.13734323251992464, "clip_ratio/high_mean": 0.13734323251992464, "clip_ratio/low_mean": 0.015625, "clip_ratio/low_min": 0.015625, "clip_ratio/region_mean": 0.15296823251992464, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 38.25, "completions/mean_terminated_length": 38.25, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 1.5458678156137466, "epoch": 0.012897744825455668, "frac_reward_zero_std": 0.0, "grad_norm": 14.146446228027344, "learning_rate": 8.990909090909092e-06, "loss": 0.0292, "num_tokens": 717022.0, "reward": 0.9717813730239868, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9717813730239868, "reward_meter_std": 0.05659351125359535, "reward_std": 0.05659349635243416, "reward_total_composite_mean": 0.9717813730239868, "reward_total_composite_std": 0.05659351125359535, "reward_total_mean": 0.9717813730239868, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9717813730239868, "rewards/meter/std": 0.05659351125359535, "rewards/total_composite/mean": 0.9717813730239868, "rewards/total_composite/std": 0.05659351125359535, "sampling/importance_sampling_ratio/max": 1.9646681547164917, "sampling/importance_sampling_ratio/mean": 1.0397027730941772, "sampling/importance_sampling_ratio/min": 0.33652088046073914, "sampling/sampling_logp_difference/max": 1.089095115661621, "sampling/sampling_logp_difference/mean": 0.1425103396177292, "step": 334 }, { "clip_ratio/high_max": 0.10228652320802212, "clip_ratio/high_mean": 0.10228652320802212, "clip_ratio/low_mean": 0.01715686358511448, "clip_ratio/low_min": 0.01715686358511448, "clip_ratio/region_mean": 0.1194433867931366, "completions/clipped_ratio": 0.0, "completions/max_length": 74.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 63.25, "completions/mean_terminated_length": 63.25, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 1.2129319533705711, "epoch": 0.012936360827927092, "frac_reward_zero_std": 0.0, "grad_norm": 7.787652969360352, "learning_rate": 8.98787878787879e-06, "loss": -0.0594, "num_tokens": 718816.0, "reward": 0.8696156740188599, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8696156740188599, "reward_meter_std": 0.31520524621009827, "reward_std": 0.31520524621009827, "reward_total_composite_mean": 0.8696156740188599, "reward_total_composite_std": 0.31520524621009827, "reward_total_mean": 0.8696156740188599, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8696156740188599, "rewards/meter/std": 0.31520524621009827, "rewards/total_composite/mean": 0.8696156740188599, "rewards/total_composite/std": 0.31520524621009827, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0193424224853516, "sampling/importance_sampling_ratio/min": 0.32608509063720703, "sampling/sampling_logp_difference/max": 1.1205968856811523, "sampling/sampling_logp_difference/mean": 0.13351094722747803, "step": 335 }, { "clip_ratio/high_max": 0.04853037279099226, "clip_ratio/high_mean": 0.04853037279099226, "clip_ratio/low_mean": 0.027916074730455875, "clip_ratio/low_min": 0.027916074730455875, "clip_ratio/region_mean": 0.07644644752144814, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 67.75, "completions/mean_terminated_length": 67.75, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7481025010347366, "epoch": 0.012974976830398516, "frac_reward_zero_std": 0.0, "grad_norm": 7.147242069244385, "learning_rate": 8.984848484848485e-06, "loss": 0.0228, "num_tokens": 720702.0, "reward": 0.9919648766517639, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9919648766517639, "reward_meter_std": 0.00817751046270132, "reward_std": 0.008177503012120724, "reward_total_composite_mean": 0.9919648766517639, "reward_total_composite_std": 0.00817751046270132, "reward_total_mean": 0.9919648766517639, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9919648766517639, "rewards/meter/std": 0.00817751046270132, "rewards/total_composite/mean": 0.9919648766517639, "rewards/total_composite/std": 0.00817751046270132, "sampling/importance_sampling_ratio/max": 1.912467360496521, "sampling/importance_sampling_ratio/mean": 1.0083116292953491, "sampling/importance_sampling_ratio/min": 0.08475096523761749, "sampling/sampling_logp_difference/max": 2.4680380821228027, "sampling/sampling_logp_difference/mean": 0.10161230713129044, "step": 336 }, { "clip_ratio/high_max": 0.07585466234013438, "clip_ratio/high_mean": 0.07585466234013438, "clip_ratio/low_mean": 0.007352941203862429, "clip_ratio/low_min": 0.007352941203862429, "clip_ratio/region_mean": 0.08320760354399681, "completions/clipped_ratio": 0.0, "completions/max_length": 170.0, "completions/max_terminated_length": 170.0, "completions/mean_length": 85.0, "completions/mean_terminated_length": 85.0, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.6667735129594803, "epoch": 0.01301359283286994, "frac_reward_zero_std": 0.0, "grad_norm": 6.292624473571777, "learning_rate": 8.981818181818182e-06, "loss": 0.3588, "num_tokens": 722606.0, "reward": 0.8667486310005188, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.9909840822219849, "reward_meter_std": 0.0034961404744535685, "reward_std": 0.35023483633995056, "reward_total_composite_mean": 0.8667486310005188, "reward_total_composite_std": 0.35023483633995056, "reward_total_mean": 0.8667486310005188, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.9909840822219849, "rewards/meter/std": 0.0034961404744535685, "rewards/total_composite/mean": 0.8667486310005188, "rewards/total_composite/std": 0.35023483633995056, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.014748454093933, "sampling/importance_sampling_ratio/min": 0.18162985146045685, "sampling/sampling_logp_difference/max": 1.7057844400405884, "sampling/sampling_logp_difference/mean": 0.07967483252286911, "step": 337 }, { "clip_ratio/high_max": 0.02921690931543708, "clip_ratio/high_mean": 0.02921690931543708, "clip_ratio/low_mean": 0.027584444032981992, "clip_ratio/low_min": 0.027584444032981992, "clip_ratio/region_mean": 0.05680135334841907, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 94.125, "completions/mean_terminated_length": 94.125, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 0.38130839727818966, "epoch": 0.013052208835341365, "frac_reward_zero_std": 0.0, "grad_norm": 6.0476861000061035, "learning_rate": 8.97878787878788e-06, "loss": 0.0094, "num_tokens": 724687.0, "reward": 0.7916698455810547, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7916698455810547, "reward_meter_std": 0.20429320633411407, "reward_std": 0.2042931765317917, "reward_total_composite_mean": 0.7916698455810547, "reward_total_composite_std": 0.20429320633411407, "reward_total_mean": 0.7916698455810547, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7916698455810547, "rewards/meter/std": 0.20429320633411407, "rewards/total_composite/mean": 0.7916698455810547, "rewards/total_composite/std": 0.20429320633411407, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0018184185028076, "sampling/importance_sampling_ratio/min": 0.2368934005498886, "sampling/sampling_logp_difference/max": 1.4401450157165527, "sampling/sampling_logp_difference/mean": 0.051787663251161575, "step": 338 }, { "clip_ratio/high_max": 0.06074862740933895, "clip_ratio/high_mean": 0.06074862740933895, "clip_ratio/low_mean": 0.0517513370141387, "clip_ratio/low_min": 0.0517513370141387, "clip_ratio/region_mean": 0.11249996442347765, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 25.5, "completions/mean_terminated_length": 25.5, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 0.8039275705814362, "epoch": 0.013090824837812789, "frac_reward_zero_std": 0.0, "grad_norm": 32.10745620727539, "learning_rate": 8.975757575757577e-06, "loss": 0.1049, "num_tokens": 726091.0, "reward": 0.45373764634132385, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45373764634132385, "reward_meter_std": 0.3389832377433777, "reward_std": 0.3389832377433777, "reward_total_composite_mean": 0.45373764634132385, "reward_total_composite_std": 0.3389832377433777, "reward_total_mean": 0.45373764634132385, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45373764634132385, "rewards/meter/std": 0.3389832377433777, "rewards/total_composite/mean": 0.45373764634132385, "rewards/total_composite/std": 0.3389832377433777, "sampling/importance_sampling_ratio/max": 1.9982775449752808, "sampling/importance_sampling_ratio/mean": 0.9738427400588989, "sampling/importance_sampling_ratio/min": 0.186411514878273, "sampling/sampling_logp_difference/max": 1.6797986030578613, "sampling/sampling_logp_difference/mean": 0.163490429520607, "step": 339 }, { "clip_ratio/high_max": 0.05819632112979889, "clip_ratio/high_mean": 0.05819632112979889, "clip_ratio/low_mean": 0.03718182072043419, "clip_ratio/low_min": 0.03718182072043419, "clip_ratio/region_mean": 0.09537814185023308, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 181.0, "completions/mean_length": 206.875, "completions/mean_terminated_length": 163.2857208251953, "completions/min_length": 148.0, "completions/min_terminated_length": 148.0, "entropy": 0.5428336411714554, "epoch": 0.013129440840284215, "frac_reward_zero_std": 0.0, "grad_norm": 4.418445110321045, "learning_rate": 8.972727272727272e-06, "loss": -0.0956, "num_tokens": 728882.0, "reward": 0.39793068170547485, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8392857313156128, "reward_count_adherence_std": 0.3452087938785553, "reward_meter_mean": 0.4240845739841461, "reward_meter_std": 0.30786141753196716, "reward_std": 0.29285892844200134, "reward_total_composite_mean": 0.39793068170547485, "reward_total_composite_std": 0.29285889863967896, "reward_total_mean": 0.39793068170547485, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8392857313156128, "rewards/count_adherence/std": 0.3452087938785553, "rewards/meter/mean": 0.4240845739841461, "rewards/meter/std": 0.30786141753196716, "rewards/total_composite/mean": 0.39793068170547485, "rewards/total_composite/std": 0.29285889863967896, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0121982097625732, "sampling/importance_sampling_ratio/min": 0.04704439640045166, "sampling/sampling_logp_difference/max": 3.0566635131835938, "sampling/sampling_logp_difference/mean": 0.10585647076368332, "step": 340 }, { "clip_ratio/high_max": 0.11759159062057734, "clip_ratio/high_mean": 0.11759159062057734, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.11759159062057734, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 54.5, "completions/mean_terminated_length": 54.5, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 1.2029671669006348, "epoch": 0.013168056842755639, "frac_reward_zero_std": 0.0, "grad_norm": 7.589391708374023, "learning_rate": 8.969696969696971e-06, "loss": -0.1819, "num_tokens": 730886.0, "reward": 0.9168034195899963, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9767169952392578, "reward_meter_std": 0.013271527364850044, "reward_std": 0.17712122201919556, "reward_total_composite_mean": 0.9168034195899963, "reward_total_composite_std": 0.17712123692035675, "reward_total_mean": 0.9168034195899963, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9767169952392578, "rewards/meter/std": 0.013271527364850044, "rewards/total_composite/mean": 0.9168034195899963, "rewards/total_composite/std": 0.17712123692035675, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.022121787071228, "sampling/importance_sampling_ratio/min": 0.33108022809028625, "sampling/sampling_logp_difference/max": 1.1053946018218994, "sampling/sampling_logp_difference/mean": 0.12854255735874176, "step": 341 }, { "clip_ratio/high_max": 0.08128050155937672, "clip_ratio/high_mean": 0.08128050155937672, "clip_ratio/low_mean": 0.021226415410637856, "clip_ratio/low_min": 0.021226415410637856, "clip_ratio/region_mean": 0.10250691697001457, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 146.5, "completions/mean_terminated_length": 94.28572082519531, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 1.2604146748781204, "epoch": 0.013206672845227063, "frac_reward_zero_std": 0.0, "grad_norm": 4.1543121337890625, "learning_rate": 8.966666666666667e-06, "loss": -0.1304, "num_tokens": 733050.0, "reward": 0.7020714282989502, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7078612446784973, "reward_meter_std": 0.3426123261451721, "reward_std": 0.3555365204811096, "reward_total_composite_mean": 0.7020714282989502, "reward_total_composite_std": 0.3555365204811096, "reward_total_mean": 0.7020714282989502, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7078612446784973, "rewards/meter/std": 0.3426123261451721, "rewards/total_composite/mean": 0.7020714282989502, "rewards/total_composite/std": 0.3555365204811096, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.020814299583435, "sampling/importance_sampling_ratio/min": 0.20932936668395996, "sampling/sampling_logp_difference/max": 1.5638463497161865, "sampling/sampling_logp_difference/mean": 0.15139326453208923, "step": 342 }, { "clip_ratio/high_max": 0.02198702801251784, "clip_ratio/high_mean": 0.02198702801251784, "clip_ratio/low_mean": 0.007872846443206072, "clip_ratio/low_min": 0.007872846443206072, "clip_ratio/region_mean": 0.02985987445572391, "completions/clipped_ratio": 0.0, "completions/max_length": 162.0, "completions/max_terminated_length": 162.0, "completions/mean_length": 136.75, "completions/mean_terminated_length": 136.75, "completions/min_length": 115.0, "completions/min_terminated_length": 115.0, "entropy": 0.2882226835936308, "epoch": 0.013245288847698487, "frac_reward_zero_std": 0.0, "grad_norm": 6.76770544052124, "learning_rate": 8.963636363636364e-06, "loss": -0.0077, "num_tokens": 735640.0, "reward": 0.7804628610610962, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_meter_mean": 0.866592288017273, "reward_meter_std": 0.23036333918571472, "reward_std": 0.22920989990234375, "reward_total_composite_mean": 0.7804628610610962, "reward_total_composite_std": 0.22920989990234375, "reward_total_mean": 0.7804628610610962, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/meter/mean": 0.866592288017273, "rewards/meter/std": 0.23036333918571472, "rewards/total_composite/mean": 0.7804628610610962, "rewards/total_composite/std": 0.22920989990234375, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0099705457687378, "sampling/importance_sampling_ratio/min": 0.0917281061410904, "sampling/sampling_logp_difference/max": 2.3889265060424805, "sampling/sampling_logp_difference/mean": 0.04342114180326462, "step": 343 }, { "clip_ratio/high_max": 0.001968626049347222, "clip_ratio/high_mean": 0.001968626049347222, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.001968626049347222, "completions/clipped_ratio": 0.75, "completions/max_length": 512.0, "completions/max_terminated_length": 512.0, "completions/mean_length": 511.0, "completions/mean_terminated_length": 508.0, "completions/min_length": 504.0, "completions/min_terminated_length": 504.0, "entropy": 0.015514392405748367, "epoch": 0.013283904850169911, "frac_reward_zero_std": 0.0, "grad_norm": 0.3268384635448456, "learning_rate": 8.960606060606061e-06, "loss": -0.1251, "num_tokens": 738392.0, "reward": 0.6975077390670776, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.736842155456543, "reward_count_adherence_std": 0.06891091912984848, "reward_meter_mean": 0.9466683864593506, "reward_meter_std": 0.14325150847434998, "reward_std": 0.12571200728416443, "reward_total_composite_mean": 0.6975077390670776, "reward_total_composite_std": 0.12571200728416443, "reward_total_mean": 0.6975077390670776, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.736842155456543, "rewards/count_adherence/std": 0.06891091912984848, "rewards/meter/mean": 0.9466683864593506, "rewards/meter/std": 0.14325150847434998, "rewards/total_composite/mean": 0.6975077390670776, "rewards/total_composite/std": 0.12571200728416443, "sampling/importance_sampling_ratio/max": 1.704252004623413, "sampling/importance_sampling_ratio/mean": 1.0004547834396362, "sampling/importance_sampling_ratio/min": 0.46806204319000244, "sampling/sampling_logp_difference/max": 0.7591544389724731, "sampling/sampling_logp_difference/mean": 0.007342774420976639, "step": 344 }, { "clip_ratio/high_max": 0.049760105554014444, "clip_ratio/high_mean": 0.049760105554014444, "clip_ratio/low_mean": 0.02456349227577448, "clip_ratio/low_min": 0.02456349227577448, "clip_ratio/region_mean": 0.07432359782978892, "completions/clipped_ratio": 0.0, "completions/max_length": 151.0, "completions/max_terminated_length": 151.0, "completions/mean_length": 135.625, "completions/mean_terminated_length": 135.625, "completions/min_length": 124.0, "completions/min_terminated_length": 124.0, "entropy": 0.7220766767859459, "epoch": 0.013322520852641335, "frac_reward_zero_std": 0.0, "grad_norm": 7.332951068878174, "learning_rate": 8.957575757575758e-06, "loss": 0.0533, "num_tokens": 740877.0, "reward": 0.8432111740112305, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8432111740112305, "reward_meter_std": 0.3098846971988678, "reward_std": 0.3098846971988678, "reward_total_composite_mean": 0.8432111740112305, "reward_total_composite_std": 0.3098846971988678, "reward_total_mean": 0.8432111740112305, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8432111740112305, "rewards/meter/std": 0.3098846971988678, "rewards/total_composite/mean": 0.8432111740112305, "rewards/total_composite/std": 0.3098846971988678, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0232460498809814, "sampling/importance_sampling_ratio/min": 0.20046362280845642, "sampling/sampling_logp_difference/max": 1.6071224212646484, "sampling/sampling_logp_difference/mean": 0.09029541909694672, "step": 345 }, { "clip_ratio/high_max": 0.060007378458976746, "clip_ratio/high_mean": 0.060007378458976746, "clip_ratio/low_mean": 0.025923453271389008, "clip_ratio/low_min": 0.025923453271389008, "clip_ratio/region_mean": 0.08593083173036575, "completions/clipped_ratio": 0.0, "completions/max_length": 175.0, "completions/max_terminated_length": 175.0, "completions/mean_length": 136.25, "completions/mean_terminated_length": 136.25, "completions/min_length": 107.0, "completions/min_terminated_length": 107.0, "entropy": 0.7361192889511585, "epoch": 0.01336113685511276, "frac_reward_zero_std": 0.0, "grad_norm": 6.021731853485107, "learning_rate": 8.954545454545456e-06, "loss": -0.0646, "num_tokens": 743391.0, "reward": 0.8351510763168335, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.8487316966056824, "reward_meter_std": 0.22170411050319672, "reward_std": 0.2519603669643402, "reward_total_composite_mean": 0.8351510763168335, "reward_total_composite_std": 0.2519603967666626, "reward_total_mean": 0.8351510763168335, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.8487316966056824, "rewards/meter/std": 0.22170411050319672, "rewards/total_composite/mean": 0.8351510763168335, "rewards/total_composite/std": 0.2519603967666626, "sampling/importance_sampling_ratio/max": 1.87782621383667, "sampling/importance_sampling_ratio/mean": 1.0095629692077637, "sampling/importance_sampling_ratio/min": 0.2516863942146301, "sampling/sampling_logp_difference/max": 1.3795714378356934, "sampling/sampling_logp_difference/mean": 0.08980220556259155, "step": 346 }, { "clip_ratio/high_max": 0.0906870374456048, "clip_ratio/high_mean": 0.0906870374456048, "clip_ratio/low_mean": 0.008223684504628181, "clip_ratio/low_min": 0.008223684504628181, "clip_ratio/region_mean": 0.09891072195023298, "completions/clipped_ratio": 0.0, "completions/max_length": 152.0, "completions/max_terminated_length": 152.0, "completions/mean_length": 84.0, "completions/mean_terminated_length": 84.0, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 1.0877859592437744, "epoch": 0.013399752857584183, "frac_reward_zero_std": 0.0, "grad_norm": 10.403669357299805, "learning_rate": 8.951515151515153e-06, "loss": 0.3161, "num_tokens": 745255.0, "reward": 0.8664380311965942, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.9903609752655029, "reward_meter_std": 0.0039792293682694435, "reward_std": 0.35011619329452515, "reward_total_composite_mean": 0.8664380311965942, "reward_total_composite_std": 0.35011622309684753, "reward_total_mean": 0.8664380311965942, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.9903609752655029, "rewards/meter/std": 0.0039792293682694435, "rewards/total_composite/mean": 0.8664380311965942, "rewards/total_composite/std": 0.35011622309684753, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0305798053741455, "sampling/importance_sampling_ratio/min": 0.31438201665878296, "sampling/sampling_logp_difference/max": 1.1571464538574219, "sampling/sampling_logp_difference/mean": 0.09673066437244415, "step": 347 }, { "clip_ratio/high_max": 0.035924003925174475, "clip_ratio/high_mean": 0.035924003925174475, "clip_ratio/low_mean": 0.011363636702299118, "clip_ratio/low_min": 0.011363636702299118, "clip_ratio/region_mean": 0.04728764062747359, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 261.0, "completions/mean_length": 268.5, "completions/mean_terminated_length": 233.71429443359375, "completions/min_length": 220.0, "completions/min_terminated_length": 220.0, "entropy": 0.3383890204131603, "epoch": 0.013438368860055607, "frac_reward_zero_std": 0.0, "grad_norm": 1.5081286430358887, "learning_rate": 8.94848484848485e-06, "loss": -0.2579, "num_tokens": 748739.0, "reward": 0.7942942976951599, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.24147263169288635, "reward_meter_mean": 0.8488904237747192, "reward_meter_std": 0.3285263478755951, "reward_std": 0.33547642827033997, "reward_total_composite_mean": 0.7942942976951599, "reward_total_composite_std": 0.33547642827033997, "reward_total_mean": 0.7942942976951599, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.24147263169288635, "rewards/meter/mean": 0.8488904237747192, "rewards/meter/std": 0.3285263478755951, "rewards/total_composite/mean": 0.7942942976951599, "rewards/total_composite/std": 0.33547642827033997, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0065252780914307, "sampling/importance_sampling_ratio/min": 0.0667203888297081, "sampling/sampling_logp_difference/max": 2.707244634628296, "sampling/sampling_logp_difference/mean": 0.05050771310925484, "step": 348 }, { "clip_ratio/high_max": 0.07814110023900867, "clip_ratio/high_mean": 0.07814110023900867, "clip_ratio/low_mean": 0.025058357510715723, "clip_ratio/low_min": 0.025058357510715723, "clip_ratio/region_mean": 0.10319945774972439, "completions/clipped_ratio": 0.0, "completions/max_length": 153.0, "completions/max_terminated_length": 153.0, "completions/mean_length": 125.25, "completions/mean_terminated_length": 125.25, "completions/min_length": 94.0, "completions/min_terminated_length": 94.0, "entropy": 0.955632783472538, "epoch": 0.013476984862527032, "frac_reward_zero_std": 0.0, "grad_norm": 6.383397102355957, "learning_rate": 8.945454545454546e-06, "loss": 0.0873, "num_tokens": 751125.0, "reward": 0.974650502204895, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.974650502204895, "reward_meter_std": 0.015549466013908386, "reward_std": 0.01554945856332779, "reward_total_composite_mean": 0.974650502204895, "reward_total_composite_std": 0.015549466013908386, "reward_total_mean": 0.974650502204895, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.974650502204895, "rewards/meter/std": 0.015549466013908386, "rewards/total_composite/mean": 0.974650502204895, "rewards/total_composite/std": 0.015549466013908386, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.01600182056427, "sampling/importance_sampling_ratio/min": 0.2371901124715805, "sampling/sampling_logp_difference/max": 1.4388933181762695, "sampling/sampling_logp_difference/mean": 0.1007874459028244, "step": 349 }, { "clip_ratio/high_max": 0.07839446794241667, "clip_ratio/high_mean": 0.07839446794241667, "clip_ratio/low_mean": 0.044384559616446495, "clip_ratio/low_min": 0.044384559616446495, "clip_ratio/region_mean": 0.12277902755886316, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 35.875, "completions/mean_terminated_length": 35.875, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 1.2592712044715881, "epoch": 0.013515600864998456, "frac_reward_zero_std": 0.0, "grad_norm": 14.133708953857422, "learning_rate": 8.942424242424243e-06, "loss": -0.018, "num_tokens": 752644.0, "reward": 0.690624475479126, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.690624475479126, "reward_meter_std": 0.37756747007369995, "reward_std": 0.37756747007369995, "reward_total_composite_mean": 0.690624475479126, "reward_total_composite_std": 0.37756747007369995, "reward_total_mean": 0.690624475479126, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.690624475479126, "rewards/meter/std": 0.37756747007369995, "rewards/total_composite/mean": 0.690624475479126, "rewards/total_composite/std": 0.37756747007369995, "sampling/importance_sampling_ratio/max": 1.7945036888122559, "sampling/importance_sampling_ratio/mean": 1.0118988752365112, "sampling/importance_sampling_ratio/min": 0.24649037420749664, "sampling/sampling_logp_difference/max": 1.4004323482513428, "sampling/sampling_logp_difference/mean": 0.1355486959218979, "step": 350 }, { "epoch": 0.013515600864998456, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.038461538461538464, "eval_completions/max_length": 442.84615384615387, "eval_completions/max_terminated_length": 400.0, "eval_completions/mean_length": 212.46153846153845, "eval_completions/mean_terminated_length": 200.26236431415265, "eval_completions/min_length": 56.0, "eval_completions/min_terminated_length": 56.0, "eval_entropy": 0.43929139238137466, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 752644.0, "eval_reward": 0.6290297783338107, "eval_reward_arabic_clean_mean": 0.9903846153846154, "eval_reward_arabic_clean_std": 0.027196414195574246, "eval_reward_count_adherence_mean": 0.8791503814550546, "eval_reward_count_adherence_std": 0.17575800361541602, "eval_reward_meter_mean": 0.7184457114109626, "eval_reward_meter_std": 0.3159666336499728, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.6290297783338107, "eval_reward_total_composite_std": 0.31780216900201946, "eval_reward_total_mean": 0.6290297783338107, "eval_rewards/arabic_clean/mean": 0.9903846153846154, "eval_rewards/arabic_clean/std": 0.027196414195574246, "eval_rewards/count_adherence/mean": 0.8791503814550546, "eval_rewards/count_adherence/std": 0.17575800361541602, "eval_rewards/meter/mean": 0.7184457114109626, "eval_rewards/meter/std": 0.3159666336499728, "eval_rewards/total_composite/mean": 0.6290297783338107, "eval_rewards/total_composite/std": 0.31780216900201946, "eval_runtime": 82.5629, "eval_samples_per_second": 1.26, "eval_sampling/importance_sampling_ratio/max": 1.47766217818627, "eval_sampling/importance_sampling_ratio/mean": 1.0086628473722017, "eval_sampling/importance_sampling_ratio/min": 0.3609803124116017, "eval_sampling/sampling_logp_difference/max": 1.040850510964027, "eval_sampling/sampling_logp_difference/mean": 0.03541659864668663, "eval_steps_per_second": 0.157, "step": 350 }, { "clip_ratio/high_max": 0.06420147884637117, "clip_ratio/high_mean": 0.06420147884637117, "clip_ratio/low_mean": 0.042410715483129025, "clip_ratio/low_min": 0.042410715483129025, "clip_ratio/region_mean": 0.1066121943295002, "completions/clipped_ratio": 0.0, "completions/max_length": 132.0, "completions/max_terminated_length": 132.0, "completions/mean_length": 110.625, "completions/mean_terminated_length": 110.625, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "entropy": 0.6541618332266808, "epoch": 0.01355421686746988, "frac_reward_zero_std": 0.0, "grad_norm": 7.404175281524658, "learning_rate": 8.93939393939394e-06, "loss": 0.0583, "num_tokens": 755121.0, "reward": 0.8215762376785278, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.8419463634490967, "reward_meter_std": 0.2106313854455948, "reward_std": 0.23777368664741516, "reward_total_composite_mean": 0.8215762376785278, "reward_total_composite_std": 0.23777370154857635, "reward_total_mean": 0.8215762376785278, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.8419463634490967, "rewards/meter/std": 0.2106313854455948, "rewards/total_composite/mean": 0.8215762376785278, "rewards/total_composite/std": 0.23777370154857635, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0185338258743286, "sampling/importance_sampling_ratio/min": 0.17011570930480957, "sampling/sampling_logp_difference/max": 1.7712764739990234, "sampling/sampling_logp_difference/mean": 0.10544459521770477, "step": 351 }, { "clip_ratio/high_max": 0.040051594376564026, "clip_ratio/high_mean": 0.040051594376564026, "clip_ratio/low_mean": 0.043291399255394936, "clip_ratio/low_min": 0.043291399255394936, "clip_ratio/region_mean": 0.08334299363195896, "completions/clipped_ratio": 0.0, "completions/max_length": 350.0, "completions/max_terminated_length": 350.0, "completions/mean_length": 312.0, "completions/mean_terminated_length": 312.0, "completions/min_length": 266.0, "completions/min_terminated_length": 266.0, "entropy": 0.5112155750393867, "epoch": 0.013592832869941304, "frac_reward_zero_std": 0.0, "grad_norm": 4.749355792999268, "learning_rate": 8.936363636363638e-06, "loss": 0.0229, "num_tokens": 759273.0, "reward": 0.3508853614330292, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8977272510528564, "reward_count_adherence_std": 0.0758657306432724, "reward_meter_mean": 0.6065003275871277, "reward_meter_std": 0.3428960144519806, "reward_std": 0.3484891951084137, "reward_total_composite_mean": 0.3508853614330292, "reward_total_composite_std": 0.3484891951084137, "reward_total_mean": 0.3508853614330292, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8977272510528564, "rewards/count_adherence/std": 0.0758657306432724, "rewards/meter/mean": 0.6065003275871277, "rewards/meter/std": 0.3428960144519806, "rewards/total_composite/mean": 0.3508853614330292, "rewards/total_composite/std": 0.3484891951084137, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0068981647491455, "sampling/importance_sampling_ratio/min": 0.048666857182979584, "sampling/sampling_logp_difference/max": 3.022757053375244, "sampling/sampling_logp_difference/mean": 0.09127286821603775, "step": 352 }, { "clip_ratio/high_max": 0.051137037575244904, "clip_ratio/high_mean": 0.051137037575244904, "clip_ratio/low_mean": 0.10074498318135738, "clip_ratio/low_min": 0.10074498318135738, "clip_ratio/region_mean": 0.1518820207566023, "completions/clipped_ratio": 0.0, "completions/max_length": 58.0, "completions/max_terminated_length": 58.0, "completions/mean_length": 53.375, "completions/mean_terminated_length": 53.375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9390326142311096, "epoch": 0.013631448872412728, "frac_reward_zero_std": 0.0, "grad_norm": 15.203680992126465, "learning_rate": 8.933333333333333e-06, "loss": 0.0551, "num_tokens": 760972.0, "reward": 0.17881934344768524, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.17881934344768524, "reward_meter_std": 0.21953943371772766, "reward_std": 0.21953943371772766, "reward_total_composite_mean": 0.17881934344768524, "reward_total_composite_std": 0.21953943371772766, "reward_total_mean": 0.17881934344768524, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.17881934344768524, "rewards/meter/std": 0.21953943371772766, "rewards/total_composite/mean": 0.17881934344768524, "rewards/total_composite/std": 0.21953943371772766, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.006723403930664, "sampling/importance_sampling_ratio/min": 0.06635808944702148, "sampling/sampling_logp_difference/max": 2.7126896381378174, "sampling/sampling_logp_difference/mean": 0.16142068803310394, "step": 353 }, { "clip_ratio/high_max": 0.03562006680294871, "clip_ratio/high_mean": 0.03562006680294871, "clip_ratio/low_mean": 0.04170922236517072, "clip_ratio/low_min": 0.04170922236517072, "clip_ratio/region_mean": 0.07732928916811943, "completions/clipped_ratio": 0.0, "completions/max_length": 255.0, "completions/max_terminated_length": 255.0, "completions/mean_length": 217.5, "completions/mean_terminated_length": 217.5, "completions/min_length": 183.0, "completions/min_terminated_length": 183.0, "entropy": 0.4405891187489033, "epoch": 0.013670064874884152, "frac_reward_zero_std": 0.0, "grad_norm": 5.69448184967041, "learning_rate": 8.930303030303032e-06, "loss": 0.0918, "num_tokens": 764184.0, "reward": 0.43276864290237427, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9285714626312256, "reward_count_adherence_std": 0.07636035233736038, "reward_meter_mean": 0.47910094261169434, "reward_meter_std": 0.35389965772628784, "reward_std": 0.353183388710022, "reward_total_composite_mean": 0.43276864290237427, "reward_total_composite_std": 0.35318341851234436, "reward_total_mean": 0.43276864290237427, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9285714626312256, "rewards/count_adherence/std": 0.07636035233736038, "rewards/meter/mean": 0.47910094261169434, "rewards/meter/std": 0.35389965772628784, "rewards/total_composite/mean": 0.43276864290237427, "rewards/total_composite/std": 0.35318341851234436, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9991462230682373, "sampling/importance_sampling_ratio/min": 0.01798236183822155, "sampling/sampling_logp_difference/max": 4.018363952636719, "sampling/sampling_logp_difference/mean": 0.09170925617218018, "step": 354 }, { "clip_ratio/high_max": 0.0662611536681652, "clip_ratio/high_mean": 0.0662611536681652, "clip_ratio/low_mean": 0.013718276750296354, "clip_ratio/low_min": 0.013718276750296354, "clip_ratio/region_mean": 0.07997943041846156, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 62.75, "completions/mean_terminated_length": 62.75, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6785079278051853, "epoch": 0.013708680877355576, "frac_reward_zero_std": 0.0, "grad_norm": 8.740988731384277, "learning_rate": 8.927272727272728e-06, "loss": 0.1883, "num_tokens": 765870.0, "reward": 0.7710193395614624, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8165422677993774, "reward_meter_std": 0.2722550332546234, "reward_std": 0.3160322606563568, "reward_total_composite_mean": 0.7710193395614624, "reward_total_composite_std": 0.3160322606563568, "reward_total_mean": 0.7710193395614624, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8165422677993774, "rewards/meter/std": 0.2722550332546234, "rewards/total_composite/mean": 0.7710193395614624, "rewards/total_composite/std": 0.3160322606563568, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9960544109344482, "sampling/importance_sampling_ratio/min": 0.2889011800289154, "sampling/sampling_logp_difference/max": 1.2416706085205078, "sampling/sampling_logp_difference/mean": 0.09419586509466171, "step": 355 }, { "clip_ratio/high_max": 0.029830908868461847, "clip_ratio/high_mean": 0.029830908868461847, "clip_ratio/low_mean": 0.02032768283970654, "clip_ratio/low_min": 0.02032768283970654, "clip_ratio/region_mean": 0.05015859170816839, "completions/clipped_ratio": 0.0, "completions/max_length": 174.0, "completions/max_terminated_length": 174.0, "completions/mean_length": 91.0, "completions/mean_terminated_length": 91.0, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.4440796282142401, "epoch": 0.013747296879827, "frac_reward_zero_std": 0.0, "grad_norm": 5.667863368988037, "learning_rate": 8.924242424242425e-06, "loss": 0.3162, "num_tokens": 767806.0, "reward": 0.5287183523178101, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.4432026445865631, "reward_meter_mean": 0.7748513221740723, "reward_meter_std": 0.3971291780471802, "reward_std": 0.421138733625412, "reward_total_composite_mean": 0.5287183523178101, "reward_total_composite_std": 0.4211387634277344, "reward_total_mean": 0.5287183523178101, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.4432026445865631, "rewards/meter/mean": 0.7748513221740723, "rewards/meter/std": 0.3971291780471802, "rewards/total_composite/mean": 0.5287183523178101, "rewards/total_composite/std": 0.4211387634277344, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.00663161277771, "sampling/importance_sampling_ratio/min": 0.207846999168396, "sampling/sampling_logp_difference/max": 1.5709530115127563, "sampling/sampling_logp_difference/mean": 0.057105425745248795, "step": 356 }, { "clip_ratio/high_max": 0.07131410390138626, "clip_ratio/high_mean": 0.07131410390138626, "clip_ratio/low_mean": 0.05875496123917401, "clip_ratio/low_min": 0.05875496123917401, "clip_ratio/region_mean": 0.13006906514056027, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 29.625, "completions/mean_terminated_length": 29.625, "completions/min_length": 21.0, "completions/min_terminated_length": 21.0, "entropy": 1.4358574822545052, "epoch": 0.013785912882298424, "frac_reward_zero_std": 0.0, "grad_norm": 14.779327392578125, "learning_rate": 8.921212121212122e-06, "loss": -0.0252, "num_tokens": 769331.0, "reward": 0.644232988357544, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.644232988357544, "reward_meter_std": 0.4240405559539795, "reward_std": 0.4240405559539795, "reward_total_composite_mean": 0.644232988357544, "reward_total_composite_std": 0.4240405559539795, "reward_total_mean": 0.644232988357544, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.644232988357544, "rewards/meter/std": 0.4240405559539795, "rewards/total_composite/mean": 0.644232988357544, "rewards/total_composite/std": 0.4240405559539795, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0188149213790894, "sampling/importance_sampling_ratio/min": 0.20378637313842773, "sampling/sampling_logp_difference/max": 1.5906829833984375, "sampling/sampling_logp_difference/mean": 0.12809233367443085, "step": 357 }, { "clip_ratio/high_max": 0.053119941614568233, "clip_ratio/high_mean": 0.053119941614568233, "clip_ratio/low_mean": 0.0018292682943865657, "clip_ratio/low_min": 0.0018292682943865657, "clip_ratio/region_mean": 0.0549492099089548, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 205.0, "completions/mean_length": 177.75, "completions/mean_terminated_length": 130.0, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "entropy": 0.3757124850526452, "epoch": 0.013824528884769849, "frac_reward_zero_std": 0.0, "grad_norm": 2.133929491043091, "learning_rate": 8.91818181818182e-06, "loss": -0.0033, "num_tokens": 771649.0, "reward": 0.6629506349563599, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.34503278136253357, "reward_meter_mean": 0.7501189708709717, "reward_meter_std": 0.4528391361236572, "reward_std": 0.43371593952178955, "reward_total_composite_mean": 0.6629506349563599, "reward_total_composite_std": 0.43371596932411194, "reward_total_mean": 0.6629506349563599, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.34503278136253357, "rewards/meter/mean": 0.7501189708709717, "rewards/meter/std": 0.4528391361236572, "rewards/total_composite/mean": 0.6629506349563599, "rewards/total_composite/std": 0.43371596932411194, "sampling/importance_sampling_ratio/max": 1.9287148714065552, "sampling/importance_sampling_ratio/mean": 1.0138229131698608, "sampling/importance_sampling_ratio/min": 0.16741985082626343, "sampling/sampling_logp_difference/max": 1.7872505187988281, "sampling/sampling_logp_difference/mean": 0.053938575088977814, "step": 358 }, { "clip_ratio/high_max": 0.025988655164837837, "clip_ratio/high_mean": 0.025988655164837837, "clip_ratio/low_mean": 0.006502890028059483, "clip_ratio/low_min": 0.006502890028059483, "clip_ratio/region_mean": 0.03249154519289732, "completions/clipped_ratio": 0.0, "completions/max_length": 207.0, "completions/max_terminated_length": 207.0, "completions/mean_length": 189.25, "completions/mean_terminated_length": 189.25, "completions/min_length": 167.0, "completions/min_terminated_length": 167.0, "entropy": 0.20762322936207056, "epoch": 0.013863144887241273, "frac_reward_zero_std": 0.0, "grad_norm": 4.576873779296875, "learning_rate": 8.915151515151515e-06, "loss": -0.0206, "num_tokens": 774739.0, "reward": 0.9521228075027466, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9521228075027466, "reward_meter_std": 0.1113143265247345, "reward_std": 0.1113143190741539, "reward_total_composite_mean": 0.9521228075027466, "reward_total_composite_std": 0.1113143265247345, "reward_total_mean": 0.9521228075027466, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9521228075027466, "rewards/meter/std": 0.1113143265247345, "rewards/total_composite/mean": 0.9521228075027466, "rewards/total_composite/std": 0.1113143265247345, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0031837224960327, "sampling/importance_sampling_ratio/min": 0.31054913997650146, "sampling/sampling_logp_difference/max": 1.1694130897521973, "sampling/sampling_logp_difference/mean": 0.033114705234766006, "step": 359 }, { "clip_ratio/high_max": 0.06353305862285197, "clip_ratio/high_mean": 0.06353305862285197, "clip_ratio/low_mean": 0.031017429195344448, "clip_ratio/low_min": 0.031017429195344448, "clip_ratio/region_mean": 0.09455048781819642, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 69.375, "completions/mean_terminated_length": 69.375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9112853184342384, "epoch": 0.013901760889712697, "frac_reward_zero_std": 0.0, "grad_norm": 8.154752731323242, "learning_rate": 8.912121212121214e-06, "loss": 0.0254, "num_tokens": 776550.0, "reward": 0.7717971801757812, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7717971801757812, "reward_meter_std": 0.3203040659427643, "reward_std": 0.3203040659427643, "reward_total_composite_mean": 0.7717971801757812, "reward_total_composite_std": 0.3203040659427643, "reward_total_mean": 0.7717971801757812, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7717971801757812, "rewards/meter/std": 0.3203040659427643, "rewards/total_composite/mean": 0.7717971801757812, "rewards/total_composite/std": 0.3203040659427643, "sampling/importance_sampling_ratio/max": 1.804463267326355, "sampling/importance_sampling_ratio/mean": 1.0157387256622314, "sampling/importance_sampling_ratio/min": 0.2980525493621826, "sampling/sampling_logp_difference/max": 1.2104854583740234, "sampling/sampling_logp_difference/mean": 0.09423349797725677, "step": 360 }, { "clip_ratio/high_max": 0.07991194678470492, "clip_ratio/high_mean": 0.07991194678470492, "clip_ratio/low_mean": 0.026876877062022686, "clip_ratio/low_min": 0.026876877062022686, "clip_ratio/region_mean": 0.10678882384672761, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 97.125, "completions/mean_terminated_length": 97.125, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.8551923632621765, "epoch": 0.01394037689218412, "frac_reward_zero_std": 0.0, "grad_norm": 13.655211448669434, "learning_rate": 8.90909090909091e-06, "loss": 0.0533, "num_tokens": 778655.0, "reward": 0.9174784421920776, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9174784421920776, "reward_meter_std": 0.10890436172485352, "reward_std": 0.10890434682369232, "reward_total_composite_mean": 0.9174784421920776, "reward_total_composite_std": 0.10890436172485352, "reward_total_mean": 0.9174784421920776, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9174784421920776, "rewards/meter/std": 0.10890436172485352, "rewards/total_composite/mean": 0.9174784421920776, "rewards/total_composite/std": 0.10890436172485352, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0211211442947388, "sampling/importance_sampling_ratio/min": 0.16303564608097076, "sampling/sampling_logp_difference/max": 1.8137863874435425, "sampling/sampling_logp_difference/mean": 0.1321590393781662, "step": 361 }, { "clip_ratio/high_max": 0.021009880118072033, "clip_ratio/high_mean": 0.021009880118072033, "clip_ratio/low_mean": 0.004234739113599062, "clip_ratio/low_min": 0.004234739113599062, "clip_ratio/region_mean": 0.025244619231671095, "completions/clipped_ratio": 0.0, "completions/max_length": 141.0, "completions/max_terminated_length": 141.0, "completions/mean_length": 111.375, "completions/mean_terminated_length": 111.375, "completions/min_length": 92.0, "completions/min_terminated_length": 92.0, "entropy": 0.20824719313532114, "epoch": 0.013978992894655545, "frac_reward_zero_std": 0.0, "grad_norm": 3.6917600631713867, "learning_rate": 8.906060606060607e-06, "loss": 0.0839, "num_tokens": 781154.0, "reward": 0.9842470288276672, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9842470288276672, "reward_meter_std": 0.012328671291470528, "reward_std": 0.012328672222793102, "reward_total_composite_mean": 0.9842470288276672, "reward_total_composite_std": 0.012328671291470528, "reward_total_mean": 0.9842470288276672, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9842470288276672, "rewards/meter/std": 0.012328671291470528, "rewards/total_composite/mean": 0.9842470288276672, "rewards/total_composite/std": 0.012328671291470528, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0069833993911743, "sampling/importance_sampling_ratio/min": 0.2445802241563797, "sampling/sampling_logp_difference/max": 1.4082119464874268, "sampling/sampling_logp_difference/mean": 0.029706332832574844, "step": 362 }, { "clip_ratio/high_max": 0.07039879262447357, "clip_ratio/high_mean": 0.07039879262447357, "clip_ratio/low_mean": 0.030319053679704666, "clip_ratio/low_min": 0.030319053679704666, "clip_ratio/region_mean": 0.10071784630417824, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 70.625, "completions/mean_terminated_length": 70.625, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.7273201942443848, "epoch": 0.014017608897126969, "frac_reward_zero_std": 0.0, "grad_norm": 10.716965675354004, "learning_rate": 8.903030303030304e-06, "loss": 0.0367, "num_tokens": 783007.0, "reward": 0.6237794160842896, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6237794160842896, "reward_meter_std": 0.3550654649734497, "reward_std": 0.3550654351711273, "reward_total_composite_mean": 0.6237794160842896, "reward_total_composite_std": 0.3550654649734497, "reward_total_mean": 0.6237794160842896, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6237794160842896, "rewards/meter/std": 0.3550654649734497, "rewards/total_composite/mean": 0.6237794160842896, "rewards/total_composite/std": 0.3550654649734497, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0215344429016113, "sampling/importance_sampling_ratio/min": 0.17098604142665863, "sampling/sampling_logp_difference/max": 1.7661733627319336, "sampling/sampling_logp_difference/mean": 0.10527131706476212, "step": 363 }, { "clip_ratio/high_max": 0.12814369797706604, "clip_ratio/high_mean": 0.12814369797706604, "clip_ratio/low_mean": 0.008928571827709675, "clip_ratio/low_min": 0.008928571827709675, "clip_ratio/region_mean": 0.13707226980477571, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 55.375, "completions/mean_terminated_length": 55.375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 1.1656930446624756, "epoch": 0.014056224899598393, "frac_reward_zero_std": 0.0, "grad_norm": 10.589325904846191, "learning_rate": 8.900000000000001e-06, "loss": 0.0098, "num_tokens": 784698.0, "reward": 0.8658082485198975, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8658082485198975, "reward_meter_std": 0.2791600823402405, "reward_std": 0.2791600525379181, "reward_total_composite_mean": 0.8658082485198975, "reward_total_composite_std": 0.2791600823402405, "reward_total_mean": 0.8658082485198975, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8658082485198975, "rewards/meter/std": 0.2791600823402405, "rewards/total_composite/mean": 0.8658082485198975, "rewards/total_composite/std": 0.2791600823402405, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.013712763786316, "sampling/importance_sampling_ratio/min": 0.3191623091697693, "sampling/sampling_logp_difference/max": 1.1420555114746094, "sampling/sampling_logp_difference/mean": 0.13043774664402008, "step": 364 }, { "clip_ratio/high_max": 0.0560882892459631, "clip_ratio/high_mean": 0.0560882892459631, "clip_ratio/low_mean": 0.05067971581593156, "clip_ratio/low_min": 0.05067971581593156, "clip_ratio/region_mean": 0.10676800506189466, "completions/clipped_ratio": 0.0, "completions/max_length": 167.0, "completions/max_terminated_length": 167.0, "completions/mean_length": 122.125, "completions/mean_terminated_length": 122.125, "completions/min_length": 108.0, "completions/min_terminated_length": 108.0, "entropy": 0.5795126520097256, "epoch": 0.014094840902069817, "frac_reward_zero_std": 0.0, "grad_norm": 13.111671447753906, "learning_rate": 8.896969696969697e-06, "loss": 0.1186, "num_tokens": 787243.0, "reward": 0.07550254464149475, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.07551360130310059, "reward_meter_std": 0.0628013163805008, "reward_std": 0.06281644105911255, "reward_total_composite_mean": 0.07550254464149475, "reward_total_composite_std": 0.06281644105911255, "reward_total_mean": 0.07550254464149475, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.07551360130310059, "rewards/meter/std": 0.0628013163805008, "rewards/total_composite/mean": 0.07550254464149475, "rewards/total_composite/std": 0.06281644105911255, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0089328289031982, "sampling/importance_sampling_ratio/min": 0.11512690037488937, "sampling/sampling_logp_difference/max": 2.1617202758789062, "sampling/sampling_logp_difference/mean": 0.13020947575569153, "step": 365 }, { "clip_ratio/high_max": 0.08675131388008595, "clip_ratio/high_mean": 0.08675131388008595, "clip_ratio/low_mean": 0.07220942713320255, "clip_ratio/low_min": 0.07220942713320255, "clip_ratio/region_mean": 0.1589607410132885, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 53.625, "completions/mean_terminated_length": 53.625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 2.051785424351692, "epoch": 0.014133456904541241, "frac_reward_zero_std": 0.0, "grad_norm": 13.758865356445312, "learning_rate": 8.893939393939394e-06, "loss": 0.0132, "num_tokens": 788896.0, "reward": 0.5461307764053345, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5461307764053345, "reward_meter_std": 0.36441224813461304, "reward_std": 0.36441221833229065, "reward_total_composite_mean": 0.5461307764053345, "reward_total_composite_std": 0.36441224813461304, "reward_total_mean": 0.5461307764053345, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5461307764053345, "rewards/meter/std": 0.36441224813461304, "rewards/total_composite/mean": 0.5461307764053345, "rewards/total_composite/std": 0.36441224813461304, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0263890027999878, "sampling/importance_sampling_ratio/min": 0.19857226312160492, "sampling/sampling_logp_difference/max": 1.6166021823883057, "sampling/sampling_logp_difference/mean": 0.1779501587152481, "step": 366 }, { "clip_ratio/high_max": 0.04118129098787904, "clip_ratio/high_mean": 0.04118129098787904, "clip_ratio/low_mean": 0.028543358203023672, "clip_ratio/low_min": 0.028543358203023672, "clip_ratio/region_mean": 0.06972464919090271, "completions/clipped_ratio": 0.0, "completions/max_length": 90.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 79.375, "completions/mean_terminated_length": 79.375, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.6636021360754967, "epoch": 0.014172072907012665, "frac_reward_zero_std": 0.0, "grad_norm": 9.988097190856934, "learning_rate": 8.890909090909091e-06, "loss": -0.0044, "num_tokens": 790811.0, "reward": 0.9885889291763306, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9885889291763306, "reward_meter_std": 0.0046616969630122185, "reward_std": 0.004661702550947666, "reward_total_composite_mean": 0.9885889291763306, "reward_total_composite_std": 0.0046616969630122185, "reward_total_mean": 0.9885889291763306, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9885889291763306, "rewards/meter/std": 0.0046616969630122185, "rewards/total_composite/mean": 0.9885889291763306, "rewards/total_composite/std": 0.0046616969630122185, "sampling/importance_sampling_ratio/max": 1.7074363231658936, "sampling/importance_sampling_ratio/mean": 1.0116159915924072, "sampling/importance_sampling_ratio/min": 0.2945983111858368, "sampling/sampling_logp_difference/max": 1.2221425771713257, "sampling/sampling_logp_difference/mean": 0.07036007940769196, "step": 367 }, { "clip_ratio/high_max": 0.06731301127001643, "clip_ratio/high_mean": 0.06731301127001643, "clip_ratio/low_mean": 0.0042372881434857845, "clip_ratio/low_min": 0.0042372881434857845, "clip_ratio/region_mean": 0.07155029941350222, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 62.125, "completions/mean_terminated_length": 62.125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.4450516998767853, "epoch": 0.01421068890948409, "frac_reward_zero_std": 0.0, "grad_norm": 5.517111778259277, "learning_rate": 8.887878787878789e-06, "loss": -0.0084, "num_tokens": 792532.0, "reward": 0.8935509920120239, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8935509920120239, "reward_meter_std": 0.2326761782169342, "reward_std": 0.2326761931180954, "reward_total_composite_mean": 0.8935509920120239, "reward_total_composite_std": 0.2326761782169342, "reward_total_mean": 0.8935509920120239, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8935509920120239, "rewards/meter/std": 0.2326761782169342, "rewards/total_composite/mean": 0.8935509920120239, "rewards/total_composite/std": 0.2326761782169342, "sampling/importance_sampling_ratio/max": 1.846786618232727, "sampling/importance_sampling_ratio/mean": 0.9973874688148499, "sampling/importance_sampling_ratio/min": 0.2832942605018616, "sampling/sampling_logp_difference/max": 1.2612690925598145, "sampling/sampling_logp_difference/mean": 0.06450241804122925, "step": 368 }, { "clip_ratio/high_max": 0.051239289343357086, "clip_ratio/high_mean": 0.051239289343357086, "clip_ratio/low_mean": 0.005859375, "clip_ratio/low_min": 0.005859375, "clip_ratio/region_mean": 0.057098664343357086, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 73.5, "completions/mean_terminated_length": 73.5, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.4530269633978605, "epoch": 0.014249304911955514, "frac_reward_zero_std": 0.0, "grad_norm": 4.8590497970581055, "learning_rate": 8.884848484848486e-06, "loss": -0.0431, "num_tokens": 794480.0, "reward": 0.9953228235244751, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9953228235244751, "reward_meter_std": 0.008204305544495583, "reward_std": 0.008204314857721329, "reward_total_composite_mean": 0.9953228235244751, "reward_total_composite_std": 0.008204305544495583, "reward_total_mean": 0.9953228235244751, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9953228235244751, "rewards/meter/std": 0.008204305544495583, "rewards/total_composite/mean": 0.9953228235244751, "rewards/total_composite/std": 0.008204305544495583, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0053033828735352, "sampling/importance_sampling_ratio/min": 0.23970215022563934, "sampling/sampling_logp_difference/max": 2.3124313354492188, "sampling/sampling_logp_difference/mean": 0.057661134749650955, "step": 369 }, { "clip_ratio/high_max": 0.007220303174108267, "clip_ratio/high_mean": 0.007220303174108267, "clip_ratio/low_mean": 0.023962138686329126, "clip_ratio/low_min": 0.023962138686329126, "clip_ratio/region_mean": 0.031182441860437393, "completions/clipped_ratio": 0.0, "completions/max_length": 193.0, "completions/max_terminated_length": 193.0, "completions/mean_length": 158.0, "completions/mean_terminated_length": 158.0, "completions/min_length": 135.0, "completions/min_terminated_length": 135.0, "entropy": 0.33616957906633615, "epoch": 0.014287920914426938, "frac_reward_zero_std": 0.0, "grad_norm": 3.5815742015838623, "learning_rate": 8.881818181818183e-06, "loss": -0.0679, "num_tokens": 797320.0, "reward": 0.8628234267234802, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.07715168595314026, "reward_meter_mean": 0.9859833717346191, "reward_meter_std": 0.00827515497803688, "reward_std": 0.07765334099531174, "reward_total_composite_mean": 0.8628234267234802, "reward_total_composite_std": 0.07765333354473114, "reward_total_mean": 0.8628234267234802, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.07715168595314026, "rewards/meter/mean": 0.9859833717346191, "rewards/meter/std": 0.00827515497803688, "rewards/total_composite/mean": 0.8628234267234802, "rewards/total_composite/std": 0.07765333354473114, "sampling/importance_sampling_ratio/max": 1.8284692764282227, "sampling/importance_sampling_ratio/mean": 1.002156376838684, "sampling/importance_sampling_ratio/min": 0.2905518114566803, "sampling/sampling_logp_difference/max": 1.2359733581542969, "sampling/sampling_logp_difference/mean": 0.036213189363479614, "step": 370 }, { "clip_ratio/high_max": 0.02175675635226071, "clip_ratio/high_mean": 0.02175675635226071, "clip_ratio/low_mean": 0.02037237980403006, "clip_ratio/low_min": 0.02037237980403006, "clip_ratio/region_mean": 0.04212913615629077, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 63.125, "completions/mean_terminated_length": 63.125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.3037525750696659, "epoch": 0.014326536916898362, "frac_reward_zero_std": 0.0, "grad_norm": 4.787428379058838, "learning_rate": 8.87878787878788e-06, "loss": -0.0611, "num_tokens": 799041.0, "reward": 0.9925068020820618, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9925068020820618, "reward_meter_std": 0.004724609199911356, "reward_std": 0.004724607802927494, "reward_total_composite_mean": 0.9925068020820618, "reward_total_composite_std": 0.004724609199911356, "reward_total_mean": 0.9925068020820618, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9925068020820618, "rewards/meter/std": 0.004724609199911356, "rewards/total_composite/mean": 0.9925068020820618, "rewards/total_composite/std": 0.004724609199911356, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0087881088256836, "sampling/importance_sampling_ratio/min": 0.4250510334968567, "sampling/sampling_logp_difference/max": 1.3125829696655273, "sampling/sampling_logp_difference/mean": 0.03738410025835037, "step": 371 }, { "clip_ratio/high_max": 0.05502570327371359, "clip_ratio/high_mean": 0.05502570327371359, "clip_ratio/low_mean": 0.03239734377712011, "clip_ratio/low_min": 0.03239734377712011, "clip_ratio/region_mean": 0.0874230470508337, "completions/clipped_ratio": 0.0, "completions/max_length": 49.0, "completions/max_terminated_length": 49.0, "completions/mean_length": 47.125, "completions/mean_terminated_length": 47.125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.453409057110548, "epoch": 0.014365152919369786, "frac_reward_zero_std": 0.0, "grad_norm": 10.848628044128418, "learning_rate": 8.875757575757576e-06, "loss": 0.0082, "num_tokens": 800618.0, "reward": 0.7270175218582153, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7270175218582153, "reward_meter_std": 0.33816584944725037, "reward_std": 0.33816584944725037, "reward_total_composite_mean": 0.7270175218582153, "reward_total_composite_std": 0.33816584944725037, "reward_total_mean": 0.7270175218582153, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7270175218582153, "rewards/meter/std": 0.33816584944725037, "rewards/total_composite/mean": 0.7270175218582153, "rewards/total_composite/std": 0.33816584944725037, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.007200002670288, "sampling/importance_sampling_ratio/min": 0.22253604233264923, "sampling/sampling_logp_difference/max": 1.5026662349700928, "sampling/sampling_logp_difference/mean": 0.11081711202859879, "step": 372 }, { "clip_ratio/high_max": 0.08649335522204638, "clip_ratio/high_mean": 0.08649335522204638, "clip_ratio/low_mean": 0.03359880484640598, "clip_ratio/low_min": 0.03359880484640598, "clip_ratio/region_mean": 0.12009216006845236, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 51.625, "completions/mean_terminated_length": 51.625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 1.7377965189516544, "epoch": 0.014403768921841212, "frac_reward_zero_std": 0.0, "grad_norm": 15.01648235321045, "learning_rate": 8.872727272727275e-06, "loss": -0.0215, "num_tokens": 802191.0, "reward": 0.8347938060760498, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8347938060760498, "reward_meter_std": 0.2780701220035553, "reward_std": 0.2780701220035553, "reward_total_composite_mean": 0.8347938060760498, "reward_total_composite_std": 0.2780701220035553, "reward_total_mean": 0.8347938060760498, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8347938060760498, "rewards/meter/std": 0.2780701220035553, "rewards/total_composite/mean": 0.8347938060760498, "rewards/total_composite/std": 0.2780701220035553, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0421912670135498, "sampling/importance_sampling_ratio/min": 0.2581785023212433, "sampling/sampling_logp_difference/max": 1.3541040420532227, "sampling/sampling_logp_difference/mean": 0.15455831587314606, "step": 373 }, { "clip_ratio/high_max": 0.10351844411343336, "clip_ratio/high_mean": 0.10351844411343336, "clip_ratio/low_mean": 0.026901003904640675, "clip_ratio/low_min": 0.026901003904640675, "clip_ratio/region_mean": 0.13041944801807404, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 77.375, "completions/mean_terminated_length": 77.375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7330310307443142, "epoch": 0.014442384924312636, "frac_reward_zero_std": 0.0, "grad_norm": 9.044235229492188, "learning_rate": 8.86969696969697e-06, "loss": 0.0391, "num_tokens": 804026.0, "reward": 0.8928734064102173, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8928734064102173, "reward_meter_std": 0.21326282620429993, "reward_std": 0.21326281130313873, "reward_total_composite_mean": 0.8928734064102173, "reward_total_composite_std": 0.21326282620429993, "reward_total_mean": 0.8928734064102173, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8928734064102173, "rewards/meter/std": 0.21326282620429993, "rewards/total_composite/mean": 0.8928734064102173, "rewards/total_composite/std": 0.21326282620429993, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0097415447235107, "sampling/importance_sampling_ratio/min": 0.20891344547271729, "sampling/sampling_logp_difference/max": 1.5658352375030518, "sampling/sampling_logp_difference/mean": 0.10972950607538223, "step": 374 }, { "clip_ratio/high_max": 0.051100376760587096, "clip_ratio/high_mean": 0.051100376760587096, "clip_ratio/low_mean": 0.009168443502858281, "clip_ratio/low_min": 0.009168443502858281, "clip_ratio/region_mean": 0.06026882026344538, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 67.125, "completions/mean_terminated_length": 67.125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.7069630771875381, "epoch": 0.01448100092678406, "frac_reward_zero_std": 0.0, "grad_norm": 9.385233879089355, "learning_rate": 8.866666666666668e-06, "loss": 0.0183, "num_tokens": 805811.0, "reward": 0.9862740635871887, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9862740635871887, "reward_meter_std": 0.022809647023677826, "reward_std": 0.02280966006219387, "reward_total_composite_mean": 0.9862740635871887, "reward_total_composite_std": 0.022809647023677826, "reward_total_mean": 0.9862740635871887, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9862740635871887, "rewards/meter/std": 0.022809647023677826, "rewards/total_composite/mean": 0.9862740635871887, "rewards/total_composite/std": 0.022809647023677826, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.005605697631836, "sampling/importance_sampling_ratio/min": 0.24791260063648224, "sampling/sampling_logp_difference/max": 1.394679069519043, "sampling/sampling_logp_difference/mean": 0.08005134761333466, "step": 375 }, { "clip_ratio/high_max": 0.049564928747713566, "clip_ratio/high_mean": 0.049564928747713566, "clip_ratio/low_mean": 0.07232486410066485, "clip_ratio/low_min": 0.07232486410066485, "clip_ratio/region_mean": 0.12188979284837842, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 86.75, "completions/mean_terminated_length": 86.75, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 1.4634561464190483, "epoch": 0.014519616929255484, "frac_reward_zero_std": 0.0, "grad_norm": 7.467469215393066, "learning_rate": 8.863636363636365e-06, "loss": 0.0159, "num_tokens": 807817.0, "reward": 0.38385850191116333, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.38385850191116333, "reward_meter_std": 0.3889022171497345, "reward_std": 0.3889022171497345, "reward_total_composite_mean": 0.38385850191116333, "reward_total_composite_std": 0.3889022171497345, "reward_total_mean": 0.38385850191116333, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.38385850191116333, "rewards/meter/std": 0.3889022171497345, "rewards/total_composite/mean": 0.38385850191116333, "rewards/total_composite/std": 0.3889022171497345, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0250762701034546, "sampling/importance_sampling_ratio/min": 0.2584901452064514, "sampling/sampling_logp_difference/max": 1.3528976440429688, "sampling/sampling_logp_difference/mean": 0.14060647785663605, "step": 376 }, { "clip_ratio/high_max": 0.028778444975614548, "clip_ratio/high_mean": 0.028778444975614548, "clip_ratio/low_mean": 0.004890488460659981, "clip_ratio/low_min": 0.004890488460659981, "clip_ratio/region_mean": 0.03366893343627453, "completions/clipped_ratio": 0.0, "completions/max_length": 195.0, "completions/max_terminated_length": 195.0, "completions/mean_length": 181.25, "completions/mean_terminated_length": 181.25, "completions/min_length": 162.0, "completions/min_terminated_length": 162.0, "entropy": 0.25179606676101685, "epoch": 0.014558232931726908, "frac_reward_zero_std": 0.0, "grad_norm": 2.5315823554992676, "learning_rate": 8.860606060606062e-06, "loss": -0.0199, "num_tokens": 810779.0, "reward": 0.7281081080436707, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8541666269302368, "reward_count_adherence_std": 0.10681165754795074, "reward_meter_mean": 0.8494396209716797, "reward_meter_std": 0.3451205790042877, "reward_std": 0.314047247171402, "reward_total_composite_mean": 0.7281081080436707, "reward_total_composite_std": 0.31404727697372437, "reward_total_mean": 0.7281081080436707, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8541666269302368, "rewards/count_adherence/std": 0.10681165754795074, "rewards/meter/mean": 0.8494396209716797, "rewards/meter/std": 0.3451205790042877, "rewards/total_composite/mean": 0.7281081080436707, "rewards/total_composite/std": 0.31404727697372437, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0015827417373657, "sampling/importance_sampling_ratio/min": 0.2383430302143097, "sampling/sampling_logp_difference/max": 1.434044361114502, "sampling/sampling_logp_difference/mean": 0.04079859331250191, "step": 377 }, { "clip_ratio/high_max": 0.0347325021866709, "clip_ratio/high_mean": 0.0347325021866709, "clip_ratio/low_mean": 0.008928571827709675, "clip_ratio/low_min": 0.008928571827709675, "clip_ratio/region_mean": 0.043661074014380574, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 143.0, "completions/mean_terminated_length": 90.28572082519531, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.33806798979640007, "epoch": 0.014596848934198332, "frac_reward_zero_std": 0.0, "grad_norm": 6.6282148361206055, "learning_rate": 8.857575757575758e-06, "loss": -0.1719, "num_tokens": 812651.0, "reward": 0.8677093982696533, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_meter_mean": 0.9918551445007324, "reward_meter_std": 0.004135291092097759, "reward_std": 0.24586959183216095, "reward_total_composite_mean": 0.8677093982696533, "reward_total_composite_std": 0.24586959183216095, "reward_total_mean": 0.8677093982696533, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/meter/mean": 0.9918551445007324, "rewards/meter/std": 0.004135291092097759, "rewards/total_composite/mean": 0.8677093982696533, "rewards/total_composite/std": 0.24586959183216095, "sampling/importance_sampling_ratio/max": 1.980355143547058, "sampling/importance_sampling_ratio/mean": 1.008686900138855, "sampling/importance_sampling_ratio/min": 0.29936423897743225, "sampling/sampling_logp_difference/max": 1.2060942649841309, "sampling/sampling_logp_difference/mean": 0.052827268838882446, "step": 378 }, { "clip_ratio/high_max": 0.08018230739980936, "clip_ratio/high_mean": 0.08018230739980936, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.08018230739980936, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 130.625, "completions/mean_terminated_length": 76.14286041259766, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.7669309824705124, "epoch": 0.014635464936669756, "frac_reward_zero_std": 0.0, "grad_norm": 1.1005628108978271, "learning_rate": 8.854545454545455e-06, "loss": -0.1795, "num_tokens": 814504.0, "reward": 0.9303869605064392, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9917647838592529, "reward_meter_std": 0.009205368347465992, "reward_std": 0.17772506177425385, "reward_total_composite_mean": 0.9303869605064392, "reward_total_composite_std": 0.17772506177425385, "reward_total_mean": 0.9303869605064392, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9917647838592529, "rewards/meter/std": 0.009205368347465992, "rewards/total_composite/mean": 0.9303869605064392, "rewards/total_composite/std": 0.17772506177425385, "sampling/importance_sampling_ratio/max": 1.736937165260315, "sampling/importance_sampling_ratio/mean": 1.0020660161972046, "sampling/importance_sampling_ratio/min": 0.3145061433315277, "sampling/sampling_logp_difference/max": 1.1567516326904297, "sampling/sampling_logp_difference/mean": 0.08945769816637039, "step": 379 }, { "clip_ratio/high_max": 0.07530082948505878, "clip_ratio/high_mean": 0.07530082948505878, "clip_ratio/low_mean": 0.05674390681087971, "clip_ratio/low_min": 0.05674390681087971, "clip_ratio/region_mean": 0.1320447362959385, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 62.0, "completions/mean_terminated_length": 62.0, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 1.2989665120840073, "epoch": 0.01467408093914118, "frac_reward_zero_std": 0.0, "grad_norm": 9.77833366394043, "learning_rate": 8.851515151515152e-06, "loss": -0.0121, "num_tokens": 816336.0, "reward": 0.8162009716033936, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8162009716033936, "reward_meter_std": 0.21702320873737335, "reward_std": 0.21702319383621216, "reward_total_composite_mean": 0.8162009716033936, "reward_total_composite_std": 0.21702320873737335, "reward_total_mean": 0.8162009716033936, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8162009716033936, "rewards/meter/std": 0.21702320873737335, "rewards/total_composite/mean": 0.8162009716033936, "rewards/total_composite/std": 0.21702320873737335, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0254578590393066, "sampling/importance_sampling_ratio/min": 0.2928999066352844, "sampling/sampling_logp_difference/max": 1.2279243469238281, "sampling/sampling_logp_difference/mean": 0.13395410776138306, "step": 380 }, { "clip_ratio/high_max": 0.02148950519040227, "clip_ratio/high_mean": 0.02148950519040227, "clip_ratio/low_mean": 0.02306468691676855, "clip_ratio/low_min": 0.02306468691676855, "clip_ratio/region_mean": 0.04455419210717082, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 77.375, "completions/mean_terminated_length": 77.375, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.47446247562766075, "epoch": 0.014712696941612605, "frac_reward_zero_std": 0.0, "grad_norm": 5.939858913421631, "learning_rate": 8.84848484848485e-06, "loss": 0.0106, "num_tokens": 818123.0, "reward": 0.9950414299964905, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9950414299964905, "reward_meter_std": 0.005652880761772394, "reward_std": 0.005652868654578924, "reward_total_composite_mean": 0.9950414299964905, "reward_total_composite_std": 0.005652880761772394, "reward_total_mean": 0.9950414299964905, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9950414299964905, "rewards/meter/std": 0.005652880761772394, "rewards/total_composite/mean": 0.9950414299964905, "rewards/total_composite/std": 0.005652880761772394, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0126311779022217, "sampling/importance_sampling_ratio/min": 0.18580889701843262, "sampling/sampling_logp_difference/max": 1.6830365657806396, "sampling/sampling_logp_difference/mean": 0.05509962514042854, "step": 381 }, { "clip_ratio/high_max": 0.023234429769217968, "clip_ratio/high_mean": 0.023234429769217968, "clip_ratio/low_mean": 0.0074404762126505375, "clip_ratio/low_min": 0.0074404762126505375, "clip_ratio/region_mean": 0.030674905981868505, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 185.0, "completions/mean_length": 211.75, "completions/mean_terminated_length": 168.85714721679688, "completions/min_length": 158.0, "completions/min_terminated_length": 158.0, "entropy": 0.311492882668972, "epoch": 0.014751312944084029, "frac_reward_zero_std": 0.0, "grad_norm": 1.8641679286956787, "learning_rate": 8.845454545454547e-06, "loss": -0.2242, "num_tokens": 820713.0, "reward": 0.7125877141952515, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.23299294710159302, "reward_meter_mean": 0.9491947889328003, "reward_meter_std": 0.10156966745853424, "reward_std": 0.2403973639011383, "reward_total_composite_mean": 0.7125877141952515, "reward_total_composite_std": 0.2403973489999771, "reward_total_mean": 0.7125877141952515, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.23299294710159302, "rewards/meter/mean": 0.9491947889328003, "rewards/meter/std": 0.10156966745853424, "rewards/total_composite/mean": 0.7125877141952515, "rewards/total_composite/std": 0.2403973489999771, "sampling/importance_sampling_ratio/max": 1.9695637226104736, "sampling/importance_sampling_ratio/mean": 1.0095936059951782, "sampling/importance_sampling_ratio/min": 0.24216197431087494, "sampling/sampling_logp_difference/max": 1.4181485176086426, "sampling/sampling_logp_difference/mean": 0.04226767271757126, "step": 382 }, { "clip_ratio/high_max": 0.01344697322929278, "clip_ratio/high_mean": 0.01344697322929278, "clip_ratio/low_mean": 0.0015822785208001733, "clip_ratio/low_min": 0.0015822785208001733, "clip_ratio/region_mean": 0.015029251750092953, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 252.0, "completions/mean_length": 263.0, "completions/mean_terminated_length": 227.4285888671875, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "entropy": 0.10115705709904432, "epoch": 0.014789928946555453, "frac_reward_zero_std": 0.0, "grad_norm": 1.574141263961792, "learning_rate": 8.842424242424244e-06, "loss": -0.1634, "num_tokens": 823881.0, "reward": 0.5856432914733887, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.2314550280570984, "reward_meter_mean": 0.8664563298225403, "reward_meter_std": 0.2947894036769867, "reward_std": 0.2903149425983429, "reward_total_composite_mean": 0.5856432914733887, "reward_total_composite_std": 0.2903149425983429, "reward_total_mean": 0.5856432914733887, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/meter/mean": 0.8664563298225403, "rewards/meter/std": 0.2947894036769867, "rewards/total_composite/mean": 0.5856432914733887, "rewards/total_composite/std": 0.2903149425983429, "sampling/importance_sampling_ratio/max": 1.8257579803466797, "sampling/importance_sampling_ratio/mean": 1.000448226928711, "sampling/importance_sampling_ratio/min": 0.3171911835670471, "sampling/sampling_logp_difference/max": 1.1482505798339844, "sampling/sampling_logp_difference/mean": 0.01734515093266964, "step": 383 }, { "clip_ratio/high_max": 0.03935463528614491, "clip_ratio/high_mean": 0.03935463528614491, "clip_ratio/low_mean": 0.008561643771827221, "clip_ratio/low_min": 0.008561643771827221, "clip_ratio/region_mean": 0.04791627905797213, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 132.125, "completions/mean_terminated_length": 77.85714721679688, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.3592350035905838, "epoch": 0.014828544949026877, "frac_reward_zero_std": 0.0, "grad_norm": 2.7595345973968506, "learning_rate": 8.83939393939394e-06, "loss": -0.0853, "num_tokens": 825706.0, "reward": 0.8233171105384827, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8857226967811584, "reward_meter_std": 0.2998782992362976, "reward_std": 0.32403311133384705, "reward_total_composite_mean": 0.8233171105384827, "reward_total_composite_std": 0.32403311133384705, "reward_total_mean": 0.8233171105384827, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8857226967811584, "rewards/meter/std": 0.2998782992362976, "rewards/total_composite/mean": 0.8233171105384827, "rewards/total_composite/std": 0.32403311133384705, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.005861759185791, "sampling/importance_sampling_ratio/min": 0.19981907308101654, "sampling/sampling_logp_difference/max": 1.6103429794311523, "sampling/sampling_logp_difference/mean": 0.05464348942041397, "step": 384 }, { "clip_ratio/high_max": 0.041496834717690945, "clip_ratio/high_mean": 0.041496834717690945, "clip_ratio/low_mean": 0.003689236124046147, "clip_ratio/low_min": 0.003689236124046147, "clip_ratio/region_mean": 0.04518607084173709, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 178.75, "completions/mean_terminated_length": 67.66667175292969, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.43436889722943306, "epoch": 0.014867160951498301, "frac_reward_zero_std": 0.0, "grad_norm": 2.582751512527466, "learning_rate": 8.836363636363637e-06, "loss": -0.0509, "num_tokens": 827248.0, "reward": 0.714938223361969, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.714938223361969, "reward_meter_std": 0.36748242378234863, "reward_std": 0.36748242378234863, "reward_total_composite_mean": 0.714938223361969, "reward_total_composite_std": 0.36748242378234863, "reward_total_mean": 0.714938223361969, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.714938223361969, "rewards/meter/std": 0.36748242378234863, "rewards/total_composite/mean": 0.714938223361969, "rewards/total_composite/std": 0.36748242378234863, "sampling/importance_sampling_ratio/max": 1.566494107246399, "sampling/importance_sampling_ratio/mean": 1.0119549036026, "sampling/importance_sampling_ratio/min": 0.33843517303466797, "sampling/sampling_logp_difference/max": 1.0834226608276367, "sampling/sampling_logp_difference/mean": 0.07517319172620773, "step": 385 }, { "clip_ratio/high_max": 0.07191554573364556, "clip_ratio/high_mean": 0.07191554573364556, "clip_ratio/low_mean": 0.03804087173193693, "clip_ratio/low_min": 0.03804087173193693, "clip_ratio/region_mean": 0.10995641746558249, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 58.25, "completions/mean_terminated_length": 58.25, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 1.1986883580684662, "epoch": 0.014905776953969725, "frac_reward_zero_std": 0.0, "grad_norm": 13.948408126831055, "learning_rate": 8.833333333333334e-06, "loss": 0.0492, "num_tokens": 828954.0, "reward": 0.690985918045044, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.690985918045044, "reward_meter_std": 0.42123687267303467, "reward_std": 0.42123687267303467, "reward_total_composite_mean": 0.690985918045044, "reward_total_composite_std": 0.42123687267303467, "reward_total_mean": 0.690985918045044, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.690985918045044, "rewards/meter/std": 0.42123687267303467, "rewards/total_composite/mean": 0.690985918045044, "rewards/total_composite/std": 0.42123687267303467, "sampling/importance_sampling_ratio/max": 1.8247418403625488, "sampling/importance_sampling_ratio/mean": 1.0141727924346924, "sampling/importance_sampling_ratio/min": 0.1829366534948349, "sampling/sampling_logp_difference/max": 1.698615312576294, "sampling/sampling_logp_difference/mean": 0.12392318993806839, "step": 386 }, { "clip_ratio/high_max": 0.007820297265425324, "clip_ratio/high_mean": 0.007820297265425324, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007820297265425324, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 306.0, "completions/mean_length": 315.25, "completions/mean_terminated_length": 287.14288330078125, "completions/min_length": 254.0, "completions/min_terminated_length": 254.0, "entropy": 0.06537747196853161, "epoch": 0.01494439295644115, "frac_reward_zero_std": 0.0, "grad_norm": 0.3322877585887909, "learning_rate": 8.830303030303031e-06, "loss": -0.2826, "num_tokens": 832724.0, "reward": 0.6194590330123901, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2121320217847824, "reward_meter_mean": 0.9916845560073853, "reward_meter_std": 0.01541493646800518, "reward_std": 0.21031685173511505, "reward_total_composite_mean": 0.6194590330123901, "reward_total_composite_std": 0.21031685173511505, "reward_total_mean": 0.6194590330123901, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2121320217847824, "rewards/meter/mean": 0.9916845560073853, "rewards/meter/std": 0.01541493646800518, "rewards/total_composite/mean": 0.6194590330123901, "rewards/total_composite/std": 0.21031685173511505, "sampling/importance_sampling_ratio/max": 1.4588537216186523, "sampling/importance_sampling_ratio/mean": 1.0010322332382202, "sampling/importance_sampling_ratio/min": 0.15520599484443665, "sampling/sampling_logp_difference/max": 1.863002061843872, "sampling/sampling_logp_difference/mean": 0.011599292047321796, "step": 387 }, { "clip_ratio/high_max": 0.01489788806065917, "clip_ratio/high_mean": 0.01489788806065917, "clip_ratio/low_mean": 0.00827294704504311, "clip_ratio/low_min": 0.00827294704504311, "clip_ratio/region_mean": 0.02317083510570228, "completions/clipped_ratio": 0.0, "completions/max_length": 107.0, "completions/max_terminated_length": 107.0, "completions/mean_length": 92.875, "completions/mean_terminated_length": 92.875, "completions/min_length": 86.0, "completions/min_terminated_length": 86.0, "entropy": 0.24626289308071136, "epoch": 0.014983008958912573, "frac_reward_zero_std": 0.0, "grad_norm": 3.59706449508667, "learning_rate": 8.827272727272727e-06, "loss": 0.0025, "num_tokens": 834907.0, "reward": 0.9105833172798157, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.9513072967529297, "reward_meter_std": 0.04710450395941734, "reward_std": 0.11427939683198929, "reward_total_composite_mean": 0.9105833172798157, "reward_total_composite_std": 0.11427941173315048, "reward_total_mean": 0.9105833172798157, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.9513072967529297, "rewards/meter/std": 0.04710450395941734, "rewards/total_composite/mean": 0.9105833172798157, "rewards/total_composite/std": 0.11427941173315048, "sampling/importance_sampling_ratio/max": 1.8268436193466187, "sampling/importance_sampling_ratio/mean": 1.0046768188476562, "sampling/importance_sampling_ratio/min": 0.3529474139213562, "sampling/sampling_logp_difference/max": 1.0414361953735352, "sampling/sampling_logp_difference/mean": 0.02844572812318802, "step": 388 }, { "clip_ratio/high_max": 0.09026568429544568, "clip_ratio/high_mean": 0.09026568429544568, "clip_ratio/low_mean": 0.006756756920367479, "clip_ratio/low_min": 0.006756756920367479, "clip_ratio/region_mean": 0.09702244121581316, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 34.25, "completions/mean_terminated_length": 34.25, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.777605514973402, "epoch": 0.015021624961383997, "frac_reward_zero_std": 0.0, "grad_norm": 10.221504211425781, "learning_rate": 8.824242424242426e-06, "loss": 0.0368, "num_tokens": 836445.0, "reward": 0.8630082011222839, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8630082011222839, "reward_meter_std": 0.34829336404800415, "reward_std": 0.34829336404800415, "reward_total_composite_mean": 0.8630082011222839, "reward_total_composite_std": 0.34829336404800415, "reward_total_mean": 0.8630082011222839, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8630082011222839, "rewards/meter/std": 0.34829336404800415, "rewards/total_composite/mean": 0.8630082011222839, "rewards/total_composite/std": 0.34829336404800415, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0091283321380615, "sampling/importance_sampling_ratio/min": 0.10067791491746902, "sampling/sampling_logp_difference/max": 2.2958288192749023, "sampling/sampling_logp_difference/mean": 0.11211102455854416, "step": 389 }, { "clip_ratio/high_max": 0.07300483155995607, "clip_ratio/high_mean": 0.07300483155995607, "clip_ratio/low_mean": 0.030689293053001165, "clip_ratio/low_min": 0.030689293053001165, "clip_ratio/region_mean": 0.10369412461295724, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 54.75, "completions/mean_terminated_length": 54.75, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 1.3469589613378048, "epoch": 0.015060240963855422, "frac_reward_zero_std": 0.0, "grad_norm": 8.775293350219727, "learning_rate": 8.821212121212121e-06, "loss": -0.0172, "num_tokens": 838331.0, "reward": 0.48685652017593384, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.48685652017593384, "reward_meter_std": 0.3812946379184723, "reward_std": 0.3812946081161499, "reward_total_composite_mean": 0.48685652017593384, "reward_total_composite_std": 0.3812946379184723, "reward_total_mean": 0.48685652017593384, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.48685652017593384, "rewards/meter/std": 0.3812946379184723, "rewards/total_composite/mean": 0.48685652017593384, "rewards/total_composite/std": 0.3812946379184723, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.029207468032837, "sampling/importance_sampling_ratio/min": 0.2566058933734894, "sampling/sampling_logp_difference/max": 1.3602138757705688, "sampling/sampling_logp_difference/mean": 0.12760156393051147, "step": 390 }, { "clip_ratio/high_max": 0.0027604734350461513, "clip_ratio/high_mean": 0.0027604734350461513, "clip_ratio/low_mean": 0.003784051747061312, "clip_ratio/low_min": 0.003784051747061312, "clip_ratio/region_mean": 0.0065445251821074635, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 359.0, "completions/mean_length": 342.875, "completions/mean_terminated_length": 318.71429443359375, "completions/min_length": 295.0, "completions/min_terminated_length": 295.0, "entropy": 0.051004831213504076, "epoch": 0.015098856966326846, "frac_reward_zero_std": 0.0, "grad_norm": 0.7848347425460815, "learning_rate": 8.818181818181819e-06, "loss": -0.1899, "num_tokens": 842434.0, "reward": 0.5062733888626099, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.6136363744735718, "reward_count_adherence_std": 0.25132471323013306, "reward_meter_mean": 0.7168420553207397, "reward_meter_std": 0.3972436785697937, "reward_std": 0.2856999337673187, "reward_total_composite_mean": 0.5062733888626099, "reward_total_composite_std": 0.2856999337673187, "reward_total_mean": 0.5062733888626099, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.6136363744735718, "rewards/count_adherence/std": 0.25132471323013306, "rewards/meter/mean": 0.7168420553207397, "rewards/meter/std": 0.3972436785697937, "rewards/total_composite/mean": 0.5062733888626099, "rewards/total_composite/std": 0.2856999337673187, "sampling/importance_sampling_ratio/max": 1.6002336740493774, "sampling/importance_sampling_ratio/mean": 1.0016242265701294, "sampling/importance_sampling_ratio/min": 0.3409028947353363, "sampling/sampling_logp_difference/max": 1.076157569885254, "sampling/sampling_logp_difference/mean": 0.008826361037790775, "step": 391 }, { "clip_ratio/high_max": 0.007834467338398099, "clip_ratio/high_mean": 0.007834467338398099, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007834467338398099, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 304.0, "completions/mean_length": 373.25, "completions/mean_terminated_length": 290.0, "completions/min_length": 283.0, "completions/min_terminated_length": 283.0, "entropy": 0.05020246421918273, "epoch": 0.01513747296879827, "frac_reward_zero_std": 0.0, "grad_norm": 0.6587200164794922, "learning_rate": 8.815151515151516e-06, "loss": -0.3491, "num_tokens": 845556.0, "reward": 0.5244123935699463, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.5277777910232544, "reward_count_adherence_std": 0.37912923097610474, "reward_meter_mean": 0.8696821331977844, "reward_meter_std": 0.35143736004829407, "reward_std": 0.3767135441303253, "reward_total_composite_mean": 0.5244123935699463, "reward_total_composite_std": 0.3767135441303253, "reward_total_mean": 0.5244123935699463, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.5277777910232544, "rewards/count_adherence/std": 0.37912923097610474, "rewards/meter/mean": 0.8696821331977844, "rewards/meter/std": 0.35143736004829407, "rewards/total_composite/mean": 0.5244123935699463, "rewards/total_composite/std": 0.3767135441303253, "sampling/importance_sampling_ratio/max": 1.8669248819351196, "sampling/importance_sampling_ratio/mean": 1.002270221710205, "sampling/importance_sampling_ratio/min": 0.33716630935668945, "sampling/sampling_logp_difference/max": 1.0871790647506714, "sampling/sampling_logp_difference/mean": 0.015206166543066502, "step": 392 }, { "clip_ratio/high_max": 0.06486599263735116, "clip_ratio/high_mean": 0.06486599263735116, "clip_ratio/low_mean": 0.010939412750303745, "clip_ratio/low_min": 0.010939412750303745, "clip_ratio/region_mean": 0.0758054053876549, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 76.375, "completions/mean_terminated_length": 76.375, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.4674673527479172, "epoch": 0.015176088971269694, "frac_reward_zero_std": 0.0, "grad_norm": 8.689268112182617, "learning_rate": 8.812121212121213e-06, "loss": 0.0322, "num_tokens": 847311.0, "reward": 0.8588340878486633, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8588340878486633, "reward_meter_std": 0.2888956665992737, "reward_std": 0.2888956665992737, "reward_total_composite_mean": 0.8588340878486633, "reward_total_composite_std": 0.2888956665992737, "reward_total_mean": 0.8588340878486633, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8588340878486633, "rewards/meter/std": 0.2888956665992737, "rewards/total_composite/mean": 0.8588340878486633, "rewards/total_composite/std": 0.2888956665992737, "sampling/importance_sampling_ratio/max": 1.9332025051116943, "sampling/importance_sampling_ratio/mean": 0.9985421895980835, "sampling/importance_sampling_ratio/min": 0.13957762718200684, "sampling/sampling_logp_difference/max": 1.9691343307495117, "sampling/sampling_logp_difference/mean": 0.07139719277620316, "step": 393 }, { "clip_ratio/high_max": 0.028151679784059525, "clip_ratio/high_mean": 0.028151679784059525, "clip_ratio/low_mean": 0.007181095774285495, "clip_ratio/low_min": 0.007181095774285495, "clip_ratio/region_mean": 0.03533277555834502, "completions/clipped_ratio": 0.0, "completions/max_length": 74.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 66.125, "completions/mean_terminated_length": 66.125, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.37163497880101204, "epoch": 0.015214704973741118, "frac_reward_zero_std": 0.0, "grad_norm": 4.890065670013428, "learning_rate": 8.809090909090909e-06, "loss": 0.0681, "num_tokens": 849152.0, "reward": 0.9758315086364746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9758315086364746, "reward_meter_std": 0.012030374258756638, "reward_std": 0.012030377984046936, "reward_total_composite_mean": 0.9758315086364746, "reward_total_composite_std": 0.012030374258756638, "reward_total_mean": 0.9758315086364746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9758315086364746, "rewards/meter/std": 0.012030374258756638, "rewards/total_composite/mean": 0.9758315086364746, "rewards/total_composite/std": 0.012030374258756638, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.004264235496521, "sampling/importance_sampling_ratio/min": 0.4598883390426636, "sampling/sampling_logp_difference/max": 0.8468852043151855, "sampling/sampling_logp_difference/mean": 0.048741716891527176, "step": 394 }, { "clip_ratio/high_max": 0.012422295869328082, "clip_ratio/high_mean": 0.012422295869328082, "clip_ratio/low_mean": 0.009408602491021156, "clip_ratio/low_min": 0.009408602491021156, "clip_ratio/region_mean": 0.021830898360349238, "completions/clipped_ratio": 0.0, "completions/max_length": 265.0, "completions/max_terminated_length": 265.0, "completions/mean_length": 228.625, "completions/mean_terminated_length": 228.625, "completions/min_length": 186.0, "completions/min_terminated_length": 186.0, "entropy": 0.17339316615834832, "epoch": 0.015253320976212542, "frac_reward_zero_std": 0.0, "grad_norm": 2.795933485031128, "learning_rate": 8.806060606060608e-06, "loss": -0.0587, "num_tokens": 852613.0, "reward": 0.8257385492324829, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625820279121399, "reward_meter_mean": 0.9906454086303711, "reward_meter_std": 0.012306920252740383, "reward_std": 0.3412370979785919, "reward_total_composite_mean": 0.8257385492324829, "reward_total_composite_std": 0.3412371277809143, "reward_total_mean": 0.8257385492324829, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625820279121399, "rewards/meter/mean": 0.9906454086303711, "rewards/meter/std": 0.012306920252740383, "rewards/total_composite/mean": 0.8257385492324829, "rewards/total_composite/std": 0.3412371277809143, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0015069246292114, "sampling/importance_sampling_ratio/min": 0.3412272036075592, "sampling/sampling_logp_difference/max": 1.5854034423828125, "sampling/sampling_logp_difference/mean": 0.02395275980234146, "step": 395 }, { "clip_ratio/high_max": 0.034834470599889755, "clip_ratio/high_mean": 0.034834470599889755, "clip_ratio/low_mean": 0.03667238587513566, "clip_ratio/low_min": 0.03667238587513566, "clip_ratio/region_mean": 0.07150685647502542, "completions/clipped_ratio": 0.0, "completions/max_length": 40.0, "completions/max_terminated_length": 40.0, "completions/mean_length": 35.0, "completions/mean_terminated_length": 35.0, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.7259577997028828, "epoch": 0.015291936978683966, "frac_reward_zero_std": 0.0, "grad_norm": 15.071035385131836, "learning_rate": 8.803030303030303e-06, "loss": -0.0516, "num_tokens": 854021.0, "reward": 0.9902995824813843, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9902995824813843, "reward_meter_std": 0.008138173259794712, "reward_std": 0.008138181641697884, "reward_total_composite_mean": 0.9902995824813843, "reward_total_composite_std": 0.008138173259794712, "reward_total_mean": 0.9902995824813843, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9902995824813843, "rewards/meter/std": 0.008138173259794712, "rewards/total_composite/mean": 0.9902995824813843, "rewards/total_composite/std": 0.008138173259794712, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0173804759979248, "sampling/importance_sampling_ratio/min": 0.2798110842704773, "sampling/sampling_logp_difference/max": 1.2736406326293945, "sampling/sampling_logp_difference/mean": 0.08739858120679855, "step": 396 }, { "clip_ratio/high_max": 0.04474749346263707, "clip_ratio/high_mean": 0.04474749346263707, "clip_ratio/low_mean": 0.011363636702299118, "clip_ratio/low_min": 0.011363636702299118, "clip_ratio/region_mean": 0.056111130164936185, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 134.25, "completions/mean_terminated_length": 80.28572082519531, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.4520561061799526, "epoch": 0.01533055298115539, "frac_reward_zero_std": 0.0, "grad_norm": 4.2064313888549805, "learning_rate": 8.8e-06, "loss": 0.0085, "num_tokens": 855791.0, "reward": 0.865929901599884, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.865929901599884, "reward_meter_std": 0.3411285877227783, "reward_std": 0.3411285877227783, "reward_total_composite_mean": 0.865929901599884, "reward_total_composite_std": 0.3411285877227783, "reward_total_mean": 0.865929901599884, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.865929901599884, "rewards/meter/std": 0.3411285877227783, "rewards/total_composite/mean": 0.865929901599884, "rewards/total_composite/std": 0.3411285877227783, "sampling/importance_sampling_ratio/max": 1.667251706123352, "sampling/importance_sampling_ratio/mean": 1.0096566677093506, "sampling/importance_sampling_ratio/min": 0.19086399674415588, "sampling/sampling_logp_difference/max": 1.6561942100524902, "sampling/sampling_logp_difference/mean": 0.07304941862821579, "step": 397 }, { "clip_ratio/high_max": 0.04711233067791909, "clip_ratio/high_mean": 0.04711233067791909, "clip_ratio/low_mean": 0.005040322430431843, "clip_ratio/low_min": 0.005040322430431843, "clip_ratio/region_mean": 0.05215265310835093, "completions/clipped_ratio": 0.0, "completions/max_length": 124.0, "completions/max_terminated_length": 124.0, "completions/mean_length": 89.875, "completions/mean_terminated_length": 89.875, "completions/min_length": 75.0, "completions/min_terminated_length": 75.0, "entropy": 0.38309746980667114, "epoch": 0.015369168983626814, "frac_reward_zero_std": 0.0, "grad_norm": 4.518268585205078, "learning_rate": 8.796969696969698e-06, "loss": 0.1437, "num_tokens": 857766.0, "reward": 0.9344407320022583, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9967172145843506, "reward_meter_std": 0.003067870857194066, "reward_std": 0.17628978192806244, "reward_total_composite_mean": 0.9344407320022583, "reward_total_composite_std": 0.17628978192806244, "reward_total_mean": 0.9344407320022583, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9967172145843506, "rewards/meter/std": 0.003067870857194066, "rewards/total_composite/mean": 0.9344407320022583, "rewards/total_composite/std": 0.17628978192806244, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002355694770813, "sampling/importance_sampling_ratio/min": 0.2568609118461609, "sampling/sampling_logp_difference/max": 1.3592205047607422, "sampling/sampling_logp_difference/mean": 0.05183165520429611, "step": 398 }, { "clip_ratio/high_max": 0.03413120610639453, "clip_ratio/high_mean": 0.03413120610639453, "clip_ratio/low_mean": 0.03256993810646236, "clip_ratio/low_min": 0.03256993810646236, "clip_ratio/region_mean": 0.06670114421285689, "completions/clipped_ratio": 0.0, "completions/max_length": 61.0, "completions/max_terminated_length": 61.0, "completions/mean_length": 53.75, "completions/mean_terminated_length": 53.75, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.45951317623257637, "epoch": 0.015407784986098239, "frac_reward_zero_std": 0.0, "grad_norm": 10.965712547302246, "learning_rate": 8.793939393939395e-06, "loss": 0.0428, "num_tokens": 859500.0, "reward": 0.26512396335601807, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.37250423431396484, "reward_meter_std": 0.42634570598602295, "reward_std": 0.39319032430648804, "reward_total_composite_mean": 0.26512396335601807, "reward_total_composite_std": 0.3931903541088104, "reward_total_mean": 0.26512396335601807, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.37250423431396484, "rewards/meter/std": 0.42634570598602295, "rewards/total_composite/mean": 0.26512396335601807, "rewards/total_composite/std": 0.3931903541088104, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.001451015472412, "sampling/importance_sampling_ratio/min": 0.08536264300346375, "sampling/sampling_logp_difference/max": 2.4608466625213623, "sampling/sampling_logp_difference/mean": 0.0987580195069313, "step": 399 }, { "clip_ratio/high_max": 0.011500443739350885, "clip_ratio/high_mean": 0.011500443739350885, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.011500443739350885, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 157.0, "completions/mean_length": 196.25, "completions/mean_terminated_length": 151.1428680419922, "completions/min_length": 148.0, "completions/min_terminated_length": 148.0, "entropy": 0.0809963047504425, "epoch": 0.015446400988569663, "frac_reward_zero_std": 0.0, "grad_norm": 0.6731557250022888, "learning_rate": 8.790909090909092e-06, "loss": -0.2368, "num_tokens": 862030.0, "reward": 0.6456302404403687, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.65625, "reward_count_adherence_std": 0.2651650309562683, "reward_meter_mean": 0.9850339889526367, "reward_meter_std": 0.02169320359826088, "reward_std": 0.2613680958747864, "reward_total_composite_mean": 0.6456302404403687, "reward_total_composite_std": 0.26136812567710876, "reward_total_mean": 0.6456302404403687, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.65625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/meter/mean": 0.9850339889526367, "rewards/meter/std": 0.02169320359826088, "rewards/total_composite/mean": 0.6456302404403687, "rewards/total_composite/std": 0.26136812567710876, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002915382385254, "sampling/importance_sampling_ratio/min": 0.18668344616889954, "sampling/sampling_logp_difference/max": 1.6783409118652344, "sampling/sampling_logp_difference/mean": 0.020483043044805527, "step": 400 }, { "epoch": 0.015446400988569663, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.41346153846153844, "eval_completions/max_length": 512.0, "eval_completions/max_terminated_length": 400.53846153846155, "eval_completions/mean_length": 344.08653846153845, "eval_completions/mean_terminated_length": 226.2978057861328, "eval_completions/min_length": 85.23076923076923, "eval_completions/min_terminated_length": 85.23076923076923, "eval_entropy": 0.19937350027836287, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 862030.0, "eval_reward": 0.4161693981060615, "eval_reward_arabic_clean_mean": 0.9903846153846154, "eval_reward_arabic_clean_std": 0.027196414195574246, "eval_reward_count_adherence_mean": 0.6621637413134942, "eval_reward_count_adherence_std": 0.3351786213998611, "eval_reward_meter_mean": 0.6171861015833341, "eval_reward_meter_std": 0.42123945630513704, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.4161693981060615, "eval_reward_total_composite_std": 0.378701776266098, "eval_reward_total_mean": 0.4161693981060615, "eval_rewards/arabic_clean/mean": 0.9903846153846154, "eval_rewards/arabic_clean/std": 0.027196414195574246, "eval_rewards/count_adherence/mean": 0.6621637413134942, "eval_rewards/count_adherence/std": 0.3351786213998611, "eval_rewards/meter/mean": 0.6171861015833341, "eval_rewards/meter/std": 0.42123945630513704, "eval_rewards/total_composite/mean": 0.4161693981060615, "eval_rewards/total_composite/std": 0.378701776266098, "eval_runtime": 96.6201, "eval_samples_per_second": 1.076, "eval_sampling/importance_sampling_ratio/max": 1.3838598086283758, "eval_sampling/importance_sampling_ratio/mean": 1.0045312092854426, "eval_sampling/importance_sampling_ratio/min": 0.40342745643395644, "eval_sampling/sampling_logp_difference/max": 0.9377481570610633, "eval_sampling/sampling_logp_difference/mean": 0.018011176170637973, "eval_steps_per_second": 0.135, "step": 400 }, { "clip_ratio/high_max": 0.011423650896176696, "clip_ratio/high_mean": 0.011423650896176696, "clip_ratio/low_mean": 0.04286885913461447, "clip_ratio/low_min": 0.04286885913461447, "clip_ratio/region_mean": 0.05429251003079116, "completions/clipped_ratio": 0.0, "completions/max_length": 83.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 70.375, "completions/mean_terminated_length": 70.375, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.6498333364725113, "epoch": 0.015485016991041087, "frac_reward_zero_std": 0.0, "grad_norm": 6.882446765899658, "learning_rate": 8.787878787878788e-06, "loss": 0.0529, "num_tokens": 863793.0, "reward": 0.5120395421981812, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5120395421981812, "reward_meter_std": 0.39659610390663147, "reward_std": 0.39659610390663147, "reward_total_composite_mean": 0.5120395421981812, "reward_total_composite_std": 0.39659610390663147, "reward_total_mean": 0.5120395421981812, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5120395421981812, "rewards/meter/std": 0.39659610390663147, "rewards/total_composite/mean": 0.5120395421981812, "rewards/total_composite/std": 0.39659610390663147, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0185896158218384, "sampling/importance_sampling_ratio/min": 0.43671727180480957, "sampling/sampling_logp_difference/max": 0.8284692764282227, "sampling/sampling_logp_difference/mean": 0.079770028591156, "step": 401 }, { "clip_ratio/high_max": 0.01652618101797998, "clip_ratio/high_mean": 0.01652618101797998, "clip_ratio/low_mean": 0.013676032423973083, "clip_ratio/low_min": 0.013676032423973083, "clip_ratio/region_mean": 0.030202213441953063, "completions/clipped_ratio": 0.0, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 90.875, "completions/mean_terminated_length": 90.875, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "entropy": 0.2551422342658043, "epoch": 0.01552363299351251, "frac_reward_zero_std": 0.0, "grad_norm": 3.843118190765381, "learning_rate": 8.784848484848487e-06, "loss": -0.0316, "num_tokens": 865768.0, "reward": 0.9842378497123718, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9842378497123718, "reward_meter_std": 0.0201681200414896, "reward_std": 0.020168133080005646, "reward_total_composite_mean": 0.9842378497123718, "reward_total_composite_std": 0.0201681200414896, "reward_total_mean": 0.9842378497123718, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9842378497123718, "rewards/meter/std": 0.0201681200414896, "rewards/total_composite/mean": 0.9842378497123718, "rewards/total_composite/std": 0.0201681200414896, "sampling/importance_sampling_ratio/max": 1.9674099683761597, "sampling/importance_sampling_ratio/mean": 1.0152220726013184, "sampling/importance_sampling_ratio/min": 0.31482240557670593, "sampling/sampling_logp_difference/max": 1.155746579170227, "sampling/sampling_logp_difference/mean": 0.03747996687889099, "step": 402 }, { "clip_ratio/high_max": 0.028843345178756863, "clip_ratio/high_mean": 0.028843345178756863, "clip_ratio/low_mean": 0.000936329597607255, "clip_ratio/low_min": 0.000936329597607255, "clip_ratio/region_mean": 0.029779674776364118, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 267.0, "completions/mean_length": 217.5, "completions/mean_terminated_length": 175.42857360839844, "completions/min_length": 140.0, "completions/min_terminated_length": 140.0, "entropy": 0.3300076089799404, "epoch": 0.015562248995983935, "frac_reward_zero_std": 0.0, "grad_norm": 1.8304016590118408, "learning_rate": 8.781818181818182e-06, "loss": -0.113, "num_tokens": 868356.0, "reward": 0.5801796913146973, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.5833333730697632, "reward_count_adherence_std": 0.29546844959259033, "reward_meter_mean": 0.9523094892501831, "reward_meter_std": 0.1186181977391243, "reward_std": 0.29439738392829895, "reward_total_composite_mean": 0.5801796913146973, "reward_total_composite_std": 0.29439741373062134, "reward_total_mean": 0.5801796913146973, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.5833333730697632, "rewards/count_adherence/std": 0.29546844959259033, "rewards/meter/mean": 0.9523094892501831, "rewards/meter/std": 0.1186181977391243, "rewards/total_composite/mean": 0.5801796913146973, "rewards/total_composite/std": 0.29439741373062134, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0064983367919922, "sampling/importance_sampling_ratio/min": 0.33814290165901184, "sampling/sampling_logp_difference/max": 1.0842866897583008, "sampling/sampling_logp_difference/mean": 0.043538108468055725, "step": 403 }, { "clip_ratio/high_max": 0.029422825085930526, "clip_ratio/high_mean": 0.029422825085930526, "clip_ratio/low_mean": 0.005681818351149559, "clip_ratio/low_min": 0.005681818351149559, "clip_ratio/region_mean": 0.035104643437080085, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 88.0, "completions/mean_length": 187.25, "completions/mean_terminated_length": 79.0, "completions/min_length": 75.0, "completions/min_terminated_length": 75.0, "entropy": 0.26876694336533546, "epoch": 0.015600864998455359, "frac_reward_zero_std": 0.0, "grad_norm": 1.5644749402999878, "learning_rate": 8.77878787878788e-06, "loss": -0.1182, "num_tokens": 870166.0, "reward": 0.5707218647003174, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_meter_mean": 0.7447091341018677, "reward_meter_std": 0.3070685863494873, "reward_std": 0.45596015453338623, "reward_total_composite_mean": 0.5707218647003174, "reward_total_composite_std": 0.45596015453338623, "reward_total_mean": 0.5707218647003174, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/meter/mean": 0.7447091341018677, "rewards/meter/std": 0.3070685863494873, "rewards/total_composite/mean": 0.5707218647003174, "rewards/total_composite/std": 0.45596015453338623, "sampling/importance_sampling_ratio/max": 1.7909971475601196, "sampling/importance_sampling_ratio/mean": 1.0064294338226318, "sampling/importance_sampling_ratio/min": 0.2336532175540924, "sampling/sampling_logp_difference/max": 1.4539172649383545, "sampling/sampling_logp_difference/mean": 0.06043194606900215, "step": 404 }, { "clip_ratio/high_max": 0.0038860102649778128, "clip_ratio/high_mean": 0.0038860102649778128, "clip_ratio/low_mean": 0.012407735688611865, "clip_ratio/low_min": 0.012407735688611865, "clip_ratio/region_mean": 0.016293745953589678, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 256.0, "completions/mean_length": 300.75, "completions/mean_terminated_length": 230.33334350585938, "completions/min_length": 193.0, "completions/min_terminated_length": 193.0, "entropy": 0.12349590379744768, "epoch": 0.015639481000926783, "frac_reward_zero_std": 0.0, "grad_norm": 1.1297802925109863, "learning_rate": 8.775757575757577e-06, "loss": 0.181, "num_tokens": 872988.0, "reward": 0.23586036264896393, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.22160132229328156, "reward_meter_mean": 0.37604400515556335, "reward_meter_std": 0.43697869777679443, "reward_std": 0.3007969558238983, "reward_total_composite_mean": 0.23586036264896393, "reward_total_composite_std": 0.3007969558238983, "reward_total_mean": 0.23586036264896393, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.22160132229328156, "rewards/meter/mean": 0.37604400515556335, "rewards/meter/std": 0.43697869777679443, "rewards/total_composite/mean": 0.23586036264896393, "rewards/total_composite/std": 0.3007969558238983, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0042189359664917, "sampling/importance_sampling_ratio/min": 0.2869817018508911, "sampling/sampling_logp_difference/max": 1.2483367919921875, "sampling/sampling_logp_difference/mean": 0.023270348086953163, "step": 405 }, { "clip_ratio/high_max": 0.0061827958561480045, "clip_ratio/high_mean": 0.0061827958561480045, "clip_ratio/low_mean": 0.011723854579031467, "clip_ratio/low_min": 0.011723854579031467, "clip_ratio/region_mean": 0.017906650435179472, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 62.625, "completions/mean_terminated_length": 62.625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.21097453031688929, "epoch": 0.015678097003398207, "frac_reward_zero_std": 0.0, "grad_norm": 4.1059088706970215, "learning_rate": 8.772727272727274e-06, "loss": 0.0324, "num_tokens": 874753.0, "reward": 0.9913897514343262, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9913897514343262, "reward_meter_std": 0.003956401254981756, "reward_std": 0.003956401254981756, "reward_total_composite_mean": 0.9913897514343262, "reward_total_composite_std": 0.003956401254981756, "reward_total_mean": 0.9913897514343262, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9913897514343262, "rewards/meter/std": 0.003956401254981756, "rewards/total_composite/mean": 0.9913897514343262, "rewards/total_composite/std": 0.003956401254981756, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0122790336608887, "sampling/importance_sampling_ratio/min": 0.4850950837135315, "sampling/sampling_logp_difference/max": 0.9925615787506104, "sampling/sampling_logp_difference/mean": 0.027037320658564568, "step": 406 }, { "clip_ratio/high_max": 0.016171834780834615, "clip_ratio/high_mean": 0.016171834780834615, "clip_ratio/low_mean": 0.011579734331462532, "clip_ratio/low_min": 0.011579734331462532, "clip_ratio/region_mean": 0.027751569112297148, "completions/clipped_ratio": 0.0, "completions/max_length": 168.0, "completions/max_terminated_length": 168.0, "completions/mean_length": 138.375, "completions/mean_terminated_length": 138.375, "completions/min_length": 121.0, "completions/min_terminated_length": 121.0, "entropy": 0.1530680824071169, "epoch": 0.01571671300586963, "frac_reward_zero_std": 0.0, "grad_norm": 3.022797107696533, "learning_rate": 8.76969696969697e-06, "loss": 0.0382, "num_tokens": 877196.0, "reward": 0.46666404604911804, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6999959945678711, "reward_meter_std": 0.3435265123844147, "reward_std": 0.22901766002178192, "reward_total_composite_mean": 0.46666404604911804, "reward_total_composite_std": 0.22901767492294312, "reward_total_mean": 0.46666404604911804, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6999959945678711, "rewards/meter/std": 0.3435265123844147, "rewards/total_composite/mean": 0.46666404604911804, "rewards/total_composite/std": 0.22901767492294312, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0028660297393799, "sampling/importance_sampling_ratio/min": 0.24043114483356476, "sampling/sampling_logp_difference/max": 1.4253215789794922, "sampling/sampling_logp_difference/mean": 0.022317711263895035, "step": 407 }, { "clip_ratio/high_max": 0.08028767257928848, "clip_ratio/high_mean": 0.08028767257928848, "clip_ratio/low_mean": 0.036312646232545376, "clip_ratio/low_min": 0.036312646232545376, "clip_ratio/region_mean": 0.11660031881183386, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 59.0, "completions/mean_terminated_length": 59.0, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.9289319105446339, "epoch": 0.015755329008341055, "frac_reward_zero_std": 0.0, "grad_norm": 10.218791007995605, "learning_rate": 8.766666666666669e-06, "loss": 0.1037, "num_tokens": 878828.0, "reward": 0.6509081721305847, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6509081721305847, "reward_meter_std": 0.4415837228298187, "reward_std": 0.44158369302749634, "reward_total_composite_mean": 0.6509081721305847, "reward_total_composite_std": 0.4415837228298187, "reward_total_mean": 0.6509081721305847, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6509081721305847, "rewards/meter/std": 0.4415837228298187, "rewards/total_composite/mean": 0.6509081721305847, "rewards/total_composite/std": 0.4415837228298187, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.02310311794281, "sampling/importance_sampling_ratio/min": 0.06255759298801422, "sampling/sampling_logp_difference/max": 2.771667718887329, "sampling/sampling_logp_difference/mean": 0.11866805702447891, "step": 408 }, { "clip_ratio/high_max": 0.009341755299828947, "clip_ratio/high_mean": 0.009341755299828947, "clip_ratio/low_mean": 0.0006944444612599909, "clip_ratio/low_min": 0.0006944444612599909, "clip_ratio/region_mean": 0.010036199761088938, "completions/clipped_ratio": 0.0, "completions/max_length": 216.0, "completions/max_terminated_length": 216.0, "completions/mean_length": 175.625, "completions/mean_terminated_length": 175.625, "completions/min_length": 159.0, "completions/min_terminated_length": 159.0, "entropy": 0.07792735006660223, "epoch": 0.01579394501081248, "frac_reward_zero_std": 0.0, "grad_norm": 1.702805995941162, "learning_rate": 8.763636363636364e-06, "loss": 0.0206, "num_tokens": 881641.0, "reward": 0.7126193046569824, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9501590132713318, "reward_meter_std": 0.11174096912145615, "reward_std": 0.08380571752786636, "reward_total_composite_mean": 0.7126193046569824, "reward_total_composite_std": 0.08380572497844696, "reward_total_mean": 0.7126193046569824, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9501590132713318, "rewards/meter/std": 0.11174096912145615, "rewards/total_composite/mean": 0.7126193046569824, "rewards/total_composite/std": 0.08380572497844696, "sampling/importance_sampling_ratio/max": 1.7096338272094727, "sampling/importance_sampling_ratio/mean": 1.001296043395996, "sampling/importance_sampling_ratio/min": 0.38079074025154114, "sampling/sampling_logp_difference/max": 0.9655053615570068, "sampling/sampling_logp_difference/mean": 0.013060882687568665, "step": 409 }, { "clip_ratio/high_max": 0.012198542011901736, "clip_ratio/high_mean": 0.012198542011901736, "clip_ratio/low_mean": 0.003342245938256383, "clip_ratio/low_min": 0.003342245938256383, "clip_ratio/region_mean": 0.01554078795015812, "completions/clipped_ratio": 0.0, "completions/max_length": 244.0, "completions/max_terminated_length": 244.0, "completions/mean_length": 197.625, "completions/mean_terminated_length": 197.625, "completions/min_length": 182.0, "completions/min_terminated_length": 182.0, "entropy": 0.0969978254288435, "epoch": 0.015832561013283904, "frac_reward_zero_std": 0.0, "grad_norm": 2.0530569553375244, "learning_rate": 8.760606060606061e-06, "loss": -0.0088, "num_tokens": 884542.0, "reward": 0.7310122847557068, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.8907101154327393, "reward_meter_std": 0.20771878957748413, "reward_std": 0.1586739867925644, "reward_total_composite_mean": 0.7310122847557068, "reward_total_composite_std": 0.1586739867925644, "reward_total_mean": 0.7310122847557068, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.8907101154327393, "rewards/meter/std": 0.20771878957748413, "rewards/total_composite/mean": 0.7310122847557068, "rewards/total_composite/std": 0.1586739867925644, "sampling/importance_sampling_ratio/max": 1.6074455976486206, "sampling/importance_sampling_ratio/mean": 0.9990739822387695, "sampling/importance_sampling_ratio/min": 0.009806273505091667, "sampling/sampling_logp_difference/max": 4.624732971191406, "sampling/sampling_logp_difference/mean": 0.017095215618610382, "step": 410 }, { "clip_ratio/high_max": 0.02881905622780323, "clip_ratio/high_mean": 0.02881905622780323, "clip_ratio/low_mean": 0.005724609247408807, "clip_ratio/low_min": 0.005724609247408807, "clip_ratio/region_mean": 0.03454366547521204, "completions/clipped_ratio": 0.0, "completions/max_length": 141.0, "completions/max_terminated_length": 141.0, "completions/mean_length": 105.375, "completions/mean_terminated_length": 105.375, "completions/min_length": 83.0, "completions/min_terminated_length": 83.0, "entropy": 0.23645233362913132, "epoch": 0.015871177015755328, "frac_reward_zero_std": 0.0, "grad_norm": 4.408254623413086, "learning_rate": 8.757575757575759e-06, "loss": 0.1971, "num_tokens": 886841.0, "reward": 0.8437220454216003, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_meter_mean": 0.9555299282073975, "reward_meter_std": 0.10529791563749313, "reward_std": 0.2139330804347992, "reward_total_composite_mean": 0.8437220454216003, "reward_total_composite_std": 0.2139330953359604, "reward_total_mean": 0.8437220454216003, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/meter/mean": 0.9555299282073975, "rewards/meter/std": 0.10529791563749313, "rewards/total_composite/mean": 0.8437220454216003, "rewards/total_composite/std": 0.2139330953359604, "sampling/importance_sampling_ratio/max": 1.7728590965270996, "sampling/importance_sampling_ratio/mean": 1.0038602352142334, "sampling/importance_sampling_ratio/min": 0.2763468325138092, "sampling/sampling_logp_difference/max": 1.2860984802246094, "sampling/sampling_logp_difference/mean": 0.03925402835011482, "step": 411 }, { "clip_ratio/high_max": 0.005883037491003051, "clip_ratio/high_mean": 0.005883037491003051, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.005883037491003051, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 441.0, "completions/mean_length": 413.5, "completions/mean_terminated_length": 399.4285888671875, "completions/min_length": 378.0, "completions/min_terminated_length": 378.0, "entropy": 0.03046043962240219, "epoch": 0.015909793018226752, "frac_reward_zero_std": 0.0, "grad_norm": 0.3299441337585449, "learning_rate": 8.754545454545456e-06, "loss": -0.2932, "num_tokens": 891477.0, "reward": 0.8021494150161743, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8194444179534912, "reward_count_adherence_std": 0.29057809710502625, "reward_meter_mean": 0.8727073669433594, "reward_meter_std": 0.34727609157562256, "reward_std": 0.3275650143623352, "reward_total_composite_mean": 0.8021494150161743, "reward_total_composite_std": 0.3275650441646576, "reward_total_mean": 0.8021494150161743, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8194444179534912, "rewards/count_adherence/std": 0.29057809710502625, "rewards/meter/mean": 0.8727073669433594, "rewards/meter/std": 0.34727609157562256, "rewards/total_composite/mean": 0.8021494150161743, "rewards/total_composite/std": 0.3275650441646576, "sampling/importance_sampling_ratio/max": 1.6943782567977905, "sampling/importance_sampling_ratio/mean": 0.9996734857559204, "sampling/importance_sampling_ratio/min": 0.22663362324237823, "sampling/sampling_logp_difference/max": 1.4844205379486084, "sampling/sampling_logp_difference/mean": 0.007050658110529184, "step": 412 }, { "clip_ratio/high_max": 0.05882604233920574, "clip_ratio/high_mean": 0.05882604233920574, "clip_ratio/low_mean": 0.012824675533920527, "clip_ratio/low_min": 0.012824675533920527, "clip_ratio/region_mean": 0.07165071787312627, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 88.0, "completions/mean_length": 167.125, "completions/mean_terminated_length": 52.16666793823242, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.5243904180824757, "epoch": 0.015948409020698176, "frac_reward_zero_std": 0.0, "grad_norm": 2.0739166736602783, "learning_rate": 8.751515151515151e-06, "loss": 0.0018, "num_tokens": 892998.0, "reward": 0.5062292814254761, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.5175492167472839, "reward_meter_mean": 0.5100301504135132, "reward_meter_std": 0.5075311064720154, "reward_std": 0.5117626786231995, "reward_total_composite_mean": 0.5062292814254761, "reward_total_composite_std": 0.5117626786231995, "reward_total_mean": 0.5062292814254761, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.5175492167472839, "rewards/meter/mean": 0.5100301504135132, "rewards/meter/std": 0.5075311064720154, "rewards/total_composite/mean": 0.5062292814254761, "rewards/total_composite/std": 0.5117626786231995, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.01053786277771, "sampling/importance_sampling_ratio/min": 0.5460512638092041, "sampling/sampling_logp_difference/max": 0.7841591835021973, "sampling/sampling_logp_difference/mean": 0.06872761994600296, "step": 413 }, { "clip_ratio/high_max": 0.06984005169942975, "clip_ratio/high_mean": 0.06984005169942975, "clip_ratio/low_mean": 0.009469697251915932, "clip_ratio/low_min": 0.009469697251915932, "clip_ratio/region_mean": 0.07930974895134568, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 57.625, "completions/mean_terminated_length": 57.625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.582982636988163, "epoch": 0.0159870250231696, "frac_reward_zero_std": 0.0, "grad_norm": 10.703254699707031, "learning_rate": 8.748484848484849e-06, "loss": 0.0655, "num_tokens": 894651.0, "reward": 0.9551189541816711, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9551189541816711, "reward_meter_std": 0.09812162071466446, "reward_std": 0.09812159836292267, "reward_total_composite_mean": 0.9551189541816711, "reward_total_composite_std": 0.09812162071466446, "reward_total_mean": 0.9551189541816711, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9551189541816711, "rewards/meter/std": 0.09812162071466446, "rewards/total_composite/mean": 0.9551189541816711, "rewards/total_composite/std": 0.09812162071466446, "sampling/importance_sampling_ratio/max": 1.675656795501709, "sampling/importance_sampling_ratio/mean": 1.0104643106460571, "sampling/importance_sampling_ratio/min": 0.28781425952911377, "sampling/sampling_logp_difference/max": 1.2454400062561035, "sampling/sampling_logp_difference/mean": 0.07875344157218933, "step": 414 }, { "clip_ratio/high_max": 0.04313966212794185, "clip_ratio/high_mean": 0.04313966212794185, "clip_ratio/low_mean": 0.03434053680393845, "clip_ratio/low_min": 0.03434053680393845, "clip_ratio/region_mean": 0.0774801989318803, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 92.0, "completions/mean_length": 112.125, "completions/mean_terminated_length": 55.000003814697266, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6476233620196581, "epoch": 0.016025641025641024, "frac_reward_zero_std": 0.0, "grad_norm": 4.649420261383057, "learning_rate": 8.745454545454546e-06, "loss": 0.0492, "num_tokens": 896156.0, "reward": 0.28754958510398865, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_meter_mean": 0.2886698246002197, "reward_meter_std": 0.40278124809265137, "reward_std": 0.40368756651878357, "reward_total_composite_mean": 0.28754958510398865, "reward_total_composite_std": 0.40368756651878357, "reward_total_mean": 0.28754958510398865, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/meter/mean": 0.2886698246002197, "rewards/meter/std": 0.40278124809265137, "rewards/total_composite/mean": 0.28754958510398865, "rewards/total_composite/std": 0.40368756651878357, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0061570405960083, "sampling/importance_sampling_ratio/min": 0.2186972051858902, "sampling/sampling_logp_difference/max": 1.5200672149658203, "sampling/sampling_logp_difference/mean": 0.10733786970376968, "step": 415 }, { "clip_ratio/high_max": 0.062005657935515046, "clip_ratio/high_mean": 0.062005657935515046, "clip_ratio/low_mean": 0.03538359794765711, "clip_ratio/low_min": 0.03538359794765711, "clip_ratio/region_mean": 0.09738925588317215, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 57.875, "completions/mean_terminated_length": 57.875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6767406091094017, "epoch": 0.01606425702811245, "frac_reward_zero_std": 0.0, "grad_norm": 7.304360866546631, "learning_rate": 8.742424242424243e-06, "loss": 0.0358, "num_tokens": 897867.0, "reward": 0.9717522859573364, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9717522859573364, "reward_meter_std": 0.027185985818505287, "reward_std": 0.027185987681150436, "reward_total_composite_mean": 0.9717522859573364, "reward_total_composite_std": 0.027185985818505287, "reward_total_mean": 0.9717522859573364, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9717522859573364, "rewards/meter/std": 0.027185985818505287, "rewards/total_composite/mean": 0.9717522859573364, "rewards/total_composite/std": 0.027185985818505287, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0156903266906738, "sampling/importance_sampling_ratio/min": 0.19506938755512238, "sampling/sampling_logp_difference/max": 1.6343998908996582, "sampling/sampling_logp_difference/mean": 0.09120234102010727, "step": 416 }, { "clip_ratio/high_max": 0.021424076927360147, "clip_ratio/high_mean": 0.021424076927360147, "clip_ratio/low_mean": 0.002363372186664492, "clip_ratio/low_min": 0.002363372186664492, "clip_ratio/region_mean": 0.02378744911402464, "completions/clipped_ratio": 0.0, "completions/max_length": 344.0, "completions/max_terminated_length": 344.0, "completions/mean_length": 227.125, "completions/mean_terminated_length": 227.125, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "entropy": 0.2837667972780764, "epoch": 0.016102873030583872, "frac_reward_zero_std": 0.0, "grad_norm": 1.8169100284576416, "learning_rate": 8.73939393939394e-06, "loss": 0.1247, "num_tokens": 901164.0, "reward": 0.5552949905395508, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.925000011920929, "reward_count_adherence_std": 0.14880475401878357, "reward_meter_mean": 0.6192874312400818, "reward_meter_std": 0.45972275733947754, "reward_std": 0.43653252720832825, "reward_total_composite_mean": 0.5552949905395508, "reward_total_composite_std": 0.43653252720832825, "reward_total_mean": 0.5552949905395508, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.925000011920929, "rewards/count_adherence/std": 0.14880475401878357, "rewards/meter/mean": 0.6192874312400818, "rewards/meter/std": 0.45972275733947754, "rewards/total_composite/mean": 0.5552949905395508, "rewards/total_composite/std": 0.43653252720832825, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0012174844741821, "sampling/importance_sampling_ratio/min": 0.27433061599731445, "sampling/sampling_logp_difference/max": 1.3905742168426514, "sampling/sampling_logp_difference/mean": 0.02308918908238411, "step": 417 }, { "clip_ratio/high_max": 0.03858941700309515, "clip_ratio/high_mean": 0.03858941700309515, "clip_ratio/low_mean": 0.11292503494769335, "clip_ratio/low_min": 0.11292503494769335, "clip_ratio/region_mean": 0.1515144519507885, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 50.125, "completions/mean_terminated_length": 50.125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.8871809840202332, "epoch": 0.016141489033055297, "frac_reward_zero_std": 0.0, "grad_norm": 21.298921585083008, "learning_rate": 8.736363636363638e-06, "loss": -0.0317, "num_tokens": 902909.0, "reward": 0.32849666476249695, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.32849666476249695, "reward_meter_std": 0.32036224007606506, "reward_std": 0.32036224007606506, "reward_total_composite_mean": 0.32849666476249695, "reward_total_composite_std": 0.32036224007606506, "reward_total_mean": 0.32849666476249695, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.32849666476249695, "rewards/meter/std": 0.32036224007606506, "rewards/total_composite/mean": 0.32849666476249695, "rewards/total_composite/std": 0.32036224007606506, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0049675703048706, "sampling/importance_sampling_ratio/min": 0.14722536504268646, "sampling/sampling_logp_difference/max": 2.284748077392578, "sampling/sampling_logp_difference/mean": 0.13514763116836548, "step": 418 }, { "clip_ratio/high_max": 0.05910295504145324, "clip_ratio/high_mean": 0.05910295504145324, "clip_ratio/low_mean": 0.00957037159241736, "clip_ratio/low_min": 0.00957037159241736, "clip_ratio/region_mean": 0.0686733266338706, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 73.75, "completions/mean_terminated_length": 73.75, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.5439852885901928, "epoch": 0.01618010503552672, "frac_reward_zero_std": 0.0, "grad_norm": 6.602462291717529, "learning_rate": 8.733333333333333e-06, "loss": 0.0702, "num_tokens": 904739.0, "reward": 0.799231767654419, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.799231767654419, "reward_meter_std": 0.3458506464958191, "reward_std": 0.3458506166934967, "reward_total_composite_mean": 0.799231767654419, "reward_total_composite_std": 0.3458506464958191, "reward_total_mean": 0.799231767654419, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.799231767654419, "rewards/meter/std": 0.3458506464958191, "rewards/total_composite/mean": 0.799231767654419, "rewards/total_composite/std": 0.3458506464958191, "sampling/importance_sampling_ratio/max": 1.8707276582717896, "sampling/importance_sampling_ratio/mean": 0.9987403750419617, "sampling/importance_sampling_ratio/min": 0.34747663140296936, "sampling/sampling_logp_difference/max": 1.0570578575134277, "sampling/sampling_logp_difference/mean": 0.07469379901885986, "step": 419 }, { "clip_ratio/high_max": 0.014262907905504107, "clip_ratio/high_mean": 0.014262907905504107, "clip_ratio/low_mean": 0.006358225247822702, "clip_ratio/low_min": 0.006358225247822702, "clip_ratio/region_mean": 0.02062113315332681, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 72.75, "completions/mean_terminated_length": 72.75, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.13834022916853428, "epoch": 0.016218721037998145, "frac_reward_zero_std": 0.0, "grad_norm": 4.019112586975098, "learning_rate": 8.73030303030303e-06, "loss": 0.0655, "num_tokens": 906465.0, "reward": 0.9897938966751099, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9897938966751099, "reward_meter_std": 0.00681549496948719, "reward_std": 0.006815491709858179, "reward_total_composite_mean": 0.9897938966751099, "reward_total_composite_std": 0.00681549496948719, "reward_total_mean": 0.9897938966751099, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9897938966751099, "rewards/meter/std": 0.00681549496948719, "rewards/total_composite/mean": 0.9897938966751099, "rewards/total_composite/std": 0.00681549496948719, "sampling/importance_sampling_ratio/max": 1.771165132522583, "sampling/importance_sampling_ratio/mean": 1.0009511709213257, "sampling/importance_sampling_ratio/min": 0.07870874553918839, "sampling/sampling_logp_difference/max": 2.5420010089874268, "sampling/sampling_logp_difference/mean": 0.030092770233750343, "step": 420 }, { "clip_ratio/high_max": 0.016083280788734555, "clip_ratio/high_mean": 0.016083280788734555, "clip_ratio/low_mean": 0.005128088872879744, "clip_ratio/low_min": 0.005128088872879744, "clip_ratio/region_mean": 0.0212113696616143, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 157.0, "completions/mean_length": 189.125, "completions/mean_terminated_length": 143.0, "completions/min_length": 136.0, "completions/min_terminated_length": 136.0, "entropy": 0.14536871574819088, "epoch": 0.016257337040469572, "frac_reward_zero_std": 0.0, "grad_norm": 2.0794014930725098, "learning_rate": 8.727272727272728e-06, "loss": -0.119, "num_tokens": 908794.0, "reward": 0.6646036505699158, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.2651650309562683, "reward_meter_mean": 0.6905167698860168, "reward_meter_std": 0.3626475930213928, "reward_std": 0.4017622768878937, "reward_total_composite_mean": 0.6646036505699158, "reward_total_composite_std": 0.4017622768878937, "reward_total_mean": 0.6646036505699158, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/meter/mean": 0.6905167698860168, "rewards/meter/std": 0.3626475930213928, "rewards/total_composite/mean": 0.6646036505699158, "rewards/total_composite/std": 0.4017622768878937, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0038185119628906, "sampling/importance_sampling_ratio/min": 0.39857566356658936, "sampling/sampling_logp_difference/max": 0.9549951553344727, "sampling/sampling_logp_difference/mean": 0.02924906462430954, "step": 421 }, { "clip_ratio/high_max": 0.04184396180789918, "clip_ratio/high_mean": 0.04184396180789918, "clip_ratio/low_mean": 0.004385964944958687, "clip_ratio/low_min": 0.004385964944958687, "clip_ratio/region_mean": 0.046229926752857864, "completions/clipped_ratio": 0.0, "completions/max_length": 140.0, "completions/max_terminated_length": 140.0, "completions/mean_length": 121.375, "completions/mean_terminated_length": 121.375, "completions/min_length": 109.0, "completions/min_terminated_length": 109.0, "entropy": 0.49255986511707306, "epoch": 0.016295953042940996, "frac_reward_zero_std": 0.0, "grad_norm": 4.160637855529785, "learning_rate": 8.724242424242425e-06, "loss": -0.026, "num_tokens": 911117.0, "reward": 0.9373536109924316, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9373536109924316, "reward_meter_std": 0.09886158257722855, "reward_std": 0.09886158257722855, "reward_total_composite_mean": 0.9373536109924316, "reward_total_composite_std": 0.09886158257722855, "reward_total_mean": 0.9373536109924316, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9373536109924316, "rewards/meter/std": 0.09886158257722855, "rewards/total_composite/mean": 0.9373536109924316, "rewards/total_composite/std": 0.09886158257722855, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.011407732963562, "sampling/importance_sampling_ratio/min": 0.25942739844322205, "sampling/sampling_logp_difference/max": 1.349278450012207, "sampling/sampling_logp_difference/mean": 0.05337180942296982, "step": 422 }, { "clip_ratio/high_max": 0.01431451621465385, "clip_ratio/high_mean": 0.01431451621465385, "clip_ratio/low_mean": 0.018862260156311095, "clip_ratio/low_min": 0.018862260156311095, "clip_ratio/region_mean": 0.033176776370964944, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 66.125, "completions/mean_terminated_length": 66.125, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.16816303879022598, "epoch": 0.01633456904541242, "frac_reward_zero_std": 0.0, "grad_norm": 13.163901329040527, "learning_rate": 8.72121212121212e-06, "loss": 0.0591, "num_tokens": 912910.0, "reward": 0.9770172834396362, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9770172834396362, "reward_meter_std": 0.024198686704039574, "reward_std": 0.024198684841394424, "reward_total_composite_mean": 0.9770172834396362, "reward_total_composite_std": 0.024198686704039574, "reward_total_mean": 0.9770172834396362, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9770172834396362, "rewards/meter/std": 0.024198686704039574, "rewards/total_composite/mean": 0.9770172834396362, "rewards/total_composite/std": 0.024198686704039574, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.003563642501831, "sampling/importance_sampling_ratio/min": 0.03152162954211235, "sampling/sampling_logp_difference/max": 3.4570813179016113, "sampling/sampling_logp_difference/mean": 0.04488004371523857, "step": 423 }, { "clip_ratio/high_max": 0.04446423542685807, "clip_ratio/high_mean": 0.04446423542685807, "clip_ratio/low_mean": 0.013393073342740536, "clip_ratio/low_min": 0.013393073342740536, "clip_ratio/region_mean": 0.0578573087695986, "completions/clipped_ratio": 0.0, "completions/max_length": 91.0, "completions/max_terminated_length": 91.0, "completions/mean_length": 78.0, "completions/mean_terminated_length": 78.0, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.281008530408144, "epoch": 0.016373185047883845, "frac_reward_zero_std": 0.0, "grad_norm": 6.008713722229004, "learning_rate": 8.71818181818182e-06, "loss": 0.0378, "num_tokens": 914750.0, "reward": 0.7533670663833618, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7533670663833618, "reward_meter_std": 0.23079943656921387, "reward_std": 0.23079942166805267, "reward_total_composite_mean": 0.7533670663833618, "reward_total_composite_std": 0.23079943656921387, "reward_total_mean": 0.7533670663833618, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7533670663833618, "rewards/meter/std": 0.23079943656921387, "rewards/total_composite/mean": 0.7533670663833618, "rewards/total_composite/std": 0.23079943656921387, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9994415044784546, "sampling/importance_sampling_ratio/min": 0.012960345484316349, "sampling/sampling_logp_difference/max": 4.345860958099365, "sampling/sampling_logp_difference/mean": 0.0553349107503891, "step": 424 }, { "clip_ratio/high_max": 0.025681341998279095, "clip_ratio/high_mean": 0.025681341998279095, "clip_ratio/low_mean": 0.05649581435136497, "clip_ratio/low_min": 0.05649581435136497, "clip_ratio/region_mean": 0.08217715634964406, "completions/clipped_ratio": 0.0, "completions/max_length": 53.0, "completions/max_terminated_length": 53.0, "completions/mean_length": 45.625, "completions/mean_terminated_length": 45.625, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.5226194709539413, "epoch": 0.01641180105035527, "frac_reward_zero_std": 0.0, "grad_norm": 8.99482536315918, "learning_rate": 8.715151515151515e-06, "loss": 0.0023, "num_tokens": 916259.0, "reward": 0.18696027994155884, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.18696027994155884, "reward_meter_std": 0.2777934968471527, "reward_std": 0.2777934968471527, "reward_total_composite_mean": 0.18696027994155884, "reward_total_composite_std": 0.2777934968471527, "reward_total_mean": 0.18696027994155884, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.18696027994155884, "rewards/meter/std": 0.2777934968471527, "rewards/total_composite/mean": 0.18696027994155884, "rewards/total_composite/std": 0.2777934968471527, "sampling/importance_sampling_ratio/max": 1.9791115522384644, "sampling/importance_sampling_ratio/mean": 1.0027213096618652, "sampling/importance_sampling_ratio/min": 0.2798304259777069, "sampling/sampling_logp_difference/max": 1.273571491241455, "sampling/sampling_logp_difference/mean": 0.08858486264944077, "step": 425 }, { "clip_ratio/high_max": 0.04074844322167337, "clip_ratio/high_mean": 0.04074844322167337, "clip_ratio/low_mean": 0.018849206971935928, "clip_ratio/low_min": 0.018849206971935928, "clip_ratio/region_mean": 0.0595976501936093, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 71.375, "completions/mean_terminated_length": 71.375, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.481033593416214, "epoch": 0.016450417052826693, "frac_reward_zero_std": 0.0, "grad_norm": 5.837379455566406, "learning_rate": 8.712121212121212e-06, "loss": 0.0217, "num_tokens": 918078.0, "reward": 0.7051376700401306, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7622324228286743, "reward_meter_std": 0.3091115951538086, "reward_std": 0.31919535994529724, "reward_total_composite_mean": 0.7051376700401306, "reward_total_composite_std": 0.31919533014297485, "reward_total_mean": 0.7051376700401306, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7622324228286743, "rewards/meter/std": 0.3091115951538086, "rewards/total_composite/mean": 0.7051376700401306, "rewards/total_composite/std": 0.31919533014297485, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.010563611984253, "sampling/importance_sampling_ratio/min": 0.030512982979416847, "sampling/sampling_logp_difference/max": 3.489603042602539, "sampling/sampling_logp_difference/mean": 0.07148178666830063, "step": 426 }, { "clip_ratio/high_max": 0.023971143178641796, "clip_ratio/high_mean": 0.023971143178641796, "clip_ratio/low_mean": 0.009528988506644964, "clip_ratio/low_min": 0.009528988506644964, "clip_ratio/region_mean": 0.03350013168528676, "completions/clipped_ratio": 0.0, "completions/max_length": 170.0, "completions/max_terminated_length": 170.0, "completions/mean_length": 150.25, "completions/mean_terminated_length": 150.25, "completions/min_length": 129.0, "completions/min_terminated_length": 129.0, "entropy": 0.14678781293332577, "epoch": 0.016489033055298117, "frac_reward_zero_std": 0.0, "grad_norm": 4.158021450042725, "learning_rate": 8.70909090909091e-06, "loss": -0.0653, "num_tokens": 920736.0, "reward": 0.6173264980316162, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_meter_mean": 0.6729066967964172, "reward_meter_std": 0.3364524841308594, "reward_std": 0.3513941466808319, "reward_total_composite_mean": 0.6173264980316162, "reward_total_composite_std": 0.3513941466808319, "reward_total_mean": 0.6173264980316162, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/meter/mean": 0.6729066967964172, "rewards/meter/std": 0.3364524841308594, "rewards/total_composite/mean": 0.6173264980316162, "rewards/total_composite/std": 0.3513941466808319, "sampling/importance_sampling_ratio/max": 1.959710717201233, "sampling/importance_sampling_ratio/mean": 0.9964794516563416, "sampling/importance_sampling_ratio/min": 0.05687982589006424, "sampling/sampling_logp_difference/max": 2.866814613342285, "sampling/sampling_logp_difference/mean": 0.03079906478524208, "step": 427 }, { "clip_ratio/high_max": 0.010739810299128294, "clip_ratio/high_mean": 0.010739810299128294, "clip_ratio/low_mean": 0.009472908801399171, "clip_ratio/low_min": 0.009472908801399171, "clip_ratio/region_mean": 0.020212719100527465, "completions/clipped_ratio": 0.0, "completions/max_length": 138.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 129.0, "completions/mean_terminated_length": 129.0, "completions/min_length": 107.0, "completions/min_terminated_length": 107.0, "entropy": 0.13649542536586523, "epoch": 0.01652764905776954, "frac_reward_zero_std": 0.0, "grad_norm": 2.6976351737976074, "learning_rate": 8.706060606060607e-06, "loss": 0.0675, "num_tokens": 923000.0, "reward": 0.11112642288208008, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.11112642288208008, "reward_meter_std": 0.1817607432603836, "reward_std": 0.1817607432603836, "reward_total_composite_mean": 0.11112642288208008, "reward_total_composite_std": 0.1817607432603836, "reward_total_mean": 0.11112642288208008, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.11112642288208008, "rewards/meter/std": 0.1817607432603836, "rewards/total_composite/mean": 0.11112642288208008, "rewards/total_composite/std": 0.1817607432603836, "sampling/importance_sampling_ratio/max": 1.9328269958496094, "sampling/importance_sampling_ratio/mean": 1.0000661611557007, "sampling/importance_sampling_ratio/min": 0.07731583714485168, "sampling/sampling_logp_difference/max": 2.559856414794922, "sampling/sampling_logp_difference/mean": 0.030291767790913582, "step": 428 }, { "clip_ratio/high_max": 0.02691519889049232, "clip_ratio/high_mean": 0.02691519889049232, "clip_ratio/low_mean": 0.012388192000798881, "clip_ratio/low_min": 0.012388192000798881, "clip_ratio/region_mean": 0.0393033908912912, "completions/clipped_ratio": 0.0, "completions/max_length": 140.0, "completions/max_terminated_length": 140.0, "completions/mean_length": 127.125, "completions/mean_terminated_length": 127.125, "completions/min_length": 113.0, "completions/min_terminated_length": 113.0, "entropy": 0.26551887206733227, "epoch": 0.016566265060240965, "frac_reward_zero_std": 0.0, "grad_norm": 3.4749865531921387, "learning_rate": 8.703030303030304e-06, "loss": -0.0293, "num_tokens": 925409.0, "reward": 0.8244721293449402, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_meter_mean": 0.9445109963417053, "reward_meter_std": 0.06675712764263153, "reward_std": 0.16515542566776276, "reward_total_composite_mean": 0.8244721293449402, "reward_total_composite_std": 0.16515542566776276, "reward_total_mean": 0.8244721293449402, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/meter/mean": 0.9445109963417053, "rewards/meter/std": 0.06675712764263153, "rewards/total_composite/mean": 0.8244721293449402, "rewards/total_composite/std": 0.16515542566776276, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9982576966285706, "sampling/importance_sampling_ratio/min": 0.019715862348675728, "sampling/sampling_logp_difference/max": 3.9263317584991455, "sampling/sampling_logp_difference/mean": 0.05006590485572815, "step": 429 }, { "clip_ratio/high_max": 0.03724813973531127, "clip_ratio/high_mean": 0.03724813973531127, "clip_ratio/low_mean": 0.03095380635932088, "clip_ratio/low_min": 0.03095380635932088, "clip_ratio/region_mean": 0.06820194609463215, "completions/clipped_ratio": 0.0, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 98.0, "completions/mean_terminated_length": 98.0, "completions/min_length": 90.0, "completions/min_terminated_length": 90.0, "entropy": 0.5216472372412682, "epoch": 0.01660488106271239, "frac_reward_zero_std": 0.0, "grad_norm": 5.7448906898498535, "learning_rate": 8.700000000000001e-06, "loss": 0.0512, "num_tokens": 927497.0, "reward": 0.574688196182251, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.574688196182251, "reward_meter_std": 0.4255768954753876, "reward_std": 0.42557692527770996, "reward_total_composite_mean": 0.574688196182251, "reward_total_composite_std": 0.4255768954753876, "reward_total_mean": 0.574688196182251, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.574688196182251, "rewards/meter/std": 0.4255768954753876, "rewards/total_composite/mean": 0.574688196182251, "rewards/total_composite/std": 0.4255768954753876, "sampling/importance_sampling_ratio/max": 1.9886913299560547, "sampling/importance_sampling_ratio/mean": 1.0072433948516846, "sampling/importance_sampling_ratio/min": 0.3208860456943512, "sampling/sampling_logp_difference/max": 1.1366691589355469, "sampling/sampling_logp_difference/mean": 0.06919876486063004, "step": 430 }, { "clip_ratio/high_max": 0.060504904482513666, "clip_ratio/high_mean": 0.060504904482513666, "clip_ratio/low_mean": 0.022997836116701365, "clip_ratio/low_min": 0.022997836116701365, "clip_ratio/region_mean": 0.08350274059921503, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 34.125, "completions/mean_terminated_length": 34.125, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 0.9744241572916508, "epoch": 0.016643497065183813, "frac_reward_zero_std": 0.0, "grad_norm": 14.200037956237793, "learning_rate": 8.696969696969699e-06, "loss": -0.0277, "num_tokens": 929098.0, "reward": 0.811887264251709, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.811887264251709, "reward_meter_std": 0.2896690368652344, "reward_std": 0.2896690368652344, "reward_total_composite_mean": 0.811887264251709, "reward_total_composite_std": 0.2896690368652344, "reward_total_mean": 0.811887264251709, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.811887264251709, "rewards/meter/std": 0.2896690368652344, "rewards/total_composite/mean": 0.811887264251709, "rewards/total_composite/std": 0.2896690368652344, "sampling/importance_sampling_ratio/max": 1.7877914905548096, "sampling/importance_sampling_ratio/mean": 1.0314644575119019, "sampling/importance_sampling_ratio/min": 0.440626323223114, "sampling/sampling_logp_difference/max": 0.8195581436157227, "sampling/sampling_logp_difference/mean": 0.09828025102615356, "step": 431 }, { "clip_ratio/high_max": 0.0062806373462080956, "clip_ratio/high_mean": 0.0062806373462080956, "clip_ratio/low_mean": 0.01565172686241567, "clip_ratio/low_min": 0.01565172686241567, "clip_ratio/region_mean": 0.021932364208623767, "completions/clipped_ratio": 0.0, "completions/max_length": 113.0, "completions/max_terminated_length": 113.0, "completions/mean_length": 103.0, "completions/mean_terminated_length": 103.0, "completions/min_length": 96.0, "completions/min_terminated_length": 96.0, "entropy": 0.12999565247446299, "epoch": 0.016682113067655237, "frac_reward_zero_std": 0.0, "grad_norm": 6.835657596588135, "learning_rate": 8.693939393939394e-06, "loss": 0.038, "num_tokens": 931202.0, "reward": 0.45791012048721313, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45791012048721313, "reward_meter_std": 0.43955934047698975, "reward_std": 0.43955934047698975, "reward_total_composite_mean": 0.45791012048721313, "reward_total_composite_std": 0.43955934047698975, "reward_total_mean": 0.45791012048721313, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45791012048721313, "rewards/meter/std": 0.43955934047698975, "rewards/total_composite/mean": 0.45791012048721313, "rewards/total_composite/std": 0.43955934047698975, "sampling/importance_sampling_ratio/max": 1.681004524230957, "sampling/importance_sampling_ratio/mean": 0.9998974800109863, "sampling/importance_sampling_ratio/min": 0.3137332797050476, "sampling/sampling_logp_difference/max": 1.1592121124267578, "sampling/sampling_logp_difference/mean": 0.025745589286088943, "step": 432 }, { "clip_ratio/high_max": 0.03764841705560684, "clip_ratio/high_mean": 0.03764841705560684, "clip_ratio/low_mean": 0.0251602572388947, "clip_ratio/low_min": 0.0251602572388947, "clip_ratio/region_mean": 0.06280867429450154, "completions/clipped_ratio": 0.0, "completions/max_length": 110.0, "completions/max_terminated_length": 110.0, "completions/mean_length": 94.875, "completions/mean_terminated_length": 94.875, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.45340409502387047, "epoch": 0.01672072907012666, "frac_reward_zero_std": 0.0, "grad_norm": 9.083555221557617, "learning_rate": 8.690909090909091e-06, "loss": 0.0363, "num_tokens": 933225.0, "reward": 0.7613606452941895, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.8027656674385071, "reward_meter_std": 0.3288112282752991, "reward_std": 0.3221178352832794, "reward_total_composite_mean": 0.7613606452941895, "reward_total_composite_std": 0.3221178352832794, "reward_total_mean": 0.7613606452941895, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.8027656674385071, "rewards/meter/std": 0.3288112282752991, "rewards/total_composite/mean": 0.7613606452941895, "rewards/total_composite/std": 0.3221178352832794, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0011898279190063, "sampling/importance_sampling_ratio/min": 0.2318556159734726, "sampling/sampling_logp_difference/max": 1.461640477180481, "sampling/sampling_logp_difference/mean": 0.08027959614992142, "step": 433 }, { "clip_ratio/high_max": 0.013409517356194556, "clip_ratio/high_mean": 0.013409517356194556, "clip_ratio/low_mean": 0.0010869564721360803, "clip_ratio/low_min": 0.0010869564721360803, "clip_ratio/region_mean": 0.014496473828330636, "completions/clipped_ratio": 0.0, "completions/max_length": 120.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 114.5, "completions/mean_terminated_length": 114.5, "completions/min_length": 104.0, "completions/min_terminated_length": 104.0, "entropy": 0.11784437298774719, "epoch": 0.016759345072598086, "frac_reward_zero_std": 0.0, "grad_norm": 3.4593441486358643, "learning_rate": 8.687878787878789e-06, "loss": 0.007, "num_tokens": 935461.0, "reward": 0.8310332298278809, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8310332298278809, "reward_meter_std": 0.32082754373550415, "reward_std": 0.32082754373550415, "reward_total_composite_mean": 0.8310332298278809, "reward_total_composite_std": 0.32082754373550415, "reward_total_mean": 0.8310332298278809, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8310332298278809, "rewards/meter/std": 0.32082754373550415, "rewards/total_composite/mean": 0.8310332298278809, "rewards/total_composite/std": 0.32082754373550415, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0050222873687744, "sampling/importance_sampling_ratio/min": 0.0013107022969052196, "sampling/sampling_logp_difference/max": 6.637192249298096, "sampling/sampling_logp_difference/mean": 0.032745786011219025, "step": 434 }, { "clip_ratio/high_max": 0.04601668380200863, "clip_ratio/high_mean": 0.04601668380200863, "clip_ratio/low_mean": 0.014399510342627764, "clip_ratio/low_min": 0.014399510342627764, "clip_ratio/region_mean": 0.06041619414463639, "completions/clipped_ratio": 0.0, "completions/max_length": 133.0, "completions/max_terminated_length": 133.0, "completions/mean_length": 101.125, "completions/mean_terminated_length": 101.125, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.5314316283911467, "epoch": 0.01679796107506951, "frac_reward_zero_std": 0.0, "grad_norm": 5.847456455230713, "learning_rate": 8.684848484848486e-06, "loss": -0.0446, "num_tokens": 937614.0, "reward": 0.8126308917999268, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.8531937599182129, "reward_meter_std": 0.27812930941581726, "reward_std": 0.2817155420780182, "reward_total_composite_mean": 0.8126308917999268, "reward_total_composite_std": 0.2817155122756958, "reward_total_mean": 0.8126308917999268, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.8531937599182129, "rewards/meter/std": 0.27812930941581726, "rewards/total_composite/mean": 0.8126308917999268, "rewards/total_composite/std": 0.2817155122756958, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002807378768921, "sampling/importance_sampling_ratio/min": 0.12069769948720932, "sampling/sampling_logp_difference/max": 2.1144661903381348, "sampling/sampling_logp_difference/mean": 0.07007157802581787, "step": 435 }, { "clip_ratio/high_max": 0.0015625000232830644, "clip_ratio/high_mean": 0.0015625000232830644, "clip_ratio/low_mean": 0.026244841050356627, "clip_ratio/low_min": 0.026244841050356627, "clip_ratio/region_mean": 0.02780734107363969, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 77.25, "completions/mean_terminated_length": 77.25, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.1496438980102539, "epoch": 0.016836577077540934, "frac_reward_zero_std": 0.0, "grad_norm": 5.732955455780029, "learning_rate": 8.681818181818182e-06, "loss": -0.0109, "num_tokens": 939392.0, "reward": 0.3143185079097748, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3143185079097748, "reward_meter_std": 0.41200879216194153, "reward_std": 0.41200879216194153, "reward_total_composite_mean": 0.3143185079097748, "reward_total_composite_std": 0.41200879216194153, "reward_total_mean": 0.3143185079097748, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3143185079097748, "rewards/meter/std": 0.41200879216194153, "rewards/total_composite/mean": 0.3143185079097748, "rewards/total_composite/std": 0.41200879216194153, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0097142457962036, "sampling/importance_sampling_ratio/min": 0.01733795367181301, "sampling/sampling_logp_difference/max": 4.05485725402832, "sampling/sampling_logp_difference/mean": 0.04445616900920868, "step": 436 }, { "clip_ratio/high_max": 0.014880952425301075, "clip_ratio/high_mean": 0.014880952425301075, "clip_ratio/low_mean": 0.01840795623138547, "clip_ratio/low_min": 0.01840795623138547, "clip_ratio/region_mean": 0.033288908656686544, "completions/clipped_ratio": 0.0, "completions/max_length": 96.0, "completions/max_terminated_length": 96.0, "completions/mean_length": 82.75, "completions/mean_terminated_length": 82.75, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.3760291952639818, "epoch": 0.016875193080012358, "frac_reward_zero_std": 0.0, "grad_norm": 4.509356498718262, "learning_rate": 8.67878787878788e-06, "loss": -0.0275, "num_tokens": 941350.0, "reward": 0.2339237928390503, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_meter_mean": 0.2568199038505554, "reward_meter_std": 0.359527051448822, "reward_std": 0.3625546097755432, "reward_total_composite_mean": 0.2339237928390503, "reward_total_composite_std": 0.3625546097755432, "reward_total_mean": 0.2339237928390503, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/meter/mean": 0.2568199038505554, "rewards/meter/std": 0.359527051448822, "rewards/total_composite/mean": 0.2339237928390503, "rewards/total_composite/std": 0.3625546097755432, "sampling/importance_sampling_ratio/max": 1.8314160108566284, "sampling/importance_sampling_ratio/mean": 1.0075230598449707, "sampling/importance_sampling_ratio/min": 0.25561147928237915, "sampling/sampling_logp_difference/max": 1.3640966415405273, "sampling/sampling_logp_difference/mean": 0.058143459260463715, "step": 437 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.016913809082483782, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 8.675757575757576e-06, "loss": 0.0, "num_tokens": 943046.0, "reward": 0.7461053729057312, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9948071241378784, "reward_meter_std": 0.00352023309096694, "reward_std": 0.0026401823852211237, "reward_total_composite_mean": 0.7461053729057312, "reward_total_composite_std": 0.0026401823852211237, "reward_total_mean": 0.7461053729057312, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9948071241378784, "rewards/meter/std": 0.00352023309096694, "rewards/total_composite/mean": 0.7461053729057312, "rewards/total_composite/std": 0.0026401823852211237, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 438 }, { "clip_ratio/high_max": 0.023564013885334134, "clip_ratio/high_mean": 0.023564013885334134, "clip_ratio/low_mean": 0.006527067394927144, "clip_ratio/low_min": 0.006527067394927144, "clip_ratio/region_mean": 0.030091081280261278, "completions/clipped_ratio": 0.0, "completions/max_length": 109.0, "completions/max_terminated_length": 109.0, "completions/mean_length": 94.25, "completions/mean_terminated_length": 94.25, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.20515940617769957, "epoch": 0.016952425084955206, "frac_reward_zero_std": 0.0, "grad_norm": 3.7757630348205566, "learning_rate": 8.672727272727273e-06, "loss": 0.0153, "num_tokens": 945072.0, "reward": 0.7195857763290405, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8440791368484497, "reward_meter_std": 0.29224100708961487, "reward_std": 0.4076501131057739, "reward_total_composite_mean": 0.7195857763290405, "reward_total_composite_std": 0.4076501429080963, "reward_total_mean": 0.7195857763290405, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8440791368484497, "rewards/meter/std": 0.29224100708961487, "rewards/total_composite/mean": 0.7195857763290405, "rewards/total_composite/std": 0.4076501429080963, "sampling/importance_sampling_ratio/max": 1.6128379106521606, "sampling/importance_sampling_ratio/mean": 1.0024596452713013, "sampling/importance_sampling_ratio/min": 0.1524176001548767, "sampling/sampling_logp_difference/max": 1.8811311721801758, "sampling/sampling_logp_difference/mean": 0.031045421957969666, "step": 439 }, { "clip_ratio/high_max": 0.008545128046534956, "clip_ratio/high_mean": 0.008545128046534956, "clip_ratio/low_mean": 0.013955606264062226, "clip_ratio/low_min": 0.013955606264062226, "clip_ratio/region_mean": 0.02250073431059718, "completions/clipped_ratio": 0.0, "completions/max_length": 223.0, "completions/max_terminated_length": 223.0, "completions/mean_length": 199.25, "completions/mean_terminated_length": 199.25, "completions/min_length": 179.0, "completions/min_terminated_length": 179.0, "entropy": 0.1384673686698079, "epoch": 0.01699104108742663, "frac_reward_zero_std": 0.0, "grad_norm": 4.999176979064941, "learning_rate": 8.66969696969697e-06, "loss": -0.0297, "num_tokens": 948306.0, "reward": 0.800205647945404, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_meter_mean": 0.906821608543396, "reward_meter_std": 0.20782814919948578, "reward_std": 0.22486314177513123, "reward_total_composite_mean": 0.800205647945404, "reward_total_composite_std": 0.22486315667629242, "reward_total_mean": 0.800205647945404, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/meter/mean": 0.906821608543396, "rewards/meter/std": 0.20782814919948578, "rewards/total_composite/mean": 0.800205647945404, "rewards/total_composite/std": 0.22486315667629242, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0032387971878052, "sampling/importance_sampling_ratio/min": 0.13524653017520905, "sampling/sampling_logp_difference/max": 2.0006561279296875, "sampling/sampling_logp_difference/mean": 0.024938292801380157, "step": 440 }, { "clip_ratio/high_max": 0.06254499591886997, "clip_ratio/high_mean": 0.06254499591886997, "clip_ratio/low_mean": 0.04578754771500826, "clip_ratio/low_min": 0.04578754771500826, "clip_ratio/region_mean": 0.10833254363387823, "completions/clipped_ratio": 0.0, "completions/max_length": 39.0, "completions/max_terminated_length": 39.0, "completions/mean_length": 33.625, "completions/mean_terminated_length": 33.625, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.6665975973010063, "epoch": 0.017029657089898054, "frac_reward_zero_std": 0.0, "grad_norm": 12.705753326416016, "learning_rate": 8.666666666666668e-06, "loss": 0.043, "num_tokens": 949895.0, "reward": 0.7382475137710571, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7382475137710571, "reward_meter_std": 0.344305157661438, "reward_std": 0.344305157661438, "reward_total_composite_mean": 0.7382475137710571, "reward_total_composite_std": 0.344305157661438, "reward_total_mean": 0.7382475137710571, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7382475137710571, "rewards/meter/std": 0.344305157661438, "rewards/total_composite/mean": 0.7382475137710571, "rewards/total_composite/std": 0.344305157661438, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0123142004013062, "sampling/importance_sampling_ratio/min": 0.2521496117115021, "sampling/sampling_logp_difference/max": 1.377732753753662, "sampling/sampling_logp_difference/mean": 0.11312177032232285, "step": 441 }, { "clip_ratio/high_max": 0.04311846289783716, "clip_ratio/high_mean": 0.04311846289783716, "clip_ratio/low_mean": 0.018479025457054377, "clip_ratio/low_min": 0.018479025457054377, "clip_ratio/region_mean": 0.06159748835489154, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 67.375, "completions/mean_terminated_length": 67.375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.44354628771543503, "epoch": 0.01706827309236948, "frac_reward_zero_std": 0.0, "grad_norm": 6.052305698394775, "learning_rate": 8.663636363636363e-06, "loss": 0.0748, "num_tokens": 951634.0, "reward": 0.6851848363876343, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6851848363876343, "reward_meter_std": 0.40763622522354126, "reward_std": 0.40763622522354126, "reward_total_composite_mean": 0.6851848363876343, "reward_total_composite_std": 0.40763622522354126, "reward_total_mean": 0.6851848363876343, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6851848363876343, "rewards/meter/std": 0.40763622522354126, "rewards/total_composite/mean": 0.6851848363876343, "rewards/total_composite/std": 0.40763622522354126, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.01041579246521, "sampling/importance_sampling_ratio/min": 0.14436128735542297, "sampling/sampling_logp_difference/max": 1.9354361295700073, "sampling/sampling_logp_difference/mean": 0.06014850363135338, "step": 442 }, { "clip_ratio/high_max": 0.04367695190012455, "clip_ratio/high_mean": 0.04367695190012455, "clip_ratio/low_mean": 0.014395925216376781, "clip_ratio/low_min": 0.014395925216376781, "clip_ratio/region_mean": 0.05807287711650133, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 68.625, "completions/mean_terminated_length": 68.625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.5356311798095703, "epoch": 0.017106889094840903, "frac_reward_zero_std": 0.0, "grad_norm": 9.460426330566406, "learning_rate": 8.660606060606062e-06, "loss": 0.0122, "num_tokens": 953439.0, "reward": 0.861977219581604, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.861977219581604, "reward_meter_std": 0.24617436528205872, "reward_std": 0.24617433547973633, "reward_total_composite_mean": 0.861977219581604, "reward_total_composite_std": 0.24617436528205872, "reward_total_mean": 0.861977219581604, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.861977219581604, "rewards/meter/std": 0.24617436528205872, "rewards/total_composite/mean": 0.861977219581604, "rewards/total_composite/std": 0.24617436528205872, "sampling/importance_sampling_ratio/max": 1.7051851749420166, "sampling/importance_sampling_ratio/mean": 1.0046181678771973, "sampling/importance_sampling_ratio/min": 0.1390223354101181, "sampling/sampling_logp_difference/max": 1.9731206893920898, "sampling/sampling_logp_difference/mean": 0.06774439662694931, "step": 443 }, { "clip_ratio/high_max": 0.011721267364919186, "clip_ratio/high_mean": 0.011721267364919186, "clip_ratio/low_mean": 0.05329327145591378, "clip_ratio/low_min": 0.05329327145591378, "clip_ratio/region_mean": 0.06501453882083297, "completions/clipped_ratio": 0.0, "completions/max_length": 118.0, "completions/max_terminated_length": 118.0, "completions/mean_length": 106.625, "completions/mean_terminated_length": 106.625, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "entropy": 0.31410662829875946, "epoch": 0.017145505097312327, "frac_reward_zero_std": 0.0, "grad_norm": 6.638420104980469, "learning_rate": 8.657575757575758e-06, "loss": 0.0611, "num_tokens": 955748.0, "reward": 0.24504423141479492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.24504423141479492, "reward_meter_std": 0.346823513507843, "reward_std": 0.346823513507843, "reward_total_composite_mean": 0.24504423141479492, "reward_total_composite_std": 0.346823513507843, "reward_total_mean": 0.24504423141479492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.24504423141479492, "rewards/meter/std": 0.346823513507843, "rewards/total_composite/mean": 0.24504423141479492, "rewards/total_composite/std": 0.346823513507843, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0113799571990967, "sampling/importance_sampling_ratio/min": 0.2446102499961853, "sampling/sampling_logp_difference/max": 1.4080891609191895, "sampling/sampling_logp_difference/mean": 0.05710998922586441, "step": 444 }, { "clip_ratio/high_max": 0.05313561297953129, "clip_ratio/high_mean": 0.05313561297953129, "clip_ratio/low_mean": 0.021353119518607855, "clip_ratio/low_min": 0.021353119518607855, "clip_ratio/region_mean": 0.07448873249813914, "completions/clipped_ratio": 0.0, "completions/max_length": 74.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 68.125, "completions/mean_terminated_length": 68.125, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.7675438597798347, "epoch": 0.01718412109978375, "frac_reward_zero_std": 0.0, "grad_norm": 9.578984260559082, "learning_rate": 8.654545454545455e-06, "loss": 0.0332, "num_tokens": 957485.0, "reward": 0.7745425701141357, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7745425701141357, "reward_meter_std": 0.3829474449157715, "reward_std": 0.38294747471809387, "reward_total_composite_mean": 0.7745425701141357, "reward_total_composite_std": 0.3829474449157715, "reward_total_mean": 0.7745425701141357, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7745425701141357, "rewards/meter/std": 0.3829474449157715, "rewards/total_composite/mean": 0.7745425701141357, "rewards/total_composite/std": 0.3829474449157715, "sampling/importance_sampling_ratio/max": 1.9029569625854492, "sampling/importance_sampling_ratio/mean": 1.0089476108551025, "sampling/importance_sampling_ratio/min": 0.31309664249420166, "sampling/sampling_logp_difference/max": 1.1612434387207031, "sampling/sampling_logp_difference/mean": 0.08342333137989044, "step": 445 }, { "clip_ratio/high_max": 0.05887592723593116, "clip_ratio/high_mean": 0.05887592723593116, "clip_ratio/low_mean": 0.02302631549537182, "clip_ratio/low_min": 0.02302631549537182, "clip_ratio/region_mean": 0.08190224273130298, "completions/clipped_ratio": 0.0, "completions/max_length": 43.0, "completions/max_terminated_length": 43.0, "completions/mean_length": 38.375, "completions/mean_terminated_length": 38.375, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.6561026684939861, "epoch": 0.017222737102255175, "frac_reward_zero_std": 0.0, "grad_norm": 16.04683494567871, "learning_rate": 8.651515151515152e-06, "loss": 0.0135, "num_tokens": 959040.0, "reward": 0.8562139272689819, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8562139272689819, "reward_meter_std": 0.34138572216033936, "reward_std": 0.34138569235801697, "reward_total_composite_mean": 0.8562139272689819, "reward_total_composite_std": 0.34138572216033936, "reward_total_mean": 0.8562139272689819, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8562139272689819, "rewards/meter/std": 0.34138572216033936, "rewards/total_composite/mean": 0.8562139272689819, "rewards/total_composite/std": 0.34138572216033936, "sampling/importance_sampling_ratio/max": 1.844504952430725, "sampling/importance_sampling_ratio/mean": 1.0087430477142334, "sampling/importance_sampling_ratio/min": 0.2737632095813751, "sampling/sampling_logp_difference/max": 1.2954916954040527, "sampling/sampling_logp_difference/mean": 0.09310141205787659, "step": 446 }, { "clip_ratio/high_max": 0.011402326985262334, "clip_ratio/high_mean": 0.011402326985262334, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.011402326985262334, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 197.0, "completions/mean_length": 230.375, "completions/mean_terminated_length": 190.1428680419922, "completions/min_length": 177.0, "completions/min_terminated_length": 177.0, "entropy": 0.12354243081063032, "epoch": 0.0172613531047266, "frac_reward_zero_std": 0.0, "grad_norm": 0.7952864766120911, "learning_rate": 8.64848484848485e-06, "loss": -0.2555, "num_tokens": 961699.0, "reward": 0.8865582346916199, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.2651650309562683, "reward_meter_mean": 0.9410502910614014, "reward_meter_std": 0.1454276442527771, "reward_std": 0.29953086376190186, "reward_total_composite_mean": 0.8865582346916199, "reward_total_composite_std": 0.29953092336654663, "reward_total_mean": 0.8865582346916199, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/meter/mean": 0.9410502910614014, "rewards/meter/std": 0.1454276442527771, "rewards/total_composite/mean": 0.8865582346916199, "rewards/total_composite/std": 0.29953092336654663, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0042375326156616, "sampling/importance_sampling_ratio/min": 0.3248317837715149, "sampling/sampling_logp_difference/max": 1.1244478225708008, "sampling/sampling_logp_difference/mean": 0.01994623802602291, "step": 447 }, { "clip_ratio/high_max": 0.01393397233914584, "clip_ratio/high_mean": 0.01393397233914584, "clip_ratio/low_mean": 0.002027027076110244, "clip_ratio/low_min": 0.002027027076110244, "clip_ratio/region_mean": 0.015960999415256083, "completions/clipped_ratio": 0.0, "completions/max_length": 185.0, "completions/max_terminated_length": 185.0, "completions/mean_length": 158.75, "completions/mean_terminated_length": 158.75, "completions/min_length": 126.0, "completions/min_terminated_length": 126.0, "entropy": 0.10146280331537127, "epoch": 0.017299969107198023, "frac_reward_zero_std": 0.0, "grad_norm": 2.0035412311553955, "learning_rate": 8.645454545454545e-06, "loss": 0.0638, "num_tokens": 964297.0, "reward": 0.859869122505188, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.859869122505188, "reward_meter_std": 0.3417814075946808, "reward_std": 0.3417814075946808, "reward_total_composite_mean": 0.859869122505188, "reward_total_composite_std": 0.3417814075946808, "reward_total_mean": 0.859869122505188, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.859869122505188, "rewards/meter/std": 0.3417814075946808, "rewards/total_composite/mean": 0.859869122505188, "rewards/total_composite/std": 0.3417814075946808, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9988955855369568, "sampling/importance_sampling_ratio/min": 0.005555473268032074, "sampling/sampling_logp_difference/max": 5.192971706390381, "sampling/sampling_logp_difference/mean": 0.03218178451061249, "step": 448 }, { "clip_ratio/high_max": 0.029356154147535563, "clip_ratio/high_mean": 0.029356154147535563, "clip_ratio/low_mean": 0.007736280560493469, "clip_ratio/low_min": 0.007736280560493469, "clip_ratio/region_mean": 0.03709243470802903, "completions/clipped_ratio": 0.0, "completions/max_length": 90.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 82.75, "completions/mean_terminated_length": 82.75, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.2209324724972248, "epoch": 0.017338585109669447, "frac_reward_zero_std": 0.0, "grad_norm": 6.3059892654418945, "learning_rate": 8.642424242424242e-06, "loss": 0.0171, "num_tokens": 966255.0, "reward": 0.6425033807754517, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6425033807754517, "reward_meter_std": 0.41706737875938416, "reward_std": 0.41706737875938416, "reward_total_composite_mean": 0.6425033807754517, "reward_total_composite_std": 0.41706737875938416, "reward_total_mean": 0.6425033807754517, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6425033807754517, "rewards/meter/std": 0.41706737875938416, "rewards/total_composite/mean": 0.6425033807754517, "rewards/total_composite/std": 0.41706737875938416, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0040130615234375, "sampling/importance_sampling_ratio/min": 0.02065885066986084, "sampling/sampling_logp_difference/max": 3.8796114921569824, "sampling/sampling_logp_difference/mean": 0.053077779710292816, "step": 449 }, { "clip_ratio/high_max": 0.027218999108299613, "clip_ratio/high_mean": 0.027218999108299613, "clip_ratio/low_mean": 0.004411764908581972, "clip_ratio/low_min": 0.004411764908581972, "clip_ratio/region_mean": 0.031630764016881585, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 81.0, "completions/mean_terminated_length": 81.0, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.15494854096323252, "epoch": 0.01737720111214087, "frac_reward_zero_std": 0.0, "grad_norm": 6.594456195831299, "learning_rate": 8.63939393939394e-06, "loss": 0.0266, "num_tokens": 968263.0, "reward": 0.861186146736145, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.861186146736145, "reward_meter_std": 0.25013267993927, "reward_std": 0.25013265013694763, "reward_total_composite_mean": 0.861186146736145, "reward_total_composite_std": 0.25013267993927, "reward_total_mean": 0.861186146736145, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.861186146736145, "rewards/meter/std": 0.25013267993927, "rewards/total_composite/mean": 0.861186146736145, "rewards/total_composite/std": 0.25013267993927, "sampling/importance_sampling_ratio/max": 1.9482147693634033, "sampling/importance_sampling_ratio/mean": 0.9992127418518066, "sampling/importance_sampling_ratio/min": 0.1744629293680191, "sampling/sampling_logp_difference/max": 1.7460429668426514, "sampling/sampling_logp_difference/mean": 0.030779149383306503, "step": 450 }, { "epoch": 0.01737720111214087, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.10576923076923077, "eval_completions/max_length": 485.38461538461536, "eval_completions/max_terminated_length": 421.0769230769231, "eval_completions/mean_length": 252.39423076923077, "eval_completions/mean_terminated_length": 221.38736900916467, "eval_completions/min_length": 61.23076923076923, "eval_completions/min_terminated_length": 61.23076923076923, "eval_entropy": 0.11755917536524627, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 968263.0, "eval_reward": 0.6704203371818249, "eval_reward_arabic_clean_mean": 0.9903846153846154, "eval_reward_arabic_clean_std": 0.027196414195574246, "eval_reward_count_adherence_mean": 0.9385907145646902, "eval_reward_count_adherence_std": 0.09539258336791626, "eval_reward_meter_mean": 0.7144990059045645, "eval_reward_meter_std": 0.3781636357307434, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.6704203371818249, "eval_reward_total_composite_std": 0.37348280388575333, "eval_reward_total_mean": 0.6704203371818249, "eval_rewards/arabic_clean/mean": 0.9903846153846154, "eval_rewards/arabic_clean/std": 0.027196414195574246, "eval_rewards/count_adherence/mean": 0.9385907145646902, "eval_rewards/count_adherence/std": 0.09539258336791626, "eval_rewards/meter/mean": 0.7144990059045645, "eval_rewards/meter/std": 0.3781636357307434, "eval_rewards/total_composite/mean": 0.6704203371818249, "eval_rewards/total_composite/std": 0.37348280388575333, "eval_runtime": 90.6979, "eval_samples_per_second": 1.147, "eval_sampling/importance_sampling_ratio/max": 1.352581189228938, "eval_sampling/importance_sampling_ratio/mean": 1.002858510384193, "eval_sampling/importance_sampling_ratio/min": 0.45446773446523225, "eval_sampling/sampling_logp_difference/max": 0.8244214149621817, "eval_sampling/sampling_logp_difference/mean": 0.011250602045597939, "eval_steps_per_second": 0.143, "step": 450 }, { "clip_ratio/high_max": 0.0517552737146616, "clip_ratio/high_mean": 0.0517552737146616, "clip_ratio/low_mean": 0.03685897495597601, "clip_ratio/low_min": 0.03685897495597601, "clip_ratio/region_mean": 0.08861424867063761, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 60.25, "completions/mean_terminated_length": 60.25, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7900894470512867, "epoch": 0.017415817114612295, "frac_reward_zero_std": 0.0, "grad_norm": 8.833879470825195, "learning_rate": 8.636363636363637e-06, "loss": -0.0468, "num_tokens": 969993.0, "reward": 0.6889505386352539, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6889505386352539, "reward_meter_std": 0.3999699652194977, "reward_std": 0.3999699354171753, "reward_total_composite_mean": 0.6889505386352539, "reward_total_composite_std": 0.3999699652194977, "reward_total_mean": 0.6889505386352539, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6889505386352539, "rewards/meter/std": 0.3999699652194977, "rewards/total_composite/mean": 0.6889505386352539, "rewards/total_composite/std": 0.3999699652194977, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0142425298690796, "sampling/importance_sampling_ratio/min": 0.35178372263908386, "sampling/sampling_logp_difference/max": 1.3110675811767578, "sampling/sampling_logp_difference/mean": 0.09507620334625244, "step": 451 }, { "clip_ratio/high_max": 0.02525400766171515, "clip_ratio/high_mean": 0.02525400766171515, "clip_ratio/low_mean": 0.006992337410338223, "clip_ratio/low_min": 0.006992337410338223, "clip_ratio/region_mean": 0.03224634507205337, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 94.0, "completions/mean_terminated_length": 94.0, "completions/min_length": 87.0, "completions/min_terminated_length": 87.0, "entropy": 0.20060661621391773, "epoch": 0.01745443311708372, "frac_reward_zero_std": 0.0, "grad_norm": 4.048279762268066, "learning_rate": 8.633333333333334e-06, "loss": -0.0294, "num_tokens": 972209.0, "reward": 0.9136518239974976, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9136518239974976, "reward_meter_std": 0.0902651846408844, "reward_std": 0.0902651846408844, "reward_total_composite_mean": 0.9136518239974976, "reward_total_composite_std": 0.0902651846408844, "reward_total_mean": 0.9136518239974976, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9136518239974976, "rewards/meter/std": 0.0902651846408844, "rewards/total_composite/mean": 0.9136518239974976, "rewards/total_composite/std": 0.0902651846408844, "sampling/importance_sampling_ratio/max": 1.876058578491211, "sampling/importance_sampling_ratio/mean": 1.0003708600997925, "sampling/importance_sampling_ratio/min": 0.3134796619415283, "sampling/sampling_logp_difference/max": 1.1600208282470703, "sampling/sampling_logp_difference/mean": 0.03461015596985817, "step": 452 }, { "clip_ratio/high_max": 0.015870221075601876, "clip_ratio/high_mean": 0.015870221075601876, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.015870221075601876, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 70.125, "completions/mean_terminated_length": 70.125, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.08665410289540887, "epoch": 0.017493049119555144, "frac_reward_zero_std": 0.0, "grad_norm": 6.656115531921387, "learning_rate": 8.630303030303032e-06, "loss": 0.0093, "num_tokens": 973962.0, "reward": 0.9888208508491516, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9888208508491516, "reward_meter_std": 0.006749412976205349, "reward_std": 0.006749419495463371, "reward_total_composite_mean": 0.9888208508491516, "reward_total_composite_std": 0.006749412976205349, "reward_total_mean": 0.9888208508491516, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9888208508491516, "rewards/meter/std": 0.006749412976205349, "rewards/total_composite/mean": 0.9888208508491516, "rewards/total_composite/std": 0.006749412976205349, "sampling/importance_sampling_ratio/max": 1.4743931293487549, "sampling/importance_sampling_ratio/mean": 0.9998013377189636, "sampling/importance_sampling_ratio/min": 0.22037020325660706, "sampling/sampling_logp_difference/max": 1.512446403503418, "sampling/sampling_logp_difference/mean": 0.02052040584385395, "step": 453 }, { "clip_ratio/high_max": 0.0574263078160584, "clip_ratio/high_mean": 0.0574263078160584, "clip_ratio/low_mean": 0.01666666753590107, "clip_ratio/low_min": 0.01666666753590107, "clip_ratio/region_mean": 0.07409297535195947, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 58.625, "completions/mean_terminated_length": 58.625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6852592751383781, "epoch": 0.017531665122026568, "frac_reward_zero_std": 0.0, "grad_norm": 9.838415145874023, "learning_rate": 8.627272727272727e-06, "loss": -0.0522, "num_tokens": 975703.0, "reward": 0.9708679914474487, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9708679914474487, "reward_meter_std": 0.03722724691033363, "reward_std": 0.037227239459753036, "reward_total_composite_mean": 0.9708679914474487, "reward_total_composite_std": 0.03722724691033363, "reward_total_mean": 0.9708679914474487, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9708679914474487, "rewards/meter/std": 0.03722724691033363, "rewards/total_composite/mean": 0.9708679914474487, "rewards/total_composite/std": 0.03722724691033363, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0130358934402466, "sampling/importance_sampling_ratio/min": 0.18911553919315338, "sampling/sampling_logp_difference/max": 1.6653971672058105, "sampling/sampling_logp_difference/mean": 0.07885369658470154, "step": 454 }, { "clip_ratio/high_max": 0.03188905236311257, "clip_ratio/high_mean": 0.03188905236311257, "clip_ratio/low_mean": 0.026715174899436533, "clip_ratio/low_min": 0.026715174899436533, "clip_ratio/region_mean": 0.0586042272625491, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 62.5, "completions/mean_terminated_length": 62.5, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5540340095758438, "epoch": 0.017570281124497992, "frac_reward_zero_std": 0.0, "grad_norm": 7.684765815734863, "learning_rate": 8.624242424242424e-06, "loss": 0.0665, "num_tokens": 977683.0, "reward": 0.6929647922515869, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6929647922515869, "reward_meter_std": 0.3059764504432678, "reward_std": 0.3059764504432678, "reward_total_composite_mean": 0.6929647922515869, "reward_total_composite_std": 0.3059764504432678, "reward_total_mean": 0.6929647922515869, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6929647922515869, "rewards/meter/std": 0.3059764504432678, "rewards/total_composite/mean": 0.6929647922515869, "rewards/total_composite/std": 0.3059764504432678, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0214698314666748, "sampling/importance_sampling_ratio/min": 0.06062639132142067, "sampling/sampling_logp_difference/max": 2.803025007247925, "sampling/sampling_logp_difference/mean": 0.07383247464895248, "step": 455 }, { "clip_ratio/high_max": 0.037544333608821034, "clip_ratio/high_mean": 0.037544333608821034, "clip_ratio/low_mean": 0.004999999888241291, "clip_ratio/low_min": 0.004999999888241291, "clip_ratio/region_mean": 0.042544333497062325, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 75.625, "completions/mean_terminated_length": 75.625, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.3263458888977766, "epoch": 0.017608897126969416, "frac_reward_zero_std": 0.0, "grad_norm": 7.524571895599365, "learning_rate": 8.621212121212122e-06, "loss": 0.0137, "num_tokens": 979768.0, "reward": 0.8802084922790527, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8802084922790527, "reward_meter_std": 0.23987267911434174, "reward_std": 0.23987266421318054, "reward_total_composite_mean": 0.8802084922790527, "reward_total_composite_std": 0.23987267911434174, "reward_total_mean": 0.8802084922790527, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8802084922790527, "rewards/meter/std": 0.23987267911434174, "rewards/total_composite/mean": 0.8802084922790527, "rewards/total_composite/std": 0.23987267911434174, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0096123218536377, "sampling/importance_sampling_ratio/min": 0.1034177839756012, "sampling/sampling_logp_difference/max": 2.2689783573150635, "sampling/sampling_logp_difference/mean": 0.0491391159594059, "step": 456 }, { "clip_ratio/high_max": 0.018728531897068024, "clip_ratio/high_mean": 0.018728531897068024, "clip_ratio/low_mean": 0.026498167659156024, "clip_ratio/low_min": 0.026498167659156024, "clip_ratio/region_mean": 0.04522669955622405, "completions/clipped_ratio": 0.0, "completions/max_length": 130.0, "completions/max_terminated_length": 130.0, "completions/mean_length": 110.625, "completions/mean_terminated_length": 110.625, "completions/min_length": 93.0, "completions/min_terminated_length": 93.0, "entropy": 0.3454656656831503, "epoch": 0.01764751312944084, "frac_reward_zero_std": 0.0, "grad_norm": 6.170909404754639, "learning_rate": 8.618181818181819e-06, "loss": 0.0947, "num_tokens": 982005.0, "reward": 0.3757762312889099, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.37684983015060425, "reward_meter_std": 0.48171141743659973, "reward_std": 0.4826580584049225, "reward_total_composite_mean": 0.3757762312889099, "reward_total_composite_std": 0.4826580584049225, "reward_total_mean": 0.3757762312889099, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.37684983015060425, "rewards/meter/std": 0.48171141743659973, "rewards/total_composite/mean": 0.3757762312889099, "rewards/total_composite/std": 0.4826580584049225, "sampling/importance_sampling_ratio/max": 1.8442530632019043, "sampling/importance_sampling_ratio/mean": 1.0049611330032349, "sampling/importance_sampling_ratio/min": 0.22940349578857422, "sampling/sampling_logp_difference/max": 1.4722728729248047, "sampling/sampling_logp_difference/mean": 0.0551149956882, "step": 457 }, { "clip_ratio/high_max": 0.07460826355963945, "clip_ratio/high_mean": 0.07460826355963945, "clip_ratio/low_mean": 0.04874078743159771, "clip_ratio/low_min": 0.04874078743159771, "clip_ratio/region_mean": 0.12334905099123716, "completions/clipped_ratio": 0.0, "completions/max_length": 37.0, "completions/max_terminated_length": 37.0, "completions/mean_length": 25.125, "completions/mean_terminated_length": 25.125, "completions/min_length": 10.0, "completions/min_terminated_length": 10.0, "entropy": 1.231294609606266, "epoch": 0.017686129131912264, "frac_reward_zero_std": 0.0, "grad_norm": 16.211706161499023, "learning_rate": 8.615151515151516e-06, "loss": -0.0317, "num_tokens": 983398.0, "reward": 0.6279522180557251, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6279522180557251, "reward_meter_std": 0.4916090965270996, "reward_std": 0.491609126329422, "reward_total_composite_mean": 0.6279522180557251, "reward_total_composite_std": 0.4916090965270996, "reward_total_mean": 0.6279522180557251, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6279522180557251, "rewards/meter/std": 0.4916090965270996, "rewards/total_composite/mean": 0.6279522180557251, "rewards/total_composite/std": 0.4916090965270996, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0198932886123657, "sampling/importance_sampling_ratio/min": 0.29847922921180725, "sampling/sampling_logp_difference/max": 1.209054946899414, "sampling/sampling_logp_difference/mean": 0.1369742900133133, "step": 458 }, { "clip_ratio/high_max": 0.04640375077724457, "clip_ratio/high_mean": 0.04640375077724457, "clip_ratio/low_mean": 0.02632259437814355, "clip_ratio/low_min": 0.02632259437814355, "clip_ratio/region_mean": 0.07272634515538812, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 74.875, "completions/mean_terminated_length": 74.875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.4475377518683672, "epoch": 0.01772474513438369, "frac_reward_zero_std": 0.0, "grad_norm": 7.541397571563721, "learning_rate": 8.612121212121213e-06, "loss": 0.1012, "num_tokens": 985277.0, "reward": 0.500255286693573, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.500255286693573, "reward_meter_std": 0.3483890891075134, "reward_std": 0.3483890891075134, "reward_total_composite_mean": 0.500255286693573, "reward_total_composite_std": 0.3483890891075134, "reward_total_mean": 0.500255286693573, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.500255286693573, "rewards/meter/std": 0.3483890891075134, "rewards/total_composite/mean": 0.500255286693573, "rewards/total_composite/std": 0.3483890891075134, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.000501036643982, "sampling/importance_sampling_ratio/min": 0.2836383879184723, "sampling/sampling_logp_difference/max": 1.2600550651550293, "sampling/sampling_logp_difference/mean": 0.08134466409683228, "step": 459 }, { "clip_ratio/high_max": 0.012001242313999683, "clip_ratio/high_mean": 0.012001242313999683, "clip_ratio/low_mean": 0.017407751642167568, "clip_ratio/low_min": 0.017407751642167568, "clip_ratio/region_mean": 0.02940899395616725, "completions/clipped_ratio": 0.0, "completions/max_length": 154.0, "completions/max_terminated_length": 154.0, "completions/mean_length": 136.375, "completions/mean_terminated_length": 136.375, "completions/min_length": 119.0, "completions/min_terminated_length": 119.0, "entropy": 0.2906641475856304, "epoch": 0.017763361136855112, "frac_reward_zero_std": 0.0, "grad_norm": 4.076127529144287, "learning_rate": 8.60909090909091e-06, "loss": -0.0349, "num_tokens": 987752.0, "reward": 0.5672988295555115, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5672988295555115, "reward_meter_std": 0.4312629699707031, "reward_std": 0.4312629699707031, "reward_total_composite_mean": 0.5672988295555115, "reward_total_composite_std": 0.4312629699707031, "reward_total_mean": 0.5672988295555115, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5672988295555115, "rewards/meter/std": 0.4312629699707031, "rewards/total_composite/mean": 0.5672988295555115, "rewards/total_composite/std": 0.4312629699707031, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0044218301773071, "sampling/importance_sampling_ratio/min": 0.1266932338476181, "sampling/sampling_logp_difference/max": 2.0659866333007812, "sampling/sampling_logp_difference/mean": 0.045063383877277374, "step": 460 }, { "clip_ratio/high_max": 0.009281257749535143, "clip_ratio/high_mean": 0.009281257749535143, "clip_ratio/low_mean": 0.002057613106444478, "clip_ratio/low_min": 0.002057613106444478, "clip_ratio/region_mean": 0.011338870855979621, "completions/clipped_ratio": 0.0, "completions/max_length": 243.0, "completions/max_terminated_length": 243.0, "completions/mean_length": 208.75, "completions/mean_terminated_length": 208.75, "completions/min_length": 192.0, "completions/min_terminated_length": 192.0, "entropy": 0.08123606955632567, "epoch": 0.017801977139326536, "frac_reward_zero_std": 0.0, "grad_norm": 2.037872552871704, "learning_rate": 8.606060606060606e-06, "loss": 0.059, "num_tokens": 991070.0, "reward": 0.9722763299942017, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.9929186105728149, "reward_meter_std": 0.0022024763748049736, "reward_std": 0.059263937175273895, "reward_total_composite_mean": 0.9722763299942017, "reward_total_composite_std": 0.0592639334499836, "reward_total_mean": 0.9722763299942017, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.9929186105728149, "rewards/meter/std": 0.0022024763748049736, "rewards/total_composite/mean": 0.9722763299942017, "rewards/total_composite/std": 0.0592639334499836, "sampling/importance_sampling_ratio/max": 1.966139793395996, "sampling/importance_sampling_ratio/mean": 1.0022977590560913, "sampling/importance_sampling_ratio/min": 0.16790510714054108, "sampling/sampling_logp_difference/max": 1.7843563556671143, "sampling/sampling_logp_difference/mean": 0.014968657866120338, "step": 461 }, { "clip_ratio/high_max": 0.05066513631027192, "clip_ratio/high_mean": 0.05066513631027192, "clip_ratio/low_mean": 0.012249511666595936, "clip_ratio/low_min": 0.012249511666595936, "clip_ratio/region_mean": 0.06291464797686785, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 87.375, "completions/mean_terminated_length": 87.375, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.557247344404459, "epoch": 0.01784059314179796, "frac_reward_zero_std": 0.0, "grad_norm": 6.325527667999268, "learning_rate": 8.603030303030303e-06, "loss": 0.0298, "num_tokens": 993009.0, "reward": 0.82567298412323, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.82567298412323, "reward_meter_std": 0.2936802804470062, "reward_std": 0.29368025064468384, "reward_total_composite_mean": 0.82567298412323, "reward_total_composite_std": 0.2936802804470062, "reward_total_mean": 0.82567298412323, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.82567298412323, "rewards/meter/std": 0.2936802804470062, "rewards/total_composite/mean": 0.82567298412323, "rewards/total_composite/std": 0.2936802804470062, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.012847661972046, "sampling/importance_sampling_ratio/min": 0.34010180830955505, "sampling/sampling_logp_difference/max": 1.0785102844238281, "sampling/sampling_logp_difference/mean": 0.06957826763391495, "step": 462 }, { "clip_ratio/high_max": 0.02107094577513635, "clip_ratio/high_mean": 0.02107094577513635, "clip_ratio/low_mean": 0.0037878789007663727, "clip_ratio/low_min": 0.0037878789007663727, "clip_ratio/region_mean": 0.024858824675902724, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 65.0, "completions/mean_terminated_length": 65.0, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.1741385543718934, "epoch": 0.017879209144269385, "frac_reward_zero_std": 0.0, "grad_norm": 5.930828094482422, "learning_rate": 8.6e-06, "loss": 0.0017, "num_tokens": 994937.0, "reward": 0.9922396540641785, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9922396540641785, "reward_meter_std": 0.002804464427754283, "reward_std": 0.0028044627979397774, "reward_total_composite_mean": 0.9922396540641785, "reward_total_composite_std": 0.002804464427754283, "reward_total_mean": 0.9922396540641785, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9922396540641785, "rewards/meter/std": 0.002804464427754283, "rewards/total_composite/mean": 0.9922396540641785, "rewards/total_composite/std": 0.002804464427754283, "sampling/importance_sampling_ratio/max": 1.8714525699615479, "sampling/importance_sampling_ratio/mean": 1.003735065460205, "sampling/importance_sampling_ratio/min": 0.3877050578594208, "sampling/sampling_logp_difference/max": 0.9475104808807373, "sampling/sampling_logp_difference/mean": 0.033212851732969284, "step": 463 }, { "clip_ratio/high_max": 0.08965541888028383, "clip_ratio/high_mean": 0.08965541888028383, "clip_ratio/low_mean": 0.008184524020180106, "clip_ratio/low_min": 0.008184524020180106, "clip_ratio/region_mean": 0.09783994290046394, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 48.0, "completions/mean_length": 155.25, "completions/mean_terminated_length": 36.333335876464844, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 1.133492972701788, "epoch": 0.01791782514674081, "frac_reward_zero_std": 0.0, "grad_norm": 2.3135251998901367, "learning_rate": 8.596969696969698e-06, "loss": 0.0244, "num_tokens": 996427.0, "reward": 0.6161172389984131, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6161172389984131, "reward_meter_std": 0.4752645790576935, "reward_std": 0.47526460886001587, "reward_total_composite_mean": 0.6161172389984131, "reward_total_composite_std": 0.4752645790576935, "reward_total_mean": 0.6161172389984131, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6161172389984131, "rewards/meter/std": 0.4752645790576935, "rewards/total_composite/mean": 0.6161172389984131, "rewards/total_composite/std": 0.4752645790576935, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9996461868286133, "sampling/importance_sampling_ratio/min": 0.307363361120224, "sampling/sampling_logp_difference/max": 1.1797246932983398, "sampling/sampling_logp_difference/mean": 0.12042637169361115, "step": 464 }, { "clip_ratio/high_max": 0.017931917682290077, "clip_ratio/high_mean": 0.017931917682290077, "clip_ratio/low_mean": 0.015818335115909576, "clip_ratio/low_min": 0.015818335115909576, "clip_ratio/region_mean": 0.033750252798199654, "completions/clipped_ratio": 0.0, "completions/max_length": 133.0, "completions/max_terminated_length": 133.0, "completions/mean_length": 120.875, "completions/mean_terminated_length": 120.875, "completions/min_length": 113.0, "completions/min_terminated_length": 113.0, "entropy": 0.2514910716563463, "epoch": 0.017956441149212233, "frac_reward_zero_std": 0.0, "grad_norm": 4.309906959533691, "learning_rate": 8.593939393939395e-06, "loss": 0.0135, "num_tokens": 998754.0, "reward": 0.6896439790725708, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8134843111038208, "reward_meter_std": 0.3482135534286499, "reward_std": 0.44019806385040283, "reward_total_composite_mean": 0.6896439790725708, "reward_total_composite_std": 0.4401980936527252, "reward_total_mean": 0.6896439790725708, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8134843111038208, "rewards/meter/std": 0.3482135534286499, "rewards/total_composite/mean": 0.6896439790725708, "rewards/total_composite/std": 0.4401980936527252, "sampling/importance_sampling_ratio/max": 1.797261357307434, "sampling/importance_sampling_ratio/mean": 1.0006272792816162, "sampling/importance_sampling_ratio/min": 0.311477929353714, "sampling/sampling_logp_difference/max": 1.1664267778396606, "sampling/sampling_logp_difference/mean": 0.03921005502343178, "step": 465 }, { "clip_ratio/high_max": 0.03716489998623729, "clip_ratio/high_mean": 0.03716489998623729, "clip_ratio/low_mean": 0.006340579595416784, "clip_ratio/low_min": 0.006340579595416784, "clip_ratio/region_mean": 0.04350547958165407, "completions/clipped_ratio": 0.0, "completions/max_length": 138.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 120.125, "completions/mean_terminated_length": 120.125, "completions/min_length": 112.0, "completions/min_terminated_length": 112.0, "entropy": 0.291955066844821, "epoch": 0.017995057151683657, "frac_reward_zero_std": 0.0, "grad_norm": 5.061103820800781, "learning_rate": 8.590909090909092e-06, "loss": 0.0569, "num_tokens": 1000955.0, "reward": 0.9295108914375305, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9295108914375305, "reward_meter_std": 0.18052063882350922, "reward_std": 0.18052060902118683, "reward_total_composite_mean": 0.9295108914375305, "reward_total_composite_std": 0.18052063882350922, "reward_total_mean": 0.9295108914375305, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9295108914375305, "rewards/meter/std": 0.18052063882350922, "rewards/total_composite/mean": 0.9295108914375305, "rewards/total_composite/std": 0.18052063882350922, "sampling/importance_sampling_ratio/max": 1.9984016418457031, "sampling/importance_sampling_ratio/mean": 1.0039215087890625, "sampling/importance_sampling_ratio/min": 0.09835071116685867, "sampling/sampling_logp_difference/max": 2.3192155361175537, "sampling/sampling_logp_difference/mean": 0.04497542977333069, "step": 466 }, { "clip_ratio/high_max": 0.008227241458371282, "clip_ratio/high_mean": 0.008227241458371282, "clip_ratio/low_mean": 0.00698582676704973, "clip_ratio/low_min": 0.00698582676704973, "clip_ratio/region_mean": 0.015213068225421011, "completions/clipped_ratio": 0.0, "completions/max_length": 174.0, "completions/max_terminated_length": 174.0, "completions/mean_length": 152.0, "completions/mean_terminated_length": 152.0, "completions/min_length": 138.0, "completions/min_terminated_length": 138.0, "entropy": 0.0712776998989284, "epoch": 0.01803367315415508, "frac_reward_zero_std": 0.0, "grad_norm": 2.9019546508789062, "learning_rate": 8.587878787878788e-06, "loss": 0.0437, "num_tokens": 1003675.0, "reward": 0.8826419711112976, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8826419711112976, "reward_meter_std": 0.06341774016618729, "reward_std": 0.06341774016618729, "reward_total_composite_mean": 0.8826419711112976, "reward_total_composite_std": 0.06341774016618729, "reward_total_mean": 0.8826419711112976, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8826419711112976, "rewards/meter/std": 0.06341774016618729, "rewards/total_composite/mean": 0.8826419711112976, "rewards/total_composite/std": 0.06341774016618729, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0029544830322266, "sampling/importance_sampling_ratio/min": 0.26845496892929077, "sampling/sampling_logp_difference/max": 1.3150720596313477, "sampling/sampling_logp_difference/mean": 0.015705382451415062, "step": 467 }, { "clip_ratio/high_max": 0.0006329113966785371, "clip_ratio/high_mean": 0.0006329113966785371, "clip_ratio/low_mean": 0.0020095510117243975, "clip_ratio/low_min": 0.0020095510117243975, "clip_ratio/region_mean": 0.0026424624084029347, "completions/clipped_ratio": 0.0, "completions/max_length": 413.0, "completions/max_terminated_length": 413.0, "completions/mean_length": 386.25, "completions/mean_terminated_length": 386.25, "completions/min_length": 359.0, "completions/min_terminated_length": 359.0, "entropy": 0.028902734396979213, "epoch": 0.018072289156626505, "frac_reward_zero_std": 0.0, "grad_norm": 0.9965296983718872, "learning_rate": 8.584848484848485e-06, "loss": -0.0241, "num_tokens": 1008541.0, "reward": 0.906877875328064, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9431818723678589, "reward_count_adherence_std": 0.047049909830093384, "reward_meter_mean": 0.9619865417480469, "reward_meter_std": 0.025031376630067825, "reward_std": 0.04043539986014366, "reward_total_composite_mean": 0.906877875328064, "reward_total_composite_std": 0.04043539986014366, "reward_total_mean": 0.906877875328064, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9431818723678589, "rewards/count_adherence/std": 0.047049909830093384, "rewards/meter/mean": 0.9619865417480469, "rewards/meter/std": 0.025031376630067825, "rewards/total_composite/mean": 0.906877875328064, "rewards/total_composite/std": 0.04043539986014366, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0018101930618286, "sampling/importance_sampling_ratio/min": 0.4794699549674988, "sampling/sampling_logp_difference/max": 1.920891523361206, "sampling/sampling_logp_difference/mean": 0.00543476827442646, "step": 468 }, { "clip_ratio/high_max": 0.026214548386633396, "clip_ratio/high_mean": 0.026214548386633396, "clip_ratio/low_mean": 0.009848485235124826, "clip_ratio/low_min": 0.009848485235124826, "clip_ratio/region_mean": 0.03606303362175822, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 37.0, "completions/mean_terminated_length": 37.0, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.17447292152792215, "epoch": 0.01811090515909793, "frac_reward_zero_std": 0.0, "grad_norm": 7.141157150268555, "learning_rate": 8.581818181818183e-06, "loss": 0.1817, "num_tokens": 1010085.0, "reward": 0.7328898906707764, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.857481062412262, "reward_meter_std": 0.2525491416454315, "reward_std": 0.38510987162590027, "reward_total_composite_mean": 0.7328898906707764, "reward_total_composite_std": 0.38510990142822266, "reward_total_mean": 0.7328898906707764, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.857481062412262, "rewards/meter/std": 0.2525491416454315, "rewards/total_composite/mean": 0.7328898906707764, "rewards/total_composite/std": 0.38510990142822266, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9989219903945923, "sampling/importance_sampling_ratio/min": 0.2123665064573288, "sampling/sampling_logp_difference/max": 1.5494416952133179, "sampling/sampling_logp_difference/mean": 0.04425249993801117, "step": 469 }, { "clip_ratio/high_max": 0.0195100650889799, "clip_ratio/high_mean": 0.0195100650889799, "clip_ratio/low_mean": 0.007512626354582608, "clip_ratio/low_min": 0.007512626354582608, "clip_ratio/region_mean": 0.027022691443562508, "completions/clipped_ratio": 0.0, "completions/max_length": 100.0, "completions/max_terminated_length": 100.0, "completions/mean_length": 96.375, "completions/mean_terminated_length": 96.375, "completions/min_length": 94.0, "completions/min_terminated_length": 94.0, "entropy": 0.22278593480587006, "epoch": 0.018149521161569353, "frac_reward_zero_std": 0.0, "grad_norm": 7.436746597290039, "learning_rate": 8.57878787878788e-06, "loss": 0.0294, "num_tokens": 1012136.0, "reward": 0.9915547370910645, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9915547370910645, "reward_meter_std": 0.0038915486074984074, "reward_std": 0.0038915553595870733, "reward_total_composite_mean": 0.9915547370910645, "reward_total_composite_std": 0.0038915486074984074, "reward_total_mean": 0.9915547370910645, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9915547370910645, "rewards/meter/std": 0.0038915486074984074, "rewards/total_composite/mean": 0.9915547370910645, "rewards/total_composite/std": 0.0038915486074984074, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0057390928268433, "sampling/importance_sampling_ratio/min": 0.24664175510406494, "sampling/sampling_logp_difference/max": 1.3998184204101562, "sampling/sampling_logp_difference/mean": 0.038666851818561554, "step": 470 }, { "clip_ratio/high_max": 0.09589226730167866, "clip_ratio/high_mean": 0.09589226730167866, "clip_ratio/low_mean": 0.07797870878130198, "clip_ratio/low_min": 0.07797870878130198, "clip_ratio/region_mean": 0.17387097608298063, "completions/clipped_ratio": 0.0, "completions/max_length": 47.0, "completions/max_terminated_length": 47.0, "completions/mean_length": 40.5, "completions/mean_terminated_length": 40.5, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 1.0023160837590694, "epoch": 0.018188137164040778, "frac_reward_zero_std": 0.0, "grad_norm": 15.974438667297363, "learning_rate": 8.575757575757575e-06, "loss": 0.0586, "num_tokens": 1013700.0, "reward": 0.38729679584503174, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.38729679584503174, "reward_meter_std": 0.3866852819919586, "reward_std": 0.3866852819919586, "reward_total_composite_mean": 0.38729679584503174, "reward_total_composite_std": 0.3866852819919586, "reward_total_mean": 0.38729679584503174, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.38729679584503174, "rewards/meter/std": 0.3866852819919586, "rewards/total_composite/mean": 0.38729679584503174, "rewards/total_composite/std": 0.3866852819919586, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0078424215316772, "sampling/importance_sampling_ratio/min": 0.1371387541294098, "sampling/sampling_logp_difference/max": 1.9867620468139648, "sampling/sampling_logp_difference/mean": 0.16885001957416534, "step": 471 }, { "clip_ratio/high_max": 0.004306173766963184, "clip_ratio/high_mean": 0.004306173766963184, "clip_ratio/low_mean": 0.004235844942741096, "clip_ratio/low_min": 0.004235844942741096, "clip_ratio/region_mean": 0.00854201870970428, "completions/clipped_ratio": 0.0, "completions/max_length": 334.0, "completions/max_terminated_length": 334.0, "completions/mean_length": 278.75, "completions/mean_terminated_length": 278.75, "completions/min_length": 241.0, "completions/min_terminated_length": 241.0, "entropy": 0.03723532357253134, "epoch": 0.0182267531665122, "frac_reward_zero_std": 0.0, "grad_norm": 1.0963542461395264, "learning_rate": 8.572727272727274e-06, "loss": -0.0246, "num_tokens": 1017570.0, "reward": 0.8407608866691589, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_meter_mean": 0.924202561378479, "reward_meter_std": 0.0937681496143341, "reward_std": 0.10190220922231674, "reward_total_composite_mean": 0.8407608866691589, "reward_total_composite_std": 0.10190222412347794, "reward_total_mean": 0.8407608866691589, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/meter/mean": 0.924202561378479, "rewards/meter/std": 0.0937681496143341, "rewards/total_composite/mean": 0.8407608866691589, "rewards/total_composite/std": 0.10190222412347794, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.000677227973938, "sampling/importance_sampling_ratio/min": 0.370554655790329, "sampling/sampling_logp_difference/max": 0.992754340171814, "sampling/sampling_logp_difference/mean": 0.008891636505723, "step": 472 }, { "clip_ratio/high_max": 0.01820858521386981, "clip_ratio/high_mean": 0.01820858521386981, "clip_ratio/low_mean": 0.01952884637285024, "clip_ratio/low_min": 0.01952884637285024, "clip_ratio/region_mean": 0.03773743158672005, "completions/clipped_ratio": 0.0, "completions/max_length": 196.0, "completions/max_terminated_length": 196.0, "completions/mean_length": 171.25, "completions/mean_terminated_length": 171.25, "completions/min_length": 149.0, "completions/min_terminated_length": 149.0, "entropy": 0.17230255994945765, "epoch": 0.018265369168983626, "frac_reward_zero_std": 0.0, "grad_norm": 5.147512912750244, "learning_rate": 8.56969696969697e-06, "loss": -0.0118, "num_tokens": 1020348.0, "reward": 0.49889272451400757, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.0890870913863182, "reward_meter_mean": 0.5626472234725952, "reward_meter_std": 0.38277679681777954, "reward_std": 0.33463039994239807, "reward_total_composite_mean": 0.49889272451400757, "reward_total_composite_std": 0.33463042974472046, "reward_total_mean": 0.49889272451400757, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.0890870913863182, "rewards/meter/mean": 0.5626472234725952, "rewards/meter/std": 0.38277679681777954, "rewards/total_composite/mean": 0.49889272451400757, "rewards/total_composite/std": 0.33463042974472046, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9987762570381165, "sampling/importance_sampling_ratio/min": 0.12169203162193298, "sampling/sampling_logp_difference/max": 2.106261730194092, "sampling/sampling_logp_difference/mean": 0.053236186504364014, "step": 473 }, { "clip_ratio/high_max": 0.004681251273723319, "clip_ratio/high_mean": 0.004681251273723319, "clip_ratio/low_mean": 0.005101353977806866, "clip_ratio/low_min": 0.005101353977806866, "clip_ratio/region_mean": 0.009782605251530185, "completions/clipped_ratio": 0.0, "completions/max_length": 291.0, "completions/max_terminated_length": 291.0, "completions/mean_length": 253.625, "completions/mean_terminated_length": 253.625, "completions/min_length": 223.0, "completions/min_terminated_length": 223.0, "entropy": 0.10501971561461687, "epoch": 0.01830398517145505, "frac_reward_zero_std": 0.0, "grad_norm": 2.0184075832366943, "learning_rate": 8.566666666666667e-06, "loss": 0.0284, "num_tokens": 1024089.0, "reward": 0.915224552154541, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.0890870913863182, "reward_meter_mean": 0.998430073261261, "reward_meter_std": 0.0012139956234022975, "reward_std": 0.08891873806715012, "reward_total_composite_mean": 0.915224552154541, "reward_total_composite_std": 0.08891873806715012, "reward_total_mean": 0.915224552154541, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.0890870913863182, "rewards/meter/mean": 0.998430073261261, "rewards/meter/std": 0.0012139956234022975, "rewards/total_composite/mean": 0.915224552154541, "rewards/total_composite/std": 0.08891873806715012, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9997615814208984, "sampling/importance_sampling_ratio/min": 0.1190701276063919, "sampling/sampling_logp_difference/max": 2.128042697906494, "sampling/sampling_logp_difference/mean": 0.020224176347255707, "step": 474 }, { "clip_ratio/high_max": 0.04206577688455582, "clip_ratio/high_mean": 0.04206577688455582, "clip_ratio/low_mean": 0.006897549610584974, "clip_ratio/low_min": 0.006897549610584974, "clip_ratio/region_mean": 0.04896332649514079, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 71.25, "completions/mean_terminated_length": 71.25, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.2513603400439024, "epoch": 0.018342601173926474, "frac_reward_zero_std": 0.0, "grad_norm": 5.0996994972229, "learning_rate": 8.563636363636364e-06, "loss": 0.0063, "num_tokens": 1025987.0, "reward": 0.8450901508331299, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8450901508331299, "reward_meter_std": 0.1726076304912567, "reward_std": 0.17260761559009552, "reward_total_composite_mean": 0.8450901508331299, "reward_total_composite_std": 0.1726076304912567, "reward_total_mean": 0.8450901508331299, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8450901508331299, "rewards/meter/std": 0.1726076304912567, "rewards/total_composite/mean": 0.8450901508331299, "rewards/total_composite/std": 0.1726076304912567, "sampling/importance_sampling_ratio/max": 1.6401515007019043, "sampling/importance_sampling_ratio/mean": 0.9991965889930725, "sampling/importance_sampling_ratio/min": 0.3256930410861969, "sampling/sampling_logp_difference/max": 1.1217999458312988, "sampling/sampling_logp_difference/mean": 0.043718110769987106, "step": 475 }, { "clip_ratio/high_max": 0.012941297609359026, "clip_ratio/high_mean": 0.012941297609359026, "clip_ratio/low_mean": 0.009093915577977896, "clip_ratio/low_min": 0.009093915577977896, "clip_ratio/region_mean": 0.02203521318733692, "completions/clipped_ratio": 0.0, "completions/max_length": 35.0, "completions/max_terminated_length": 35.0, "completions/mean_length": 29.875, "completions/mean_terminated_length": 29.875, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.20345518365502357, "epoch": 0.018381217176397898, "frac_reward_zero_std": 0.0, "grad_norm": 7.3300299644470215, "learning_rate": 8.560606060606062e-06, "loss": -0.0343, "num_tokens": 1027490.0, "reward": 0.9858591556549072, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9858591556549072, "reward_meter_std": 0.004257791675627232, "reward_std": 0.004257792141288519, "reward_total_composite_mean": 0.9858591556549072, "reward_total_composite_std": 0.004257791675627232, "reward_total_mean": 0.9858591556549072, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9858591556549072, "rewards/meter/std": 0.004257791675627232, "rewards/total_composite/mean": 0.9858591556549072, "rewards/total_composite/std": 0.004257791675627232, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0109765529632568, "sampling/importance_sampling_ratio/min": 0.5488837957382202, "sampling/sampling_logp_difference/max": 0.8543341159820557, "sampling/sampling_logp_difference/mean": 0.03374743461608887, "step": 476 }, { "clip_ratio/high_max": 0.011585089145228267, "clip_ratio/high_mean": 0.011585089145228267, "clip_ratio/low_mean": 0.005435622064396739, "clip_ratio/low_min": 0.005435622064396739, "clip_ratio/region_mean": 0.017020711209625006, "completions/clipped_ratio": 0.0, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 108.5, "completions/mean_terminated_length": 108.5, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "entropy": 0.15065084025263786, "epoch": 0.018419833178869322, "frac_reward_zero_std": 0.0, "grad_norm": 3.7667415142059326, "learning_rate": 8.557575757575757e-06, "loss": 0.018, "num_tokens": 1029622.0, "reward": 0.9522513151168823, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9522513151168823, "reward_meter_std": 0.056059498339891434, "reward_std": 0.05605950206518173, "reward_total_composite_mean": 0.9522513151168823, "reward_total_composite_std": 0.056059498339891434, "reward_total_mean": 0.9522513151168823, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9522513151168823, "rewards/meter/std": 0.056059498339891434, "rewards/total_composite/mean": 0.9522513151168823, "rewards/total_composite/std": 0.056059498339891434, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0057148933410645, "sampling/importance_sampling_ratio/min": 0.3075287938117981, "sampling/sampling_logp_difference/max": 1.1791865825653076, "sampling/sampling_logp_difference/mean": 0.026357771828770638, "step": 477 }, { "clip_ratio/high_max": 0.04250439163297415, "clip_ratio/high_mean": 0.04250439163297415, "clip_ratio/low_mean": 0.02712087077088654, "clip_ratio/low_min": 0.02712087077088654, "clip_ratio/region_mean": 0.06962526240386069, "completions/clipped_ratio": 0.0, "completions/max_length": 41.0, "completions/max_terminated_length": 41.0, "completions/mean_length": 37.875, "completions/mean_terminated_length": 37.875, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.5912935622036457, "epoch": 0.018458449181340746, "frac_reward_zero_std": 0.0, "grad_norm": 10.037378311157227, "learning_rate": 8.554545454545456e-06, "loss": -0.0113, "num_tokens": 1031189.0, "reward": 0.978717565536499, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.978717565536499, "reward_meter_std": 0.019986465573310852, "reward_std": 0.019986478611826897, "reward_total_composite_mean": 0.978717565536499, "reward_total_composite_std": 0.019986465573310852, "reward_total_mean": 0.978717565536499, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.978717565536499, "rewards/meter/std": 0.019986465573310852, "rewards/total_composite/mean": 0.978717565536499, "rewards/total_composite/std": 0.019986465573310852, "sampling/importance_sampling_ratio/max": 1.5463435649871826, "sampling/importance_sampling_ratio/mean": 1.0022932291030884, "sampling/importance_sampling_ratio/min": 0.23787212371826172, "sampling/sampling_logp_difference/max": 1.4360220432281494, "sampling/sampling_logp_difference/mean": 0.08604246377944946, "step": 478 }, { "clip_ratio/high_max": 0.05710198846645653, "clip_ratio/high_mean": 0.05710198846645653, "clip_ratio/low_mean": 0.018391148187220097, "clip_ratio/low_min": 0.018391148187220097, "clip_ratio/region_mean": 0.07549313665367663, "completions/clipped_ratio": 0.0, "completions/max_length": 44.0, "completions/max_terminated_length": 44.0, "completions/mean_length": 39.75, "completions/mean_terminated_length": 39.75, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.5402822978794575, "epoch": 0.01849706518381217, "frac_reward_zero_std": 0.0, "grad_norm": 10.624458312988281, "learning_rate": 8.551515151515152e-06, "loss": 0.0424, "num_tokens": 1032963.0, "reward": 0.9893389940261841, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9893389940261841, "reward_meter_std": 0.015485532581806183, "reward_std": 0.015485531650483608, "reward_total_composite_mean": 0.9893389940261841, "reward_total_composite_std": 0.015485532581806183, "reward_total_mean": 0.9893389940261841, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9893389940261841, "rewards/meter/std": 0.015485532581806183, "rewards/total_composite/mean": 0.9893389940261841, "rewards/total_composite/std": 0.015485532581806183, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0154733657836914, "sampling/importance_sampling_ratio/min": 0.2684987783432007, "sampling/sampling_logp_difference/max": 1.3149088621139526, "sampling/sampling_logp_difference/mean": 0.10419061034917831, "step": 479 }, { "clip_ratio/high_max": 0.05253493972122669, "clip_ratio/high_mean": 0.05253493972122669, "clip_ratio/low_mean": 0.05937229562550783, "clip_ratio/low_min": 0.05937229562550783, "clip_ratio/region_mean": 0.11190723534673452, "completions/clipped_ratio": 0.0, "completions/max_length": 37.0, "completions/max_terminated_length": 37.0, "completions/mean_length": 31.625, "completions/mean_terminated_length": 31.625, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 1.2414276078343391, "epoch": 0.018535681186283594, "frac_reward_zero_std": 0.0, "grad_norm": 20.665754318237305, "learning_rate": 8.548484848484849e-06, "loss": -0.0113, "num_tokens": 1034496.0, "reward": 0.9100282192230225, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9100282192230225, "reward_meter_std": 0.14061063528060913, "reward_std": 0.14061065018177032, "reward_total_composite_mean": 0.9100282192230225, "reward_total_composite_std": 0.14061063528060913, "reward_total_mean": 0.9100282192230225, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9100282192230225, "rewards/meter/std": 0.14061063528060913, "rewards/total_composite/mean": 0.9100282192230225, "rewards/total_composite/std": 0.14061063528060913, "sampling/importance_sampling_ratio/max": 1.649492859840393, "sampling/importance_sampling_ratio/mean": 1.0112000703811646, "sampling/importance_sampling_ratio/min": 0.37617847323417664, "sampling/sampling_logp_difference/max": 0.977691650390625, "sampling/sampling_logp_difference/mean": 0.13002178072929382, "step": 480 }, { "clip_ratio/high_max": 0.08672621939331293, "clip_ratio/high_mean": 0.08672621939331293, "clip_ratio/low_mean": 0.010937499813735485, "clip_ratio/low_min": 0.010937499813735485, "clip_ratio/region_mean": 0.09766371920704842, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 76.75, "completions/mean_terminated_length": 76.75, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.5781661160290241, "epoch": 0.01857429718875502, "frac_reward_zero_std": 0.0, "grad_norm": 8.993289947509766, "learning_rate": 8.545454545454546e-06, "loss": 0.024, "num_tokens": 1036446.0, "reward": 0.9631932973861694, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9631932973861694, "reward_meter_std": 0.08677735924720764, "reward_std": 0.08677736669778824, "reward_total_composite_mean": 0.9631932973861694, "reward_total_composite_std": 0.08677735924720764, "reward_total_mean": 0.9631932973861694, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9631932973861694, "rewards/meter/std": 0.08677735924720764, "rewards/total_composite/mean": 0.9631932973861694, "rewards/total_composite/std": 0.08677735924720764, "sampling/importance_sampling_ratio/max": 1.636481761932373, "sampling/importance_sampling_ratio/mean": 0.9976180195808411, "sampling/importance_sampling_ratio/min": 0.2606494724750519, "sampling/sampling_logp_difference/max": 1.344578742980957, "sampling/sampling_logp_difference/mean": 0.0779096931219101, "step": 481 }, { "clip_ratio/high_max": 0.005991354206344113, "clip_ratio/high_mean": 0.005991354206344113, "clip_ratio/low_mean": 0.002808988792821765, "clip_ratio/low_min": 0.002808988792821765, "clip_ratio/region_mean": 0.008800342999165878, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 288.0, "completions/mean_length": 300.125, "completions/mean_terminated_length": 269.8571472167969, "completions/min_length": 254.0, "completions/min_terminated_length": 254.0, "entropy": 0.07355018192902207, "epoch": 0.018612913191226443, "frac_reward_zero_std": 0.0, "grad_norm": 1.2208207845687866, "learning_rate": 8.542424242424243e-06, "loss": -0.244, "num_tokens": 1040023.0, "reward": 0.7929118871688843, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.29574236273765564, "reward_meter_mean": 0.9346262216567993, "reward_meter_std": 0.16473090648651123, "reward_std": 0.3079202473163605, "reward_total_composite_mean": 0.7929118871688843, "reward_total_composite_std": 0.3079202473163605, "reward_total_mean": 0.7929118871688843, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.29574236273765564, "rewards/meter/mean": 0.9346262216567993, "rewards/meter/std": 0.16473090648651123, "rewards/total_composite/mean": 0.7929118871688843, "rewards/total_composite/std": 0.3079202473163605, "sampling/importance_sampling_ratio/max": 1.6571389436721802, "sampling/importance_sampling_ratio/mean": 1.0012937784194946, "sampling/importance_sampling_ratio/min": 0.3793216049671173, "sampling/sampling_logp_difference/max": 0.9693708419799805, "sampling/sampling_logp_difference/mean": 0.012091459706425667, "step": 482 }, { "clip_ratio/high_max": 0.010245901241432875, "clip_ratio/high_mean": 0.010245901241432875, "clip_ratio/low_mean": 0.0014594576205126941, "clip_ratio/low_min": 0.0014594576205126941, "clip_ratio/region_mean": 0.01170535886194557, "completions/clipped_ratio": 0.0, "completions/max_length": 183.0, "completions/max_terminated_length": 183.0, "completions/mean_length": 180.25, "completions/mean_terminated_length": 180.25, "completions/min_length": 161.0, "completions/min_terminated_length": 161.0, "entropy": 0.0649343291297555, "epoch": 0.018651529193697867, "frac_reward_zero_std": 0.0, "grad_norm": 3.103454828262329, "learning_rate": 8.539393939393939e-06, "loss": 0.0021, "num_tokens": 1043145.0, "reward": 0.9860587120056152, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9860587120056152, "reward_meter_std": 0.00629128934815526, "reward_std": 0.006291288882493973, "reward_total_composite_mean": 0.9860587120056152, "reward_total_composite_std": 0.00629128934815526, "reward_total_mean": 0.9860587120056152, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9860587120056152, "rewards/meter/std": 0.00629128934815526, "rewards/total_composite/mean": 0.9860587120056152, "rewards/total_composite/std": 0.00629128934815526, "sampling/importance_sampling_ratio/max": 1.7320133447647095, "sampling/importance_sampling_ratio/mean": 1.0001847743988037, "sampling/importance_sampling_ratio/min": 0.41738274693489075, "sampling/sampling_logp_difference/max": 0.8737516403198242, "sampling/sampling_logp_difference/mean": 0.011846227571368217, "step": 483 }, { "clip_ratio/high_max": 0.059974749106913805, "clip_ratio/high_mean": 0.059974749106913805, "clip_ratio/low_mean": 0.029679158004000783, "clip_ratio/low_min": 0.029679158004000783, "clip_ratio/region_mean": 0.08965390711091459, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 66.75, "completions/mean_terminated_length": 66.75, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.9045082405209541, "epoch": 0.01869014519616929, "frac_reward_zero_std": 0.0, "grad_norm": 9.362083435058594, "learning_rate": 8.536363636363636e-06, "loss": 0.0128, "num_tokens": 1044895.0, "reward": 0.6785883903503418, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7406154870986938, "reward_meter_std": 0.36668860912323, "reward_std": 0.35991325974464417, "reward_total_composite_mean": 0.6785883903503418, "reward_total_composite_std": 0.3599132299423218, "reward_total_mean": 0.6785883903503418, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7406154870986938, "rewards/meter/std": 0.36668860912323, "rewards/total_composite/mean": 0.6785883903503418, "rewards/total_composite/std": 0.3599132299423218, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0062280893325806, "sampling/importance_sampling_ratio/min": 0.25423842668533325, "sampling/sampling_logp_difference/max": 1.3694827556610107, "sampling/sampling_logp_difference/mean": 0.10126848518848419, "step": 484 }, { "clip_ratio/high_max": 0.07197061297483742, "clip_ratio/high_mean": 0.07197061297483742, "clip_ratio/low_mean": 0.015625, "clip_ratio/low_min": 0.015625, "clip_ratio/region_mean": 0.08759561297483742, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 61.375, "completions/mean_terminated_length": 61.375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5880453810095787, "epoch": 0.018728761198640715, "frac_reward_zero_std": 0.0, "grad_norm": 11.369089126586914, "learning_rate": 8.533333333333335e-06, "loss": -0.0278, "num_tokens": 1046762.0, "reward": 0.8861362338066101, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8861362338066101, "reward_meter_std": 0.2756871283054352, "reward_std": 0.2756870985031128, "reward_total_composite_mean": 0.8861362338066101, "reward_total_composite_std": 0.2756871283054352, "reward_total_mean": 0.8861362338066101, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8861362338066101, "rewards/meter/std": 0.2756871283054352, "rewards/total_composite/mean": 0.8861362338066101, "rewards/total_composite/std": 0.2756871283054352, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9978853464126587, "sampling/importance_sampling_ratio/min": 0.26445987820625305, "sampling/sampling_logp_difference/max": 1.3300657272338867, "sampling/sampling_logp_difference/mean": 0.08699135482311249, "step": 485 }, { "clip_ratio/high_max": 0.030109542072750628, "clip_ratio/high_mean": 0.030109542072750628, "clip_ratio/low_mean": 0.02085444121621549, "clip_ratio/low_min": 0.02085444121621549, "clip_ratio/region_mean": 0.05096398328896612, "completions/clipped_ratio": 0.0, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 99.5, "completions/mean_terminated_length": 99.5, "completions/min_length": 84.0, "completions/min_terminated_length": 84.0, "entropy": 0.2146557718515396, "epoch": 0.018767377201112143, "frac_reward_zero_std": 0.0, "grad_norm": 4.333034992218018, "learning_rate": 8.53030303030303e-06, "loss": -0.026, "num_tokens": 1048822.0, "reward": 0.7474471926689148, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.786818265914917, "reward_meter_std": 0.3528897166252136, "reward_std": 0.3502931594848633, "reward_total_composite_mean": 0.7474471926689148, "reward_total_composite_std": 0.35029318928718567, "reward_total_mean": 0.7474471926689148, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.786818265914917, "rewards/meter/std": 0.3528897166252136, "rewards/total_composite/mean": 0.7474471926689148, "rewards/total_composite/std": 0.35029318928718567, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002170443534851, "sampling/importance_sampling_ratio/min": 0.22690196335315704, "sampling/sampling_logp_difference/max": 1.4832372665405273, "sampling/sampling_logp_difference/mean": 0.0431230328977108, "step": 486 }, { "clip_ratio/high_max": 0.013687330298125744, "clip_ratio/high_mean": 0.013687330298125744, "clip_ratio/low_mean": 0.002577319508418441, "clip_ratio/low_min": 0.002577319508418441, "clip_ratio/region_mean": 0.016264649806544185, "completions/clipped_ratio": 0.0, "completions/max_length": 439.0, "completions/max_terminated_length": 439.0, "completions/mean_length": 400.125, "completions/mean_terminated_length": 400.125, "completions/min_length": 344.0, "completions/min_terminated_length": 344.0, "entropy": 0.12399658421054482, "epoch": 0.018805993203583567, "frac_reward_zero_std": 0.0, "grad_norm": 1.3781453371047974, "learning_rate": 8.527272727272728e-06, "loss": -0.0076, "num_tokens": 1053671.0, "reward": 0.6021700501441956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9634721279144287, "reward_meter_std": 0.0763736218214035, "reward_std": 0.047733522951602936, "reward_total_composite_mean": 0.6021700501441956, "reward_total_composite_std": 0.047733522951602936, "reward_total_mean": 0.6021700501441956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9634721279144287, "rewards/meter/std": 0.0763736218214035, "rewards/total_composite/mean": 0.6021700501441956, "rewards/total_composite/std": 0.047733522951602936, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0029096603393555, "sampling/importance_sampling_ratio/min": 0.25609996914863586, "sampling/sampling_logp_difference/max": 1.362187385559082, "sampling/sampling_logp_difference/mean": 0.018493853509426117, "step": 487 }, { "clip_ratio/high_max": 0.08754385984502733, "clip_ratio/high_mean": 0.08754385984502733, "clip_ratio/low_mean": 0.019999999552965164, "clip_ratio/low_min": 0.019999999552965164, "clip_ratio/region_mean": 0.10754385939799249, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 56.375, "completions/mean_terminated_length": 56.375, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.9573509357869625, "epoch": 0.01884460920605499, "frac_reward_zero_std": 0.0, "grad_norm": 12.93553352355957, "learning_rate": 8.524242424242425e-06, "loss": -0.0275, "num_tokens": 1055530.0, "reward": 0.9578395485877991, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9578395485877991, "reward_meter_std": 0.06491218507289886, "reward_std": 0.06491218507289886, "reward_total_composite_mean": 0.9578395485877991, "reward_total_composite_std": 0.06491218507289886, "reward_total_mean": 0.9578395485877991, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9578395485877991, "rewards/meter/std": 0.06491218507289886, "rewards/total_composite/mean": 0.9578395485877991, "rewards/total_composite/std": 0.06491218507289886, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.005127191543579, "sampling/importance_sampling_ratio/min": 0.29221248626708984, "sampling/sampling_logp_difference/max": 1.230273962020874, "sampling/sampling_logp_difference/mean": 0.11469703167676926, "step": 488 }, { "clip_ratio/high_max": 0.02726867760065943, "clip_ratio/high_mean": 0.02726867760065943, "clip_ratio/low_mean": 0.00903480825945735, "clip_ratio/low_min": 0.00903480825945735, "clip_ratio/region_mean": 0.03630348586011678, "completions/clipped_ratio": 0.0, "completions/max_length": 150.0, "completions/max_terminated_length": 150.0, "completions/mean_length": 133.875, "completions/mean_terminated_length": 133.875, "completions/min_length": 120.0, "completions/min_terminated_length": 120.0, "entropy": 0.25978855788707733, "epoch": 0.018883225208526415, "frac_reward_zero_std": 0.0, "grad_norm": 3.998319625854492, "learning_rate": 8.521212121212123e-06, "loss": 0.0046, "num_tokens": 1058017.0, "reward": 0.9484606981277466, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9484606981277466, "reward_meter_std": 0.09933194518089294, "reward_std": 0.09933193773031235, "reward_total_composite_mean": 0.9484606981277466, "reward_total_composite_std": 0.09933194518089294, "reward_total_mean": 0.9484606981277466, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9484606981277466, "rewards/meter/std": 0.09933194518089294, "rewards/total_composite/mean": 0.9484606981277466, "rewards/total_composite/std": 0.09933194518089294, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.006198763847351, "sampling/importance_sampling_ratio/min": 0.23934954404830933, "sampling/sampling_logp_difference/max": 1.4298303127288818, "sampling/sampling_logp_difference/mean": 0.0375179685652256, "step": 489 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0007530120201408863, "clip_ratio/low_min": 0.0007530120201408863, "clip_ratio/region_mean": 0.0007530120201408863, "completions/clipped_ratio": 0.875, "completions/max_length": 512.0, "completions/max_terminated_length": 498.0, "completions/mean_length": 510.25, "completions/mean_terminated_length": 498.0, "completions/min_length": 498.0, "completions/min_terminated_length": 498.0, "entropy": 0.00822315365076065, "epoch": 0.01892184121099784, "frac_reward_zero_std": 0.0, "grad_norm": 0.38429051637649536, "learning_rate": 8.518181818181818e-06, "loss": 0.1271, "num_tokens": 1060315.0, "reward": 0.8464405536651611, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8557692170143127, "reward_count_adherence_std": 0.08661473542451859, "reward_meter_mean": 0.9891150593757629, "reward_meter_std": 0.00664390018209815, "reward_std": 0.08564455062150955, "reward_total_composite_mean": 0.8464405536651611, "reward_total_composite_std": 0.08564455062150955, "reward_total_mean": 0.8464405536651611, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8557692170143127, "rewards/count_adherence/std": 0.08661473542451859, "rewards/meter/mean": 0.9891150593757629, "rewards/meter/std": 0.00664390018209815, "rewards/total_composite/mean": 0.8464405536651611, "rewards/total_composite/std": 0.08564455062150955, "sampling/importance_sampling_ratio/max": 1.7250312566757202, "sampling/importance_sampling_ratio/mean": 0.9997017979621887, "sampling/importance_sampling_ratio/min": 0.3699522316455841, "sampling/sampling_logp_difference/max": 0.9943814277648926, "sampling/sampling_logp_difference/mean": 0.011192544363439083, "step": 490 }, { "clip_ratio/high_max": 0.03605138626880944, "clip_ratio/high_mean": 0.03605138626880944, "clip_ratio/low_mean": 0.043553632916882634, "clip_ratio/low_min": 0.043553632916882634, "clip_ratio/region_mean": 0.07960501918569207, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 93.25, "completions/mean_terminated_length": 93.25, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.900152787566185, "epoch": 0.018960457213469263, "frac_reward_zero_std": 0.0, "grad_norm": 4.761613368988037, "learning_rate": 8.515151515151517e-06, "loss": 0.0351, "num_tokens": 1062421.0, "reward": 0.6782705783843994, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6782705783843994, "reward_meter_std": 0.363802045583725, "reward_std": 0.363802045583725, "reward_total_composite_mean": 0.6782705783843994, "reward_total_composite_std": 0.363802045583725, "reward_total_mean": 0.6782705783843994, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6782705783843994, "rewards/meter/std": 0.363802045583725, "rewards/total_composite/mean": 0.6782705783843994, "rewards/total_composite/std": 0.363802045583725, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0159639120101929, "sampling/importance_sampling_ratio/min": 0.26024797558784485, "sampling/sampling_logp_difference/max": 1.3461203575134277, "sampling/sampling_logp_difference/mean": 0.08261455595493317, "step": 491 }, { "clip_ratio/high_max": 0.03652191942092031, "clip_ratio/high_mean": 0.03652191942092031, "clip_ratio/low_mean": 0.032360111363232136, "clip_ratio/low_min": 0.032360111363232136, "clip_ratio/region_mean": 0.06888203078415245, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 68.5, "completions/mean_terminated_length": 68.5, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7679142504930496, "epoch": 0.018999073215940687, "frac_reward_zero_std": 0.0, "grad_norm": 10.827360153198242, "learning_rate": 8.512121212121213e-06, "loss": 0.0363, "num_tokens": 1064305.0, "reward": 0.9250147342681885, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9250147342681885, "reward_meter_std": 0.151312917470932, "reward_std": 0.1513129323720932, "reward_total_composite_mean": 0.9250147342681885, "reward_total_composite_std": 0.151312917470932, "reward_total_mean": 0.9250147342681885, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9250147342681885, "rewards/meter/std": 0.151312917470932, "rewards/total_composite/mean": 0.9250147342681885, "rewards/total_composite/std": 0.151312917470932, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.018401861190796, "sampling/importance_sampling_ratio/min": 0.1545751392841339, "sampling/sampling_logp_difference/max": 1.867074966430664, "sampling/sampling_logp_difference/mean": 0.10603255778551102, "step": 492 }, { "clip_ratio/high_max": 0.039439259795472026, "clip_ratio/high_mean": 0.039439259795472026, "clip_ratio/low_mean": 0.016476215794682503, "clip_ratio/low_min": 0.016476215794682503, "clip_ratio/region_mean": 0.05591547559015453, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 68.875, "completions/mean_terminated_length": 68.875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.5212747771292925, "epoch": 0.01903768921841211, "frac_reward_zero_std": 0.0, "grad_norm": 5.6415114402771, "learning_rate": 8.50909090909091e-06, "loss": -0.0015, "num_tokens": 1066128.0, "reward": 0.9896060228347778, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9896060228347778, "reward_meter_std": 0.009286360815167427, "reward_std": 0.009286360815167427, "reward_total_composite_mean": 0.9896060228347778, "reward_total_composite_std": 0.009286360815167427, "reward_total_mean": 0.9896060228347778, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9896060228347778, "rewards/meter/std": 0.009286360815167427, "rewards/total_composite/mean": 0.9896060228347778, "rewards/total_composite/std": 0.009286360815167427, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0087600946426392, "sampling/importance_sampling_ratio/min": 0.14200963079929352, "sampling/sampling_logp_difference/max": 1.9518604278564453, "sampling/sampling_logp_difference/mean": 0.07539483904838562, "step": 493 }, { "clip_ratio/high_max": 0.034729897044599056, "clip_ratio/high_mean": 0.034729897044599056, "clip_ratio/low_mean": 0.03369492199271917, "clip_ratio/low_min": 0.03369492199271917, "clip_ratio/region_mean": 0.06842481903731823, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 58.75, "completions/mean_terminated_length": 58.75, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.47727346792817116, "epoch": 0.019076305220883535, "frac_reward_zero_std": 0.0, "grad_norm": 6.613814353942871, "learning_rate": 8.506060606060607e-06, "loss": 0.0225, "num_tokens": 1067822.0, "reward": 0.9344394207000732, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9344394207000732, "reward_meter_std": 0.060838740319013596, "reward_std": 0.060838740319013596, "reward_total_composite_mean": 0.9344394207000732, "reward_total_composite_std": 0.060838740319013596, "reward_total_mean": 0.9344394207000732, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9344394207000732, "rewards/meter/std": 0.060838740319013596, "rewards/total_composite/mean": 0.9344394207000732, "rewards/total_composite/std": 0.060838740319013596, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.014532446861267, "sampling/importance_sampling_ratio/min": 0.14271166920661926, "sampling/sampling_logp_difference/max": 1.9469289779663086, "sampling/sampling_logp_difference/mean": 0.06783849745988846, "step": 494 }, { "clip_ratio/high_max": 0.027538669761270285, "clip_ratio/high_mean": 0.027538669761270285, "clip_ratio/low_mean": 0.024894393514841795, "clip_ratio/low_min": 0.024894393514841795, "clip_ratio/region_mean": 0.05243306327611208, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 30.875, "completions/mean_terminated_length": 30.875, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.3115545194596052, "epoch": 0.01911492122335496, "frac_reward_zero_std": 0.0, "grad_norm": 12.706208229064941, "learning_rate": 8.503030303030304e-06, "loss": -0.0075, "num_tokens": 1069485.0, "reward": 0.9881634712219238, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9881634712219238, "reward_meter_std": 0.007193571422249079, "reward_std": 0.007193575147539377, "reward_total_composite_mean": 0.9881634712219238, "reward_total_composite_std": 0.007193571422249079, "reward_total_mean": 0.9881634712219238, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9881634712219238, "rewards/meter/std": 0.007193571422249079, "rewards/total_composite/mean": 0.9881634712219238, "rewards/total_composite/std": 0.007193571422249079, "sampling/importance_sampling_ratio/max": 1.6685515642166138, "sampling/importance_sampling_ratio/mean": 1.0025434494018555, "sampling/importance_sampling_ratio/min": 0.25602710247039795, "sampling/sampling_logp_difference/max": 1.3624719381332397, "sampling/sampling_logp_difference/mean": 0.060055576264858246, "step": 495 }, { "clip_ratio/high_max": 0.013113626977428794, "clip_ratio/high_mean": 0.013113626977428794, "clip_ratio/low_mean": 0.01094052626285702, "clip_ratio/low_min": 0.01094052626285702, "clip_ratio/region_mean": 0.024054153240285814, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 92.5, "completions/mean_terminated_length": 92.5, "completions/min_length": 84.0, "completions/min_terminated_length": 84.0, "entropy": 0.17256110534071922, "epoch": 0.019153537225826384, "frac_reward_zero_std": 0.0, "grad_norm": 3.555715322494507, "learning_rate": 8.5e-06, "loss": -0.0266, "num_tokens": 1071673.0, "reward": 0.9900758862495422, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9900758862495422, "reward_meter_std": 0.004209411796182394, "reward_std": 0.004209410399198532, "reward_total_composite_mean": 0.9900758862495422, "reward_total_composite_std": 0.004209411796182394, "reward_total_mean": 0.9900758862495422, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9900758862495422, "rewards/meter/std": 0.004209411796182394, "rewards/total_composite/mean": 0.9900758862495422, "rewards/total_composite/std": 0.004209411796182394, "sampling/importance_sampling_ratio/max": 1.8225340843200684, "sampling/importance_sampling_ratio/mean": 1.0048907995224, "sampling/importance_sampling_ratio/min": 0.42399612069129944, "sampling/sampling_logp_difference/max": 0.8580310344696045, "sampling/sampling_logp_difference/mean": 0.02267627976834774, "step": 496 }, { "clip_ratio/high_max": 0.055402441415935755, "clip_ratio/high_mean": 0.055402441415935755, "clip_ratio/low_mean": 0.0071428571827709675, "clip_ratio/low_min": 0.0071428571827709675, "clip_ratio/region_mean": 0.06254529859870672, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 73.25, "completions/mean_terminated_length": 73.25, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.5875852480530739, "epoch": 0.019192153228297808, "frac_reward_zero_std": 0.0, "grad_norm": 4.990721225738525, "learning_rate": 8.496969696969697e-06, "loss": -0.0116, "num_tokens": 1073467.0, "reward": 0.9253207445144653, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9253207445144653, "reward_meter_std": 0.19340236485004425, "reward_std": 0.19340236485004425, "reward_total_composite_mean": 0.9253207445144653, "reward_total_composite_std": 0.19340236485004425, "reward_total_mean": 0.9253207445144653, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9253207445144653, "rewards/meter/std": 0.19340236485004425, "rewards/total_composite/mean": 0.9253207445144653, "rewards/total_composite/std": 0.19340236485004425, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0199859142303467, "sampling/importance_sampling_ratio/min": 0.06627547740936279, "sampling/sampling_logp_difference/max": 2.713935375213623, "sampling/sampling_logp_difference/mean": 0.08409885317087173, "step": 497 }, { "clip_ratio/high_max": 0.010509460349567235, "clip_ratio/high_mean": 0.010509460349567235, "clip_ratio/low_mean": 0.01110077218618244, "clip_ratio/low_min": 0.01110077218618244, "clip_ratio/region_mean": 0.021610232535749674, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 91.125, "completions/mean_terminated_length": 91.125, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.1501608146354556, "epoch": 0.019230769230769232, "frac_reward_zero_std": 0.0, "grad_norm": 3.0449001789093018, "learning_rate": 8.493939393939394e-06, "loss": -0.0224, "num_tokens": 1075516.0, "reward": 0.9902229905128479, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9902229905128479, "reward_meter_std": 0.003602617187425494, "reward_std": 0.0036026162561029196, "reward_total_composite_mean": 0.9902229905128479, "reward_total_composite_std": 0.003602617187425494, "reward_total_mean": 0.9902229905128479, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9902229905128479, "rewards/meter/std": 0.003602617187425494, "rewards/total_composite/mean": 0.9902229905128479, "rewards/total_composite/std": 0.003602617187425494, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.997484564781189, "sampling/importance_sampling_ratio/min": 0.2278515249490738, "sampling/sampling_logp_difference/max": 1.4790611267089844, "sampling/sampling_logp_difference/mean": 0.023890873417258263, "step": 498 }, { "clip_ratio/high_max": 0.01690437039360404, "clip_ratio/high_mean": 0.01690437039360404, "clip_ratio/low_mean": 0.005158253246918321, "clip_ratio/low_min": 0.005158253246918321, "clip_ratio/region_mean": 0.02206262364052236, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 68.375, "completions/mean_terminated_length": 68.375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.23555130790919065, "epoch": 0.019269385233240656, "frac_reward_zero_std": 0.0, "grad_norm": 4.565327167510986, "learning_rate": 8.490909090909092e-06, "loss": 0.0379, "num_tokens": 1077319.0, "reward": 0.9964392185211182, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9964392185211182, "reward_meter_std": 0.0012064595939591527, "reward_std": 0.0012064601760357618, "reward_total_composite_mean": 0.9964392185211182, "reward_total_composite_std": 0.0012064595939591527, "reward_total_mean": 0.9964392185211182, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9964392185211182, "rewards/meter/std": 0.0012064595939591527, "rewards/total_composite/mean": 0.9964392185211182, "rewards/total_composite/std": 0.0012064595939591527, "sampling/importance_sampling_ratio/max": 1.8629289865493774, "sampling/importance_sampling_ratio/mean": 1.0085853338241577, "sampling/importance_sampling_ratio/min": 0.21121247112751007, "sampling/sampling_logp_difference/max": 1.5548906326293945, "sampling/sampling_logp_difference/mean": 0.032802514731884, "step": 499 }, { "clip_ratio/high_max": 0.03529414697550237, "clip_ratio/high_mean": 0.03529414697550237, "clip_ratio/low_mean": 0.01627026009373367, "clip_ratio/low_min": 0.01627026009373367, "clip_ratio/region_mean": 0.05156440706923604, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 77.5, "completions/mean_terminated_length": 77.5, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.35560205206274986, "epoch": 0.01930800123571208, "frac_reward_zero_std": 0.0, "grad_norm": 4.640279769897461, "learning_rate": 8.487878787878789e-06, "loss": -0.0131, "num_tokens": 1079123.0, "reward": 0.9947643280029297, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9947643280029297, "reward_meter_std": 0.0026077541988343, "reward_std": 0.0026077530346810818, "reward_total_composite_mean": 0.9947643280029297, "reward_total_composite_std": 0.0026077541988343, "reward_total_mean": 0.9947643280029297, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9947643280029297, "rewards/meter/std": 0.0026077541988343, "rewards/total_composite/mean": 0.9947643280029297, "rewards/total_composite/std": 0.0026077541988343, "sampling/importance_sampling_ratio/max": 1.9909405708312988, "sampling/importance_sampling_ratio/mean": 1.0034871101379395, "sampling/importance_sampling_ratio/min": 0.24968643486499786, "sampling/sampling_logp_difference/max": 1.3875494003295898, "sampling/sampling_logp_difference/mean": 0.05810660123825073, "step": 500 }, { "epoch": 0.01930800123571208, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.27884615384615385, "eval_completions/max_length": 504.3076923076923, "eval_completions/max_terminated_length": 360.61538461538464, "eval_completions/mean_length": 282.3942307692308, "eval_completions/mean_terminated_length": 189.76557100736179, "eval_completions/min_length": 56.53846153846154, "eval_completions/min_terminated_length": 56.53846153846154, "eval_entropy": 0.2863846653356002, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1079123.0, "eval_reward": 0.5957829631291903, "eval_reward_arabic_clean_mean": 0.9711538461538461, "eval_reward_arabic_clean_std": 0.06280488005051246, "eval_reward_count_adherence_mean": 0.7540726845081036, "eval_reward_count_adherence_std": 0.26829315836612994, "eval_reward_meter_mean": 0.806977744285877, "eval_reward_meter_std": 0.28674349504021496, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.5957829631291903, "eval_reward_total_composite_std": 0.3549887262857877, "eval_reward_total_mean": 0.5957829631291903, "eval_rewards/arabic_clean/mean": 0.9711538461538461, "eval_rewards/arabic_clean/std": 0.06280488005051246, "eval_rewards/count_adherence/mean": 0.7540726845081036, "eval_rewards/count_adherence/std": 0.26829315836612994, "eval_rewards/meter/mean": 0.806977744285877, "eval_rewards/meter/std": 0.28674349504021496, "eval_rewards/total_composite/mean": 0.5957829631291903, "eval_rewards/total_composite/std": 0.3549887262857877, "eval_runtime": 93.945, "eval_samples_per_second": 1.107, "eval_sampling/importance_sampling_ratio/max": 1.4029179719778209, "eval_sampling/importance_sampling_ratio/mean": 1.006858468055725, "eval_sampling/importance_sampling_ratio/min": 0.38570847190343416, "eval_sampling/sampling_logp_difference/max": 1.013349202963022, "eval_sampling/sampling_logp_difference/mean": 0.02426047422564947, "eval_steps_per_second": 0.138, "step": 500 }, { "clip_ratio/high_max": 0.023434267612174153, "clip_ratio/high_mean": 0.023434267612174153, "clip_ratio/low_mean": 0.006404084269888699, "clip_ratio/low_min": 0.006404084269888699, "clip_ratio/region_mean": 0.029838351882062852, "completions/clipped_ratio": 0.0, "completions/max_length": 119.0, "completions/max_terminated_length": 119.0, "completions/mean_length": 106.125, "completions/mean_terminated_length": 106.125, "completions/min_length": 94.0, "completions/min_terminated_length": 94.0, "entropy": 0.22485548444092274, "epoch": 0.019346617238183504, "frac_reward_zero_std": 0.0, "grad_norm": 5.740342617034912, "learning_rate": 8.484848484848486e-06, "loss": 0.0695, "num_tokens": 1081252.0, "reward": 0.78095543384552, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.78095543384552, "reward_meter_std": 0.2571522295475006, "reward_std": 0.2571522295475006, "reward_total_composite_mean": 0.78095543384552, "reward_total_composite_std": 0.2571522295475006, "reward_total_mean": 0.78095543384552, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.78095543384552, "rewards/meter/std": 0.2571522295475006, "rewards/total_composite/mean": 0.78095543384552, "rewards/total_composite/std": 0.2571522295475006, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.000687599182129, "sampling/importance_sampling_ratio/min": 0.14426499605178833, "sampling/sampling_logp_difference/max": 1.936103343963623, "sampling/sampling_logp_difference/mean": 0.0388408899307251, "step": 501 }, { "clip_ratio/high_max": 0.04436044883914292, "clip_ratio/high_mean": 0.04436044883914292, "clip_ratio/low_mean": 0.02120496891438961, "clip_ratio/low_min": 0.02120496891438961, "clip_ratio/region_mean": 0.06556541775353253, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 74.125, "completions/mean_terminated_length": 74.125, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.6134384572505951, "epoch": 0.019385233240654928, "frac_reward_zero_std": 0.0, "grad_norm": 5.4612603187561035, "learning_rate": 8.481818181818182e-06, "loss": -0.0119, "num_tokens": 1083101.0, "reward": 0.9958293437957764, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9958293437957764, "reward_meter_std": 0.0022998028434813023, "reward_std": 0.0022997905034571886, "reward_total_composite_mean": 0.9958293437957764, "reward_total_composite_std": 0.0022998028434813023, "reward_total_mean": 0.9958293437957764, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9958293437957764, "rewards/meter/std": 0.0022998028434813023, "rewards/total_composite/mean": 0.9958293437957764, "rewards/total_composite/std": 0.0022998028434813023, "sampling/importance_sampling_ratio/max": 1.5113362073898315, "sampling/importance_sampling_ratio/mean": 0.9978984594345093, "sampling/importance_sampling_ratio/min": 0.2680939733982086, "sampling/sampling_logp_difference/max": 1.3164176940917969, "sampling/sampling_logp_difference/mean": 0.07660207152366638, "step": 502 }, { "clip_ratio/high_max": 0.016571022104471922, "clip_ratio/high_mean": 0.016571022104471922, "clip_ratio/low_mean": 0.011187375290319324, "clip_ratio/low_min": 0.011187375290319324, "clip_ratio/region_mean": 0.027758397394791245, "completions/clipped_ratio": 0.0, "completions/max_length": 243.0, "completions/max_terminated_length": 243.0, "completions/mean_length": 224.0, "completions/mean_terminated_length": 224.0, "completions/min_length": 202.0, "completions/min_terminated_length": 202.0, "entropy": 0.2083021691069007, "epoch": 0.019423849243126352, "frac_reward_zero_std": 0.0, "grad_norm": 2.5192019939422607, "learning_rate": 8.478787878787879e-06, "loss": 0.0356, "num_tokens": 1086421.0, "reward": 0.7093769311904907, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7916666269302368, "reward_count_adherence_std": 0.07715165615081787, "reward_meter_mean": 0.9007662534713745, "reward_meter_std": 0.15409159660339355, "reward_std": 0.12365645170211792, "reward_total_composite_mean": 0.7093769311904907, "reward_total_composite_std": 0.12365645170211792, "reward_total_mean": 0.7093769311904907, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7916666269302368, "rewards/count_adherence/std": 0.07715165615081787, "rewards/meter/mean": 0.9007662534713745, "rewards/meter/std": 0.15409159660339355, "rewards/total_composite/mean": 0.7093769311904907, "rewards/total_composite/std": 0.12365645170211792, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.005336880683899, "sampling/importance_sampling_ratio/min": 0.49309608340263367, "sampling/sampling_logp_difference/max": 1.0005009174346924, "sampling/sampling_logp_difference/mean": 0.02353961206972599, "step": 503 }, { "clip_ratio/high_max": 0.04974571894854307, "clip_ratio/high_mean": 0.04974571894854307, "clip_ratio/low_mean": 0.0136233662487939, "clip_ratio/low_min": 0.0136233662487939, "clip_ratio/region_mean": 0.06336908519733697, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 77.625, "completions/mean_terminated_length": 77.625, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.6513996087014675, "epoch": 0.019462465245597776, "frac_reward_zero_std": 0.0, "grad_norm": 7.049271583557129, "learning_rate": 8.475757575757576e-06, "loss": 0.0237, "num_tokens": 1088370.0, "reward": 0.7662866115570068, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7662866115570068, "reward_meter_std": 0.42396625876426697, "reward_std": 0.4239662289619446, "reward_total_composite_mean": 0.7662866115570068, "reward_total_composite_std": 0.42396625876426697, "reward_total_mean": 0.7662866115570068, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7662866115570068, "rewards/meter/std": 0.42396625876426697, "rewards/total_composite/mean": 0.7662866115570068, "rewards/total_composite/std": 0.42396625876426697, "sampling/importance_sampling_ratio/max": 1.7661075592041016, "sampling/importance_sampling_ratio/mean": 1.0156745910644531, "sampling/importance_sampling_ratio/min": 0.2086387276649475, "sampling/sampling_logp_difference/max": 1.5671510696411133, "sampling/sampling_logp_difference/mean": 0.07983585447072983, "step": 504 }, { "clip_ratio/high_max": 0.020820592530071735, "clip_ratio/high_mean": 0.020820592530071735, "clip_ratio/low_mean": 0.0246689785271883, "clip_ratio/low_min": 0.0246689785271883, "clip_ratio/region_mean": 0.045489571057260036, "completions/clipped_ratio": 0.0, "completions/max_length": 61.0, "completions/max_terminated_length": 61.0, "completions/mean_length": 55.625, "completions/mean_terminated_length": 55.625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5484390016645193, "epoch": 0.0195010812480692, "frac_reward_zero_std": 0.0, "grad_norm": 8.706897735595703, "learning_rate": 8.472727272727274e-06, "loss": 0.0374, "num_tokens": 1090079.0, "reward": 0.9907145500183105, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9907145500183105, "reward_meter_std": 0.0025706093292683363, "reward_std": 0.002570599550381303, "reward_total_composite_mean": 0.9907145500183105, "reward_total_composite_std": 0.0025706093292683363, "reward_total_mean": 0.9907145500183105, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9907145500183105, "rewards/meter/std": 0.0025706093292683363, "rewards/total_composite/mean": 0.9907145500183105, "rewards/total_composite/std": 0.0025706093292683363, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0099107027053833, "sampling/importance_sampling_ratio/min": 0.22027796506881714, "sampling/sampling_logp_difference/max": 1.5128650665283203, "sampling/sampling_logp_difference/mean": 0.06765672564506531, "step": 505 }, { "clip_ratio/high_max": 0.04047576058655977, "clip_ratio/high_mean": 0.04047576058655977, "clip_ratio/low_mean": 0.04866071417927742, "clip_ratio/low_min": 0.04866071417927742, "clip_ratio/region_mean": 0.08913647476583719, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 54.25, "completions/mean_terminated_length": 54.25, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.9682378023862839, "epoch": 0.019539697250540625, "frac_reward_zero_std": 0.0, "grad_norm": 9.833094596862793, "learning_rate": 8.46969696969697e-06, "loss": -0.1105, "num_tokens": 1091745.0, "reward": 0.8061291575431824, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8061291575431824, "reward_meter_std": 0.3550299108028412, "reward_std": 0.3550299406051636, "reward_total_composite_mean": 0.8061291575431824, "reward_total_composite_std": 0.3550299108028412, "reward_total_mean": 0.8061291575431824, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8061291575431824, "rewards/meter/std": 0.3550299108028412, "rewards/total_composite/mean": 0.8061291575431824, "rewards/total_composite/std": 0.3550299108028412, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0167040824890137, "sampling/importance_sampling_ratio/min": 0.2069854736328125, "sampling/sampling_logp_difference/max": 1.5751066207885742, "sampling/sampling_logp_difference/mean": 0.08280141651630402, "step": 506 }, { "clip_ratio/high_max": 0.06833233823999763, "clip_ratio/high_mean": 0.06833233823999763, "clip_ratio/low_mean": 0.019542983267456293, "clip_ratio/low_min": 0.019542983267456293, "clip_ratio/region_mean": 0.08787532150745392, "completions/clipped_ratio": 0.0, "completions/max_length": 90.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 71.375, "completions/mean_terminated_length": 71.375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7916622683405876, "epoch": 0.01957831325301205, "frac_reward_zero_std": 0.0, "grad_norm": 7.7388482093811035, "learning_rate": 8.466666666666668e-06, "loss": 0.0027, "num_tokens": 1093764.0, "reward": 0.9402273893356323, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9402273893356323, "reward_meter_std": 0.08104795962572098, "reward_std": 0.08104795962572098, "reward_total_composite_mean": 0.9402273893356323, "reward_total_composite_std": 0.08104795962572098, "reward_total_mean": 0.9402273893356323, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9402273893356323, "rewards/meter/std": 0.08104795962572098, "rewards/total_composite/mean": 0.9402273893356323, "rewards/total_composite/std": 0.08104795962572098, "sampling/importance_sampling_ratio/max": 1.8226356506347656, "sampling/importance_sampling_ratio/mean": 1.0046333074569702, "sampling/importance_sampling_ratio/min": 0.24624574184417725, "sampling/sampling_logp_difference/max": 1.4014253616333008, "sampling/sampling_logp_difference/mean": 0.09213840216398239, "step": 507 }, { "clip_ratio/high_max": 0.02592427283525467, "clip_ratio/high_mean": 0.02592427283525467, "clip_ratio/low_mean": 0.015961318742483854, "clip_ratio/low_min": 0.015961318742483854, "clip_ratio/region_mean": 0.041885591577738523, "completions/clipped_ratio": 0.0, "completions/max_length": 193.0, "completions/max_terminated_length": 193.0, "completions/mean_length": 156.0, "completions/mean_terminated_length": 156.0, "completions/min_length": 118.0, "completions/min_terminated_length": 118.0, "entropy": 0.37319300696253777, "epoch": 0.019616929255483473, "frac_reward_zero_std": 0.0, "grad_norm": 3.3655362129211426, "learning_rate": 8.463636363636364e-06, "loss": -0.0493, "num_tokens": 1096436.0, "reward": 0.9363090991973877, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.9674587845802307, "reward_meter_std": 0.08305719494819641, "reward_std": 0.11212778836488724, "reward_total_composite_mean": 0.9363090991973877, "reward_total_composite_std": 0.11212779581546783, "reward_total_mean": 0.9363090991973877, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.9674587845802307, "rewards/meter/std": 0.08305719494819641, "rewards/total_composite/mean": 0.9363090991973877, "rewards/total_composite/std": 0.11212779581546783, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0092945098876953, "sampling/importance_sampling_ratio/min": 0.3582862913608551, "sampling/sampling_logp_difference/max": 1.0351219177246094, "sampling/sampling_logp_difference/mean": 0.04139424115419388, "step": 508 }, { "clip_ratio/high_max": 0.09690898563712835, "clip_ratio/high_mean": 0.09690898563712835, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.09690898563712835, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 121.625, "completions/mean_terminated_length": 65.85714721679688, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 1.1623116582632065, "epoch": 0.019655545257954897, "frac_reward_zero_std": 0.0, "grad_norm": 1.5039535760879517, "learning_rate": 8.460606060606061e-06, "loss": -0.1651, "num_tokens": 1098089.0, "reward": 0.850326418876648, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8553266525268555, "reward_meter_std": 0.3322550356388092, "reward_std": 0.3462829291820526, "reward_total_composite_mean": 0.850326418876648, "reward_total_composite_std": 0.3462829291820526, "reward_total_mean": 0.850326418876648, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8553266525268555, "rewards/meter/std": 0.3322550356388092, "rewards/total_composite/mean": 0.850326418876648, "rewards/total_composite/std": 0.3462829291820526, "sampling/importance_sampling_ratio/max": 1.746443271636963, "sampling/importance_sampling_ratio/mean": 1.0222753286361694, "sampling/importance_sampling_ratio/min": 0.27474337816238403, "sampling/sampling_logp_difference/max": 1.2919178009033203, "sampling/sampling_logp_difference/mean": 0.12041088938713074, "step": 509 }, { "clip_ratio/high_max": 0.006500857998616993, "clip_ratio/high_mean": 0.006500857998616993, "clip_ratio/low_mean": 0.00692010746570304, "clip_ratio/low_min": 0.00692010746570304, "clip_ratio/region_mean": 0.013420965464320034, "completions/clipped_ratio": 0.0, "completions/max_length": 505.0, "completions/max_terminated_length": 505.0, "completions/mean_length": 447.125, "completions/mean_terminated_length": 447.125, "completions/min_length": 398.0, "completions/min_terminated_length": 398.0, "entropy": 0.1255875793285668, "epoch": 0.01969416126042632, "frac_reward_zero_std": 0.0, "grad_norm": 1.3078835010528564, "learning_rate": 8.457575757575758e-06, "loss": 0.0177, "num_tokens": 1103402.0, "reward": 0.3376147150993347, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.4464285969734192, "reward_count_adherence_std": 0.11921756714582443, "reward_meter_mean": 0.7473684549331665, "reward_meter_std": 0.4575249254703522, "reward_std": 0.22579078376293182, "reward_total_composite_mean": 0.3376147150993347, "reward_total_composite_std": 0.22579079866409302, "reward_total_mean": 0.3376147150993347, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.4464285969734192, "rewards/count_adherence/std": 0.11921756714582443, "rewards/meter/mean": 0.7473684549331665, "rewards/meter/std": 0.4575249254703522, "rewards/total_composite/mean": 0.3376147150993347, "rewards/total_composite/std": 0.22579079866409302, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0023648738861084, "sampling/importance_sampling_ratio/min": 0.294707715511322, "sampling/sampling_logp_difference/max": 1.221771240234375, "sampling/sampling_logp_difference/mean": 0.015463379211723804, "step": 510 }, { "clip_ratio/high_max": 0.058790234150364995, "clip_ratio/high_mean": 0.058790234150364995, "clip_ratio/low_mean": 0.03445858974009752, "clip_ratio/low_min": 0.03445858974009752, "clip_ratio/region_mean": 0.09324882389046252, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 63.75, "completions/mean_terminated_length": 63.75, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 1.0178688187152147, "epoch": 0.019732777262897745, "frac_reward_zero_std": 0.0, "grad_norm": 10.033199310302734, "learning_rate": 8.454545454545455e-06, "loss": -0.019, "num_tokens": 1105240.0, "reward": 0.6394338011741638, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.6957893371582031, "reward_meter_std": 0.35945481061935425, "reward_std": 0.35790061950683594, "reward_total_composite_mean": 0.6394338011741638, "reward_total_composite_std": 0.35790061950683594, "reward_total_mean": 0.6394338011741638, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.6957893371582031, "rewards/meter/std": 0.35945481061935425, "rewards/total_composite/mean": 0.6394338011741638, "rewards/total_composite/std": 0.35790061950683594, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0079913139343262, "sampling/importance_sampling_ratio/min": 0.06637737900018692, "sampling/sampling_logp_difference/max": 2.7123990058898926, "sampling/sampling_logp_difference/mean": 0.11444373428821564, "step": 511 }, { "clip_ratio/high_max": 0.014946788433007896, "clip_ratio/high_mean": 0.014946788433007896, "clip_ratio/low_mean": 0.00832630880177021, "clip_ratio/low_min": 0.00832630880177021, "clip_ratio/region_mean": 0.023273097234778106, "completions/clipped_ratio": 0.0, "completions/max_length": 278.0, "completions/max_terminated_length": 278.0, "completions/mean_length": 225.75, "completions/mean_terminated_length": 225.75, "completions/min_length": 186.0, "completions/min_terminated_length": 186.0, "entropy": 0.19403257127851248, "epoch": 0.01977139326536917, "frac_reward_zero_std": 0.0, "grad_norm": 1.5483953952789307, "learning_rate": 8.451515151515151e-06, "loss": -0.0532, "num_tokens": 1108518.0, "reward": 0.8210574388504028, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_meter_mean": 0.8709026575088501, "reward_meter_std": 0.35162675380706787, "reward_std": 0.34322601556777954, "reward_total_composite_mean": 0.8210574388504028, "reward_total_composite_std": 0.34322604537010193, "reward_total_mean": 0.8210574388504028, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/meter/mean": 0.8709026575088501, "rewards/meter/std": 0.35162675380706787, "rewards/total_composite/mean": 0.8210574388504028, "rewards/total_composite/std": 0.34322604537010193, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0026448965072632, "sampling/importance_sampling_ratio/min": 0.3978947103023529, "sampling/sampling_logp_difference/max": 0.9215679168701172, "sampling/sampling_logp_difference/mean": 0.02275705337524414, "step": 512 }, { "clip_ratio/high_max": 0.02126406622119248, "clip_ratio/high_mean": 0.02126406622119248, "clip_ratio/low_mean": 0.009132357081398368, "clip_ratio/low_min": 0.009132357081398368, "clip_ratio/region_mean": 0.030396423302590847, "completions/clipped_ratio": 0.0, "completions/max_length": 175.0, "completions/max_terminated_length": 175.0, "completions/mean_length": 149.25, "completions/mean_terminated_length": 149.25, "completions/min_length": 132.0, "completions/min_terminated_length": 132.0, "entropy": 0.19797090534120798, "epoch": 0.019810009267840593, "frac_reward_zero_std": 0.0, "grad_norm": 2.7554123401641846, "learning_rate": 8.44848484848485e-06, "loss": -0.0103, "num_tokens": 1110976.0, "reward": 0.8653509020805359, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.8965615034103394, "reward_meter_std": 0.14327730238437653, "reward_std": 0.14502419531345367, "reward_total_composite_mean": 0.8653509020805359, "reward_total_composite_std": 0.14502419531345367, "reward_total_mean": 0.8653509020805359, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.8965615034103394, "rewards/meter/std": 0.14327730238437653, "rewards/total_composite/mean": 0.8653509020805359, "rewards/total_composite/std": 0.14502419531345367, "sampling/importance_sampling_ratio/max": 1.710719108581543, "sampling/importance_sampling_ratio/mean": 1.002771258354187, "sampling/importance_sampling_ratio/min": 0.2964406907558441, "sampling/sampling_logp_difference/max": 1.2159080505371094, "sampling/sampling_logp_difference/mean": 0.02919297106564045, "step": 513 }, { "clip_ratio/high_max": 0.051333898678421974, "clip_ratio/high_mean": 0.051333898678421974, "clip_ratio/low_mean": 0.0033783784601837397, "clip_ratio/low_min": 0.0033783784601837397, "clip_ratio/region_mean": 0.054712277138605714, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 67.75, "completions/mean_terminated_length": 67.75, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.40955257788300514, "epoch": 0.019848625270312018, "frac_reward_zero_std": 0.0, "grad_norm": 8.517362594604492, "learning_rate": 8.445454545454547e-06, "loss": 0.0446, "num_tokens": 1112726.0, "reward": 0.8835674524307251, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8835674524307251, "reward_meter_std": 0.292568564414978, "reward_std": 0.2925685942173004, "reward_total_composite_mean": 0.8835674524307251, "reward_total_composite_std": 0.292568564414978, "reward_total_mean": 0.8835674524307251, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8835674524307251, "rewards/meter/std": 0.292568564414978, "rewards/total_composite/mean": 0.8835674524307251, "rewards/total_composite/std": 0.292568564414978, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.009161114692688, "sampling/importance_sampling_ratio/min": 0.2343650758266449, "sampling/sampling_logp_difference/max": 1.4508752822875977, "sampling/sampling_logp_difference/mean": 0.06897350400686264, "step": 514 }, { "clip_ratio/high_max": 0.043231920688413084, "clip_ratio/high_mean": 0.043231920688413084, "clip_ratio/low_mean": 0.021710526663810015, "clip_ratio/low_min": 0.021710526663810015, "clip_ratio/region_mean": 0.0649424473522231, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 61.625, "completions/mean_terminated_length": 61.625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.4629223048686981, "epoch": 0.01988724127278344, "frac_reward_zero_std": 0.0, "grad_norm": 5.492783069610596, "learning_rate": 8.442424242424243e-06, "loss": -0.0222, "num_tokens": 1114499.0, "reward": 0.7765995264053345, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7765995264053345, "reward_meter_std": 0.4026697874069214, "reward_std": 0.4026697874069214, "reward_total_composite_mean": 0.7765995264053345, "reward_total_composite_std": 0.4026697874069214, "reward_total_mean": 0.7765995264053345, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7765995264053345, "rewards/meter/std": 0.4026697874069214, "rewards/total_composite/mean": 0.7765995264053345, "rewards/total_composite/std": 0.4026697874069214, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0022004842758179, "sampling/importance_sampling_ratio/min": 0.2164708971977234, "sampling/sampling_logp_difference/max": 1.8261196613311768, "sampling/sampling_logp_difference/mean": 0.06085870414972305, "step": 515 }, { "clip_ratio/high_max": 0.07153899129480124, "clip_ratio/high_mean": 0.07153899129480124, "clip_ratio/low_mean": 0.04520996939390898, "clip_ratio/low_min": 0.04520996939390898, "clip_ratio/region_mean": 0.11674896068871021, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 32.625, "completions/mean_terminated_length": 32.625, "completions/min_length": 23.0, "completions/min_terminated_length": 23.0, "entropy": 1.2552415579557419, "epoch": 0.019925857275254866, "frac_reward_zero_std": 0.0, "grad_norm": 13.839630126953125, "learning_rate": 8.43939393939394e-06, "loss": -0.0002, "num_tokens": 1116008.0, "reward": 0.7724308371543884, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7724308371543884, "reward_meter_std": 0.31887128949165344, "reward_std": 0.31887128949165344, "reward_total_composite_mean": 0.7724308371543884, "reward_total_composite_std": 0.31887128949165344, "reward_total_mean": 0.7724308371543884, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7724308371543884, "rewards/meter/std": 0.31887128949165344, "rewards/total_composite/mean": 0.7724308371543884, "rewards/total_composite/std": 0.31887128949165344, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0144718885421753, "sampling/importance_sampling_ratio/min": 0.30714622139930725, "sampling/sampling_logp_difference/max": 1.1804313659667969, "sampling/sampling_logp_difference/mean": 0.13659369945526123, "step": 516 }, { "clip_ratio/high_max": 0.0776620376855135, "clip_ratio/high_mean": 0.0776620376855135, "clip_ratio/low_mean": 0.02741228137165308, "clip_ratio/low_min": 0.02741228137165308, "clip_ratio/region_mean": 0.10507431905716658, "completions/clipped_ratio": 0.0, "completions/max_length": 30.0, "completions/max_terminated_length": 30.0, "completions/mean_length": 24.875, "completions/mean_terminated_length": 24.875, "completions/min_length": 18.0, "completions/min_terminated_length": 18.0, "entropy": 1.112723309546709, "epoch": 0.01996447327772629, "frac_reward_zero_std": 0.0, "grad_norm": 17.498676300048828, "learning_rate": 8.436363636363637e-06, "loss": -0.0974, "num_tokens": 1117535.0, "reward": 0.9236002564430237, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9236002564430237, "reward_meter_std": 0.16382306814193726, "reward_std": 0.16382306814193726, "reward_total_composite_mean": 0.9236002564430237, "reward_total_composite_std": 0.16382306814193726, "reward_total_mean": 0.9236002564430237, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9236002564430237, "rewards/meter/std": 0.16382306814193726, "rewards/total_composite/mean": 0.9236002564430237, "rewards/total_composite/std": 0.16382306814193726, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0398297309875488, "sampling/importance_sampling_ratio/min": 0.27661052346229553, "sampling/sampling_logp_difference/max": 1.2851448059082031, "sampling/sampling_logp_difference/mean": 0.13017626106739044, "step": 517 }, { "clip_ratio/high_max": 0.049344516824930906, "clip_ratio/high_mean": 0.049344516824930906, "clip_ratio/low_mean": 0.007462686393409967, "clip_ratio/low_min": 0.007462686393409967, "clip_ratio/region_mean": 0.056807203218340874, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 61.75, "completions/mean_terminated_length": 61.75, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.3643992841243744, "epoch": 0.020003089280197714, "frac_reward_zero_std": 0.0, "grad_norm": 15.10335922241211, "learning_rate": 8.433333333333334e-06, "loss": 0.047, "num_tokens": 1119517.0, "reward": 0.9054743051528931, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9054743051528931, "reward_meter_std": 0.21583297848701477, "reward_std": 0.21583294868469238, "reward_total_composite_mean": 0.9054743051528931, "reward_total_composite_std": 0.21583297848701477, "reward_total_mean": 0.9054743051528931, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9054743051528931, "rewards/meter/std": 0.21583297848701477, "rewards/total_composite/mean": 0.9054743051528931, "rewards/total_composite/std": 0.21583297848701477, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0084285736083984, "sampling/importance_sampling_ratio/min": 0.18905863165855408, "sampling/sampling_logp_difference/max": 1.6656980514526367, "sampling/sampling_logp_difference/mean": 0.07659897208213806, "step": 518 }, { "clip_ratio/high_max": 0.04268710082396865, "clip_ratio/high_mean": 0.04268710082396865, "clip_ratio/low_mean": 0.007263681618496776, "clip_ratio/low_min": 0.007263681618496776, "clip_ratio/region_mean": 0.049950782442465425, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 70.0, "completions/mean_terminated_length": 70.0, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.3383452221751213, "epoch": 0.020041705282669138, "frac_reward_zero_std": 0.0, "grad_norm": 8.149646759033203, "learning_rate": 8.43030303030303e-06, "loss": 0.0138, "num_tokens": 1121333.0, "reward": 0.9806559085845947, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9806559085845947, "reward_meter_std": 0.02947128564119339, "reward_std": 0.029471300542354584, "reward_total_composite_mean": 0.9806559085845947, "reward_total_composite_std": 0.02947128564119339, "reward_total_mean": 0.9806559085845947, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9806559085845947, "rewards/meter/std": 0.02947128564119339, "rewards/total_composite/mean": 0.9806559085845947, "rewards/total_composite/std": 0.02947128564119339, "sampling/importance_sampling_ratio/max": 1.8948339223861694, "sampling/importance_sampling_ratio/mean": 1.0027549266815186, "sampling/importance_sampling_ratio/min": 0.009218051098287106, "sampling/sampling_logp_difference/max": 4.686591625213623, "sampling/sampling_logp_difference/mean": 0.07023530453443527, "step": 519 }, { "clip_ratio/high_max": 0.07098443387076259, "clip_ratio/high_mean": 0.07098443387076259, "clip_ratio/low_mean": 0.007692307699471712, "clip_ratio/low_min": 0.007692307699471712, "clip_ratio/region_mean": 0.0786767415702343, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 55.75, "completions/mean_terminated_length": 55.75, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.4810672476887703, "epoch": 0.020080321285140562, "frac_reward_zero_std": 0.0, "grad_norm": 8.837297439575195, "learning_rate": 8.427272727272729e-06, "loss": 0.0682, "num_tokens": 1123139.0, "reward": 0.8729170560836792, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8729170560836792, "reward_meter_std": 0.29740720987319946, "reward_std": 0.2974071800708771, "reward_total_composite_mean": 0.8729170560836792, "reward_total_composite_std": 0.29740720987319946, "reward_total_mean": 0.8729170560836792, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8729170560836792, "rewards/meter/std": 0.29740720987319946, "rewards/total_composite/mean": 0.8729170560836792, "rewards/total_composite/std": 0.29740720987319946, "sampling/importance_sampling_ratio/max": 1.8521945476531982, "sampling/importance_sampling_ratio/mean": 0.9940183162689209, "sampling/importance_sampling_ratio/min": 0.2821709215641022, "sampling/sampling_logp_difference/max": 1.265242338180542, "sampling/sampling_logp_difference/mean": 0.07541073858737946, "step": 520 }, { "clip_ratio/high_max": 0.022381525253877044, "clip_ratio/high_mean": 0.022381525253877044, "clip_ratio/low_mean": 0.008333333767950535, "clip_ratio/low_min": 0.008333333767950535, "clip_ratio/region_mean": 0.03071485902182758, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 59.75, "completions/mean_terminated_length": 59.75, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.1859533153474331, "epoch": 0.020118937287611986, "frac_reward_zero_std": 0.0, "grad_norm": 16.822296142578125, "learning_rate": 8.424242424242425e-06, "loss": 0.0135, "num_tokens": 1124881.0, "reward": 0.9238840341567993, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9238840341567993, "reward_meter_std": 0.19443634152412415, "reward_std": 0.19443634152412415, "reward_total_composite_mean": 0.9238840341567993, "reward_total_composite_std": 0.19443634152412415, "reward_total_mean": 0.9238840341567993, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9238840341567993, "rewards/meter/std": 0.19443634152412415, "rewards/total_composite/mean": 0.9238840341567993, "rewards/total_composite/std": 0.19443634152412415, "sampling/importance_sampling_ratio/max": 1.7410789728164673, "sampling/importance_sampling_ratio/mean": 0.9970530867576599, "sampling/importance_sampling_ratio/min": 0.04523586481809616, "sampling/sampling_logp_difference/max": 3.09586501121521, "sampling/sampling_logp_difference/mean": 0.039955347776412964, "step": 521 }, { "clip_ratio/high_max": 0.028243856504559517, "clip_ratio/high_mean": 0.028243856504559517, "clip_ratio/low_mean": 0.01347197126597166, "clip_ratio/low_min": 0.01347197126597166, "clip_ratio/region_mean": 0.04171582777053118, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 75.125, "completions/mean_terminated_length": 75.125, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.3937871027737856, "epoch": 0.02015755329008341, "frac_reward_zero_std": 0.0, "grad_norm": 5.966022491455078, "learning_rate": 8.421212121212122e-06, "loss": 0.0201, "num_tokens": 1126658.0, "reward": 0.9940762519836426, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9940762519836426, "reward_meter_std": 0.0017088382737711072, "reward_std": 0.0017088415334001184, "reward_total_composite_mean": 0.9940762519836426, "reward_total_composite_std": 0.0017088382737711072, "reward_total_mean": 0.9940762519836426, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9940762519836426, "rewards/meter/std": 0.0017088382737711072, "rewards/total_composite/mean": 0.9940762519836426, "rewards/total_composite/std": 0.0017088382737711072, "sampling/importance_sampling_ratio/max": 1.9666850566864014, "sampling/importance_sampling_ratio/mean": 1.0083460807800293, "sampling/importance_sampling_ratio/min": 0.3674972355365753, "sampling/sampling_logp_difference/max": 1.0010395050048828, "sampling/sampling_logp_difference/mean": 0.05746918171644211, "step": 522 }, { "clip_ratio/high_max": 0.04396977473516017, "clip_ratio/high_mean": 0.04396977473516017, "clip_ratio/low_mean": 0.004464285913854837, "clip_ratio/low_min": 0.004464285913854837, "clip_ratio/region_mean": 0.04843406064901501, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 62.75, "completions/mean_terminated_length": 62.75, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.23601900041103363, "epoch": 0.020196169292554834, "frac_reward_zero_std": 0.0, "grad_norm": 4.775942802429199, "learning_rate": 8.418181818181819e-06, "loss": -0.0272, "num_tokens": 1128392.0, "reward": 0.8802205324172974, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8802205324172974, "reward_meter_std": 0.31313174962997437, "reward_std": 0.31313174962997437, "reward_total_composite_mean": 0.8802205324172974, "reward_total_composite_std": 0.31313174962997437, "reward_total_mean": 0.8802205324172974, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8802205324172974, "rewards/meter/std": 0.31313174962997437, "rewards/total_composite/mean": 0.8802205324172974, "rewards/total_composite/std": 0.31313174962997437, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9997758269309998, "sampling/importance_sampling_ratio/min": 0.22748437523841858, "sampling/sampling_logp_difference/max": 1.4806737899780273, "sampling/sampling_logp_difference/mean": 0.040101900696754456, "step": 523 }, { "clip_ratio/high_max": 0.0902106543071568, "clip_ratio/high_mean": 0.0902106543071568, "clip_ratio/low_mean": 0.0262486576102674, "clip_ratio/low_min": 0.0262486576102674, "clip_ratio/region_mean": 0.1164593119174242, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 62.125, "completions/mean_terminated_length": 62.125, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 1.2009354755282402, "epoch": 0.02023478529502626, "frac_reward_zero_std": 0.0, "grad_norm": 8.702469825744629, "learning_rate": 8.415151515151516e-06, "loss": -0.0291, "num_tokens": 1130217.0, "reward": 0.8824061155319214, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8824061155319214, "reward_meter_std": 0.2138787806034088, "reward_std": 0.2138787806034088, "reward_total_composite_mean": 0.8824061155319214, "reward_total_composite_std": 0.2138787806034088, "reward_total_mean": 0.8824061155319214, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8824061155319214, "rewards/meter/std": 0.2138787806034088, "rewards/total_composite/mean": 0.8824061155319214, "rewards/total_composite/std": 0.2138787806034088, "sampling/importance_sampling_ratio/max": 1.9018948078155518, "sampling/importance_sampling_ratio/mean": 1.0184638500213623, "sampling/importance_sampling_ratio/min": 0.21237356960773468, "sampling/sampling_logp_difference/max": 1.5494084358215332, "sampling/sampling_logp_difference/mean": 0.10073237121105194, "step": 524 }, { "clip_ratio/high_max": 0.027191198198124766, "clip_ratio/high_mean": 0.027191198198124766, "clip_ratio/low_mean": 0.003846153849735856, "clip_ratio/low_min": 0.003846153849735856, "clip_ratio/region_mean": 0.031037352047860622, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 59.0, "completions/mean_terminated_length": 59.0, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.3998655714094639, "epoch": 0.020273401297497683, "frac_reward_zero_std": 0.0, "grad_norm": 6.02722692489624, "learning_rate": 8.412121212121212e-06, "loss": 0.0389, "num_tokens": 1131849.0, "reward": 0.9700571298599243, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9700571298599243, "reward_meter_std": 0.05985637754201889, "reward_std": 0.059856388717889786, "reward_total_composite_mean": 0.9700571298599243, "reward_total_composite_std": 0.05985637754201889, "reward_total_mean": 0.9700571298599243, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9700571298599243, "rewards/meter/std": 0.05985637754201889, "rewards/total_composite/mean": 0.9700571298599243, "rewards/total_composite/std": 0.05985637754201889, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.01723313331604, "sampling/importance_sampling_ratio/min": 0.3532440662384033, "sampling/sampling_logp_difference/max": 1.0405960083007812, "sampling/sampling_logp_difference/mean": 0.05891498550772667, "step": 525 }, { "clip_ratio/high_max": 0.029155581374652684, "clip_ratio/high_mean": 0.029155581374652684, "clip_ratio/low_mean": 0.021122918464243412, "clip_ratio/low_min": 0.021122918464243412, "clip_ratio/region_mean": 0.050278499838896096, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 70.5, "completions/mean_terminated_length": 70.5, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.4445030000060797, "epoch": 0.020312017299969107, "frac_reward_zero_std": 0.0, "grad_norm": 5.217512607574463, "learning_rate": 8.40909090909091e-06, "loss": 0.0231, "num_tokens": 1133805.0, "reward": 0.9931546449661255, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9931546449661255, "reward_meter_std": 0.004212968982756138, "reward_std": 0.00421295827254653, "reward_total_composite_mean": 0.9931546449661255, "reward_total_composite_std": 0.004212968982756138, "reward_total_mean": 0.9931546449661255, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9931546449661255, "rewards/meter/std": 0.004212968982756138, "rewards/total_composite/mean": 0.9931546449661255, "rewards/total_composite/std": 0.004212968982756138, "sampling/importance_sampling_ratio/max": 1.9715811014175415, "sampling/importance_sampling_ratio/mean": 1.0042046308517456, "sampling/importance_sampling_ratio/min": 0.214838445186615, "sampling/sampling_logp_difference/max": 1.5378689765930176, "sampling/sampling_logp_difference/mean": 0.0634373277425766, "step": 526 }, { "clip_ratio/high_max": 0.016355944564566016, "clip_ratio/high_mean": 0.016355944564566016, "clip_ratio/low_mean": 0.01564345066435635, "clip_ratio/low_min": 0.01564345066435635, "clip_ratio/region_mean": 0.03199939522892237, "completions/clipped_ratio": 0.0, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 75.375, "completions/mean_terminated_length": 75.375, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.3602394051849842, "epoch": 0.02035063330244053, "frac_reward_zero_std": 0.0, "grad_norm": 2.7269952297210693, "learning_rate": 8.406060606060606e-06, "loss": 0.006, "num_tokens": 1135576.0, "reward": 0.9965004920959473, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9965004920959473, "reward_meter_std": 0.0009321427205577493, "reward_std": 0.000932130089495331, "reward_total_composite_mean": 0.9965004920959473, "reward_total_composite_std": 0.0009321427205577493, "reward_total_mean": 0.9965004920959473, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9965004920959473, "rewards/meter/std": 0.0009321427205577493, "rewards/total_composite/mean": 0.9965004920959473, "rewards/total_composite/std": 0.0009321427205577493, "sampling/importance_sampling_ratio/max": 1.7970446348190308, "sampling/importance_sampling_ratio/mean": 1.0171750783920288, "sampling/importance_sampling_ratio/min": 0.4395350217819214, "sampling/sampling_logp_difference/max": 0.822037935256958, "sampling/sampling_logp_difference/mean": 0.04060669243335724, "step": 527 }, { "clip_ratio/high_max": 0.07623076229356229, "clip_ratio/high_mean": 0.07623076229356229, "clip_ratio/low_mean": 0.0037878789007663727, "clip_ratio/low_min": 0.0037878789007663727, "clip_ratio/region_mean": 0.08001864119432867, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 66.75, "completions/mean_terminated_length": 66.75, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.784766998142004, "epoch": 0.020389249304911955, "frac_reward_zero_std": 0.0, "grad_norm": 9.207352638244629, "learning_rate": 8.403030303030304e-06, "loss": 0.0118, "num_tokens": 1137326.0, "reward": 0.9670517444610596, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9670517444610596, "reward_meter_std": 0.06938152760267258, "reward_std": 0.06938153505325317, "reward_total_composite_mean": 0.9670517444610596, "reward_total_composite_std": 0.06938152760267258, "reward_total_mean": 0.9670517444610596, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9670517444610596, "rewards/meter/std": 0.06938152760267258, "rewards/total_composite/mean": 0.9670517444610596, "rewards/total_composite/std": 0.06938152760267258, "sampling/importance_sampling_ratio/max": 1.738789677619934, "sampling/importance_sampling_ratio/mean": 0.9962921738624573, "sampling/importance_sampling_ratio/min": 0.26605382561683655, "sampling/sampling_logp_difference/max": 1.324056625366211, "sampling/sampling_logp_difference/mean": 0.08710537105798721, "step": 528 }, { "clip_ratio/high_max": 0.015567422262392938, "clip_ratio/high_mean": 0.015567422262392938, "clip_ratio/low_mean": 0.029255319386720657, "clip_ratio/low_min": 0.029255319386720657, "clip_ratio/region_mean": 0.044822741649113595, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 61.0, "completions/mean_terminated_length": 61.0, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.30135350674390793, "epoch": 0.02042786530738338, "frac_reward_zero_std": 0.0, "grad_norm": 7.656765460968018, "learning_rate": 8.400000000000001e-06, "loss": -0.0752, "num_tokens": 1139126.0, "reward": 0.9007197618484497, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9007197618484497, "reward_meter_std": 0.2582366466522217, "reward_std": 0.2582366466522217, "reward_total_composite_mean": 0.9007197618484497, "reward_total_composite_std": 0.2582366466522217, "reward_total_mean": 0.9007197618484497, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9007197618484497, "rewards/meter/std": 0.2582366466522217, "rewards/total_composite/mean": 0.9007197618484497, "rewards/total_composite/std": 0.2582366466522217, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0085376501083374, "sampling/importance_sampling_ratio/min": 0.2871541976928711, "sampling/sampling_logp_difference/max": 1.2477359771728516, "sampling/sampling_logp_difference/mean": 0.03346162289381027, "step": 529 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.020466481309854803, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 8.396969696969698e-06, "loss": 0.0, "num_tokens": 1140846.0, "reward": 0.7890878915786743, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7941176891326904, "reward_count_adherence_std": 0.03144249692559242, "reward_meter_mean": 0.9937265515327454, "reward_meter_std": 0.002974079456180334, "reward_std": 0.029924683272838593, "reward_total_composite_mean": 0.7890878915786743, "reward_total_composite_std": 0.029924675822257996, "reward_total_mean": 0.7890878915786743, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7941176891326904, "rewards/count_adherence/std": 0.03144249692559242, "rewards/meter/mean": 0.9937265515327454, "rewards/meter/std": 0.002974079456180334, "rewards/total_composite/mean": 0.7890878915786743, "rewards/total_composite/std": 0.029924675822257996, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 530 }, { "clip_ratio/high_max": 0.0648979377001524, "clip_ratio/high_mean": 0.0648979377001524, "clip_ratio/low_mean": 0.08407607581466436, "clip_ratio/low_min": 0.08407607581466436, "clip_ratio/region_mean": 0.14897401351481676, "completions/clipped_ratio": 0.0, "completions/max_length": 53.0, "completions/max_terminated_length": 53.0, "completions/mean_length": 44.375, "completions/mean_terminated_length": 44.375, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 1.1344088204205036, "epoch": 0.020505097312326227, "frac_reward_zero_std": 0.0, "grad_norm": 15.459403038024902, "learning_rate": 8.393939393939394e-06, "loss": 0.0262, "num_tokens": 1142401.0, "reward": 0.564997673034668, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.564997673034668, "reward_meter_std": 0.3845665752887726, "reward_std": 0.3845665454864502, "reward_total_composite_mean": 0.564997673034668, "reward_total_composite_std": 0.3845665752887726, "reward_total_mean": 0.564997673034668, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.564997673034668, "rewards/meter/std": 0.3845665752887726, "rewards/total_composite/mean": 0.564997673034668, "rewards/total_composite/std": 0.3845665752887726, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0244461297988892, "sampling/importance_sampling_ratio/min": 0.09556441009044647, "sampling/sampling_logp_difference/max": 2.347954750061035, "sampling/sampling_logp_difference/mean": 0.17102597653865814, "step": 531 }, { "clip_ratio/high_max": 0.0692659798078239, "clip_ratio/high_mean": 0.0692659798078239, "clip_ratio/low_mean": 0.01616688398644328, "clip_ratio/low_min": 0.01616688398644328, "clip_ratio/region_mean": 0.08543286379426718, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 60.375, "completions/mean_terminated_length": 60.375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.5591697357594967, "epoch": 0.02054371331479765, "frac_reward_zero_std": 0.0, "grad_norm": 11.56308364868164, "learning_rate": 8.390909090909091e-06, "loss": 0.0452, "num_tokens": 1144260.0, "reward": 0.772533655166626, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.772533655166626, "reward_meter_std": 0.38782942295074463, "reward_std": 0.38782939314842224, "reward_total_composite_mean": 0.772533655166626, "reward_total_composite_std": 0.38782942295074463, "reward_total_mean": 0.772533655166626, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.772533655166626, "rewards/meter/std": 0.38782942295074463, "rewards/total_composite/mean": 0.772533655166626, "rewards/total_composite/std": 0.38782942295074463, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002143383026123, "sampling/importance_sampling_ratio/min": 0.16826894879341125, "sampling/sampling_logp_difference/max": 1.7821917533874512, "sampling/sampling_logp_difference/mean": 0.08298543095588684, "step": 532 }, { "clip_ratio/high_max": 0.059228118509054184, "clip_ratio/high_mean": 0.059228118509054184, "clip_ratio/low_mean": 0.02431722730398178, "clip_ratio/low_min": 0.02431722730398178, "clip_ratio/region_mean": 0.08354534581303596, "completions/clipped_ratio": 0.0, "completions/max_length": 38.0, "completions/max_terminated_length": 38.0, "completions/mean_length": 31.75, "completions/mean_terminated_length": 31.75, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 0.6379514243453741, "epoch": 0.020582329317269075, "frac_reward_zero_std": 0.0, "grad_norm": 7.510979652404785, "learning_rate": 8.387878787878788e-06, "loss": -0.0447, "num_tokens": 1145610.0, "reward": 0.994328498840332, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.994328498840332, "reward_meter_std": 0.00353585509583354, "reward_std": 0.00353585509583354, "reward_total_composite_mean": 0.994328498840332, "reward_total_composite_std": 0.00353585509583354, "reward_total_mean": 0.994328498840332, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.994328498840332, "rewards/meter/std": 0.00353585509583354, "rewards/total_composite/mean": 0.994328498840332, "rewards/total_composite/std": 0.00353585509583354, "sampling/importance_sampling_ratio/max": 1.9707249402999878, "sampling/importance_sampling_ratio/mean": 0.9933980703353882, "sampling/importance_sampling_ratio/min": 0.33012497425079346, "sampling/sampling_logp_difference/max": 1.1082839965820312, "sampling/sampling_logp_difference/mean": 0.07902076840400696, "step": 533 }, { "clip_ratio/high_max": 0.00898129097186029, "clip_ratio/high_mean": 0.00898129097186029, "clip_ratio/low_mean": 0.008662280859425664, "clip_ratio/low_min": 0.008662280859425664, "clip_ratio/region_mean": 0.017643571831285954, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 56.25, "completions/mean_terminated_length": 56.25, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.17711176443845034, "epoch": 0.0206209453197405, "frac_reward_zero_std": 0.0, "grad_norm": 4.608026504516602, "learning_rate": 8.384848484848485e-06, "loss": 0.0332, "num_tokens": 1147340.0, "reward": 0.9940440058708191, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9940440058708191, "reward_meter_std": 0.0018207214307039976, "reward_std": 0.0018207177054136992, "reward_total_composite_mean": 0.9940440058708191, "reward_total_composite_std": 0.0018207214307039976, "reward_total_mean": 0.9940440058708191, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9940440058708191, "rewards/meter/std": 0.0018207214307039976, "rewards/total_composite/mean": 0.9940440058708191, "rewards/total_composite/std": 0.0018207214307039976, "sampling/importance_sampling_ratio/max": 1.6200429201126099, "sampling/importance_sampling_ratio/mean": 1.0104416608810425, "sampling/importance_sampling_ratio/min": 0.3822028934955597, "sampling/sampling_logp_difference/max": 0.9618037343025208, "sampling/sampling_logp_difference/mean": 0.02367156185209751, "step": 534 }, { "clip_ratio/high_max": 0.02654118835926056, "clip_ratio/high_mean": 0.02654118835926056, "clip_ratio/low_mean": 0.008223684038966894, "clip_ratio/low_min": 0.008223684038966894, "clip_ratio/region_mean": 0.03476487239822745, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 66.25, "completions/mean_terminated_length": 66.25, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.3021476771682501, "epoch": 0.020659561322211924, "frac_reward_zero_std": 0.0, "grad_norm": 5.5635881423950195, "learning_rate": 8.381818181818183e-06, "loss": 0.0063, "num_tokens": 1149134.0, "reward": 0.7755165100097656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7755165100097656, "reward_meter_std": 0.3405035734176636, "reward_std": 0.3405035436153412, "reward_total_composite_mean": 0.7755165100097656, "reward_total_composite_std": 0.3405035734176636, "reward_total_mean": 0.7755165100097656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7755165100097656, "rewards/meter/std": 0.3405035734176636, "rewards/total_composite/mean": 0.7755165100097656, "rewards/total_composite/std": 0.3405035734176636, "sampling/importance_sampling_ratio/max": 1.6945619583129883, "sampling/importance_sampling_ratio/mean": 1.0043402910232544, "sampling/importance_sampling_ratio/min": 0.16238459944725037, "sampling/sampling_logp_difference/max": 1.8177876472473145, "sampling/sampling_logp_difference/mean": 0.044020526111125946, "step": 535 }, { "clip_ratio/high_max": 0.053157048765569925, "clip_ratio/high_mean": 0.053157048765569925, "clip_ratio/low_mean": 0.043238147161901, "clip_ratio/low_min": 0.043238147161901, "clip_ratio/region_mean": 0.09639519592747092, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 53.75, "completions/mean_terminated_length": 53.75, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 1.1170207932591438, "epoch": 0.020698177324683348, "frac_reward_zero_std": 0.0, "grad_norm": 8.588635444641113, "learning_rate": 8.37878787878788e-06, "loss": -0.0758, "num_tokens": 1150740.0, "reward": 0.7046811580657959, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7046811580657959, "reward_meter_std": 0.4017917513847351, "reward_std": 0.4017917513847351, "reward_total_composite_mean": 0.7046811580657959, "reward_total_composite_std": 0.4017917513847351, "reward_total_mean": 0.7046811580657959, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7046811580657959, "rewards/meter/std": 0.4017917513847351, "rewards/total_composite/mean": 0.7046811580657959, "rewards/total_composite/std": 0.4017917513847351, "sampling/importance_sampling_ratio/max": 1.8760080337524414, "sampling/importance_sampling_ratio/mean": 1.0192784070968628, "sampling/importance_sampling_ratio/min": 0.31289422512054443, "sampling/sampling_logp_difference/max": 1.1618900299072266, "sampling/sampling_logp_difference/mean": 0.10004501044750214, "step": 536 }, { "clip_ratio/high_max": 0.019980506971478462, "clip_ratio/high_mean": 0.019980506971478462, "clip_ratio/low_mean": 0.03469064529053867, "clip_ratio/low_min": 0.03469064529053867, "clip_ratio/region_mean": 0.05467115226201713, "completions/clipped_ratio": 0.0, "completions/max_length": 57.0, "completions/max_terminated_length": 57.0, "completions/mean_length": 49.75, "completions/mean_terminated_length": 49.75, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 0.6782696768641472, "epoch": 0.020736793327154772, "frac_reward_zero_std": 0.0, "grad_norm": 8.848946571350098, "learning_rate": 8.375757575757576e-06, "loss": -0.0426, "num_tokens": 1152266.0, "reward": 0.9934061765670776, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9934061765670776, "reward_meter_std": 0.0037812571972608566, "reward_std": 0.003781270468607545, "reward_total_composite_mean": 0.9934061765670776, "reward_total_composite_std": 0.0037812571972608566, "reward_total_mean": 0.9934061765670776, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9934061765670776, "rewards/meter/std": 0.0037812571972608566, "rewards/total_composite/mean": 0.9934061765670776, "rewards/total_composite/std": 0.0037812571972608566, "sampling/importance_sampling_ratio/max": 1.9671330451965332, "sampling/importance_sampling_ratio/mean": 1.0079725980758667, "sampling/importance_sampling_ratio/min": 0.20439153909683228, "sampling/sampling_logp_difference/max": 1.5877177715301514, "sampling/sampling_logp_difference/mean": 0.06811977922916412, "step": 537 }, { "clip_ratio/high_max": 0.026057497365400195, "clip_ratio/high_mean": 0.026057497365400195, "clip_ratio/low_mean": 0.016544118523597717, "clip_ratio/low_min": 0.016544118523597717, "clip_ratio/region_mean": 0.04260161588899791, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 60.625, "completions/mean_terminated_length": 60.625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5225202403962612, "epoch": 0.020775409329626196, "frac_reward_zero_std": 0.0, "grad_norm": 11.105710983276367, "learning_rate": 8.372727272727273e-06, "loss": 0.0562, "num_tokens": 1153991.0, "reward": 0.9464359283447266, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9464359283447266, "reward_meter_std": 0.10982144623994827, "reward_std": 0.10982143878936768, "reward_total_composite_mean": 0.9464359283447266, "reward_total_composite_std": 0.10982144623994827, "reward_total_mean": 0.9464359283447266, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9464359283447266, "rewards/meter/std": 0.10982144623994827, "rewards/total_composite/mean": 0.9464359283447266, "rewards/total_composite/std": 0.10982144623994827, "sampling/importance_sampling_ratio/max": 1.6170642375946045, "sampling/importance_sampling_ratio/mean": 1.0101873874664307, "sampling/importance_sampling_ratio/min": 2.127368787796513e-07, "sampling/sampling_logp_difference/max": 15.36320972442627, "sampling/sampling_logp_difference/mean": 0.08471371978521347, "step": 538 }, { "clip_ratio/high_max": 0.05073056067340076, "clip_ratio/high_mean": 0.05073056067340076, "clip_ratio/low_mean": 0.005681818351149559, "clip_ratio/low_min": 0.005681818351149559, "clip_ratio/region_mean": 0.05641237902455032, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 63.875, "completions/mean_terminated_length": 63.875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5723963566124439, "epoch": 0.02081402533209762, "frac_reward_zero_std": 0.0, "grad_norm": 3.6939918994903564, "learning_rate": 8.36969696969697e-06, "loss": 0.0146, "num_tokens": 1155878.0, "reward": 0.9885964393615723, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9885964393615723, "reward_meter_std": 0.016855819150805473, "reward_std": 0.01685582473874092, "reward_total_composite_mean": 0.9885964393615723, "reward_total_composite_std": 0.016855819150805473, "reward_total_mean": 0.9885964393615723, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9885964393615723, "rewards/meter/std": 0.016855819150805473, "rewards/total_composite/mean": 0.9885964393615723, "rewards/total_composite/std": 0.016855819150805473, "sampling/importance_sampling_ratio/max": 1.6128665208816528, "sampling/importance_sampling_ratio/mean": 1.0144485235214233, "sampling/importance_sampling_ratio/min": 0.3828132748603821, "sampling/sampling_logp_difference/max": 0.9602079391479492, "sampling/sampling_logp_difference/mean": 0.04388084262609482, "step": 539 }, { "clip_ratio/high_max": 0.07365514896810055, "clip_ratio/high_mean": 0.07365514896810055, "clip_ratio/low_mean": 0.008426966145634651, "clip_ratio/low_min": 0.008426966145634651, "clip_ratio/region_mean": 0.0820821151137352, "completions/clipped_ratio": 0.0, "completions/max_length": 89.0, "completions/max_terminated_length": 89.0, "completions/mean_length": 63.625, "completions/mean_terminated_length": 63.625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.48294258303940296, "epoch": 0.020852641334569044, "frac_reward_zero_std": 0.0, "grad_norm": 12.970458030700684, "learning_rate": 8.366666666666667e-06, "loss": 0.1671, "num_tokens": 1157571.0, "reward": 0.9218109250068665, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9840399622917175, "reward_meter_std": 0.00786462053656578, "reward_std": 0.1714293360710144, "reward_total_composite_mean": 0.9218109250068665, "reward_total_composite_std": 0.1714293360710144, "reward_total_mean": 0.9218109250068665, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9840399622917175, "rewards/meter/std": 0.00786462053656578, "rewards/total_composite/mean": 0.9218109250068665, "rewards/total_composite/std": 0.1714293360710144, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0064505338668823, "sampling/importance_sampling_ratio/min": 0.3767927885055542, "sampling/sampling_logp_difference/max": 0.9760599136352539, "sampling/sampling_logp_difference/mean": 0.07498990744352341, "step": 540 }, { "clip_ratio/high_max": 0.020859031821601093, "clip_ratio/high_mean": 0.020859031821601093, "clip_ratio/low_mean": 0.02023959648795426, "clip_ratio/low_min": 0.02023959648795426, "clip_ratio/region_mean": 0.04109862830955535, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 62.375, "completions/mean_terminated_length": 62.375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.2864169627428055, "epoch": 0.02089125733704047, "frac_reward_zero_std": 0.0, "grad_norm": 5.643881797790527, "learning_rate": 8.363636363636365e-06, "loss": -0.0019, "num_tokens": 1159414.0, "reward": 0.9919471740722656, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9919471740722656, "reward_meter_std": 0.005765520967543125, "reward_std": 0.005765520967543125, "reward_total_composite_mean": 0.9919471740722656, "reward_total_composite_std": 0.005765520967543125, "reward_total_mean": 0.9919471740722656, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9919471740722656, "rewards/meter/std": 0.005765520967543125, "rewards/total_composite/mean": 0.9919471740722656, "rewards/total_composite/std": 0.005765520967543125, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0133535861968994, "sampling/importance_sampling_ratio/min": 0.2700084447860718, "sampling/sampling_logp_difference/max": 1.3093020915985107, "sampling/sampling_logp_difference/mean": 0.046641286462545395, "step": 541 }, { "clip_ratio/high_max": 0.01289307966362685, "clip_ratio/high_mean": 0.01289307966362685, "clip_ratio/low_mean": 0.004344935878179967, "clip_ratio/low_min": 0.004344935878179967, "clip_ratio/region_mean": 0.017238015541806817, "completions/clipped_ratio": 0.0, "completions/max_length": 177.0, "completions/max_terminated_length": 177.0, "completions/mean_length": 153.25, "completions/mean_terminated_length": 153.25, "completions/min_length": 134.0, "completions/min_terminated_length": 134.0, "entropy": 0.2024863502010703, "epoch": 0.020929873339511892, "frac_reward_zero_std": 0.0, "grad_norm": 2.8404381275177, "learning_rate": 8.360606060606062e-06, "loss": 0.0263, "num_tokens": 1162016.0, "reward": 0.9956228137016296, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9956228137016296, "reward_meter_std": 0.0026213540695607662, "reward_std": 0.002621352905407548, "reward_total_composite_mean": 0.9956228137016296, "reward_total_composite_std": 0.0026213540695607662, "reward_total_mean": 0.9956228137016296, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9956228137016296, "rewards/meter/std": 0.0026213540695607662, "rewards/total_composite/mean": 0.9956228137016296, "rewards/total_composite/std": 0.0026213540695607662, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0009527206420898, "sampling/importance_sampling_ratio/min": 0.28226134181022644, "sampling/sampling_logp_difference/max": 1.2649219036102295, "sampling/sampling_logp_difference/mean": 0.026027433574199677, "step": 542 }, { "clip_ratio/high_max": 0.008265212236437947, "clip_ratio/high_mean": 0.008265212236437947, "clip_ratio/low_mean": 0.0014523655408993363, "clip_ratio/low_min": 0.0014523655408993363, "clip_ratio/region_mean": 0.009717577777337283, "completions/clipped_ratio": 0.0, "completions/max_length": 463.0, "completions/max_terminated_length": 463.0, "completions/mean_length": 390.875, "completions/mean_terminated_length": 390.875, "completions/min_length": 335.0, "completions/min_terminated_length": 335.0, "entropy": 0.0655752515885979, "epoch": 0.020968489341983317, "frac_reward_zero_std": 0.0, "grad_norm": 3.049520254135132, "learning_rate": 8.357575757575759e-06, "loss": 0.0722, "num_tokens": 1166687.0, "reward": 0.3688773512840271, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.453125, "reward_count_adherence_std": 0.16280877590179443, "reward_meter_mean": 0.867215096950531, "reward_meter_std": 0.3118921220302582, "reward_std": 0.16893039643764496, "reward_total_composite_mean": 0.3688773512840271, "reward_total_composite_std": 0.16893041133880615, "reward_total_mean": 0.3688773512840271, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.453125, "rewards/count_adherence/std": 0.16280877590179443, "rewards/meter/mean": 0.867215096950531, "rewards/meter/std": 0.3118921220302582, "rewards/total_composite/mean": 0.3688773512840271, "rewards/total_composite/std": 0.16893041133880615, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0000622272491455, "sampling/importance_sampling_ratio/min": 0.30091166496276855, "sampling/sampling_logp_difference/max": 1.2009385824203491, "sampling/sampling_logp_difference/mean": 0.011823274195194244, "step": 543 }, { "clip_ratio/high_max": 0.019809147692285478, "clip_ratio/high_mean": 0.019809147692285478, "clip_ratio/low_mean": 0.035438207909464836, "clip_ratio/low_min": 0.035438207909464836, "clip_ratio/region_mean": 0.055247355601750314, "completions/clipped_ratio": 0.0, "completions/max_length": 107.0, "completions/max_terminated_length": 107.0, "completions/mean_length": 95.25, "completions/mean_terminated_length": 95.25, "completions/min_length": 80.0, "completions/min_terminated_length": 80.0, "entropy": 0.2810734435915947, "epoch": 0.02100710534445474, "frac_reward_zero_std": 0.0, "grad_norm": 5.046764850616455, "learning_rate": 8.354545454545455e-06, "loss": -0.0199, "num_tokens": 1168769.0, "reward": 0.9941377639770508, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9941377639770508, "reward_meter_std": 0.004864970687776804, "reward_std": 0.00486496277153492, "reward_total_composite_mean": 0.9941377639770508, "reward_total_composite_std": 0.004864970687776804, "reward_total_mean": 0.9941377639770508, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9941377639770508, "rewards/meter/std": 0.004864970687776804, "rewards/total_composite/mean": 0.9941377639770508, "rewards/total_composite/std": 0.004864970687776804, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0006630420684814, "sampling/importance_sampling_ratio/min": 0.10804898291826248, "sampling/sampling_logp_difference/max": 2.225170612335205, "sampling/sampling_logp_difference/mean": 0.05243554711341858, "step": 544 }, { "clip_ratio/high_max": 0.018268492887727916, "clip_ratio/high_mean": 0.018268492887727916, "clip_ratio/low_mean": 0.004854368977248669, "clip_ratio/low_min": 0.004854368977248669, "clip_ratio/region_mean": 0.023122861864976585, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 98.75, "completions/mean_terminated_length": 98.75, "completions/min_length": 86.0, "completions/min_terminated_length": 86.0, "entropy": 0.23292037099599838, "epoch": 0.021045721346926165, "frac_reward_zero_std": 0.0, "grad_norm": 5.207396030426025, "learning_rate": 8.351515151515152e-06, "loss": 0.0556, "num_tokens": 1170871.0, "reward": 0.9043634533882141, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9043634533882141, "reward_meter_std": 0.18687696754932404, "reward_std": 0.18687698245048523, "reward_total_composite_mean": 0.9043634533882141, "reward_total_composite_std": 0.18687696754932404, "reward_total_mean": 0.9043634533882141, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9043634533882141, "rewards/meter/std": 0.18687696754932404, "rewards/total_composite/mean": 0.9043634533882141, "rewards/total_composite/std": 0.18687696754932404, "sampling/importance_sampling_ratio/max": 1.8148711919784546, "sampling/importance_sampling_ratio/mean": 1.0059583187103271, "sampling/importance_sampling_ratio/min": 0.31646302342414856, "sampling/sampling_logp_difference/max": 1.1505489349365234, "sampling/sampling_logp_difference/mean": 0.03357382118701935, "step": 545 }, { "clip_ratio/high_max": 0.011283236730378121, "clip_ratio/high_mean": 0.011283236730378121, "clip_ratio/low_mean": 0.015035076532512903, "clip_ratio/low_min": 0.015035076532512903, "clip_ratio/region_mean": 0.026318313262891024, "completions/clipped_ratio": 0.0, "completions/max_length": 196.0, "completions/max_terminated_length": 196.0, "completions/mean_length": 168.625, "completions/mean_terminated_length": 168.625, "completions/min_length": 155.0, "completions/min_terminated_length": 155.0, "entropy": 0.3597529251128435, "epoch": 0.02108433734939759, "frac_reward_zero_std": 0.0, "grad_norm": 4.271132469177246, "learning_rate": 8.348484848484849e-06, "loss": 0.0381, "num_tokens": 1173692.0, "reward": 0.9413485527038574, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9413485527038574, "reward_meter_std": 0.09055134654045105, "reward_std": 0.09055135399103165, "reward_total_composite_mean": 0.9413485527038574, "reward_total_composite_std": 0.09055134654045105, "reward_total_mean": 0.9413485527038574, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9413485527038574, "rewards/meter/std": 0.09055134654045105, "rewards/total_composite/mean": 0.9413485527038574, "rewards/total_composite/std": 0.09055134654045105, "sampling/importance_sampling_ratio/max": 1.946368932723999, "sampling/importance_sampling_ratio/mean": 1.0049318075180054, "sampling/importance_sampling_ratio/min": 0.3178619146347046, "sampling/sampling_logp_difference/max": 1.1461381912231445, "sampling/sampling_logp_difference/mean": 0.040303874760866165, "step": 546 }, { "clip_ratio/high_max": 0.032155484426766634, "clip_ratio/high_mean": 0.032155484426766634, "clip_ratio/low_mean": 0.0022522523067891598, "clip_ratio/low_min": 0.0022522523067891598, "clip_ratio/region_mean": 0.034407736733555794, "completions/clipped_ratio": 0.0, "completions/max_length": 127.0, "completions/max_terminated_length": 127.0, "completions/mean_length": 118.125, "completions/mean_terminated_length": 118.125, "completions/min_length": 111.0, "completions/min_terminated_length": 111.0, "entropy": 0.1798835713416338, "epoch": 0.021122953351869013, "frac_reward_zero_std": 0.0, "grad_norm": 3.342482566833496, "learning_rate": 8.345454545454546e-06, "loss": -0.0148, "num_tokens": 1175997.0, "reward": 0.967841625213623, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.967841625213623, "reward_meter_std": 0.06629345566034317, "reward_std": 0.06629344820976257, "reward_total_composite_mean": 0.967841625213623, "reward_total_composite_std": 0.06629345566034317, "reward_total_mean": 0.967841625213623, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.967841625213623, "rewards/meter/std": 0.06629345566034317, "rewards/total_composite/mean": 0.967841625213623, "rewards/total_composite/std": 0.06629345566034317, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0027629137039185, "sampling/importance_sampling_ratio/min": 0.14123374223709106, "sampling/sampling_logp_difference/max": 1.9573390483856201, "sampling/sampling_logp_difference/mean": 0.0339958630502224, "step": 547 }, { "clip_ratio/high_max": 0.025215634261257946, "clip_ratio/high_mean": 0.025215634261257946, "clip_ratio/low_mean": 0.011371727799996734, "clip_ratio/low_min": 0.011371727799996734, "clip_ratio/region_mean": 0.03658736206125468, "completions/clipped_ratio": 0.0, "completions/max_length": 179.0, "completions/max_terminated_length": 179.0, "completions/mean_length": 133.125, "completions/mean_terminated_length": 133.125, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "entropy": 0.2751317787915468, "epoch": 0.021161569354340437, "frac_reward_zero_std": 0.0, "grad_norm": 6.153160572052002, "learning_rate": 8.342424242424244e-06, "loss": -0.0406, "num_tokens": 1178566.0, "reward": 0.9537743330001831, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.9785022139549255, "reward_meter_std": 0.02502669021487236, "reward_std": 0.07013029605150223, "reward_total_composite_mean": 0.9537743330001831, "reward_total_composite_std": 0.07013029605150223, "reward_total_mean": 0.9537743330001831, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.9785022139549255, "rewards/meter/std": 0.02502669021487236, "rewards/total_composite/mean": 0.9537743330001831, "rewards/total_composite/std": 0.07013029605150223, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0059552192687988, "sampling/importance_sampling_ratio/min": 0.3159232437610626, "sampling/sampling_logp_difference/max": 1.1522560119628906, "sampling/sampling_logp_difference/mean": 0.035310305655002594, "step": 548 }, { "clip_ratio/high_max": 0.04026081250049174, "clip_ratio/high_mean": 0.04026081250049174, "clip_ratio/low_mean": 0.05864309147000313, "clip_ratio/low_min": 0.05864309147000313, "clip_ratio/region_mean": 0.09890390397049487, "completions/clipped_ratio": 0.0, "completions/max_length": 34.0, "completions/max_terminated_length": 34.0, "completions/mean_length": 29.25, "completions/mean_terminated_length": 29.25, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 0.9557730779051781, "epoch": 0.02120018535681186, "frac_reward_zero_std": 0.0, "grad_norm": 17.468664169311523, "learning_rate": 8.339393939393941e-06, "loss": -0.077, "num_tokens": 1180024.0, "reward": 0.989723801612854, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.989723801612854, "reward_meter_std": 0.011034172028303146, "reward_std": 0.011034182272851467, "reward_total_composite_mean": 0.989723801612854, "reward_total_composite_std": 0.011034172028303146, "reward_total_mean": 0.989723801612854, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.989723801612854, "rewards/meter/std": 0.011034172028303146, "rewards/total_composite/mean": 0.989723801612854, "rewards/total_composite/std": 0.011034172028303146, "sampling/importance_sampling_ratio/max": 1.7388663291931152, "sampling/importance_sampling_ratio/mean": 1.0076111555099487, "sampling/importance_sampling_ratio/min": 0.2602878212928772, "sampling/sampling_logp_difference/max": 1.3459672927856445, "sampling/sampling_logp_difference/mean": 0.10392901301383972, "step": 549 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.021238801359283285, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 8.336363636363636e-06, "loss": 0.0, "num_tokens": 1181720.0, "reward": 0.9139711856842041, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9191176891326904, "reward_count_adherence_std": 0.05388972535729408, "reward_meter_mean": 0.9942543506622314, "reward_meter_std": 0.005934838205575943, "reward_std": 0.056208569556474686, "reward_total_composite_mean": 0.9139711856842041, "reward_total_composite_std": 0.05620856583118439, "reward_total_mean": 0.9139711856842041, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9191176891326904, "rewards/count_adherence/std": 0.05388972535729408, "rewards/meter/mean": 0.9942543506622314, "rewards/meter/std": 0.005934838205575943, "rewards/total_composite/mean": 0.9139711856842041, "rewards/total_composite/std": 0.05620856583118439, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 550 }, { "epoch": 0.021238801359283285, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.125, "eval_completions/max_length": 476.38461538461536, "eval_completions/max_terminated_length": 421.0769230769231, "eval_completions/mean_length": 241.0096153846154, "eval_completions/mean_terminated_length": 199.7985393817608, "eval_completions/min_length": 51.69230769230769, "eval_completions/min_terminated_length": 51.69230769230769, "eval_entropy": 0.1650333639520865, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1181720.0, "eval_reward": 0.7004609107971191, "eval_reward_arabic_clean_mean": 0.9807692307692307, "eval_reward_arabic_clean_std": 0.05439282839114849, "eval_reward_count_adherence_mean": 0.8751364029370822, "eval_reward_count_adherence_std": 0.1485061846100367, "eval_reward_meter_mean": 0.7935248292409457, "eval_reward_meter_std": 0.3153245966308392, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.7004609107971191, "eval_reward_total_composite_std": 0.3202407302764746, "eval_reward_total_mean": 0.7004609107971191, "eval_rewards/arabic_clean/mean": 0.9807692307692307, "eval_rewards/arabic_clean/std": 0.05439282839114849, "eval_rewards/count_adherence/mean": 0.8751364029370822, "eval_rewards/count_adherence/std": 0.1485061846100367, "eval_rewards/meter/mean": 0.7935248292409457, "eval_rewards/meter/std": 0.3153245966308392, "eval_rewards/total_composite/mean": 0.7004609107971191, "eval_rewards/total_composite/std": 0.3202407302764746, "eval_runtime": 88.1689, "eval_samples_per_second": 1.18, "eval_sampling/importance_sampling_ratio/max": 1.3832710614571204, "eval_sampling/importance_sampling_ratio/mean": 1.0041714814993052, "eval_sampling/importance_sampling_ratio/min": 0.41424351701369655, "eval_sampling/sampling_logp_difference/max": 0.8992016132061298, "eval_sampling/sampling_logp_difference/mean": 0.014547023384903487, "eval_steps_per_second": 0.147, "step": 550 }, { "clip_ratio/high_max": 0.02020994306076318, "clip_ratio/high_mean": 0.02020994306076318, "clip_ratio/low_mean": 0.004437869880348444, "clip_ratio/low_min": 0.004437869880348444, "clip_ratio/region_mean": 0.024647812941111624, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 217.0, "completions/mean_length": 234.375, "completions/mean_terminated_length": 194.71429443359375, "completions/min_length": 169.0, "completions/min_terminated_length": 169.0, "entropy": 0.2244832031428814, "epoch": 0.021277417361754713, "frac_reward_zero_std": 0.0, "grad_norm": 1.8348972797393799, "learning_rate": 8.333333333333334e-06, "loss": -0.1884, "num_tokens": 1184507.0, "reward": 0.637830376625061, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.07715168595314026, "reward_meter_mean": 0.659835934638977, "reward_meter_std": 0.40453797578811646, "reward_std": 0.39101067185401917, "reward_total_composite_mean": 0.637830376625061, "reward_total_composite_std": 0.39101067185401917, "reward_total_mean": 0.637830376625061, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.07715168595314026, "rewards/meter/mean": 0.659835934638977, "rewards/meter/std": 0.40453797578811646, "rewards/total_composite/mean": 0.637830376625061, "rewards/total_composite/std": 0.39101067185401917, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002615213394165, "sampling/importance_sampling_ratio/min": 0.31355801224708557, "sampling/sampling_logp_difference/max": 1.1597709655761719, "sampling/sampling_logp_difference/mean": 0.03236944600939751, "step": 551 }, { "clip_ratio/high_max": 0.027031495235860348, "clip_ratio/high_mean": 0.027031495235860348, "clip_ratio/low_mean": 0.012516135815531015, "clip_ratio/low_min": 0.012516135815531015, "clip_ratio/region_mean": 0.03954763105139136, "completions/clipped_ratio": 0.0, "completions/max_length": 164.0, "completions/max_terminated_length": 164.0, "completions/mean_length": 147.75, "completions/mean_terminated_length": 147.75, "completions/min_length": 129.0, "completions/min_terminated_length": 129.0, "entropy": 0.31488965079188347, "epoch": 0.021316033364226137, "frac_reward_zero_std": 0.0, "grad_norm": 2.554471731185913, "learning_rate": 8.330303030303031e-06, "loss": 0.015, "num_tokens": 1187017.0, "reward": 0.7965080738067627, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9956350326538086, "reward_meter_std": 0.0016549181891605258, "reward_std": 0.0013239351101219654, "reward_total_composite_mean": 0.7965080738067627, "reward_total_composite_std": 0.0013239418622106314, "reward_total_mean": 0.7965080738067627, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9956350326538086, "rewards/meter/std": 0.0016549181891605258, "rewards/total_composite/mean": 0.7965080738067627, "rewards/total_composite/std": 0.0013239418622106314, "sampling/importance_sampling_ratio/max": 1.891858458518982, "sampling/importance_sampling_ratio/mean": 1.0011682510375977, "sampling/importance_sampling_ratio/min": 0.1732589304447174, "sampling/sampling_logp_difference/max": 1.7529680728912354, "sampling/sampling_logp_difference/mean": 0.037060461938381195, "step": 552 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.003231151611544192, "clip_ratio/low_min": 0.003231151611544192, "clip_ratio/region_mean": 0.003231151611544192, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 511.0, "completions/mean_length": 509.75, "completions/mean_terminated_length": 506.0, "completions/min_length": 497.0, "completions/min_terminated_length": 497.0, "entropy": 0.021786156576126814, "epoch": 0.02135464936669756, "frac_reward_zero_std": 0.0, "grad_norm": 0.24584703147411346, "learning_rate": 8.327272727272728e-06, "loss": 0.1244, "num_tokens": 1190519.0, "reward": 0.767181932926178, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7708333730697632, "reward_count_adherence_std": 0.058925554156303406, "reward_meter_mean": 0.9953852891921997, "reward_meter_std": 0.00345088099129498, "reward_std": 0.05727332457900047, "reward_total_composite_mean": 0.767181932926178, "reward_total_composite_std": 0.05727330222725868, "reward_total_mean": 0.767181932926178, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7708333730697632, "rewards/count_adherence/std": 0.058925554156303406, "rewards/meter/mean": 0.9953852891921997, "rewards/meter/std": 0.00345088099129498, "rewards/total_composite/mean": 0.767181932926178, "rewards/total_composite/std": 0.05727330222725868, "sampling/importance_sampling_ratio/max": 1.871092677116394, "sampling/importance_sampling_ratio/mean": 1.0002206563949585, "sampling/importance_sampling_ratio/min": 0.30614548921585083, "sampling/sampling_logp_difference/max": 1.183694839477539, "sampling/sampling_logp_difference/mean": 0.008550068363547325, "step": 553 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0089119115145877, "clip_ratio/low_min": 0.0089119115145877, "clip_ratio/region_mean": 0.0089119115145877, "completions/clipped_ratio": 0.75, "completions/max_length": 512.0, "completions/max_terminated_length": 497.0, "completions/mean_length": 504.625, "completions/mean_terminated_length": 482.5, "completions/min_length": 468.0, "completions/min_terminated_length": 468.0, "entropy": 0.19928418099880219, "epoch": 0.021393265369168985, "frac_reward_zero_std": 0.0, "grad_norm": 1.8809558153152466, "learning_rate": 8.324242424242425e-06, "loss": 0.378, "num_tokens": 1193244.0, "reward": 0.6255342364311218, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1075671836733818, "reward_meter_mean": 0.7643306255340576, "reward_meter_std": 0.37500372529029846, "reward_std": 0.32354021072387695, "reward_total_composite_mean": 0.6255342364311218, "reward_total_composite_std": 0.32354018092155457, "reward_total_mean": 0.6255342364311218, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1075671836733818, "rewards/meter/mean": 0.7643306255340576, "rewards/meter/std": 0.37500372529029846, "rewards/total_composite/mean": 0.6255342364311218, "rewards/total_composite/std": 0.32354018092155457, "sampling/importance_sampling_ratio/max": 1.7761412858963013, "sampling/importance_sampling_ratio/mean": 1.0125058889389038, "sampling/importance_sampling_ratio/min": 0.27125003933906555, "sampling/sampling_logp_difference/max": 1.3047142028808594, "sampling/sampling_logp_difference/mean": 0.06437436491250992, "step": 554 }, { "clip_ratio/high_max": 0.005685312673449516, "clip_ratio/high_mean": 0.005685312673449516, "clip_ratio/low_mean": 0.017126905964687467, "clip_ratio/low_min": 0.017126905964687467, "clip_ratio/region_mean": 0.022812218638136983, "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 126.375, "completions/mean_terminated_length": 126.375, "completions/min_length": 121.0, "completions/min_terminated_length": 121.0, "entropy": 0.2988105323165655, "epoch": 0.02143188137164041, "frac_reward_zero_std": 0.0, "grad_norm": 2.518230676651001, "learning_rate": 8.321212121212123e-06, "loss": -0.0045, "num_tokens": 1195591.0, "reward": 0.839267909526825, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.12938730418682098, "reward_meter_mean": 0.9948133826255798, "reward_meter_std": 0.0038075658958405256, "reward_std": 0.12791673839092255, "reward_total_composite_mean": 0.839267909526825, "reward_total_composite_std": 0.12791672348976135, "reward_total_mean": 0.839267909526825, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/meter/mean": 0.9948133826255798, "rewards/meter/std": 0.0038075658958405256, "rewards/total_composite/mean": 0.839267909526825, "rewards/total_composite/std": 0.12791672348976135, "sampling/importance_sampling_ratio/max": 1.7961597442626953, "sampling/importance_sampling_ratio/mean": 1.0079847574234009, "sampling/importance_sampling_ratio/min": 0.2756645977497101, "sampling/sampling_logp_difference/max": 1.2885704040527344, "sampling/sampling_logp_difference/mean": 0.0339997336268425, "step": 555 }, { "clip_ratio/high_max": 0.007534351840149611, "clip_ratio/high_mean": 0.007534351840149611, "clip_ratio/low_mean": 0.0012622967187780887, "clip_ratio/low_min": 0.0012622967187780887, "clip_ratio/region_mean": 0.0087966485589277, "completions/clipped_ratio": 0.0, "completions/max_length": 500.0, "completions/max_terminated_length": 500.0, "completions/mean_length": 482.625, "completions/mean_terminated_length": 482.625, "completions/min_length": 461.0, "completions/min_terminated_length": 461.0, "entropy": 0.06857710564509034, "epoch": 0.021470497374111833, "frac_reward_zero_std": 0.0, "grad_norm": 1.6413999795913696, "learning_rate": 8.318181818181818e-06, "loss": 0.0222, "num_tokens": 1200948.0, "reward": 0.8098647594451904, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.0589255690574646, "reward_meter_mean": 0.9967899918556213, "reward_meter_std": 0.0011801483342424035, "reward_std": 0.058309562504291534, "reward_total_composite_mean": 0.8098647594451904, "reward_total_composite_std": 0.058309562504291534, "reward_total_mean": 0.8098647594451904, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.0589255690574646, "rewards/meter/mean": 0.9967899918556213, "rewards/meter/std": 0.0011801483342424035, "rewards/total_composite/mean": 0.8098647594451904, "rewards/total_composite/std": 0.058309562504291534, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0008271932601929, "sampling/importance_sampling_ratio/min": 0.20025621354579926, "sampling/sampling_logp_difference/max": 1.6081576347351074, "sampling/sampling_logp_difference/mean": 0.010928530246019363, "step": 556 }, { "clip_ratio/high_max": 0.024866676423698664, "clip_ratio/high_mean": 0.024866676423698664, "clip_ratio/low_mean": 0.026261302642524242, "clip_ratio/low_min": 0.026261302642524242, "clip_ratio/region_mean": 0.051127979066222906, "completions/clipped_ratio": 0.0, "completions/max_length": 123.0, "completions/max_terminated_length": 123.0, "completions/mean_length": 109.125, "completions/mean_terminated_length": 109.125, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "entropy": 0.2295174626633525, "epoch": 0.021509113376583257, "frac_reward_zero_std": 0.0, "grad_norm": 12.06613826751709, "learning_rate": 8.315151515151516e-06, "loss": 0.0447, "num_tokens": 1203421.0, "reward": 0.5651826858520508, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.5895034074783325, "reward_meter_std": 0.44556495547294617, "reward_std": 0.42655691504478455, "reward_total_composite_mean": 0.5651826858520508, "reward_total_composite_std": 0.42655694484710693, "reward_total_mean": 0.5651826858520508, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.5895034074783325, "rewards/meter/std": 0.44556495547294617, "rewards/total_composite/mean": 0.5651826858520508, "rewards/total_composite/std": 0.42655694484710693, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9983038306236267, "sampling/importance_sampling_ratio/min": 0.13523530960083008, "sampling/sampling_logp_difference/max": 2.000739097595215, "sampling/sampling_logp_difference/mean": 0.057171959429979324, "step": 557 }, { "clip_ratio/high_max": 0.025330669013783336, "clip_ratio/high_mean": 0.025330669013783336, "clip_ratio/low_mean": 0.010358731728047132, "clip_ratio/low_min": 0.010358731728047132, "clip_ratio/region_mean": 0.03568940074183047, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 61.0, "completions/mean_terminated_length": 61.0, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.24670910649001598, "epoch": 0.02154772937905468, "frac_reward_zero_std": 0.0, "grad_norm": 4.484973907470703, "learning_rate": 8.312121212121213e-06, "loss": -0.019, "num_tokens": 1205157.0, "reward": 0.9771539568901062, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9771539568901062, "reward_meter_std": 0.036376286298036575, "reward_std": 0.03637627884745598, "reward_total_composite_mean": 0.9771539568901062, "reward_total_composite_std": 0.036376286298036575, "reward_total_mean": 0.9771539568901062, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9771539568901062, "rewards/meter/std": 0.036376286298036575, "rewards/total_composite/mean": 0.9771539568901062, "rewards/total_composite/std": 0.036376286298036575, "sampling/importance_sampling_ratio/max": 1.4410507678985596, "sampling/importance_sampling_ratio/mean": 0.9910410046577454, "sampling/importance_sampling_ratio/min": 0.17207419872283936, "sampling/sampling_logp_difference/max": 1.7598295211791992, "sampling/sampling_logp_difference/mean": 0.04534757509827614, "step": 558 }, { "clip_ratio/high_max": 0.027243590680882335, "clip_ratio/high_mean": 0.027243590680882335, "clip_ratio/low_mean": 0.013174113817512989, "clip_ratio/low_min": 0.013174113817512989, "clip_ratio/region_mean": 0.040417704498395324, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 55.125, "completions/mean_terminated_length": 55.125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.3850720599293709, "epoch": 0.021586345381526106, "frac_reward_zero_std": 0.0, "grad_norm": 12.47499942779541, "learning_rate": 8.30909090909091e-06, "loss": 0.0143, "num_tokens": 1206934.0, "reward": 0.9845154285430908, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9845154285430908, "reward_meter_std": 0.022365685552358627, "reward_std": 0.022365683689713478, "reward_total_composite_mean": 0.9845154285430908, "reward_total_composite_std": 0.022365685552358627, "reward_total_mean": 0.9845154285430908, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9845154285430908, "rewards/meter/std": 0.022365685552358627, "rewards/total_composite/mean": 0.9845154285430908, "rewards/total_composite/std": 0.022365685552358627, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0180634260177612, "sampling/importance_sampling_ratio/min": 0.3067775070667267, "sampling/sampling_logp_difference/max": 1.1816325187683105, "sampling/sampling_logp_difference/mean": 0.05525405332446098, "step": 559 }, { "clip_ratio/high_max": 0.029417280456982553, "clip_ratio/high_mean": 0.029417280456982553, "clip_ratio/low_mean": 0.004687500186264515, "clip_ratio/low_min": 0.004687500186264515, "clip_ratio/region_mean": 0.03410478064324707, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 86.875, "completions/mean_terminated_length": 86.875, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.22090137097984552, "epoch": 0.02162496138399753, "frac_reward_zero_std": 0.0, "grad_norm": 7.248865604400635, "learning_rate": 8.306060606060606e-06, "loss": -0.0201, "num_tokens": 1209005.0, "reward": 0.923915684223175, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.923915684223175, "reward_meter_std": 0.18663685023784637, "reward_std": 0.18663683533668518, "reward_total_composite_mean": 0.923915684223175, "reward_total_composite_std": 0.18663685023784637, "reward_total_mean": 0.923915684223175, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.923915684223175, "rewards/meter/std": 0.18663685023784637, "rewards/total_composite/mean": 0.923915684223175, "rewards/total_composite/std": 0.18663685023784637, "sampling/importance_sampling_ratio/max": 1.8499445915222168, "sampling/importance_sampling_ratio/mean": 1.0030776262283325, "sampling/importance_sampling_ratio/min": 0.3106648325920105, "sampling/sampling_logp_difference/max": 1.1690406799316406, "sampling/sampling_logp_difference/mean": 0.03298182412981987, "step": 560 }, { "clip_ratio/high_max": 0.04831800376996398, "clip_ratio/high_mean": 0.04831800376996398, "clip_ratio/low_mean": 0.005494505632668734, "clip_ratio/low_min": 0.005494505632668734, "clip_ratio/region_mean": 0.05381250940263271, "completions/clipped_ratio": 0.0, "completions/max_length": 110.0, "completions/max_terminated_length": 110.0, "completions/mean_length": 96.875, "completions/mean_terminated_length": 96.875, "completions/min_length": 91.0, "completions/min_terminated_length": 91.0, "entropy": 0.5123469866812229, "epoch": 0.021663577386468954, "frac_reward_zero_std": 0.0, "grad_norm": 5.603593826293945, "learning_rate": 8.303030303030305e-06, "loss": -0.009, "num_tokens": 1211172.0, "reward": 0.9536159038543701, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.995019793510437, "reward_meter_std": 0.0025853195693343878, "reward_std": 0.11767084896564484, "reward_total_composite_mean": 0.9536159038543701, "reward_total_composite_std": 0.11767086386680603, "reward_total_mean": 0.9536159038543701, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.995019793510437, "rewards/meter/std": 0.0025853195693343878, "rewards/total_composite/mean": 0.9536159038543701, "rewards/total_composite/std": 0.11767086386680603, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0120702981948853, "sampling/importance_sampling_ratio/min": 0.07194232940673828, "sampling/sampling_logp_difference/max": 2.6318905353546143, "sampling/sampling_logp_difference/mean": 0.05422169715166092, "step": 561 }, { "clip_ratio/high_max": 0.06236687349155545, "clip_ratio/high_mean": 0.06236687349155545, "clip_ratio/low_mean": 0.0078125, "clip_ratio/low_min": 0.0078125, "clip_ratio/region_mean": 0.07017937349155545, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 37.75, "completions/mean_terminated_length": 37.75, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 0.7698529586195946, "epoch": 0.021702193388940378, "frac_reward_zero_std": 0.0, "grad_norm": 11.571051597595215, "learning_rate": 8.3e-06, "loss": 0.2898, "num_tokens": 1212666.0, "reward": 0.8193449378013611, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.9433770179748535, "reward_meter_std": 0.13426972925662994, "reward_std": 0.3567107319831848, "reward_total_composite_mean": 0.8193449378013611, "reward_total_composite_std": 0.3567107319831848, "reward_total_mean": 0.8193449378013611, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.9433770179748535, "rewards/meter/std": 0.13426972925662994, "rewards/total_composite/mean": 0.8193449378013611, "rewards/total_composite/std": 0.3567107319831848, "sampling/importance_sampling_ratio/max": 1.9018025398254395, "sampling/importance_sampling_ratio/mean": 1.0174795389175415, "sampling/importance_sampling_ratio/min": 0.22708770632743835, "sampling/sampling_logp_difference/max": 1.4824190139770508, "sampling/sampling_logp_difference/mean": 0.09738308191299438, "step": 562 }, { "clip_ratio/high_max": 0.02509535406716168, "clip_ratio/high_mean": 0.02509535406716168, "clip_ratio/low_mean": 0.008614832302555442, "clip_ratio/low_min": 0.008614832302555442, "clip_ratio/region_mean": 0.03371018636971712, "completions/clipped_ratio": 0.0, "completions/max_length": 102.0, "completions/max_terminated_length": 102.0, "completions/mean_length": 100.125, "completions/mean_terminated_length": 100.125, "completions/min_length": 96.0, "completions/min_terminated_length": 96.0, "entropy": 0.4031477700918913, "epoch": 0.021740809391411802, "frac_reward_zero_std": 0.0, "grad_norm": 4.293374061584473, "learning_rate": 8.296969696969697e-06, "loss": 0.0224, "num_tokens": 1214907.0, "reward": 0.7916634678840637, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7916634678840637, "reward_meter_std": 0.35509946942329407, "reward_std": 0.3550994396209717, "reward_total_composite_mean": 0.7916634678840637, "reward_total_composite_std": 0.35509946942329407, "reward_total_mean": 0.7916634678840637, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7916634678840637, "rewards/meter/std": 0.35509946942329407, "rewards/total_composite/mean": 0.7916634678840637, "rewards/total_composite/std": 0.35509946942329407, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0102379322052002, "sampling/importance_sampling_ratio/min": 0.38540852069854736, "sampling/sampling_logp_difference/max": 0.95345139503479, "sampling/sampling_logp_difference/mean": 0.04964831843972206, "step": 563 }, { "clip_ratio/high_max": 0.044469698797911406, "clip_ratio/high_mean": 0.044469698797911406, "clip_ratio/low_mean": 0.031700728461146355, "clip_ratio/low_min": 0.031700728461146355, "clip_ratio/region_mean": 0.07617042725905776, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 59.125, "completions/mean_terminated_length": 59.125, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.574961706995964, "epoch": 0.021779425393883226, "frac_reward_zero_std": 0.0, "grad_norm": 7.8068928718566895, "learning_rate": 8.293939393939395e-06, "loss": -0.1095, "num_tokens": 1216596.0, "reward": 0.9822205305099487, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9822205305099487, "reward_meter_std": 0.0145874610170722, "reward_std": 0.014587470330297947, "reward_total_composite_mean": 0.9822205305099487, "reward_total_composite_std": 0.0145874610170722, "reward_total_mean": 0.9822205305099487, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9822205305099487, "rewards/meter/std": 0.0145874610170722, "rewards/total_composite/mean": 0.9822205305099487, "rewards/total_composite/std": 0.0145874610170722, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0125072002410889, "sampling/importance_sampling_ratio/min": 0.07002489268779755, "sampling/sampling_logp_difference/max": 2.658904552459717, "sampling/sampling_logp_difference/mean": 0.0998057872056961, "step": 564 }, { "clip_ratio/high_max": 0.056833125185221434, "clip_ratio/high_mean": 0.056833125185221434, "clip_ratio/low_mean": 0.021110056899487972, "clip_ratio/low_min": 0.021110056899487972, "clip_ratio/region_mean": 0.0779431820847094, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 36.375, "completions/mean_terminated_length": 36.375, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 0.8591618165373802, "epoch": 0.02181804139635465, "frac_reward_zero_std": 0.0, "grad_norm": 9.879420280456543, "learning_rate": 8.290909090909092e-06, "loss": 0.1893, "num_tokens": 1218119.0, "reward": 0.7292733192443848, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.7298904061317444, "reward_meter_std": 0.45080265402793884, "reward_std": 0.451938658952713, "reward_total_composite_mean": 0.7292733192443848, "reward_total_composite_std": 0.4519386887550354, "reward_total_mean": 0.7292733192443848, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.7298904061317444, "rewards/meter/std": 0.45080265402793884, "rewards/total_composite/mean": 0.7292733192443848, "rewards/total_composite/std": 0.4519386887550354, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0224130153656006, "sampling/importance_sampling_ratio/min": 0.3525867760181427, "sampling/sampling_logp_difference/max": 1.0424585342407227, "sampling/sampling_logp_difference/mean": 0.09998878836631775, "step": 565 }, { "clip_ratio/high_max": 0.019384657382033765, "clip_ratio/high_mean": 0.019384657382033765, "clip_ratio/low_mean": 0.03550754114985466, "clip_ratio/low_min": 0.03550754114985466, "clip_ratio/region_mean": 0.054892198531888425, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 73.0, "completions/mean_terminated_length": 73.0, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.5164803229272366, "epoch": 0.021856657398826074, "frac_reward_zero_std": 0.0, "grad_norm": 7.685236930847168, "learning_rate": 8.287878787878787e-06, "loss": -0.0217, "num_tokens": 1220231.0, "reward": 0.8192075490951538, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8192075490951538, "reward_meter_std": 0.1594366729259491, "reward_std": 0.1594366729259491, "reward_total_composite_mean": 0.8192075490951538, "reward_total_composite_std": 0.1594366729259491, "reward_total_mean": 0.8192075490951538, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8192075490951538, "rewards/meter/std": 0.1594366729259491, "rewards/total_composite/mean": 0.8192075490951538, "rewards/total_composite/std": 0.1594366729259491, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.019374132156372, "sampling/importance_sampling_ratio/min": 0.24237361550331116, "sampling/sampling_logp_difference/max": 1.4172749519348145, "sampling/sampling_logp_difference/mean": 0.07931912690401077, "step": 566 }, { "clip_ratio/high_max": 0.05356209189631045, "clip_ratio/high_mean": 0.05356209189631045, "clip_ratio/low_mean": 0.06415719725191593, "clip_ratio/low_min": 0.06415719725191593, "clip_ratio/region_mean": 0.11771928914822638, "completions/clipped_ratio": 0.0, "completions/max_length": 51.0, "completions/max_terminated_length": 51.0, "completions/mean_length": 48.25, "completions/mean_terminated_length": 48.25, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7732437737286091, "epoch": 0.0218952734012975, "frac_reward_zero_std": 0.0, "grad_norm": 13.685770988464355, "learning_rate": 8.284848484848486e-06, "loss": 0.0125, "num_tokens": 1221897.0, "reward": 0.7687733173370361, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7687733173370361, "reward_meter_std": 0.23431365191936493, "reward_std": 0.23431365191936493, "reward_total_composite_mean": 0.7687733173370361, "reward_total_composite_std": 0.23431365191936493, "reward_total_mean": 0.7687733173370361, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7687733173370361, "rewards/meter/std": 0.23431365191936493, "rewards/total_composite/mean": 0.7687733173370361, "rewards/total_composite/std": 0.23431365191936493, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0146090984344482, "sampling/importance_sampling_ratio/min": 0.15560193359851837, "sampling/sampling_logp_difference/max": 1.8604542016983032, "sampling/sampling_logp_difference/mean": 0.12316906452178955, "step": 567 }, { "clip_ratio/high_max": 0.07650120463222265, "clip_ratio/high_mean": 0.07650120463222265, "clip_ratio/low_mean": 0.07042828761041164, "clip_ratio/low_min": 0.07042828761041164, "clip_ratio/region_mean": 0.1469294922426343, "completions/clipped_ratio": 0.0, "completions/max_length": 51.0, "completions/max_terminated_length": 51.0, "completions/mean_length": 41.625, "completions/mean_terminated_length": 41.625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 1.1647358424961567, "epoch": 0.021933889403768923, "frac_reward_zero_std": 0.0, "grad_norm": 12.740221977233887, "learning_rate": 8.281818181818182e-06, "loss": 0.0232, "num_tokens": 1223686.0, "reward": 0.3464130163192749, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3464130163192749, "reward_meter_std": 0.327831894159317, "reward_std": 0.327831894159317, "reward_total_composite_mean": 0.3464130163192749, "reward_total_composite_std": 0.327831894159317, "reward_total_mean": 0.3464130163192749, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3464130163192749, "rewards/meter/std": 0.327831894159317, "rewards/total_composite/mean": 0.3464130163192749, "rewards/total_composite/std": 0.327831894159317, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0059748888015747, "sampling/importance_sampling_ratio/min": 0.15346065163612366, "sampling/sampling_logp_difference/max": 1.874311089515686, "sampling/sampling_logp_difference/mean": 0.13335032761096954, "step": 568 }, { "clip_ratio/high_max": 0.020774202537722886, "clip_ratio/high_mean": 0.020774202537722886, "clip_ratio/low_mean": 0.0090304184705019, "clip_ratio/low_min": 0.0090304184705019, "clip_ratio/region_mean": 0.029804621008224785, "completions/clipped_ratio": 0.0, "completions/max_length": 263.0, "completions/max_terminated_length": 263.0, "completions/mean_length": 208.0, "completions/mean_terminated_length": 208.0, "completions/min_length": 151.0, "completions/min_terminated_length": 151.0, "entropy": 0.30806298181414604, "epoch": 0.021972505406240347, "frac_reward_zero_std": 0.0, "grad_norm": 5.267251014709473, "learning_rate": 8.27878787878788e-06, "loss": 0.0953, "num_tokens": 1226918.0, "reward": 0.8531581163406372, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9642857313156128, "reward_count_adherence_std": 0.06613000482320786, "reward_meter_mean": 0.8887746334075928, "reward_meter_std": 0.28811898827552795, "reward_std": 0.28023195266723633, "reward_total_composite_mean": 0.8531581163406372, "reward_total_composite_std": 0.28023195266723633, "reward_total_mean": 0.8531581163406372, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9642857313156128, "rewards/count_adherence/std": 0.06613000482320786, "rewards/meter/mean": 0.8887746334075928, "rewards/meter/std": 0.28811898827552795, "rewards/total_composite/mean": 0.8531581163406372, "rewards/total_composite/std": 0.28023195266723633, "sampling/importance_sampling_ratio/max": 1.8939993381500244, "sampling/importance_sampling_ratio/mean": 1.004589319229126, "sampling/importance_sampling_ratio/min": 0.07200159877538681, "sampling/sampling_logp_difference/max": 2.6310670375823975, "sampling/sampling_logp_difference/mean": 0.04299961030483246, "step": 569 }, { "clip_ratio/high_max": 0.04666911787353456, "clip_ratio/high_mean": 0.04666911787353456, "clip_ratio/low_mean": 0.005681818351149559, "clip_ratio/low_min": 0.005681818351149559, "clip_ratio/region_mean": 0.05235093622468412, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 65.0, "completions/mean_terminated_length": 65.0, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.3545149974524975, "epoch": 0.02201112140871177, "frac_reward_zero_std": 0.0, "grad_norm": 4.654249668121338, "learning_rate": 8.275757575757577e-06, "loss": 0.0113, "num_tokens": 1228806.0, "reward": 0.984466016292572, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.984466016292572, "reward_meter_std": 0.027155917137861252, "reward_std": 0.027155913412570953, "reward_total_composite_mean": 0.984466016292572, "reward_total_composite_std": 0.027155917137861252, "reward_total_mean": 0.984466016292572, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.984466016292572, "rewards/meter/std": 0.027155917137861252, "rewards/total_composite/mean": 0.984466016292572, "rewards/total_composite/std": 0.027155917137861252, "sampling/importance_sampling_ratio/max": 1.9392898082733154, "sampling/importance_sampling_ratio/mean": 1.0072888135910034, "sampling/importance_sampling_ratio/min": 0.3174997866153717, "sampling/sampling_logp_difference/max": 1.147278070449829, "sampling/sampling_logp_difference/mean": 0.053486477583646774, "step": 570 }, { "clip_ratio/high_max": 0.014448553905822337, "clip_ratio/high_mean": 0.014448553905822337, "clip_ratio/low_mean": 0.015158275258727372, "clip_ratio/low_min": 0.015158275258727372, "clip_ratio/region_mean": 0.02960682916454971, "completions/clipped_ratio": 0.0, "completions/max_length": 419.0, "completions/max_terminated_length": 419.0, "completions/mean_length": 372.375, "completions/mean_terminated_length": 372.375, "completions/min_length": 329.0, "completions/min_terminated_length": 329.0, "entropy": 0.16989378002472222, "epoch": 0.022049737411183195, "frac_reward_zero_std": 0.0, "grad_norm": 2.5224688053131104, "learning_rate": 8.272727272727274e-06, "loss": -0.01, "num_tokens": 1233705.0, "reward": 0.3962605595588684, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.09234060347080231, "reward_meter_mean": 0.5269562005996704, "reward_meter_std": 0.4027676284313202, "reward_std": 0.30246567726135254, "reward_total_composite_mean": 0.3962605595588684, "reward_total_composite_std": 0.30246567726135254, "reward_total_mean": 0.3962605595588684, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.09234060347080231, "rewards/meter/mean": 0.5269562005996704, "rewards/meter/std": 0.4027676284313202, "rewards/total_composite/mean": 0.3962605595588684, "rewards/total_composite/std": 0.30246567726135254, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9997126460075378, "sampling/importance_sampling_ratio/min": 0.11277057975530624, "sampling/sampling_logp_difference/max": 2.1823997497558594, "sampling/sampling_logp_difference/mean": 0.0314236655831337, "step": 571 }, { "clip_ratio/high_max": 0.04550157627090812, "clip_ratio/high_mean": 0.04550157627090812, "clip_ratio/low_mean": 0.025765900732949376, "clip_ratio/low_min": 0.025765900732949376, "clip_ratio/region_mean": 0.0712674770038575, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 79.25, "completions/mean_terminated_length": 79.25, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.6656168103218079, "epoch": 0.02208835341365462, "frac_reward_zero_std": 0.0, "grad_norm": 8.577203750610352, "learning_rate": 8.269696969696971e-06, "loss": -0.0052, "num_tokens": 1235635.0, "reward": 0.6216261386871338, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6216261386871338, "reward_meter_std": 0.42476242780685425, "reward_std": 0.42476242780685425, "reward_total_composite_mean": 0.6216261386871338, "reward_total_composite_std": 0.42476242780685425, "reward_total_mean": 0.6216261386871338, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6216261386871338, "rewards/meter/std": 0.42476242780685425, "rewards/total_composite/mean": 0.6216261386871338, "rewards/total_composite/std": 0.42476242780685425, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0138676166534424, "sampling/importance_sampling_ratio/min": 0.27314189076423645, "sampling/sampling_logp_difference/max": 1.9287548065185547, "sampling/sampling_logp_difference/mean": 0.08498334139585495, "step": 572 }, { "clip_ratio/high_max": 0.08289422187954187, "clip_ratio/high_mean": 0.08289422187954187, "clip_ratio/low_mean": 0.023148147389292717, "clip_ratio/low_min": 0.023148147389292717, "clip_ratio/region_mean": 0.10604236926883459, "completions/clipped_ratio": 0.0, "completions/max_length": 31.0, "completions/max_terminated_length": 31.0, "completions/mean_length": 28.875, "completions/mean_terminated_length": 28.875, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 1.1661205813288689, "epoch": 0.022126969416126043, "frac_reward_zero_std": 0.0, "grad_norm": 14.97447681427002, "learning_rate": 8.266666666666667e-06, "loss": -0.0174, "num_tokens": 1237082.0, "reward": 0.8920953273773193, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8920953273773193, "reward_meter_std": 0.2680381238460541, "reward_std": 0.2680380940437317, "reward_total_composite_mean": 0.8920953273773193, "reward_total_composite_std": 0.2680381238460541, "reward_total_mean": 0.8920953273773193, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8920953273773193, "rewards/meter/std": 0.2680381238460541, "rewards/total_composite/mean": 0.8920953273773193, "rewards/total_composite/std": 0.2680381238460541, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0461758375167847, "sampling/importance_sampling_ratio/min": 0.3460072875022888, "sampling/sampling_logp_difference/max": 1.061295509338379, "sampling/sampling_logp_difference/mean": 0.12218277901411057, "step": 573 }, { "clip_ratio/high_max": 0.011733462568372488, "clip_ratio/high_mean": 0.011733462568372488, "clip_ratio/low_mean": 0.01109237689524889, "clip_ratio/low_min": 0.01109237689524889, "clip_ratio/region_mean": 0.022825839463621378, "completions/clipped_ratio": 0.0, "completions/max_length": 265.0, "completions/max_terminated_length": 265.0, "completions/mean_length": 242.375, "completions/mean_terminated_length": 242.375, "completions/min_length": 208.0, "completions/min_terminated_length": 208.0, "entropy": 0.18924708105623722, "epoch": 0.022165585418597467, "frac_reward_zero_std": 0.0, "grad_norm": 1.9361296892166138, "learning_rate": 8.263636363636366e-06, "loss": 0.0108, "num_tokens": 1240781.0, "reward": 0.7266948223114014, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.930555522441864, "reward_count_adherence_std": 0.05750546231865883, "reward_meter_mean": 0.7801742553710938, "reward_meter_std": 0.3070351183414459, "reward_std": 0.2840970754623413, "reward_total_composite_mean": 0.7266948223114014, "reward_total_composite_std": 0.2840970754623413, "reward_total_mean": 0.7266948223114014, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.930555522441864, "rewards/count_adherence/std": 0.05750546231865883, "rewards/meter/mean": 0.7801742553710938, "rewards/meter/std": 0.3070351183414459, "rewards/total_composite/mean": 0.7266948223114014, "rewards/total_composite/std": 0.2840970754623413, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0045069456100464, "sampling/importance_sampling_ratio/min": 0.050895627588033676, "sampling/sampling_logp_difference/max": 2.977978229522705, "sampling/sampling_logp_difference/mean": 0.03169988840818405, "step": 574 }, { "clip_ratio/high_max": 0.05042124609462917, "clip_ratio/high_mean": 0.05042124609462917, "clip_ratio/low_mean": 0.017729461658746004, "clip_ratio/low_min": 0.017729461658746004, "clip_ratio/region_mean": 0.06815070775337517, "completions/clipped_ratio": 0.0, "completions/max_length": 98.0, "completions/max_terminated_length": 98.0, "completions/mean_length": 90.0, "completions/mean_terminated_length": 90.0, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 0.570578096434474, "epoch": 0.02220420142106889, "frac_reward_zero_std": 0.0, "grad_norm": 6.091910362243652, "learning_rate": 8.260606060606061e-06, "loss": -0.0409, "num_tokens": 1242957.0, "reward": 0.934752345085144, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.934752345085144, "reward_meter_std": 0.10161388665437698, "reward_std": 0.10161387175321579, "reward_total_composite_mean": 0.934752345085144, "reward_total_composite_std": 0.10161388665437698, "reward_total_mean": 0.934752345085144, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.934752345085144, "rewards/meter/std": 0.10161388665437698, "rewards/total_composite/mean": 0.934752345085144, "rewards/total_composite/std": 0.10161388665437698, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.009366750717163, "sampling/importance_sampling_ratio/min": 0.2479490041732788, "sampling/sampling_logp_difference/max": 1.3945322036743164, "sampling/sampling_logp_difference/mean": 0.07466892898082733, "step": 575 }, { "clip_ratio/high_max": 0.08125000167638063, "clip_ratio/high_mean": 0.08125000167638063, "clip_ratio/low_mean": 0.03163566067814827, "clip_ratio/low_min": 0.03163566067814827, "clip_ratio/region_mean": 0.1128856623545289, "completions/clipped_ratio": 0.0, "completions/max_length": 35.0, "completions/max_terminated_length": 35.0, "completions/mean_length": 32.375, "completions/mean_terminated_length": 32.375, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 1.167568787932396, "epoch": 0.022242817423540315, "frac_reward_zero_std": 0.0, "grad_norm": 18.79474639892578, "learning_rate": 8.257575757575758e-06, "loss": 0.0045, "num_tokens": 1244488.0, "reward": 0.6495904922485352, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6495904922485352, "reward_meter_std": 0.46892398595809937, "reward_std": 0.46892398595809937, "reward_total_composite_mean": 0.6495904922485352, "reward_total_composite_std": 0.46892398595809937, "reward_total_mean": 0.6495904922485352, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6495904922485352, "rewards/meter/std": 0.46892398595809937, "rewards/total_composite/mean": 0.6495904922485352, "rewards/total_composite/std": 0.46892398595809937, "sampling/importance_sampling_ratio/max": 1.6851778030395508, "sampling/importance_sampling_ratio/mean": 1.0079195499420166, "sampling/importance_sampling_ratio/min": 0.3687765896320343, "sampling/sampling_logp_difference/max": 0.9975643157958984, "sampling/sampling_logp_difference/mean": 0.11486772447824478, "step": 576 }, { "clip_ratio/high_max": 0.02569850441068411, "clip_ratio/high_mean": 0.02569850441068411, "clip_ratio/low_mean": 0.030232772696763277, "clip_ratio/low_min": 0.030232772696763277, "clip_ratio/region_mean": 0.055931277107447386, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 94.625, "completions/mean_terminated_length": 94.625, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.5516252182424068, "epoch": 0.02228143342601174, "frac_reward_zero_std": 0.0, "grad_norm": 4.967631816864014, "learning_rate": 8.254545454545456e-06, "loss": -0.0136, "num_tokens": 1246653.0, "reward": 0.5170981884002686, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_meter_mean": 0.5609345436096191, "reward_meter_std": 0.46121135354042053, "reward_std": 0.43609705567359924, "reward_total_composite_mean": 0.5170981884002686, "reward_total_composite_std": 0.43609705567359924, "reward_total_mean": 0.5170981884002686, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/meter/mean": 0.5609345436096191, "rewards/meter/std": 0.46121135354042053, "rewards/total_composite/mean": 0.5170981884002686, "rewards/total_composite/std": 0.43609705567359924, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0093859434127808, "sampling/importance_sampling_ratio/min": 0.17441149055957794, "sampling/sampling_logp_difference/max": 1.746337890625, "sampling/sampling_logp_difference/mean": 0.07433033734560013, "step": 577 }, { "clip_ratio/high_max": 0.02754599740728736, "clip_ratio/high_mean": 0.02754599740728736, "clip_ratio/low_mean": 0.024840134428814054, "clip_ratio/low_min": 0.024840134428814054, "clip_ratio/region_mean": 0.05238613183610141, "completions/clipped_ratio": 0.0, "completions/max_length": 188.0, "completions/max_terminated_length": 188.0, "completions/mean_length": 164.125, "completions/mean_terminated_length": 164.125, "completions/min_length": 148.0, "completions/min_terminated_length": 148.0, "entropy": 0.5197625793516636, "epoch": 0.022320049428483164, "frac_reward_zero_std": 0.0, "grad_norm": 3.93625545501709, "learning_rate": 8.251515151515153e-06, "loss": 0.0284, "num_tokens": 1249486.0, "reward": 0.9166064262390137, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9166064262390137, "reward_meter_std": 0.09252025932073593, "reward_std": 0.09252026677131653, "reward_total_composite_mean": 0.9166064262390137, "reward_total_composite_std": 0.09252025932073593, "reward_total_mean": 0.9166064262390137, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9166064262390137, "rewards/meter/std": 0.09252025932073593, "rewards/total_composite/mean": 0.9166064262390137, "rewards/total_composite/std": 0.09252025932073593, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0109132528305054, "sampling/importance_sampling_ratio/min": 0.29223909974098206, "sampling/sampling_logp_difference/max": 1.4260609149932861, "sampling/sampling_logp_difference/mean": 0.07041816413402557, "step": 578 }, { "clip_ratio/high_max": 0.06810012133792043, "clip_ratio/high_mean": 0.06810012133792043, "clip_ratio/low_mean": 0.01710526365786791, "clip_ratio/low_min": 0.01710526365786791, "clip_ratio/region_mean": 0.08520538499578834, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 69.25, "completions/mean_terminated_length": 69.25, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.8376755490899086, "epoch": 0.022358665430954588, "frac_reward_zero_std": 0.0, "grad_norm": 9.262944221496582, "learning_rate": 8.248484848484848e-06, "loss": 0.1901, "num_tokens": 1251320.0, "reward": 0.9087815284729004, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9710856676101685, "reward_meter_std": 0.049965545535087585, "reward_std": 0.17285725474357605, "reward_total_composite_mean": 0.9087815284729004, "reward_total_composite_std": 0.17285725474357605, "reward_total_mean": 0.9087815284729004, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9710856676101685, "rewards/meter/std": 0.049965545535087585, "rewards/total_composite/mean": 0.9087815284729004, "rewards/total_composite/std": 0.17285725474357605, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0127062797546387, "sampling/importance_sampling_ratio/min": 0.3225191533565521, "sampling/sampling_logp_difference/max": 1.1315927505493164, "sampling/sampling_logp_difference/mean": 0.096940778195858, "step": 579 }, { "clip_ratio/high_max": 0.018500169040635228, "clip_ratio/high_mean": 0.018500169040635228, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.018500169040635228, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 367.0, "completions/mean_length": 362.625, "completions/mean_terminated_length": 341.2857360839844, "completions/min_length": 316.0, "completions/min_terminated_length": 316.0, "entropy": 0.16224890854209661, "epoch": 0.022397281433426012, "frac_reward_zero_std": 0.0, "grad_norm": 0.5297556519508362, "learning_rate": 8.245454545454546e-06, "loss": -0.2893, "num_tokens": 1255245.0, "reward": 0.4977211654186249, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.5588235855102539, "reward_count_adherence_std": 0.04446641355752945, "reward_meter_mean": 0.9441625475883484, "reward_meter_std": 0.14516927301883698, "reward_std": 0.2027885913848877, "reward_total_composite_mean": 0.4977211654186249, "reward_total_composite_std": 0.2027886062860489, "reward_total_mean": 0.4977211654186249, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.5588235855102539, "rewards/count_adherence/std": 0.04446641355752945, "rewards/meter/mean": 0.9441625475883484, "rewards/meter/std": 0.14516927301883698, "rewards/total_composite/mean": 0.4977211654186249, "rewards/total_composite/std": 0.2027886062860489, "sampling/importance_sampling_ratio/max": 1.8625940084457397, "sampling/importance_sampling_ratio/mean": 1.0028082132339478, "sampling/importance_sampling_ratio/min": 0.29588600993156433, "sampling/sampling_logp_difference/max": 1.2177810668945312, "sampling/sampling_logp_difference/mean": 0.02394985593855381, "step": 580 }, { "clip_ratio/high_max": 0.07077483460307121, "clip_ratio/high_mean": 0.07077483460307121, "clip_ratio/low_mean": 0.02420289907604456, "clip_ratio/low_min": 0.02420289907604456, "clip_ratio/region_mean": 0.09497773367911577, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 67.875, "completions/mean_terminated_length": 67.875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.8226092867553234, "epoch": 0.022435897435897436, "frac_reward_zero_std": 0.0, "grad_norm": 6.394820690155029, "learning_rate": 8.242424242424243e-06, "loss": 0.0445, "num_tokens": 1257068.0, "reward": 0.9752446413040161, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9752446413040161, "reward_meter_std": 0.03254934400320053, "reward_std": 0.03254932910203934, "reward_total_composite_mean": 0.9752446413040161, "reward_total_composite_std": 0.03254934400320053, "reward_total_mean": 0.9752446413040161, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9752446413040161, "rewards/meter/std": 0.03254934400320053, "rewards/total_composite/mean": 0.9752446413040161, "rewards/total_composite/std": 0.03254934400320053, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0144362449645996, "sampling/importance_sampling_ratio/min": 0.20634615421295166, "sampling/sampling_logp_difference/max": 1.578200101852417, "sampling/sampling_logp_difference/mean": 0.09171347320079803, "step": 581 }, { "clip_ratio/high_max": 0.010697707650251687, "clip_ratio/high_mean": 0.010697707650251687, "clip_ratio/low_mean": 0.036390340072102845, "clip_ratio/low_min": 0.036390340072102845, "clip_ratio/region_mean": 0.04708804772235453, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 59.625, "completions/mean_terminated_length": 59.625, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.32135884277522564, "epoch": 0.02247451343836886, "frac_reward_zero_std": 0.0, "grad_norm": 3.4065492153167725, "learning_rate": 8.23939393939394e-06, "loss": -0.0091, "num_tokens": 1258849.0, "reward": 0.9942880868911743, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9942880868911743, "reward_meter_std": 0.002081402810290456, "reward_std": 0.0020814072340726852, "reward_total_composite_mean": 0.9942880868911743, "reward_total_composite_std": 0.002081402810290456, "reward_total_mean": 0.9942880868911743, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9942880868911743, "rewards/meter/std": 0.002081402810290456, "rewards/total_composite/mean": 0.9942880868911743, "rewards/total_composite/std": 0.002081402810290456, "sampling/importance_sampling_ratio/max": 1.7408068180084229, "sampling/importance_sampling_ratio/mean": 1.0069268941879272, "sampling/importance_sampling_ratio/min": 0.3066324293613434, "sampling/sampling_logp_difference/max": 1.182105541229248, "sampling/sampling_logp_difference/mean": 0.04282836988568306, "step": 582 }, { "clip_ratio/high_max": 0.02780228859046474, "clip_ratio/high_mean": 0.02780228859046474, "clip_ratio/low_mean": 0.02640543133020401, "clip_ratio/low_min": 0.02640543133020401, "clip_ratio/region_mean": 0.05420771992066875, "completions/clipped_ratio": 0.0, "completions/max_length": 166.0, "completions/max_terminated_length": 166.0, "completions/mean_length": 147.125, "completions/mean_terminated_length": 147.125, "completions/min_length": 129.0, "completions/min_terminated_length": 129.0, "entropy": 0.4634787142276764, "epoch": 0.022513129440840284, "frac_reward_zero_std": 0.0, "grad_norm": 5.01640510559082, "learning_rate": 8.236363636363637e-06, "loss": 0.0741, "num_tokens": 1261386.0, "reward": 0.6761964559555054, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.0890870913863182, "reward_meter_mean": 0.7399221062660217, "reward_meter_std": 0.3321729898452759, "reward_std": 0.29238972067832947, "reward_total_composite_mean": 0.6761964559555054, "reward_total_composite_std": 0.29238972067832947, "reward_total_mean": 0.6761964559555054, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.0890870913863182, "rewards/meter/mean": 0.7399221062660217, "rewards/meter/std": 0.3321729898452759, "rewards/total_composite/mean": 0.6761964559555054, "rewards/total_composite/std": 0.29238972067832947, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0108050107955933, "sampling/importance_sampling_ratio/min": 0.16547901928424835, "sampling/sampling_logp_difference/max": 1.7989108562469482, "sampling/sampling_logp_difference/mean": 0.06298165768384933, "step": 583 }, { "clip_ratio/high_max": 0.05211255559697747, "clip_ratio/high_mean": 0.05211255559697747, "clip_ratio/low_mean": 0.02927643246948719, "clip_ratio/low_min": 0.02927643246948719, "clip_ratio/region_mean": 0.08138898806646466, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 67.0, "completions/mean_terminated_length": 67.0, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 1.1980116702616215, "epoch": 0.02255174544331171, "frac_reward_zero_std": 0.0, "grad_norm": 8.98315715789795, "learning_rate": 8.233333333333335e-06, "loss": 0.0272, "num_tokens": 1263178.0, "reward": 0.7797154188156128, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7797154188156128, "reward_meter_std": 0.2954230308532715, "reward_std": 0.29542306065559387, "reward_total_composite_mean": 0.7797154188156128, "reward_total_composite_std": 0.2954230308532715, "reward_total_mean": 0.7797154188156128, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7797154188156128, "rewards/meter/std": 0.2954230308532715, "rewards/total_composite/mean": 0.7797154188156128, "rewards/total_composite/std": 0.2954230308532715, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0329049825668335, "sampling/importance_sampling_ratio/min": 0.3161243200302124, "sampling/sampling_logp_difference/max": 1.1516196727752686, "sampling/sampling_logp_difference/mean": 0.10191215574741364, "step": 584 }, { "clip_ratio/high_max": 0.05925852665677667, "clip_ratio/high_mean": 0.05925852665677667, "clip_ratio/low_mean": 0.019736841320991516, "clip_ratio/low_min": 0.019736841320991516, "clip_ratio/region_mean": 0.07899536797776818, "completions/clipped_ratio": 0.0, "completions/max_length": 61.0, "completions/max_terminated_length": 61.0, "completions/mean_length": 55.5, "completions/mean_terminated_length": 55.5, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.8991814702749252, "epoch": 0.022590361445783132, "frac_reward_zero_std": 0.0, "grad_norm": 10.492538452148438, "learning_rate": 8.23030303030303e-06, "loss": 0.0176, "num_tokens": 1264918.0, "reward": 0.8827799558639526, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8827799558639526, "reward_meter_std": 0.28730660676956177, "reward_std": 0.28730660676956177, "reward_total_composite_mean": 0.8827799558639526, "reward_total_composite_std": 0.28730660676956177, "reward_total_mean": 0.8827799558639526, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8827799558639526, "rewards/meter/std": 0.28730660676956177, "rewards/total_composite/mean": 0.8827799558639526, "rewards/total_composite/std": 0.28730660676956177, "sampling/importance_sampling_ratio/max": 1.7023773193359375, "sampling/importance_sampling_ratio/mean": 1.0217286348342896, "sampling/importance_sampling_ratio/min": 0.36261942982673645, "sampling/sampling_logp_difference/max": 1.0144014358520508, "sampling/sampling_logp_difference/mean": 0.08820638805627823, "step": 585 }, { "clip_ratio/high_max": 0.054413119331002235, "clip_ratio/high_mean": 0.054413119331002235, "clip_ratio/low_mean": 0.017296989914029837, "clip_ratio/low_min": 0.017296989914029837, "clip_ratio/region_mean": 0.07171010924503207, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 67.0, "completions/mean_terminated_length": 67.0, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.9242872335016727, "epoch": 0.022628977448254557, "frac_reward_zero_std": 0.0, "grad_norm": 5.471312999725342, "learning_rate": 8.227272727272728e-06, "loss": -0.0258, "num_tokens": 1266838.0, "reward": 0.9903906583786011, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9903906583786011, "reward_meter_std": 0.01108819991350174, "reward_std": 0.011088193394243717, "reward_total_composite_mean": 0.9903906583786011, "reward_total_composite_std": 0.01108819991350174, "reward_total_mean": 0.9903906583786011, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9903906583786011, "rewards/meter/std": 0.01108819991350174, "rewards/total_composite/mean": 0.9903906583786011, "rewards/total_composite/std": 0.01108819991350174, "sampling/importance_sampling_ratio/max": 1.8207906484603882, "sampling/importance_sampling_ratio/mean": 1.0199015140533447, "sampling/importance_sampling_ratio/min": 0.4516042470932007, "sampling/sampling_logp_difference/max": 0.7949490547180176, "sampling/sampling_logp_difference/mean": 0.08893144875764847, "step": 586 }, { "clip_ratio/high_max": 0.05832049483433366, "clip_ratio/high_mean": 0.05832049483433366, "clip_ratio/low_mean": 0.04157197009772062, "clip_ratio/low_min": 0.04157197009772062, "clip_ratio/region_mean": 0.09989246493205428, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 61.25, "completions/mean_terminated_length": 61.25, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.9658423773944378, "epoch": 0.02266759345072598, "frac_reward_zero_std": 0.0, "grad_norm": 9.306632995605469, "learning_rate": 8.224242424242425e-06, "loss": 0.0326, "num_tokens": 1268600.0, "reward": 0.7887836694717407, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7887836694717407, "reward_meter_std": 0.31874561309814453, "reward_std": 0.3187456429004669, "reward_total_composite_mean": 0.7887836694717407, "reward_total_composite_std": 0.31874561309814453, "reward_total_mean": 0.7887836694717407, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7887836694717407, "rewards/meter/std": 0.31874561309814453, "rewards/total_composite/mean": 0.7887836694717407, "rewards/total_composite/std": 0.31874561309814453, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0263839960098267, "sampling/importance_sampling_ratio/min": 0.23777316510677338, "sampling/sampling_logp_difference/max": 1.4364380836486816, "sampling/sampling_logp_difference/mean": 0.10599493235349655, "step": 587 }, { "clip_ratio/high_max": 0.02804773487150669, "clip_ratio/high_mean": 0.02804773487150669, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.02804773487150669, "completions/clipped_ratio": 0.5, "completions/max_length": 512.0, "completions/max_terminated_length": 301.0, "completions/mean_length": 390.625, "completions/mean_terminated_length": 269.25, "completions/min_length": 229.0, "completions/min_terminated_length": 229.0, "entropy": 0.43688641488552094, "epoch": 0.022706209453197405, "frac_reward_zero_std": 0.0, "grad_norm": 1.4397287368774414, "learning_rate": 8.221212121212122e-06, "loss": -0.2794, "num_tokens": 1271261.0, "reward": 0.5204770565032959, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.5249999761581421, "reward_count_adherence_std": 0.2815771996974945, "reward_meter_mean": 0.9679808616638184, "reward_meter_std": 0.08165019750595093, "reward_std": 0.28585320711135864, "reward_total_composite_mean": 0.5204770565032959, "reward_total_composite_std": 0.28585317730903625, "reward_total_mean": 0.5204770565032959, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.5249999761581421, "rewards/count_adherence/std": 0.2815771996974945, "rewards/meter/mean": 0.9679808616638184, "rewards/meter/std": 0.08165019750595093, "rewards/total_composite/mean": 0.5204770565032959, "rewards/total_composite/std": 0.28585317730903625, "sampling/importance_sampling_ratio/max": 1.7755378484725952, "sampling/importance_sampling_ratio/mean": 1.0239464044570923, "sampling/importance_sampling_ratio/min": 0.22953523695468903, "sampling/sampling_logp_difference/max": 1.4716987609863281, "sampling/sampling_logp_difference/mean": 0.08885669708251953, "step": 588 }, { "clip_ratio/high_max": 0.0018656715983524919, "clip_ratio/high_mean": 0.0018656715983524919, "clip_ratio/low_mean": 0.03957205289043486, "clip_ratio/low_min": 0.03957205289043486, "clip_ratio/region_mean": 0.04143772448878735, "completions/clipped_ratio": 0.0, "completions/max_length": 134.0, "completions/max_terminated_length": 134.0, "completions/mean_length": 105.75, "completions/mean_terminated_length": 105.75, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "entropy": 0.2631940208375454, "epoch": 0.02274482545566883, "frac_reward_zero_std": 0.0, "grad_norm": 4.359503269195557, "learning_rate": 8.21818181818182e-06, "loss": -0.0798, "num_tokens": 1273507.0, "reward": 0.7688436508178711, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.9854410886764526, "reward_meter_std": 0.019673505797982216, "reward_std": 0.07495999336242676, "reward_total_composite_mean": 0.7688436508178711, "reward_total_composite_std": 0.07496000826358795, "reward_total_mean": 0.7688436508178711, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.9854410886764526, "rewards/meter/std": 0.019673505797982216, "rewards/total_composite/mean": 0.7688436508178711, "rewards/total_composite/std": 0.07496000826358795, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0047855377197266, "sampling/importance_sampling_ratio/min": 0.2658828794956207, "sampling/sampling_logp_difference/max": 1.3246994018554688, "sampling/sampling_logp_difference/mean": 0.039897385984659195, "step": 589 }, { "clip_ratio/high_max": 0.029261499643325806, "clip_ratio/high_mean": 0.029261499643325806, "clip_ratio/low_mean": 0.0037128713447600603, "clip_ratio/low_min": 0.0037128713447600603, "clip_ratio/region_mean": 0.032974370988085866, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 170.375, "completions/mean_terminated_length": 121.5714340209961, "completions/min_length": 101.0, "completions/min_terminated_length": 101.0, "entropy": 0.2874904926866293, "epoch": 0.022783441458140253, "frac_reward_zero_std": 0.0, "grad_norm": 1.4748144149780273, "learning_rate": 8.215151515151517e-06, "loss": -0.1856, "num_tokens": 1275902.0, "reward": 0.6351298093795776, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2314550280570984, "reward_meter_mean": 0.795690655708313, "reward_meter_std": 0.37391647696495056, "reward_std": 0.378958523273468, "reward_total_composite_mean": 0.6351298093795776, "reward_total_composite_std": 0.378958523273468, "reward_total_mean": 0.6351298093795776, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2314550280570984, "rewards/meter/mean": 0.795690655708313, "rewards/meter/std": 0.37391647696495056, "rewards/total_composite/mean": 0.6351298093795776, "rewards/total_composite/std": 0.378958523273468, "sampling/importance_sampling_ratio/max": 1.574059009552002, "sampling/importance_sampling_ratio/mean": 1.005539059638977, "sampling/importance_sampling_ratio/min": 0.35161903500556946, "sampling/sampling_logp_difference/max": 1.0452070236206055, "sampling/sampling_logp_difference/mean": 0.03722504526376724, "step": 590 }, { "clip_ratio/high_max": 0.05741901881992817, "clip_ratio/high_mean": 0.05741901881992817, "clip_ratio/low_mean": 0.08319734176620841, "clip_ratio/low_min": 0.08319734176620841, "clip_ratio/region_mean": 0.14061636058613658, "completions/clipped_ratio": 0.0, "completions/max_length": 45.0, "completions/max_terminated_length": 45.0, "completions/mean_length": 40.5, "completions/mean_terminated_length": 40.5, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 1.7381385117769241, "epoch": 0.022822057460611677, "frac_reward_zero_std": 0.0, "grad_norm": 14.161763191223145, "learning_rate": 8.212121212121212e-06, "loss": 0.0618, "num_tokens": 1277586.0, "reward": 0.5279456377029419, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5279456377029419, "reward_meter_std": 0.370597779750824, "reward_std": 0.370597779750824, "reward_total_composite_mean": 0.5279456377029419, "reward_total_composite_std": 0.370597779750824, "reward_total_mean": 0.5279456377029419, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5279456377029419, "rewards/meter/std": 0.370597779750824, "rewards/total_composite/mean": 0.5279456377029419, "rewards/total_composite/std": 0.370597779750824, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0325664281845093, "sampling/importance_sampling_ratio/min": 0.31123626232147217, "sampling/sampling_logp_difference/max": 1.1672029495239258, "sampling/sampling_logp_difference/mean": 0.17503851652145386, "step": 591 }, { "clip_ratio/high_max": 0.010578885208815336, "clip_ratio/high_mean": 0.010578885208815336, "clip_ratio/low_mean": 0.0036123525351285934, "clip_ratio/low_min": 0.0036123525351285934, "clip_ratio/region_mean": 0.01419123774394393, "completions/clipped_ratio": 0.0, "completions/max_length": 428.0, "completions/max_terminated_length": 428.0, "completions/mean_length": 389.0, "completions/mean_terminated_length": 389.0, "completions/min_length": 360.0, "completions/min_terminated_length": 360.0, "entropy": 0.12590192956849933, "epoch": 0.0228606734630831, "frac_reward_zero_std": 0.0, "grad_norm": 1.401776909828186, "learning_rate": 8.20909090909091e-06, "loss": -0.0262, "num_tokens": 1282466.0, "reward": 0.5704156160354614, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.5723684430122375, "reward_count_adherence_std": 0.05215953662991524, "reward_meter_mean": 0.9966329336166382, "reward_meter_std": 0.0009374520741403103, "reward_std": 0.05163882300257683, "reward_total_composite_mean": 0.5704156160354614, "reward_total_composite_std": 0.05163882300257683, "reward_total_mean": 0.5704156160354614, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.5723684430122375, "rewards/count_adherence/std": 0.05215953662991524, "rewards/meter/mean": 0.9966329336166382, "rewards/meter/std": 0.0009374520741403103, "rewards/total_composite/mean": 0.5704156160354614, "rewards/total_composite/std": 0.05163882300257683, "sampling/importance_sampling_ratio/max": 1.6324708461761475, "sampling/importance_sampling_ratio/mean": 1.001259446144104, "sampling/importance_sampling_ratio/min": 0.21806199848651886, "sampling/sampling_logp_difference/max": 1.5229759216308594, "sampling/sampling_logp_difference/mean": 0.017461512237787247, "step": 592 }, { "clip_ratio/high_max": 0.06137674581259489, "clip_ratio/high_mean": 0.06137674581259489, "clip_ratio/low_mean": 0.003846153849735856, "clip_ratio/low_min": 0.003846153849735856, "clip_ratio/region_mean": 0.06522289966233075, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 62.375, "completions/mean_terminated_length": 62.375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.5911059454083443, "epoch": 0.022899289465554525, "frac_reward_zero_std": 0.0, "grad_norm": 7.278051853179932, "learning_rate": 8.206060606060607e-06, "loss": 0.0288, "num_tokens": 1284101.0, "reward": 0.8718899488449097, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8718899488449097, "reward_meter_std": 0.3202956020832062, "reward_std": 0.3202956020832062, "reward_total_composite_mean": 0.8718899488449097, "reward_total_composite_std": 0.3202956020832062, "reward_total_mean": 0.8718899488449097, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8718899488449097, "rewards/meter/std": 0.3202956020832062, "rewards/total_composite/mean": 0.8718899488449097, "rewards/total_composite/std": 0.3202956020832062, "sampling/importance_sampling_ratio/max": 1.7530381679534912, "sampling/importance_sampling_ratio/mean": 1.0134860277175903, "sampling/importance_sampling_ratio/min": 0.23351548612117767, "sampling/sampling_logp_difference/max": 1.4545068740844727, "sampling/sampling_logp_difference/mean": 0.06579845398664474, "step": 593 }, { "clip_ratio/high_max": 0.029324828181415796, "clip_ratio/high_mean": 0.029324828181415796, "clip_ratio/low_mean": 0.004878048785030842, "clip_ratio/low_min": 0.004878048785030842, "clip_ratio/region_mean": 0.03420287696644664, "completions/clipped_ratio": 0.0, "completions/max_length": 234.0, "completions/max_terminated_length": 234.0, "completions/mean_length": 221.75, "completions/mean_terminated_length": 221.75, "completions/min_length": 195.0, "completions/min_terminated_length": 195.0, "entropy": 0.49583121575415134, "epoch": 0.02293790546802595, "frac_reward_zero_std": 0.0, "grad_norm": 4.129243850708008, "learning_rate": 8.203030303030304e-06, "loss": -0.0155, "num_tokens": 1287579.0, "reward": 0.7827649116516113, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.06613000482320786, "reward_meter_mean": 0.9475843906402588, "reward_meter_std": 0.13766330480575562, "reward_std": 0.32273048162460327, "reward_total_composite_mean": 0.7827649116516113, "reward_total_composite_std": 0.32273051142692566, "reward_total_mean": 0.7827649116516113, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.06613000482320786, "rewards/meter/mean": 0.9475843906402588, "rewards/meter/std": 0.13766330480575562, "rewards/total_composite/mean": 0.7827649116516113, "rewards/total_composite/std": 0.32273051142692566, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0077857971191406, "sampling/importance_sampling_ratio/min": 0.21689140796661377, "sampling/sampling_logp_difference/max": 1.5283584594726562, "sampling/sampling_logp_difference/mean": 0.05360095202922821, "step": 594 }, { "clip_ratio/high_max": 0.014449786627665162, "clip_ratio/high_mean": 0.014449786627665162, "clip_ratio/low_mean": 0.012580781243741512, "clip_ratio/low_min": 0.012580781243741512, "clip_ratio/region_mean": 0.027030567871406674, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 69.375, "completions/mean_terminated_length": 69.375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.2160019911825657, "epoch": 0.022976521470497373, "frac_reward_zero_std": 0.0, "grad_norm": 5.483264446258545, "learning_rate": 8.2e-06, "loss": -0.0029, "num_tokens": 1289294.0, "reward": 0.825728178024292, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.825728178024292, "reward_meter_std": 0.15038101375102997, "reward_std": 0.15038102865219116, "reward_total_composite_mean": 0.825728178024292, "reward_total_composite_std": 0.15038101375102997, "reward_total_mean": 0.825728178024292, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.825728178024292, "rewards/meter/std": 0.15038101375102997, "rewards/total_composite/mean": 0.825728178024292, "rewards/total_composite/std": 0.15038101375102997, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0042104721069336, "sampling/importance_sampling_ratio/min": 0.12377584725618362, "sampling/sampling_logp_difference/max": 2.089282989501953, "sampling/sampling_logp_difference/mean": 0.043961603194475174, "step": 595 }, { "clip_ratio/high_max": 0.015763025381602347, "clip_ratio/high_mean": 0.015763025381602347, "clip_ratio/low_mean": 0.005905511789023876, "clip_ratio/low_min": 0.005905511789023876, "clip_ratio/region_mean": 0.021668537170626223, "completions/clipped_ratio": 0.0, "completions/max_length": 127.0, "completions/max_terminated_length": 127.0, "completions/mean_length": 119.875, "completions/mean_terminated_length": 119.875, "completions/min_length": 114.0, "completions/min_terminated_length": 114.0, "entropy": 0.1262477389536798, "epoch": 0.023015137472968798, "frac_reward_zero_std": 0.0, "grad_norm": 4.874330520629883, "learning_rate": 8.196969696969698e-06, "loss": 0.0213, "num_tokens": 1291573.0, "reward": 0.9766520857810974, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9766520857810974, "reward_meter_std": 0.04947783052921295, "reward_std": 0.04947783797979355, "reward_total_composite_mean": 0.9766520857810974, "reward_total_composite_std": 0.04947783052921295, "reward_total_mean": 0.9766520857810974, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9766520857810974, "rewards/meter/std": 0.04947783052921295, "rewards/total_composite/mean": 0.9766520857810974, "rewards/total_composite/std": 0.04947783052921295, "sampling/importance_sampling_ratio/max": 1.7739815711975098, "sampling/importance_sampling_ratio/mean": 1.0042794942855835, "sampling/importance_sampling_ratio/min": 0.25463753938674927, "sampling/sampling_logp_difference/max": 1.3679141998291016, "sampling/sampling_logp_difference/mean": 0.02237871289253235, "step": 596 }, { "clip_ratio/high_max": 0.037429331336170435, "clip_ratio/high_mean": 0.037429331336170435, "clip_ratio/low_mean": 0.01575682358816266, "clip_ratio/low_min": 0.01575682358816266, "clip_ratio/region_mean": 0.053186154924333096, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 62.25, "completions/mean_terminated_length": 62.25, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.4781202729791403, "epoch": 0.02305375347544022, "frac_reward_zero_std": 0.0, "grad_norm": 10.373922348022461, "learning_rate": 8.193939393939394e-06, "loss": 0.0304, "num_tokens": 1293343.0, "reward": 0.7612351775169373, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7612351775169373, "reward_meter_std": 0.35920435190200806, "reward_std": 0.35920435190200806, "reward_total_composite_mean": 0.7612351775169373, "reward_total_composite_std": 0.35920435190200806, "reward_total_mean": 0.7612351775169373, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7612351775169373, "rewards/meter/std": 0.35920435190200806, "rewards/total_composite/mean": 0.7612351775169373, "rewards/total_composite/std": 0.35920435190200806, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0154905319213867, "sampling/importance_sampling_ratio/min": 0.3465805947780609, "sampling/sampling_logp_difference/max": 1.0596399307250977, "sampling/sampling_logp_difference/mean": 0.0720410943031311, "step": 597 }, { "clip_ratio/high_max": 0.02251984179019928, "clip_ratio/high_mean": 0.02251984179019928, "clip_ratio/low_mean": 0.027435938362032175, "clip_ratio/low_min": 0.027435938362032175, "clip_ratio/region_mean": 0.049955780152231455, "completions/clipped_ratio": 0.0, "completions/max_length": 33.0, "completions/max_terminated_length": 33.0, "completions/mean_length": 29.0, "completions/mean_terminated_length": 29.0, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.44570457749068737, "epoch": 0.023092369477911646, "frac_reward_zero_std": 0.0, "grad_norm": 11.545695304870605, "learning_rate": 8.190909090909091e-06, "loss": 0.0542, "num_tokens": 1294775.0, "reward": 0.9914101958274841, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9914101958274841, "reward_meter_std": 0.00670025497674942, "reward_std": 0.006700248457491398, "reward_total_composite_mean": 0.9914101958274841, "reward_total_composite_std": 0.00670025497674942, "reward_total_mean": 0.9914101958274841, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9914101958274841, "rewards/meter/std": 0.00670025497674942, "rewards/total_composite/mean": 0.9914101958274841, "rewards/total_composite/std": 0.00670025497674942, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.004575490951538, "sampling/importance_sampling_ratio/min": 0.2126145362854004, "sampling/sampling_logp_difference/max": 1.5482743978500366, "sampling/sampling_logp_difference/mean": 0.06982678174972534, "step": 598 }, { "clip_ratio/high_max": 0.04812374617904425, "clip_ratio/high_mean": 0.04812374617904425, "clip_ratio/low_mean": 0.056075175292789936, "clip_ratio/low_min": 0.056075175292789936, "clip_ratio/region_mean": 0.10419892147183418, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 59.625, "completions/mean_terminated_length": 59.625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6933459341526031, "epoch": 0.02313098548038307, "frac_reward_zero_std": 0.0, "grad_norm": 11.035534858703613, "learning_rate": 8.187878787878788e-06, "loss": 0.0205, "num_tokens": 1296492.0, "reward": 0.7003433704376221, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7003433704376221, "reward_meter_std": 0.4035126864910126, "reward_std": 0.4035126864910126, "reward_total_composite_mean": 0.7003433704376221, "reward_total_composite_std": 0.4035126864910126, "reward_total_mean": 0.7003433704376221, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7003433704376221, "rewards/meter/std": 0.4035126864910126, "rewards/total_composite/mean": 0.7003433704376221, "rewards/total_composite/std": 0.4035126864910126, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.020950198173523, "sampling/importance_sampling_ratio/min": 0.22465747594833374, "sampling/sampling_logp_difference/max": 1.493178367614746, "sampling/sampling_logp_difference/mean": 0.09578597545623779, "step": 599 }, { "clip_ratio/high_max": 0.044667589012533426, "clip_ratio/high_mean": 0.044667589012533426, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.044667589012533426, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 128.5, "completions/mean_terminated_length": 73.71428680419922, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.5339640863239765, "epoch": 0.023169601482854494, "frac_reward_zero_std": 0.0, "grad_norm": 1.266343355178833, "learning_rate": 8.184848484848486e-06, "loss": -0.1774, "num_tokens": 1298416.0, "reward": 0.8710224628448486, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9104650616645813, "reward_meter_std": 0.24043236672878265, "reward_std": 0.3519781231880188, "reward_total_composite_mean": 0.8710224628448486, "reward_total_composite_std": 0.3519780933856964, "reward_total_mean": 0.8710224628448486, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9104650616645813, "rewards/meter/std": 0.24043236672878265, "rewards/total_composite/mean": 0.8710224628448486, "rewards/total_composite/std": 0.3519780933856964, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0156185626983643, "sampling/importance_sampling_ratio/min": 0.39828726649284363, "sampling/sampling_logp_difference/max": 0.9205818176269531, "sampling/sampling_logp_difference/mean": 0.07025135308504105, "step": 600 }, { "epoch": 0.023169601482854494, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/max_length": 382.61538461538464, "eval_completions/max_terminated_length": 339.2307692307692, "eval_completions/mean_length": 205.16346153846155, "eval_completions/mean_terminated_length": 186.50274892953726, "eval_completions/min_length": 58.92307692307692, "eval_completions/min_terminated_length": 58.92307692307692, "eval_entropy": 0.2500755110612282, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1298416.0, "eval_reward": 0.6174316452099726, "eval_reward_arabic_clean_mean": 0.9326923076923077, "eval_reward_arabic_clean_std": 0.13402181176038888, "eval_reward_count_adherence_mean": 0.9103590066616352, "eval_reward_count_adherence_std": 0.12672624450463515, "eval_reward_meter_mean": 0.6951331358689529, "eval_reward_meter_std": 0.4035135255410121, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.6174316452099726, "eval_reward_total_composite_std": 0.3925590217113495, "eval_reward_total_mean": 0.6174316452099726, "eval_rewards/arabic_clean/mean": 0.9326923076923077, "eval_rewards/arabic_clean/std": 0.13402181176038888, "eval_rewards/count_adherence/mean": 0.9103590066616352, "eval_rewards/count_adherence/std": 0.12672624450463515, "eval_rewards/meter/mean": 0.6951331358689529, "eval_rewards/meter/std": 0.4035135255410121, "eval_rewards/total_composite/mean": 0.6174316452099726, "eval_rewards/total_composite/std": 0.3925590217113495, "eval_runtime": 72.8099, "eval_samples_per_second": 1.428, "eval_sampling/importance_sampling_ratio/max": 1.4073029848245473, "eval_sampling/importance_sampling_ratio/mean": 1.0067635774612427, "eval_sampling/importance_sampling_ratio/min": 0.39233631583360523, "eval_sampling/sampling_logp_difference/max": 0.9544231708233173, "eval_sampling/sampling_logp_difference/mean": 0.023065941838117745, "eval_steps_per_second": 0.179, "step": 600 }, { "clip_ratio/high_max": 0.024640035582706332, "clip_ratio/high_mean": 0.024640035582706332, "clip_ratio/low_mean": 0.015199637040495872, "clip_ratio/low_min": 0.015199637040495872, "clip_ratio/region_mean": 0.039839672623202205, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 59.125, "completions/mean_terminated_length": 59.125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.31142993830144405, "epoch": 0.023208217485325918, "frac_reward_zero_std": 0.0, "grad_norm": 4.212752342224121, "learning_rate": 8.181818181818183e-06, "loss": -0.0232, "num_tokens": 1300265.0, "reward": 0.9931149482727051, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9931149482727051, "reward_meter_std": 0.003802346298471093, "reward_std": 0.0038023567758500576, "reward_total_composite_mean": 0.9931149482727051, "reward_total_composite_std": 0.003802346298471093, "reward_total_mean": 0.9931149482727051, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9931149482727051, "rewards/meter/std": 0.003802346298471093, "rewards/total_composite/mean": 0.9931149482727051, "rewards/total_composite/std": 0.003802346298471093, "sampling/importance_sampling_ratio/max": 1.6298530101776123, "sampling/importance_sampling_ratio/mean": 1.0037661790847778, "sampling/importance_sampling_ratio/min": 0.3451637029647827, "sampling/sampling_logp_difference/max": 1.0637364387512207, "sampling/sampling_logp_difference/mean": 0.03990501910448074, "step": 601 }, { "clip_ratio/high_max": 0.029445810709148645, "clip_ratio/high_mean": 0.029445810709148645, "clip_ratio/low_mean": 0.019871795549988747, "clip_ratio/low_min": 0.019871795549988747, "clip_ratio/region_mean": 0.04931760625913739, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 157.125, "completions/mean_terminated_length": 106.42857360839844, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "entropy": 0.3072041980922222, "epoch": 0.023246833487797342, "frac_reward_zero_std": 0.0, "grad_norm": 4.308811664581299, "learning_rate": 8.17878787878788e-06, "loss": -0.0699, "num_tokens": 1302514.0, "reward": 0.7166256308555603, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.2651650309562683, "reward_meter_mean": 0.803666353225708, "reward_meter_std": 0.3494153916835785, "reward_std": 0.3973376154899597, "reward_total_composite_mean": 0.7166256308555603, "reward_total_composite_std": 0.3973376154899597, "reward_total_mean": 0.7166256308555603, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/meter/mean": 0.803666353225708, "rewards/meter/std": 0.3494153916835785, "rewards/total_composite/mean": 0.7166256308555603, "rewards/total_composite/std": 0.3973376154899597, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0027865171432495, "sampling/importance_sampling_ratio/min": 0.14994479715824127, "sampling/sampling_logp_difference/max": 1.8974881172180176, "sampling/sampling_logp_difference/mean": 0.05126181244850159, "step": 602 }, { "clip_ratio/high_max": 0.027199887670576572, "clip_ratio/high_mean": 0.027199887670576572, "clip_ratio/low_mean": 0.006521739065647125, "clip_ratio/low_min": 0.006521739065647125, "clip_ratio/region_mean": 0.0337216267362237, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 129.0, "completions/mean_length": 165.75, "completions/mean_terminated_length": 116.28572082519531, "completions/min_length": 110.0, "completions/min_terminated_length": 110.0, "entropy": 0.19555421639233828, "epoch": 0.023285449490268766, "frac_reward_zero_std": 0.0, "grad_norm": 3.3487203121185303, "learning_rate": 8.175757575757577e-06, "loss": -0.1352, "num_tokens": 1304712.0, "reward": 0.7459595203399658, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.7495772838592529, "reward_meter_std": 0.4524652659893036, "reward_std": 0.45911717414855957, "reward_total_composite_mean": 0.7459595203399658, "reward_total_composite_std": 0.45911717414855957, "reward_total_mean": 0.7459595203399658, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.7495772838592529, "rewards/meter/std": 0.4524652659893036, "rewards/total_composite/mean": 0.7459595203399658, "rewards/total_composite/std": 0.45911717414855957, "sampling/importance_sampling_ratio/max": 1.7410459518432617, "sampling/importance_sampling_ratio/mean": 0.9969672560691833, "sampling/importance_sampling_ratio/min": 0.14971929788589478, "sampling/sampling_logp_difference/max": 1.8989930152893066, "sampling/sampling_logp_difference/mean": 0.034356024116277695, "step": 603 }, { "clip_ratio/high_max": 0.05441663879901171, "clip_ratio/high_mean": 0.05441663879901171, "clip_ratio/low_mean": 0.014390989672392607, "clip_ratio/low_min": 0.014390989672392607, "clip_ratio/region_mean": 0.06880762847140431, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 56.875, "completions/mean_terminated_length": 56.875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.8086119182407856, "epoch": 0.02332406549274019, "frac_reward_zero_std": 0.0, "grad_norm": 9.974048614501953, "learning_rate": 8.172727272727273e-06, "loss": 0.0446, "num_tokens": 1306447.0, "reward": 0.8660935163497925, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8660935163497925, "reward_meter_std": 0.2912440299987793, "reward_std": 0.2912440299987793, "reward_total_composite_mean": 0.8660935163497925, "reward_total_composite_std": 0.2912440299987793, "reward_total_mean": 0.8660935163497925, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8660935163497925, "rewards/meter/std": 0.2912440299987793, "rewards/total_composite/mean": 0.8660935163497925, "rewards/total_composite/std": 0.2912440299987793, "sampling/importance_sampling_ratio/max": 1.9299688339233398, "sampling/importance_sampling_ratio/mean": 1.023914098739624, "sampling/importance_sampling_ratio/min": 0.33213749527931213, "sampling/sampling_logp_difference/max": 1.1022062301635742, "sampling/sampling_logp_difference/mean": 0.09364975243806839, "step": 604 }, { "clip_ratio/high_max": 0.008479945652652532, "clip_ratio/high_mean": 0.008479945652652532, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.008479945652652532, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 256.0, "completions/mean_length": 282.25, "completions/mean_terminated_length": 249.4285888671875, "completions/min_length": 239.0, "completions/min_terminated_length": 239.0, "entropy": 0.12214899715036154, "epoch": 0.023362681495211614, "frac_reward_zero_std": 0.0, "grad_norm": 0.45873093605041504, "learning_rate": 8.16969696969697e-06, "loss": -0.2736, "num_tokens": 1309849.0, "reward": 0.8718953132629395, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9107142686843872, "reward_count_adherence_std": 0.25253814458847046, "reward_meter_mean": 0.9013054370880127, "reward_meter_std": 0.2691211402416229, "reward_std": 0.352304071187973, "reward_total_composite_mean": 0.8718953132629395, "reward_total_composite_std": 0.352304071187973, "reward_total_mean": 0.8718953132629395, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9107142686843872, "rewards/count_adherence/std": 0.25253814458847046, "rewards/meter/mean": 0.9013054370880127, "rewards/meter/std": 0.2691211402416229, "rewards/total_composite/mean": 0.8718953132629395, "rewards/total_composite/std": 0.352304071187973, "sampling/importance_sampling_ratio/max": 1.9584522247314453, "sampling/importance_sampling_ratio/mean": 1.0060789585113525, "sampling/importance_sampling_ratio/min": 0.36774441599845886, "sampling/sampling_logp_difference/max": 1.0003671646118164, "sampling/sampling_logp_difference/mean": 0.01991911418735981, "step": 605 }, { "clip_ratio/high_max": 0.007427771924994886, "clip_ratio/high_mean": 0.007427771924994886, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.007427771924994886, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 343.0, "completions/mean_length": 359.125, "completions/mean_terminated_length": 337.2857360839844, "completions/min_length": 323.0, "completions/min_terminated_length": 323.0, "entropy": 0.061391755007207394, "epoch": 0.02340129749768304, "frac_reward_zero_std": 0.0, "grad_norm": 0.30050450563430786, "learning_rate": 8.166666666666668e-06, "loss": -0.2859, "num_tokens": 1313978.0, "reward": 0.6420051455497742, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.644230842590332, "reward_count_adherence_std": 0.23236627876758575, "reward_meter_mean": 0.995347797870636, "reward_meter_std": 0.005631509702652693, "reward_std": 0.23203760385513306, "reward_total_composite_mean": 0.6420051455497742, "reward_total_composite_std": 0.23203761875629425, "reward_total_mean": 0.6420051455497742, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.644230842590332, "rewards/count_adherence/std": 0.23236627876758575, "rewards/meter/mean": 0.995347797870636, "rewards/meter/std": 0.005631509702652693, "rewards/total_composite/mean": 0.6420051455497742, "rewards/total_composite/std": 0.23203761875629425, "sampling/importance_sampling_ratio/max": 1.6662840843200684, "sampling/importance_sampling_ratio/mean": 1.0007063150405884, "sampling/importance_sampling_ratio/min": 0.37334179878234863, "sampling/sampling_logp_difference/max": 0.9852609634399414, "sampling/sampling_logp_difference/mean": 0.009540513157844543, "step": 606 }, { "clip_ratio/high_max": 0.00936650182120502, "clip_ratio/high_mean": 0.00936650182120502, "clip_ratio/low_mean": 0.01970675610937178, "clip_ratio/low_min": 0.01970675610937178, "clip_ratio/region_mean": 0.0290732579305768, "completions/clipped_ratio": 0.0, "completions/max_length": 175.0, "completions/max_terminated_length": 175.0, "completions/mean_length": 154.625, "completions/mean_terminated_length": 154.625, "completions/min_length": 135.0, "completions/min_terminated_length": 135.0, "entropy": 0.1557165440171957, "epoch": 0.023439913500154463, "frac_reward_zero_std": 0.0, "grad_norm": 3.355532169342041, "learning_rate": 8.163636363636365e-06, "loss": 0.0658, "num_tokens": 1316671.0, "reward": 0.4215872883796692, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.4418049454689026, "reward_meter_std": 0.4134439527988434, "reward_std": 0.38700950145721436, "reward_total_composite_mean": 0.4215872883796692, "reward_total_composite_std": 0.38700953125953674, "reward_total_mean": 0.4215872883796692, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.4418049454689026, "rewards/meter/std": 0.4134439527988434, "rewards/total_composite/mean": 0.4215872883796692, "rewards/total_composite/std": 0.38700953125953674, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0042226314544678, "sampling/importance_sampling_ratio/min": 0.1457909643650055, "sampling/sampling_logp_difference/max": 1.925581455230713, "sampling/sampling_logp_difference/mean": 0.03203287720680237, "step": 607 }, { "clip_ratio/high_max": 0.011494944454170763, "clip_ratio/high_mean": 0.011494944454170763, "clip_ratio/low_mean": 0.013556188903748989, "clip_ratio/low_min": 0.013556188903748989, "clip_ratio/region_mean": 0.025051133357919753, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 64.75, "completions/mean_terminated_length": 64.75, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.30151631124317646, "epoch": 0.023478529502625887, "frac_reward_zero_std": 0.0, "grad_norm": 6.676723957061768, "learning_rate": 8.16060606060606e-06, "loss": -0.0142, "num_tokens": 1318477.0, "reward": 0.6355655789375305, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6355655789375305, "reward_meter_std": 0.38601288199424744, "reward_std": 0.38601288199424744, "reward_total_composite_mean": 0.6355655789375305, "reward_total_composite_std": 0.38601288199424744, "reward_total_mean": 0.6355655789375305, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6355655789375305, "rewards/meter/std": 0.38601288199424744, "rewards/total_composite/mean": 0.6355655789375305, "rewards/total_composite/std": 0.38601288199424744, "sampling/importance_sampling_ratio/max": 1.405138373374939, "sampling/importance_sampling_ratio/mean": 1.007306694984436, "sampling/importance_sampling_ratio/min": 0.2254199981689453, "sampling/sampling_logp_difference/max": 1.4897899627685547, "sampling/sampling_logp_difference/mean": 0.03938113898038864, "step": 608 }, { "clip_ratio/high_max": 0.08979849983006716, "clip_ratio/high_mean": 0.08979849983006716, "clip_ratio/low_mean": 0.03448660718277097, "clip_ratio/low_min": 0.03448660718277097, "clip_ratio/region_mean": 0.12428510701283813, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 32.25, "completions/mean_terminated_length": 32.25, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 0.6633263751864433, "epoch": 0.02351714550509731, "frac_reward_zero_std": 0.0, "grad_norm": 11.4707612991333, "learning_rate": 8.15757575757576e-06, "loss": 0.0344, "num_tokens": 1320007.0, "reward": 0.9407675266265869, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9407675266265869, "reward_meter_std": 0.10082443803548813, "reward_std": 0.10082443803548813, "reward_total_composite_mean": 0.9407675266265869, "reward_total_composite_std": 0.10082443803548813, "reward_total_mean": 0.9407675266265869, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9407675266265869, "rewards/meter/std": 0.10082443803548813, "rewards/total_composite/mean": 0.9407675266265869, "rewards/total_composite/std": 0.10082443803548813, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0182549953460693, "sampling/importance_sampling_ratio/min": 0.16654972732067108, "sampling/sampling_logp_difference/max": 1.7924613952636719, "sampling/sampling_logp_difference/mean": 0.09047635644674301, "step": 609 }, { "clip_ratio/high_max": 0.023026442737318575, "clip_ratio/high_mean": 0.023026442737318575, "clip_ratio/low_mean": 0.019085082225501537, "clip_ratio/low_min": 0.019085082225501537, "clip_ratio/region_mean": 0.04211152496282011, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 123.75, "completions/mean_terminated_length": 68.28572082519531, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.6228674612939358, "epoch": 0.023555761507568735, "frac_reward_zero_std": 0.0, "grad_norm": 3.2543447017669678, "learning_rate": 8.154545454545455e-06, "loss": -0.0688, "num_tokens": 1321653.0, "reward": 0.547182559967041, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.5480015277862549, "reward_meter_std": 0.4364262819290161, "reward_std": 0.43759211897850037, "reward_total_composite_mean": 0.547182559967041, "reward_total_composite_std": 0.43759214878082275, "reward_total_mean": 0.547182559967041, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.5480015277862549, "rewards/meter/std": 0.4364262819290161, "rewards/total_composite/mean": 0.547182559967041, "rewards/total_composite/std": 0.43759214878082275, "sampling/importance_sampling_ratio/max": 1.6886634826660156, "sampling/importance_sampling_ratio/mean": 1.0165828466415405, "sampling/importance_sampling_ratio/min": 0.32916250824928284, "sampling/sampling_logp_difference/max": 1.111203670501709, "sampling/sampling_logp_difference/mean": 0.08188275992870331, "step": 610 }, { "clip_ratio/high_max": 0.01991767482832074, "clip_ratio/high_mean": 0.01991767482832074, "clip_ratio/low_mean": 0.012284422758966684, "clip_ratio/low_min": 0.012284422758966684, "clip_ratio/region_mean": 0.032202097587287426, "completions/clipped_ratio": 0.0, "completions/max_length": 33.0, "completions/max_terminated_length": 33.0, "completions/mean_length": 30.75, "completions/mean_terminated_length": 30.75, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.3008997645229101, "epoch": 0.02359437751004016, "frac_reward_zero_std": 0.0, "grad_norm": 6.743978023529053, "learning_rate": 8.151515151515152e-06, "loss": -0.011, "num_tokens": 1323107.0, "reward": 0.9942895174026489, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9942895174026489, "reward_meter_std": 0.001669783261604607, "reward_std": 0.001669783960096538, "reward_total_composite_mean": 0.9942895174026489, "reward_total_composite_std": 0.001669783261604607, "reward_total_mean": 0.9942895174026489, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9942895174026489, "rewards/meter/std": 0.001669783261604607, "rewards/total_composite/mean": 0.9942895174026489, "rewards/total_composite/std": 0.001669783261604607, "sampling/importance_sampling_ratio/max": 1.3152281045913696, "sampling/importance_sampling_ratio/mean": 1.0020709037780762, "sampling/importance_sampling_ratio/min": 0.16944730281829834, "sampling/sampling_logp_difference/max": 1.7752132415771484, "sampling/sampling_logp_difference/mean": 0.05331292748451233, "step": 611 }, { "clip_ratio/high_max": 0.038389022229239345, "clip_ratio/high_mean": 0.038389022229239345, "clip_ratio/low_mean": 0.008333333767950535, "clip_ratio/low_min": 0.008333333767950535, "clip_ratio/region_mean": 0.04672235599718988, "completions/clipped_ratio": 0.0, "completions/max_length": 62.0, "completions/max_terminated_length": 62.0, "completions/mean_length": 55.625, "completions/mean_terminated_length": 55.625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.5617792904376984, "epoch": 0.023632993512511583, "frac_reward_zero_std": 0.0, "grad_norm": 7.670464515686035, "learning_rate": 8.14848484848485e-06, "loss": 0.0336, "num_tokens": 1324792.0, "reward": 0.8599371910095215, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8599371910095215, "reward_meter_std": 0.3198857009410858, "reward_std": 0.31988564133644104, "reward_total_composite_mean": 0.8599371910095215, "reward_total_composite_std": 0.3198857009410858, "reward_total_mean": 0.8599371910095215, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8599371910095215, "rewards/meter/std": 0.3198857009410858, "rewards/total_composite/mean": 0.8599371910095215, "rewards/total_composite/std": 0.3198857009410858, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0190188884735107, "sampling/importance_sampling_ratio/min": 0.41206616163253784, "sampling/sampling_logp_difference/max": 0.9435205459594727, "sampling/sampling_logp_difference/mean": 0.06448192894458771, "step": 612 }, { "clip_ratio/high_max": 0.05149728851392865, "clip_ratio/high_mean": 0.05149728851392865, "clip_ratio/low_mean": 0.02302631549537182, "clip_ratio/low_min": 0.02302631549537182, "clip_ratio/region_mean": 0.07452360400930047, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 114.125, "completions/mean_terminated_length": 57.28571701049805, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 1.4391320049762726, "epoch": 0.023671609514983007, "frac_reward_zero_std": 0.0, "grad_norm": 3.4569411277770996, "learning_rate": 8.145454545454547e-06, "loss": -0.087, "num_tokens": 1326353.0, "reward": 0.6004748940467834, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.6199837923049927, "reward_meter_std": 0.4558931887149811, "reward_std": 0.48121726512908936, "reward_total_composite_mean": 0.6004748940467834, "reward_total_composite_std": 0.48121726512908936, "reward_total_mean": 0.6004748940467834, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.6199837923049927, "rewards/meter/std": 0.4558931887149811, "rewards/total_composite/mean": 0.6004748940467834, "rewards/total_composite/std": 0.48121726512908936, "sampling/importance_sampling_ratio/max": 1.9146498441696167, "sampling/importance_sampling_ratio/mean": 1.0191153287887573, "sampling/importance_sampling_ratio/min": 0.18310889601707458, "sampling/sampling_logp_difference/max": 1.69767427444458, "sampling/sampling_logp_difference/mean": 0.11160858720541, "step": 613 }, { "clip_ratio/high_max": 0.02200371865183115, "clip_ratio/high_mean": 0.02200371865183115, "clip_ratio/low_mean": 0.022413392609450966, "clip_ratio/low_min": 0.022413392609450966, "clip_ratio/region_mean": 0.044417111261282116, "completions/clipped_ratio": 0.0, "completions/max_length": 158.0, "completions/max_terminated_length": 158.0, "completions/mean_length": 122.625, "completions/mean_terminated_length": 122.625, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "entropy": 0.29260148853063583, "epoch": 0.02371022551745443, "frac_reward_zero_std": 0.0, "grad_norm": 5.5195722579956055, "learning_rate": 8.142424242424242e-06, "loss": -0.025, "num_tokens": 1328678.0, "reward": 0.48351413011550903, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_meter_mean": 0.5231146216392517, "reward_meter_std": 0.36290431022644043, "reward_std": 0.3324859142303467, "reward_total_composite_mean": 0.48351413011550903, "reward_total_composite_std": 0.3324858844280243, "reward_total_mean": 0.48351413011550903, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/meter/mean": 0.5231146216392517, "rewards/meter/std": 0.36290431022644043, "rewards/total_composite/mean": 0.48351413011550903, "rewards/total_composite/std": 0.3324858844280243, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0053133964538574, "sampling/importance_sampling_ratio/min": 0.047882918268442154, "sampling/sampling_logp_difference/max": 3.038996458053589, "sampling/sampling_logp_difference/mean": 0.05160455033183098, "step": 614 }, { "clip_ratio/high_max": 0.018577482085675, "clip_ratio/high_mean": 0.018577482085675, "clip_ratio/low_mean": 0.014563622185960412, "clip_ratio/low_min": 0.014563622185960412, "clip_ratio/region_mean": 0.03314110427163541, "completions/clipped_ratio": 0.0, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 105.25, "completions/mean_terminated_length": 105.25, "completions/min_length": 98.0, "completions/min_terminated_length": 98.0, "entropy": 0.42340752109885216, "epoch": 0.023748841519925856, "frac_reward_zero_std": 0.0, "grad_norm": 4.773278713226318, "learning_rate": 8.139393939393941e-06, "loss": 0.016, "num_tokens": 1330808.0, "reward": 0.7684873342514038, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7684873342514038, "reward_meter_std": 0.3484794795513153, "reward_std": 0.3484795093536377, "reward_total_composite_mean": 0.7684873342514038, "reward_total_composite_std": 0.3484794795513153, "reward_total_mean": 0.7684873342514038, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7684873342514038, "rewards/meter/std": 0.3484794795513153, "rewards/total_composite/mean": 0.7684873342514038, "rewards/total_composite/std": 0.3484794795513153, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.013346791267395, "sampling/importance_sampling_ratio/min": 0.3099987804889679, "sampling/sampling_logp_difference/max": 1.171186923980713, "sampling/sampling_logp_difference/mean": 0.054694000631570816, "step": 615 }, { "clip_ratio/high_max": 0.0064004448358900845, "clip_ratio/high_mean": 0.0064004448358900845, "clip_ratio/low_mean": 0.004212898784317076, "clip_ratio/low_min": 0.004212898784317076, "clip_ratio/region_mean": 0.01061334362020716, "completions/clipped_ratio": 0.0, "completions/max_length": 210.0, "completions/max_terminated_length": 210.0, "completions/mean_length": 198.75, "completions/mean_terminated_length": 198.75, "completions/min_length": 195.0, "completions/min_terminated_length": 195.0, "entropy": 0.05790994456037879, "epoch": 0.023787457522397283, "frac_reward_zero_std": 0.0, "grad_norm": 2.1530308723449707, "learning_rate": 8.136363636363637e-06, "loss": 0.0206, "num_tokens": 1333982.0, "reward": 0.9137976765632629, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9791666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_meter_mean": 0.9345196485519409, "reward_meter_std": 0.17161889374256134, "reward_std": 0.1733204573392868, "reward_total_composite_mean": 0.9137976765632629, "reward_total_composite_std": 0.1733204871416092, "reward_total_mean": 0.9137976765632629, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9791666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/meter/mean": 0.9345196485519409, "rewards/meter/std": 0.17161889374256134, "rewards/total_composite/mean": 0.9137976765632629, "rewards/total_composite/std": 0.1733204871416092, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0017095804214478, "sampling/importance_sampling_ratio/min": 0.30434298515319824, "sampling/sampling_logp_difference/max": 1.1895999908447266, "sampling/sampling_logp_difference/mean": 0.009508727118372917, "step": 616 }, { "clip_ratio/high_max": 0.013311688497196883, "clip_ratio/high_mean": 0.013311688497196883, "clip_ratio/low_mean": 0.026029597967863083, "clip_ratio/low_min": 0.026029597967863083, "clip_ratio/region_mean": 0.039341286465059966, "completions/clipped_ratio": 0.0, "completions/max_length": 456.0, "completions/max_terminated_length": 456.0, "completions/mean_length": 189.375, "completions/mean_terminated_length": 189.375, "completions/min_length": 137.0, "completions/min_terminated_length": 137.0, "entropy": 0.9195150500163436, "epoch": 0.023826073524868707, "frac_reward_zero_std": 0.0, "grad_norm": 3.8700666427612305, "learning_rate": 8.133333333333334e-06, "loss": 0.1404, "num_tokens": 1337009.0, "reward": 0.11995942890644073, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_meter_mean": 0.12910132110118866, "reward_meter_std": 0.23855595290660858, "reward_std": 0.22783413529396057, "reward_total_composite_mean": 0.11995942890644073, "reward_total_composite_std": 0.22783412039279938, "reward_total_mean": 0.11995942890644073, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/meter/mean": 0.12910132110118866, "rewards/meter/std": 0.23855595290660858, "rewards/total_composite/mean": 0.11995942890644073, "rewards/total_composite/std": 0.22783412039279938, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0223716497421265, "sampling/importance_sampling_ratio/min": 0.009397400543093681, "sampling/sampling_logp_difference/max": 4.667322158813477, "sampling/sampling_logp_difference/mean": 0.08845033496618271, "step": 617 }, { "clip_ratio/high_max": 0.031583026982843876, "clip_ratio/high_mean": 0.031583026982843876, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.031583026982843876, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 54.0, "completions/mean_length": 339.375, "completions/mean_terminated_length": 51.66666793823242, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.19933610782027245, "epoch": 0.02386468952734013, "frac_reward_zero_std": 0.0, "grad_norm": 0.84645676612854, "learning_rate": 8.130303030303031e-06, "loss": -0.0697, "num_tokens": 1338388.0, "reward": 0.37216296792030334, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_meter_mean": 0.5469461679458618, "reward_meter_std": 0.45063626766204834, "reward_std": 0.5076145529747009, "reward_total_composite_mean": 0.37216296792030334, "reward_total_composite_std": 0.5076146125793457, "reward_total_mean": 0.37216296792030334, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/meter/mean": 0.5469461679458618, "rewards/meter/std": 0.45063626766204834, "rewards/total_composite/mean": 0.37216296792030334, "rewards/total_composite/std": 0.5076146125793457, "sampling/importance_sampling_ratio/max": 1.5025615692138672, "sampling/importance_sampling_ratio/mean": 1.009710669517517, "sampling/importance_sampling_ratio/min": 0.24296501278877258, "sampling/sampling_logp_difference/max": 1.4148378372192383, "sampling/sampling_logp_difference/mean": 0.07076752930879593, "step": 618 }, { "clip_ratio/high_max": 0.0026461693923920393, "clip_ratio/high_mean": 0.0026461693923920393, "clip_ratio/low_mean": 0.014778794953599572, "clip_ratio/low_min": 0.014778794953599572, "clip_ratio/region_mean": 0.01742496434599161, "completions/clipped_ratio": 0.0, "completions/max_length": 96.0, "completions/max_terminated_length": 96.0, "completions/mean_length": 92.625, "completions/mean_terminated_length": 92.625, "completions/min_length": 90.0, "completions/min_terminated_length": 90.0, "entropy": 0.1813750467263162, "epoch": 0.023903305529811555, "frac_reward_zero_std": 0.0, "grad_norm": 4.1318182945251465, "learning_rate": 8.127272727272728e-06, "loss": -0.0004, "num_tokens": 1340369.0, "reward": 0.7933108806610107, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7933108806610107, "reward_meter_std": 0.2967395782470703, "reward_std": 0.2967395484447479, "reward_total_composite_mean": 0.7933108806610107, "reward_total_composite_std": 0.2967395782470703, "reward_total_mean": 0.7933108806610107, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7933108806610107, "rewards/meter/std": 0.2967395782470703, "rewards/total_composite/mean": 0.7933108806610107, "rewards/total_composite/std": 0.2967395782470703, "sampling/importance_sampling_ratio/max": 1.3991177082061768, "sampling/importance_sampling_ratio/mean": 1.001517415046692, "sampling/importance_sampling_ratio/min": 0.37277644872665405, "sampling/sampling_logp_difference/max": 0.9867763519287109, "sampling/sampling_logp_difference/mean": 0.026417352259159088, "step": 619 }, { "clip_ratio/high_max": 0.0851530022919178, "clip_ratio/high_mean": 0.0851530022919178, "clip_ratio/low_mean": 0.011140820104628801, "clip_ratio/low_min": 0.011140820104628801, "clip_ratio/region_mean": 0.0962938223965466, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/max_terminated_length": 36.0, "completions/mean_length": 33.875, "completions/mean_terminated_length": 33.875, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.5899157114326954, "epoch": 0.02394192153228298, "frac_reward_zero_std": 0.0, "grad_norm": 11.696823120117188, "learning_rate": 8.124242424242424e-06, "loss": 0.0358, "num_tokens": 1341808.0, "reward": 0.978384256362915, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.978384256362915, "reward_meter_std": 0.029845381155610085, "reward_std": 0.029845381155610085, "reward_total_composite_mean": 0.978384256362915, "reward_total_composite_std": 0.029845381155610085, "reward_total_mean": 0.978384256362915, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.978384256362915, "rewards/meter/std": 0.029845381155610085, "rewards/total_composite/mean": 0.978384256362915, "rewards/total_composite/std": 0.029845381155610085, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.007791519165039, "sampling/importance_sampling_ratio/min": 0.1091901957988739, "sampling/sampling_logp_difference/max": 2.2146639823913574, "sampling/sampling_logp_difference/mean": 0.11957071721553802, "step": 620 }, { "clip_ratio/high_max": 0.017727577593177557, "clip_ratio/high_mean": 0.017727577593177557, "clip_ratio/low_mean": 0.011628984240815043, "clip_ratio/low_min": 0.011628984240815043, "clip_ratio/region_mean": 0.0293565618339926, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 72.375, "completions/mean_terminated_length": 72.375, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.2109714262187481, "epoch": 0.023980537534754404, "frac_reward_zero_std": 0.0, "grad_norm": 4.917610168457031, "learning_rate": 8.121212121212121e-06, "loss": 0.034, "num_tokens": 1343571.0, "reward": 0.9518520832061768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9518520832061768, "reward_meter_std": 0.032847389578819275, "reward_std": 0.032847389578819275, "reward_total_composite_mean": 0.9518520832061768, "reward_total_composite_std": 0.032847389578819275, "reward_total_mean": 0.9518520832061768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9518520832061768, "rewards/meter/std": 0.032847389578819275, "rewards/total_composite/mean": 0.9518520832061768, "rewards/total_composite/std": 0.032847389578819275, "sampling/importance_sampling_ratio/max": 1.9684488773345947, "sampling/importance_sampling_ratio/mean": 1.0048478841781616, "sampling/importance_sampling_ratio/min": 0.06061416491866112, "sampling/sampling_logp_difference/max": 2.8032267093658447, "sampling/sampling_logp_difference/mean": 0.04176875576376915, "step": 621 }, { "clip_ratio/high_max": 0.03944407729431987, "clip_ratio/high_mean": 0.03944407729431987, "clip_ratio/low_mean": 0.0062500000931322575, "clip_ratio/low_min": 0.0062500000931322575, "clip_ratio/region_mean": 0.045694077387452126, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 113.125, "completions/mean_terminated_length": 56.142860412597656, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.4394574910402298, "epoch": 0.024019153537225828, "frac_reward_zero_std": 0.0, "grad_norm": 1.2342267036437988, "learning_rate": 8.118181818181819e-06, "loss": -0.1456, "num_tokens": 1345212.0, "reward": 0.8246999979019165, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8251349329948425, "reward_meter_std": 0.3412078320980072, "reward_std": 0.342404842376709, "reward_total_composite_mean": 0.8246999979019165, "reward_total_composite_std": 0.342404842376709, "reward_total_mean": 0.8246999979019165, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8251349329948425, "rewards/meter/std": 0.3412078320980072, "rewards/total_composite/mean": 0.8246999979019165, "rewards/total_composite/std": 0.342404842376709, "sampling/importance_sampling_ratio/max": 1.750449538230896, "sampling/importance_sampling_ratio/mean": 1.0137029886245728, "sampling/importance_sampling_ratio/min": 0.22795508801937103, "sampling/sampling_logp_difference/max": 1.4786067008972168, "sampling/sampling_logp_difference/mean": 0.07290157675743103, "step": 622 }, { "clip_ratio/high_max": 0.025720802485011518, "clip_ratio/high_mean": 0.025720802485011518, "clip_ratio/low_mean": 0.001623376621864736, "clip_ratio/low_min": 0.001623376621864736, "clip_ratio/region_mean": 0.027344179106876254, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 125.125, "completions/mean_terminated_length": 69.85714721679688, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.31833127327263355, "epoch": 0.024057769539697252, "frac_reward_zero_std": 0.0, "grad_norm": 1.7279670238494873, "learning_rate": 8.115151515151516e-06, "loss": -0.1006, "num_tokens": 1346949.0, "reward": 0.7471871376037598, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7928895950317383, "reward_meter_std": 0.3771921992301941, "reward_std": 0.4512399137020111, "reward_total_composite_mean": 0.7471871376037598, "reward_total_composite_std": 0.4512399435043335, "reward_total_mean": 0.7471871376037598, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7928895950317383, "rewards/meter/std": 0.3771921992301941, "rewards/total_composite/mean": 0.7471871376037598, "rewards/total_composite/std": 0.4512399435043335, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0057697296142578, "sampling/importance_sampling_ratio/min": 0.3635649085044861, "sampling/sampling_logp_difference/max": 1.0117974281311035, "sampling/sampling_logp_difference/mean": 0.050993990153074265, "step": 623 }, { "clip_ratio/high_max": 0.0006510416860692203, "clip_ratio/high_mean": 0.0006510416860692203, "clip_ratio/low_mean": 0.0013736264081671834, "clip_ratio/low_min": 0.0013736264081671834, "clip_ratio/region_mean": 0.0020246680942364037, "completions/clipped_ratio": 0.0, "completions/max_length": 192.0, "completions/max_terminated_length": 192.0, "completions/mean_length": 182.75, "completions/mean_terminated_length": 182.75, "completions/min_length": 181.0, "completions/min_terminated_length": 181.0, "entropy": 0.04385493486188352, "epoch": 0.024096385542168676, "frac_reward_zero_std": 0.0, "grad_norm": 2.252504825592041, "learning_rate": 8.112121212121213e-06, "loss": -0.0178, "num_tokens": 1350067.0, "reward": 0.9957711100578308, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9957711100578308, "reward_meter_std": 0.0014193379320204258, "reward_std": 0.0014193379320204258, "reward_total_composite_mean": 0.9957711100578308, "reward_total_composite_std": 0.0014193379320204258, "reward_total_mean": 0.9957711100578308, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9957711100578308, "rewards/meter/std": 0.0014193379320204258, "rewards/total_composite/mean": 0.9957711100578308, "rewards/total_composite/std": 0.0014193379320204258, "sampling/importance_sampling_ratio/max": 1.406175971031189, "sampling/importance_sampling_ratio/mean": 1.0003677606582642, "sampling/importance_sampling_ratio/min": 0.5395426154136658, "sampling/sampling_logp_difference/max": 0.6170334815979004, "sampling/sampling_logp_difference/mean": 0.005115547217428684, "step": 624 }, { "clip_ratio/high_max": 0.00999945483636111, "clip_ratio/high_mean": 0.00999945483636111, "clip_ratio/low_mean": 0.005678939749486744, "clip_ratio/low_min": 0.005678939749486744, "clip_ratio/region_mean": 0.015678394585847855, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 288.0, "completions/mean_length": 297.0, "completions/mean_terminated_length": 266.2857360839844, "completions/min_length": 247.0, "completions/min_terminated_length": 247.0, "entropy": 0.09663973702117801, "epoch": 0.0241350015446401, "frac_reward_zero_std": 0.0, "grad_norm": 2.2000861167907715, "learning_rate": 8.10909090909091e-06, "loss": -0.1074, "num_tokens": 1353587.0, "reward": 0.4286315441131592, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9027777910232544, "reward_count_adherence_std": 0.03928370773792267, "reward_meter_mean": 0.5770298838615417, "reward_meter_std": 0.47208163142204285, "reward_std": 0.44896507263183594, "reward_total_composite_mean": 0.4286315441131592, "reward_total_composite_std": 0.44896507263183594, "reward_total_mean": 0.4286315441131592, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9027777910232544, "rewards/count_adherence/std": 0.03928370773792267, "rewards/meter/mean": 0.5770298838615417, "rewards/meter/std": 0.47208163142204285, "rewards/total_composite/mean": 0.4286315441131592, "rewards/total_composite/std": 0.44896507263183594, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0011159181594849, "sampling/importance_sampling_ratio/min": 0.22995755076408386, "sampling/sampling_logp_difference/max": 1.469860553741455, "sampling/sampling_logp_difference/mean": 0.021907327696681023, "step": 625 }, { "clip_ratio/high_max": 0.002810997946653515, "clip_ratio/high_mean": 0.002810997946653515, "clip_ratio/low_mean": 0.005793766817077994, "clip_ratio/low_min": 0.005793766817077994, "clip_ratio/region_mean": 0.00860476476373151, "completions/clipped_ratio": 0.0, "completions/max_length": 272.0, "completions/max_terminated_length": 272.0, "completions/mean_length": 258.25, "completions/mean_terminated_length": 258.25, "completions/min_length": 239.0, "completions/min_terminated_length": 239.0, "entropy": 0.08377446280792356, "epoch": 0.024173617547111524, "frac_reward_zero_std": 0.0, "grad_norm": 1.3433260917663574, "learning_rate": 8.106060606060606e-06, "loss": -0.0186, "num_tokens": 1357445.0, "reward": 0.9136239886283875, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.921875, "reward_count_adherence_std": 0.06469365209341049, "reward_meter_mean": 0.9910991787910461, "reward_meter_std": 0.006634681485593319, "reward_std": 0.06364713609218597, "reward_total_composite_mean": 0.9136239886283875, "reward_total_composite_std": 0.06364713609218597, "reward_total_mean": 0.9136239886283875, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.921875, "rewards/count_adherence/std": 0.06469365209341049, "rewards/meter/mean": 0.9910991787910461, "rewards/meter/std": 0.006634681485593319, "rewards/total_composite/mean": 0.9136239886283875, "rewards/total_composite/std": 0.06364713609218597, "sampling/importance_sampling_ratio/max": 1.596511960029602, "sampling/importance_sampling_ratio/mean": 1.0006234645843506, "sampling/importance_sampling_ratio/min": 0.2601662278175354, "sampling/sampling_logp_difference/max": 1.3464345932006836, "sampling/sampling_logp_difference/mean": 0.01168814580887556, "step": 626 }, { "clip_ratio/high_max": 0.04422784689813852, "clip_ratio/high_mean": 0.04422784689813852, "clip_ratio/low_mean": 0.010802469216287136, "clip_ratio/low_min": 0.010802469216287136, "clip_ratio/region_mean": 0.05503031611442566, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 175.25, "completions/mean_terminated_length": 63.0, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.9980961419641972, "epoch": 0.02421223354958295, "frac_reward_zero_std": 0.0, "grad_norm": 1.754539966583252, "learning_rate": 8.103030303030303e-06, "loss": -0.1003, "num_tokens": 1359055.0, "reward": 0.5797286033630371, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_meter_mean": 0.7318032383918762, "reward_meter_std": 0.3413369357585907, "reward_std": 0.4377219080924988, "reward_total_composite_mean": 0.5797286033630371, "reward_total_composite_std": 0.4377219080924988, "reward_total_mean": 0.5797286033630371, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/meter/mean": 0.7318032383918762, "rewards/meter/std": 0.3413369357585907, "rewards/total_composite/mean": 0.5797286033630371, "rewards/total_composite/std": 0.4377219080924988, "sampling/importance_sampling_ratio/max": 1.7900029420852661, "sampling/importance_sampling_ratio/mean": 1.012277603149414, "sampling/importance_sampling_ratio/min": 0.25523537397384644, "sampling/sampling_logp_difference/max": 1.3655691146850586, "sampling/sampling_logp_difference/mean": 0.11965037882328033, "step": 627 }, { "clip_ratio/high_max": 0.020865230937488377, "clip_ratio/high_mean": 0.020865230937488377, "clip_ratio/low_mean": 0.0069444444961845875, "clip_ratio/low_min": 0.0069444444961845875, "clip_ratio/region_mean": 0.027809675433672965, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 92.125, "completions/mean_terminated_length": 92.125, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "entropy": 0.19556331355124712, "epoch": 0.024250849552054372, "frac_reward_zero_std": 0.0, "grad_norm": 5.110913276672363, "learning_rate": 8.1e-06, "loss": 0.0687, "num_tokens": 1361096.0, "reward": 0.970349907875061, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.970349907875061, "reward_meter_std": 0.06832630932331085, "reward_std": 0.06832629442214966, "reward_total_composite_mean": 0.970349907875061, "reward_total_composite_std": 0.06832630932331085, "reward_total_mean": 0.970349907875061, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.970349907875061, "rewards/meter/std": 0.06832630932331085, "rewards/total_composite/mean": 0.970349907875061, "rewards/total_composite/std": 0.06832630932331085, "sampling/importance_sampling_ratio/max": 1.841081142425537, "sampling/importance_sampling_ratio/mean": 0.9971374273300171, "sampling/importance_sampling_ratio/min": 0.31275883316993713, "sampling/sampling_logp_difference/max": 1.1623228788375854, "sampling/sampling_logp_difference/mean": 0.02751935087144375, "step": 628 }, { "clip_ratio/high_max": 0.016275564790703356, "clip_ratio/high_mean": 0.016275564790703356, "clip_ratio/low_mean": 0.010869565419852734, "clip_ratio/low_min": 0.010869565419852734, "clip_ratio/region_mean": 0.02714513021055609, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 182.875, "completions/mean_terminated_length": 73.16667175292969, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.30349646881222725, "epoch": 0.024289465554525796, "frac_reward_zero_std": 0.0, "grad_norm": 0.993527352809906, "learning_rate": 8.096969696969698e-06, "loss": -0.1464, "num_tokens": 1362727.0, "reward": 0.662638783454895, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9057246446609497, "reward_meter_std": 0.21483053267002106, "reward_std": 0.46009397506713867, "reward_total_composite_mean": 0.662638783454895, "reward_total_composite_std": 0.46009400486946106, "reward_total_mean": 0.662638783454895, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9057246446609497, "rewards/meter/std": 0.21483053267002106, "rewards/total_composite/mean": 0.662638783454895, "rewards/total_composite/std": 0.46009400486946106, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0186997652053833, "sampling/importance_sampling_ratio/min": 0.46451571583747864, "sampling/sampling_logp_difference/max": 0.8761682510375977, "sampling/sampling_logp_difference/mean": 0.0446912907063961, "step": 629 }, { "clip_ratio/high_max": 0.04845884535461664, "clip_ratio/high_mean": 0.04845884535461664, "clip_ratio/low_mean": 0.00390625, "clip_ratio/low_min": 0.00390625, "clip_ratio/region_mean": 0.05236509535461664, "completions/clipped_ratio": 0.0, "completions/max_length": 64.0, "completions/max_terminated_length": 64.0, "completions/mean_length": 62.0, "completions/mean_terminated_length": 62.0, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.25993255618959665, "epoch": 0.02432808155699722, "frac_reward_zero_std": 0.0, "grad_norm": 8.351807594299316, "learning_rate": 8.093939393939395e-06, "loss": 0.0194, "num_tokens": 1364463.0, "reward": 0.9843227863311768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9843227863311768, "reward_meter_std": 0.027253830805420876, "reward_std": 0.027253834530711174, "reward_total_composite_mean": 0.9843227863311768, "reward_total_composite_std": 0.027253830805420876, "reward_total_mean": 0.9843227863311768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9843227863311768, "rewards/meter/std": 0.027253830805420876, "rewards/total_composite/mean": 0.9843227863311768, "rewards/total_composite/std": 0.027253830805420876, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0087597370147705, "sampling/importance_sampling_ratio/min": 0.24401849508285522, "sampling/sampling_logp_difference/max": 1.4105112552642822, "sampling/sampling_logp_difference/mean": 0.05221335589885712, "step": 630 }, { "clip_ratio/high_max": 0.011983279720880091, "clip_ratio/high_mean": 0.011983279720880091, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.011983279720880091, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 127.25, "completions/mean_terminated_length": 72.28572082519531, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.1889364793896675, "epoch": 0.024366697559468645, "frac_reward_zero_std": 0.0, "grad_norm": 0.8814429640769958, "learning_rate": 8.090909090909092e-06, "loss": -0.1755, "num_tokens": 1366217.0, "reward": 0.8639343976974487, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8845906257629395, "reward_meter_std": 0.2908637821674347, "reward_std": 0.3492541015148163, "reward_total_composite_mean": 0.8639343976974487, "reward_total_composite_std": 0.3492541015148163, "reward_total_mean": 0.8639343976974487, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8845906257629395, "rewards/meter/std": 0.2908637821674347, "rewards/total_composite/mean": 0.8639343976974487, "rewards/total_composite/std": 0.3492541015148163, "sampling/importance_sampling_ratio/max": 1.5585085153579712, "sampling/importance_sampling_ratio/mean": 1.006989598274231, "sampling/importance_sampling_ratio/min": 0.4087888300418854, "sampling/sampling_logp_difference/max": 0.8945565223693848, "sampling/sampling_logp_difference/mean": 0.028667865321040154, "step": 631 }, { "clip_ratio/high_max": 0.007443342707119882, "clip_ratio/high_mean": 0.007443342707119882, "clip_ratio/low_mean": 0.0009259259095415473, "clip_ratio/low_min": 0.0009259259095415473, "clip_ratio/region_mean": 0.00836926861666143, "completions/clipped_ratio": 0.0, "completions/max_length": 135.0, "completions/max_terminated_length": 135.0, "completions/mean_length": 111.0, "completions/mean_terminated_length": 111.0, "completions/min_length": 99.0, "completions/min_terminated_length": 99.0, "entropy": 0.07266335096210241, "epoch": 0.02440531356194007, "frac_reward_zero_std": 0.0, "grad_norm": 3.513773202896118, "learning_rate": 8.08787878787879e-06, "loss": 0.0991, "num_tokens": 1368537.0, "reward": 0.9886435270309448, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9886435270309448, "reward_meter_std": 0.0022036279551684856, "reward_std": 0.0022036198060959578, "reward_total_composite_mean": 0.9886435270309448, "reward_total_composite_std": 0.0022036279551684856, "reward_total_mean": 0.9886435270309448, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9886435270309448, "rewards/meter/std": 0.0022036279551684856, "rewards/total_composite/mean": 0.9886435270309448, "rewards/total_composite/std": 0.0022036279551684856, "sampling/importance_sampling_ratio/max": 1.52896249294281, "sampling/importance_sampling_ratio/mean": 1.0014369487762451, "sampling/importance_sampling_ratio/min": 0.39802050590515137, "sampling/sampling_logp_difference/max": 0.9212517142295837, "sampling/sampling_logp_difference/mean": 0.01080810371786356, "step": 632 }, { "clip_ratio/high_max": 0.022631968837231398, "clip_ratio/high_mean": 0.022631968837231398, "clip_ratio/low_mean": 0.0013020833721384406, "clip_ratio/low_min": 0.0013020833721384406, "clip_ratio/region_mean": 0.023934052209369838, "completions/clipped_ratio": 0.0, "completions/max_length": 96.0, "completions/max_terminated_length": 96.0, "completions/mean_length": 84.875, "completions/mean_terminated_length": 84.875, "completions/min_length": 81.0, "completions/min_terminated_length": 81.0, "entropy": 0.17416242323815823, "epoch": 0.024443929564411493, "frac_reward_zero_std": 0.0, "grad_norm": 3.3415863513946533, "learning_rate": 8.084848484848485e-06, "loss": 0.0485, "num_tokens": 1370640.0, "reward": 0.8842945098876953, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8842945098876953, "reward_meter_std": 0.31306833028793335, "reward_std": 0.31306830048561096, "reward_total_composite_mean": 0.8842945098876953, "reward_total_composite_std": 0.31306833028793335, "reward_total_mean": 0.8842945098876953, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8842945098876953, "rewards/meter/std": 0.31306833028793335, "rewards/total_composite/mean": 0.8842945098876953, "rewards/total_composite/std": 0.31306833028793335, "sampling/importance_sampling_ratio/max": 1.9100323915481567, "sampling/importance_sampling_ratio/mean": 1.005111813545227, "sampling/importance_sampling_ratio/min": 0.2329607456922531, "sampling/sampling_logp_difference/max": 1.4568853378295898, "sampling/sampling_logp_difference/mean": 0.02020621858537197, "step": 633 }, { "clip_ratio/high_max": 0.018129791948013008, "clip_ratio/high_mean": 0.018129791948013008, "clip_ratio/low_mean": 0.012231739703565836, "clip_ratio/low_min": 0.012231739703565836, "clip_ratio/region_mean": 0.030361531651578844, "completions/clipped_ratio": 0.0, "completions/max_length": 142.0, "completions/max_terminated_length": 142.0, "completions/mean_length": 126.25, "completions/mean_terminated_length": 126.25, "completions/min_length": 115.0, "completions/min_terminated_length": 115.0, "entropy": 0.20136078912764788, "epoch": 0.024482545566882917, "frac_reward_zero_std": 0.0, "grad_norm": 2.963343858718872, "learning_rate": 8.081818181818182e-06, "loss": 0.0184, "num_tokens": 1372994.0, "reward": 0.9853245615959167, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9853245615959167, "reward_meter_std": 0.021229863166809082, "reward_std": 0.02122986875474453, "reward_total_composite_mean": 0.9853245615959167, "reward_total_composite_std": 0.021229863166809082, "reward_total_mean": 0.9853245615959167, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9853245615959167, "rewards/meter/std": 0.021229863166809082, "rewards/total_composite/mean": 0.9853245615959167, "rewards/total_composite/std": 0.021229863166809082, "sampling/importance_sampling_ratio/max": 1.6705741882324219, "sampling/importance_sampling_ratio/mean": 1.0044063329696655, "sampling/importance_sampling_ratio/min": 0.3048539459705353, "sampling/sampling_logp_difference/max": 1.187922477722168, "sampling/sampling_logp_difference/mean": 0.027480771765112877, "step": 634 }, { "clip_ratio/high_max": 0.012339744134806097, "clip_ratio/high_mean": 0.012339744134806097, "clip_ratio/low_mean": 0.007863856852054596, "clip_ratio/low_min": 0.007863856852054596, "clip_ratio/region_mean": 0.020203600986860693, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 61.875, "completions/mean_terminated_length": 61.875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.11720475321635604, "epoch": 0.02452116156935434, "frac_reward_zero_std": 0.0, "grad_norm": 6.4878387451171875, "learning_rate": 8.07878787878788e-06, "loss": -0.0067, "num_tokens": 1374785.0, "reward": 0.9954343438148499, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9954343438148499, "reward_meter_std": 0.0015961348544806242, "reward_std": 0.0015961244935169816, "reward_total_composite_mean": 0.9954343438148499, "reward_total_composite_std": 0.0015961348544806242, "reward_total_mean": 0.9954343438148499, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9954343438148499, "rewards/meter/std": 0.0015961348544806242, "rewards/total_composite/mean": 0.9954343438148499, "rewards/total_composite/std": 0.0015961348544806242, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9988678693771362, "sampling/importance_sampling_ratio/min": 0.15966175496578217, "sampling/sampling_logp_difference/max": 1.8346977233886719, "sampling/sampling_logp_difference/mean": 0.0258852057158947, "step": 635 }, { "clip_ratio/high_max": 0.002884615445509553, "clip_ratio/high_mean": 0.002884615445509553, "clip_ratio/low_mean": 0.0020576479146257043, "clip_ratio/low_min": 0.0020576479146257043, "clip_ratio/region_mean": 0.004942263360135257, "completions/clipped_ratio": 0.0, "completions/max_length": 130.0, "completions/max_terminated_length": 130.0, "completions/mean_length": 122.25, "completions/mean_terminated_length": 122.25, "completions/min_length": 121.0, "completions/min_terminated_length": 121.0, "entropy": 0.03814642573706806, "epoch": 0.024559777571825765, "frac_reward_zero_std": 0.0, "grad_norm": 1.9705545902252197, "learning_rate": 8.075757575757577e-06, "loss": -0.0179, "num_tokens": 1377307.0, "reward": 0.9956600069999695, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9956600069999695, "reward_meter_std": 0.001489842776209116, "reward_std": 0.001489846152253449, "reward_total_composite_mean": 0.9956600069999695, "reward_total_composite_std": 0.001489842776209116, "reward_total_mean": 0.9956600069999695, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9956600069999695, "rewards/meter/std": 0.001489842776209116, "rewards/total_composite/mean": 0.9956600069999695, "rewards/total_composite/std": 0.001489842776209116, "sampling/importance_sampling_ratio/max": 1.2143502235412598, "sampling/importance_sampling_ratio/mean": 1.0008108615875244, "sampling/importance_sampling_ratio/min": 0.10169878602027893, "sampling/sampling_logp_difference/max": 2.2857398986816406, "sampling/sampling_logp_difference/mean": 0.0057179187424480915, "step": 636 }, { "clip_ratio/high_max": 0.010326079092919827, "clip_ratio/high_mean": 0.010326079092919827, "clip_ratio/low_mean": 0.003179112682119012, "clip_ratio/low_min": 0.003179112682119012, "clip_ratio/region_mean": 0.013505191775038838, "completions/clipped_ratio": 0.0, "completions/max_length": 138.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 123.5, "completions/mean_terminated_length": 123.5, "completions/min_length": 112.0, "completions/min_terminated_length": 112.0, "entropy": 0.18402807414531708, "epoch": 0.02459839357429719, "frac_reward_zero_std": 0.0, "grad_norm": 2.965711832046509, "learning_rate": 8.072727272727274e-06, "loss": 0.0233, "num_tokens": 1379671.0, "reward": 0.9958841800689697, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9958841800689697, "reward_meter_std": 0.0024583181366324425, "reward_std": 0.002458317205309868, "reward_total_composite_mean": 0.9958841800689697, "reward_total_composite_std": 0.0024583181366324425, "reward_total_mean": 0.9958841800689697, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9958841800689697, "rewards/meter/std": 0.0024583181366324425, "rewards/total_composite/mean": 0.9958841800689697, "rewards/total_composite/std": 0.0024583181366324425, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0019030570983887, "sampling/importance_sampling_ratio/min": 0.38929271697998047, "sampling/sampling_logp_difference/max": 0.9434237480163574, "sampling/sampling_logp_difference/mean": 0.027591824531555176, "step": 637 }, { "clip_ratio/high_max": 0.051263275323435664, "clip_ratio/high_mean": 0.051263275323435664, "clip_ratio/low_mean": 0.023809524718672037, "clip_ratio/low_min": 0.023809524718672037, "clip_ratio/region_mean": 0.0750728000421077, "completions/clipped_ratio": 0.0, "completions/max_length": 68.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 64.375, "completions/mean_terminated_length": 64.375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.5689874831587076, "epoch": 0.024637009576768613, "frac_reward_zero_std": 0.0, "grad_norm": 11.34463882446289, "learning_rate": 8.069696969696971e-06, "loss": -0.0238, "num_tokens": 1381546.0, "reward": 0.9862507581710815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9862507581710815, "reward_meter_std": 0.01588655635714531, "reward_std": 0.015886547043919563, "reward_total_composite_mean": 0.9862507581710815, "reward_total_composite_std": 0.01588655635714531, "reward_total_mean": 0.9862507581710815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9862507581710815, "rewards/meter/std": 0.01588655635714531, "rewards/total_composite/mean": 0.9862507581710815, "rewards/total_composite/std": 0.01588655635714531, "sampling/importance_sampling_ratio/max": 1.9803534746170044, "sampling/importance_sampling_ratio/mean": 1.005232810974121, "sampling/importance_sampling_ratio/min": 0.05610604211688042, "sampling/sampling_logp_difference/max": 2.88051176071167, "sampling/sampling_logp_difference/mean": 0.08512242883443832, "step": 638 }, { "clip_ratio/high_max": 0.026776819955557585, "clip_ratio/high_mean": 0.026776819955557585, "clip_ratio/low_mean": 0.015207641525194049, "clip_ratio/low_min": 0.015207641525194049, "clip_ratio/region_mean": 0.041984461480751634, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 74.75, "completions/mean_terminated_length": 74.75, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.3610265199095011, "epoch": 0.024675625579240038, "frac_reward_zero_std": 0.0, "grad_norm": 5.633913993835449, "learning_rate": 8.066666666666667e-06, "loss": -0.0012, "num_tokens": 1383384.0, "reward": 0.8388459086418152, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8388459086418152, "reward_meter_std": 0.19675958156585693, "reward_std": 0.19675958156585693, "reward_total_composite_mean": 0.8388459086418152, "reward_total_composite_std": 0.19675958156585693, "reward_total_mean": 0.8388459086418152, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8388459086418152, "rewards/meter/std": 0.19675958156585693, "rewards/total_composite/mean": 0.8388459086418152, "rewards/total_composite/std": 0.19675958156585693, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.998264491558075, "sampling/importance_sampling_ratio/min": 0.21954980492591858, "sampling/sampling_logp_difference/max": 1.5161762237548828, "sampling/sampling_logp_difference/mean": 0.05180966109037399, "step": 639 }, { "clip_ratio/high_max": 0.0054954917868599296, "clip_ratio/high_mean": 0.0054954917868599296, "clip_ratio/low_mean": 0.002071823226287961, "clip_ratio/low_min": 0.002071823226287961, "clip_ratio/region_mean": 0.007567315013147891, "completions/clipped_ratio": 0.0, "completions/max_length": 181.0, "completions/max_terminated_length": 181.0, "completions/mean_length": 162.25, "completions/mean_terminated_length": 162.25, "completions/min_length": 151.0, "completions/min_terminated_length": 151.0, "entropy": 0.01887570507824421, "epoch": 0.02471424158171146, "frac_reward_zero_std": 0.0, "grad_norm": 0.2766904830932617, "learning_rate": 8.063636363636364e-06, "loss": 0.0423, "num_tokens": 1386090.0, "reward": 0.970228910446167, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.9950998425483704, "reward_meter_std": 0.0002485640870872885, "reward_std": 0.0704522356390953, "reward_total_composite_mean": 0.970228910446167, "reward_total_composite_std": 0.0704522356390953, "reward_total_mean": 0.970228910446167, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.9950998425483704, "rewards/meter/std": 0.0002485640870872885, "rewards/total_composite/mean": 0.970228910446167, "rewards/total_composite/std": 0.0704522356390953, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0019837617874146, "sampling/importance_sampling_ratio/min": 0.07809732854366302, "sampling/sampling_logp_difference/max": 2.5497994422912598, "sampling/sampling_logp_difference/mean": 0.007383763324469328, "step": 640 }, { "clip_ratio/high_max": 0.025679388898424804, "clip_ratio/high_mean": 0.025679388898424804, "clip_ratio/low_mean": 0.012743587838485837, "clip_ratio/low_min": 0.012743587838485837, "clip_ratio/region_mean": 0.03842297673691064, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 76.75, "completions/mean_terminated_length": 76.75, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.1969589926302433, "epoch": 0.024752857584182886, "frac_reward_zero_std": 0.0, "grad_norm": 3.8018136024475098, "learning_rate": 8.060606060606061e-06, "loss": -0.0001, "num_tokens": 1387880.0, "reward": 0.9926354885101318, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9926354885101318, "reward_meter_std": 0.003230726346373558, "reward_std": 0.0032307212240993977, "reward_total_composite_mean": 0.9926354885101318, "reward_total_composite_std": 0.003230726346373558, "reward_total_mean": 0.9926354885101318, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9926354885101318, "rewards/meter/std": 0.003230726346373558, "rewards/total_composite/mean": 0.9926354885101318, "rewards/total_composite/std": 0.003230726346373558, "sampling/importance_sampling_ratio/max": 1.8937081098556519, "sampling/importance_sampling_ratio/mean": 1.0071512460708618, "sampling/importance_sampling_ratio/min": 0.37865278124809265, "sampling/sampling_logp_difference/max": 0.9711356163024902, "sampling/sampling_logp_difference/mean": 0.03708671033382416, "step": 641 }, { "clip_ratio/high_max": 0.053032459458336234, "clip_ratio/high_mean": 0.053032459458336234, "clip_ratio/low_mean": 0.012456294149160385, "clip_ratio/low_min": 0.012456294149160385, "clip_ratio/region_mean": 0.06548875360749662, "completions/clipped_ratio": 0.0, "completions/max_length": 47.0, "completions/max_terminated_length": 47.0, "completions/mean_length": 40.25, "completions/mean_terminated_length": 40.25, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.34129922464489937, "epoch": 0.02479147358665431, "frac_reward_zero_std": 0.0, "grad_norm": 10.998772621154785, "learning_rate": 8.057575757575759e-06, "loss": 0.0512, "num_tokens": 1389306.0, "reward": 0.9872698783874512, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9872698783874512, "reward_meter_std": 0.01214898843318224, "reward_std": 0.012148984707891941, "reward_total_composite_mean": 0.9872698783874512, "reward_total_composite_std": 0.01214898843318224, "reward_total_mean": 0.9872698783874512, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9872698783874512, "rewards/meter/std": 0.01214898843318224, "rewards/total_composite/mean": 0.9872698783874512, "rewards/total_composite/std": 0.01214898843318224, "sampling/importance_sampling_ratio/max": 1.8077318668365479, "sampling/importance_sampling_ratio/mean": 1.0039377212524414, "sampling/importance_sampling_ratio/min": 0.27446630597114563, "sampling/sampling_logp_difference/max": 1.2929267883300781, "sampling/sampling_logp_difference/mean": 0.0713094025850296, "step": 642 }, { "clip_ratio/high_max": 0.0059894436853937805, "clip_ratio/high_mean": 0.0059894436853937805, "clip_ratio/low_mean": 0.011697308160364628, "clip_ratio/low_min": 0.011697308160364628, "clip_ratio/region_mean": 0.01768675184575841, "completions/clipped_ratio": 0.0, "completions/max_length": 313.0, "completions/max_terminated_length": 313.0, "completions/mean_length": 246.375, "completions/mean_terminated_length": 246.375, "completions/min_length": 192.0, "completions/min_terminated_length": 192.0, "entropy": 0.11560235964134336, "epoch": 0.024830089589125734, "frac_reward_zero_std": 0.0, "grad_norm": 3.1086318492889404, "learning_rate": 8.054545454545454e-06, "loss": 0.11, "num_tokens": 1392997.0, "reward": 0.3722308278083801, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.930555522441864, "reward_count_adherence_std": 0.05750546231865883, "reward_meter_mean": 0.3895261585712433, "reward_meter_std": 0.42622098326683044, "reward_std": 0.41810813546180725, "reward_total_composite_mean": 0.3722308278083801, "reward_total_composite_std": 0.41810813546180725, "reward_total_mean": 0.3722308278083801, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.930555522441864, "rewards/count_adherence/std": 0.05750546231865883, "rewards/meter/mean": 0.3895261585712433, "rewards/meter/std": 0.42622098326683044, "rewards/total_composite/mean": 0.3722308278083801, "rewards/total_composite/std": 0.41810813546180725, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0075058937072754, "sampling/importance_sampling_ratio/min": 0.046687766909599304, "sampling/sampling_logp_difference/max": 3.0642731189727783, "sampling/sampling_logp_difference/mean": 0.02562355063855648, "step": 643 }, { "clip_ratio/high_max": 0.0217176906298846, "clip_ratio/high_mean": 0.0217176906298846, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0217176906298846, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 114.0, "completions/mean_terminated_length": 57.142860412597656, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.13272713590413332, "epoch": 0.024868705591597158, "frac_reward_zero_std": 0.0, "grad_norm": 0.7139359712600708, "learning_rate": 8.051515151515153e-06, "loss": -0.1547, "num_tokens": 1394733.0, "reward": 0.8692982196807861, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8798133134841919, "reward_meter_std": 0.321513295173645, "reward_std": 0.3512541353702545, "reward_total_composite_mean": 0.8692982196807861, "reward_total_composite_std": 0.3512541353702545, "reward_total_mean": 0.8692982196807861, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8798133134841919, "rewards/meter/std": 0.321513295173645, "rewards/total_composite/mean": 0.8692982196807861, "rewards/total_composite/std": 0.3512541353702545, "sampling/importance_sampling_ratio/max": 1.4886727333068848, "sampling/importance_sampling_ratio/mean": 0.9990324378013611, "sampling/importance_sampling_ratio/min": 0.2924591600894928, "sampling/sampling_logp_difference/max": 1.2294301986694336, "sampling/sampling_logp_difference/mean": 0.0238660741597414, "step": 644 }, { "clip_ratio/high_max": 0.008699847152456641, "clip_ratio/high_mean": 0.008699847152456641, "clip_ratio/low_mean": 0.007154436782002449, "clip_ratio/low_min": 0.007154436782002449, "clip_ratio/region_mean": 0.01585428393445909, "completions/clipped_ratio": 0.0, "completions/max_length": 134.0, "completions/max_terminated_length": 134.0, "completions/mean_length": 127.25, "completions/mean_terminated_length": 127.25, "completions/min_length": 119.0, "completions/min_terminated_length": 119.0, "entropy": 0.07990281283855438, "epoch": 0.024907321594068582, "frac_reward_zero_std": 0.0, "grad_norm": 2.8207523822784424, "learning_rate": 8.048484848484849e-06, "loss": -0.0075, "num_tokens": 1397215.0, "reward": 0.5935784578323364, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5935784578323364, "reward_meter_std": 0.49478766322135925, "reward_std": 0.49478766322135925, "reward_total_composite_mean": 0.5935784578323364, "reward_total_composite_std": 0.49478766322135925, "reward_total_mean": 0.5935784578323364, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5935784578323364, "rewards/meter/std": 0.49478766322135925, "rewards/total_composite/mean": 0.5935784578323364, "rewards/total_composite/std": 0.49478766322135925, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0039057731628418, "sampling/importance_sampling_ratio/min": 0.18896886706352234, "sampling/sampling_logp_difference/max": 1.666172981262207, "sampling/sampling_logp_difference/mean": 0.0225541889667511, "step": 645 }, { "clip_ratio/high_max": 0.012931034667417407, "clip_ratio/high_mean": 0.012931034667417407, "clip_ratio/low_mean": 0.015636918134987354, "clip_ratio/low_min": 0.015636918134987354, "clip_ratio/region_mean": 0.02856795280240476, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 172.75, "completions/mean_terminated_length": 59.66666793823242, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.23534639924764633, "epoch": 0.024945937596540006, "frac_reward_zero_std": 0.0, "grad_norm": 1.6291898488998413, "learning_rate": 8.045454545454546e-06, "loss": -0.0732, "num_tokens": 1399037.0, "reward": 0.49611878395080566, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.5550702810287476, "reward_meter_std": 0.4581260085105896, "reward_std": 0.49892619252204895, "reward_total_composite_mean": 0.49611878395080566, "reward_total_composite_std": 0.49892622232437134, "reward_total_mean": 0.49611878395080566, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.5550702810287476, "rewards/meter/std": 0.4581260085105896, "rewards/total_composite/mean": 0.49611878395080566, "rewards/total_composite/std": 0.49892622232437134, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0126827955245972, "sampling/importance_sampling_ratio/min": 0.22186465561389923, "sampling/sampling_logp_difference/max": 1.5663788318634033, "sampling/sampling_logp_difference/mean": 0.05649138242006302, "step": 646 }, { "clip_ratio/high_max": 0.05566767114214599, "clip_ratio/high_mean": 0.05566767114214599, "clip_ratio/low_mean": 0.0018656715983524919, "clip_ratio/low_min": 0.0018656715983524919, "clip_ratio/region_mean": 0.05753334274049848, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 66.375, "completions/mean_terminated_length": 66.375, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.2588699162006378, "epoch": 0.02498455359901143, "frac_reward_zero_std": 0.0, "grad_norm": 10.47767162322998, "learning_rate": 8.042424242424243e-06, "loss": 0.0108, "num_tokens": 1400768.0, "reward": 0.9769783020019531, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9769783020019531, "reward_meter_std": 0.051688529551029205, "reward_std": 0.05168852210044861, "reward_total_composite_mean": 0.9769783020019531, "reward_total_composite_std": 0.051688529551029205, "reward_total_mean": 0.9769783020019531, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9769783020019531, "rewards/meter/std": 0.051688529551029205, "rewards/total_composite/mean": 0.9769783020019531, "rewards/total_composite/std": 0.051688529551029205, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9968314170837402, "sampling/importance_sampling_ratio/min": 0.20647425949573517, "sampling/sampling_logp_difference/max": 1.5775794982910156, "sampling/sampling_logp_difference/mean": 0.056386951357126236, "step": 647 }, { "clip_ratio/high_max": 0.009631438297219574, "clip_ratio/high_mean": 0.009631438297219574, "clip_ratio/low_mean": 0.005490340990945697, "clip_ratio/low_min": 0.005490340990945697, "clip_ratio/region_mean": 0.015121779288165271, "completions/clipped_ratio": 0.0, "completions/max_length": 276.0, "completions/max_terminated_length": 276.0, "completions/mean_length": 250.375, "completions/mean_terminated_length": 250.375, "completions/min_length": 222.0, "completions/min_terminated_length": 222.0, "entropy": 0.06133082904852927, "epoch": 0.025023169601482854, "frac_reward_zero_std": 0.0, "grad_norm": 2.8141632080078125, "learning_rate": 8.03939393939394e-06, "loss": 0.0133, "num_tokens": 1404355.0, "reward": 0.6260231733322144, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.07715168595314026, "reward_meter_mean": 0.7232567071914673, "reward_meter_std": 0.3504089117050171, "reward_std": 0.3030511140823364, "reward_total_composite_mean": 0.6260231733322144, "reward_total_composite_std": 0.3030511140823364, "reward_total_mean": 0.6260231733322144, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.07715168595314026, "rewards/meter/mean": 0.7232567071914673, "rewards/meter/std": 0.3504089117050171, "rewards/total_composite/mean": 0.6260231733322144, "rewards/total_composite/std": 0.3030511140823364, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9957653880119324, "sampling/importance_sampling_ratio/min": 0.004950075875967741, "sampling/sampling_logp_difference/max": 5.308352470397949, "sampling/sampling_logp_difference/mean": 0.026500631123781204, "step": 648 }, { "clip_ratio/high_max": 0.011183355352841318, "clip_ratio/high_mean": 0.011183355352841318, "clip_ratio/low_mean": 0.006225490127690136, "clip_ratio/low_min": 0.006225490127690136, "clip_ratio/region_mean": 0.017408845480531454, "completions/clipped_ratio": 0.0, "completions/max_length": 125.0, "completions/max_terminated_length": 125.0, "completions/mean_length": 112.25, "completions/mean_terminated_length": 112.25, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "entropy": 0.11915135849267244, "epoch": 0.02506178560395428, "frac_reward_zero_std": 0.0, "grad_norm": 3.6201226711273193, "learning_rate": 8.036363636363636e-06, "loss": 0.0372, "num_tokens": 1406589.0, "reward": 0.981624960899353, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.981624960899353, "reward_meter_std": 0.027504365891218185, "reward_std": 0.02750437520444393, "reward_total_composite_mean": 0.981624960899353, "reward_total_composite_std": 0.027504365891218185, "reward_total_mean": 0.981624960899353, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.981624960899353, "rewards/meter/std": 0.027504365891218185, "rewards/total_composite/mean": 0.981624960899353, "rewards/total_composite/std": 0.027504365891218185, "sampling/importance_sampling_ratio/max": 1.9342072010040283, "sampling/importance_sampling_ratio/mean": 1.0045708417892456, "sampling/importance_sampling_ratio/min": 0.3109181523323059, "sampling/sampling_logp_difference/max": 1.1682255268096924, "sampling/sampling_logp_difference/mean": 0.019951220601797104, "step": 649 }, { "clip_ratio/high_max": 0.05512813315726817, "clip_ratio/high_mean": 0.05512813315726817, "clip_ratio/low_mean": 0.033882785588502884, "clip_ratio/low_min": 0.033882785588502884, "clip_ratio/region_mean": 0.08901091874577105, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 35.625, "completions/mean_terminated_length": 35.625, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.5731233917176723, "epoch": 0.025100401606425703, "frac_reward_zero_std": 0.0, "grad_norm": 12.612115859985352, "learning_rate": 8.033333333333335e-06, "loss": 0.0674, "num_tokens": 1408050.0, "reward": 0.9578008651733398, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9578008651733398, "reward_meter_std": 0.05439894273877144, "reward_std": 0.05439893528819084, "reward_total_composite_mean": 0.9578008651733398, "reward_total_composite_std": 0.05439894273877144, "reward_total_mean": 0.9578008651733398, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9578008651733398, "rewards/meter/std": 0.05439894273877144, "rewards/total_composite/mean": 0.9578008651733398, "rewards/total_composite/std": 0.05439894273877144, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.007057547569275, "sampling/importance_sampling_ratio/min": 0.18632878363132477, "sampling/sampling_logp_difference/max": 1.6802425384521484, "sampling/sampling_logp_difference/mean": 0.11987494677305222, "step": 650 }, { "epoch": 0.025100401606425703, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.028846153846153848, "eval_completions/max_length": 433.15384615384613, "eval_completions/max_terminated_length": 416.6923076923077, "eval_completions/mean_length": 229.43269230769232, "eval_completions/mean_terminated_length": 220.6758258526142, "eval_completions/min_length": 59.38461538461539, "eval_completions/min_terminated_length": 59.38461538461539, "eval_entropy": 0.07029147646748103, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1408050.0, "eval_reward": 0.7413886831356928, "eval_reward_arabic_clean_mean": 0.9615384615384616, "eval_reward_arabic_clean_std": 0.0900012942460867, "eval_reward_count_adherence_mean": 0.9108192599736727, "eval_reward_count_adherence_std": 0.1330794313779244, "eval_reward_meter_mean": 0.8344126389576838, "eval_reward_meter_std": 0.3256990680327782, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.7413886831356928, "eval_reward_total_composite_std": 0.3471943082717749, "eval_reward_total_mean": 0.7413886831356928, "eval_rewards/arabic_clean/mean": 0.9615384615384616, "eval_rewards/arabic_clean/std": 0.0900012942460867, "eval_rewards/count_adherence/mean": 0.9108192599736727, "eval_rewards/count_adherence/std": 0.1330794313779244, "eval_rewards/meter/mean": 0.8344126389576838, "eval_rewards/meter/std": 0.3256990680327782, "eval_rewards/total_composite/mean": 0.7413886831356928, "eval_rewards/total_composite/std": 0.3471943082717749, "eval_runtime": 81.5104, "eval_samples_per_second": 1.276, "eval_sampling/importance_sampling_ratio/max": 1.3485183532421405, "eval_sampling/importance_sampling_ratio/mean": 1.0019580951103797, "eval_sampling/importance_sampling_ratio/min": 0.3777222243639139, "eval_sampling/sampling_logp_difference/max": 0.9992800859304575, "eval_sampling/sampling_logp_difference/mean": 0.007470924049042738, "eval_steps_per_second": 0.159, "step": 650 }, { "clip_ratio/high_max": 0.010521235642954707, "clip_ratio/high_mean": 0.010521235642954707, "clip_ratio/low_mean": 0.028315248200669885, "clip_ratio/low_min": 0.028315248200669885, "clip_ratio/region_mean": 0.03883648384362459, "completions/clipped_ratio": 0.0, "completions/max_length": 37.0, "completions/max_terminated_length": 37.0, "completions/mean_length": 35.125, "completions/mean_terminated_length": 35.125, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.17123969458043575, "epoch": 0.026147728642005062, "frac_reward_zero_std": 0.0, "grad_norm": 9.100071907043457, "learning_rate": 8.03030303030303e-06, "loss": -0.0071, "num_tokens": 1409555.0, "reward": 0.9935092329978943, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9935092329978943, "reward_meter_std": 0.000985646271146834, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0009856420801952481, "reward_total_composite_mean": 0.9935092329978943, "reward_total_composite_std": 0.000985646271146834, "reward_total_mean": 0.9935092329978943, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9935092329978943, "rewards/meter/std": 0.000985646271146834, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9935092329978943, "rewards/total_composite/std": 0.000985646271146834, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.011391282081604, "sampling/importance_sampling_ratio/min": 0.3883599042892456, "sampling/sampling_logp_difference/max": 0.9458228349685669, "sampling/sampling_logp_difference/mean": 0.04576735198497772, "step": 651 }, { "clip_ratio/high_max": 0.0035446555411908776, "clip_ratio/high_mean": 0.0035446555411908776, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0035446555411908776, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 363.0, "completions/mean_length": 374.25, "completions/mean_terminated_length": 354.5714416503906, "completions/min_length": 343.0, "completions/min_terminated_length": 343.0, "entropy": 0.019337893230840564, "epoch": 0.026187894123790016, "frac_reward_zero_std": 0.0, "grad_norm": 0.4141400456428528, "learning_rate": 8.027272727272728e-06, "loss": -0.2894, "num_tokens": 1413749.0, "reward": 0.04464861750602722, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.824999988079071, "reward_count_adherence_std": 0.337003618478775, "reward_meter_mean": 0.8732885122299194, "reward_meter_std": 0.3528631627559662, "reward_repeat_penalty_mean": 0.17251461744308472, "reward_repeat_penalty_std": 0.33435773849487305, "reward_std": 0.018085261806845665, "reward_total_composite_mean": 0.04464861750602722, "reward_total_composite_std": 0.018085261806845665, "reward_total_mean": 0.04464861750602722, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.824999988079071, "rewards/count_adherence/std": 0.337003618478775, "rewards/meter/mean": 0.8732885122299194, "rewards/meter/std": 0.3528631627559662, "rewards/repeat_penalty/mean": 0.17251461744308472, "rewards/repeat_penalty/std": 0.33435773849487305, "rewards/total_composite/mean": 0.04464861750602722, "rewards/total_composite/std": 0.018085261806845665, "sampling/importance_sampling_ratio/max": 1.834702491760254, "sampling/importance_sampling_ratio/mean": 1.0013567209243774, "sampling/importance_sampling_ratio/min": 0.4920751452445984, "sampling/sampling_logp_difference/max": 0.7091238498687744, "sampling/sampling_logp_difference/mean": 0.004473666660487652, "step": 652 }, { "clip_ratio/high_max": 0.0029761905316263437, "clip_ratio/high_mean": 0.0029761905316263437, "clip_ratio/low_mean": 0.007873826543800533, "clip_ratio/low_min": 0.007873826543800533, "clip_ratio/region_mean": 0.010850017075426877, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 133.5, "completions/mean_terminated_length": 79.42857360839844, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.0790142323821783, "epoch": 0.02622805960557497, "frac_reward_zero_std": 0.0, "grad_norm": 1.191830039024353, "learning_rate": 8.024242424242425e-06, "loss": 0.1416, "num_tokens": 1415617.0, "reward": 0.43250638246536255, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9687988758087158, "reward_meter_std": 0.06074121594429016, "reward_repeat_penalty_mean": 0.4583333432674408, "reward_repeat_penalty_std": 0.24800792336463928, "reward_std": 0.1944577544927597, "reward_total_composite_mean": 0.43250638246536255, "reward_total_composite_std": 0.1944577693939209, "reward_total_mean": 0.43250638246536255, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9687988758087158, "rewards/meter/std": 0.06074121594429016, "rewards/repeat_penalty/mean": 0.4583333432674408, "rewards/repeat_penalty/std": 0.24800792336463928, "rewards/total_composite/mean": 0.43250638246536255, "rewards/total_composite/std": 0.1944577693939209, "sampling/importance_sampling_ratio/max": 1.5146371126174927, "sampling/importance_sampling_ratio/mean": 1.0012526512145996, "sampling/importance_sampling_ratio/min": 0.3877831697463989, "sampling/sampling_logp_difference/max": 0.9473090171813965, "sampling/sampling_logp_difference/mean": 0.014217361807823181, "step": 653 }, { "clip_ratio/high_max": 0.008620842476375401, "clip_ratio/high_mean": 0.008620842476375401, "clip_ratio/low_mean": 0.003801907878369093, "clip_ratio/low_min": 0.003801907878369093, "clip_ratio/region_mean": 0.012422750354744494, "completions/clipped_ratio": 0.0, "completions/max_length": 183.0, "completions/max_terminated_length": 183.0, "completions/mean_length": 170.625, "completions/mean_terminated_length": 170.625, "completions/min_length": 162.0, "completions/min_terminated_length": 162.0, "entropy": 0.08471588138490915, "epoch": 0.026268225087359924, "frac_reward_zero_std": 0.0, "grad_norm": 1.927111268043518, "learning_rate": 8.021212121212122e-06, "loss": -0.0232, "num_tokens": 1418478.0, "reward": 0.2665513753890991, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.9953961968421936, "reward_meter_std": 0.0023201238363981247, "reward_repeat_penalty_mean": 0.2678571343421936, "reward_repeat_penalty_std": 0.17806050181388855, "reward_std": 0.17725922167301178, "reward_total_composite_mean": 0.2665513753890991, "reward_total_composite_std": 0.17725923657417297, "reward_total_mean": 0.2665513753890991, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.9953961968421936, "rewards/meter/std": 0.0023201238363981247, "rewards/repeat_penalty/mean": 0.2678571343421936, "rewards/repeat_penalty/std": 0.17806050181388855, "rewards/total_composite/mean": 0.2665513753890991, "rewards/total_composite/std": 0.17725923657417297, "sampling/importance_sampling_ratio/max": 1.6224781274795532, "sampling/importance_sampling_ratio/mean": 1.0009305477142334, "sampling/importance_sampling_ratio/min": 0.24168278276920319, "sampling/sampling_logp_difference/max": 1.4201292991638184, "sampling/sampling_logp_difference/mean": 0.01804671622812748, "step": 654 }, { "clip_ratio/high_max": 0.012714299838989973, "clip_ratio/high_mean": 0.012714299838989973, "clip_ratio/low_mean": 0.0018382353009656072, "clip_ratio/low_min": 0.0018382353009656072, "clip_ratio/region_mean": 0.01455253513995558, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 68.0, "completions/mean_length": 116.625, "completions/mean_terminated_length": 60.142860412597656, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.17866009753197432, "epoch": 0.026308390569144878, "frac_reward_zero_std": 0.0, "grad_norm": 2.2248940467834473, "learning_rate": 8.018181818181818e-06, "loss": -0.0945, "num_tokens": 1420163.0, "reward": 0.25364238023757935, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7503823637962341, "reward_meter_std": 0.44998785853385925, "reward_repeat_penalty_mean": 0.5, "reward_repeat_penalty_std": 0.30860671401023865, "reward_std": 0.1438898742198944, "reward_total_composite_mean": 0.25364238023757935, "reward_total_composite_std": 0.14388985931873322, "reward_total_mean": 0.25364238023757935, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7503823637962341, "rewards/meter/std": 0.44998785853385925, "rewards/repeat_penalty/mean": 0.5, "rewards/repeat_penalty/std": 0.30860671401023865, "rewards/total_composite/mean": 0.25364238023757935, "rewards/total_composite/std": 0.14388985931873322, "sampling/importance_sampling_ratio/max": 1.6566717624664307, "sampling/importance_sampling_ratio/mean": 1.0044450759887695, "sampling/importance_sampling_ratio/min": 0.35307735204696655, "sampling/sampling_logp_difference/max": 1.0410680770874023, "sampling/sampling_logp_difference/mean": 0.024109482765197754, "step": 655 }, { "clip_ratio/high_max": 0.01278492109850049, "clip_ratio/high_mean": 0.01278492109850049, "clip_ratio/low_mean": 0.004310344811528921, "clip_ratio/low_min": 0.004310344811528921, "clip_ratio/region_mean": 0.01709526591002941, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 58.0, "completions/mean_terminated_length": 58.0, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.16807558294385672, "epoch": 0.026348556050929832, "frac_reward_zero_std": 0.0, "grad_norm": 6.352079391479492, "learning_rate": 8.015151515151515e-06, "loss": 0.0094, "num_tokens": 1421891.0, "reward": 0.3079977035522461, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9239930510520935, "reward_meter_std": 0.15441425144672394, "reward_repeat_penalty_mean": 0.3333333432674408, "reward_repeat_penalty_std": 0.0, "reward_std": 0.05147142335772514, "reward_total_composite_mean": 0.3079977035522461, "reward_total_composite_std": 0.051471415907144547, "reward_total_mean": 0.3079977035522461, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9239930510520935, "rewards/meter/std": 0.15441425144672394, "rewards/repeat_penalty/mean": 0.3333333432674408, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.3079977035522461, "rewards/total_composite/std": 0.051471415907144547, "sampling/importance_sampling_ratio/max": 1.928532361984253, "sampling/importance_sampling_ratio/mean": 1.0036613941192627, "sampling/importance_sampling_ratio/min": 0.41602474451065063, "sampling/sampling_logp_difference/max": 0.8770105838775635, "sampling/sampling_logp_difference/mean": 0.022419268265366554, "step": 656 }, { "clip_ratio/high_max": 0.0028169237775728106, "clip_ratio/high_mean": 0.0028169237775728106, "clip_ratio/low_mean": 0.008925562433432788, "clip_ratio/low_min": 0.008925562433432788, "clip_ratio/region_mean": 0.011742486211005598, "completions/clipped_ratio": 0.0, "completions/max_length": 185.0, "completions/max_terminated_length": 185.0, "completions/mean_length": 181.25, "completions/mean_terminated_length": 181.25, "completions/min_length": 175.0, "completions/min_terminated_length": 175.0, "entropy": 0.042974324664101005, "epoch": 0.026388721532714786, "frac_reward_zero_std": 0.0, "grad_norm": 2.9878616333007812, "learning_rate": 8.012121212121214e-06, "loss": 0.0154, "num_tokens": 1424909.0, "reward": 0.1662987768650055, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9874005317687988, "reward_meter_std": 0.011436098255217075, "reward_repeat_penalty_mean": 0.20192307233810425, "reward_repeat_penalty_std": 0.2094048410654068, "reward_std": 0.17312301695346832, "reward_total_composite_mean": 0.1662987768650055, "reward_total_composite_std": 0.17312301695346832, "reward_total_mean": 0.1662987768650055, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9874005317687988, "rewards/meter/std": 0.011436098255217075, "rewards/repeat_penalty/mean": 0.20192307233810425, "rewards/repeat_penalty/std": 0.2094048410654068, "rewards/total_composite/mean": 0.1662987768650055, "rewards/total_composite/std": 0.17312301695346832, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0016026496887207, "sampling/importance_sampling_ratio/min": 0.1793055236339569, "sampling/sampling_logp_difference/max": 1.7186641693115234, "sampling/sampling_logp_difference/mean": 0.010927603580057621, "step": 657 }, { "clip_ratio/high_max": 0.0005817760829813778, "clip_ratio/high_mean": 0.0005817760829813778, "clip_ratio/low_mean": 0.00030637255986221135, "clip_ratio/low_min": 0.00030637255986221135, "clip_ratio/region_mean": 0.0008881486428435892, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 441.0, "completions/mean_length": 428.5, "completions/mean_terminated_length": 416.5714416503906, "completions/min_length": 394.0, "completions/min_terminated_length": 394.0, "entropy": 0.012874894309788942, "epoch": 0.02642888701449974, "frac_reward_zero_std": 0.0, "grad_norm": 0.7183297276496887, "learning_rate": 8.00909090909091e-06, "loss": -0.0762, "num_tokens": 1429785.0, "reward": 0.033445145934820175, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.6416666507720947, "reward_count_adherence_std": 0.26170989871025085, "reward_meter_mean": 0.8735865354537964, "reward_meter_std": 0.35298284888267517, "reward_repeat_penalty_mean": 0.17413419485092163, "reward_repeat_penalty_std": 0.34882497787475586, "reward_std": 0.06880706548690796, "reward_total_composite_mean": 0.033445145934820175, "reward_total_composite_std": 0.06880706548690796, "reward_total_mean": 0.033445145934820175, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.6416666507720947, "rewards/count_adherence/std": 0.26170989871025085, "rewards/meter/mean": 0.8735865354537964, "rewards/meter/std": 0.35298284888267517, "rewards/repeat_penalty/mean": 0.17413419485092163, "rewards/repeat_penalty/std": 0.34882497787475586, "rewards/total_composite/mean": 0.033445145934820175, "rewards/total_composite/std": 0.06880706548690796, "sampling/importance_sampling_ratio/max": 1.7735869884490967, "sampling/importance_sampling_ratio/mean": 1.0009920597076416, "sampling/importance_sampling_ratio/min": 0.3645470440387726, "sampling/sampling_logp_difference/max": 1.0090997219085693, "sampling/sampling_logp_difference/mean": 0.0026275559794157743, "step": 658 }, { "clip_ratio/high_max": 0.008969587041065097, "clip_ratio/high_mean": 0.008969587041065097, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.008969587041065097, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 190.375, "completions/mean_terminated_length": 83.16667175292969, "completions/min_length": 81.0, "completions/min_terminated_length": 81.0, "entropy": 0.06744233565405011, "epoch": 0.026469052496284694, "frac_reward_zero_std": 0.0, "grad_norm": 1.3609012365341187, "learning_rate": 8.006060606060607e-06, "loss": -0.1652, "num_tokens": 1431540.0, "reward": 0.513268232345581, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9505882263183594, "reward_meter_std": 0.030698692426085472, "reward_repeat_penalty_mean": 0.7916666865348816, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.3378343880176544, "reward_total_composite_mean": 0.513268232345581, "reward_total_composite_std": 0.3378344178199768, "reward_total_mean": 0.513268232345581, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9505882263183594, "rewards/meter/std": 0.030698692426085472, "rewards/repeat_penalty/mean": 0.7916666865348816, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.513268232345581, "rewards/total_composite/std": 0.3378344178199768, "sampling/importance_sampling_ratio/max": 1.7507625818252563, "sampling/importance_sampling_ratio/mean": 1.0079931020736694, "sampling/importance_sampling_ratio/min": 0.1503116339445114, "sampling/sampling_logp_difference/max": 1.8950445652008057, "sampling/sampling_logp_difference/mean": 0.02022649347782135, "step": 659 }, { "clip_ratio/high_max": 0.0036057692486792803, "clip_ratio/high_mean": 0.0036057692486792803, "clip_ratio/low_mean": 0.006200430449098349, "clip_ratio/low_min": 0.006200430449098349, "clip_ratio/region_mean": 0.009806199697777629, "completions/clipped_ratio": 0.0, "completions/max_length": 138.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 110.625, "completions/mean_terminated_length": 110.625, "completions/min_length": 104.0, "completions/min_terminated_length": 104.0, "entropy": 0.020129066659137607, "epoch": 0.026509217978069648, "frac_reward_zero_std": 0.0, "grad_norm": 2.2579872608184814, "learning_rate": 8.003030303030304e-06, "loss": 0.0308, "num_tokens": 1433681.0, "reward": 0.22219520807266235, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.9927444458007812, "reward_meter_std": 0.0012347318697720766, "reward_repeat_penalty_mean": 0.23571428656578064, "reward_repeat_penalty_std": 0.07284314185380936, "reward_std": 0.07082199305295944, "reward_total_composite_mean": 0.22219520807266235, "reward_total_composite_std": 0.07082200050354004, "reward_total_mean": 0.22219520807266235, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.9927444458007812, "rewards/meter/std": 0.0012347318697720766, "rewards/repeat_penalty/mean": 0.23571428656578064, "rewards/repeat_penalty/std": 0.07284314185380936, "rewards/total_composite/mean": 0.22219520807266235, "rewards/total_composite/std": 0.07082200050354004, "sampling/importance_sampling_ratio/max": 1.6747108697891235, "sampling/importance_sampling_ratio/mean": 1.001028299331665, "sampling/importance_sampling_ratio/min": 0.1580846756696701, "sampling/sampling_logp_difference/max": 1.8446245193481445, "sampling/sampling_logp_difference/mean": 0.008687403053045273, "step": 660 }, { "clip_ratio/high_max": 0.017718179151415825, "clip_ratio/high_mean": 0.017718179151415825, "clip_ratio/low_mean": 0.008919409476220608, "clip_ratio/low_min": 0.008919409476220608, "clip_ratio/region_mean": 0.026637588627636433, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 123.0, "completions/mean_length": 203.625, "completions/mean_terminated_length": 100.83333587646484, "completions/min_length": 81.0, "completions/min_terminated_length": 81.0, "entropy": 0.17050567921251059, "epoch": 0.0265493834598546, "frac_reward_zero_std": 0.0, "grad_norm": 3.181408405303955, "learning_rate": 8.000000000000001e-06, "loss": -0.0515, "num_tokens": 1435750.0, "reward": 0.22007080912590027, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_meter_mean": 0.43306416273117065, "reward_meter_std": 0.44791871309280396, "reward_repeat_penalty_mean": 0.6357142925262451, "reward_repeat_penalty_std": 0.31916436553001404, "reward_std": 0.2968771457672119, "reward_total_composite_mean": 0.22007080912590027, "reward_total_composite_std": 0.2968771755695343, "reward_total_mean": 0.22007080912590027, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/meter/mean": 0.43306416273117065, "rewards/meter/std": 0.44791871309280396, "rewards/repeat_penalty/mean": 0.6357142925262451, "rewards/repeat_penalty/std": 0.31916436553001404, "rewards/total_composite/mean": 0.22007080912590027, "rewards/total_composite/std": 0.2968771755695343, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0068386793136597, "sampling/importance_sampling_ratio/min": 0.253473699092865, "sampling/sampling_logp_difference/max": 1.372495174407959, "sampling/sampling_logp_difference/mean": 0.04375706985592842, "step": 661 }, { "clip_ratio/high_max": 0.012073024990968406, "clip_ratio/high_mean": 0.012073024990968406, "clip_ratio/low_mean": 0.004385964944958687, "clip_ratio/low_min": 0.004385964944958687, "clip_ratio/region_mean": 0.016458989935927093, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 117.0, "completions/mean_terminated_length": 60.57143020629883, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.17267457023262978, "epoch": 0.026589548941639556, "frac_reward_zero_std": 0.0, "grad_norm": 2.6338069438934326, "learning_rate": 7.996969696969697e-06, "loss": -0.1279, "num_tokens": 1437638.0, "reward": 0.455108642578125, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9266777634620667, "reward_meter_std": 0.1883465051651001, "reward_repeat_penalty_mean": 0.5833333730697632, "reward_repeat_penalty_std": 0.2357022762298584, "reward_std": 0.24599777162075043, "reward_total_composite_mean": 0.455108642578125, "reward_total_composite_std": 0.24599777162075043, "reward_total_mean": 0.455108642578125, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9266777634620667, "rewards/meter/std": 0.1883465051651001, "rewards/repeat_penalty/mean": 0.5833333730697632, "rewards/repeat_penalty/std": 0.2357022762298584, "rewards/total_composite/mean": 0.455108642578125, "rewards/total_composite/std": 0.24599777162075043, "sampling/importance_sampling_ratio/max": 1.474334478378296, "sampling/importance_sampling_ratio/mean": 1.0021228790283203, "sampling/importance_sampling_ratio/min": 0.263834148645401, "sampling/sampling_logp_difference/max": 1.3324346542358398, "sampling/sampling_logp_difference/mean": 0.032812319695949554, "step": 662 }, { "clip_ratio/high_max": 0.014703674940392375, "clip_ratio/high_mean": 0.014703674940392375, "clip_ratio/low_mean": 0.00461137923412025, "clip_ratio/low_min": 0.00461137923412025, "clip_ratio/region_mean": 0.019315054174512625, "completions/clipped_ratio": 0.0, "completions/max_length": 133.0, "completions/max_terminated_length": 133.0, "completions/mean_length": 108.0, "completions/mean_terminated_length": 108.0, "completions/min_length": 96.0, "completions/min_terminated_length": 96.0, "entropy": 0.11175651382654905, "epoch": 0.02662971442342451, "frac_reward_zero_std": 0.0, "grad_norm": 4.197593688964844, "learning_rate": 7.993939393939396e-06, "loss": 0.021, "num_tokens": 1439950.0, "reward": 0.3900730013847351, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.9684537053108215, "reward_meter_std": 0.027583837509155273, "reward_repeat_penalty_mean": 0.4226190447807312, "reward_repeat_penalty_std": 0.2210753709077835, "reward_std": 0.19891956448554993, "reward_total_composite_mean": 0.3900730013847351, "reward_total_composite_std": 0.19891957938671112, "reward_total_mean": 0.3900730013847351, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.9684537053108215, "rewards/meter/std": 0.027583837509155273, "rewards/repeat_penalty/mean": 0.4226190447807312, "rewards/repeat_penalty/std": 0.2210753709077835, "rewards/total_composite/mean": 0.3900730013847351, "rewards/total_composite/std": 0.19891957938671112, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9997091889381409, "sampling/importance_sampling_ratio/min": 0.3571523129940033, "sampling/sampling_logp_difference/max": 1.0295929908752441, "sampling/sampling_logp_difference/mean": 0.02085985243320465, "step": 663 }, { "clip_ratio/high_max": 0.023867564275860786, "clip_ratio/high_mean": 0.023867564275860786, "clip_ratio/low_mean": 0.0055147059028968215, "clip_ratio/low_min": 0.0055147059028968215, "clip_ratio/region_mean": 0.029382270178757608, "completions/clipped_ratio": 0.0, "completions/max_length": 79.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 70.625, "completions/mean_terminated_length": 70.625, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.10323597816750407, "epoch": 0.026669879905209463, "frac_reward_zero_std": 0.0, "grad_norm": 7.99793004989624, "learning_rate": 7.990909090909091e-06, "loss": -0.029, "num_tokens": 1441763.0, "reward": 0.568142294883728, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9828510880470276, "reward_meter_std": 0.025825461372733116, "reward_repeat_penalty_mean": 0.5833333730697632, "reward_repeat_penalty_std": 0.29546841979026794, "reward_std": 0.27455058693885803, "reward_total_composite_mean": 0.568142294883728, "reward_total_composite_std": 0.27455055713653564, "reward_total_mean": 0.568142294883728, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9828510880470276, "rewards/meter/std": 0.025825461372733116, "rewards/repeat_penalty/mean": 0.5833333730697632, "rewards/repeat_penalty/std": 0.29546841979026794, "rewards/total_composite/mean": 0.568142294883728, "rewards/total_composite/std": 0.27455055713653564, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0028775930404663, "sampling/importance_sampling_ratio/min": 0.3252873122692108, "sampling/sampling_logp_difference/max": 1.1230463981628418, "sampling/sampling_logp_difference/mean": 0.03234035521745682, "step": 664 }, { "clip_ratio/high_max": 0.0015432098880410194, "clip_ratio/high_mean": 0.0015432098880410194, "clip_ratio/low_mean": 0.009405238670296967, "clip_ratio/low_min": 0.009405238670296967, "clip_ratio/region_mean": 0.010948448558337986, "completions/clipped_ratio": 0.0, "completions/max_length": 83.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 80.625, "completions/mean_terminated_length": 80.625, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.07347342604771256, "epoch": 0.026710045386994417, "frac_reward_zero_std": 0.0, "grad_norm": 3.2300848960876465, "learning_rate": 7.987878787878789e-06, "loss": -0.0097, "num_tokens": 1443616.0, "reward": 0.7601395845413208, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9603564143180847, "reward_meter_std": 0.023673059418797493, "reward_repeat_penalty_mean": 0.7916666865348816, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.16597026586532593, "reward_total_composite_mean": 0.7601395845413208, "reward_total_composite_std": 0.16597026586532593, "reward_total_mean": 0.7601395845413208, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9603564143180847, "rewards/meter/std": 0.023673059418797493, "rewards/repeat_penalty/mean": 0.7916666865348816, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.7601395845413208, "rewards/total_composite/std": 0.16597026586532593, "sampling/importance_sampling_ratio/max": 1.564980387687683, "sampling/importance_sampling_ratio/mean": 1.0014386177062988, "sampling/importance_sampling_ratio/min": 0.3567086160182953, "sampling/sampling_logp_difference/max": 1.0308361053466797, "sampling/sampling_logp_difference/mean": 0.0124077582731843, "step": 665 }, { "clip_ratio/high_max": 0.006232782383449376, "clip_ratio/high_mean": 0.006232782383449376, "clip_ratio/low_mean": 0.0010416667209938169, "clip_ratio/low_min": 0.0010416667209938169, "clip_ratio/region_mean": 0.0072744491044431925, "completions/clipped_ratio": 0.0, "completions/max_length": 135.0, "completions/max_terminated_length": 135.0, "completions/mean_length": 122.25, "completions/mean_terminated_length": 122.25, "completions/min_length": 120.0, "completions/min_terminated_length": 120.0, "entropy": 0.03877314692363143, "epoch": 0.02675021086877937, "frac_reward_zero_std": 0.0, "grad_norm": 3.160210609436035, "learning_rate": 7.984848484848486e-06, "loss": 0.0007, "num_tokens": 1445930.0, "reward": 0.12827160954475403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8794082999229431, "reward_meter_std": 0.32782238721847534, "reward_repeat_penalty_mean": 0.212053582072258, "reward_repeat_penalty_std": 0.2030286192893982, "reward_std": 0.03277355059981346, "reward_total_composite_mean": 0.12827160954475403, "reward_total_composite_std": 0.03277355059981346, "reward_total_mean": 0.12827160954475403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8794082999229431, "rewards/meter/std": 0.32782238721847534, "rewards/repeat_penalty/mean": 0.212053582072258, "rewards/repeat_penalty/std": 0.2030286192893982, "rewards/total_composite/mean": 0.12827160954475403, "rewards/total_composite/std": 0.03277355059981346, "sampling/importance_sampling_ratio/max": 1.6665557622909546, "sampling/importance_sampling_ratio/mean": 0.9980396032333374, "sampling/importance_sampling_ratio/min": 0.0016290009953081608, "sampling/sampling_logp_difference/max": 6.419788360595703, "sampling/sampling_logp_difference/mean": 0.02072002924978733, "step": 666 }, { "clip_ratio/high_max": 0.006372183095663786, "clip_ratio/high_mean": 0.006372183095663786, "clip_ratio/low_mean": 0.0031968391267582774, "clip_ratio/low_min": 0.0031968391267582774, "clip_ratio/region_mean": 0.009569022222422063, "completions/clipped_ratio": 0.0, "completions/max_length": 129.0, "completions/max_terminated_length": 129.0, "completions/mean_length": 120.875, "completions/mean_terminated_length": 120.875, "completions/min_length": 116.0, "completions/min_terminated_length": 116.0, "entropy": 0.07529849279671907, "epoch": 0.026790376350564325, "frac_reward_zero_std": 0.0, "grad_norm": 4.775012016296387, "learning_rate": 7.981818181818183e-06, "loss": 0.0108, "num_tokens": 1448313.0, "reward": 0.24911293387413025, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9965612888336182, "reward_meter_std": 0.0018690497381612659, "reward_repeat_penalty_mean": 0.25, "reward_repeat_penalty_std": 0.21257823705673218, "reward_std": 0.2116239219903946, "reward_total_composite_mean": 0.24911293387413025, "reward_total_composite_std": 0.2116239219903946, "reward_total_mean": 0.24911293387413025, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9965612888336182, "rewards/meter/std": 0.0018690497381612659, "rewards/repeat_penalty/mean": 0.25, "rewards/repeat_penalty/std": 0.21257823705673218, "rewards/total_composite/mean": 0.24911293387413025, "rewards/total_composite/std": 0.2116239219903946, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9989076256752014, "sampling/importance_sampling_ratio/min": 0.3773258924484253, "sampling/sampling_logp_difference/max": 1.0500693321228027, "sampling/sampling_logp_difference/mean": 0.017011119052767754, "step": 667 }, { "clip_ratio/high_max": 0.0030251864809542894, "clip_ratio/high_mean": 0.0030251864809542894, "clip_ratio/low_mean": 0.007991038146428764, "clip_ratio/low_min": 0.007991038146428764, "clip_ratio/region_mean": 0.011016224627383053, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 207.0, "completions/mean_length": 243.0, "completions/mean_terminated_length": 204.57144165039062, "completions/min_length": 195.0, "completions/min_terminated_length": 195.0, "entropy": 0.05400602100417018, "epoch": 0.02683054183234928, "frac_reward_zero_std": 0.0, "grad_norm": 2.0396084785461426, "learning_rate": 7.978787878787879e-06, "loss": -0.1559, "num_tokens": 1451329.0, "reward": 0.17570531368255615, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9733182787895203, "reward_meter_std": 0.02887692302465439, "reward_repeat_penalty_mean": 0.27272728085517883, "reward_repeat_penalty_std": 0.13744163513183594, "reward_std": 0.11893083900213242, "reward_total_composite_mean": 0.17570531368255615, "reward_total_composite_std": 0.11893084645271301, "reward_total_mean": 0.17570531368255615, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9733182787895203, "rewards/meter/std": 0.02887692302465439, "rewards/repeat_penalty/mean": 0.27272728085517883, "rewards/repeat_penalty/std": 0.13744163513183594, "rewards/total_composite/mean": 0.17570531368255615, "rewards/total_composite/std": 0.11893084645271301, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9996070861816406, "sampling/importance_sampling_ratio/min": 0.1251610666513443, "sampling/sampling_logp_difference/max": 2.0781538486480713, "sampling/sampling_logp_difference/mean": 0.01857808604836464, "step": 668 }, { "clip_ratio/high_max": 0.011646514758467674, "clip_ratio/high_mean": 0.011646514758467674, "clip_ratio/low_mean": 0.009377967799082398, "clip_ratio/low_min": 0.009377967799082398, "clip_ratio/region_mean": 0.021024482557550073, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 240.125, "completions/mean_terminated_length": 77.0, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.16993126086890697, "epoch": 0.026870707314134233, "frac_reward_zero_std": 0.0, "grad_norm": 2.1599395275115967, "learning_rate": 7.975757575757576e-06, "loss": -0.023, "num_tokens": 1453130.0, "reward": 0.4261804223060608, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5011062026023865, "reward_meter_std": 0.4051038920879364, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.46671321988105774, "reward_total_composite_mean": 0.4261804223060608, "reward_total_composite_std": 0.4667132496833801, "reward_total_mean": 0.4261804223060608, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5011062026023865, "rewards/meter/std": 0.4051038920879364, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.4261804223060608, "rewards/total_composite/std": 0.4667132496833801, "sampling/importance_sampling_ratio/max": 1.8760875463485718, "sampling/importance_sampling_ratio/mean": 1.0080572366714478, "sampling/importance_sampling_ratio/min": 0.16133907437324524, "sampling/sampling_logp_difference/max": 1.824247121810913, "sampling/sampling_logp_difference/mean": 0.052589599043130875, "step": 669 }, { "clip_ratio/high_max": 0.013186233583837748, "clip_ratio/high_mean": 0.013186233583837748, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.013186233583837748, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 93.0, "completions/mean_length": 351.0, "completions/mean_terminated_length": 82.66667175292969, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.09451978467404842, "epoch": 0.026910872795919187, "frac_reward_zero_std": 0.0, "grad_norm": 0.766589879989624, "learning_rate": 7.972727272727273e-06, "loss": -0.1072, "num_tokens": 1454698.0, "reward": 0.249087393283844, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6174333691596985, "reward_meter_std": 0.4055008888244629, "reward_repeat_penalty_mean": 0.7083333730697632, "reward_repeat_penalty_std": 0.11785111576318741, "reward_std": 0.3437734842300415, "reward_total_composite_mean": 0.249087393283844, "reward_total_composite_std": 0.3437734544277191, "reward_total_mean": 0.249087393283844, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6174333691596985, "rewards/meter/std": 0.4055008888244629, "rewards/repeat_penalty/mean": 0.7083333730697632, "rewards/repeat_penalty/std": 0.11785111576318741, "rewards/total_composite/mean": 0.249087393283844, "rewards/total_composite/std": 0.3437734544277191, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.004920482635498, "sampling/importance_sampling_ratio/min": 0.4397118091583252, "sampling/sampling_logp_difference/max": 1.1255141496658325, "sampling/sampling_logp_difference/mean": 0.03491988405585289, "step": 670 }, { "clip_ratio/high_max": 0.006735671544447541, "clip_ratio/high_mean": 0.006735671544447541, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.006735671544447541, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 354.75, "completions/mean_terminated_length": 92.66667175292969, "completions/min_length": 91.0, "completions/min_terminated_length": 91.0, "entropy": 0.07205967605113983, "epoch": 0.02695103827770414, "frac_reward_zero_std": 0.0, "grad_norm": 0.7819209098815918, "learning_rate": 7.96969696969697e-06, "loss": -0.0912, "num_tokens": 1456328.0, "reward": 0.19879300892353058, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.7872094511985779, "reward_meter_std": 0.3365079164505005, "reward_repeat_penalty_mean": 0.4750000238418579, "reward_repeat_penalty_std": 0.2121320366859436, "reward_std": 0.21251867711544037, "reward_total_composite_mean": 0.19879300892353058, "reward_total_composite_std": 0.21251867711544037, "reward_total_mean": 0.19879300892353058, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.7872094511985779, "rewards/meter/std": 0.3365079164505005, "rewards/repeat_penalty/mean": 0.4750000238418579, "rewards/repeat_penalty/std": 0.2121320366859436, "rewards/total_composite/mean": 0.19879300892353058, "rewards/total_composite/std": 0.21251867711544037, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0077892541885376, "sampling/importance_sampling_ratio/min": 0.31241610646247864, "sampling/sampling_logp_difference/max": 1.163419246673584, "sampling/sampling_logp_difference/mean": 0.0315895713865757, "step": 671 }, { "clip_ratio/high_max": 0.010866477387025952, "clip_ratio/high_mean": 0.010866477387025952, "clip_ratio/low_mean": 0.0028696630615741014, "clip_ratio/low_min": 0.0028696630615741014, "clip_ratio/region_mean": 0.013736140448600054, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 220.0, "completions/mean_length": 314.0, "completions/mean_terminated_length": 195.1999969482422, "completions/min_length": 160.0, "completions/min_terminated_length": 160.0, "entropy": 0.06148350611329079, "epoch": 0.026991203759489095, "frac_reward_zero_std": 0.0, "grad_norm": 0.8036666512489319, "learning_rate": 7.966666666666668e-06, "loss": -0.1237, "num_tokens": 1458728.0, "reward": 0.23602712154388428, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.1414213627576828, "reward_meter_mean": 0.7117201685905457, "reward_meter_std": 0.3770325481891632, "reward_repeat_penalty_mean": 0.5681818127632141, "reward_repeat_penalty_std": 0.2368127554655075, "reward_std": 0.1749935895204544, "reward_total_composite_mean": 0.23602712154388428, "reward_total_composite_std": 0.1749935895204544, "reward_total_mean": 0.23602712154388428, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.1414213627576828, "rewards/meter/mean": 0.7117201685905457, "rewards/meter/std": 0.3770325481891632, "rewards/repeat_penalty/mean": 0.5681818127632141, "rewards/repeat_penalty/std": 0.2368127554655075, "rewards/total_composite/mean": 0.23602712154388428, "rewards/total_composite/std": 0.1749935895204544, "sampling/importance_sampling_ratio/max": 1.857919692993164, "sampling/importance_sampling_ratio/mean": 0.9994598627090454, "sampling/importance_sampling_ratio/min": 0.22612299025058746, "sampling/sampling_logp_difference/max": 1.4866762161254883, "sampling/sampling_logp_difference/mean": 0.020951304584741592, "step": 672 }, { "clip_ratio/high_max": 0.02129602595232427, "clip_ratio/high_mean": 0.02129602595232427, "clip_ratio/low_mean": 0.020833334419876337, "clip_ratio/low_min": 0.020833334419876337, "clip_ratio/region_mean": 0.04212936037220061, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 117.625, "completions/mean_terminated_length": 61.28571701049805, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.2579981219023466, "epoch": 0.02703136924127405, "frac_reward_zero_std": 0.0, "grad_norm": 4.668978214263916, "learning_rate": 7.963636363636365e-06, "loss": -0.0271, "num_tokens": 1460405.0, "reward": 0.768899142742157, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.8629885911941528, "reward_meter_std": 0.28332778811454773, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.32128065824508667, "reward_total_composite_mean": 0.768899142742157, "reward_total_composite_std": 0.3212806284427643, "reward_total_mean": 0.768899142742157, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.8629885911941528, "rewards/meter/std": 0.28332778811454773, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.768899142742157, "rewards/total_composite/std": 0.3212806284427643, "sampling/importance_sampling_ratio/max": 1.7451122999191284, "sampling/importance_sampling_ratio/mean": 1.0077714920043945, "sampling/importance_sampling_ratio/min": 0.1919175386428833, "sampling/sampling_logp_difference/max": 1.6506894826889038, "sampling/sampling_logp_difference/mean": 0.04510435834527016, "step": 673 }, { "clip_ratio/high_max": 0.04135313397273421, "clip_ratio/high_mean": 0.04135313397273421, "clip_ratio/low_mean": 0.009934040834195912, "clip_ratio/low_min": 0.009934040834195912, "clip_ratio/region_mean": 0.051287174806930125, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 128.875, "completions/mean_terminated_length": 74.14286041259766, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.23062355443835258, "epoch": 0.027071534723059003, "frac_reward_zero_std": 0.0, "grad_norm": 3.691714286804199, "learning_rate": 7.96060606060606e-06, "loss": -0.0956, "num_tokens": 1462244.0, "reward": 0.5691444873809814, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.7070336937904358, "reward_meter_std": 0.39935943484306335, "reward_repeat_penalty_mean": 0.8333333730697632, "reward_repeat_penalty_std": 0.17817415297031403, "reward_std": 0.3437305986881256, "reward_total_composite_mean": 0.5691444873809814, "reward_total_composite_std": 0.343730628490448, "reward_total_mean": 0.5691444873809814, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.7070336937904358, "rewards/meter/std": 0.39935943484306335, "rewards/repeat_penalty/mean": 0.8333333730697632, "rewards/repeat_penalty/std": 0.17817415297031403, "rewards/total_composite/mean": 0.5691444873809814, "rewards/total_composite/std": 0.343730628490448, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0029557943344116, "sampling/importance_sampling_ratio/min": 0.28025004267692566, "sampling/sampling_logp_difference/max": 1.2720730304718018, "sampling/sampling_logp_difference/mean": 0.05939958617091179, "step": 674 }, { "clip_ratio/high_max": 0.000681198900565505, "clip_ratio/high_mean": 0.000681198900565505, "clip_ratio/low_mean": 0.0032165506563615054, "clip_ratio/low_min": 0.0032165506563615054, "clip_ratio/region_mean": 0.0038977495569270104, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 367.0, "completions/mean_length": 376.125, "completions/mean_terminated_length": 356.71429443359375, "completions/min_length": 337.0, "completions/min_terminated_length": 337.0, "entropy": 0.0205289286095649, "epoch": 0.027111700204843957, "frac_reward_zero_std": 0.0, "grad_norm": 0.7685384154319763, "learning_rate": 7.957575757575758e-06, "loss": -0.0973, "num_tokens": 1466421.0, "reward": 0.15836204588413239, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8624999523162842, "reward_count_adherence_std": 0.31139087677001953, "reward_meter_mean": 0.9768602848052979, "reward_meter_std": 0.0202656090259552, "reward_repeat_penalty_mean": 0.2991071343421936, "reward_repeat_penalty_std": 0.36836329102516174, "reward_std": 0.21933621168136597, "reward_total_composite_mean": 0.15836204588413239, "reward_total_composite_std": 0.21933622658252716, "reward_total_mean": 0.15836204588413239, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8624999523162842, "rewards/count_adherence/std": 0.31139087677001953, "rewards/meter/mean": 0.9768602848052979, "rewards/meter/std": 0.0202656090259552, "rewards/repeat_penalty/mean": 0.2991071343421936, "rewards/repeat_penalty/std": 0.36836329102516174, "rewards/total_composite/mean": 0.15836204588413239, "rewards/total_composite/std": 0.21933622658252716, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0009857416152954, "sampling/importance_sampling_ratio/min": 0.4014633893966675, "sampling/sampling_logp_difference/max": 1.467843770980835, "sampling/sampling_logp_difference/mean": 0.005116640590131283, "step": 675 }, { "clip_ratio/high_max": 0.01704174862243235, "clip_ratio/high_mean": 0.01704174862243235, "clip_ratio/low_mean": 0.009073751280084252, "clip_ratio/low_min": 0.009073751280084252, "clip_ratio/region_mean": 0.026115499902516603, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 45.5, "completions/mean_terminated_length": 45.5, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.16463111247867346, "epoch": 0.02715186568662891, "frac_reward_zero_std": 0.0, "grad_norm": 9.489598274230957, "learning_rate": 7.954545454545455e-06, "loss": -0.1218, "num_tokens": 1468025.0, "reward": 0.9916675090789795, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9916675090789795, "reward_meter_std": 0.0027789692394435406, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.002778968308120966, "reward_total_composite_mean": 0.9916675090789795, "reward_total_composite_std": 0.0027789692394435406, "reward_total_mean": 0.9916675090789795, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9916675090789795, "rewards/meter/std": 0.0027789692394435406, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9916675090789795, "rewards/total_composite/std": 0.0027789692394435406, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9964287877082825, "sampling/importance_sampling_ratio/min": 0.13002057373523712, "sampling/sampling_logp_difference/max": 2.040062665939331, "sampling/sampling_logp_difference/mean": 0.040273357182741165, "step": 676 }, { "clip_ratio/high_max": 0.0021551724057644606, "clip_ratio/high_mean": 0.0021551724057644606, "clip_ratio/low_mean": 0.012098872568458319, "clip_ratio/low_min": 0.012098872568458319, "clip_ratio/region_mean": 0.01425404497422278, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 62.125, "completions/mean_terminated_length": 62.125, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.11069364938884974, "epoch": 0.027192031168413865, "frac_reward_zero_std": 0.0, "grad_norm": 4.125744342803955, "learning_rate": 7.951515151515152e-06, "loss": 0.0185, "num_tokens": 1469690.0, "reward": 0.6625509858131409, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9938265085220337, "reward_meter_std": 0.0003937912406399846, "reward_repeat_penalty_mean": 0.6666666865348816, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0002625406195875257, "reward_total_composite_mean": 0.6625509858131409, "reward_total_composite_std": 0.00026252749375998974, "reward_total_mean": 0.6625509858131409, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9938265085220337, "rewards/meter/std": 0.0003937912406399846, "rewards/repeat_penalty/mean": 0.6666666865348816, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6625509858131409, "rewards/total_composite/std": 0.00026252749375998974, "sampling/importance_sampling_ratio/max": 1.5561105012893677, "sampling/importance_sampling_ratio/mean": 1.0004545450210571, "sampling/importance_sampling_ratio/min": 0.0030335744377225637, "sampling/sampling_logp_difference/max": 5.798013687133789, "sampling/sampling_logp_difference/mean": 0.02882186695933342, "step": 677 }, { "clip_ratio/high_max": 0.002251501166028902, "clip_ratio/high_mean": 0.002251501166028902, "clip_ratio/low_mean": 0.004044867469929159, "clip_ratio/low_min": 0.004044867469929159, "clip_ratio/region_mean": 0.006296368635958061, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 291.0, "completions/mean_length": 336.25, "completions/mean_terminated_length": 277.66668701171875, "completions/min_length": 268.0, "completions/min_terminated_length": 268.0, "entropy": 0.03139376197941601, "epoch": 0.02723219665019882, "frac_reward_zero_std": 0.0, "grad_norm": 0.7712501287460327, "learning_rate": 7.948484848484848e-06, "loss": -0.15, "num_tokens": 1472788.0, "reward": 0.1397983729839325, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8035714626312256, "reward_count_adherence_std": 0.15152288973331451, "reward_meter_mean": 0.6280694007873535, "reward_meter_std": 0.5047115683555603, "reward_repeat_penalty_mean": 0.41633522510528564, "reward_repeat_penalty_std": 0.3482770323753357, "reward_std": 0.1796947568655014, "reward_total_composite_mean": 0.1397983729839325, "reward_total_composite_std": 0.1796947717666626, "reward_total_mean": 0.1397983729839325, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8035714626312256, "rewards/count_adherence/std": 0.15152288973331451, "rewards/meter/mean": 0.6280694007873535, "rewards/meter/std": 0.5047115683555603, "rewards/repeat_penalty/mean": 0.41633522510528564, "rewards/repeat_penalty/std": 0.3482770323753357, "rewards/total_composite/mean": 0.1397983729839325, "rewards/total_composite/std": 0.1796947717666626, "sampling/importance_sampling_ratio/max": 1.6066981554031372, "sampling/importance_sampling_ratio/mean": 0.9978663921356201, "sampling/importance_sampling_ratio/min": 0.003241149475798011, "sampling/sampling_logp_difference/max": 5.731827259063721, "sampling/sampling_logp_difference/mean": 0.01377029623836279, "step": 678 }, { "clip_ratio/high_max": 0.01512786210514605, "clip_ratio/high_mean": 0.01512786210514605, "clip_ratio/low_mean": 0.002358490601181984, "clip_ratio/low_min": 0.002358490601181984, "clip_ratio/region_mean": 0.017486352706328034, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 57.0, "completions/mean_terminated_length": 57.0, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.11628487333655357, "epoch": 0.027272362131983773, "frac_reward_zero_std": 0.0, "grad_norm": 12.517946243286133, "learning_rate": 7.945454545454547e-06, "loss": -0.0123, "num_tokens": 1474604.0, "reward": 0.9428657293319702, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9841916561126709, "reward_meter_std": 0.005828971043229103, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.1139112189412117, "reward_total_composite_mean": 0.9428657293319702, "reward_total_composite_std": 0.1139112040400505, "reward_total_mean": 0.9428657293319702, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9841916561126709, "rewards/meter/std": 0.005828971043229103, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.9428657293319702, "rewards/total_composite/std": 0.1139112040400505, "sampling/importance_sampling_ratio/max": 1.880238652229309, "sampling/importance_sampling_ratio/mean": 0.9998968243598938, "sampling/importance_sampling_ratio/min": 0.3291391432285309, "sampling/sampling_logp_difference/max": 1.1112747192382812, "sampling/sampling_logp_difference/mean": 0.02025281824171543, "step": 679 }, { "clip_ratio/high_max": 0.0033385155256837606, "clip_ratio/high_mean": 0.0033385155256837606, "clip_ratio/low_mean": 0.014545571291819215, "clip_ratio/low_min": 0.014545571291819215, "clip_ratio/region_mean": 0.017884086817502975, "completions/clipped_ratio": 0.0, "completions/max_length": 129.0, "completions/max_terminated_length": 129.0, "completions/mean_length": 115.625, "completions/mean_terminated_length": 115.625, "completions/min_length": 101.0, "completions/min_terminated_length": 101.0, "entropy": 0.08438334474340081, "epoch": 0.027312527613768726, "frac_reward_zero_std": 0.0, "grad_norm": 8.33311653137207, "learning_rate": 7.942424242424242e-06, "loss": 0.031, "num_tokens": 1476777.0, "reward": 0.22119268774986267, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_meter_mean": 0.371232271194458, "reward_meter_std": 0.47603076696395874, "reward_repeat_penalty_mean": 0.48125001788139343, "reward_repeat_penalty_std": 0.13611315190792084, "reward_std": 0.2868722081184387, "reward_total_composite_mean": 0.22119268774986267, "reward_total_composite_std": 0.28687217831611633, "reward_total_mean": 0.22119268774986267, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/meter/mean": 0.371232271194458, "rewards/meter/std": 0.47603076696395874, "rewards/repeat_penalty/mean": 0.48125001788139343, "rewards/repeat_penalty/std": 0.13611315190792084, "rewards/total_composite/mean": 0.22119268774986267, "rewards/total_composite/std": 0.28687217831611633, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0001816749572754, "sampling/importance_sampling_ratio/min": 0.1354907900094986, "sampling/sampling_logp_difference/max": 1.9988516569137573, "sampling/sampling_logp_difference/mean": 0.020960384979844093, "step": 680 }, { "clip_ratio/high_max": 0.015127861872315407, "clip_ratio/high_mean": 0.015127861872315407, "clip_ratio/low_mean": 0.014689265750348568, "clip_ratio/low_min": 0.014689265750348568, "clip_ratio/region_mean": 0.029817127622663975, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 57.875, "completions/mean_terminated_length": 57.875, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.11835484858602285, "epoch": 0.02735269309555368, "frac_reward_zero_std": 0.0, "grad_norm": 3.9222095012664795, "learning_rate": 7.93939393939394e-06, "loss": 0.0231, "num_tokens": 1478560.0, "reward": 0.8934845924377441, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9723160266876221, "reward_meter_std": 0.027899622917175293, "reward_repeat_penalty_mean": 0.9166666865348816, "reward_repeat_penalty_std": 0.15430334210395813, "reward_std": 0.163389652967453, "reward_total_composite_mean": 0.8934845924377441, "reward_total_composite_std": 0.1633896678686142, "reward_total_mean": 0.8934845924377441, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9723160266876221, "rewards/meter/std": 0.027899622917175293, "rewards/repeat_penalty/mean": 0.9166666865348816, "rewards/repeat_penalty/std": 0.15430334210395813, "rewards/total_composite/mean": 0.8934845924377441, "rewards/total_composite/std": 0.1633896678686142, "sampling/importance_sampling_ratio/max": 1.6929512023925781, "sampling/importance_sampling_ratio/mean": 1.0034892559051514, "sampling/importance_sampling_ratio/min": 0.342024028301239, "sampling/sampling_logp_difference/max": 1.0728743076324463, "sampling/sampling_logp_difference/mean": 0.023344971239566803, "step": 681 }, { "clip_ratio/high_max": 0.0029069767333567142, "clip_ratio/high_mean": 0.0029069767333567142, "clip_ratio/low_mean": 0.005251961061730981, "clip_ratio/low_min": 0.005251961061730981, "clip_ratio/region_mean": 0.008158937795087695, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 173.875, "completions/mean_terminated_length": 125.5714340209961, "completions/min_length": 109.0, "completions/min_terminated_length": 109.0, "entropy": 0.049124513287097216, "epoch": 0.027392858577338634, "frac_reward_zero_std": 0.0, "grad_norm": 1.2039419412612915, "learning_rate": 7.936363636363637e-06, "loss": -0.0676, "num_tokens": 1480663.0, "reward": 0.16035160422325134, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_meter_mean": 0.38672682642936707, "reward_meter_std": 0.36102262139320374, "reward_repeat_penalty_mean": 0.48750001192092896, "reward_repeat_penalty_std": 0.24604006111621857, "reward_std": 0.24009782075881958, "reward_total_composite_mean": 0.16035160422325134, "reward_total_composite_std": 0.24009783565998077, "reward_total_mean": 0.16035160422325134, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/meter/mean": 0.38672682642936707, "rewards/meter/std": 0.36102262139320374, "rewards/repeat_penalty/mean": 0.48750001192092896, "rewards/repeat_penalty/std": 0.24604006111621857, "rewards/total_composite/mean": 0.16035160422325134, "rewards/total_composite/std": 0.24009783565998077, "sampling/importance_sampling_ratio/max": 1.6329307556152344, "sampling/importance_sampling_ratio/mean": 1.0000630617141724, "sampling/importance_sampling_ratio/min": 0.29752659797668457, "sampling/sampling_logp_difference/max": 1.2122516632080078, "sampling/sampling_logp_difference/mean": 0.013726767152547836, "step": 682 }, { "clip_ratio/high_max": 0.016894312808290124, "clip_ratio/high_mean": 0.016894312808290124, "clip_ratio/low_mean": 0.0042372881434857845, "clip_ratio/low_min": 0.0042372881434857845, "clip_ratio/region_mean": 0.02113160095177591, "completions/clipped_ratio": 0.0, "completions/max_length": 61.0, "completions/max_terminated_length": 61.0, "completions/mean_length": 58.75, "completions/mean_terminated_length": 58.75, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.11382754053920507, "epoch": 0.02743302405912359, "frac_reward_zero_std": 0.0, "grad_norm": 4.130276679992676, "learning_rate": 7.933333333333334e-06, "loss": 0.0096, "num_tokens": 1482349.0, "reward": 0.8474001884460449, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9239417314529419, "reward_meter_std": 0.05428864806890488, "reward_repeat_penalty_mean": 0.9166666865348816, "reward_repeat_penalty_std": 0.15430334210395813, "reward_std": 0.15459680557250977, "reward_total_composite_mean": 0.8474001884460449, "reward_total_composite_std": 0.15459680557250977, "reward_total_mean": 0.8474001884460449, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9239417314529419, "rewards/meter/std": 0.05428864806890488, "rewards/repeat_penalty/mean": 0.9166666865348816, "rewards/repeat_penalty/std": 0.15430334210395813, "rewards/total_composite/mean": 0.8474001884460449, "rewards/total_composite/std": 0.15459680557250977, "sampling/importance_sampling_ratio/max": 1.6103789806365967, "sampling/importance_sampling_ratio/mean": 0.994130551815033, "sampling/importance_sampling_ratio/min": 0.15196943283081055, "sampling/sampling_logp_difference/max": 1.8840758800506592, "sampling/sampling_logp_difference/mean": 0.03419341892004013, "step": 683 }, { "clip_ratio/high_max": 0.004629629664123058, "clip_ratio/high_mean": 0.004629629664123058, "clip_ratio/low_mean": 0.007758883642964065, "clip_ratio/low_min": 0.007758883642964065, "clip_ratio/region_mean": 0.012388513307087123, "completions/clipped_ratio": 0.0, "completions/max_length": 83.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 80.25, "completions/mean_terminated_length": 80.25, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.0625843945890665, "epoch": 0.027473189540908542, "frac_reward_zero_std": 0.0, "grad_norm": 4.445869445800781, "learning_rate": 7.930303030303031e-06, "loss": -0.0064, "num_tokens": 1484327.0, "reward": 0.46393126249313354, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9331251978874207, "reward_meter_std": 0.07388782501220703, "reward_repeat_penalty_mean": 0.5, "reward_repeat_penalty_std": 0.10690450668334961, "reward_std": 0.09499124437570572, "reward_total_composite_mean": 0.46393126249313354, "reward_total_composite_std": 0.09499123692512512, "reward_total_mean": 0.46393126249313354, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9331251978874207, "rewards/meter/std": 0.07388782501220703, "rewards/repeat_penalty/mean": 0.5, "rewards/repeat_penalty/std": 0.10690450668334961, "rewards/total_composite/mean": 0.46393126249313354, "rewards/total_composite/std": 0.09499123692512512, "sampling/importance_sampling_ratio/max": 1.7777718305587769, "sampling/importance_sampling_ratio/mean": 1.0021919012069702, "sampling/importance_sampling_ratio/min": 0.3052648901939392, "sampling/sampling_logp_difference/max": 1.1865754127502441, "sampling/sampling_logp_difference/mean": 0.01861550658941269, "step": 684 }, { "clip_ratio/high_max": 0.010335821425542235, "clip_ratio/high_mean": 0.010335821425542235, "clip_ratio/low_mean": 0.0007022471982054412, "clip_ratio/low_min": 0.0007022471982054412, "clip_ratio/region_mean": 0.011038068623747677, "completions/clipped_ratio": 0.0, "completions/max_length": 178.0, "completions/max_terminated_length": 178.0, "completions/mean_length": 170.625, "completions/mean_terminated_length": 170.625, "completions/min_length": 165.0, "completions/min_terminated_length": 165.0, "entropy": 0.046010758727788925, "epoch": 0.027513355022693496, "frac_reward_zero_std": 0.0, "grad_norm": 2.300926685333252, "learning_rate": 7.927272727272729e-06, "loss": 0.0202, "num_tokens": 1487252.0, "reward": 0.34419798851013184, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8037871718406677, "reward_meter_std": 0.32751503586769104, "reward_repeat_penalty_mean": 0.4107142686843872, "reward_repeat_penalty_std": 0.050507623702287674, "reward_std": 0.14113974571228027, "reward_total_composite_mean": 0.34419798851013184, "reward_total_composite_std": 0.14113976061344147, "reward_total_mean": 0.34419798851013184, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8037871718406677, "rewards/meter/std": 0.32751503586769104, "rewards/repeat_penalty/mean": 0.4107142686843872, "rewards/repeat_penalty/std": 0.050507623702287674, "rewards/total_composite/mean": 0.34419798851013184, "rewards/total_composite/std": 0.14113976061344147, "sampling/importance_sampling_ratio/max": 1.4589576721191406, "sampling/importance_sampling_ratio/mean": 0.9983497262001038, "sampling/importance_sampling_ratio/min": 0.19332465529441833, "sampling/sampling_logp_difference/max": 1.643384337425232, "sampling/sampling_logp_difference/mean": 0.010442078113555908, "step": 685 }, { "clip_ratio/high_max": 0.00234195904340595, "clip_ratio/high_mean": 0.00234195904340595, "clip_ratio/low_mean": 0.003458057180978358, "clip_ratio/low_min": 0.003458057180978358, "clip_ratio/region_mean": 0.005800016224384308, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 222.0, "completions/mean_length": 251.75, "completions/mean_terminated_length": 214.57144165039062, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "entropy": 0.021744283847510815, "epoch": 0.02755352050447845, "frac_reward_zero_std": 0.0, "grad_norm": 1.047049641609192, "learning_rate": 7.924242424242426e-06, "loss": -0.0998, "num_tokens": 1490154.0, "reward": 0.2209167182445526, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.2828427255153656, "reward_meter_mean": 0.9798320531845093, "reward_meter_std": 0.047762468457221985, "reward_repeat_penalty_mean": 0.32499998807907104, "reward_repeat_penalty_std": 0.27645719051361084, "reward_std": 0.04932519420981407, "reward_total_composite_mean": 0.2209167182445526, "reward_total_composite_std": 0.04932519793510437, "reward_total_mean": 0.2209167182445526, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.2828427255153656, "rewards/meter/mean": 0.9798320531845093, "rewards/meter/std": 0.047762468457221985, "rewards/repeat_penalty/mean": 0.32499998807907104, "rewards/repeat_penalty/std": 0.27645719051361084, "rewards/total_composite/mean": 0.2209167182445526, "rewards/total_composite/std": 0.04932519793510437, "sampling/importance_sampling_ratio/max": 1.7827941179275513, "sampling/importance_sampling_ratio/mean": 0.9986944198608398, "sampling/importance_sampling_ratio/min": 0.053416479378938675, "sampling/sampling_logp_difference/max": 2.929636001586914, "sampling/sampling_logp_difference/mean": 0.011242986656725407, "step": 686 }, { "clip_ratio/high_max": 0.020970338257029653, "clip_ratio/high_mean": 0.020970338257029653, "clip_ratio/low_mean": 0.011955027701333165, "clip_ratio/low_min": 0.011955027701333165, "clip_ratio/region_mean": 0.03292536595836282, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 71.0, "completions/mean_terminated_length": 71.0, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.1976525131613016, "epoch": 0.027593685986263404, "frac_reward_zero_std": 0.0, "grad_norm": 10.655113220214844, "learning_rate": 7.921212121212122e-06, "loss": 0.0292, "num_tokens": 1491874.0, "reward": 0.8430095314979553, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8845878839492798, "reward_meter_std": 0.2909509837627411, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.2961682677268982, "reward_total_composite_mean": 0.8430095314979553, "reward_total_composite_std": 0.2961682975292206, "reward_total_mean": 0.8430095314979553, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8845878839492798, "rewards/meter/std": 0.2909509837627411, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.8430095314979553, "rewards/total_composite/std": 0.2961682975292206, "sampling/importance_sampling_ratio/max": 1.9307304620742798, "sampling/importance_sampling_ratio/mean": 1.0036027431488037, "sampling/importance_sampling_ratio/min": 0.05301474407315254, "sampling/sampling_logp_difference/max": 2.937185287475586, "sampling/sampling_logp_difference/mean": 0.05931292846798897, "step": 687 }, { "clip_ratio/high_max": 0.010716472752392292, "clip_ratio/high_mean": 0.010716472752392292, "clip_ratio/low_mean": 0.011363636702299118, "clip_ratio/low_min": 0.011363636702299118, "clip_ratio/region_mean": 0.02208010945469141, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 67.75, "completions/mean_terminated_length": 67.75, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.06369170360267162, "epoch": 0.027633851468048358, "frac_reward_zero_std": 0.0, "grad_norm": 1.4717203378677368, "learning_rate": 7.918181818181819e-06, "loss": -0.0086, "num_tokens": 1493736.0, "reward": 0.6656583547592163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9984875321388245, "reward_meter_std": 0.0001689638738753274, "reward_repeat_penalty_mean": 0.6666666865348816, "reward_repeat_penalty_std": 0.0, "reward_std": 0.00011264239583397284, "reward_total_composite_mean": 0.6656583547592163, "reward_total_composite_std": 0.00011263116175541654, "reward_total_mean": 0.6656583547592163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9984875321388245, "rewards/meter/std": 0.0001689638738753274, "rewards/repeat_penalty/mean": 0.6666666865348816, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6656583547592163, "rewards/total_composite/std": 0.00011263116175541654, "sampling/importance_sampling_ratio/max": 1.6862038373947144, "sampling/importance_sampling_ratio/mean": 0.9985640048980713, "sampling/importance_sampling_ratio/min": 0.07396066933870316, "sampling/sampling_logp_difference/max": 2.604221820831299, "sampling/sampling_logp_difference/mean": 0.018908310681581497, "step": 688 }, { "clip_ratio/high_max": 0.0019430051324889064, "clip_ratio/high_mean": 0.0019430051324889064, "clip_ratio/low_mean": 0.007414351915940642, "clip_ratio/low_min": 0.007414351915940642, "clip_ratio/region_mean": 0.009357357048429549, "completions/clipped_ratio": 0.0, "completions/max_length": 212.0, "completions/max_terminated_length": 212.0, "completions/mean_length": 202.625, "completions/mean_terminated_length": 202.625, "completions/min_length": 191.0, "completions/min_terminated_length": 191.0, "entropy": 0.03671248443424702, "epoch": 0.027674016949833312, "frac_reward_zero_std": 0.0, "grad_norm": 2.0693576335906982, "learning_rate": 7.915151515151516e-06, "loss": 0.0309, "num_tokens": 1497021.0, "reward": 0.4050329029560089, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.995306134223938, "reward_meter_std": 0.0053658634424209595, "reward_repeat_penalty_mean": 0.4194444417953491, "reward_repeat_penalty_std": 0.13975918292999268, "reward_std": 0.1355670541524887, "reward_total_composite_mean": 0.4050329029560089, "reward_total_composite_std": 0.1355670541524887, "reward_total_mean": 0.4050329029560089, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.995306134223938, "rewards/meter/std": 0.0053658634424209595, "rewards/repeat_penalty/mean": 0.4194444417953491, "rewards/repeat_penalty/std": 0.13975918292999268, "rewards/total_composite/mean": 0.4050329029560089, "rewards/total_composite/std": 0.1355670541524887, "sampling/importance_sampling_ratio/max": 1.674434781074524, "sampling/importance_sampling_ratio/mean": 0.9986175298690796, "sampling/importance_sampling_ratio/min": 0.08943047374486923, "sampling/sampling_logp_difference/max": 2.4142937660217285, "sampling/sampling_logp_difference/mean": 0.014271133579313755, "step": 689 }, { "clip_ratio/high_max": 0.0015578281017951667, "clip_ratio/high_mean": 0.0015578281017951667, "clip_ratio/low_mean": 0.0021797263179905713, "clip_ratio/low_min": 0.0021797263179905713, "clip_ratio/region_mean": 0.003737554419785738, "completions/clipped_ratio": 0.0, "completions/max_length": 402.0, "completions/max_terminated_length": 402.0, "completions/mean_length": 401.625, "completions/mean_terminated_length": 401.625, "completions/min_length": 400.0, "completions/min_terminated_length": 400.0, "entropy": 0.027160495053976774, "epoch": 0.027714182431618266, "frac_reward_zero_std": 0.0, "grad_norm": 1.1219055652618408, "learning_rate": 7.912121212121213e-06, "loss": 0.0024, "num_tokens": 1502074.0, "reward": 0.1784874051809311, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9981971979141235, "reward_meter_std": 0.000627980858553201, "reward_repeat_penalty_mean": 0.2503289580345154, "reward_repeat_penalty_std": 0.23873279988765717, "reward_std": 0.17026525735855103, "reward_total_composite_mean": 0.1784874051809311, "reward_total_composite_std": 0.17026527225971222, "reward_total_mean": 0.1784874051809311, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9981971979141235, "rewards/meter/std": 0.000627980858553201, "rewards/repeat_penalty/mean": 0.2503289580345154, "rewards/repeat_penalty/std": 0.23873279988765717, "rewards/total_composite/mean": 0.1784874051809311, "rewards/total_composite/std": 0.17026527225971222, "sampling/importance_sampling_ratio/max": 1.6704438924789429, "sampling/importance_sampling_ratio/mean": 1.0005240440368652, "sampling/importance_sampling_ratio/min": 0.24811138212680817, "sampling/sampling_logp_difference/max": 1.3938775062561035, "sampling/sampling_logp_difference/mean": 0.005141077097505331, "step": 690 }, { "clip_ratio/high_max": 0.04530784301459789, "clip_ratio/high_mean": 0.04530784301459789, "clip_ratio/low_mean": 0.019354344811290503, "clip_ratio/low_min": 0.019354344811290503, "clip_ratio/region_mean": 0.0646621878258884, "completions/clipped_ratio": 0.0, "completions/max_length": 44.0, "completions/max_terminated_length": 44.0, "completions/mean_length": 38.125, "completions/mean_terminated_length": 38.125, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 0.5944820679724216, "epoch": 0.02775434791340322, "frac_reward_zero_std": 0.0, "grad_norm": 11.69098949432373, "learning_rate": 7.909090909090909e-06, "loss": -0.1031, "num_tokens": 1503707.0, "reward": 0.4370739161968231, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.4370739161968231, "reward_meter_std": 0.2700711488723755, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.2700711488723755, "reward_total_composite_mean": 0.4370739161968231, "reward_total_composite_std": 0.2700711488723755, "reward_total_mean": 0.4370739161968231, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.4370739161968231, "rewards/meter/std": 0.2700711488723755, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.4370739161968231, "rewards/total_composite/std": 0.2700711488723755, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0089696645736694, "sampling/importance_sampling_ratio/min": 0.3319256007671356, "sampling/sampling_logp_difference/max": 1.102844476699829, "sampling/sampling_logp_difference/mean": 0.0835486352443695, "step": 691 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0014367816038429737, "clip_ratio/low_min": 0.0014367816038429737, "clip_ratio/region_mean": 0.0014367816038429737, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 86.625, "completions/mean_terminated_length": 86.625, "completions/min_length": 84.0, "completions/min_terminated_length": 84.0, "entropy": 0.04205932654440403, "epoch": 0.027794513395188174, "frac_reward_zero_std": 0.0, "grad_norm": 5.031876564025879, "learning_rate": 7.906060606060608e-06, "loss": 0.0153, "num_tokens": 1505712.0, "reward": 0.9942313432693481, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9942313432693481, "reward_meter_std": 0.0012215422466397285, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.00122154806740582, "reward_total_composite_mean": 0.9942313432693481, "reward_total_composite_std": 0.0012215422466397285, "reward_total_mean": 0.9942313432693481, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9942313432693481, "rewards/meter/std": 0.0012215422466397285, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9942313432693481, "rewards/total_composite/std": 0.0012215422466397285, "sampling/importance_sampling_ratio/max": 1.5647001266479492, "sampling/importance_sampling_ratio/mean": 1.003043293952942, "sampling/importance_sampling_ratio/min": 0.7906866669654846, "sampling/sampling_logp_difference/max": 0.44769424200057983, "sampling/sampling_logp_difference/mean": 0.005889675114303827, "step": 692 }, { "clip_ratio/high_max": 0.01416083937510848, "clip_ratio/high_mean": 0.01416083937510848, "clip_ratio/low_mean": 0.009437322150915861, "clip_ratio/low_min": 0.009437322150915861, "clip_ratio/region_mean": 0.02359816152602434, "completions/clipped_ratio": 0.0, "completions/max_length": 55.0, "completions/max_terminated_length": 55.0, "completions/mean_length": 54.125, "completions/mean_terminated_length": 54.125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.0895584006793797, "epoch": 0.027834678876973128, "frac_reward_zero_std": 0.0, "grad_norm": 10.364151954650879, "learning_rate": 7.903030303030303e-06, "loss": 0.0041, "num_tokens": 1507385.0, "reward": 0.9447178244590759, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9447178244590759, "reward_meter_std": 0.019572317600250244, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.01957232505083084, "reward_total_composite_mean": 0.9447178244590759, "reward_total_composite_std": 0.019572317600250244, "reward_total_mean": 0.9447178244590759, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9447178244590759, "rewards/meter/std": 0.019572317600250244, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9447178244590759, "rewards/total_composite/std": 0.019572317600250244, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.003846287727356, "sampling/importance_sampling_ratio/min": 0.14936968684196472, "sampling/sampling_logp_difference/max": 1.9013309478759766, "sampling/sampling_logp_difference/mean": 0.024356268346309662, "step": 693 }, { "clip_ratio/high_max": 0.02390445303171873, "clip_ratio/high_mean": 0.02390445303171873, "clip_ratio/low_mean": 0.01502489356789738, "clip_ratio/low_min": 0.01502489356789738, "clip_ratio/region_mean": 0.03892934659961611, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 74.0, "completions/mean_terminated_length": 74.0, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.17548873648047447, "epoch": 0.02787484435875808, "frac_reward_zero_std": 0.0, "grad_norm": 6.670380115509033, "learning_rate": 7.9e-06, "loss": 0.0035, "num_tokens": 1509273.0, "reward": 0.5444035530090332, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.610145092010498, "reward_meter_std": 0.23973627388477325, "reward_repeat_penalty_mean": 0.875, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.24921227991580963, "reward_total_composite_mean": 0.5444035530090332, "reward_total_composite_std": 0.24921227991580963, "reward_total_mean": 0.5444035530090332, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.610145092010498, "rewards/meter/std": 0.23973627388477325, "rewards/repeat_penalty/mean": 0.875, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.5444035530090332, "rewards/total_composite/std": 0.24921227991580963, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0047415494918823, "sampling/importance_sampling_ratio/min": 0.16379445791244507, "sampling/sampling_logp_difference/max": 1.8091429471969604, "sampling/sampling_logp_difference/mean": 0.030294643715023994, "step": 694 }, { "clip_ratio/high_max": 0.004360056365840137, "clip_ratio/high_mean": 0.004360056365840137, "clip_ratio/low_mean": 0.0062915480230003595, "clip_ratio/low_min": 0.0062915480230003595, "clip_ratio/region_mean": 0.010651604388840497, "completions/clipped_ratio": 0.0, "completions/max_length": 90.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 80.75, "completions/mean_terminated_length": 80.75, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.06276643788442016, "epoch": 0.02791500984054304, "frac_reward_zero_std": 0.0, "grad_norm": 3.7013967037200928, "learning_rate": 7.896969696969698e-06, "loss": -0.0124, "num_tokens": 1511199.0, "reward": 0.788793683052063, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9964468479156494, "reward_meter_std": 0.0019429969834163785, "reward_repeat_penalty_mean": 0.7916666865348816, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.17156179249286652, "reward_total_composite_mean": 0.788793683052063, "reward_total_composite_std": 0.17156179249286652, "reward_total_mean": 0.788793683052063, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9964468479156494, "rewards/meter/std": 0.0019429969834163785, "rewards/repeat_penalty/mean": 0.7916666865348816, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.788793683052063, "rewards/total_composite/std": 0.17156179249286652, "sampling/importance_sampling_ratio/max": 1.8497363328933716, "sampling/importance_sampling_ratio/mean": 1.0024663209915161, "sampling/importance_sampling_ratio/min": 0.1775287538766861, "sampling/sampling_logp_difference/max": 1.7286226749420166, "sampling/sampling_logp_difference/mean": 0.012971381656825542, "step": 695 }, { "clip_ratio/high_max": 0.00876707280986011, "clip_ratio/high_mean": 0.00876707280986011, "clip_ratio/low_mean": 0.0020850637229159474, "clip_ratio/low_min": 0.0020850637229159474, "clip_ratio/region_mean": 0.010852136532776058, "completions/clipped_ratio": 0.0, "completions/max_length": 129.0, "completions/max_terminated_length": 129.0, "completions/mean_length": 125.75, "completions/mean_terminated_length": 125.75, "completions/min_length": 112.0, "completions/min_terminated_length": 112.0, "entropy": 0.07676348416134715, "epoch": 0.027955175322327993, "frac_reward_zero_std": 0.0, "grad_norm": 3.119380235671997, "learning_rate": 7.893939393939395e-06, "loss": -0.0063, "num_tokens": 1513573.0, "reward": 0.6532999277114868, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9228010177612305, "reward_meter_std": 0.20124337077140808, "reward_repeat_penalty_mean": 0.7000000476837158, "reward_repeat_penalty_std": 0.10690449178218842, "reward_std": 0.18960076570510864, "reward_total_composite_mean": 0.6532999277114868, "reward_total_composite_std": 0.18960076570510864, "reward_total_mean": 0.6532999277114868, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9228010177612305, "rewards/meter/std": 0.20124337077140808, "rewards/repeat_penalty/mean": 0.7000000476837158, "rewards/repeat_penalty/std": 0.10690449178218842, "rewards/total_composite/mean": 0.6532999277114868, "rewards/total_composite/std": 0.18960076570510864, "sampling/importance_sampling_ratio/max": 1.9363112449645996, "sampling/importance_sampling_ratio/mean": 0.9984103441238403, "sampling/importance_sampling_ratio/min": 0.2494570016860962, "sampling/sampling_logp_difference/max": 1.3884687423706055, "sampling/sampling_logp_difference/mean": 0.016659488901495934, "step": 696 }, { "clip_ratio/high_max": 0.01933896285481751, "clip_ratio/high_mean": 0.01933896285481751, "clip_ratio/low_mean": 0.003846153849735856, "clip_ratio/low_min": 0.003846153849735856, "clip_ratio/region_mean": 0.023185116704553366, "completions/clipped_ratio": 0.0, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 59.375, "completions/mean_terminated_length": 59.375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.09744885191321373, "epoch": 0.027995340804112947, "frac_reward_zero_std": 0.0, "grad_norm": 4.277256011962891, "learning_rate": 7.89090909090909e-06, "loss": 0.0606, "num_tokens": 1515360.0, "reward": 0.8894380331039429, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9654116630554199, "reward_meter_std": 0.034304678440093994, "reward_repeat_penalty_mean": 0.9166666865348816, "reward_repeat_penalty_std": 0.15430334210395813, "reward_std": 0.17405925691127777, "reward_total_composite_mean": 0.8894380331039429, "reward_total_composite_std": 0.17405925691127777, "reward_total_mean": 0.8894380331039429, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9654116630554199, "rewards/meter/std": 0.034304678440093994, "rewards/repeat_penalty/mean": 0.9166666865348816, "rewards/repeat_penalty/std": 0.15430334210395813, "rewards/total_composite/mean": 0.8894380331039429, "rewards/total_composite/std": 0.17405925691127777, "sampling/importance_sampling_ratio/max": 1.4003076553344727, "sampling/importance_sampling_ratio/mean": 0.99860018491745, "sampling/importance_sampling_ratio/min": 0.3639322817325592, "sampling/sampling_logp_difference/max": 1.0107874870300293, "sampling/sampling_logp_difference/mean": 0.020010532811284065, "step": 697 }, { "clip_ratio/high_max": 0.015907755587249994, "clip_ratio/high_mean": 0.015907755587249994, "clip_ratio/low_mean": 0.007161757908761501, "clip_ratio/low_min": 0.007161757908761501, "clip_ratio/region_mean": 0.023069513496011496, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 412.0, "completions/mean_length": 382.25, "completions/mean_terminated_length": 363.71429443359375, "completions/min_length": 321.0, "completions/min_terminated_length": 321.0, "entropy": 0.18515709601342678, "epoch": 0.0280355062858979, "frac_reward_zero_std": 0.0, "grad_norm": 2.2967092990875244, "learning_rate": 7.88787878787879e-06, "loss": -0.0873, "num_tokens": 1519450.0, "reward": 0.18387337028980255, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8854166865348816, "reward_count_adherence_std": 0.1254950612783432, "reward_meter_mean": 0.6105729937553406, "reward_meter_std": 0.4790833294391632, "reward_repeat_penalty_mean": 0.3964124917984009, "reward_repeat_penalty_std": 0.25513792037963867, "reward_std": 0.21844197809696198, "reward_total_composite_mean": 0.18387337028980255, "reward_total_composite_std": 0.21844197809696198, "reward_total_mean": 0.18387337028980255, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8854166865348816, "rewards/count_adherence/std": 0.1254950612783432, "rewards/meter/mean": 0.6105729937553406, "rewards/meter/std": 0.4790833294391632, "rewards/repeat_penalty/mean": 0.3964124917984009, "rewards/repeat_penalty/std": 0.25513792037963867, "rewards/total_composite/mean": 0.18387337028980255, "rewards/total_composite/std": 0.21844197809696198, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9987672567367554, "sampling/importance_sampling_ratio/min": 0.001238961354829371, "sampling/sampling_logp_difference/max": 6.693481922149658, "sampling/sampling_logp_difference/mean": 0.0396236851811409, "step": 698 }, { "clip_ratio/high_max": 0.02036348171532154, "clip_ratio/high_mean": 0.02036348171532154, "clip_ratio/low_mean": 0.00747219193726778, "clip_ratio/low_min": 0.00747219193726778, "clip_ratio/region_mean": 0.02783567365258932, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 67.125, "completions/mean_terminated_length": 67.125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.14588068891316652, "epoch": 0.028075671767682855, "frac_reward_zero_std": 0.0, "grad_norm": 8.473615646362305, "learning_rate": 7.884848484848485e-06, "loss": 0.0056, "num_tokens": 1521331.0, "reward": 0.8282062411308289, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9927859306335449, "reward_meter_std": 0.014541360549628735, "reward_repeat_penalty_mean": 0.8333333730697632, "reward_repeat_penalty_std": 0.17817415297031403, "reward_std": 0.18183691799640656, "reward_total_composite_mean": 0.8282062411308289, "reward_total_composite_std": 0.18183693289756775, "reward_total_mean": 0.8282062411308289, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9927859306335449, "rewards/meter/std": 0.014541360549628735, "rewards/repeat_penalty/mean": 0.8333333730697632, "rewards/repeat_penalty/std": 0.17817415297031403, "rewards/total_composite/mean": 0.8282062411308289, "rewards/total_composite/std": 0.18183693289756775, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9997567534446716, "sampling/importance_sampling_ratio/min": 0.1795266717672348, "sampling/sampling_logp_difference/max": 1.766160249710083, "sampling/sampling_logp_difference/mean": 0.03374454379081726, "step": 699 }, { "clip_ratio/high_max": 0.006157157360576093, "clip_ratio/high_mean": 0.006157157360576093, "clip_ratio/low_mean": 0.00364298140630126, "clip_ratio/low_min": 0.00364298140630126, "clip_ratio/region_mean": 0.009800138766877353, "completions/clipped_ratio": 0.0, "completions/max_length": 444.0, "completions/max_terminated_length": 444.0, "completions/mean_length": 414.875, "completions/mean_terminated_length": 414.875, "completions/min_length": 401.0, "completions/min_terminated_length": 401.0, "entropy": 0.045434954110533, "epoch": 0.02811583724946781, "frac_reward_zero_std": 0.0, "grad_norm": 0.8298696279525757, "learning_rate": 7.881818181818182e-06, "loss": 0.0097, "num_tokens": 1526242.0, "reward": 0.16019713878631592, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.029462797567248344, "reward_meter_mean": 0.9960967302322388, "reward_meter_std": 0.0013218529056757689, "reward_repeat_penalty_mean": 0.19121241569519043, "reward_repeat_penalty_std": 0.07494427263736725, "reward_std": 0.061176449060440063, "reward_total_composite_mean": 0.16019713878631592, "reward_total_composite_std": 0.061176449060440063, "reward_total_mean": 0.16019713878631592, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.029462797567248344, "rewards/meter/mean": 0.9960967302322388, "rewards/meter/std": 0.0013218529056757689, "rewards/repeat_penalty/mean": 0.19121241569519043, "rewards/repeat_penalty/std": 0.07494427263736725, "rewards/total_composite/mean": 0.16019713878631592, "rewards/total_composite/std": 0.061176449060440063, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0012154579162598, "sampling/importance_sampling_ratio/min": 0.238611102104187, "sampling/sampling_logp_difference/max": 1.432920217514038, "sampling/sampling_logp_difference/mean": 0.008506695739924908, "step": 700 }, { "epoch": 0.02811583724946781, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.11538461538461539, "eval_completions/max_length": 471.9230769230769, "eval_completions/max_terminated_length": 415.15384615384613, "eval_completions/mean_length": 249.43269230769232, "eval_completions/mean_terminated_length": 217.6739994929387, "eval_completions/min_length": 68.53846153846153, "eval_completions/min_terminated_length": 68.53846153846153, "eval_entropy": 0.1376804428604933, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1526242.0, "eval_reward": 0.29438196466519284, "eval_reward_arabic_clean_mean": 0.9038461538461539, "eval_reward_arabic_clean_std": 0.2343954168833219, "eval_reward_count_adherence_mean": 0.8881359283740704, "eval_reward_count_adherence_std": 0.16248861929545036, "eval_reward_meter_mean": 0.6321157022164419, "eval_reward_meter_std": 0.37711624113413006, "eval_reward_repeat_penalty_mean": 0.5953293947073129, "eval_reward_repeat_penalty_std": 0.32899803152451146, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.29438196466519284, "eval_reward_total_composite_std": 0.28008361991781455, "eval_reward_total_mean": 0.29438196466519284, "eval_rewards/arabic_clean/mean": 0.9038461538461539, "eval_rewards/arabic_clean/std": 0.2343954168833219, "eval_rewards/count_adherence/mean": 0.8881359283740704, "eval_rewards/count_adherence/std": 0.16248861929545036, "eval_rewards/meter/mean": 0.6321157022164419, "eval_rewards/meter/std": 0.37711624113413006, "eval_rewards/repeat_penalty/mean": 0.5953293947073129, "eval_rewards/repeat_penalty/std": 0.32899803152451146, "eval_rewards/total_composite/mean": 0.29438196466519284, "eval_rewards/total_composite/std": 0.28008361991781455, "eval_runtime": 87.7418, "eval_samples_per_second": 1.185, "eval_sampling/importance_sampling_ratio/max": 1.455959943624643, "eval_sampling/importance_sampling_ratio/mean": 1.0041690973135142, "eval_sampling/importance_sampling_ratio/min": 0.4343368663237645, "eval_sampling/sampling_logp_difference/max": 0.881988103573139, "eval_sampling/sampling_logp_difference/mean": 0.012457216982371531, "eval_steps_per_second": 0.148, "step": 700 }, { "clip_ratio/high_max": 0.015958538744598627, "clip_ratio/high_mean": 0.015958538744598627, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.015958538744598627, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 138.75, "completions/mean_terminated_length": 85.42857360839844, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.11331802047789097, "epoch": 0.028156002731252763, "frac_reward_zero_std": 0.0, "grad_norm": 2.5312631130218506, "learning_rate": 7.87878787878788e-06, "loss": -0.12, "num_tokens": 1528168.0, "reward": 0.6387161016464233, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.646858811378479, "reward_meter_std": 0.40135496854782104, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.41526278853416443, "reward_total_composite_mean": 0.6387161016464233, "reward_total_composite_std": 0.41526278853416443, "reward_total_mean": 0.6387161016464233, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.646858811378479, "rewards/meter/std": 0.40135496854782104, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6387161016464233, "rewards/total_composite/std": 0.41526278853416443, "sampling/importance_sampling_ratio/max": 1.6849335432052612, "sampling/importance_sampling_ratio/mean": 1.0036530494689941, "sampling/importance_sampling_ratio/min": 0.5280055403709412, "sampling/sampling_logp_difference/max": 0.638648509979248, "sampling/sampling_logp_difference/mean": 0.017966095358133316, "step": 701 }, { "clip_ratio/high_max": 0.0155344782397151, "clip_ratio/high_mean": 0.0155344782397151, "clip_ratio/low_mean": 0.01317842910066247, "clip_ratio/low_min": 0.01317842910066247, "clip_ratio/region_mean": 0.02871290734037757, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 79.0, "completions/mean_length": 128.25, "completions/mean_terminated_length": 73.42857360839844, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.37723080068826675, "epoch": 0.028196168213037717, "frac_reward_zero_std": 0.0, "grad_norm": 3.0773770809173584, "learning_rate": 7.875757575757577e-06, "loss": -0.0691, "num_tokens": 1529770.0, "reward": 0.33759811520576477, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3803873062133789, "reward_meter_std": 0.26946189999580383, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.3016302287578583, "reward_total_composite_mean": 0.33759811520576477, "reward_total_composite_std": 0.30163025856018066, "reward_total_mean": 0.33759811520576477, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3803873062133789, "rewards/meter/std": 0.26946189999580383, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.33759811520576477, "rewards/total_composite/std": 0.30163025856018066, "sampling/importance_sampling_ratio/max": 1.7729606628417969, "sampling/importance_sampling_ratio/mean": 1.011560082435608, "sampling/importance_sampling_ratio/min": 0.14418688416481018, "sampling/sampling_logp_difference/max": 1.9366450309753418, "sampling/sampling_logp_difference/mean": 0.04749147966504097, "step": 702 }, { "clip_ratio/high_max": 0.004737977171316743, "clip_ratio/high_mean": 0.004737977171316743, "clip_ratio/low_mean": 0.0028346364269964397, "clip_ratio/low_min": 0.0028346364269964397, "clip_ratio/region_mean": 0.007572613598313183, "completions/clipped_ratio": 0.0, "completions/max_length": 242.0, "completions/max_terminated_length": 242.0, "completions/mean_length": 229.75, "completions/mean_terminated_length": 229.75, "completions/min_length": 206.0, "completions/min_terminated_length": 206.0, "entropy": 0.03166929807048291, "epoch": 0.02823633369482267, "frac_reward_zero_std": 0.0, "grad_norm": 1.2964930534362793, "learning_rate": 7.872727272727273e-06, "loss": -0.0245, "num_tokens": 1533320.0, "reward": 0.2607119679450989, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9970081448554993, "reward_meter_std": 0.001187506248243153, "reward_repeat_penalty_mean": 0.2613636255264282, "reward_repeat_penalty_std": 0.197011336684227, "reward_std": 0.1968017816543579, "reward_total_composite_mean": 0.2607119679450989, "reward_total_composite_std": 0.19680176675319672, "reward_total_mean": 0.2607119679450989, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9970081448554993, "rewards/meter/std": 0.001187506248243153, "rewards/repeat_penalty/mean": 0.2613636255264282, "rewards/repeat_penalty/std": 0.197011336684227, "rewards/total_composite/mean": 0.2607119679450989, "rewards/total_composite/std": 0.19680176675319672, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9988393187522888, "sampling/importance_sampling_ratio/min": 0.009685891680419445, "sampling/sampling_logp_difference/max": 4.6370849609375, "sampling/sampling_logp_difference/mean": 0.014087834395468235, "step": 703 }, { "clip_ratio/high_max": 0.009915342554450035, "clip_ratio/high_mean": 0.009915342554450035, "clip_ratio/low_mean": 0.01385743310675025, "clip_ratio/low_min": 0.01385743310675025, "clip_ratio/region_mean": 0.023772775661200285, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 368.0, "completions/mean_length": 364.5, "completions/mean_terminated_length": 315.3333435058594, "completions/min_length": 229.0, "completions/min_terminated_length": 229.0, "entropy": 0.2017015889286995, "epoch": 0.028276499176607624, "frac_reward_zero_std": 0.0, "grad_norm": 3.015087127685547, "learning_rate": 7.86969696969697e-06, "loss": -0.1074, "num_tokens": 1536668.0, "reward": 0.0969100296497345, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.8522727489471436, "reward_count_adherence_std": 0.21697448194026947, "reward_meter_mean": 0.20065514743328094, "reward_meter_std": 0.3053584098815918, "reward_repeat_penalty_mean": 0.6299689412117004, "reward_repeat_penalty_std": 0.28235092759132385, "reward_std": 0.21232594549655914, "reward_total_composite_mean": 0.0969100296497345, "reward_total_composite_std": 0.21232596039772034, "reward_total_mean": 0.0969100296497345, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.8522727489471436, "rewards/count_adherence/std": 0.21697448194026947, "rewards/meter/mean": 0.20065514743328094, "rewards/meter/std": 0.3053584098815918, "rewards/repeat_penalty/mean": 0.6299689412117004, "rewards/repeat_penalty/std": 0.28235092759132385, "rewards/total_composite/mean": 0.0969100296497345, "rewards/total_composite/std": 0.21232596039772034, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9969695806503296, "sampling/importance_sampling_ratio/min": 0.08501863479614258, "sampling/sampling_logp_difference/max": 2.4648847579956055, "sampling/sampling_logp_difference/mean": 0.04316805675625801, "step": 704 }, { "clip_ratio/high_max": 0.006355932215228677, "clip_ratio/high_mean": 0.006355932215228677, "clip_ratio/low_mean": 0.006398809840902686, "clip_ratio/low_min": 0.006398809840902686, "clip_ratio/region_mean": 0.012754742056131363, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 58.75, "completions/mean_terminated_length": 58.75, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.053199955029413104, "epoch": 0.02831666465839258, "frac_reward_zero_std": 0.0, "grad_norm": 2.615363836288452, "learning_rate": 7.866666666666667e-06, "loss": -0.0075, "num_tokens": 1538402.0, "reward": 0.909184455871582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9921605587005615, "reward_meter_std": 0.006017809733748436, "reward_repeat_penalty_mean": 0.9166666865348816, "reward_repeat_penalty_std": 0.15430334210395813, "reward_std": 0.15155236423015594, "reward_total_composite_mean": 0.909184455871582, "reward_total_composite_std": 0.15155236423015594, "reward_total_mean": 0.909184455871582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9921605587005615, "rewards/meter/std": 0.006017809733748436, "rewards/repeat_penalty/mean": 0.9166666865348816, "rewards/repeat_penalty/std": 0.15430334210395813, "rewards/total_composite/mean": 0.909184455871582, "rewards/total_composite/std": 0.15155236423015594, "sampling/importance_sampling_ratio/max": 1.5749088525772095, "sampling/importance_sampling_ratio/mean": 0.9994084239006042, "sampling/importance_sampling_ratio/min": 0.01880229450762272, "sampling/sampling_logp_difference/max": 3.973776340484619, "sampling/sampling_logp_difference/mean": 0.021948276087641716, "step": 705 }, { "clip_ratio/high_max": 0.01414728700183332, "clip_ratio/high_mean": 0.01414728700183332, "clip_ratio/low_mean": 0.0027777778450399637, "clip_ratio/low_min": 0.0027777778450399637, "clip_ratio/region_mean": 0.016925064846873283, "completions/clipped_ratio": 0.0, "completions/max_length": 45.0, "completions/max_terminated_length": 45.0, "completions/mean_length": 44.75, "completions/mean_terminated_length": 44.75, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.13661748263984919, "epoch": 0.028356830140177532, "frac_reward_zero_std": 0.0, "grad_norm": 4.515374183654785, "learning_rate": 7.863636363636364e-06, "loss": 0.0093, "num_tokens": 1539816.0, "reward": 0.9157871603965759, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9157871603965759, "reward_meter_std": 0.05085242539644241, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.05085243284702301, "reward_total_composite_mean": 0.9157871603965759, "reward_total_composite_std": 0.05085242539644241, "reward_total_mean": 0.9157871603965759, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9157871603965759, "rewards/meter/std": 0.05085242539644241, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9157871603965759, "rewards/total_composite/std": 0.05085242539644241, "sampling/importance_sampling_ratio/max": 1.2550123929977417, "sampling/importance_sampling_ratio/mean": 0.997020423412323, "sampling/importance_sampling_ratio/min": 0.4525808095932007, "sampling/sampling_logp_difference/max": 0.7927889823913574, "sampling/sampling_logp_difference/mean": 0.02820507250726223, "step": 706 }, { "clip_ratio/high_max": 0.013377037481404841, "clip_ratio/high_mean": 0.013377037481404841, "clip_ratio/low_mean": 0.007405462441965938, "clip_ratio/low_min": 0.007405462441965938, "clip_ratio/region_mean": 0.02078249992337078, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 84.625, "completions/mean_terminated_length": 84.625, "completions/min_length": 83.0, "completions/min_terminated_length": 83.0, "entropy": 0.15222040470689535, "epoch": 0.028396995621962486, "frac_reward_zero_std": 0.0, "grad_norm": 2.2196364402770996, "learning_rate": 7.860606060606062e-06, "loss": -0.0003, "num_tokens": 1541901.0, "reward": 0.9956607818603516, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9956607818603516, "reward_meter_std": 0.0007934165187180042, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0007934237364679575, "reward_total_composite_mean": 0.9956607818603516, "reward_total_composite_std": 0.0007934165187180042, "reward_total_mean": 0.9956607818603516, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9956607818603516, "rewards/meter/std": 0.0007934165187180042, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9956607818603516, "rewards/total_composite/std": 0.0007934165187180042, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0091147422790527, "sampling/importance_sampling_ratio/min": 0.4566366374492645, "sampling/sampling_logp_difference/max": 0.8360247611999512, "sampling/sampling_logp_difference/mean": 0.026080820709466934, "step": 707 }, { "clip_ratio/high_max": 0.010587403550744057, "clip_ratio/high_mean": 0.010587403550744057, "clip_ratio/low_mean": 0.012675938894972205, "clip_ratio/low_min": 0.012675938894972205, "clip_ratio/region_mean": 0.023263342445716262, "completions/clipped_ratio": 0.0, "completions/max_length": 358.0, "completions/max_terminated_length": 358.0, "completions/mean_length": 330.75, "completions/mean_terminated_length": 330.75, "completions/min_length": 284.0, "completions/min_terminated_length": 284.0, "entropy": 0.10461874585598707, "epoch": 0.02843716110374744, "frac_reward_zero_std": 0.0, "grad_norm": 2.581402063369751, "learning_rate": 7.857575757575759e-06, "loss": 0.0303, "num_tokens": 1546099.0, "reward": 0.2035118043422699, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9027777910232544, "reward_count_adherence_std": 0.03928370773792267, "reward_meter_mean": 0.5674466490745544, "reward_meter_std": 0.4153376519680023, "reward_repeat_penalty_mean": 0.34049707651138306, "reward_repeat_penalty_std": 0.22640277445316315, "reward_std": 0.23429378867149353, "reward_total_composite_mean": 0.2035118043422699, "reward_total_composite_std": 0.23429380357265472, "reward_total_mean": 0.2035118043422699, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9027777910232544, "rewards/count_adherence/std": 0.03928370773792267, "rewards/meter/mean": 0.5674466490745544, "rewards/meter/std": 0.4153376519680023, "rewards/repeat_penalty/mean": 0.34049707651138306, "rewards/repeat_penalty/std": 0.22640277445316315, "rewards/total_composite/mean": 0.2035118043422699, "rewards/total_composite/std": 0.23429380357265472, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.002025842666626, "sampling/importance_sampling_ratio/min": 0.026643957942724228, "sampling/sampling_logp_difference/max": 3.625192880630493, "sampling/sampling_logp_difference/mean": 0.023940538987517357, "step": 708 }, { "clip_ratio/high_max": 0.005005840037483722, "clip_ratio/high_mean": 0.005005840037483722, "clip_ratio/low_mean": 0.0015743073308840394, "clip_ratio/low_min": 0.0015743073308840394, "clip_ratio/region_mean": 0.006580147368367761, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 472.0, "completions/mean_length": 452.25, "completions/mean_terminated_length": 416.3999938964844, "completions/min_length": 372.0, "completions/min_terminated_length": 372.0, "entropy": 0.0702343238517642, "epoch": 0.028477326585532394, "frac_reward_zero_std": 0.0, "grad_norm": 0.8571996688842773, "learning_rate": 7.854545454545454e-06, "loss": -0.3582, "num_tokens": 1549805.0, "reward": 0.25732704997062683, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.6590909361839294, "reward_count_adherence_std": 0.39101481437683105, "reward_meter_mean": 0.8675932884216309, "reward_meter_std": 0.35074320435523987, "reward_repeat_penalty_mean": 0.6495236158370972, "reward_repeat_penalty_std": 0.30929210782051086, "reward_std": 0.2531158924102783, "reward_total_composite_mean": 0.25732704997062683, "reward_total_composite_std": 0.2531158924102783, "reward_total_mean": 0.25732704997062683, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.6590909361839294, "rewards/count_adherence/std": 0.39101481437683105, "rewards/meter/mean": 0.8675932884216309, "rewards/meter/std": 0.35074320435523987, "rewards/repeat_penalty/mean": 0.6495236158370972, "rewards/repeat_penalty/std": 0.30929210782051086, "rewards/total_composite/mean": 0.25732704997062683, "rewards/total_composite/std": 0.2531158924102783, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0035980939865112, "sampling/importance_sampling_ratio/min": 0.05962793529033661, "sampling/sampling_logp_difference/max": 2.8196310997009277, "sampling/sampling_logp_difference/mean": 0.019949674606323242, "step": 709 }, { "clip_ratio/high_max": 0.004514876694884151, "clip_ratio/high_mean": 0.004514876694884151, "clip_ratio/low_mean": 0.0021170872496441007, "clip_ratio/low_min": 0.0021170872496441007, "clip_ratio/region_mean": 0.006631963944528252, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 497.0, "completions/mean_length": 474.875, "completions/mean_terminated_length": 469.5714416503906, "completions/min_length": 439.0, "completions/min_terminated_length": 439.0, "entropy": 0.05670151812955737, "epoch": 0.028517492067317348, "frac_reward_zero_std": 0.0, "grad_norm": 0.6216875314712524, "learning_rate": 7.851515151515152e-06, "loss": -0.2247, "num_tokens": 1554988.0, "reward": 0.3333708643913269, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.7767857313156128, "reward_count_adherence_std": 0.20360276103019714, "reward_meter_mean": 0.9897267818450928, "reward_meter_std": 0.019744135439395905, "reward_repeat_penalty_mean": 0.5224603414535522, "reward_repeat_penalty_std": 0.23697951436042786, "reward_std": 0.18023891746997833, "reward_total_composite_mean": 0.3333708643913269, "reward_total_composite_std": 0.18023891746997833, "reward_total_mean": 0.3333708643913269, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.7767857313156128, "rewards/count_adherence/std": 0.20360276103019714, "rewards/meter/mean": 0.9897267818450928, "rewards/meter/std": 0.019744135439395905, "rewards/repeat_penalty/mean": 0.5224603414535522, "rewards/repeat_penalty/std": 0.23697951436042786, "rewards/total_composite/mean": 0.3333708643913269, "rewards/total_composite/std": 0.18023891746997833, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0017552375793457, "sampling/importance_sampling_ratio/min": 0.08268983662128448, "sampling/sampling_logp_difference/max": 2.4926586151123047, "sampling/sampling_logp_difference/mean": 0.010584630072116852, "step": 710 }, { "clip_ratio/high_max": 0.0016890882980078459, "clip_ratio/high_mean": 0.0016890882980078459, "clip_ratio/low_mean": 0.0008561643480788916, "clip_ratio/low_min": 0.0008561643480788916, "clip_ratio/region_mean": 0.0025452526460867375, "completions/clipped_ratio": 0.0, "completions/max_length": 461.0, "completions/max_terminated_length": 461.0, "completions/mean_length": 440.25, "completions/mean_terminated_length": 440.25, "completions/min_length": 436.0, "completions/min_terminated_length": 436.0, "entropy": 0.011412000167183578, "epoch": 0.028557657549102302, "frac_reward_zero_std": 0.0, "grad_norm": 0.6046677231788635, "learning_rate": 7.848484848484849e-06, "loss": -0.0049, "num_tokens": 1560550.0, "reward": 0.053851306438446045, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7946428060531616, "reward_count_adherence_std": 0.025253823027014732, "reward_meter_mean": 0.9979845285415649, "reward_meter_std": 0.00018585202633403242, "reward_repeat_penalty_mean": 0.0676877498626709, "reward_repeat_penalty_std": 0.023803479969501495, "reward_std": 0.019493909552693367, "reward_total_composite_mean": 0.053851306438446045, "reward_total_composite_std": 0.019493911415338516, "reward_total_mean": 0.053851306438446045, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7946428060531616, "rewards/count_adherence/std": 0.025253823027014732, "rewards/meter/mean": 0.9979845285415649, "rewards/meter/std": 0.00018585202633403242, "rewards/repeat_penalty/mean": 0.0676877498626709, "rewards/repeat_penalty/std": 0.023803479969501495, "rewards/total_composite/mean": 0.053851306438446045, "rewards/total_composite/std": 0.019493911415338516, "sampling/importance_sampling_ratio/max": 1.460545539855957, "sampling/importance_sampling_ratio/mean": 1.0001322031021118, "sampling/importance_sampling_ratio/min": 0.30463549494743347, "sampling/sampling_logp_difference/max": 1.1886392831802368, "sampling/sampling_logp_difference/mean": 0.003577793249860406, "step": 711 }, { "clip_ratio/high_max": 0.014235412469133735, "clip_ratio/high_mean": 0.014235412469133735, "clip_ratio/low_mean": 0.016306631732732058, "clip_ratio/low_min": 0.016306631732732058, "clip_ratio/region_mean": 0.030542044201865792, "completions/clipped_ratio": 0.0, "completions/max_length": 71.0, "completions/max_terminated_length": 71.0, "completions/mean_length": 69.5, "completions/mean_terminated_length": 69.5, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.1954718241468072, "epoch": 0.028597823030887256, "frac_reward_zero_std": 0.0, "grad_norm": 4.805282115936279, "learning_rate": 7.845454545454546e-06, "loss": 0.0004, "num_tokens": 1562410.0, "reward": 0.7055873274803162, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8851493000984192, "reward_meter_std": 0.1646534502506256, "reward_repeat_penalty_mean": 0.7916666865348816, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.216535747051239, "reward_total_composite_mean": 0.7055873274803162, "reward_total_composite_std": 0.21653573215007782, "reward_total_mean": 0.7055873274803162, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8851493000984192, "rewards/meter/std": 0.1646534502506256, "rewards/repeat_penalty/mean": 0.7916666865348816, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.7055873274803162, "rewards/total_composite/std": 0.21653573215007782, "sampling/importance_sampling_ratio/max": 1.8839155435562134, "sampling/importance_sampling_ratio/mean": 0.997905969619751, "sampling/importance_sampling_ratio/min": 0.1394468992948532, "sampling/sampling_logp_difference/max": 1.9700713157653809, "sampling/sampling_logp_difference/mean": 0.03851144388318062, "step": 712 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.02863798851267221, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 7.842424242424243e-06, "loss": 0.0, "num_tokens": 1564234.0, "reward": 0.4566306471824646, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8166667222976685, "reward_count_adherence_std": 0.030860668048262596, "reward_meter_mean": 0.9704335927963257, "reward_meter_std": 0.07359233498573303, "reward_repeat_penalty_mean": 0.5789903998374939, "reward_repeat_penalty_std": 0.045423366129398346, "reward_std": 0.02297401800751686, "reward_total_composite_mean": 0.4566306471824646, "reward_total_composite_std": 0.02297402359545231, "reward_total_mean": 0.4566306471824646, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8166667222976685, "rewards/count_adherence/std": 0.030860668048262596, "rewards/meter/mean": 0.9704335927963257, "rewards/meter/std": 0.07359233498573303, "rewards/repeat_penalty/mean": 0.5789903998374939, "rewards/repeat_penalty/std": 0.045423366129398346, "rewards/total_composite/mean": 0.4566306471824646, "rewards/total_composite/std": 0.02297402359545231, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 713 }, { "clip_ratio/high_max": 0.0012019231216982007, "clip_ratio/high_mean": 0.0012019231216982007, "clip_ratio/low_mean": 0.0018522579048294574, "clip_ratio/low_min": 0.0018522579048294574, "clip_ratio/region_mean": 0.003054181026527658, "completions/clipped_ratio": 0.0, "completions/max_length": 345.0, "completions/max_terminated_length": 345.0, "completions/mean_length": 336.5, "completions/mean_terminated_length": 336.5, "completions/min_length": 311.0, "completions/min_terminated_length": 311.0, "entropy": 0.018028545891866088, "epoch": 0.028678153994457164, "frac_reward_zero_std": 0.0, "grad_norm": 0.7193350791931152, "learning_rate": 7.83939393939394e-06, "loss": 0.0251, "num_tokens": 1568398.0, "reward": 0.13619501888751984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9977849721908569, "reward_meter_std": 0.0006831432110629976, "reward_repeat_penalty_mean": 0.19117647409439087, "reward_repeat_penalty_std": 0.16262187063694, "reward_std": 0.11569356918334961, "reward_total_composite_mean": 0.13619501888751984, "reward_total_composite_std": 0.1156935766339302, "reward_total_mean": 0.13619501888751984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9977849721908569, "rewards/meter/std": 0.0006831432110629976, "rewards/repeat_penalty/mean": 0.19117647409439087, "rewards/repeat_penalty/std": 0.16262187063694, "rewards/total_composite/mean": 0.13619501888751984, "rewards/total_composite/std": 0.1156935766339302, "sampling/importance_sampling_ratio/max": 1.3743659257888794, "sampling/importance_sampling_ratio/mean": 0.9997386932373047, "sampling/importance_sampling_ratio/min": 0.2750125825405121, "sampling/sampling_logp_difference/max": 1.290938377380371, "sampling/sampling_logp_difference/mean": 0.003576630027964711, "step": 714 }, { "clip_ratio/high_max": 0.018382353708148003, "clip_ratio/high_mean": 0.018382353708148003, "clip_ratio/low_mean": 0.023657660058233887, "clip_ratio/low_min": 0.023657660058233887, "clip_ratio/region_mean": 0.04204001376638189, "completions/clipped_ratio": 0.0, "completions/max_length": 131.0, "completions/max_terminated_length": 131.0, "completions/mean_length": 123.625, "completions/mean_terminated_length": 123.625, "completions/min_length": 115.0, "completions/min_terminated_length": 115.0, "entropy": 0.23239293694496155, "epoch": 0.028718319476242118, "frac_reward_zero_std": 0.0, "grad_norm": 4.87160062789917, "learning_rate": 7.836363636363638e-06, "loss": 0.0035, "num_tokens": 1570787.0, "reward": 0.7246866822242737, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9901050329208374, "reward_meter_std": 0.0037112515419721603, "reward_repeat_penalty_mean": 0.7321428656578064, "reward_repeat_penalty_std": 0.1608559489250183, "reward_std": 0.15871338546276093, "reward_total_composite_mean": 0.7246866822242737, "reward_total_composite_std": 0.15871340036392212, "reward_total_mean": 0.7246866822242737, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9901050329208374, "rewards/meter/std": 0.0037112515419721603, "rewards/repeat_penalty/mean": 0.7321428656578064, "rewards/repeat_penalty/std": 0.1608559489250183, "rewards/total_composite/mean": 0.7246866822242737, "rewards/total_composite/std": 0.15871340036392212, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9998616576194763, "sampling/importance_sampling_ratio/min": 0.19606797397136688, "sampling/sampling_logp_difference/max": 1.6292939186096191, "sampling/sampling_logp_difference/mean": 0.04571465030312538, "step": 715 }, { "clip_ratio/high_max": 0.0044064579415135086, "clip_ratio/high_mean": 0.0044064579415135086, "clip_ratio/low_mean": 0.010836752247996628, "clip_ratio/low_min": 0.010836752247996628, "clip_ratio/region_mean": 0.015243210189510137, "completions/clipped_ratio": 0.0, "completions/max_length": 215.0, "completions/max_terminated_length": 215.0, "completions/mean_length": 175.75, "completions/mean_terminated_length": 175.75, "completions/min_length": 162.0, "completions/min_terminated_length": 162.0, "entropy": 0.15365072712302208, "epoch": 0.02875848495802707, "frac_reward_zero_std": 0.0, "grad_norm": 2.7540860176086426, "learning_rate": 7.833333333333333e-06, "loss": 0.0175, "num_tokens": 1573577.0, "reward": 0.4638897478580475, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.8235251903533936, "reward_meter_std": 0.28830382227897644, "reward_repeat_penalty_mean": 0.6091269850730896, "reward_repeat_penalty_std": 0.19641855359077454, "reward_std": 0.2275657057762146, "reward_total_composite_mean": 0.4638897478580475, "reward_total_composite_std": 0.2275657206773758, "reward_total_mean": 0.4638897478580475, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.8235251903533936, "rewards/meter/std": 0.28830382227897644, "rewards/repeat_penalty/mean": 0.6091269850730896, "rewards/repeat_penalty/std": 0.19641855359077454, "rewards/total_composite/mean": 0.4638897478580475, "rewards/total_composite/std": 0.2275657206773758, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0048706531524658, "sampling/importance_sampling_ratio/min": 0.09449966251850128, "sampling/sampling_logp_difference/max": 2.359158992767334, "sampling/sampling_logp_difference/mean": 0.02091868966817856, "step": 716 }, { "clip_ratio/high_max": 0.010442280676215887, "clip_ratio/high_mean": 0.010442280676215887, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.010442280676215887, "completions/clipped_ratio": 0.625, "completions/max_length": 512.0, "completions/max_terminated_length": 210.0, "completions/mean_length": 391.0, "completions/mean_terminated_length": 189.33334350585938, "completions/min_length": 156.0, "completions/min_terminated_length": 156.0, "entropy": 0.13471947237849236, "epoch": 0.028798650439812026, "frac_reward_zero_std": 0.0, "grad_norm": 1.3285834789276123, "learning_rate": 7.83030303030303e-06, "loss": -0.1657, "num_tokens": 1575801.0, "reward": 0.08441510796546936, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_count_adherence_mean": 0.824999988079071, "reward_count_adherence_std": 0.12817399203777313, "reward_meter_mean": 0.3074490427970886, "reward_meter_std": 0.2025083303451538, "reward_repeat_penalty_mean": 0.8395833373069763, "reward_repeat_penalty_std": 0.25571832060813904, "reward_std": 0.10946667194366455, "reward_total_composite_mean": 0.08441510796546936, "reward_total_composite_std": 0.10946666449308395, "reward_total_mean": 0.08441510796546936, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/count_adherence/mean": 0.824999988079071, "rewards/count_adherence/std": 0.12817399203777313, "rewards/meter/mean": 0.3074490427970886, "rewards/meter/std": 0.2025083303451538, "rewards/repeat_penalty/mean": 0.8395833373069763, "rewards/repeat_penalty/std": 0.25571832060813904, "rewards/total_composite/mean": 0.08441510796546936, "rewards/total_composite/std": 0.10946666449308395, "sampling/importance_sampling_ratio/max": 1.6081585884094238, "sampling/importance_sampling_ratio/mean": 1.002199649810791, "sampling/importance_sampling_ratio/min": 0.0001644995791139081, "sampling/sampling_logp_difference/max": 8.712602615356445, "sampling/sampling_logp_difference/mean": 0.05243195965886116, "step": 717 }, { "clip_ratio/high_max": 0.023710741428658366, "clip_ratio/high_mean": 0.023710741428658366, "clip_ratio/low_mean": 0.006465517450124025, "clip_ratio/low_min": 0.006465517450124025, "clip_ratio/region_mean": 0.03017625887878239, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 57.75, "completions/mean_terminated_length": 57.75, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.14472659677267075, "epoch": 0.02883881592159698, "frac_reward_zero_std": 0.0, "grad_norm": 6.637593746185303, "learning_rate": 7.827272727272728e-06, "loss": 0.0058, "num_tokens": 1577519.0, "reward": 0.9619162082672119, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9619162082672119, "reward_meter_std": 0.06612562388181686, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.06612562388181686, "reward_total_composite_mean": 0.9619162082672119, "reward_total_composite_std": 0.06612562388181686, "reward_total_mean": 0.9619162082672119, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9619162082672119, "rewards/meter/std": 0.06612562388181686, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9619162082672119, "rewards/total_composite/std": 0.06612562388181686, "sampling/importance_sampling_ratio/max": 1.769487977027893, "sampling/importance_sampling_ratio/mean": 1.004167914390564, "sampling/importance_sampling_ratio/min": 0.20535492897033691, "sampling/sampling_logp_difference/max": 1.5830154418945312, "sampling/sampling_logp_difference/mean": 0.03136257454752922, "step": 718 }, { "clip_ratio/high_max": 0.005198180675506592, "clip_ratio/high_mean": 0.005198180675506592, "clip_ratio/low_mean": 0.0008802816737443209, "clip_ratio/low_min": 0.0008802816737443209, "clip_ratio/region_mean": 0.006078462349250913, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 171.0, "completions/mean_length": 208.875, "completions/mean_terminated_length": 165.57144165039062, "completions/min_length": 142.0, "completions/min_terminated_length": 142.0, "entropy": 0.07858177460730076, "epoch": 0.028878981403381934, "frac_reward_zero_std": 0.0, "grad_norm": 0.982711136341095, "learning_rate": 7.824242424242425e-06, "loss": -0.1972, "num_tokens": 1580014.0, "reward": 0.36472243070602417, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8615807294845581, "reward_meter_std": 0.1756223738193512, "reward_repeat_penalty_mean": 0.5022321939468384, "reward_repeat_penalty_std": 0.19195686280727386, "reward_std": 0.1904788315296173, "reward_total_composite_mean": 0.36472243070602417, "reward_total_composite_std": 0.1904788464307785, "reward_total_mean": 0.36472243070602417, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8615807294845581, "rewards/meter/std": 0.1756223738193512, "rewards/repeat_penalty/mean": 0.5022321939468384, "rewards/repeat_penalty/std": 0.19195686280727386, "rewards/total_composite/mean": 0.36472243070602417, "rewards/total_composite/std": 0.1904788464307785, "sampling/importance_sampling_ratio/max": 1.6336287260055542, "sampling/importance_sampling_ratio/mean": 1.0052262544631958, "sampling/importance_sampling_ratio/min": 0.5830943584442139, "sampling/sampling_logp_difference/max": 0.5394062995910645, "sampling/sampling_logp_difference/mean": 0.011406843550503254, "step": 719 }, { "clip_ratio/high_max": 0.015587894711643457, "clip_ratio/high_mean": 0.015587894711643457, "clip_ratio/low_mean": 0.0012820513220503926, "clip_ratio/low_min": 0.0012820513220503926, "clip_ratio/region_mean": 0.01686994603369385, "completions/clipped_ratio": 0.0, "completions/max_length": 243.0, "completions/max_terminated_length": 243.0, "completions/mean_length": 228.625, "completions/mean_terminated_length": 228.625, "completions/min_length": 195.0, "completions/min_terminated_length": 195.0, "entropy": 0.08757321583107114, "epoch": 0.028919146885166887, "frac_reward_zero_std": 0.0, "grad_norm": 1.5212147235870361, "learning_rate": 7.821212121212122e-06, "loss": -0.0478, "num_tokens": 1583419.0, "reward": 0.3818710744380951, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.06613000482320786, "reward_meter_mean": 0.9813181161880493, "reward_meter_std": 0.009512215852737427, "reward_repeat_penalty_mean": 0.527634859085083, "reward_repeat_penalty_std": 0.18670302629470825, "reward_std": 0.13756079971790314, "reward_total_composite_mean": 0.3818710744380951, "reward_total_composite_std": 0.13756081461906433, "reward_total_mean": 0.3818710744380951, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.06613000482320786, "rewards/meter/mean": 0.9813181161880493, "rewards/meter/std": 0.009512215852737427, "rewards/repeat_penalty/mean": 0.527634859085083, "rewards/repeat_penalty/std": 0.18670302629470825, "rewards/total_composite/mean": 0.3818710744380951, "rewards/total_composite/std": 0.13756081461906433, "sampling/importance_sampling_ratio/max": 1.7837820053100586, "sampling/importance_sampling_ratio/mean": 1.0003083944320679, "sampling/importance_sampling_ratio/min": 0.14308412373065948, "sampling/sampling_logp_difference/max": 1.9443225860595703, "sampling/sampling_logp_difference/mean": 0.014808963052928448, "step": 720 }, { "clip_ratio/high_max": 0.05381742771714926, "clip_ratio/high_mean": 0.05381742771714926, "clip_ratio/low_mean": 0.051155281253159046, "clip_ratio/low_min": 0.051155281253159046, "clip_ratio/region_mean": 0.1049727089703083, "completions/clipped_ratio": 0.0, "completions/max_length": 69.0, "completions/max_terminated_length": 69.0, "completions/mean_length": 65.0, "completions/mean_terminated_length": 65.0, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.5916384495794773, "epoch": 0.02895931236695184, "frac_reward_zero_std": 0.0, "grad_norm": 9.25263786315918, "learning_rate": 7.81818181818182e-06, "loss": -0.0114, "num_tokens": 1585267.0, "reward": 0.5946333408355713, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6475868821144104, "reward_meter_std": 0.3421926498413086, "reward_repeat_penalty_mean": 0.9166666865348816, "reward_repeat_penalty_std": 0.15430334210395813, "reward_std": 0.34638410806655884, "reward_total_composite_mean": 0.5946333408355713, "reward_total_composite_std": 0.34638410806655884, "reward_total_mean": 0.5946333408355713, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6475868821144104, "rewards/meter/std": 0.3421926498413086, "rewards/repeat_penalty/mean": 0.9166666865348816, "rewards/repeat_penalty/std": 0.15430334210395813, "rewards/total_composite/mean": 0.5946333408355713, "rewards/total_composite/std": 0.34638410806655884, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.991131603717804, "sampling/importance_sampling_ratio/min": 0.052791085094213486, "sampling/sampling_logp_difference/max": 2.941412925720215, "sampling/sampling_logp_difference/mean": 0.1203828752040863, "step": 721 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 92.0, "completions/max_terminated_length": 92.0, "completions/mean_length": 48.25, "completions/mean_terminated_length": 48.25, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.10689277853816748, "epoch": 0.028999477848736795, "frac_reward_zero_std": 0.0, "grad_norm": 7.886468410491943, "learning_rate": 7.815151515151515e-06, "loss": 0.3273, "num_tokens": 1586837.0, "reward": 0.8698122501373291, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.9944906830787659, "reward_meter_std": 0.0011895333882421255, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.35145723819732666, "reward_total_composite_mean": 0.8698122501373291, "reward_total_composite_std": 0.35145723819732666, "reward_total_mean": 0.8698122501373291, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.9944906830787659, "rewards/meter/std": 0.0011895333882421255, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.8698122501373291, "rewards/total_composite/std": 0.35145723819732666, "sampling/importance_sampling_ratio/max": 1.3288551568984985, "sampling/importance_sampling_ratio/mean": 1.0014286041259766, "sampling/importance_sampling_ratio/min": 0.4765561819076538, "sampling/sampling_logp_difference/max": 0.7411696910858154, "sampling/sampling_logp_difference/mean": 0.01547156646847725, "step": 722 }, { "clip_ratio/high_max": 0.0007826215587556362, "clip_ratio/high_mean": 0.0007826215587556362, "clip_ratio/low_mean": 0.0007961043156683445, "clip_ratio/low_min": 0.0007961043156683445, "clip_ratio/region_mean": 0.0015787258744239807, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 494.0, "completions/mean_length": 485.75, "completions/mean_terminated_length": 470.0, "completions/min_length": 452.0, "completions/min_terminated_length": 452.0, "entropy": 0.018016068963333964, "epoch": 0.02903964333052175, "frac_reward_zero_std": 0.0, "grad_norm": 0.8348656892776489, "learning_rate": 7.812121212121213e-06, "loss": -0.2014, "num_tokens": 1590899.0, "reward": 0.09887628257274628, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9464285373687744, "reward_count_adherence_std": 0.03306501731276512, "reward_meter_mean": 0.996362566947937, "reward_meter_std": 0.0027744658291339874, "reward_repeat_penalty_mean": 0.10470085591077805, "reward_repeat_penalty_std": 0.10408195108175278, "reward_std": 0.09698235988616943, "reward_total_composite_mean": 0.09887628257274628, "reward_total_composite_std": 0.09698235988616943, "reward_total_mean": 0.09887628257274628, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9464285373687744, "rewards/count_adherence/std": 0.03306501731276512, "rewards/meter/mean": 0.996362566947937, "rewards/meter/std": 0.0027744658291339874, "rewards/repeat_penalty/mean": 0.10470085591077805, "rewards/repeat_penalty/std": 0.10408195108175278, "rewards/total_composite/mean": 0.09887628257274628, "rewards/total_composite/std": 0.09698235988616943, "sampling/importance_sampling_ratio/max": 1.536428451538086, "sampling/importance_sampling_ratio/mean": 1.0003700256347656, "sampling/importance_sampling_ratio/min": 0.13657712936401367, "sampling/sampling_logp_difference/max": 1.990865707397461, "sampling/sampling_logp_difference/mean": 0.007093369495123625, "step": 723 }, { "clip_ratio/high_max": 0.002920488826930523, "clip_ratio/high_mean": 0.002920488826930523, "clip_ratio/low_mean": 0.0028556776233017445, "clip_ratio/low_min": 0.0028556776233017445, "clip_ratio/region_mean": 0.005776166450232267, "completions/clipped_ratio": 0.0, "completions/max_length": 403.0, "completions/max_terminated_length": 403.0, "completions/mean_length": 390.625, "completions/mean_terminated_length": 390.625, "completions/min_length": 379.0, "completions/min_terminated_length": 379.0, "entropy": 0.028950548847205937, "epoch": 0.029079808812306703, "frac_reward_zero_std": 0.0, "grad_norm": 1.2350369691848755, "learning_rate": 7.80909090909091e-06, "loss": 0.0117, "num_tokens": 1595768.0, "reward": 0.1255086362361908, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.734375, "reward_count_adherence_std": 0.04419417306780815, "reward_meter_mean": 0.9978216886520386, "reward_meter_std": 0.0007184247369877994, "reward_repeat_penalty_mean": 0.17863407731056213, "reward_repeat_penalty_std": 0.16910506784915924, "reward_std": 0.10828038305044174, "reward_total_composite_mean": 0.1255086362361908, "reward_total_composite_std": 0.10828039050102234, "reward_total_mean": 0.1255086362361908, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.734375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/meter/mean": 0.9978216886520386, "rewards/meter/std": 0.0007184247369877994, "rewards/repeat_penalty/mean": 0.17863407731056213, "rewards/repeat_penalty/std": 0.16910506784915924, "rewards/total_composite/mean": 0.1255086362361908, "rewards/total_composite/std": 0.10828039050102234, "sampling/importance_sampling_ratio/max": 1.8996793031692505, "sampling/importance_sampling_ratio/mean": 0.9993754625320435, "sampling/importance_sampling_ratio/min": 0.22015291452407837, "sampling/sampling_logp_difference/max": 1.5134329795837402, "sampling/sampling_logp_difference/mean": 0.0057006035931408405, "step": 724 }, { "clip_ratio/high_max": 0.007217321544885635, "clip_ratio/high_mean": 0.007217321544885635, "clip_ratio/low_mean": 0.004787406767718494, "clip_ratio/low_min": 0.004787406767718494, "clip_ratio/region_mean": 0.01200472831260413, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 136.75, "completions/mean_terminated_length": 83.14286041259766, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.09931796230375767, "epoch": 0.029119974294091657, "frac_reward_zero_std": 0.0, "grad_norm": 1.6505030393600464, "learning_rate": 7.806060606060607e-06, "loss": -0.1213, "num_tokens": 1597686.0, "reward": 0.5530991554260254, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5868990421295166, "reward_meter_std": 0.38611555099487305, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.4085244834423065, "reward_total_composite_mean": 0.5530991554260254, "reward_total_composite_std": 0.40852445363998413, "reward_total_mean": 0.5530991554260254, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5868990421295166, "rewards/meter/std": 0.38611555099487305, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.5530991554260254, "rewards/total_composite/std": 0.40852445363998413, "sampling/importance_sampling_ratio/max": 1.7016674280166626, "sampling/importance_sampling_ratio/mean": 1.0019892454147339, "sampling/importance_sampling_ratio/min": 0.4019929766654968, "sampling/sampling_logp_difference/max": 0.911320686340332, "sampling/sampling_logp_difference/mean": 0.022672384977340698, "step": 725 }, { "clip_ratio/high_max": 0.0009765625, "clip_ratio/high_mean": 0.0009765625, "clip_ratio/low_mean": 0.0029605674790218472, "clip_ratio/low_min": 0.0029605674790218472, "clip_ratio/region_mean": 0.003937129979021847, "completions/clipped_ratio": 0.0, "completions/max_length": 129.0, "completions/max_terminated_length": 129.0, "completions/mean_length": 127.25, "completions/mean_terminated_length": 127.25, "completions/min_length": 126.0, "completions/min_terminated_length": 126.0, "entropy": 0.05762754753232002, "epoch": 0.02916013977587661, "frac_reward_zero_std": 0.0, "grad_norm": 1.0429009199142456, "learning_rate": 7.803030303030303e-06, "loss": -0.0023, "num_tokens": 1600008.0, "reward": 0.46501004695892334, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9302235841751099, "reward_meter_std": 0.015423719771206379, "reward_repeat_penalty_mean": 0.5, "reward_repeat_penalty_std": 0.1511857956647873, "reward_std": 0.14159856736660004, "reward_total_composite_mean": 0.46501004695892334, "reward_total_composite_std": 0.14159858226776123, "reward_total_mean": 0.46501004695892334, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9302235841751099, "rewards/meter/std": 0.015423719771206379, "rewards/repeat_penalty/mean": 0.5, "rewards/repeat_penalty/std": 0.1511857956647873, "rewards/total_composite/mean": 0.46501004695892334, "rewards/total_composite/std": 0.14159858226776123, "sampling/importance_sampling_ratio/max": 1.5183614492416382, "sampling/importance_sampling_ratio/mean": 1.002754807472229, "sampling/importance_sampling_ratio/min": 0.4002356231212616, "sampling/sampling_logp_difference/max": 0.9157018661499023, "sampling/sampling_logp_difference/mean": 0.01078812312334776, "step": 726 }, { "clip_ratio/high_max": 0.02533797360956669, "clip_ratio/high_mean": 0.02533797360956669, "clip_ratio/low_mean": 0.032587712397798896, "clip_ratio/low_min": 0.032587712397798896, "clip_ratio/region_mean": 0.057925686007365584, "completions/clipped_ratio": 0.0, "completions/max_length": 104.0, "completions/max_terminated_length": 104.0, "completions/mean_length": 99.375, "completions/mean_terminated_length": 99.375, "completions/min_length": 93.0, "completions/min_terminated_length": 93.0, "entropy": 0.2684608269482851, "epoch": 0.029200305257661565, "frac_reward_zero_std": 0.0, "grad_norm": 7.388904094696045, "learning_rate": 7.800000000000002e-06, "loss": 0.0279, "num_tokens": 1601923.0, "reward": 0.3363860249519348, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.4179952144622803, "reward_meter_std": 0.45823782682418823, "reward_repeat_penalty_mean": 0.800000011920929, "reward_repeat_penalty_std": 0.10690449178218842, "reward_std": 0.36587125062942505, "reward_total_composite_mean": 0.3363860249519348, "reward_total_composite_std": 0.36587125062942505, "reward_total_mean": 0.3363860249519348, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.4179952144622803, "rewards/meter/std": 0.45823782682418823, "rewards/repeat_penalty/mean": 0.800000011920929, "rewards/repeat_penalty/std": 0.10690449178218842, "rewards/total_composite/mean": 0.3363860249519348, "rewards/total_composite/std": 0.36587125062942505, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9850558042526245, "sampling/importance_sampling_ratio/min": 0.006547517143189907, "sampling/sampling_logp_difference/max": 5.028669357299805, "sampling/sampling_logp_difference/mean": 0.0847281664609909, "step": 727 }, { "clip_ratio/high_max": 0.003258531214669347, "clip_ratio/high_mean": 0.003258531214669347, "clip_ratio/low_mean": 0.008432107453700155, "clip_ratio/low_min": 0.008432107453700155, "clip_ratio/region_mean": 0.011690638668369502, "completions/clipped_ratio": 0.0, "completions/max_length": 483.0, "completions/max_terminated_length": 483.0, "completions/mean_length": 459.125, "completions/mean_terminated_length": 459.125, "completions/min_length": 427.0, "completions/min_terminated_length": 427.0, "entropy": 0.06644301256164908, "epoch": 0.02924047073944652, "frac_reward_zero_std": 0.0, "grad_norm": 2.0805506706237793, "learning_rate": 7.796969696969697e-06, "loss": 0.0076, "num_tokens": 1607332.0, "reward": 0.12284211814403534, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0431290864944458, "reward_meter_mean": 0.28689688444137573, "reward_meter_std": 0.3819184899330139, "reward_repeat_penalty_mean": 0.5729086995124817, "reward_repeat_penalty_std": 0.018385794013738632, "reward_std": 0.1601785272359848, "reward_total_composite_mean": 0.12284211814403534, "reward_total_composite_std": 0.1601785272359848, "reward_total_mean": 0.12284211814403534, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0431290864944458, "rewards/meter/mean": 0.28689688444137573, "rewards/meter/std": 0.3819184899330139, "rewards/repeat_penalty/mean": 0.5729086995124817, "rewards/repeat_penalty/std": 0.018385794013738632, "rewards/total_composite/mean": 0.12284211814403534, "rewards/total_composite/std": 0.1601785272359848, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9993253350257874, "sampling/importance_sampling_ratio/min": 0.03411376476287842, "sampling/sampling_logp_difference/max": 3.37805438041687, "sampling/sampling_logp_difference/mean": 0.019973881542682648, "step": 728 }, { "clip_ratio/high_max": 0.007218867307528853, "clip_ratio/high_mean": 0.007218867307528853, "clip_ratio/low_mean": 0.0015625000232830644, "clip_ratio/low_min": 0.0015625000232830644, "clip_ratio/region_mean": 0.008781367330811918, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 88.0, "completions/mean_length": 139.25, "completions/mean_terminated_length": 86.00000762939453, "completions/min_length": 80.0, "completions/min_terminated_length": 80.0, "entropy": 0.1982464650645852, "epoch": 0.029280636221231473, "frac_reward_zero_std": 0.0, "grad_norm": 2.659188747406006, "learning_rate": 7.793939393939394e-06, "loss": -0.1369, "num_tokens": 1609182.0, "reward": 0.6998236179351807, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.700344443321228, "reward_meter_std": 0.42837557196617126, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.4293443262577057, "reward_total_composite_mean": 0.6998236179351807, "reward_total_composite_std": 0.4293443560600281, "reward_total_mean": 0.6998236179351807, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.700344443321228, "rewards/meter/std": 0.42837557196617126, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6998236179351807, "rewards/total_composite/std": 0.4293443560600281, "sampling/importance_sampling_ratio/max": 1.5019832849502563, "sampling/importance_sampling_ratio/mean": 1.0047773122787476, "sampling/importance_sampling_ratio/min": 0.5312735438346863, "sampling/sampling_logp_difference/max": 0.6324782371520996, "sampling/sampling_logp_difference/mean": 0.022995855659246445, "step": 729 }, { "clip_ratio/high_max": 0.010773762594908476, "clip_ratio/high_mean": 0.010773762594908476, "clip_ratio/low_mean": 0.002890269970521331, "clip_ratio/low_min": 0.002890269970521331, "clip_ratio/region_mean": 0.013664032565429807, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 84.125, "completions/mean_terminated_length": 84.125, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.13521220535039902, "epoch": 0.029320801703016427, "frac_reward_zero_std": 0.0, "grad_norm": 3.446493625640869, "learning_rate": 7.790909090909092e-06, "loss": 0.0222, "num_tokens": 1611175.0, "reward": 0.9330159425735474, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9330159425735474, "reward_meter_std": 0.04698435589671135, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.04698435962200165, "reward_total_composite_mean": 0.9330159425735474, "reward_total_composite_std": 0.04698435589671135, "reward_total_mean": 0.9330159425735474, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9330159425735474, "rewards/meter/std": 0.04698435589671135, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9330159425735474, "rewards/total_composite/std": 0.04698435589671135, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0041048526763916, "sampling/importance_sampling_ratio/min": 0.3314521312713623, "sampling/sampling_logp_difference/max": 1.4188241958618164, "sampling/sampling_logp_difference/mean": 0.02119125984609127, "step": 730 }, { "clip_ratio/high_max": 0.0005307855899445713, "clip_ratio/high_mean": 0.0005307855899445713, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0005307855899445713, "completions/clipped_ratio": 0.875, "completions/max_length": 512.0, "completions/max_terminated_length": 471.0, "completions/mean_length": 506.875, "completions/mean_terminated_length": 471.0, "completions/min_length": 471.0, "completions/min_terminated_length": 471.0, "entropy": 0.005113576073199511, "epoch": 0.02936096718480138, "frac_reward_zero_std": 0.0, "grad_norm": 3.5135695934295654, "learning_rate": 7.787878787878789e-06, "loss": -0.2761, "num_tokens": 1613214.0, "reward": 0.055620092898607254, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.5277777910232544, "reward_count_adherence_std": 0.051434461027383804, "reward_meter_mean": 0.9958064556121826, "reward_meter_std": 0.0007912082364782691, "reward_repeat_penalty_mean": 0.11126373708248138, "reward_repeat_penalty_std": 0.07416856288909912, "reward_std": 0.02950124815106392, "reward_total_composite_mean": 0.055620092898607254, "reward_total_composite_std": 0.029501251876354218, "reward_total_mean": 0.055620092898607254, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.5277777910232544, "rewards/count_adherence/std": 0.051434461027383804, "rewards/meter/mean": 0.9958064556121826, "rewards/meter/std": 0.0007912082364782691, "rewards/repeat_penalty/mean": 0.11126373708248138, "rewards/repeat_penalty/std": 0.07416856288909912, "rewards/total_composite/mean": 0.055620092898607254, "rewards/total_composite/std": 0.029501251876354218, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9985577464103699, "sampling/importance_sampling_ratio/min": 0.2603153586387634, "sampling/sampling_logp_difference/max": 1.3458614349365234, "sampling/sampling_logp_difference/mean": 0.013655466958880424, "step": 731 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.029401132666586335, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 7.784848484848484e-06, "loss": 0.0, "num_tokens": 1614982.0, "reward": 0.18774111568927765, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0345032773911953, "reward_meter_mean": 0.9962900280952454, "reward_meter_std": 0.001235451316460967, "reward_repeat_penalty_mean": 0.19743433594703674, "reward_repeat_penalty_std": 0.17679214477539062, "reward_std": 0.16288605332374573, "reward_total_composite_mean": 0.18774111568927765, "reward_total_composite_std": 0.16288606822490692, "reward_total_mean": 0.18774111568927765, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0345032773911953, "rewards/meter/mean": 0.9962900280952454, "rewards/meter/std": 0.001235451316460967, "rewards/repeat_penalty/mean": 0.19743433594703674, "rewards/repeat_penalty/std": 0.17679214477539062, "rewards/total_composite/mean": 0.18774111568927765, "rewards/total_composite/std": 0.16288606822490692, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 732 }, { "clip_ratio/high_max": 0.027756539173424244, "clip_ratio/high_mean": 0.027756539173424244, "clip_ratio/low_mean": 0.034895967692136765, "clip_ratio/low_min": 0.034895967692136765, "clip_ratio/region_mean": 0.06265250686556101, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 72.0, "completions/mean_terminated_length": 72.0, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.3269932046532631, "epoch": 0.02944129814837129, "frac_reward_zero_std": 0.0, "grad_norm": 5.411409378051758, "learning_rate": 7.781818181818183e-06, "loss": 0.026, "num_tokens": 1616806.0, "reward": 0.5835638046264648, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6948316097259521, "reward_meter_std": 0.2794814109802246, "reward_repeat_penalty_mean": 0.8333333730697632, "reward_repeat_penalty_std": 0.17817415297031403, "reward_std": 0.28273844718933105, "reward_total_composite_mean": 0.5835638046264648, "reward_total_composite_std": 0.28273841738700867, "reward_total_mean": 0.5835638046264648, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6948316097259521, "rewards/meter/std": 0.2794814109802246, "rewards/repeat_penalty/mean": 0.8333333730697632, "rewards/repeat_penalty/std": 0.17817415297031403, "rewards/total_composite/mean": 0.5835638046264648, "rewards/total_composite/std": 0.28273841738700867, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0083332061767578, "sampling/importance_sampling_ratio/min": 0.03945096582174301, "sampling/sampling_logp_difference/max": 3.232696771621704, "sampling/sampling_logp_difference/mean": 0.055757418274879456, "step": 733 }, { "clip_ratio/high_max": 0.0010775862028822303, "clip_ratio/high_mean": 0.0010775862028822303, "clip_ratio/low_mean": 0.0021551724057644606, "clip_ratio/low_min": 0.0021551724057644606, "clip_ratio/region_mean": 0.003232758608646691, "completions/clipped_ratio": 0.0, "completions/max_length": 116.0, "completions/max_terminated_length": 116.0, "completions/mean_length": 116.0, "completions/mean_terminated_length": 116.0, "completions/min_length": 116.0, "completions/min_terminated_length": 116.0, "entropy": 0.025226276833564043, "epoch": 0.029481463630156243, "frac_reward_zero_std": 0.0, "grad_norm": 1.1426414251327515, "learning_rate": 7.778787878787879e-06, "loss": 0.0012, "num_tokens": 1619174.0, "reward": 0.8406277894973755, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9807324409484863, "reward_meter_std": 0.005540105979889631, "reward_repeat_penalty_mean": 0.8571428656578064, "reward_repeat_penalty_std": 0.0, "reward_std": 0.004748655948787928, "reward_total_composite_mean": 0.8406277894973755, "reward_total_composite_std": 0.004748670384287834, "reward_total_mean": 0.8406277894973755, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9807324409484863, "rewards/meter/std": 0.005540105979889631, "rewards/repeat_penalty/mean": 0.8571428656578064, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.8406277894973755, "rewards/total_composite/std": 0.004748670384287834, "sampling/importance_sampling_ratio/max": 1.4202854633331299, "sampling/importance_sampling_ratio/mean": 1.0012872219085693, "sampling/importance_sampling_ratio/min": 0.4178299903869629, "sampling/sampling_logp_difference/max": 0.8726806640625, "sampling/sampling_logp_difference/mean": 0.004732904955744743, "step": 734 }, { "clip_ratio/high_max": 0.011470985249616206, "clip_ratio/high_mean": 0.011470985249616206, "clip_ratio/low_mean": 0.026082158088684082, "clip_ratio/low_min": 0.026082158088684082, "clip_ratio/region_mean": 0.03755314333830029, "completions/clipped_ratio": 0.0, "completions/max_length": 83.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 77.5, "completions/mean_terminated_length": 77.5, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.2497086301445961, "epoch": 0.029521629111941197, "frac_reward_zero_std": 0.0, "grad_norm": 6.164267539978027, "learning_rate": 7.775757575757576e-06, "loss": 0.0021, "num_tokens": 1620938.0, "reward": 0.7734056115150452, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8432132005691528, "reward_meter_std": 0.11800947040319443, "reward_repeat_penalty_mean": 0.9249999523162842, "reward_repeat_penalty_std": 0.1035098284482956, "reward_std": 0.09497448056936264, "reward_total_composite_mean": 0.7734056115150452, "reward_total_composite_std": 0.09497449547052383, "reward_total_mean": 0.7734056115150452, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8432132005691528, "rewards/meter/std": 0.11800947040319443, "rewards/repeat_penalty/mean": 0.9249999523162842, "rewards/repeat_penalty/std": 0.1035098284482956, "rewards/total_composite/mean": 0.7734056115150452, "rewards/total_composite/std": 0.09497449547052383, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0057860612869263, "sampling/importance_sampling_ratio/min": 0.2621157169342041, "sampling/sampling_logp_difference/max": 1.3389692306518555, "sampling/sampling_logp_difference/mean": 0.04740333557128906, "step": 735 }, { "clip_ratio/high_max": 0.01677176496013999, "clip_ratio/high_mean": 0.01677176496013999, "clip_ratio/low_mean": 0.008429729146882892, "clip_ratio/low_min": 0.008429729146882892, "clip_ratio/region_mean": 0.02520149410702288, "completions/clipped_ratio": 0.0, "completions/max_length": 353.0, "completions/max_terminated_length": 353.0, "completions/mean_length": 115.875, "completions/mean_terminated_length": 115.875, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 1.2863622568547726, "epoch": 0.02956179459372615, "frac_reward_zero_std": 0.0, "grad_norm": 5.787602424621582, "learning_rate": 7.772727272727273e-06, "loss": 0.46, "num_tokens": 1623113.0, "reward": 0.6369646191596985, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_meter_mean": 0.7237052917480469, "reward_meter_std": 0.3117098808288574, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.40405309200286865, "reward_total_composite_mean": 0.6369646191596985, "reward_total_composite_std": 0.40405309200286865, "reward_total_mean": 0.6369646191596985, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/meter/mean": 0.7237052917480469, "rewards/meter/std": 0.3117098808288574, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6369646191596985, "rewards/total_composite/std": 0.40405309200286865, "sampling/importance_sampling_ratio/max": 1.964148998260498, "sampling/importance_sampling_ratio/mean": 1.0180284976959229, "sampling/importance_sampling_ratio/min": 0.2670920789241791, "sampling/sampling_logp_difference/max": 1.3201618194580078, "sampling/sampling_logp_difference/mean": 0.08920754492282867, "step": 736 }, { "clip_ratio/high_max": 0.015350477071478963, "clip_ratio/high_mean": 0.015350477071478963, "clip_ratio/low_mean": 0.0008333333535119891, "clip_ratio/low_min": 0.0008333333535119891, "clip_ratio/region_mean": 0.016183810424990952, "completions/clipped_ratio": 0.375, "completions/max_length": 512.0, "completions/max_terminated_length": 191.0, "completions/mean_length": 294.875, "completions/mean_terminated_length": 164.60000610351562, "completions/min_length": 147.0, "completions/min_terminated_length": 147.0, "entropy": 0.12422919739037752, "epoch": 0.029601960075511104, "frac_reward_zero_std": 0.0, "grad_norm": 1.1047923564910889, "learning_rate": 7.76969696969697e-06, "loss": -0.2132, "num_tokens": 1625144.0, "reward": 0.20652014017105103, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.22160132229328156, "reward_meter_mean": 0.3803099989891052, "reward_meter_std": 0.2973701059818268, "reward_repeat_penalty_mean": 0.797619104385376, "reward_repeat_penalty_std": 0.2185886949300766, "reward_std": 0.19584397971630096, "reward_total_composite_mean": 0.20652014017105103, "reward_total_composite_std": 0.19584397971630096, "reward_total_mean": 0.20652014017105103, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.22160132229328156, "rewards/meter/mean": 0.3803099989891052, "rewards/meter/std": 0.2973701059818268, "rewards/repeat_penalty/mean": 0.797619104385376, "rewards/repeat_penalty/std": 0.2185886949300766, "rewards/total_composite/mean": 0.20652014017105103, "rewards/total_composite/std": 0.19584397971630096, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0015567541122437, "sampling/importance_sampling_ratio/min": 0.2301432192325592, "sampling/sampling_logp_difference/max": 1.4690535068511963, "sampling/sampling_logp_difference/mean": 0.030263110995292664, "step": 737 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.02964212555729606, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 7.766666666666666e-06, "loss": 0.0, "num_tokens": 1626768.0, "reward": 0.2381971776485443, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.050507619976997375, "reward_meter_mean": 0.9730854630470276, "reward_meter_std": 0.03588658943772316, "reward_repeat_penalty_mean": 0.2781907618045807, "reward_repeat_penalty_std": 0.2387264519929886, "reward_std": 0.20977550745010376, "reward_total_composite_mean": 0.2381971776485443, "reward_total_composite_std": 0.20977550745010376, "reward_total_mean": 0.2381971776485443, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.050507619976997375, "rewards/meter/mean": 0.9730854630470276, "rewards/meter/std": 0.03588658943772316, "rewards/repeat_penalty/mean": 0.2781907618045807, "rewards/repeat_penalty/std": 0.2387264519929886, "rewards/total_composite/mean": 0.2381971776485443, "rewards/total_composite/std": 0.20977550745010376, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 738 }, { "clip_ratio/high_max": 0.004910050658509135, "clip_ratio/high_mean": 0.004910050658509135, "clip_ratio/low_mean": 0.005539899080758914, "clip_ratio/low_min": 0.005539899080758914, "clip_ratio/region_mean": 0.01044994973926805, "completions/clipped_ratio": 0.0, "completions/max_length": 483.0, "completions/max_terminated_length": 483.0, "completions/mean_length": 423.375, "completions/mean_terminated_length": 423.375, "completions/min_length": 398.0, "completions/min_terminated_length": 398.0, "entropy": 0.0637149391695857, "epoch": 0.029682291039081012, "frac_reward_zero_std": 0.0, "grad_norm": 1.4499318599700928, "learning_rate": 7.763636363636364e-06, "loss": 0.0363, "num_tokens": 1631595.0, "reward": 0.15555939078330994, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.3888888955116272, "reward_count_adherence_std": 0.059391383081674576, "reward_meter_mean": 0.7534134387969971, "reward_meter_std": 0.2928631901741028, "reward_repeat_penalty_mean": 0.5623973608016968, "reward_repeat_penalty_std": 0.18699996173381805, "reward_std": 0.07782954722642899, "reward_total_composite_mean": 0.15555939078330994, "reward_total_composite_std": 0.07782954722642899, "reward_total_mean": 0.15555939078330994, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.3888888955116272, "rewards/count_adherence/std": 0.059391383081674576, "rewards/meter/mean": 0.7534134387969971, "rewards/meter/std": 0.2928631901741028, "rewards/repeat_penalty/mean": 0.5623973608016968, "rewards/repeat_penalty/std": 0.18699996173381805, "rewards/total_composite/mean": 0.15555939078330994, "rewards/total_composite/std": 0.07782954722642899, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9997313022613525, "sampling/importance_sampling_ratio/min": 0.0381552055478096, "sampling/sampling_logp_difference/max": 3.2660930156707764, "sampling/sampling_logp_difference/mean": 0.013467294164001942, "step": 739 }, { "clip_ratio/high_max": 0.009530608775094151, "clip_ratio/high_mean": 0.009530608775094151, "clip_ratio/low_mean": 0.008456611772999167, "clip_ratio/low_min": 0.008456611772999167, "clip_ratio/region_mean": 0.01798722054809332, "completions/clipped_ratio": 0.0, "completions/max_length": 142.0, "completions/max_terminated_length": 142.0, "completions/mean_length": 133.625, "completions/mean_terminated_length": 133.625, "completions/min_length": 126.0, "completions/min_terminated_length": 126.0, "entropy": 0.15879025869071484, "epoch": 0.029722456520865966, "frac_reward_zero_std": 0.0, "grad_norm": 3.1338510513305664, "learning_rate": 7.76060606060606e-06, "loss": -0.0085, "num_tokens": 1634096.0, "reward": 0.0800618976354599, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.11201652884483337, "reward_meter_std": 0.19264455139636993, "reward_repeat_penalty_mean": 0.6964285969734192, "reward_repeat_penalty_std": 0.11921756714582443, "reward_std": 0.13757191598415375, "reward_total_composite_mean": 0.0800618976354599, "reward_total_composite_std": 0.13757191598415375, "reward_total_mean": 0.0800618976354599, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.11201652884483337, "rewards/meter/std": 0.19264455139636993, "rewards/repeat_penalty/mean": 0.6964285969734192, "rewards/repeat_penalty/std": 0.11921756714582443, "rewards/total_composite/mean": 0.0800618976354599, "rewards/total_composite/std": 0.13757191598415375, "sampling/importance_sampling_ratio/max": 1.8425383567810059, "sampling/importance_sampling_ratio/mean": 1.005319595336914, "sampling/importance_sampling_ratio/min": 0.33479708433151245, "sampling/sampling_logp_difference/max": 1.0942306518554688, "sampling/sampling_logp_difference/mean": 0.02300534024834633, "step": 740 }, { "clip_ratio/high_max": 0.007794186705723405, "clip_ratio/high_mean": 0.007794186705723405, "clip_ratio/low_mean": 0.006329114083200693, "clip_ratio/low_min": 0.006329114083200693, "clip_ratio/region_mean": 0.014123300788924098, "completions/clipped_ratio": 0.0, "completions/max_length": 81.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 79.25, "completions/mean_terminated_length": 79.25, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.07466331776231527, "epoch": 0.02976262200265092, "frac_reward_zero_std": 0.0, "grad_norm": 1.2720859050750732, "learning_rate": 7.757575757575758e-06, "loss": -0.0061, "num_tokens": 1636098.0, "reward": 0.794016420841217, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9925205707550049, "reward_meter_std": 0.0022588411811739206, "reward_repeat_penalty_mean": 0.800000011920929, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0018070697551593184, "reward_total_composite_mean": 0.794016420841217, "reward_total_composite_std": 0.001807067426852882, "reward_total_mean": 0.794016420841217, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9925205707550049, "rewards/meter/std": 0.0022588411811739206, "rewards/repeat_penalty/mean": 0.800000011920929, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.794016420841217, "rewards/total_composite/std": 0.001807067426852882, "sampling/importance_sampling_ratio/max": 1.5393544435501099, "sampling/importance_sampling_ratio/mean": 1.001147985458374, "sampling/importance_sampling_ratio/min": 0.4444310963153839, "sampling/sampling_logp_difference/max": 0.8109602928161621, "sampling/sampling_logp_difference/mean": 0.011411315761506557, "step": 741 }, { "clip_ratio/high_max": 0.018717249389737844, "clip_ratio/high_mean": 0.018717249389737844, "clip_ratio/low_mean": 0.021951976465061307, "clip_ratio/low_min": 0.021951976465061307, "clip_ratio/region_mean": 0.04066922585479915, "completions/clipped_ratio": 0.0, "completions/max_length": 125.0, "completions/max_terminated_length": 125.0, "completions/mean_length": 120.75, "completions/mean_terminated_length": 120.75, "completions/min_length": 114.0, "completions/min_terminated_length": 114.0, "entropy": 0.12627906422130764, "epoch": 0.029802787484435874, "frac_reward_zero_std": 0.0, "grad_norm": 7.301284313201904, "learning_rate": 7.754545454545455e-06, "loss": 0.012, "num_tokens": 1638424.0, "reward": 0.5217785835266113, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7745586633682251, "reward_meter_std": 0.25043216347694397, "reward_repeat_penalty_mean": 0.6964285969734192, "reward_repeat_penalty_std": 0.17806050181388855, "reward_std": 0.1874629259109497, "reward_total_composite_mean": 0.5217785835266113, "reward_total_composite_std": 0.1874629557132721, "reward_total_mean": 0.5217785835266113, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7745586633682251, "rewards/meter/std": 0.25043216347694397, "rewards/repeat_penalty/mean": 0.6964285969734192, "rewards/repeat_penalty/std": 0.17806050181388855, "rewards/total_composite/mean": 0.5217785835266113, "rewards/total_composite/std": 0.1874629557132721, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9962561726570129, "sampling/importance_sampling_ratio/min": 0.012216109782457352, "sampling/sampling_logp_difference/max": 4.404999732971191, "sampling/sampling_logp_difference/mean": 0.04599983990192413, "step": 742 }, { "clip_ratio/high_max": 0.0012283907853998244, "clip_ratio/high_mean": 0.0012283907853998244, "clip_ratio/low_mean": 0.0017248676158487797, "clip_ratio/low_min": 0.0017248676158487797, "clip_ratio/region_mean": 0.002953258401248604, "completions/clipped_ratio": 0.5, "completions/max_length": 512.0, "completions/max_terminated_length": 510.0, "completions/mean_length": 510.0, "completions/mean_terminated_length": 508.0, "completions/min_length": 507.0, "completions/min_terminated_length": 507.0, "entropy": 0.03308352828025818, "epoch": 0.02984295296622083, "frac_reward_zero_std": 0.0, "grad_norm": 1.0547409057617188, "learning_rate": 7.751515151515153e-06, "loss": 0.1769, "num_tokens": 1642208.0, "reward": 0.13946115970611572, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.6153846383094788, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.45572322607040405, "reward_meter_std": 0.1519794911146164, "reward_repeat_penalty_mean": 0.5480158925056458, "reward_repeat_penalty_std": 0.010451768524944782, "reward_std": 0.07740650326013565, "reward_total_composite_mean": 0.13946115970611572, "reward_total_composite_std": 0.07740650326013565, "reward_total_mean": 0.13946115970611572, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.6153846383094788, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.45572322607040405, "rewards/meter/std": 0.1519794911146164, "rewards/repeat_penalty/mean": 0.5480158925056458, "rewards/repeat_penalty/std": 0.010451768524944782, "rewards/total_composite/mean": 0.13946115970611572, "rewards/total_composite/std": 0.07740650326013565, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0025880336761475, "sampling/importance_sampling_ratio/min": 0.32132917642593384, "sampling/sampling_logp_difference/max": 1.135289192199707, "sampling/sampling_logp_difference/mean": 0.00907099712640047, "step": 743 }, { "clip_ratio/high_max": 0.027501578675583005, "clip_ratio/high_mean": 0.027501578675583005, "clip_ratio/low_mean": 0.02111415727995336, "clip_ratio/low_min": 0.02111415727995336, "clip_ratio/region_mean": 0.048615735955536366, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 64.5, "completions/mean_terminated_length": 64.5, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.6070369817316532, "epoch": 0.029883118448005785, "frac_reward_zero_std": 0.0, "grad_norm": 6.8046875, "learning_rate": 7.74848484848485e-06, "loss": 0.0283, "num_tokens": 1643996.0, "reward": 0.5396110415458679, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5396110415458679, "reward_meter_std": 0.20649512112140656, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.20649512112140656, "reward_total_composite_mean": 0.5396110415458679, "reward_total_composite_std": 0.20649512112140656, "reward_total_mean": 0.5396110415458679, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5396110415458679, "rewards/meter/std": 0.20649512112140656, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.5396110415458679, "rewards/total_composite/std": 0.20649512112140656, "sampling/importance_sampling_ratio/max": 1.632293462753296, "sampling/importance_sampling_ratio/mean": 1.0097684860229492, "sampling/importance_sampling_ratio/min": 0.28896111249923706, "sampling/sampling_logp_difference/max": 1.2414631843566895, "sampling/sampling_logp_difference/mean": 0.06342907249927521, "step": 744 }, { "clip_ratio/high_max": 0.043645198456943035, "clip_ratio/high_mean": 0.043645198456943035, "clip_ratio/low_mean": 0.008064515888690948, "clip_ratio/low_min": 0.008064515888690948, "clip_ratio/region_mean": 0.051709714345633984, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 63.0, "completions/mean_terminated_length": 63.0, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.25149067025631666, "epoch": 0.02992328392979074, "frac_reward_zero_std": 0.0, "grad_norm": 9.705404281616211, "learning_rate": 7.745454545454545e-06, "loss": 0.0099, "num_tokens": 1645756.0, "reward": 0.9103853106498718, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9103853106498718, "reward_meter_std": 0.22165298461914062, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.22165298461914062, "reward_total_composite_mean": 0.9103853106498718, "reward_total_composite_std": 0.22165298461914062, "reward_total_mean": 0.9103853106498718, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9103853106498718, "rewards/meter/std": 0.22165298461914062, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9103853106498718, "rewards/total_composite/std": 0.22165298461914062, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0033738613128662, "sampling/importance_sampling_ratio/min": 0.13348090648651123, "sampling/sampling_logp_difference/max": 2.013796806335449, "sampling/sampling_logp_difference/mean": 0.07189808040857315, "step": 745 }, { "clip_ratio/high_max": 0.006430621142499149, "clip_ratio/high_mean": 0.006430621142499149, "clip_ratio/low_mean": 0.003769519622437656, "clip_ratio/low_min": 0.003769519622437656, "clip_ratio/region_mean": 0.010200140764936805, "completions/clipped_ratio": 0.0, "completions/max_length": 260.0, "completions/max_terminated_length": 260.0, "completions/mean_length": 238.25, "completions/mean_terminated_length": 238.25, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "entropy": 0.06980151077732444, "epoch": 0.029963449411575693, "frac_reward_zero_std": 0.0, "grad_norm": 2.2934165000915527, "learning_rate": 7.742424242424244e-06, "loss": 0.0227, "num_tokens": 1649182.0, "reward": 0.2228499948978424, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.8676279783248901, "reward_meter_std": 0.3215867578983307, "reward_repeat_penalty_mean": 0.36800700426101685, "reward_repeat_penalty_std": 0.24577626585960388, "reward_std": 0.18318407237529755, "reward_total_composite_mean": 0.2228499948978424, "reward_total_composite_std": 0.18318407237529755, "reward_total_mean": 0.2228499948978424, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.8676279783248901, "rewards/meter/std": 0.3215867578983307, "rewards/repeat_penalty/mean": 0.36800700426101685, "rewards/repeat_penalty/std": 0.24577626585960388, "rewards/total_composite/mean": 0.2228499948978424, "rewards/total_composite/std": 0.18318407237529755, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0014268159866333, "sampling/importance_sampling_ratio/min": 0.016722269356250763, "sampling/sampling_logp_difference/max": 4.0910139083862305, "sampling/sampling_logp_difference/mean": 0.018860070034861565, "step": 746 }, { "clip_ratio/high_max": 0.018227352295070887, "clip_ratio/high_mean": 0.018227352295070887, "clip_ratio/low_mean": 0.012351190904155374, "clip_ratio/low_min": 0.012351190904155374, "clip_ratio/region_mean": 0.03057854319922626, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 40.625, "completions/mean_terminated_length": 40.625, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.28702736645936966, "epoch": 0.030003614893360647, "frac_reward_zero_std": 0.0, "grad_norm": 7.876811981201172, "learning_rate": 7.73939393939394e-06, "loss": -0.0252, "num_tokens": 1650683.0, "reward": 0.9663740396499634, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9663740396499634, "reward_meter_std": 0.011263493448495865, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.011263499036431313, "reward_total_composite_mean": 0.9663740396499634, "reward_total_composite_std": 0.011263493448495865, "reward_total_mean": 0.9663740396499634, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9663740396499634, "rewards/meter/std": 0.011263493448495865, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9663740396499634, "rewards/total_composite/std": 0.011263493448495865, "sampling/importance_sampling_ratio/max": 1.344473123550415, "sampling/importance_sampling_ratio/mean": 1.0029720067977905, "sampling/importance_sampling_ratio/min": 0.41253525018692017, "sampling/sampling_logp_difference/max": 0.8854336738586426, "sampling/sampling_logp_difference/mean": 0.03788968175649643, "step": 747 }, { "clip_ratio/high_max": 0.021474606008268893, "clip_ratio/high_mean": 0.021474606008268893, "clip_ratio/low_mean": 0.002961171790957451, "clip_ratio/low_min": 0.002961171790957451, "clip_ratio/region_mean": 0.024435777799226344, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 82.125, "completions/mean_terminated_length": 82.125, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.22462552785873413, "epoch": 0.0300437803751456, "frac_reward_zero_std": 0.0, "grad_norm": 4.674757957458496, "learning_rate": 7.736363636363637e-06, "loss": 0.031, "num_tokens": 1652564.0, "reward": 0.8491703271865845, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8491703271865845, "reward_meter_std": 0.15907908976078033, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.15907907485961914, "reward_total_composite_mean": 0.8491703271865845, "reward_total_composite_std": 0.15907908976078033, "reward_total_mean": 0.8491703271865845, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8491703271865845, "rewards/meter/std": 0.15907908976078033, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.8491703271865845, "rewards/total_composite/std": 0.15907908976078033, "sampling/importance_sampling_ratio/max": 1.843922734260559, "sampling/importance_sampling_ratio/mean": 1.0036686658859253, "sampling/importance_sampling_ratio/min": 0.2724129855632782, "sampling/sampling_logp_difference/max": 1.300436019897461, "sampling/sampling_logp_difference/mean": 0.0295439250767231, "step": 748 }, { "clip_ratio/high_max": 0.008620689623057842, "clip_ratio/high_mean": 0.008620689623057842, "clip_ratio/low_mean": 0.026110241888090968, "clip_ratio/low_min": 0.026110241888090968, "clip_ratio/region_mean": 0.03473093151114881, "completions/clipped_ratio": 0.0, "completions/max_length": 98.0, "completions/max_terminated_length": 98.0, "completions/mean_length": 93.625, "completions/mean_terminated_length": 93.625, "completions/min_length": 87.0, "completions/min_terminated_length": 87.0, "entropy": 0.12411046819761395, "epoch": 0.030083945856930555, "frac_reward_zero_std": 0.0, "grad_norm": 6.799373626708984, "learning_rate": 7.733333333333334e-06, "loss": 0.0372, "num_tokens": 1654625.0, "reward": 0.8075714707374573, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9564855694770813, "reward_meter_std": 0.10235674679279327, "reward_repeat_penalty_mean": 0.8500000238418579, "reward_repeat_penalty_std": 0.09258200973272324, "reward_std": 0.0810769572854042, "reward_total_composite_mean": 0.8075714707374573, "reward_total_composite_std": 0.0810769721865654, "reward_total_mean": 0.8075714707374573, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9564855694770813, "rewards/meter/std": 0.10235674679279327, "rewards/repeat_penalty/mean": 0.8500000238418579, "rewards/repeat_penalty/std": 0.09258200973272324, "rewards/total_composite/mean": 0.8075714707374573, "rewards/total_composite/std": 0.0810769721865654, "sampling/importance_sampling_ratio/max": 1.903843641281128, "sampling/importance_sampling_ratio/mean": 0.9965777397155762, "sampling/importance_sampling_ratio/min": 0.08325432986021042, "sampling/sampling_logp_difference/max": 2.4858551025390625, "sampling/sampling_logp_difference/mean": 0.03427453711628914, "step": 749 }, { "clip_ratio/high_max": 0.022817256744019687, "clip_ratio/high_mean": 0.022817256744019687, "clip_ratio/low_mean": 0.00892857147846371, "clip_ratio/low_min": 0.00892857147846371, "clip_ratio/region_mean": 0.031745828222483397, "completions/clipped_ratio": 0.0, "completions/max_length": 70.0, "completions/max_terminated_length": 70.0, "completions/mean_length": 67.0, "completions/mean_terminated_length": 67.0, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.21013184823095798, "epoch": 0.03012411133871551, "frac_reward_zero_std": 0.0, "grad_norm": 6.688387870788574, "learning_rate": 7.730303030303032e-06, "loss": 0.031, "num_tokens": 1656513.0, "reward": 0.8990964889526367, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9406866431236267, "reward_meter_std": 0.1574798822402954, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.18213684856891632, "reward_total_composite_mean": 0.8990964889526367, "reward_total_composite_std": 0.18213681876659393, "reward_total_mean": 0.8990964889526367, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9406866431236267, "rewards/meter/std": 0.1574798822402954, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.8990964889526367, "rewards/total_composite/std": 0.18213681876659393, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0121128559112549, "sampling/importance_sampling_ratio/min": 0.42169255018234253, "sampling/sampling_logp_difference/max": 0.9646925926208496, "sampling/sampling_logp_difference/mean": 0.035663776099681854, "step": 750 }, { "epoch": 0.03012411133871551, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.23076923076923078, "eval_completions/max_length": 496.7692307692308, "eval_completions/max_terminated_length": 393.46153846153845, "eval_completions/mean_length": 284.52884615384613, "eval_completions/mean_terminated_length": 215.78288092980017, "eval_completions/min_length": 61.46153846153846, "eval_completions/min_terminated_length": 61.46153846153846, "eval_entropy": 0.17351046003974402, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1656513.0, "eval_reward": 0.33899185634576356, "eval_reward_arabic_clean_mean": 0.9711538461538461, "eval_reward_arabic_clean_std": 0.08158924258672275, "eval_reward_count_adherence_mean": 0.7424245018225449, "eval_reward_count_adherence_std": 0.2582179422561939, "eval_reward_meter_mean": 0.6660121427132533, "eval_reward_meter_std": 0.37975076070198643, "eval_reward_repeat_penalty_mean": 0.638540084545429, "eval_reward_repeat_penalty_std": 0.270676647241299, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.33899185634576356, "eval_reward_total_composite_std": 0.3308297275350644, "eval_reward_total_mean": 0.33899185634576356, "eval_rewards/arabic_clean/mean": 0.9711538461538461, "eval_rewards/arabic_clean/std": 0.08158924258672275, "eval_rewards/count_adherence/mean": 0.7424245018225449, "eval_rewards/count_adherence/std": 0.2582179422561939, "eval_rewards/meter/mean": 0.6660121427132533, "eval_rewards/meter/std": 0.37975076070198643, "eval_rewards/repeat_penalty/mean": 0.638540084545429, "eval_rewards/repeat_penalty/std": 0.270676647241299, "eval_rewards/total_composite/mean": 0.33899185634576356, "eval_rewards/total_composite/std": 0.3308297275350644, "eval_runtime": 93.1633, "eval_samples_per_second": 1.116, "eval_sampling/importance_sampling_ratio/max": 1.3942875678722675, "eval_sampling/importance_sampling_ratio/mean": 1.0036690326837392, "eval_sampling/importance_sampling_ratio/min": 0.4615517258644104, "eval_sampling/sampling_logp_difference/max": 0.8113565261547382, "eval_sampling/sampling_logp_difference/mean": 0.012646582407447008, "eval_steps_per_second": 0.14, "step": 750 }, { "clip_ratio/high_max": 0.008403955027461052, "clip_ratio/high_mean": 0.008403955027461052, "clip_ratio/low_mean": 0.006320621585473418, "clip_ratio/low_min": 0.006320621585473418, "clip_ratio/region_mean": 0.01472457661293447, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 59.25, "completions/mean_terminated_length": 59.25, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.052004152443259954, "epoch": 0.030164276820500463, "frac_reward_zero_std": 0.0, "grad_norm": 5.31432580947876, "learning_rate": 7.727272727272727e-06, "loss": 0.0024, "num_tokens": 1658395.0, "reward": 0.9893741607666016, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9893741607666016, "reward_meter_std": 0.007569636683911085, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.007569642271846533, "reward_total_composite_mean": 0.9893741607666016, "reward_total_composite_std": 0.007569636683911085, "reward_total_mean": 0.9893741607666016, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9893741607666016, "rewards/meter/std": 0.007569636683911085, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9893741607666016, "rewards/total_composite/std": 0.007569636683911085, "sampling/importance_sampling_ratio/max": 1.868045449256897, "sampling/importance_sampling_ratio/mean": 1.0002750158309937, "sampling/importance_sampling_ratio/min": 0.3949167728424072, "sampling/sampling_logp_difference/max": 0.9290802478790283, "sampling/sampling_logp_difference/mean": 0.013296845369040966, "step": 751 }, { "clip_ratio/high_max": 0.006320621585473418, "clip_ratio/high_mean": 0.006320621585473418, "clip_ratio/low_mean": 0.0020833334419876337, "clip_ratio/low_min": 0.0020833334419876337, "clip_ratio/region_mean": 0.008403955027461052, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 59.25, "completions/mean_terminated_length": 59.25, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.03427604655735195, "epoch": 0.030204442302285417, "frac_reward_zero_std": 0.0, "grad_norm": 4.07772970199585, "learning_rate": 7.724242424242424e-06, "loss": 0.0051, "num_tokens": 1660117.0, "reward": 0.9534660577774048, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9949396848678589, "reward_meter_std": 0.00028474157443270087, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.11713218688964844, "reward_total_composite_mean": 0.9534660577774048, "reward_total_composite_std": 0.11713220924139023, "reward_total_mean": 0.9534660577774048, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9949396848678589, "rewards/meter/std": 0.00028474157443270087, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.9534660577774048, "rewards/total_composite/std": 0.11713220924139023, "sampling/importance_sampling_ratio/max": 1.3358639478683472, "sampling/importance_sampling_ratio/mean": 1.0019704103469849, "sampling/importance_sampling_ratio/min": 0.2900037169456482, "sampling/sampling_logp_difference/max": 1.2378616333007812, "sampling/sampling_logp_difference/mean": 0.009837880730628967, "step": 752 }, { "clip_ratio/high_max": 0.04496192745864391, "clip_ratio/high_mean": 0.04496192745864391, "clip_ratio/low_mean": 0.017439668532460928, "clip_ratio/low_min": 0.017439668532460928, "clip_ratio/region_mean": 0.06240159599110484, "completions/clipped_ratio": 0.0, "completions/max_length": 39.0, "completions/max_terminated_length": 39.0, "completions/mean_length": 35.875, "completions/mean_terminated_length": 35.875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.6193088293075562, "epoch": 0.03024460778407037, "frac_reward_zero_std": 0.0, "grad_norm": 14.107855796813965, "learning_rate": 7.721212121212122e-06, "loss": -0.0196, "num_tokens": 1661428.0, "reward": 0.9349486827850342, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9349486827850342, "reward_meter_std": 0.1060987114906311, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.1060987114906311, "reward_total_composite_mean": 0.9349486827850342, "reward_total_composite_std": 0.1060987114906311, "reward_total_mean": 0.9349486827850342, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9349486827850342, "rewards/meter/std": 0.1060987114906311, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9349486827850342, "rewards/total_composite/std": 0.1060987114906311, "sampling/importance_sampling_ratio/max": 1.6115726232528687, "sampling/importance_sampling_ratio/mean": 1.0009469985961914, "sampling/importance_sampling_ratio/min": 0.20662181079387665, "sampling/sampling_logp_difference/max": 1.5768651962280273, "sampling/sampling_logp_difference/mean": 0.07551710307598114, "step": 753 }, { "clip_ratio/high_max": 0.018074912950396538, "clip_ratio/high_mean": 0.018074912950396538, "clip_ratio/low_mean": 0.008928571594879031, "clip_ratio/low_min": 0.008928571594879031, "clip_ratio/region_mean": 0.02700348454527557, "completions/clipped_ratio": 0.0, "completions/max_length": 42.0, "completions/max_terminated_length": 42.0, "completions/mean_length": 41.5, "completions/mean_terminated_length": 41.5, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.11915541160851717, "epoch": 0.030284773265855325, "frac_reward_zero_std": 0.0, "grad_norm": 2.418649673461914, "learning_rate": 7.718181818181819e-06, "loss": 0.0091, "num_tokens": 1663080.0, "reward": 0.9943797588348389, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9943797588348389, "reward_meter_std": 0.0011224248446524143, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0011224271729588509, "reward_total_composite_mean": 0.9943797588348389, "reward_total_composite_std": 0.0011224248446524143, "reward_total_mean": 0.9943797588348389, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9943797588348389, "rewards/meter/std": 0.0011224248446524143, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9943797588348389, "rewards/total_composite/std": 0.0011224248446524143, "sampling/importance_sampling_ratio/max": 1.2741270065307617, "sampling/importance_sampling_ratio/mean": 0.9925946593284607, "sampling/importance_sampling_ratio/min": 0.2249595671892166, "sampling/sampling_logp_difference/max": 1.4918346405029297, "sampling/sampling_logp_difference/mean": 0.030370449647307396, "step": 754 }, { "clip_ratio/high_max": 0.012195121496915817, "clip_ratio/high_mean": 0.012195121496915817, "clip_ratio/low_mean": 0.0030487803742289543, "clip_ratio/low_min": 0.0030487803742289543, "clip_ratio/region_mean": 0.015243901871144772, "completions/clipped_ratio": 0.0, "completions/max_length": 41.0, "completions/max_terminated_length": 41.0, "completions/mean_length": 41.0, "completions/mean_terminated_length": 41.0, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.10165042616426945, "epoch": 0.03032493874764028, "frac_reward_zero_std": 0.0, "grad_norm": 5.144253730773926, "learning_rate": 7.715151515151516e-06, "loss": -0.0018, "num_tokens": 1664616.0, "reward": 0.9944278001785278, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9944278001785278, "reward_meter_std": 0.0012945194030180573, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0012945224298164248, "reward_total_composite_mean": 0.9944278001785278, "reward_total_composite_std": 0.0012945194030180573, "reward_total_mean": 0.9944278001785278, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9944278001785278, "rewards/meter/std": 0.0012945194030180573, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9944278001785278, "rewards/total_composite/std": 0.0012945194030180573, "sampling/importance_sampling_ratio/max": 1.2102103233337402, "sampling/importance_sampling_ratio/mean": 1.0021907091140747, "sampling/importance_sampling_ratio/min": 0.5395178198814392, "sampling/sampling_logp_difference/max": 0.617079496383667, "sampling/sampling_logp_difference/mean": 0.014835118316113949, "step": 755 }, { "clip_ratio/high_max": 0.005401917500421405, "clip_ratio/high_mean": 0.005401917500421405, "clip_ratio/low_mean": 0.005512091098353267, "clip_ratio/low_min": 0.005512091098353267, "clip_ratio/region_mean": 0.010914008598774672, "completions/clipped_ratio": 0.0, "completions/max_length": 120.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 113.75, "completions/mean_terminated_length": 113.75, "completions/min_length": 111.0, "completions/min_terminated_length": 111.0, "entropy": 0.0643842932768166, "epoch": 0.030365104229425233, "frac_reward_zero_std": 0.0, "grad_norm": 2.4242031574249268, "learning_rate": 7.712121212121213e-06, "loss": -0.0099, "num_tokens": 1666878.0, "reward": 0.6285786032676697, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9662827253341675, "reward_meter_std": 0.009305375628173351, "reward_repeat_penalty_mean": 0.6500000357627869, "reward_repeat_penalty_std": 0.09258200973272324, "reward_std": 0.09414192289113998, "reward_total_composite_mean": 0.6285786032676697, "reward_total_composite_std": 0.0941418930888176, "reward_total_mean": 0.6285786032676697, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9662827253341675, "rewards/meter/std": 0.009305375628173351, "rewards/repeat_penalty/mean": 0.6500000357627869, "rewards/repeat_penalty/std": 0.09258200973272324, "rewards/total_composite/mean": 0.6285786032676697, "rewards/total_composite/std": 0.0941418930888176, "sampling/importance_sampling_ratio/max": 1.911029577255249, "sampling/importance_sampling_ratio/mean": 1.0027672052383423, "sampling/importance_sampling_ratio/min": 0.20104746520519257, "sampling/sampling_logp_difference/max": 1.6042141914367676, "sampling/sampling_logp_difference/mean": 0.011911381967365742, "step": 756 }, { "clip_ratio/high_max": 0.007282168400706723, "clip_ratio/high_mean": 0.007282168400706723, "clip_ratio/low_mean": 0.0010245901066809893, "clip_ratio/low_min": 0.0010245901066809893, "clip_ratio/region_mean": 0.008306758507387713, "completions/clipped_ratio": 0.0, "completions/max_length": 267.0, "completions/max_terminated_length": 267.0, "completions/mean_length": 243.25, "completions/mean_terminated_length": 243.25, "completions/min_length": 217.0, "completions/min_terminated_length": 217.0, "entropy": 0.06725997012108564, "epoch": 0.030405269711210187, "frac_reward_zero_std": 0.0, "grad_norm": 1.2799259424209595, "learning_rate": 7.709090909090909e-06, "loss": 0.0259, "num_tokens": 1670368.0, "reward": 0.2822417914867401, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.6500000357627869, "reward_count_adherence_std": 0.09258200973272324, "reward_meter_mean": 0.9969884157180786, "reward_meter_std": 0.000910833477973938, "reward_repeat_penalty_mean": 0.4187062978744507, "reward_repeat_penalty_std": 0.23771634697914124, "reward_std": 0.18207496404647827, "reward_total_composite_mean": 0.2822417914867401, "reward_total_composite_std": 0.18207497894763947, "reward_total_mean": 0.2822417914867401, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.6500000357627869, "rewards/count_adherence/std": 0.09258200973272324, "rewards/meter/mean": 0.9969884157180786, "rewards/meter/std": 0.000910833477973938, "rewards/repeat_penalty/mean": 0.4187062978744507, "rewards/repeat_penalty/std": 0.23771634697914124, "rewards/total_composite/mean": 0.2822417914867401, "rewards/total_composite/std": 0.18207497894763947, "sampling/importance_sampling_ratio/max": 1.5265671014785767, "sampling/importance_sampling_ratio/mean": 1.0003676414489746, "sampling/importance_sampling_ratio/min": 0.27827587723731995, "sampling/sampling_logp_difference/max": 1.2791423797607422, "sampling/sampling_logp_difference/mean": 0.00974962953478098, "step": 757 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.03044543519299514, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 7.706060606060606e-06, "loss": 0.0, "num_tokens": 1672112.0, "reward": 0.059182293713092804, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.15625, "reward_count_adherence_std": 0.11080066114664078, "reward_meter_mean": 0.8747541308403015, "reward_meter_std": 0.1777074635028839, "reward_repeat_penalty_mean": 0.42480412125587463, "reward_repeat_penalty_std": 0.2929826080799103, "reward_std": 0.06593845039606094, "reward_total_composite_mean": 0.059182293713092804, "reward_total_composite_std": 0.06593845039606094, "reward_total_mean": 0.059182293713092804, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.15625, "rewards/count_adherence/std": 0.11080066114664078, "rewards/meter/mean": 0.8747541308403015, "rewards/meter/std": 0.1777074635028839, "rewards/repeat_penalty/mean": 0.42480412125587463, "rewards/repeat_penalty/std": 0.2929826080799103, "rewards/total_composite/mean": 0.059182293713092804, "rewards/total_composite/std": 0.06593845039606094, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 758 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 87.0, "completions/mean_terminated_length": 87.0, "completions/min_length": 87.0, "completions/min_terminated_length": 87.0, "entropy": 0.014668526826426387, "epoch": 0.030485600674780094, "frac_reward_zero_std": 1.0, "grad_norm": 0.0, "learning_rate": 7.703030303030304e-06, "loss": 0.0, "num_tokens": 1674144.0, "reward": 0.5969825983047485, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9949710369110107, "reward_meter_std": 0.0, "reward_repeat_penalty_mean": 0.6000000238418579, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0, "reward_total_composite_mean": 0.5969825983047485, "reward_total_composite_std": 0.0, "reward_total_mean": 0.5969825983047485, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9949710369110107, "rewards/meter/std": 0.0, "rewards/repeat_penalty/mean": 0.6000000238418579, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.5969825983047485, "rewards/total_composite/std": 0.0, "sampling/importance_sampling_ratio/max": 1.0613410472869873, "sampling/importance_sampling_ratio/mean": 1.0006695985794067, "sampling/importance_sampling_ratio/min": 0.848580002784729, "sampling/sampling_logp_difference/max": 0.1641908884048462, "sampling/sampling_logp_difference/mean": 0.001654994674026966, "step": 759 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.004629629664123058, "clip_ratio/low_min": 0.004629629664123058, "clip_ratio/region_mean": 0.004629629664123058, "completions/clipped_ratio": 0.0, "completions/max_length": 55.0, "completions/max_terminated_length": 55.0, "completions/mean_length": 54.125, "completions/mean_terminated_length": 54.125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.042751661501824856, "epoch": 0.03052576615656505, "frac_reward_zero_std": 0.0, "grad_norm": 4.493424415588379, "learning_rate": 7.7e-06, "loss": -0.0037, "num_tokens": 1675945.0, "reward": 0.6740554571151733, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9517734050750732, "reward_meter_std": 0.0011382178636267781, "reward_repeat_penalty_mean": 0.7083333730697632, "reward_repeat_penalty_std": 0.11785111576318741, "reward_std": 0.11107677221298218, "reward_total_composite_mean": 0.6740554571151733, "reward_total_composite_std": 0.11107677966356277, "reward_total_mean": 0.6740554571151733, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9517734050750732, "rewards/meter/std": 0.0011382178636267781, "rewards/repeat_penalty/mean": 0.7083333730697632, "rewards/repeat_penalty/std": 0.11785111576318741, "rewards/total_composite/mean": 0.6740554571151733, "rewards/total_composite/std": 0.11107677966356277, "sampling/importance_sampling_ratio/max": 1.612492322921753, "sampling/importance_sampling_ratio/mean": 1.0033941268920898, "sampling/importance_sampling_ratio/min": 0.7561957836151123, "sampling/sampling_logp_difference/max": 0.4777810573577881, "sampling/sampling_logp_difference/mean": 0.005725136026740074, "step": 760 }, { "clip_ratio/high_max": 0.0021186440717428923, "clip_ratio/high_mean": 0.0021186440717428923, "clip_ratio/low_mean": 0.006428988883271813, "clip_ratio/low_min": 0.006428988883271813, "clip_ratio/region_mean": 0.008547632955014706, "completions/clipped_ratio": 0.0, "completions/max_length": 59.0, "completions/max_terminated_length": 59.0, "completions/mean_length": 58.25, "completions/mean_terminated_length": 58.25, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.05586709058843553, "epoch": 0.030565931638350002, "frac_reward_zero_std": 0.0, "grad_norm": 0.8903390765190125, "learning_rate": 7.696969696969696e-06, "loss": -0.0023, "num_tokens": 1677747.0, "reward": 0.7047345042228699, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9949068427085876, "reward_meter_std": 0.0007968654972501099, "reward_repeat_penalty_mean": 0.7083333730697632, "reward_repeat_penalty_std": 0.11785111576318741, "reward_std": 0.1173337996006012, "reward_total_composite_mean": 0.7047345042228699, "reward_total_composite_std": 0.1173337996006012, "reward_total_mean": 0.7047345042228699, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9949068427085876, "rewards/meter/std": 0.0007968654972501099, "rewards/repeat_penalty/mean": 0.7083333730697632, "rewards/repeat_penalty/std": 0.11785111576318741, "rewards/total_composite/mean": 0.7047345042228699, "rewards/total_composite/std": 0.1173337996006012, "sampling/importance_sampling_ratio/max": 1.6007080078125, "sampling/importance_sampling_ratio/mean": 1.0014004707336426, "sampling/importance_sampling_ratio/min": 0.3485388159751892, "sampling/sampling_logp_difference/max": 1.0540056228637695, "sampling/sampling_logp_difference/mean": 0.011640225537121296, "step": 761 }, { "clip_ratio/high_max": 0.006666666595265269, "clip_ratio/high_mean": 0.006666666595265269, "clip_ratio/low_mean": 0.012610982405021787, "clip_ratio/low_min": 0.012610982405021787, "clip_ratio/region_mean": 0.019277649000287056, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 78.25, "completions/mean_terminated_length": 78.25, "completions/min_length": 75.0, "completions/min_terminated_length": 75.0, "entropy": 0.11404913989827037, "epoch": 0.030606097120134956, "frac_reward_zero_std": 0.0, "grad_norm": 5.6463236808776855, "learning_rate": 7.693939393939395e-06, "loss": 0.024, "num_tokens": 1679613.0, "reward": 0.6016985774040222, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8964411020278931, "reward_meter_std": 0.12688924372196198, "reward_repeat_penalty_mean": 0.6750000715255737, "reward_repeat_penalty_std": 0.1035098284482956, "reward_std": 0.11093335598707199, "reward_total_composite_mean": 0.6016985774040222, "reward_total_composite_std": 0.1109333410859108, "reward_total_mean": 0.6016985774040222, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8964411020278931, "rewards/meter/std": 0.12688924372196198, "rewards/repeat_penalty/mean": 0.6750000715255737, "rewards/repeat_penalty/std": 0.1035098284482956, "rewards/total_composite/mean": 0.6016985774040222, "rewards/total_composite/std": 0.1109333410859108, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0003811120986938, "sampling/importance_sampling_ratio/min": 0.4048405587673187, "sampling/sampling_logp_difference/max": 0.9042620658874512, "sampling/sampling_logp_difference/mean": 0.02804330736398697, "step": 762 }, { "clip_ratio/high_max": 0.005744358117226511, "clip_ratio/high_mean": 0.005744358117226511, "clip_ratio/low_mean": 0.005670643062330782, "clip_ratio/low_min": 0.005670643062330782, "clip_ratio/region_mean": 0.011415001179557294, "completions/clipped_ratio": 0.0, "completions/max_length": 498.0, "completions/max_terminated_length": 498.0, "completions/mean_length": 438.125, "completions/mean_terminated_length": 438.125, "completions/min_length": 391.0, "completions/min_terminated_length": 391.0, "entropy": 0.07848789915442467, "epoch": 0.03064626260191991, "frac_reward_zero_std": 0.0, "grad_norm": 1.2447540760040283, "learning_rate": 7.690909090909091e-06, "loss": 0.0481, "num_tokens": 1684742.0, "reward": 0.12146620452404022, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.2142857164144516, "reward_count_adherence_std": 0.07636035978794098, "reward_meter_mean": 0.9878873825073242, "reward_meter_std": 0.019713442772626877, "reward_repeat_penalty_mean": 0.5576170682907104, "reward_repeat_penalty_std": 0.0946657732129097, "reward_std": 0.05504889413714409, "reward_total_composite_mean": 0.12146620452404022, "reward_total_composite_std": 0.05504889413714409, "reward_total_mean": 0.12146620452404022, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.2142857164144516, "rewards/count_adherence/std": 0.07636035978794098, "rewards/meter/mean": 0.9878873825073242, "rewards/meter/std": 0.019713442772626877, "rewards/repeat_penalty/mean": 0.5576170682907104, "rewards/repeat_penalty/std": 0.0946657732129097, "rewards/total_composite/mean": 0.12146620452404022, "rewards/total_composite/std": 0.05504889413714409, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0031057596206665, "sampling/importance_sampling_ratio/min": 0.22546334564685822, "sampling/sampling_logp_difference/max": 1.4895976781845093, "sampling/sampling_logp_difference/mean": 0.010950884781777859, "step": 763 }, { "clip_ratio/high_max": 0.02714023506268859, "clip_ratio/high_mean": 0.02714023506268859, "clip_ratio/low_mean": 0.005871212342754006, "clip_ratio/low_min": 0.005871212342754006, "clip_ratio/region_mean": 0.033011447405442595, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 63.625, "completions/mean_terminated_length": 63.625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.1180117940530181, "epoch": 0.030686428083704864, "frac_reward_zero_std": 0.0, "grad_norm": 5.640087127685547, "learning_rate": 7.687878787878788e-06, "loss": 0.0189, "num_tokens": 1686539.0, "reward": 0.7850605845451355, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.874701976776123, "reward_meter_std": 0.18508003652095795, "reward_repeat_penalty_mean": 0.875, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.2699912190437317, "reward_total_composite_mean": 0.7850605845451355, "reward_total_composite_std": 0.2699912190437317, "reward_total_mean": 0.7850605845451355, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.874701976776123, "rewards/meter/std": 0.18508003652095795, "rewards/repeat_penalty/mean": 0.875, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.7850605845451355, "rewards/total_composite/std": 0.2699912190437317, "sampling/importance_sampling_ratio/max": 1.438651442527771, "sampling/importance_sampling_ratio/mean": 0.9924401044845581, "sampling/importance_sampling_ratio/min": 0.16446030139923096, "sampling/sampling_logp_difference/max": 1.8050861358642578, "sampling/sampling_logp_difference/mean": 0.032904475927352905, "step": 764 }, { "clip_ratio/high_max": 0.0028409091755747795, "clip_ratio/high_mean": 0.0028409091755747795, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0028409091755747795, "completions/clipped_ratio": 0.0, "completions/max_length": 88.0, "completions/max_terminated_length": 88.0, "completions/mean_length": 87.125, "completions/mean_terminated_length": 87.125, "completions/min_length": 87.0, "completions/min_terminated_length": 87.0, "entropy": 0.008648848335724324, "epoch": 0.030726593565489818, "frac_reward_zero_std": 0.0, "grad_norm": 4.968373775482178, "learning_rate": 7.684848484848485e-06, "loss": 0.0008, "num_tokens": 1688548.0, "reward": 0.6467622518539429, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9950021505355835, "reward_meter_std": 8.806584810372442e-05, "reward_repeat_penalty_mean": 0.6500000357627869, "reward_repeat_penalty_std": 0.1414213478565216, "reward_std": 0.14079821109771729, "reward_total_composite_mean": 0.6467622518539429, "reward_total_composite_std": 0.14079822599887848, "reward_total_mean": 0.6467622518539429, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9950021505355835, "rewards/meter/std": 8.806584810372442e-05, "rewards/repeat_penalty/mean": 0.6500000357627869, "rewards/repeat_penalty/std": 0.1414213478565216, "rewards/total_composite/mean": 0.6467622518539429, "rewards/total_composite/std": 0.14079822599887848, "sampling/importance_sampling_ratio/max": 1.767101764678955, "sampling/importance_sampling_ratio/mean": 0.9999979138374329, "sampling/importance_sampling_ratio/min": 0.1755325347185135, "sampling/sampling_logp_difference/max": 1.7399308681488037, "sampling/sampling_logp_difference/mean": 0.004592791199684143, "step": 765 }, { "clip_ratio/high_max": 0.03126057400368154, "clip_ratio/high_mean": 0.03126057400368154, "clip_ratio/low_mean": 0.004807692486792803, "clip_ratio/low_min": 0.004807692486792803, "clip_ratio/region_mean": 0.03606826649047434, "completions/clipped_ratio": 0.0, "completions/max_length": 54.0, "completions/max_terminated_length": 54.0, "completions/mean_length": 52.0, "completions/mean_terminated_length": 52.0, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.19545143470168114, "epoch": 0.030766759047274772, "frac_reward_zero_std": 0.0, "grad_norm": 10.79392147064209, "learning_rate": 7.681818181818183e-06, "loss": 0.0014, "num_tokens": 1690236.0, "reward": 0.8247180581092834, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8247180581092834, "reward_meter_std": 0.3005145490169525, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.3005145490169525, "reward_total_composite_mean": 0.8247180581092834, "reward_total_composite_std": 0.3005145490169525, "reward_total_mean": 0.8247180581092834, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8247180581092834, "rewards/meter/std": 0.3005145490169525, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.8247180581092834, "rewards/total_composite/std": 0.3005145490169525, "sampling/importance_sampling_ratio/max": 1.6643987894058228, "sampling/importance_sampling_ratio/mean": 0.997559666633606, "sampling/importance_sampling_ratio/min": 0.2000909447669983, "sampling/sampling_logp_difference/max": 1.6089832782745361, "sampling/sampling_logp_difference/mean": 0.04232970252633095, "step": 766 }, { "clip_ratio/high_max": 0.026226354064419866, "clip_ratio/high_mean": 0.026226354064419866, "clip_ratio/low_mean": 0.03220835281535983, "clip_ratio/low_min": 0.03220835281535983, "clip_ratio/region_mean": 0.058434706879779696, "completions/clipped_ratio": 0.0, "completions/max_length": 77.0, "completions/max_terminated_length": 77.0, "completions/mean_length": 72.625, "completions/mean_terminated_length": 72.625, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.46072521805763245, "epoch": 0.030806924529059726, "frac_reward_zero_std": 0.0, "grad_norm": 12.172296524047852, "learning_rate": 7.678787878787878e-06, "loss": 0.0103, "num_tokens": 1692065.0, "reward": 0.36088046431541443, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.3632194995880127, "reward_meter_std": 0.32341283559799194, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.3263150453567505, "reward_total_composite_mean": 0.36088046431541443, "reward_total_composite_std": 0.3263150453567505, "reward_total_mean": 0.36088046431541443, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.3632194995880127, "rewards/meter/std": 0.32341283559799194, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.36088046431541443, "rewards/total_composite/std": 0.3263150453567505, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9972518086433411, "sampling/importance_sampling_ratio/min": 0.005771172232925892, "sampling/sampling_logp_difference/max": 5.154880046844482, "sampling/sampling_logp_difference/mean": 0.07868395745754242, "step": 767 }, { "clip_ratio/high_max": 0.0022935778833925724, "clip_ratio/high_mean": 0.0022935778833925724, "clip_ratio/low_mean": 0.0059091257862746716, "clip_ratio/low_min": 0.0059091257862746716, "clip_ratio/region_mean": 0.008202703669667244, "completions/clipped_ratio": 0.0, "completions/max_length": 109.0, "completions/max_terminated_length": 109.0, "completions/mean_length": 107.875, "completions/mean_terminated_length": 107.875, "completions/min_length": 104.0, "completions/min_terminated_length": 104.0, "entropy": 0.09003173373639584, "epoch": 0.03084709001084468, "frac_reward_zero_std": 0.0, "grad_norm": 2.0709922313690186, "learning_rate": 7.675757575757577e-06, "loss": -0.0095, "num_tokens": 1694344.0, "reward": 0.5636348724365234, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7045435905456543, "reward_meter_std": 0.13543730974197388, "reward_repeat_penalty_mean": 0.800000011920929, "reward_repeat_penalty_std": 0.0, "reward_std": 0.10834983736276627, "reward_total_composite_mean": 0.5636348724365234, "reward_total_composite_std": 0.10834985971450806, "reward_total_mean": 0.5636348724365234, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7045435905456543, "rewards/meter/std": 0.13543730974197388, "rewards/repeat_penalty/mean": 0.800000011920929, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.5636348724365234, "rewards/total_composite/std": 0.10834985971450806, "sampling/importance_sampling_ratio/max": 1.4763460159301758, "sampling/importance_sampling_ratio/mean": 1.0031026601791382, "sampling/importance_sampling_ratio/min": 0.38304516673088074, "sampling/sampling_logp_difference/max": 0.9596023559570312, "sampling/sampling_logp_difference/mean": 0.010335095226764679, "step": 768 }, { "clip_ratio/high_max": 0.0102224723668769, "clip_ratio/high_mean": 0.0102224723668769, "clip_ratio/low_mean": 0.009834110038354993, "clip_ratio/low_min": 0.009834110038354993, "clip_ratio/region_mean": 0.020056582405231893, "completions/clipped_ratio": 0.0, "completions/max_length": 172.0, "completions/max_terminated_length": 172.0, "completions/mean_length": 143.625, "completions/mean_terminated_length": 143.625, "completions/min_length": 126.0, "completions/min_terminated_length": 126.0, "entropy": 0.0793102509342134, "epoch": 0.030887255492629634, "frac_reward_zero_std": 0.0, "grad_norm": 7.707916736602783, "learning_rate": 7.672727272727273e-06, "loss": 0.0714, "num_tokens": 1696973.0, "reward": 0.4105571210384369, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_meter_mean": 0.7441333532333374, "reward_meter_std": 0.4554755687713623, "reward_repeat_penalty_mean": 0.6174242496490479, "reward_repeat_penalty_std": 0.1036364957690239, "reward_std": 0.2803230583667755, "reward_total_composite_mean": 0.4105571210384369, "reward_total_composite_std": 0.2803230583667755, "reward_total_mean": 0.4105571210384369, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/meter/mean": 0.7441333532333374, "rewards/meter/std": 0.4554755687713623, "rewards/repeat_penalty/mean": 0.6174242496490479, "rewards/repeat_penalty/std": 0.1036364957690239, "rewards/total_composite/mean": 0.4105571210384369, "rewards/total_composite/std": 0.2803230583667755, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9966462850570679, "sampling/importance_sampling_ratio/min": 0.0077336556278169155, "sampling/sampling_logp_difference/max": 4.862173557281494, "sampling/sampling_logp_difference/mean": 0.03509281575679779, "step": 769 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 1.0, "completions/max_length": 512.0, "completions/max_terminated_length": 0.0, "completions/mean_length": 512.0, "completions/mean_terminated_length": 0.0, "completions/min_length": 512.0, "completions/min_terminated_length": 0.0, "entropy": 0.0, "epoch": 0.030927420974414588, "frac_reward_zero_std": 0.0, "grad_norm": 0.0, "learning_rate": 7.66969696969697e-06, "loss": 0.0, "num_tokens": 1698965.0, "reward": 0.3744324743747711, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.7828947305679321, "reward_count_adherence_std": 0.03373000770807266, "reward_meter_mean": 0.8939934968948364, "reward_meter_std": 0.13721102476119995, "reward_repeat_penalty_mean": 0.5402884483337402, "reward_repeat_penalty_std": 0.2157072126865387, "reward_std": 0.17441345751285553, "reward_total_composite_mean": 0.3744324743747711, "reward_total_composite_std": 0.17441345751285553, "reward_total_mean": 0.3744324743747711, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.7828947305679321, "rewards/count_adherence/std": 0.03373000770807266, "rewards/meter/mean": 0.8939934968948364, "rewards/meter/std": 0.13721102476119995, "rewards/repeat_penalty/mean": 0.5402884483337402, "rewards/repeat_penalty/std": 0.2157072126865387, "rewards/total_composite/mean": 0.3744324743747711, "rewards/total_composite/std": 0.17441345751285553, "sampling/importance_sampling_ratio/max": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "step": 770 }, { "clip_ratio/high_max": 0.010813763190526515, "clip_ratio/high_mean": 0.010813763190526515, "clip_ratio/low_mean": 0.004294316866435111, "clip_ratio/low_min": 0.004294316866435111, "clip_ratio/region_mean": 0.015108080056961626, "completions/clipped_ratio": 0.0, "completions/max_length": 263.0, "completions/max_terminated_length": 263.0, "completions/mean_length": 230.5, "completions/mean_terminated_length": 230.5, "completions/min_length": 180.0, "completions/min_terminated_length": 180.0, "entropy": 0.13555688876658678, "epoch": 0.030967586456199542, "frac_reward_zero_std": 0.0, "grad_norm": 4.9908342361450195, "learning_rate": 7.666666666666667e-06, "loss": 0.0526, "num_tokens": 1702409.0, "reward": 0.3491661250591278, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_meter_mean": 0.7852883338928223, "reward_meter_std": 0.3382474482059479, "reward_repeat_penalty_mean": 0.5688130855560303, "reward_repeat_penalty_std": 0.20688475668430328, "reward_std": 0.22600221633911133, "reward_total_composite_mean": 0.3491661250591278, "reward_total_composite_std": 0.22600221633911133, "reward_total_mean": 0.3491661250591278, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/meter/mean": 0.7852883338928223, "rewards/meter/std": 0.3382474482059479, "rewards/repeat_penalty/mean": 0.5688130855560303, "rewards/repeat_penalty/std": 0.20688475668430328, "rewards/total_composite/mean": 0.3491661250591278, "rewards/total_composite/std": 0.22600221633911133, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0030508041381836, "sampling/importance_sampling_ratio/min": 0.21555320918560028, "sampling/sampling_logp_difference/max": 1.5345475673675537, "sampling/sampling_logp_difference/mean": 0.018919790163636208, "step": 771 }, { "clip_ratio/high_max": 0.006097560748457909, "clip_ratio/high_mean": 0.006097560748457909, "clip_ratio/low_mean": 0.015005706925876439, "clip_ratio/low_min": 0.015005706925876439, "clip_ratio/region_mean": 0.021103267674334347, "completions/clipped_ratio": 0.0, "completions/max_length": 123.0, "completions/max_terminated_length": 123.0, "completions/mean_length": 99.375, "completions/mean_terminated_length": 99.375, "completions/min_length": 90.0, "completions/min_terminated_length": 90.0, "entropy": 0.08717024885118008, "epoch": 0.031007751937984496, "frac_reward_zero_std": 0.0, "grad_norm": 5.677700042724609, "learning_rate": 7.663636363636364e-06, "loss": -0.1232, "num_tokens": 1704516.0, "reward": 0.6195021271705627, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1157275140285492, "reward_meter_mean": 0.9852504730224609, "reward_meter_std": 0.008375532925128937, "reward_repeat_penalty_mean": 0.7785714864730835, "reward_repeat_penalty_std": 0.039677999913692474, "reward_std": 0.05528085306286812, "reward_total_composite_mean": 0.6195021271705627, "reward_total_composite_std": 0.05528084933757782, "reward_total_mean": 0.6195021271705627, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1157275140285492, "rewards/meter/mean": 0.9852504730224609, "rewards/meter/std": 0.008375532925128937, "rewards/repeat_penalty/mean": 0.7785714864730835, "rewards/repeat_penalty/std": 0.039677999913692474, "rewards/total_composite/mean": 0.6195021271705627, "rewards/total_composite/std": 0.05528084933757782, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0006357431411743, "sampling/importance_sampling_ratio/min": 0.2092006951570511, "sampling/sampling_logp_difference/max": 1.5644612312316895, "sampling/sampling_logp_difference/mean": 0.020249057561159134, "step": 772 }, { "clip_ratio/high_max": 0.008041649358347058, "clip_ratio/high_mean": 0.008041649358347058, "clip_ratio/low_mean": 0.003349777136463672, "clip_ratio/low_min": 0.003349777136463672, "clip_ratio/region_mean": 0.01139142649481073, "completions/clipped_ratio": 0.0, "completions/max_length": 460.0, "completions/max_terminated_length": 460.0, "completions/mean_length": 409.625, "completions/mean_terminated_length": 409.625, "completions/min_length": 346.0, "completions/min_terminated_length": 346.0, "entropy": 0.07645870675332844, "epoch": 0.03104791741976945, "frac_reward_zero_std": 0.0, "grad_norm": 5.519010066986084, "learning_rate": 7.660606060606062e-06, "loss": 0.0245, "num_tokens": 1709201.0, "reward": 0.17074038088321686, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.3571428656578064, "reward_count_adherence_std": 0.07636035233736038, "reward_meter_mean": 0.9907213449478149, "reward_meter_std": 0.006963523104786873, "reward_repeat_penalty_mean": 0.45148104429244995, "reward_repeat_penalty_std": 0.23929926753044128, "reward_std": 0.10653632134199142, "reward_total_composite_mean": 0.17074038088321686, "reward_total_composite_std": 0.10653632879257202, "reward_total_mean": 0.17074038088321686, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.3571428656578064, "rewards/count_adherence/std": 0.07636035233736038, "rewards/meter/mean": 0.9907213449478149, "rewards/meter/std": 0.006963523104786873, "rewards/repeat_penalty/mean": 0.45148104429244995, "rewards/repeat_penalty/std": 0.23929926753044128, "rewards/total_composite/mean": 0.17074038088321686, "rewards/total_composite/std": 0.10653632879257202, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9987974166870117, "sampling/importance_sampling_ratio/min": 0.006077729165554047, "sampling/sampling_logp_difference/max": 5.103124141693115, "sampling/sampling_logp_difference/mean": 0.02135242149233818, "step": 773 }, { "clip_ratio/high_max": 0.022313665016554296, "clip_ratio/high_mean": 0.022313665016554296, "clip_ratio/low_mean": 0.005654420121572912, "clip_ratio/low_min": 0.005654420121572912, "clip_ratio/region_mean": 0.027968085138127208, "completions/clipped_ratio": 0.0, "completions/max_length": 75.0, "completions/max_terminated_length": 75.0, "completions/mean_length": 69.125, "completions/mean_terminated_length": 69.125, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.37627044692635536, "epoch": 0.031088082901554404, "frac_reward_zero_std": 0.0, "grad_norm": 6.2788872718811035, "learning_rate": 7.657575757575757e-06, "loss": -0.0134, "num_tokens": 1711058.0, "reward": 0.7258920669555664, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7258920669555664, "reward_meter_std": 0.40674278140068054, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.40674278140068054, "reward_total_composite_mean": 0.7258920669555664, "reward_total_composite_std": 0.40674278140068054, "reward_total_mean": 0.7258920669555664, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7258920669555664, "rewards/meter/std": 0.40674278140068054, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.7258920669555664, "rewards/total_composite/std": 0.40674278140068054, "sampling/importance_sampling_ratio/max": 1.882003903388977, "sampling/importance_sampling_ratio/mean": 1.0082036256790161, "sampling/importance_sampling_ratio/min": 0.1066029891371727, "sampling/sampling_logp_difference/max": 2.2386436462402344, "sampling/sampling_logp_difference/mean": 0.05154965817928314, "step": 774 }, { "clip_ratio/high_max": 0.007139897206798196, "clip_ratio/high_mean": 0.007139897206798196, "clip_ratio/low_mean": 0.00418766331858933, "clip_ratio/low_min": 0.00418766331858933, "clip_ratio/region_mean": 0.011327560525387526, "completions/clipped_ratio": 0.0, "completions/max_length": 188.0, "completions/max_terminated_length": 188.0, "completions/mean_length": 168.375, "completions/mean_terminated_length": 168.375, "completions/min_length": 147.0, "completions/min_terminated_length": 147.0, "entropy": 0.06733021000400186, "epoch": 0.031128248383339358, "frac_reward_zero_std": 0.0, "grad_norm": 2.807114601135254, "learning_rate": 7.654545454545456e-06, "loss": 0.0636, "num_tokens": 1713733.0, "reward": 0.5430476665496826, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_meter_mean": 0.9743660688400269, "reward_meter_std": 0.04519447684288025, "reward_repeat_penalty_mean": 0.6060605645179749, "reward_repeat_penalty_std": 0.13551926612854004, "reward_std": 0.16461656987667084, "reward_total_composite_mean": 0.5430476665496826, "reward_total_composite_std": 0.16461656987667084, "reward_total_mean": 0.5430476665496826, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/meter/mean": 0.9743660688400269, "rewards/meter/std": 0.04519447684288025, "rewards/repeat_penalty/mean": 0.6060605645179749, "rewards/repeat_penalty/std": 0.13551926612854004, "rewards/total_composite/mean": 0.5430476665496826, "rewards/total_composite/std": 0.16461656987667084, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9989210367202759, "sampling/importance_sampling_ratio/min": 3.2826496862981003e-06, "sampling/sampling_logp_difference/max": 12.626859664916992, "sampling/sampling_logp_difference/mean": 0.026703810319304466, "step": 775 }, { "clip_ratio/high_max": 0.009050324792042375, "clip_ratio/high_mean": 0.009050324792042375, "clip_ratio/low_mean": 0.009263938991352916, "clip_ratio/low_min": 0.009263938991352916, "clip_ratio/region_mean": 0.01831426378339529, "completions/clipped_ratio": 0.0, "completions/max_length": 56.0, "completions/max_terminated_length": 56.0, "completions/mean_length": 54.5, "completions/mean_terminated_length": 54.5, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.09682174911722541, "epoch": 0.03116841386512431, "frac_reward_zero_std": 0.0, "grad_norm": 7.4227614402771, "learning_rate": 7.651515151515152e-06, "loss": 0.0012, "num_tokens": 1715409.0, "reward": 0.9904471635818481, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9904471635818481, "reward_meter_std": 0.002613567281514406, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.002613575430586934, "reward_total_composite_mean": 0.9904471635818481, "reward_total_composite_std": 0.002613567281514406, "reward_total_mean": 0.9904471635818481, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9904471635818481, "rewards/meter/std": 0.002613567281514406, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9904471635818481, "rewards/total_composite/std": 0.002613567281514406, "sampling/importance_sampling_ratio/max": 1.4630638360977173, "sampling/importance_sampling_ratio/mean": 0.9967302083969116, "sampling/importance_sampling_ratio/min": 0.3387613296508789, "sampling/sampling_logp_difference/max": 1.0824594497680664, "sampling/sampling_logp_difference/mean": 0.024185476824641228, "step": 776 }, { "clip_ratio/high_max": 0.013795045204460621, "clip_ratio/high_mean": 0.013795045204460621, "clip_ratio/low_mean": 0.013795045437291265, "clip_ratio/low_min": 0.013795045437291265, "clip_ratio/region_mean": 0.027590090641751885, "completions/clipped_ratio": 0.0, "completions/max_length": 37.0, "completions/max_terminated_length": 37.0, "completions/mean_length": 36.5, "completions/mean_terminated_length": 36.5, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.11897748988121748, "epoch": 0.031208579346909265, "frac_reward_zero_std": 0.0, "grad_norm": 8.215063095092773, "learning_rate": 7.648484848484849e-06, "loss": 0.0046, "num_tokens": 1716925.0, "reward": 0.978127121925354, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.978127121925354, "reward_meter_std": 0.0063257296569645405, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.006325736176222563, "reward_total_composite_mean": 0.978127121925354, "reward_total_composite_std": 0.0063257296569645405, "reward_total_mean": 0.978127121925354, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.978127121925354, "rewards/meter/std": 0.0063257296569645405, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.978127121925354, "rewards/total_composite/std": 0.0063257296569645405, "sampling/importance_sampling_ratio/max": 1.6868826150894165, "sampling/importance_sampling_ratio/mean": 1.0036948919296265, "sampling/importance_sampling_ratio/min": 0.23150713741779327, "sampling/sampling_logp_difference/max": 1.4631445407867432, "sampling/sampling_logp_difference/mean": 0.03158137574791908, "step": 777 }, { "clip_ratio/high_max": 0.020928236190229654, "clip_ratio/high_mean": 0.020928236190229654, "clip_ratio/low_mean": 0.02250340231694281, "clip_ratio/low_min": 0.02250340231694281, "clip_ratio/region_mean": 0.043431638507172465, "completions/clipped_ratio": 0.0, "completions/max_length": 74.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 72.25, "completions/mean_terminated_length": 72.25, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.25925541296601295, "epoch": 0.03124874482869422, "frac_reward_zero_std": 0.0, "grad_norm": 5.06115198135376, "learning_rate": 7.645454545454546e-06, "loss": 0.014, "num_tokens": 1718951.0, "reward": 0.9873093366622925, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9873093366622925, "reward_meter_std": 0.01036460418254137, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.010364595800638199, "reward_total_composite_mean": 0.9873093366622925, "reward_total_composite_std": 0.01036460418254137, "reward_total_mean": 0.9873093366622925, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9873093366622925, "rewards/meter/std": 0.01036460418254137, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9873093366622925, "rewards/total_composite/std": 0.01036460418254137, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0149582624435425, "sampling/importance_sampling_ratio/min": 0.4104529917240143, "sampling/sampling_logp_difference/max": 0.8904938697814941, "sampling/sampling_logp_difference/mean": 0.03534568101167679, "step": 778 }, { "clip_ratio/high_max": 0.030813875840976834, "clip_ratio/high_mean": 0.030813875840976834, "clip_ratio/low_mean": 0.008561643771827221, "clip_ratio/low_min": 0.008561643771827221, "clip_ratio/region_mean": 0.039375519612804055, "completions/clipped_ratio": 0.25, "completions/max_length": 512.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 182.5, "completions/mean_terminated_length": 72.66667175292969, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.38310878723859787, "epoch": 0.03128891031047917, "frac_reward_zero_std": 0.0, "grad_norm": 1.4244983196258545, "learning_rate": 7.642424242424244e-06, "loss": -0.1238, "num_tokens": 1720483.0, "reward": 0.5616785287857056, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6190794110298157, "reward_meter_std": 0.3674232065677643, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.43257129192352295, "reward_total_composite_mean": 0.5616785287857056, "reward_total_composite_std": 0.43257132172584534, "reward_total_mean": 0.5616785287857056, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6190794110298157, "rewards/meter/std": 0.3674232065677643, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.5616785287857056, "rewards/total_composite/std": 0.43257132172584534, "sampling/importance_sampling_ratio/max": 1.9660524129867554, "sampling/importance_sampling_ratio/mean": 1.0154547691345215, "sampling/importance_sampling_ratio/min": 0.2951788604259491, "sampling/sampling_logp_difference/max": 1.2201738357543945, "sampling/sampling_logp_difference/mean": 0.07225891947746277, "step": 779 }, { "clip_ratio/high_max": 0.029140884289518, "clip_ratio/high_mean": 0.029140884289518, "clip_ratio/low_mean": 0.004807692486792803, "clip_ratio/low_min": 0.004807692486792803, "clip_ratio/region_mean": 0.0339485767763108, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 182.0, "completions/mean_length": 174.375, "completions/mean_terminated_length": 126.14286041259766, "completions/min_length": 111.0, "completions/min_terminated_length": 111.0, "entropy": 0.24183030799031258, "epoch": 0.03132907579226413, "frac_reward_zero_std": 0.0, "grad_norm": 3.119354009628296, "learning_rate": 7.639393939393939e-06, "loss": -0.0498, "num_tokens": 1722862.0, "reward": 0.4575069546699524, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_meter_mean": 0.6168656349182129, "reward_meter_std": 0.4164867103099823, "reward_repeat_penalty_mean": 0.7492559552192688, "reward_repeat_penalty_std": 0.14768067002296448, "reward_std": 0.3478102684020996, "reward_total_composite_mean": 0.4575069546699524, "reward_total_composite_std": 0.3478102684020996, "reward_total_mean": 0.4575069546699524, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/meter/mean": 0.6168656349182129, "rewards/meter/std": 0.4164867103099823, "rewards/repeat_penalty/mean": 0.7492559552192688, "rewards/repeat_penalty/std": 0.14768067002296448, "rewards/total_composite/mean": 0.4575069546699524, "rewards/total_composite/std": 0.3478102684020996, "sampling/importance_sampling_ratio/max": 1.7341415882110596, "sampling/importance_sampling_ratio/mean": 1.0024807453155518, "sampling/importance_sampling_ratio/min": 0.34019285440444946, "sampling/sampling_logp_difference/max": 1.078242540359497, "sampling/sampling_logp_difference/mean": 0.03274521231651306, "step": 780 }, { "clip_ratio/high_max": 0.016590908635407686, "clip_ratio/high_mean": 0.016590908635407686, "clip_ratio/low_mean": 0.04398810095153749, "clip_ratio/low_min": 0.04398810095153749, "clip_ratio/region_mean": 0.060579009586945176, "completions/clipped_ratio": 0.0, "completions/max_length": 55.0, "completions/max_terminated_length": 55.0, "completions/mean_length": 47.375, "completions/mean_terminated_length": 47.375, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.9118200056254864, "epoch": 0.03136924127404908, "frac_reward_zero_std": 0.0, "grad_norm": 12.43602180480957, "learning_rate": 7.636363636363638e-06, "loss": -0.0116, "num_tokens": 1724537.0, "reward": 0.4856577217578888, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5619980096817017, "reward_meter_std": 0.3257886469364166, "reward_repeat_penalty_mean": 0.875, "reward_repeat_penalty_std": 0.17251639068126678, "reward_std": 0.3285104036331177, "reward_total_composite_mean": 0.4856577217578888, "reward_total_composite_std": 0.3285104036331177, "reward_total_mean": 0.4856577217578888, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5619980096817017, "rewards/meter/std": 0.3257886469364166, "rewards/repeat_penalty/mean": 0.875, "rewards/repeat_penalty/std": 0.17251639068126678, "rewards/total_composite/mean": 0.4856577217578888, "rewards/total_composite/std": 0.3285104036331177, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9970747232437134, "sampling/importance_sampling_ratio/min": 0.18346960842609406, "sampling/sampling_logp_difference/max": 1.6957062482833862, "sampling/sampling_logp_difference/mean": 0.09212920814752579, "step": 781 }, { "clip_ratio/high_max": 0.013982121949084103, "clip_ratio/high_mean": 0.013982121949084103, "clip_ratio/low_mean": 0.008460594224743545, "clip_ratio/low_min": 0.008460594224743545, "clip_ratio/region_mean": 0.022442716173827648, "completions/clipped_ratio": 0.125, "completions/max_length": 512.0, "completions/max_terminated_length": 123.0, "completions/mean_length": 166.75, "completions/mean_terminated_length": 117.42857360839844, "completions/min_length": 111.0, "completions/min_terminated_length": 111.0, "entropy": 0.2663711039349437, "epoch": 0.031409406755834035, "frac_reward_zero_std": 0.0, "grad_norm": 1.6532626152038574, "learning_rate": 7.633333333333334e-06, "loss": -0.1573, "num_tokens": 1726623.0, "reward": 0.5303109288215637, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6895759105682373, "reward_meter_std": 0.26801931858062744, "reward_repeat_penalty_mean": 0.824999988079071, "reward_repeat_penalty_std": 0.19820624589920044, "reward_std": 0.28132033348083496, "reward_total_composite_mean": 0.5303109288215637, "reward_total_composite_std": 0.28132033348083496, "reward_total_mean": 0.5303109288215637, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6895759105682373, "rewards/meter/std": 0.26801931858062744, "rewards/repeat_penalty/mean": 0.824999988079071, "rewards/repeat_penalty/std": 0.19820624589920044, "rewards/total_composite/mean": 0.5303109288215637, "rewards/total_composite/std": 0.28132033348083496, "sampling/importance_sampling_ratio/max": 1.9478799104690552, "sampling/importance_sampling_ratio/mean": 1.006204605102539, "sampling/importance_sampling_ratio/min": 0.31285813450813293, "sampling/sampling_logp_difference/max": 1.1620054244995117, "sampling/sampling_logp_difference/mean": 0.03518048673868179, "step": 782 }, { "clip_ratio/high_max": 0.013986280770041049, "clip_ratio/high_mean": 0.013986280770041049, "clip_ratio/low_mean": 0.017455301131121814, "clip_ratio/low_min": 0.017455301131121814, "clip_ratio/region_mean": 0.03144158190116286, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 79.5, "completions/mean_terminated_length": 79.5, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "entropy": 0.3720816671848297, "epoch": 0.03144957223761899, "frac_reward_zero_std": 0.0, "grad_norm": 4.994919776916504, "learning_rate": 7.630303030303031e-06, "loss": 0.0077, "num_tokens": 1728611.0, "reward": 0.6204426288604736, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6204426288604736, "reward_meter_std": 0.3357177972793579, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.3357177972793579, "reward_total_composite_mean": 0.6204426288604736, "reward_total_composite_std": 0.3357177972793579, "reward_total_mean": 0.6204426288604736, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6204426288604736, "rewards/meter/std": 0.3357177972793579, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6204426288604736, "rewards/total_composite/std": 0.3357177972793579, "sampling/importance_sampling_ratio/max": 1.7397865056991577, "sampling/importance_sampling_ratio/mean": 1.011016845703125, "sampling/importance_sampling_ratio/min": 0.34513458609580994, "sampling/sampling_logp_difference/max": 1.0638208389282227, "sampling/sampling_logp_difference/mean": 0.04477819800376892, "step": 783 }, { "clip_ratio/high_max": 0.012099922401830554, "clip_ratio/high_mean": 0.012099922401830554, "clip_ratio/low_mean": 0.018428327050060034, "clip_ratio/low_min": 0.018428327050060034, "clip_ratio/region_mean": 0.030528249451890588, "completions/clipped_ratio": 0.0, "completions/max_length": 63.0, "completions/max_terminated_length": 63.0, "completions/mean_length": 61.375, "completions/mean_terminated_length": 61.375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.2184693105518818, "epoch": 0.03148973771940394, "frac_reward_zero_std": 0.0, "grad_norm": 7.485208988189697, "learning_rate": 7.627272727272727e-06, "loss": 0.0052, "num_tokens": 1730350.0, "reward": 0.453016996383667, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5055776834487915, "reward_meter_std": 0.32300832867622375, "reward_repeat_penalty_mean": 0.8333333730697632, "reward_repeat_penalty_std": 0.17817415297031403, "reward_std": 0.33306846022605896, "reward_total_composite_mean": 0.453016996383667, "reward_total_composite_std": 0.33306846022605896, "reward_total_mean": 0.453016996383667, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5055776834487915, "rewards/meter/std": 0.32300832867622375, "rewards/repeat_penalty/mean": 0.8333333730697632, "rewards/repeat_penalty/std": 0.17817415297031403, "rewards/total_composite/mean": 0.453016996383667, "rewards/total_composite/std": 0.33306846022605896, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9948754906654358, "sampling/importance_sampling_ratio/min": 0.17718835175037384, "sampling/sampling_logp_difference/max": 1.7305419445037842, "sampling/sampling_logp_difference/mean": 0.047304026782512665, "step": 784 }, { "clip_ratio/high_max": 0.01767290150746703, "clip_ratio/high_mean": 0.01767290150746703, "clip_ratio/low_mean": 0.010869022691622376, "clip_ratio/low_min": 0.010869022691622376, "clip_ratio/region_mean": 0.028541924199089408, "completions/clipped_ratio": 0.0, "completions/max_length": 116.0, "completions/max_terminated_length": 116.0, "completions/mean_length": 104.75, "completions/mean_terminated_length": 104.75, "completions/min_length": 99.0, "completions/min_terminated_length": 99.0, "entropy": 0.31474705785512924, "epoch": 0.0315299032011889, "frac_reward_zero_std": 0.0, "grad_norm": 6.059953212738037, "learning_rate": 7.6242424242424254e-06, "loss": 0.0036, "num_tokens": 1732524.0, "reward": 0.46458256244659424, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.49319469928741455, "reward_meter_std": 0.2711309790611267, "reward_repeat_penalty_mean": 0.8999999761581421, "reward_repeat_penalty_std": 0.10690449178218842, "reward_std": 0.2836271822452545, "reward_total_composite_mean": 0.46458256244659424, "reward_total_composite_std": 0.2836271822452545, "reward_total_mean": 0.46458256244659424, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.49319469928741455, "rewards/meter/std": 0.2711309790611267, "rewards/repeat_penalty/mean": 0.8999999761581421, "rewards/repeat_penalty/std": 0.10690449178218842, "rewards/total_composite/mean": 0.46458256244659424, "rewards/total_composite/std": 0.2836271822452545, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0086406469345093, "sampling/importance_sampling_ratio/min": 0.27668195962905884, "sampling/sampling_logp_difference/max": 1.2848865985870361, "sampling/sampling_logp_difference/mean": 0.042036473751068115, "step": 785 }, { "clip_ratio/high_max": 0.0042421949619892985, "clip_ratio/high_mean": 0.0042421949619892985, "clip_ratio/low_mean": 0.004607091657817364, "clip_ratio/low_min": 0.004607091657817364, "clip_ratio/region_mean": 0.008849286619806662, "completions/clipped_ratio": 0.0, "completions/max_length": 406.0, "completions/max_terminated_length": 406.0, "completions/mean_length": 368.25, "completions/mean_terminated_length": 368.25, "completions/min_length": 322.0, "completions/min_terminated_length": 322.0, "entropy": 0.07080868305638433, "epoch": 0.03157006868297385, "frac_reward_zero_std": 0.0, "grad_norm": 2.024092435836792, "learning_rate": 7.621212121212122e-06, "loss": -0.0567, "num_tokens": 1737190.0, "reward": 0.3579794764518738, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7014279365539551, "reward_meter_std": 0.43751856684684753, "reward_repeat_penalty_mean": 0.5806276798248291, "reward_repeat_penalty_std": 0.06668182462453842, "reward_std": 0.22696760296821594, "reward_total_composite_mean": 0.3579794764518738, "reward_total_composite_std": 0.22696760296821594, "reward_total_mean": 0.3579794764518738, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7014279365539551, "rewards/meter/std": 0.43751856684684753, "rewards/repeat_penalty/mean": 0.5806276798248291, "rewards/repeat_penalty/std": 0.06668182462453842, "rewards/total_composite/mean": 0.3579794764518738, "rewards/total_composite/std": 0.22696760296821594, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0009483098983765, "sampling/importance_sampling_ratio/min": 0.2249726504087448, "sampling/sampling_logp_difference/max": 1.491776466369629, "sampling/sampling_logp_difference/mean": 0.012620110996067524, "step": 786 }, { "clip_ratio/high_max": 0.007280809339135885, "clip_ratio/high_mean": 0.007280809339135885, "clip_ratio/low_mean": 0.01558087719604373, "clip_ratio/low_min": 0.01558087719604373, "clip_ratio/region_mean": 0.022861686535179615, "completions/clipped_ratio": 0.0, "completions/max_length": 162.0, "completions/max_terminated_length": 162.0, "completions/mean_length": 153.75, "completions/mean_terminated_length": 153.75, "completions/min_length": 135.0, "completions/min_terminated_length": 135.0, "entropy": 0.11316746287047863, "epoch": 0.031610234164758805, "frac_reward_zero_std": 0.0, "grad_norm": 3.6839067935943604, "learning_rate": 7.618181818181819e-06, "loss": 0.0123, "num_tokens": 1739852.0, "reward": 0.435272216796875, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7929247617721558, "reward_meter_std": 0.10911522805690765, "reward_repeat_penalty_mean": 0.6818181872367859, "reward_repeat_penalty_std": 0.06872082501649857, "reward_std": 0.09194309264421463, "reward_total_composite_mean": 0.435272216796875, "reward_total_composite_std": 0.09194310009479523, "reward_total_mean": 0.435272216796875, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7929247617721558, "rewards/meter/std": 0.10911522805690765, "rewards/repeat_penalty/mean": 0.6818181872367859, "rewards/repeat_penalty/std": 0.06872082501649857, "rewards/total_composite/mean": 0.435272216796875, "rewards/total_composite/std": 0.09194310009479523, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9994563460350037, "sampling/importance_sampling_ratio/min": 0.14561693370342255, "sampling/sampling_logp_difference/max": 1.9267759323120117, "sampling/sampling_logp_difference/mean": 0.028897186741232872, "step": 787 }, { "clip_ratio/high_max": 0.01074189692735672, "clip_ratio/high_mean": 0.01074189692735672, "clip_ratio/low_mean": 0.012860541231930256, "clip_ratio/low_min": 0.012860541231930256, "clip_ratio/region_mean": 0.023602438159286976, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 58.0, "completions/mean_terminated_length": 58.0, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.16343743726611137, "epoch": 0.03165039964654376, "frac_reward_zero_std": 0.0, "grad_norm": 7.856208324432373, "learning_rate": 7.6151515151515155e-06, "loss": -0.0051, "num_tokens": 1741588.0, "reward": 0.6469426155090332, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6469426155090332, "reward_meter_std": 0.24868278205394745, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.24868276715278625, "reward_total_composite_mean": 0.6469426155090332, "reward_total_composite_std": 0.24868278205394745, "reward_total_mean": 0.6469426155090332, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6469426155090332, "rewards/meter/std": 0.24868278205394745, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6469426155090332, "rewards/total_composite/std": 0.24868278205394745, "sampling/importance_sampling_ratio/max": 1.8282591104507446, "sampling/importance_sampling_ratio/mean": 1.0034902095794678, "sampling/importance_sampling_ratio/min": 0.5131197571754456, "sampling/sampling_logp_difference/max": 0.6672461032867432, "sampling/sampling_logp_difference/mean": 0.022744039073586464, "step": 788 }, { "clip_ratio/high_max": 0.008072916883975267, "clip_ratio/high_mean": 0.008072916883975267, "clip_ratio/low_mean": 0.008072916883975267, "clip_ratio/low_min": 0.008072916883975267, "clip_ratio/region_mean": 0.016145833767950535, "completions/clipped_ratio": 0.0, "completions/max_length": 32.0, "completions/max_terminated_length": 32.0, "completions/mean_length": 31.25, "completions/mean_terminated_length": 31.25, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.17746192403137684, "epoch": 0.03169056512832871, "frac_reward_zero_std": 0.0, "grad_norm": 13.922452926635742, "learning_rate": 7.612121212121213e-06, "loss": 0.0131, "num_tokens": 1743054.0, "reward": 0.9813005924224854, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9813005924224854, "reward_meter_std": 0.016189413145184517, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.016189415007829666, "reward_total_composite_mean": 0.9813005924224854, "reward_total_composite_std": 0.016189413145184517, "reward_total_mean": 0.9813005924224854, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9813005924224854, "rewards/meter/std": 0.016189413145184517, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9813005924224854, "rewards/total_composite/std": 0.016189413145184517, "sampling/importance_sampling_ratio/max": 1.8372166156768799, "sampling/importance_sampling_ratio/mean": 0.9976152181625366, "sampling/importance_sampling_ratio/min": 0.3405851721763611, "sampling/sampling_logp_difference/max": 1.0770900249481201, "sampling/sampling_logp_difference/mean": 0.033597491681575775, "step": 789 }, { "clip_ratio/high_max": 0.019598963437601924, "clip_ratio/high_mean": 0.019598963437601924, "clip_ratio/low_mean": 0.009868005756288767, "clip_ratio/low_min": 0.009868005756288767, "clip_ratio/region_mean": 0.02946696919389069, "completions/clipped_ratio": 0.0, "completions/max_length": 92.0, "completions/max_terminated_length": 92.0, "completions/mean_length": 89.625, "completions/mean_terminated_length": 89.625, "completions/min_length": 85.0, "completions/min_terminated_length": 85.0, "entropy": 0.11805877834558487, "epoch": 0.03173073061011367, "frac_reward_zero_std": 0.0, "grad_norm": 6.977390766143799, "learning_rate": 7.609090909090909e-06, "loss": -0.0039, "num_tokens": 1745187.0, "reward": 0.6789125204086304, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.8486406207084656, "reward_meter_std": 0.2562169134616852, "reward_repeat_penalty_mean": 0.800000011920929, "reward_repeat_penalty_std": 0.0, "reward_std": 0.20497353374958038, "reward_total_composite_mean": 0.6789125204086304, "reward_total_composite_std": 0.20497353374958038, "reward_total_mean": 0.6789125204086304, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.8486406207084656, "rewards/meter/std": 0.2562169134616852, "rewards/repeat_penalty/mean": 0.800000011920929, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6789125204086304, "rewards/total_composite/std": 0.20497353374958038, "sampling/importance_sampling_ratio/max": 1.8353419303894043, "sampling/importance_sampling_ratio/mean": 1.0061084032058716, "sampling/importance_sampling_ratio/min": 0.44276192784309387, "sampling/sampling_logp_difference/max": 0.814723014831543, "sampling/sampling_logp_difference/mean": 0.021279064938426018, "step": 790 }, { "clip_ratio/high_max": 0.00779381615575403, "clip_ratio/high_mean": 0.00779381615575403, "clip_ratio/low_mean": 0.0032260402804240584, "clip_ratio/low_min": 0.0032260402804240584, "clip_ratio/region_mean": 0.011019856436178088, "completions/clipped_ratio": 0.0, "completions/max_length": 258.0, "completions/max_terminated_length": 258.0, "completions/mean_length": 247.25, "completions/mean_terminated_length": 247.25, "completions/min_length": 228.0, "completions/min_terminated_length": 228.0, "entropy": 0.042171002831310034, "epoch": 0.03177089609189862, "frac_reward_zero_std": 0.0, "grad_norm": 1.8626375198364258, "learning_rate": 7.606060606060606e-06, "loss": -0.0395, "num_tokens": 1748773.0, "reward": 0.4338645935058594, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_meter_mean": 0.9959322214126587, "reward_meter_std": 0.004204806871712208, "reward_repeat_penalty_mean": 0.49047619104385376, "reward_repeat_penalty_std": 0.17105023562908173, "reward_std": 0.12500372529029846, "reward_total_composite_mean": 0.4338645935058594, "reward_total_composite_std": 0.12500374019145966, "reward_total_mean": 0.4338645935058594, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/meter/mean": 0.9959322214126587, "rewards/meter/std": 0.004204806871712208, "rewards/repeat_penalty/mean": 0.49047619104385376, "rewards/repeat_penalty/std": 0.17105023562908173, "rewards/total_composite/mean": 0.4338645935058594, "rewards/total_composite/std": 0.12500374019145966, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0004253387451172, "sampling/importance_sampling_ratio/min": 0.0588078573346138, "sampling/sampling_logp_difference/max": 2.833479881286621, "sampling/sampling_logp_difference/mean": 0.014479896053671837, "step": 791 }, { "clip_ratio/high_max": 0.00658258656039834, "clip_ratio/high_mean": 0.00658258656039834, "clip_ratio/low_mean": 0.010955466306768358, "clip_ratio/low_min": 0.010955466306768358, "clip_ratio/region_mean": 0.017538052867166698, "completions/clipped_ratio": 0.0, "completions/max_length": 148.0, "completions/max_terminated_length": 148.0, "completions/mean_length": 135.0, "completions/mean_terminated_length": 135.0, "completions/min_length": 124.0, "completions/min_terminated_length": 124.0, "entropy": 0.0634374669753015, "epoch": 0.031811061573683574, "frac_reward_zero_std": 0.0, "grad_norm": 3.4738333225250244, "learning_rate": 7.603030303030303e-06, "loss": 0.023, "num_tokens": 1751485.0, "reward": 0.6611686944961548, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.991753101348877, "reward_meter_std": 0.002629074966534972, "reward_repeat_penalty_mean": 0.6666666865348816, "reward_repeat_penalty_std": 0.0, "reward_std": 0.0017527244053781033, "reward_total_composite_mean": 0.6611686944961548, "reward_total_composite_std": 0.0017527303425595164, "reward_total_mean": 0.6611686944961548, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.991753101348877, "rewards/meter/std": 0.002629074966534972, "rewards/repeat_penalty/mean": 0.6666666865348816, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6611686944961548, "rewards/total_composite/std": 0.0017527303425595164, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0068343877792358, "sampling/importance_sampling_ratio/min": 0.13520930707454681, "sampling/sampling_logp_difference/max": 2.0009312629699707, "sampling/sampling_logp_difference/mean": 0.019971484318375587, "step": 792 }, { "clip_ratio/high_max": 0.0335467669647187, "clip_ratio/high_mean": 0.0335467669647187, "clip_ratio/low_mean": 0.006658692145720124, "clip_ratio/low_min": 0.006658692145720124, "clip_ratio/region_mean": 0.040205459110438824, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 56.0, "completions/mean_terminated_length": 56.0, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.15502143744379282, "epoch": 0.03185122705546853, "frac_reward_zero_std": 0.0, "grad_norm": 5.889811038970947, "learning_rate": 7.600000000000001e-06, "loss": 0.0066, "num_tokens": 1753253.0, "reward": 0.9050641655921936, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9871419668197632, "reward_meter_std": 0.005153529345989227, "reward_repeat_penalty_mean": 0.9166666865348816, "reward_repeat_penalty_std": 0.15430334210395813, "reward_std": 0.15341757237911224, "reward_total_composite_mean": 0.9050641655921936, "reward_total_composite_std": 0.15341757237911224, "reward_total_mean": 0.9050641655921936, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9871419668197632, "rewards/meter/std": 0.005153529345989227, "rewards/repeat_penalty/mean": 0.9166666865348816, "rewards/repeat_penalty/std": 0.15430334210395813, "rewards/total_composite/mean": 0.9050641655921936, "rewards/total_composite/std": 0.15341757237911224, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9988625645637512, "sampling/importance_sampling_ratio/min": 0.05082041397690773, "sampling/sampling_logp_difference/max": 2.979457139968872, "sampling/sampling_logp_difference/mean": 0.054076679050922394, "step": 793 }, { "clip_ratio/high_max": 0.007044379832223058, "clip_ratio/high_mean": 0.007044379832223058, "clip_ratio/low_mean": 0.019052310031838715, "clip_ratio/low_min": 0.019052310031838715, "clip_ratio/region_mean": 0.026096689864061773, "completions/clipped_ratio": 0.0, "completions/max_length": 74.0, "completions/max_terminated_length": 74.0, "completions/mean_length": 71.625, "completions/mean_terminated_length": 71.625, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.15924948174506426, "epoch": 0.03189139253725348, "frac_reward_zero_std": 0.0, "grad_norm": 6.565411567687988, "learning_rate": 7.596969696969697e-06, "loss": 0.002, "num_tokens": 1755042.0, "reward": 0.9123142957687378, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.9123142957687378, "reward_meter_std": 0.09913700073957443, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.09913701564073563, "reward_total_composite_mean": 0.9123142957687378, "reward_total_composite_std": 0.09913700073957443, "reward_total_mean": 0.9123142957687378, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.9123142957687378, "rewards/meter/std": 0.09913700073957443, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.9123142957687378, "rewards/total_composite/std": 0.09913700073957443, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0043187141418457, "sampling/importance_sampling_ratio/min": 0.249431312084198, "sampling/sampling_logp_difference/max": 1.3885717391967773, "sampling/sampling_logp_difference/mean": 0.034922052174806595, "step": 794 }, { "clip_ratio/high_max": 0.0034246575087308884, "clip_ratio/high_mean": 0.0034246575087308884, "clip_ratio/low_mean": 0.008561643771827221, "clip_ratio/low_min": 0.008561643771827221, "clip_ratio/region_mean": 0.01198630128055811, "completions/clipped_ratio": 0.0, "completions/max_length": 73.0, "completions/max_terminated_length": 73.0, "completions/mean_length": 73.0, "completions/mean_terminated_length": 73.0, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.07319271843880415, "epoch": 0.031931558019038436, "frac_reward_zero_std": 0.0, "grad_norm": 2.6046133041381836, "learning_rate": 7.593939393939395e-06, "loss": 0.0046, "num_tokens": 1756866.0, "reward": 0.613559365272522, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.613559365272522, "reward_meter_std": 0.046057041734457016, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.04605703800916672, "reward_total_composite_mean": 0.613559365272522, "reward_total_composite_std": 0.046057041734457016, "reward_total_mean": 0.613559365272522, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.613559365272522, "rewards/meter/std": 0.046057041734457016, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.613559365272522, "rewards/total_composite/std": 0.046057041734457016, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0046606063842773, "sampling/importance_sampling_ratio/min": 0.5393000841140747, "sampling/sampling_logp_difference/max": 0.9375072717666626, "sampling/sampling_logp_difference/mean": 0.01630816049873829, "step": 795 }, { "clip_ratio/high_max": 0.002516112755984068, "clip_ratio/high_mean": 0.002516112755984068, "clip_ratio/low_mean": 0.0004734848625957966, "clip_ratio/low_min": 0.0004734848625957966, "clip_ratio/region_mean": 0.0029895976185798645, "completions/clipped_ratio": 0.0, "completions/max_length": 264.0, "completions/max_terminated_length": 264.0, "completions/mean_length": 250.125, "completions/mean_terminated_length": 250.125, "completions/min_length": 248.0, "completions/min_terminated_length": 248.0, "entropy": 0.023278776556253433, "epoch": 0.03197172350082339, "frac_reward_zero_std": 0.0, "grad_norm": 1.5290881395339966, "learning_rate": 7.590909090909091e-06, "loss": 0.0182, "num_tokens": 1760371.0, "reward": 0.3849101662635803, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6284428834915161, "reward_meter_std": 0.1288241744041443, "reward_repeat_penalty_mean": 0.6098901033401489, "reward_repeat_penalty_std": 0.015540807507932186, "reward_std": 0.08409524708986282, "reward_total_composite_mean": 0.3849101662635803, "reward_total_composite_std": 0.08409524708986282, "reward_total_mean": 0.3849101662635803, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6284428834915161, "rewards/meter/std": 0.1288241744041443, "rewards/repeat_penalty/mean": 0.6098901033401489, "rewards/repeat_penalty/std": 0.015540807507932186, "rewards/total_composite/mean": 0.3849101662635803, "rewards/total_composite/std": 0.08409524708986282, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0002148151397705, "sampling/importance_sampling_ratio/min": 0.3427882194519043, "sampling/sampling_logp_difference/max": 1.0706424713134766, "sampling/sampling_logp_difference/mean": 0.006375753786414862, "step": 796 }, { "clip_ratio/high_max": 0.009473072132095695, "clip_ratio/high_mean": 0.009473072132095695, "clip_ratio/low_mean": 0.003246753243729472, "clip_ratio/low_min": 0.003246753243729472, "clip_ratio/region_mean": 0.012719825375825167, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 77.5, "completions/mean_terminated_length": 77.5, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.14471599273383617, "epoch": 0.032011888982608344, "frac_reward_zero_std": 0.0, "grad_norm": 8.541836738586426, "learning_rate": 7.587878787878788e-06, "loss": -0.0121, "num_tokens": 1762455.0, "reward": 0.891382098197937, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_meter_mean": 0.9952297210693359, "reward_meter_std": 0.002311403863132, "reward_repeat_penalty_mean": 0.9583333730697632, "reward_repeat_penalty_std": 0.117851123213768, "reward_std": 0.1964196413755417, "reward_total_composite_mean": 0.891382098197937, "reward_total_composite_std": 0.1964196413755417, "reward_total_mean": 0.891382098197937, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/meter/mean": 0.9952297210693359, "rewards/meter/std": 0.002311403863132, "rewards/repeat_penalty/mean": 0.9583333730697632, "rewards/repeat_penalty/std": 0.117851123213768, "rewards/total_composite/mean": 0.891382098197937, "rewards/total_composite/std": 0.1964196413755417, "sampling/importance_sampling_ratio/max": 1.482370376586914, "sampling/importance_sampling_ratio/mean": 0.9954510927200317, "sampling/importance_sampling_ratio/min": 0.03526677191257477, "sampling/sampling_logp_difference/max": 3.3448140621185303, "sampling/sampling_logp_difference/mean": 0.034574542194604874, "step": 797 }, { "clip_ratio/high_max": 0.00390625, "clip_ratio/high_mean": 0.00390625, "clip_ratio/low_mean": 0.020607191254384816, "clip_ratio/low_min": 0.020607191254384816, "clip_ratio/region_mean": 0.024513441254384816, "completions/clipped_ratio": 0.0, "completions/max_length": 67.0, "completions/max_terminated_length": 67.0, "completions/mean_length": 66.5, "completions/mean_terminated_length": 66.5, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.1323620891198516, "epoch": 0.0320520544643933, "frac_reward_zero_std": 0.0, "grad_norm": 6.7140374183654785, "learning_rate": 7.584848484848486e-06, "loss": 0.0167, "num_tokens": 1764291.0, "reward": 0.6813795566558838, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.6813795566558838, "reward_meter_std": 0.04148668423295021, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_std": 0.04148669168353081, "reward_total_composite_mean": 0.6813795566558838, "reward_total_composite_std": 0.04148668423295021, "reward_total_mean": 0.6813795566558838, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.6813795566558838, "rewards/meter/std": 0.04148668423295021, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.6813795566558838, "rewards/total_composite/std": 0.04148668423295021, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.010377049446106, "sampling/importance_sampling_ratio/min": 0.5285674333572388, "sampling/sampling_logp_difference/max": 0.9566974639892578, "sampling/sampling_logp_difference/mean": 0.023791270330548286, "step": 798 }, { "clip_ratio/high_max": 0.002109704539179802, "clip_ratio/high_mean": 0.002109704539179802, "clip_ratio/low_mean": 0.003645833523478359, "clip_ratio/low_min": 0.003645833523478359, "clip_ratio/region_mean": 0.005755538062658161, "completions/clipped_ratio": 0.0, "completions/max_length": 240.0, "completions/max_terminated_length": 240.0, "completions/mean_length": 239.375, "completions/mean_terminated_length": 239.375, "completions/min_length": 237.0, "completions/min_terminated_length": 237.0, "entropy": 0.030161422211676836, "epoch": 0.03209221994617825, "frac_reward_zero_std": 0.0, "grad_norm": 1.2270196676254272, "learning_rate": 7.581818181818183e-06, "loss": 0.0044, "num_tokens": 1767790.0, "reward": 0.38379937410354614, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.7462765574455261, "reward_meter_std": 0.09833642095327377, "reward_repeat_penalty_mean": 0.6000000238418579, "reward_repeat_penalty_std": 0.0, "reward_std": 0.050573013722896576, "reward_total_composite_mean": 0.38379937410354614, "reward_total_composite_std": 0.05057300627231598, "reward_total_mean": 0.38379937410354614, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.7462765574455261, "rewards/meter/std": 0.09833642095327377, "rewards/repeat_penalty/mean": 0.6000000238418579, "rewards/repeat_penalty/std": 0.0, "rewards/total_composite/mean": 0.38379937410354614, "rewards/total_composite/std": 0.05057300627231598, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9996190071105957, "sampling/importance_sampling_ratio/min": 0.07412450760602951, "sampling/sampling_logp_difference/max": 2.6020090579986572, "sampling/sampling_logp_difference/mean": 0.007426128257066011, "step": 799 }, { "clip_ratio/high_max": 0.0143592240056023, "clip_ratio/high_mean": 0.0143592240056023, "clip_ratio/low_mean": 0.024260351667180657, "clip_ratio/low_min": 0.024260351667180657, "clip_ratio/region_mean": 0.03861957567278296, "completions/clipped_ratio": 0.0, "completions/max_length": 130.0, "completions/max_terminated_length": 130.0, "completions/mean_length": 119.375, "completions/mean_terminated_length": 119.375, "completions/min_length": 110.0, "completions/min_terminated_length": 110.0, "entropy": 0.23464529775083065, "epoch": 0.032132385427963206, "frac_reward_zero_std": 0.0, "grad_norm": 4.79632568359375, "learning_rate": 7.57878787878788e-06, "loss": 0.0432, "num_tokens": 1770025.0, "reward": 0.4120614528656006, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_meter_mean": 0.5170607566833496, "reward_meter_std": 0.48065322637557983, "reward_repeat_penalty_mean": 0.800000011920929, "reward_repeat_penalty_std": 0.10690449178218842, "reward_std": 0.386055052280426, "reward_total_composite_mean": 0.4120614528656006, "reward_total_composite_std": 0.386055052280426, "reward_total_mean": 0.4120614528656006, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/meter/mean": 0.5170607566833496, "rewards/meter/std": 0.48065322637557983, "rewards/repeat_penalty/mean": 0.800000011920929, "rewards/repeat_penalty/std": 0.10690449178218842, "rewards/total_composite/mean": 0.4120614528656006, "rewards/total_composite/std": 0.386055052280426, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 0.9977750182151794, "sampling/importance_sampling_ratio/min": 0.3169117867946625, "sampling/sampling_logp_difference/max": 1.1491317749023438, "sampling/sampling_logp_difference/mean": 0.04103344678878784, "step": 800 }, { "epoch": 0.032132385427963206, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/max_length": 461.9230769230769, "eval_completions/max_terminated_length": 414.46153846153845, "eval_completions/mean_length": 234.29807692307693, "eval_completions/mean_terminated_length": 216.9835216815655, "eval_completions/min_length": 63.84615384615385, "eval_completions/min_terminated_length": 63.84615384615385, "eval_entropy": 0.047992275741237864, "eval_frac_reward_zero_std": 0.0, "eval_loss": NaN, "eval_num_tokens": 1770025.0, "eval_reward": 0.3991968219096844, "eval_reward_arabic_clean_mean": 0.9903846153846154, "eval_reward_arabic_clean_std": 0.027196414195574246, "eval_reward_count_adherence_mean": 0.9552615697567279, "eval_reward_count_adherence_std": 0.08013723160211857, "eval_reward_meter_mean": 0.6419616112342248, "eval_reward_meter_std": 0.3754527878302794, "eval_reward_repeat_penalty_mean": 0.6556147245260385, "eval_reward_repeat_penalty_std": 0.24277657327743676, "eval_reward_std": NaN, "eval_reward_total_composite_mean": 0.3991968219096844, "eval_reward_total_composite_std": 0.3098094039238416, "eval_reward_total_mean": 0.3991968219096844, "eval_rewards/arabic_clean/mean": 0.9903846153846154, "eval_rewards/arabic_clean/std": 0.027196414195574246, "eval_rewards/count_adherence/mean": 0.9552615697567279, "eval_rewards/count_adherence/std": 0.08013723160211857, "eval_rewards/meter/mean": 0.6419616112342248, "eval_rewards/meter/std": 0.3754527878302794, "eval_rewards/repeat_penalty/mean": 0.6556147245260385, "eval_rewards/repeat_penalty/std": 0.24277657327743676, "eval_rewards/total_composite/mean": 0.3991968219096844, "eval_rewards/total_composite/std": 0.3098094039238416, "eval_runtime": 85.9157, "eval_samples_per_second": 1.21, "eval_sampling/importance_sampling_ratio/max": 1.2961730773632343, "eval_sampling/importance_sampling_ratio/mean": 1.0009051194557776, "eval_sampling/importance_sampling_ratio/min": 0.5230464408030877, "eval_sampling/sampling_logp_difference/max": 0.7075341939926147, "eval_sampling/sampling_logp_difference/mean": 0.0054089168552309275, "eval_steps_per_second": 0.151, "step": 800 } ], "logging_steps": 1, "max_steps": 3300, "num_input_tokens_seen": 1770025, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }