{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 39.992248062015506, "eval_steps": 500, "global_step": 160, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.48046875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 934.353515625, "completions/mean_terminated_length": 737.5409545898438, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "epoch": 0.24806201550387597, "frac_reward_zero_std": 0.046875, "grad_norm": 1.0088680982589722, "kl": 0.0, "learning_rate": 1e-06, "loss": 0.033, "num_tokens": 1693946.0, "reward": 0.2611761689186096, "reward_std": 0.2333255410194397, "rewards/verilog_format_reward/mean": 0.25927734375, "rewards/verilog_format_reward/std": 0.2499498724937439, "rewards/verilog_reward_wrapper/mean": 0.0018988256342709064, "rewards/verilog_reward_wrapper/std": 0.022316427901387215, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.484375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 944.9296875, "completions/mean_terminated_length": 766.8632202148438, "completions/min_length": 332.0, "completions/min_terminated_length": 332.0, "epoch": 0.49612403100775193, "frac_reward_zero_std": 0.0234375, "grad_norm": 1.002423882484436, "kl": 0.002178668975830078, "learning_rate": 9.95e-07, "loss": 0.0283, "num_tokens": 3408810.0, "reward": 0.26870644092559814, "reward_std": 0.23519770801067352, "rewards/verilog_format_reward/mean": 0.2666015625, "rewards/verilog_format_reward/std": 0.2495700567960739, "rewards/verilog_reward_wrapper/mean": 0.002104874001815915, "rewards/verilog_reward_wrapper/std": 0.023040015250444412, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.421875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 946.82421875, "completions/mean_terminated_length": 759.7472534179688, "completions/min_length": 201.0, "completions/min_terminated_length": 201.0, "epoch": 0.7441860465116279, "frac_reward_zero_std": 0.0625, "grad_norm": 0.9828478693962097, "kl": 0.002285480499267578, "learning_rate": 9.9e-07, "loss": 0.0282, "num_tokens": 5124870.0, "reward": 0.2463400512933731, "reward_std": 0.23075059056282043, "rewards/verilog_format_reward/mean": 0.24462890625, "rewards/verilog_format_reward/std": 0.2500644326210022, "rewards/verilog_reward_wrapper/mean": 0.0017111403867602348, "rewards/verilog_reward_wrapper/std": 0.022296784445643425, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.48046875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 936.1982421875, "completions/mean_terminated_length": 742.5250854492188, "completions/min_length": 288.0, "completions/min_terminated_length": 288.0, "epoch": 0.9922480620155039, "frac_reward_zero_std": 0.0234375, "grad_norm": 1.148897409439087, "kl": 0.0023889541625976562, "learning_rate": 9.849999999999999e-07, "loss": 0.0305, "num_tokens": 6804233.0, "reward": 0.26753896474838257, "reward_std": 0.2353009283542633, "rewards/verilog_format_reward/mean": 0.26416015625, "rewards/verilog_format_reward/std": 0.24972061812877655, "rewards/verilog_reward_wrapper/mean": 0.0033787949942052364, "rewards/verilog_reward_wrapper/std": 0.03733411431312561, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.4765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 938.2958984375, "completions/mean_terminated_length": 747.3941650390625, "completions/min_length": 322.0, "completions/min_terminated_length": 322.0, "epoch": 1.248062015503876, "frac_reward_zero_std": 0.03125, "grad_norm": 0.9923098087310791, "kl": 0.0032854080200195312, "learning_rate": 9.8e-07, "loss": 0.0268, "num_tokens": 8514792.0, "reward": 0.2662869989871979, "reward_std": 0.23357084393501282, "rewards/verilog_format_reward/mean": 0.26416015625, "rewards/verilog_format_reward/std": 0.24972061812877655, "rewards/verilog_reward_wrapper/mean": 0.002126858336851001, "rewards/verilog_reward_wrapper/std": 0.024007057771086693, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.4765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1039.0, "completions/mean_length": 941.0986328125, "completions/mean_terminated_length": 754.9867553710938, "completions/min_length": 123.0, "completions/min_terminated_length": 123.0, "epoch": 1.496124031007752, "frac_reward_zero_std": 0.03125, "grad_norm": 0.8375123143196106, "kl": 0.003920555114746094, "learning_rate": 9.75e-07, "loss": 0.0329, "num_tokens": 10200797.0, "reward": 0.28171974420547485, "reward_std": 0.23091088235378265, "rewards/verilog_format_reward/mean": 0.2802734375, "rewards/verilog_format_reward/std": 0.2482815384864807, "rewards/verilog_reward_wrapper/mean": 0.0014462890103459358, "rewards/verilog_reward_wrapper/std": 0.023088674992322922, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.484375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 940.0986328125, "completions/mean_terminated_length": 753.8447875976562, "completions/min_length": 251.0, "completions/min_terminated_length": 251.0, "epoch": 1.744186046511628, "frac_reward_zero_std": 0.03125, "grad_norm": 0.8558894991874695, "kl": 0.0045566558837890625, "learning_rate": 9.7e-07, "loss": 0.0282, "num_tokens": 11901546.0, "reward": 0.2651592493057251, "reward_std": 0.231679767370224, "rewards/verilog_format_reward/mean": 0.26318359375, "rewards/verilog_format_reward/std": 0.24977412819862366, "rewards/verilog_reward_wrapper/mean": 0.001975628547370434, "rewards/verilog_reward_wrapper/std": 0.025359520688652992, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.63671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 935.427734375, "completions/mean_terminated_length": 769.9952392578125, "completions/min_length": 206.0, "completions/min_terminated_length": 206.0, "epoch": 1.9922480620155039, "frac_reward_zero_std": 0.046875, "grad_norm": 0.8904445171356201, "kl": 0.0049686431884765625, "learning_rate": 9.649999999999999e-07, "loss": 0.0289, "num_tokens": 13601800.0, "reward": 0.2701188325881958, "reward_std": 0.22994986176490784, "rewards/verilog_format_reward/mean": 0.26953125, "rewards/verilog_format_reward/std": 0.2493576854467392, "rewards/verilog_reward_wrapper/mean": 0.0005875788046978414, "rewards/verilog_reward_wrapper/std": 0.007879519835114479, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.5234375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 940.6845703125, "completions/mean_terminated_length": 762.9769287109375, "completions/min_length": 281.0, "completions/min_terminated_length": 281.0, "epoch": 2.248062015503876, "frac_reward_zero_std": 0.0625, "grad_norm": 0.6666538119316101, "kl": 0.009490966796875, "learning_rate": 9.6e-07, "loss": 0.0229, "num_tokens": 15275549.0, "reward": 0.27797931432724, "reward_std": 0.2228950560092926, "rewards/verilog_format_reward/mean": 0.27685546875, "rewards/verilog_format_reward/std": 0.24867483973503113, "rewards/verilog_reward_wrapper/mean": 0.0011238314909860492, "rewards/verilog_reward_wrapper/std": 0.015673084184527397, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 930.9228515625, "completions/mean_terminated_length": 754.041259765625, "completions/min_length": 213.0, "completions/min_terminated_length": 213.0, "epoch": 2.496124031007752, "frac_reward_zero_std": 0.03125, "grad_norm": 0.5399675965309143, "kl": 0.018108367919921875, "learning_rate": 9.55e-07, "loss": 0.0261, "num_tokens": 16963518.0, "reward": 0.27696189284324646, "reward_std": 0.23013213276863098, "rewards/verilog_format_reward/mean": 0.27490234375, "rewards/verilog_format_reward/std": 0.24887821078300476, "rewards/verilog_reward_wrapper/mean": 0.002059559104964137, "rewards/verilog_reward_wrapper/std": 0.021279197186231613, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.58984375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 936.5546875, "completions/mean_terminated_length": 764.574951171875, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 2.744186046511628, "frac_reward_zero_std": 0.0234375, "grad_norm": 0.6438565850257874, "kl": 0.020801544189453125, "learning_rate": 9.499999999999999e-07, "loss": 0.0214, "num_tokens": 18683366.0, "reward": 0.2814231514930725, "reward_std": 0.23467692732810974, "rewards/verilog_format_reward/mean": 0.28125, "rewards/verilog_format_reward/std": 0.24816039204597473, "rewards/verilog_reward_wrapper/mean": 0.00017317011952400208, "rewards/verilog_reward_wrapper/std": 0.005541443824768066, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 925.6484375, "completions/mean_terminated_length": 743.9038696289062, "completions/min_length": 219.0, "completions/min_terminated_length": 219.0, "epoch": 2.992248062015504, "frac_reward_zero_std": 0.0546875, "grad_norm": 0.7457213997840881, "kl": 0.025104522705078125, "learning_rate": 9.45e-07, "loss": 0.0292, "num_tokens": 20379014.0, "reward": 0.28668883442878723, "reward_std": 0.23001952469348907, "rewards/verilog_format_reward/mean": 0.28466796875, "rewards/verilog_format_reward/std": 0.2477055788040161, "rewards/verilog_reward_wrapper/mean": 0.0020208756905049086, "rewards/verilog_reward_wrapper/std": 0.023941658437252045, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 926.96875, "completions/mean_terminated_length": 755.6448364257812, "completions/min_length": 298.0, "completions/min_terminated_length": 298.0, "epoch": 3.248062015503876, "frac_reward_zero_std": 0.0390625, "grad_norm": 0.583164393901825, "kl": 0.024646759033203125, "learning_rate": 9.399999999999999e-07, "loss": 0.031, "num_tokens": 22049574.0, "reward": 0.29696232080459595, "reward_std": 0.23057907819747925, "rewards/verilog_format_reward/mean": 0.29638671875, "rewards/verilog_format_reward/std": 0.245778888463974, "rewards/verilog_reward_wrapper/mean": 0.0005756138125434518, "rewards/verilog_reward_wrapper/std": 0.010529928840696812, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.66796875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 925.5947265625, "completions/mean_terminated_length": 751.660400390625, "completions/min_length": 272.0, "completions/min_terminated_length": 272.0, "epoch": 3.496124031007752, "frac_reward_zero_std": 0.0625, "grad_norm": 0.588373064994812, "kl": 0.0286102294921875, "learning_rate": 9.35e-07, "loss": 0.0276, "num_tokens": 23727383.0, "reward": 0.2949989438056946, "reward_std": 0.22458623349666595, "rewards/verilog_format_reward/mean": 0.2939453125, "rewards/verilog_format_reward/std": 0.24622756242752075, "rewards/verilog_reward_wrapper/mean": 0.0010536510962992907, "rewards/verilog_reward_wrapper/std": 0.012275650165975094, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.68359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 929.3876953125, "completions/mean_terminated_length": 763.4407958984375, "completions/min_length": 235.0, "completions/min_terminated_length": 235.0, "epoch": 3.744186046511628, "frac_reward_zero_std": 0.0703125, "grad_norm": 0.5754157304763794, "kl": 0.03060150146484375, "learning_rate": 9.3e-07, "loss": 0.0306, "num_tokens": 25434356.0, "reward": 0.29810190200805664, "reward_std": 0.21858294308185577, "rewards/verilog_format_reward/mean": 0.29736328125, "rewards/verilog_format_reward/std": 0.2455923855304718, "rewards/verilog_reward_wrapper/mean": 0.0007386474753729999, "rewards/verilog_reward_wrapper/std": 0.012755481526255608, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.5703125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 946.1669921875, "completions/mean_terminated_length": 785.5099487304688, "completions/min_length": 244.0, "completions/min_terminated_length": 244.0, "epoch": 3.992248062015504, "frac_reward_zero_std": 0.0390625, "grad_norm": 0.4880655109882355, "kl": 0.0306549072265625, "learning_rate": 9.25e-07, "loss": 0.022, "num_tokens": 27141519.0, "reward": 0.2773846983909607, "reward_std": 0.228960782289505, "rewards/verilog_format_reward/mean": 0.2763671875, "rewards/verilog_format_reward/std": 0.24872714281082153, "rewards/verilog_reward_wrapper/mean": 0.001017522532492876, "rewards/verilog_reward_wrapper/std": 0.014751540496945381, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.68359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 927.1025390625, "completions/mean_terminated_length": 758.0115966796875, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "epoch": 4.248062015503876, "frac_reward_zero_std": 0.0546875, "grad_norm": 0.5078848004341125, "kl": 0.033908843994140625, "learning_rate": 9.2e-07, "loss": 0.0192, "num_tokens": 28811272.0, "reward": 0.30459070205688477, "reward_std": 0.22647981345653534, "rewards/verilog_format_reward/mean": 0.3037109375, "rewards/verilog_format_reward/std": 0.24428141117095947, "rewards/verilog_reward_wrapper/mean": 0.0008797940681688488, "rewards/verilog_reward_wrapper/std": 0.012252310290932655, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.68359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 933.8291015625, "completions/mean_terminated_length": 773.9930419921875, "completions/min_length": 240.0, "completions/min_terminated_length": 240.0, "epoch": 4.496124031007752, "frac_reward_zero_std": 0.0703125, "grad_norm": 0.4591120183467865, "kl": 0.0429534912109375, "learning_rate": 9.15e-07, "loss": 0.0198, "num_tokens": 30538681.0, "reward": 0.3030571937561035, "reward_std": 0.2197677195072174, "rewards/verilog_format_reward/mean": 0.30224609375, "rewards/verilog_format_reward/std": 0.24459920823574066, "rewards/verilog_reward_wrapper/mean": 0.0008110881317406893, "rewards/verilog_reward_wrapper/std": 0.01473037339746952, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.75390625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 924.80859375, "completions/mean_terminated_length": 764.4855346679688, "completions/min_length": 177.0, "completions/min_terminated_length": 177.0, "epoch": 4.7441860465116275, "frac_reward_zero_std": 0.0546875, "grad_norm": 0.46417921781539917, "kl": 0.06632232666015625, "learning_rate": 9.1e-07, "loss": 0.026, "num_tokens": 32216525.0, "reward": 0.32833796739578247, "reward_std": 0.21665018796920776, "rewards/verilog_format_reward/mean": 0.32666015625, "rewards/verilog_format_reward/std": 0.23807261884212494, "rewards/verilog_reward_wrapper/mean": 0.0016778087010607123, "rewards/verilog_reward_wrapper/std": 0.019273245707154274, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 930.109375, "completions/mean_terminated_length": 754.8846435546875, "completions/min_length": 257.0, "completions/min_terminated_length": 257.0, "epoch": 4.992248062015504, "frac_reward_zero_std": 0.0390625, "grad_norm": 0.6083055138587952, "kl": 0.0860595703125, "learning_rate": 9.05e-07, "loss": 0.0338, "num_tokens": 33891677.0, "reward": 0.33011066913604736, "reward_std": 0.22226758301258087, "rewards/verilog_format_reward/mean": 0.3291015625, "rewards/verilog_format_reward/std": 0.23727183043956757, "rewards/verilog_reward_wrapper/mean": 0.0010091145522892475, "rewards/verilog_reward_wrapper/std": 0.02074064500629902, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.55078125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 935.490234375, "completions/mean_terminated_length": 754.6397705078125, "completions/min_length": 82.0, "completions/min_terminated_length": 82.0, "epoch": 5.248062015503876, "frac_reward_zero_std": 0.0859375, "grad_norm": 0.5338104367256165, "kl": 0.0912322998046875, "learning_rate": 9e-07, "loss": 0.0268, "num_tokens": 35576683.0, "reward": 0.331076979637146, "reward_std": 0.21504013240337372, "rewards/verilog_format_reward/mean": 0.32958984375, "rewards/verilog_format_reward/std": 0.23710833489894867, "rewards/verilog_reward_wrapper/mean": 0.0014871477615088224, "rewards/verilog_reward_wrapper/std": 0.017633119598031044, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.71484375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 919.30078125, "completions/mean_terminated_length": 745.1343994140625, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "epoch": 5.496124031007752, "frac_reward_zero_std": 0.1171875, "grad_norm": 0.5198015570640564, "kl": 0.100555419921875, "learning_rate": 8.95e-07, "loss": 0.026, "num_tokens": 37254607.0, "reward": 0.3412879407405853, "reward_std": 0.20774725079536438, "rewards/verilog_format_reward/mean": 0.34033203125, "rewards/verilog_format_reward/std": 0.2332235872745514, "rewards/verilog_reward_wrapper/mean": 0.0009558932506479323, "rewards/verilog_reward_wrapper/std": 0.014226512052118778, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.62890625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 929.0009765625, "completions/mean_terminated_length": 752.8705444335938, "completions/min_length": 222.0, "completions/min_terminated_length": 222.0, "epoch": 5.7441860465116275, "frac_reward_zero_std": 0.09375, "grad_norm": 0.5775974988937378, "kl": 0.09844970703125, "learning_rate": 8.9e-07, "loss": 0.0298, "num_tokens": 38939256.0, "reward": 0.33476507663726807, "reward_std": 0.21422725915908813, "rewards/verilog_format_reward/mean": 0.333984375, "rewards/verilog_format_reward/std": 0.23558612167835236, "rewards/verilog_reward_wrapper/mean": 0.0007807133952155709, "rewards/verilog_reward_wrapper/std": 0.011005398817360401, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.69921875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 918.78125, "completions/mean_terminated_length": 741.1080322265625, "completions/min_length": 294.0, "completions/min_terminated_length": 294.0, "epoch": 5.992248062015504, "frac_reward_zero_std": 0.0703125, "grad_norm": 0.5073109269142151, "kl": 0.1094512939453125, "learning_rate": 8.85e-07, "loss": 0.0217, "num_tokens": 40630768.0, "reward": 0.34352004528045654, "reward_std": 0.21125829219818115, "rewards/verilog_format_reward/mean": 0.34326171875, "rewards/verilog_format_reward/std": 0.23206646740436554, "rewards/verilog_reward_wrapper/mean": 0.00025831651873886585, "rewards/verilog_reward_wrapper/std": 0.004853071179240942, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.72265625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 923.669921875, "completions/mean_terminated_length": 756.6621704101562, "completions/min_length": 173.0, "completions/min_terminated_length": 173.0, "epoch": 6.248062015503876, "frac_reward_zero_std": 0.109375, "grad_norm": 0.4295523762702942, "kl": 0.1142120361328125, "learning_rate": 8.799999999999999e-07, "loss": 0.0185, "num_tokens": 42298750.0, "reward": 0.3572348356246948, "reward_std": 0.20643514394760132, "rewards/verilog_format_reward/mean": 0.35595703125, "rewards/verilog_format_reward/std": 0.2265463024377823, "rewards/verilog_reward_wrapper/mean": 0.001277794479392469, "rewards/verilog_reward_wrapper/std": 0.01944502629339695, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.7265625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 924.8271484375, "completions/mean_terminated_length": 760.0068359375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "epoch": 6.496124031007752, "frac_reward_zero_std": 0.1484375, "grad_norm": 0.4428359568119049, "kl": 0.1099853515625, "learning_rate": 8.75e-07, "loss": 0.0195, "num_tokens": 43986333.0, "reward": 0.3545898497104645, "reward_std": 0.1961870640516281, "rewards/verilog_format_reward/mean": 0.3544921875, "rewards/verilog_format_reward/std": 0.22722633183002472, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.6953125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 926.6396484375, "completions/mean_terminated_length": 758.9378051757812, "completions/min_length": 98.0, "completions/min_terminated_length": 98.0, "epoch": 6.7441860465116275, "frac_reward_zero_std": 0.1015625, "grad_norm": 0.542331874370575, "kl": 0.111297607421875, "learning_rate": 8.699999999999999e-07, "loss": 0.022, "num_tokens": 45661972.0, "reward": 0.352826863527298, "reward_std": 0.20133380591869354, "rewards/verilog_format_reward/mean": 0.35205078125, "rewards/verilog_format_reward/std": 0.22833429276943207, "rewards/verilog_reward_wrapper/mean": 0.000776086759287864, "rewards/verilog_reward_wrapper/std": 0.01059730164706707, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.59375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 932.2001953125, "completions/mean_terminated_length": 754.3456420898438, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "epoch": 6.992248062015504, "frac_reward_zero_std": 0.140625, "grad_norm": 0.41572245955467224, "kl": 0.1103973388671875, "learning_rate": 8.65e-07, "loss": 0.0232, "num_tokens": 47380241.0, "reward": 0.3591310381889343, "reward_std": 0.1978302001953125, "rewards/verilog_format_reward/mean": 0.357421875, "rewards/verilog_format_reward/std": 0.22585472464561462, "rewards/verilog_reward_wrapper/mean": 0.0017091556219384074, "rewards/verilog_reward_wrapper/std": 0.019761061295866966, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.61328125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 928.94921875, "completions/mean_terminated_length": 749.8644409179688, "completions/min_length": 162.0, "completions/min_terminated_length": 162.0, "epoch": 7.248062015503876, "frac_reward_zero_std": 0.15625, "grad_norm": 0.5458118915557861, "kl": 0.108856201171875, "learning_rate": 8.599999999999999e-07, "loss": 0.0156, "num_tokens": 49026141.0, "reward": 0.37038612365722656, "reward_std": 0.19074904918670654, "rewards/verilog_format_reward/mean": 0.369140625, "rewards/verilog_format_reward/std": 0.21989254653453827, "rewards/verilog_reward_wrapper/mean": 0.0012455061078071594, "rewards/verilog_reward_wrapper/std": 0.02549765072762966, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.54296875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 936.5556640625, "completions/mean_terminated_length": 755.9063110351562, "completions/min_length": 282.0, "completions/min_terminated_length": 282.0, "epoch": 7.496124031007752, "frac_reward_zero_std": 0.0859375, "grad_norm": 0.5289620161056519, "kl": 0.1089935302734375, "learning_rate": 8.55e-07, "loss": 0.0207, "num_tokens": 50734182.0, "reward": 0.3611854612827301, "reward_std": 0.20991703867912292, "rewards/verilog_format_reward/mean": 0.3603515625, "rewards/verilog_format_reward/std": 0.2244364619255066, "rewards/verilog_reward_wrapper/mean": 0.0008338955813087523, "rewards/verilog_reward_wrapper/std": 0.015692593529820442, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.6328125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 931.52734375, "completions/mean_terminated_length": 759.7703247070312, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "epoch": 7.7441860465116275, "frac_reward_zero_std": 0.1015625, "grad_norm": 0.5790072083473206, "kl": 0.1074371337890625, "learning_rate": 8.499999999999999e-07, "loss": 0.0217, "num_tokens": 52439930.0, "reward": 0.36347654461860657, "reward_std": 0.20243032276630402, "rewards/verilog_format_reward/mean": 0.36279296875, "rewards/verilog_format_reward/std": 0.22321829199790955, "rewards/verilog_reward_wrapper/mean": 0.0006835937965661287, "rewards/verilog_reward_wrapper/std": 0.008243691176176071, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.46875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 935.9296875, "completions/mean_terminated_length": 739.3403930664062, "completions/min_length": 119.0, "completions/min_terminated_length": 119.0, "epoch": 7.992248062015504, "frac_reward_zero_std": 0.09375, "grad_norm": 0.44687142968177795, "kl": 0.1077117919921875, "learning_rate": 8.45e-07, "loss": 0.0201, "num_tokens": 54150050.0, "reward": 0.3705524802207947, "reward_std": 0.201862633228302, "rewards/verilog_format_reward/mean": 0.369140625, "rewards/verilog_format_reward/std": 0.21989254653453827, "rewards/verilog_reward_wrapper/mean": 0.0014118445105850697, "rewards/verilog_reward_wrapper/std": 0.022987863048911095, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 926.8857421875, "completions/mean_terminated_length": 744.0072631835938, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "epoch": 8.248062015503876, "frac_reward_zero_std": 0.09375, "grad_norm": 0.5354660153388977, "kl": 0.104644775390625, "learning_rate": 8.399999999999999e-07, "loss": 0.0286, "num_tokens": 55857429.0, "reward": 0.36854368448257446, "reward_std": 0.2016175091266632, "rewards/verilog_format_reward/mean": 0.36767578125, "rewards/verilog_format_reward/std": 0.22068069875240326, "rewards/verilog_reward_wrapper/mean": 0.0008679118473082781, "rewards/verilog_reward_wrapper/std": 0.014339755289256573, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.5859375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 926.724609375, "completions/mean_terminated_length": 739.0787963867188, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "epoch": 8.496124031007753, "frac_reward_zero_std": 0.1953125, "grad_norm": 0.44367772340774536, "kl": 0.10772705078125, "learning_rate": 8.349999999999999e-07, "loss": 0.013, "num_tokens": 57535827.0, "reward": 0.3788085877895355, "reward_std": 0.17612235248088837, "rewards/verilog_format_reward/mean": 0.37841796875, "rewards/verilog_format_reward/std": 0.21460148692131042, "rewards/verilog_reward_wrapper/mean": 0.0003906250058207661, "rewards/verilog_reward_wrapper/std": 0.006240829359740019, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.28125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 954.4501953125, "completions/mean_terminated_length": 751.6981201171875, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "epoch": 8.744186046511627, "frac_reward_zero_std": 0.109375, "grad_norm": 0.4167349636554718, "kl": 0.10699462890625, "learning_rate": 8.299999999999999e-07, "loss": 0.0237, "num_tokens": 59248536.0, "reward": 0.37083667516708374, "reward_std": 0.19847573339939117, "rewards/verilog_format_reward/mean": 0.369140625, "rewards/verilog_format_reward/std": 0.21989254653453827, "rewards/verilog_reward_wrapper/mean": 0.0016960547072812915, "rewards/verilog_reward_wrapper/std": 0.01918778568506241, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.34765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 947.150390625, "completions/mean_terminated_length": 744.73046875, "completions/min_length": 190.0, "completions/min_terminated_length": 190.0, "epoch": 8.992248062015504, "frac_reward_zero_std": 0.1640625, "grad_norm": 0.4472634792327881, "kl": 0.10552978515625, "learning_rate": 8.249999999999999e-07, "loss": 0.0259, "num_tokens": 60944842.0, "reward": 0.374293714761734, "reward_std": 0.19246095418930054, "rewards/verilog_format_reward/mean": 0.37353515625, "rewards/verilog_format_reward/std": 0.21745170652866364, "rewards/verilog_reward_wrapper/mean": 0.0007585549028590322, "rewards/verilog_reward_wrapper/std": 0.011612006463110447, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.3359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 954.54296875, "completions/mean_terminated_length": 764.1871337890625, "completions/min_length": 226.0, "completions/min_terminated_length": 226.0, "epoch": 9.248062015503876, "frac_reward_zero_std": 0.125, "grad_norm": 0.4278841018676758, "kl": 0.10369873046875, "learning_rate": 8.199999999999999e-07, "loss": 0.0155, "num_tokens": 62661750.0, "reward": 0.3758230209350586, "reward_std": 0.19196775555610657, "rewards/verilog_format_reward/mean": 0.375, "rewards/verilog_format_reward/std": 0.21661214530467987, "rewards/verilog_reward_wrapper/mean": 0.0008229943923652172, "rewards/verilog_reward_wrapper/std": 0.011415086686611176, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.24609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 959.6689453125, "completions/mean_terminated_length": 760.0344848632812, "completions/min_length": 243.0, "completions/min_terminated_length": 243.0, "epoch": 9.496124031007753, "frac_reward_zero_std": 0.1953125, "grad_norm": 0.4209468960762024, "kl": 0.1069183349609375, "learning_rate": 8.149999999999999e-07, "loss": 0.0066, "num_tokens": 64406883.0, "reward": 0.38528627157211304, "reward_std": 0.17944923043251038, "rewards/verilog_format_reward/mean": 0.38427734375, "rewards/verilog_format_reward/std": 0.21098119020462036, "rewards/verilog_reward_wrapper/mean": 0.001008916413411498, "rewards/verilog_reward_wrapper/std": 0.015731938183307648, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.25, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 959.966796875, "completions/mean_terminated_length": 761.8937377929688, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 9.744186046511627, "frac_reward_zero_std": 0.1875, "grad_norm": 0.4477786421775818, "kl": 0.107696533203125, "learning_rate": 8.1e-07, "loss": 0.0049, "num_tokens": 66121129.0, "reward": 0.389325350522995, "reward_std": 0.1795487105846405, "rewards/verilog_format_reward/mean": 0.38818359375, "rewards/verilog_format_reward/std": 0.20844118297100067, "rewards/verilog_reward_wrapper/mean": 0.0011417765635997057, "rewards/verilog_reward_wrapper/std": 0.015038314275443554, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.203125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 968.197265625, "completions/mean_terminated_length": 778.032470703125, "completions/min_length": 278.0, "completions/min_terminated_length": 278.0, "epoch": 9.992248062015504, "frac_reward_zero_std": 0.25, "grad_norm": 0.41470661759376526, "kl": 0.1079254150390625, "learning_rate": 8.05e-07, "loss": 0.0043, "num_tokens": 67825963.0, "reward": 0.40055185556411743, "reward_std": 0.1640794724225998, "rewards/verilog_format_reward/mean": 0.39990234375, "rewards/verilog_format_reward/std": 0.20017096400260925, "rewards/verilog_reward_wrapper/mean": 0.0006495253182947636, "rewards/verilog_reward_wrapper/std": 0.011098792776465416, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.0625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 967.103515625, "completions/mean_terminated_length": 737.9191284179688, "completions/min_length": 21.0, "completions/min_terminated_length": 21.0, "epoch": 10.248062015503876, "frac_reward_zero_std": 0.1953125, "grad_norm": 0.45299988985061646, "kl": 0.1190032958984375, "learning_rate": 8e-07, "loss": 0.0032, "num_tokens": 69569653.0, "reward": 0.3867884576320648, "reward_std": 0.1780305802822113, "rewards/verilog_format_reward/mean": 0.38623046875, "rewards/verilog_format_reward/std": 0.20972412824630737, "rewards/verilog_reward_wrapper/mean": 0.0005579864955507219, "rewards/verilog_reward_wrapper/std": 0.009484429843723774, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": -0.06640625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 971.8955078125, "completions/mean_terminated_length": 757.03662109375, "completions/min_length": 325.0, "completions/min_terminated_length": 325.0, "epoch": 10.496124031007753, "frac_reward_zero_std": 0.171875, "grad_norm": 0.41740894317626953, "kl": 0.1180419921875, "learning_rate": 7.95e-07, "loss": 0.0143, "num_tokens": 71298106.0, "reward": 0.3920270800590515, "reward_std": 0.17672628164291382, "rewards/verilog_format_reward/mean": 0.3916015625, "rewards/verilog_format_reward/std": 0.2061322182416916, "rewards/verilog_reward_wrapper/mean": 0.0004255371168255806, "rewards/verilog_reward_wrapper/std": 0.008528179489076138, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1328125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 987.193359375, "completions/mean_terminated_length": 760.2973022460938, "completions/min_length": 304.0, "completions/min_terminated_length": 304.0, "epoch": 10.744186046511627, "frac_reward_zero_std": 0.1875, "grad_norm": 0.3825106620788574, "kl": 0.1203765869140625, "learning_rate": 7.9e-07, "loss": 0.0106, "num_tokens": 73024088.0, "reward": 0.39765626192092896, "reward_std": 0.1730203926563263, "rewards/verilog_format_reward/mean": 0.3974609375, "rewards/verilog_format_reward/std": 0.20197799801826477, "rewards/verilog_reward_wrapper/mean": 0.00019531250291038305, "rewards/verilog_reward_wrapper/std": 0.004417257383465767, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.078125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 984.3818359375, "completions/mean_terminated_length": 765.2838745117188, "completions/min_length": 86.0, "completions/min_terminated_length": 86.0, "epoch": 10.992248062015504, "frac_reward_zero_std": 0.1640625, "grad_norm": 0.3902977705001831, "kl": 0.123321533203125, "learning_rate": 7.85e-07, "loss": 0.0058, "num_tokens": 74773071.0, "reward": 0.37438714504241943, "reward_std": 0.18653279542922974, "rewards/verilog_format_reward/mean": 0.37353515625, "rewards/verilog_format_reward/std": 0.21745170652866364, "rewards/verilog_reward_wrapper/mean": 0.0008519786642864347, "rewards/verilog_reward_wrapper/std": 0.010081345215439796, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.109375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 982.5244140625, "completions/mean_terminated_length": 746.9517822265625, "completions/min_length": 13.0, "completions/min_terminated_length": 13.0, "epoch": 11.248062015503876, "frac_reward_zero_std": 0.25, "grad_norm": 0.35430705547332764, "kl": 0.127655029296875, "learning_rate": 7.799999999999999e-07, "loss": 0.0007, "num_tokens": 76520288.0, "reward": 0.415169894695282, "reward_std": 0.15625280141830444, "rewards/verilog_format_reward/mean": 0.41455078125, "rewards/verilog_format_reward/std": 0.18830206990242004, "rewards/verilog_reward_wrapper/mean": 0.0006191113498061895, "rewards/verilog_reward_wrapper/std": 0.008100967854261398, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.26953125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1001.23828125, "completions/mean_terminated_length": 782.9839477539062, "completions/min_length": 269.0, "completions/min_terminated_length": 269.0, "epoch": 11.496124031007753, "frac_reward_zero_std": 0.15625, "grad_norm": 0.49290165305137634, "kl": 0.13531494140625, "learning_rate": 7.75e-07, "loss": 0.0017, "num_tokens": 78274444.0, "reward": 0.3833984434604645, "reward_std": 0.18408262729644775, "rewards/verilog_format_reward/mean": 0.38330078125, "rewards/verilog_format_reward/std": 0.2116001546382904, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.3125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 998.5322265625, "completions/mean_terminated_length": 750.5511474609375, "completions/min_length": 154.0, "completions/min_terminated_length": 154.0, "epoch": 11.744186046511627, "frac_reward_zero_std": 0.1875, "grad_norm": 0.38395950198173523, "kl": 0.1358795166015625, "learning_rate": 7.699999999999999e-07, "loss": 0.0008, "num_tokens": 80035325.0, "reward": 0.3938632905483246, "reward_std": 0.17846564948558807, "rewards/verilog_format_reward/mean": 0.3935546875, "rewards/verilog_format_reward/std": 0.20477548241615295, "rewards/verilog_reward_wrapper/mean": 0.00030859376420266926, "rewards/verilog_reward_wrapper/std": 0.007435515522956848, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2734375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 994.8759765625, "completions/mean_terminated_length": 746.521484375, "completions/min_length": 198.0, "completions/min_terminated_length": 198.0, "epoch": 11.992248062015504, "frac_reward_zero_std": 0.203125, "grad_norm": 0.40989598631858826, "kl": 0.14263916015625, "learning_rate": 7.65e-07, "loss": 0.0052, "num_tokens": 81797670.0, "reward": 0.3924964666366577, "reward_std": 0.17577248811721802, "rewards/verilog_format_reward/mean": 0.39208984375, "rewards/verilog_format_reward/std": 0.20579561591148376, "rewards/verilog_reward_wrapper/mean": 0.0004066051042173058, "rewards/verilog_reward_wrapper/std": 0.006511228159070015, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.3125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 998.837890625, "completions/mean_terminated_length": 752.32958984375, "completions/min_length": 284.0, "completions/min_terminated_length": 284.0, "epoch": 12.248062015503876, "frac_reward_zero_std": 0.2578125, "grad_norm": 0.46148744225502014, "kl": 0.14862060546875, "learning_rate": 7.599999999999999e-07, "loss": 0.006, "num_tokens": 83573168.0, "reward": 0.398543119430542, "reward_std": 0.16261698305606842, "rewards/verilog_format_reward/mean": 0.3984375, "rewards/verilog_format_reward/std": 0.20126068592071533, "rewards/verilog_reward_wrapper/mean": 0.00010560219379840419, "rewards/verilog_reward_wrapper/std": 0.003379270201548934, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.34375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 997.9033203125, "completions/mean_terminated_length": 732.4583740234375, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 12.496124031007753, "frac_reward_zero_std": 0.3046875, "grad_norm": 0.32905271649360657, "kl": 0.151031494140625, "learning_rate": 7.55e-07, "loss": 0.0011, "num_tokens": 85302485.0, "reward": 0.413813054561615, "reward_std": 0.1496024876832962, "rewards/verilog_format_reward/mean": 0.4130859375, "rewards/verilog_format_reward/std": 0.18957339227199554, "rewards/verilog_reward_wrapper/mean": 0.0007271224749274552, "rewards/verilog_reward_wrapper/std": 0.012825895100831985, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.3671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 1005.2119140625, "completions/mean_terminated_length": 766.8950805664062, "completions/min_length": 240.0, "completions/min_terminated_length": 240.0, "epoch": 12.744186046511627, "frac_reward_zero_std": 0.2578125, "grad_norm": 0.3361338675022125, "kl": 0.15399169921875, "learning_rate": 7.5e-07, "loss": 0.0048, "num_tokens": 87070414.0, "reward": 0.40986329317092896, "reward_std": 0.16000983119010925, "rewards/verilog_format_reward/mean": 0.40966796875, "rewards/verilog_format_reward/std": 0.19246380031108856, "rewards/verilog_reward_wrapper/mean": 0.00019531250291038305, "rewards/verilog_reward_wrapper/std": 0.004417257383465767, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4296875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 1011.111328125, "completions/mean_terminated_length": 777.24658203125, "completions/min_length": 196.0, "completions/min_terminated_length": 196.0, "epoch": 12.992248062015504, "frac_reward_zero_std": 0.2578125, "grad_norm": 0.3623391091823578, "kl": 0.158599853515625, "learning_rate": 7.45e-07, "loss": 0.0061, "num_tokens": 88858448.0, "reward": 0.40947264432907104, "reward_std": 0.15797565877437592, "rewards/verilog_format_reward/mean": 0.4091796875, "rewards/verilog_format_reward/std": 0.19286823272705078, "rewards/verilog_reward_wrapper/mean": 0.0002929687616415322, "rewards/verilog_reward_wrapper/std": 0.005407365038990974, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.41015625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1010.1728515625, "completions/mean_terminated_length": 779.9138793945312, "completions/min_length": 359.0, "completions/min_terminated_length": 359.0, "epoch": 13.248062015503876, "frac_reward_zero_std": 0.40625, "grad_norm": 0.353252649307251, "kl": 0.16265869140625, "learning_rate": 7.4e-07, "loss": 0.005, "num_tokens": 90626721.0, "reward": 0.4288085997104645, "reward_std": 0.1250714659690857, "rewards/verilog_format_reward/mean": 0.4287109375, "rewards/verilog_format_reward/std": 0.17490647733211517, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1010.4619140625, "completions/mean_terminated_length": 768.8402709960938, "completions/min_length": 166.0, "completions/min_terminated_length": 166.0, "epoch": 13.496124031007753, "frac_reward_zero_std": 0.28125, "grad_norm": 0.36094939708709717, "kl": 0.1693115234375, "learning_rate": 7.35e-07, "loss": 0.0076, "num_tokens": 92401674.0, "reward": 0.4185546934604645, "reward_std": 0.1495988517999649, "rewards/verilog_format_reward/mean": 0.41845703125, "rewards/verilog_format_reward/std": 0.1848122924566269, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.41015625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1007.5546875, "completions/mean_terminated_length": 762.158935546875, "completions/min_length": 346.0, "completions/min_terminated_length": 346.0, "epoch": 13.744186046511627, "frac_reward_zero_std": 0.3515625, "grad_norm": 0.3663080632686615, "kl": 0.170654296875, "learning_rate": 7.3e-07, "loss": 0.0034, "num_tokens": 94147202.0, "reward": 0.4220859408378601, "reward_std": 0.13914452493190765, "rewards/verilog_format_reward/mean": 0.421875, "rewards/verilog_format_reward/std": 0.1816347986459732, "rewards/verilog_reward_wrapper/mean": 0.00021093750547152013, "rewards/verilog_reward_wrapper/std": 0.006750000175088644, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4140625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1039.0, "completions/mean_length": 1004.1181640625, "completions/mean_terminated_length": 736.780029296875, "completions/min_length": 208.0, "completions/min_terminated_length": 208.0, "epoch": 13.992248062015504, "frac_reward_zero_std": 0.375, "grad_norm": 0.31234675645828247, "kl": 0.1727294921875, "learning_rate": 7.249999999999999e-07, "loss": 0.0086, "num_tokens": 95932563.0, "reward": 0.4193359315395355, "reward_std": 0.1348457634449005, "rewards/verilog_format_reward/mean": 0.4189453125, "rewards/verilog_format_reward/std": 0.18436560034751892, "rewards/verilog_reward_wrapper/mean": 0.0003906250058207661, "rewards/verilog_reward_wrapper/std": 0.006240829359740019, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.34765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 1007.115234375, "completions/mean_terminated_length": 787.0419311523438, "completions/min_length": 387.0, "completions/min_terminated_length": 387.0, "epoch": 14.248062015503876, "frac_reward_zero_std": 0.3671875, "grad_norm": 0.31959035992622375, "kl": 0.1754150390625, "learning_rate": 7.2e-07, "loss": 0.0088, "num_tokens": 97728337.0, "reward": 0.4329012930393219, "reward_std": 0.1276518702507019, "rewards/verilog_format_reward/mean": 0.4326171875, "rewards/verilog_format_reward/std": 0.170819953083992, "rewards/verilog_reward_wrapper/mean": 0.0002840909000951797, "rewards/verilog_reward_wrapper/std": 0.005248639266937971, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.51171875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1043.0, "completions/mean_length": 1017.048828125, "completions/mean_terminated_length": 780.0640258789062, "completions/min_length": 310.0, "completions/min_terminated_length": 310.0, "epoch": 14.496124031007753, "frac_reward_zero_std": 0.3828125, "grad_norm": 0.35448935627937317, "kl": 0.183074951171875, "learning_rate": 7.149999999999999e-07, "loss": 0.0079, "num_tokens": 99494451.0, "reward": 0.43460813164711, "reward_std": 0.12309622764587402, "rewards/verilog_format_reward/mean": 0.43408203125, "rewards/verilog_format_reward/std": 0.16923882067203522, "rewards/verilog_reward_wrapper/mean": 0.0005261008627712727, "rewards/verilog_reward_wrapper/std": 0.007591851055622101, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.46484375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1014.9130859375, "completions/mean_terminated_length": 787.7445068359375, "completions/min_length": 325.0, "completions/min_terminated_length": 325.0, "epoch": 14.744186046511627, "frac_reward_zero_std": 0.4375, "grad_norm": 0.31801262497901917, "kl": 0.1885986328125, "learning_rate": 7.1e-07, "loss": 0.0059, "num_tokens": 101257578.0, "reward": 0.4434269070625305, "reward_std": 0.11294721066951752, "rewards/verilog_format_reward/mean": 0.44287109375, "rewards/verilog_format_reward/std": 0.15913979709148407, "rewards/verilog_reward_wrapper/mean": 0.000555803591851145, "rewards/verilog_reward_wrapper/std": 0.01234681811183691, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4140625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1011.7421875, "completions/mean_terminated_length": 788.82666015625, "completions/min_length": 282.0, "completions/min_terminated_length": 282.0, "epoch": 14.992248062015504, "frac_reward_zero_std": 0.46875, "grad_norm": 0.34155765175819397, "kl": 0.1822509765625, "learning_rate": 7.049999999999999e-07, "loss": 0.004, "num_tokens": 103032170.0, "reward": 0.4462890625, "reward_std": 0.1067114844918251, "rewards/verilog_format_reward/mean": 0.4462890625, "rewards/verilog_format_reward/std": 0.15490008890628815, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.44140625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1009.857421875, "completions/mean_terminated_length": 762.5454711914062, "completions/min_length": 334.0, "completions/min_terminated_length": 334.0, "epoch": 15.248062015503876, "frac_reward_zero_std": 0.4296875, "grad_norm": 0.3989734649658203, "kl": 0.18731689453125, "learning_rate": 7e-07, "loss": 0.0044, "num_tokens": 104807016.0, "reward": 0.4365234375, "reward_std": 0.11760853230953217, "rewards/verilog_format_reward/mean": 0.4365234375, "rewards/verilog_format_reward/std": 0.16654156148433685, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 1011.001953125, "completions/mean_terminated_length": 751.9850463867188, "completions/min_length": 240.0, "completions/min_terminated_length": 240.0, "epoch": 15.496124031007753, "frac_reward_zero_std": 0.46875, "grad_norm": 0.3529666066169739, "kl": 0.19097900390625, "learning_rate": 6.949999999999999e-07, "loss": 0.005, "num_tokens": 106558450.0, "reward": 0.4441356658935547, "reward_std": 0.1094958558678627, "rewards/verilog_format_reward/mean": 0.44384765625, "rewards/verilog_format_reward/std": 0.1579476147890091, "rewards/verilog_reward_wrapper/mean": 0.0002880215470213443, "rewards/verilog_reward_wrapper/std": 0.009216689504683018, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.5, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1016.728515625, "completions/mean_terminated_length": 783.828125, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 15.744186046511627, "frac_reward_zero_std": 0.4765625, "grad_norm": 0.30272263288497925, "kl": 0.19207763671875, "learning_rate": 6.9e-07, "loss": 0.0113, "num_tokens": 108344524.0, "reward": 0.44678282737731934, "reward_std": 0.10582344233989716, "rewards/verilog_format_reward/mean": 0.4462890625, "rewards/verilog_format_reward/std": 0.15490008890628815, "rewards/verilog_reward_wrapper/mean": 0.0004937665071338415, "rewards/verilog_reward_wrapper/std": 0.01019641850143671, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.48828125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1014.146484375, "completions/mean_terminated_length": 769.740478515625, "completions/min_length": 231.0, "completions/min_terminated_length": 231.0, "epoch": 15.992248062015504, "frac_reward_zero_std": 0.5078125, "grad_norm": 0.28854435682296753, "kl": 0.193450927734375, "learning_rate": 6.85e-07, "loss": 0.0093, "num_tokens": 110130770.0, "reward": 0.4513853192329407, "reward_std": 0.09740185737609863, "rewards/verilog_format_reward/mean": 0.451171875, "rewards/verilog_format_reward/std": 0.14849717915058136, "rewards/verilog_reward_wrapper/mean": 0.00021344865672290325, "rewards/verilog_reward_wrapper/std": 0.006830357015132904, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.50390625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1017.6083984375, "completions/mean_terminated_length": 788.8267822265625, "completions/min_length": 187.0, "completions/min_terminated_length": 187.0, "epoch": 16.248062015503876, "frac_reward_zero_std": 0.6171875, "grad_norm": 0.249369278550148, "kl": 0.1981201171875, "learning_rate": 6.800000000000001e-07, "loss": 0.0042, "num_tokens": 111918241.0, "reward": 0.45947265625, "reward_std": 0.07805588841438293, "rewards/verilog_format_reward/mean": 0.45947265625, "rewards/verilog_format_reward/std": 0.1365262120962143, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.5625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1017.3154296875, "completions/mean_terminated_length": 751.169677734375, "completions/min_length": 311.0, "completions/min_terminated_length": 311.0, "epoch": 16.496124031007753, "frac_reward_zero_std": 0.53125, "grad_norm": 0.3230433464050293, "kl": 0.204010009765625, "learning_rate": 6.75e-07, "loss": 0.0046, "num_tokens": 113680684.0, "reward": 0.45913708209991455, "reward_std": 0.09054259955883026, "rewards/verilog_format_reward/mean": 0.45849609375, "rewards/verilog_format_reward/std": 0.13801442086696625, "rewards/verilog_reward_wrapper/mean": 0.0006409912602975965, "rewards/verilog_reward_wrapper/std": 0.012371823191642761, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 1010.44921875, "completions/mean_terminated_length": 756.521728515625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "epoch": 16.74418604651163, "frac_reward_zero_std": 0.59375, "grad_norm": 0.27663522958755493, "kl": 0.2032470703125, "learning_rate": 6.7e-07, "loss": 0.0084, "num_tokens": 115456016.0, "reward": 0.462890625, "reward_std": 0.08014466613531113, "rewards/verilog_format_reward/mean": 0.462890625, "rewards/verilog_format_reward/std": 0.13112731277942657, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1004.240234375, "completions/mean_terminated_length": 764.2804565429688, "completions/min_length": 300.0, "completions/min_terminated_length": 300.0, "epoch": 16.992248062015506, "frac_reward_zero_std": 0.5234375, "grad_norm": 0.32575589418411255, "kl": 0.201263427734375, "learning_rate": 6.65e-07, "loss": 0.0108, "num_tokens": 117224822.0, "reward": 0.45820385217666626, "reward_std": 0.09324575960636139, "rewards/verilog_format_reward/mean": 0.4580078125, "rewards/verilog_format_reward/std": 0.13874995708465576, "rewards/verilog_reward_wrapper/mean": 0.00019605655688792467, "rewards/verilog_reward_wrapper/std": 0.004434116650372744, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.421875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1039.0, "completions/mean_length": 1012.3369140625, "completions/mean_terminated_length": 789.4121704101562, "completions/min_length": 248.0, "completions/min_terminated_length": 248.0, "epoch": 17.248062015503876, "frac_reward_zero_std": 0.6015625, "grad_norm": 0.28014716506004333, "kl": 0.202178955078125, "learning_rate": 6.6e-07, "loss": 0.0056, "num_tokens": 119022335.0, "reward": 0.45947265625, "reward_std": 0.08124551177024841, "rewards/verilog_format_reward/mean": 0.45947265625, "rewards/verilog_format_reward/std": 0.1365262120962143, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.41796875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1008.4150390625, "completions/mean_terminated_length": 764.2080688476562, "completions/min_length": 351.0, "completions/min_terminated_length": 351.0, "epoch": 17.496124031007753, "frac_reward_zero_std": 0.6015625, "grad_norm": 0.5041443109512329, "kl": 0.2069091796875, "learning_rate": 6.55e-07, "loss": 0.0114, "num_tokens": 120782624.0, "reward": 0.4608295261859894, "reward_std": 0.07834380865097046, "rewards/verilog_format_reward/mean": 0.46044921875, "rewards/verilog_format_reward/std": 0.13501454889774323, "rewards/verilog_reward_wrapper/mean": 0.00038030132418498397, "rewards/verilog_reward_wrapper/std": 0.009566394612193108, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.44921875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1009.515625, "completions/mean_terminated_length": 755.9857788085938, "completions/min_length": 9.0, "completions/min_terminated_length": 9.0, "epoch": 17.74418604651163, "frac_reward_zero_std": 0.65625, "grad_norm": 0.27798721194267273, "kl": 0.21356201171875, "learning_rate": 6.5e-07, "loss": 0.0066, "num_tokens": 122544864.0, "reward": 0.47043633460998535, "reward_std": 0.0662059634923935, "rewards/verilog_format_reward/mean": 0.47021484375, "rewards/verilog_format_reward/std": 0.11840233206748962, "rewards/verilog_reward_wrapper/mean": 0.00022149094729684293, "rewards/verilog_reward_wrapper/std": 0.007087710313498974, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.39453125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1006.1416015625, "completions/mean_terminated_length": 760.2515869140625, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 17.992248062015506, "frac_reward_zero_std": 0.578125, "grad_norm": 0.2668783664703369, "kl": 0.20751953125, "learning_rate": 6.45e-07, "loss": 0.0065, "num_tokens": 124315401.0, "reward": 0.46620237827301025, "reward_std": 0.08015787601470947, "rewards/verilog_format_reward/mean": 0.4658203125, "rewards/verilog_format_reward/std": 0.12624245882034302, "rewards/verilog_reward_wrapper/mean": 0.00038208006299100816, "rewards/verilog_reward_wrapper/std": 0.009548499248921871, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4453125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1012.515625, "completions/mean_terminated_length": 779.6901245117188, "completions/min_length": 381.0, "completions/min_terminated_length": 381.0, "epoch": 18.248062015503876, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.25418999791145325, "kl": 0.211822509765625, "learning_rate": 6.4e-07, "loss": 0.0113, "num_tokens": 126091153.0, "reward": 0.4732421934604645, "reward_std": 0.06128532811999321, "rewards/verilog_format_reward/mean": 0.47314453125, "rewards/verilog_format_reward/std": 0.11277827620506287, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.45703125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1041.0, "completions/mean_length": 1009.9169921875, "completions/mean_terminated_length": 754.7122192382812, "completions/min_length": 248.0, "completions/min_terminated_length": 248.0, "epoch": 18.496124031007753, "frac_reward_zero_std": 0.6015625, "grad_norm": 0.2500828206539154, "kl": 0.205780029296875, "learning_rate": 6.35e-07, "loss": 0.0097, "num_tokens": 127882236.0, "reward": 0.46240234375, "reward_std": 0.07782811671495438, "rewards/verilog_format_reward/mean": 0.46240234375, "rewards/verilog_format_reward/std": 0.1319175511598587, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.5, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1014.337890625, "completions/mean_terminated_length": 764.703125, "completions/min_length": 304.0, "completions/min_terminated_length": 304.0, "epoch": 18.74418604651163, "frac_reward_zero_std": 0.671875, "grad_norm": 0.25501570105552673, "kl": 0.21234130859375, "learning_rate": 6.3e-07, "loss": 0.0102, "num_tokens": 129652686.0, "reward": 0.47705078125, "reward_std": 0.06014072149991989, "rewards/verilog_format_reward/mean": 0.47705078125, "rewards/verilog_format_reward/std": 0.10468354821205139, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.55859375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1034.0, "completions/mean_length": 1016.6044921875, "completions/mean_terminated_length": 747.3717041015625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "epoch": 18.992248062015506, "frac_reward_zero_std": 0.6875, "grad_norm": 0.2580663859844208, "kl": 0.21099853515625, "learning_rate": 6.249999999999999e-07, "loss": 0.0093, "num_tokens": 131416769.0, "reward": 0.4736328125, "reward_std": 0.06022106856107712, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.4375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1043.0, "completions/mean_length": 1007.2060546875, "completions/mean_terminated_length": 745.6875, "completions/min_length": 104.0, "completions/min_terminated_length": 104.0, "epoch": 19.248062015503876, "frac_reward_zero_std": 0.6953125, "grad_norm": 0.21702566742897034, "kl": 0.210357666015625, "learning_rate": 6.2e-07, "loss": 0.0055, "num_tokens": 133220300.0, "reward": 0.4734804630279541, "reward_std": 0.05818703770637512, "rewards/verilog_format_reward/mean": 0.47314453125, "rewards/verilog_format_reward/std": 0.11277827620506287, "rewards/verilog_reward_wrapper/mean": 0.00033593751140870154, "rewards/verilog_reward_wrapper/std": 0.007762634661048651, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.48828125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 1013.6533203125, "completions/mean_terminated_length": 765.885498046875, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "epoch": 19.496124031007753, "frac_reward_zero_std": 0.5546875, "grad_norm": 0.3027474284172058, "kl": 0.209442138671875, "learning_rate": 6.149999999999999e-07, "loss": 0.0085, "num_tokens": 134991041.0, "reward": 0.4657435119152069, "reward_std": 0.08278912305831909, "rewards/verilog_format_reward/mean": 0.46484375, "rewards/verilog_format_reward/std": 0.1278989315032959, "rewards/verilog_reward_wrapper/mean": 0.0008997598779387772, "rewards/verilog_reward_wrapper/std": 0.01489182561635971, "step": 78 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.51171875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1042.0, "completions/mean_length": 1014.111328125, "completions/mean_terminated_length": 756.0000610351562, "completions/min_length": 324.0, "completions/min_terminated_length": 324.0, "epoch": 19.74418604651163, "frac_reward_zero_std": 0.703125, "grad_norm": 0.22416998445987701, "kl": 0.213623046875, "learning_rate": 6.1e-07, "loss": 0.0097, "num_tokens": 136747715.0, "reward": 0.4778599143028259, "reward_std": 0.05542721599340439, "rewards/verilog_format_reward/mean": 0.4775390625, "rewards/verilog_format_reward/std": 0.10361689329147339, "rewards/verilog_reward_wrapper/mean": 0.00032087054569274187, "rewards/verilog_reward_wrapper/std": 0.007793740835040808, "step": 79 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.48046875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1040.0, "completions/mean_length": 1010.865234375, "completions/mean_terminated_length": 748.6917724609375, "completions/min_length": 256.0, "completions/min_terminated_length": 256.0, "epoch": 19.992248062015506, "frac_reward_zero_std": 0.671875, "grad_norm": 0.2277638018131256, "kl": 0.216796875, "learning_rate": 6.049999999999999e-07, "loss": 0.0081, "num_tokens": 138512857.0, "reward": 0.47517868876457214, "reward_std": 0.06016360595822334, "rewards/verilog_format_reward/mean": 0.474609375, "rewards/verilog_format_reward/std": 0.10982899367809296, "rewards/verilog_reward_wrapper/mean": 0.0005693037528544664, "rewards/verilog_reward_wrapper/std": 0.009813308715820312, "step": 80 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.55078125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 1019.3076171875, "completions/mean_terminated_length": 776.7042846679688, "completions/min_length": 113.0, "completions/min_terminated_length": 113.0, "epoch": 20.248062015503876, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.308808833360672, "kl": 0.210479736328125, "learning_rate": 6e-07, "loss": 0.0056, "num_tokens": 140317116.0, "reward": 0.47505077719688416, "reward_std": 0.060235925018787384, "rewards/verilog_format_reward/mean": 0.474609375, "rewards/verilog_format_reward/std": 0.10982899367809296, "rewards/verilog_reward_wrapper/mean": 0.00044140624231658876, "rewards/verilog_reward_wrapper/std": 0.011432341299951077, "step": 81 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.5625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1019.9990234375, "completions/mean_terminated_length": 775.7053833007812, "completions/min_length": 360.0, "completions/min_terminated_length": 360.0, "epoch": 20.496124031007753, "frac_reward_zero_std": 0.6640625, "grad_norm": 0.25764191150665283, "kl": 0.213653564453125, "learning_rate": 5.949999999999999e-07, "loss": 0.0081, "num_tokens": 142106763.0, "reward": 0.47246092557907104, "reward_std": 0.06345676630735397, "rewards/verilog_format_reward/mean": 0.47216796875, "rewards/verilog_format_reward/std": 0.11469193547964096, "rewards/verilog_reward_wrapper/mean": 0.0002929687616415322, "rewards/verilog_reward_wrapper/std": 0.005407365038990974, "step": 82 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.50390625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1015.859375, "completions/mean_terminated_length": 774.7244262695312, "completions/min_length": 315.0, "completions/min_terminated_length": 315.0, "epoch": 20.74418604651163, "frac_reward_zero_std": 0.6875, "grad_norm": 4.3477349281311035, "kl": 0.222503662109375, "learning_rate": 5.9e-07, "loss": 0.0095, "num_tokens": 143864955.0, "reward": 0.4751953184604645, "reward_std": 0.058836475014686584, "rewards/verilog_format_reward/mean": 0.47509765625, "rewards/verilog_format_reward/std": 0.108823761343956, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 83 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.546875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1033.0, "completions/mean_length": 1018.2236328125, "completions/mean_terminated_length": 769.4913940429688, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 20.992248062015506, "frac_reward_zero_std": 0.671875, "grad_norm": 0.2927316129207611, "kl": 0.21124267578125, "learning_rate": 5.849999999999999e-07, "loss": 0.0103, "num_tokens": 145632752.0, "reward": 0.47405189275741577, "reward_std": 0.06286682933568954, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.00041908363346010447, "rewards/verilog_reward_wrapper/std": 0.010030992329120636, "step": 84 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.546875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1016.3232421875, "completions/mean_terminated_length": 752.7155151367188, "completions/min_length": 278.0, "completions/min_terminated_length": 278.0, "epoch": 21.248062015503876, "frac_reward_zero_std": 0.5546875, "grad_norm": 0.3258722424507141, "kl": 0.214630126953125, "learning_rate": 5.8e-07, "loss": 0.0106, "num_tokens": 147394315.0, "reward": 0.46589213609695435, "reward_std": 0.08097479492425919, "rewards/verilog_format_reward/mean": 0.46533203125, "rewards/verilog_format_reward/std": 0.12707433104515076, "rewards/verilog_reward_wrapper/mean": 0.0005600961740128696, "rewards/verilog_reward_wrapper/std": 0.008259853348135948, "step": 85 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.53125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1013.330078125, "completions/mean_terminated_length": 737.0833740234375, "completions/min_length": 139.0, "completions/min_terminated_length": 139.0, "epoch": 21.496124031007753, "frac_reward_zero_std": 0.6484375, "grad_norm": 0.21732480823993683, "kl": 0.207916259765625, "learning_rate": 5.749999999999999e-07, "loss": 0.0033, "num_tokens": 149160725.0, "reward": 0.47312310338020325, "reward_std": 0.06711339950561523, "rewards/verilog_format_reward/mean": 0.4716796875, "rewards/verilog_format_reward/std": 0.11563379317522049, "rewards/verilog_reward_wrapper/mean": 0.0014434210024774075, "rewards/verilog_reward_wrapper/std": 0.03093237429857254, "step": 86 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.6015625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1040.0, "completions/mean_length": 1021.2705078125, "completions/mean_terminated_length": 761.5784301757812, "completions/min_length": 318.0, "completions/min_terminated_length": 318.0, "epoch": 21.74418604651163, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.21520692110061646, "kl": 0.212615966796875, "learning_rate": 5.699999999999999e-07, "loss": 0.0099, "num_tokens": 150951858.0, "reward": 0.47819310426712036, "reward_std": 0.050974875688552856, "rewards/verilog_format_reward/mean": 0.47802734375, "rewards/verilog_format_reward/std": 0.10253681242465973, "rewards/verilog_reward_wrapper/mean": 0.00016577148926444352, "rewards/verilog_reward_wrapper/std": 0.0053046876564621925, "step": 87 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.53125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1016.291015625, "completions/mean_terminated_length": 762.3500366210938, "completions/min_length": 292.0, "completions/min_terminated_length": 292.0, "epoch": 21.992248062015506, "frac_reward_zero_std": 0.609375, "grad_norm": 0.2878574728965759, "kl": 0.216888427734375, "learning_rate": 5.649999999999999e-07, "loss": 0.0133, "num_tokens": 152748220.0, "reward": 0.4693359434604645, "reward_std": 0.07328776270151138, "rewards/verilog_format_reward/mean": 0.46923828125, "rewards/verilog_format_reward/std": 0.1202026903629303, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 88 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.60546875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1019.2421875, "completions/mean_terminated_length": 738.1583862304688, "completions/min_length": 287.0, "completions/min_terminated_length": 287.0, "epoch": 22.248062015503876, "frac_reward_zero_std": 0.6484375, "grad_norm": 0.2674074172973633, "kl": 0.22357177734375, "learning_rate": 5.6e-07, "loss": 0.0077, "num_tokens": 154516356.0, "reward": 0.47480469942092896, "reward_std": 0.06320830434560776, "rewards/verilog_format_reward/mean": 0.474609375, "rewards/verilog_format_reward/std": 0.10982899367809296, "rewards/verilog_reward_wrapper/mean": 0.00019531250291038305, "rewards/verilog_reward_wrapper/std": 0.004417257383465767, "step": 89 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.6484375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 1020.310546875, "completions/mean_terminated_length": 712.2000122070312, "completions/min_length": 104.0, "completions/min_terminated_length": 104.0, "epoch": 22.496124031007753, "frac_reward_zero_std": 0.6484375, "grad_norm": 0.3066544234752655, "kl": 0.219085693359375, "learning_rate": 5.55e-07, "loss": 0.0087, "num_tokens": 156309890.0, "reward": 0.4734381437301636, "reward_std": 0.06491498649120331, "rewards/verilog_format_reward/mean": 0.47314453125, "rewards/verilog_format_reward/std": 0.11277827620506287, "rewards/verilog_reward_wrapper/mean": 0.00029360890039242804, "rewards/verilog_reward_wrapper/std": 0.007003306411206722, "step": 90 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.71875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1028.943359375, "completions/mean_terminated_length": 750.5277709960938, "completions/min_length": 338.0, "completions/min_terminated_length": 338.0, "epoch": 22.74418604651163, "frac_reward_zero_std": 0.65625, "grad_norm": 0.24805520474910736, "kl": 0.21795654296875, "learning_rate": 5.5e-07, "loss": 0.0116, "num_tokens": 158098640.0, "reward": 0.4742778539657593, "reward_std": 0.06352642923593521, "rewards/verilog_format_reward/mean": 0.47412109375, "rewards/verilog_format_reward/std": 0.11082296073436737, "rewards/verilog_reward_wrapper/mean": 0.00015675730537623167, "rewards/verilog_reward_wrapper/std": 0.0050162337720394135, "step": 91 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.58203125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1020.57421875, "completions/mean_terminated_length": 768.3925170898438, "completions/min_length": 178.0, "completions/min_terminated_length": 178.0, "epoch": 22.992248062015506, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.23236115276813507, "kl": 0.217041015625, "learning_rate": 5.45e-07, "loss": 0.0093, "num_tokens": 159887108.0, "reward": 0.47734373807907104, "reward_std": 0.05768325924873352, "rewards/verilog_format_reward/mean": 0.47705078125, "rewards/verilog_format_reward/std": 0.10468354821205139, "rewards/verilog_reward_wrapper/mean": 0.0002929687616415322, "rewards/verilog_reward_wrapper/std": 0.005407365038990974, "step": 92 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.60546875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1020.1357421875, "completions/mean_terminated_length": 747.2178344726562, "completions/min_length": 290.0, "completions/min_terminated_length": 290.0, "epoch": 23.248062015503876, "frac_reward_zero_std": 0.640625, "grad_norm": 0.2737247347831726, "kl": 0.216827392578125, "learning_rate": 5.4e-07, "loss": 0.0097, "num_tokens": 161676407.0, "reward": 0.4770365357398987, "reward_std": 0.06329251825809479, "rewards/verilog_format_reward/mean": 0.47607421875, "rewards/verilog_format_reward/std": 0.10677818953990936, "rewards/verilog_reward_wrapper/mean": 0.0009623275836929679, "rewards/verilog_reward_wrapper/std": 0.014939825981855392, "step": 93 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.66796875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1026.6142578125, "completions/mean_terminated_length": 768.2706298828125, "completions/min_length": 368.0, "completions/min_terminated_length": 368.0, "epoch": 23.496124031007753, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.2272285670042038, "kl": 0.223480224609375, "learning_rate": 5.35e-07, "loss": 0.0081, "num_tokens": 163435220.0, "reward": 0.47448956966400146, "reward_std": 0.05914207175374031, "rewards/verilog_format_reward/mean": 0.47412109375, "rewards/verilog_format_reward/std": 0.11082296073436737, "rewards/verilog_reward_wrapper/mean": 0.0003684826078824699, "rewards/verilog_reward_wrapper/std": 0.007081810850650072, "step": 94 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.64453125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1023.7822265625, "completions/mean_terminated_length": 754.97802734375, "completions/min_length": 340.0, "completions/min_terminated_length": 340.0, "epoch": 23.74418604651163, "frac_reward_zero_std": 0.640625, "grad_norm": 0.25218382477760315, "kl": 0.22674560546875, "learning_rate": 5.3e-07, "loss": 0.0091, "num_tokens": 165227789.0, "reward": 0.4678921699523926, "reward_std": 0.06837145984172821, "rewards/verilog_format_reward/mean": 0.466796875, "rewards/verilog_format_reward/std": 0.1245562732219696, "rewards/verilog_reward_wrapper/mean": 0.001095288316719234, "rewards/verilog_reward_wrapper/std": 0.018961584195494652, "step": 95 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.60546875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 1020.8564453125, "completions/mean_terminated_length": 754.5247192382812, "completions/min_length": 420.0, "completions/min_terminated_length": 420.0, "epoch": 23.992248062015506, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.23313699662685394, "kl": 0.22711181640625, "learning_rate": 5.25e-07, "loss": 0.0101, "num_tokens": 167022362.0, "reward": 0.4828776717185974, "reward_std": 0.05082671344280243, "rewards/verilog_format_reward/mean": 0.4814453125, "rewards/verilog_format_reward/std": 0.09456108510494232, "rewards/verilog_reward_wrapper/mean": 0.0014323677169159055, "rewards/verilog_reward_wrapper/std": 0.015213088132441044, "step": 96 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1034.0, "completions/mean_length": 1023.0107421875, "completions/mean_terminated_length": 762.1146240234375, "completions/min_length": 321.0, "completions/min_terminated_length": 321.0, "epoch": 24.248062015503876, "frac_reward_zero_std": 0.75, "grad_norm": 0.21822190284729004, "kl": 0.2264404296875, "learning_rate": 5.2e-07, "loss": 0.0098, "num_tokens": 168818469.0, "reward": 0.48193359375, "reward_std": 0.0463300496339798, "rewards/verilog_format_reward/mean": 0.48193359375, "rewards/verilog_format_reward/std": 0.09335587173700333, "rewards/verilog_reward_wrapper/mean": 0.0, "rewards/verilog_reward_wrapper/std": 0.0, "step": 97 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.6484375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1023.4921875, "completions/mean_terminated_length": 748.4000244140625, "completions/min_length": 246.0, "completions/min_terminated_length": 246.0, "epoch": 24.496124031007753, "frac_reward_zero_std": 0.65625, "grad_norm": 0.25875788927078247, "kl": 0.225250244140625, "learning_rate": 5.149999999999999e-07, "loss": 0.0085, "num_tokens": 170588149.0, "reward": 0.472202330827713, "reward_std": 0.06355519592761993, "rewards/verilog_format_reward/mean": 0.4716796875, "rewards/verilog_format_reward/std": 0.11563379317522049, "rewards/verilog_reward_wrapper/mean": 0.0005226588109508157, "rewards/verilog_reward_wrapper/std": 0.008508401922881603, "step": 98 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.59375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1039.0, "completions/mean_length": 1018.998046875, "completions/mean_terminated_length": 744.75, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "epoch": 24.74418604651163, "frac_reward_zero_std": 0.7109375, "grad_norm": 0.23543274402618408, "kl": 0.226531982421875, "learning_rate": 5.1e-07, "loss": 0.0076, "num_tokens": 172358091.0, "reward": 0.47389182448387146, "reward_std": 0.057420846074819565, "rewards/verilog_format_reward/mean": 0.47314453125, "rewards/verilog_format_reward/std": 0.11277827620506287, "rewards/verilog_reward_wrapper/mean": 0.0007472826400771737, "rewards/verilog_reward_wrapper/std": 0.018201084807515144, "step": 99 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.65234375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1021.51171875, "completions/mean_terminated_length": 722.2247314453125, "completions/min_length": 294.0, "completions/min_terminated_length": 294.0, "epoch": 24.992248062015506, "frac_reward_zero_std": 0.671875, "grad_norm": 0.26558244228363037, "kl": 0.223388671875, "learning_rate": 5.049999999999999e-07, "loss": 0.0078, "num_tokens": 174159399.0, "reward": 0.47612708806991577, "reward_std": 0.05987744778394699, "rewards/verilog_format_reward/mean": 0.4755859375, "rewards/verilog_format_reward/std": 0.10780693590641022, "rewards/verilog_reward_wrapper/mean": 0.0005411551101133227, "rewards/verilog_reward_wrapper/std": 0.011832957156002522, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.69921875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1011.0, "completions/mean_length": 1025.7890625, "completions/mean_terminated_length": 728.0260009765625, "completions/min_length": 266.0, "completions/min_terminated_length": 266.0, "epoch": 25.248062015503876, "frac_reward_zero_std": 0.71875, "grad_norm": 0.21321631968021393, "kl": 0.226348876953125, "learning_rate": 5e-07, "loss": 0.0094, "num_tokens": 175934351.0, "reward": 0.4762864112854004, "reward_std": 0.05317573621869087, "rewards/verilog_format_reward/mean": 0.47607421875, "rewards/verilog_format_reward/std": 0.10677818953990936, "rewards/verilog_reward_wrapper/mean": 0.00021219004702288657, "rewards/verilog_reward_wrapper/std": 0.0048141516745090485, "step": 101 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.66015625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1026.025390625, "completions/mean_terminated_length": 767.8161010742188, "completions/min_length": 223.0, "completions/min_terminated_length": 223.0, "epoch": 25.496124031007753, "frac_reward_zero_std": 0.6875, "grad_norm": 0.28535518050193787, "kl": 0.227447509765625, "learning_rate": 4.95e-07, "loss": 0.0067, "num_tokens": 177730953.0, "reward": 0.47773438692092896, "reward_std": 0.05676613003015518, "rewards/verilog_format_reward/mean": 0.4775390625, "rewards/verilog_format_reward/std": 0.10361689329147339, "rewards/verilog_reward_wrapper/mean": 0.00019531250291038305, "rewards/verilog_reward_wrapper/std": 0.004417257383465767, "step": 102 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.69921875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1027.814453125, "completions/mean_terminated_length": 754.9610595703125, "completions/min_length": 154.0, "completions/min_terminated_length": 154.0, "epoch": 25.74418604651163, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.22172671556472778, "kl": 0.23663330078125, "learning_rate": 4.9e-07, "loss": 0.0088, "num_tokens": 179494755.0, "reward": 0.4802044928073883, "reward_std": 0.04909922182559967, "rewards/verilog_format_reward/mean": 0.4794921875, "rewards/verilog_format_reward/std": 0.09921163320541382, "rewards/verilog_reward_wrapper/mean": 0.0007122961105778813, "rewards/verilog_reward_wrapper/std": 0.011904887855052948, "step": 103 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.65234375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 1023.234375, "completions/mean_terminated_length": 742.044921875, "completions/min_length": 328.0, "completions/min_terminated_length": 328.0, "epoch": 25.992248062015506, "frac_reward_zero_std": 0.6328125, "grad_norm": 0.28392520546913147, "kl": 0.23236083984375, "learning_rate": 4.85e-07, "loss": 0.0067, "num_tokens": 181305283.0, "reward": 0.4709717035293579, "reward_std": 0.06867404282093048, "rewards/verilog_format_reward/mean": 0.470703125, "rewards/verilog_format_reward/std": 0.11748876422643661, "rewards/verilog_reward_wrapper/mean": 0.0002685546933207661, "rewards/verilog_reward_wrapper/std": 0.006295986007899046, "step": 104 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.65625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1038.0, "completions/mean_length": 1025.7783203125, "completions/mean_terminated_length": 768.1477661132812, "completions/min_length": 394.0, "completions/min_terminated_length": 394.0, "epoch": 26.248062015503876, "frac_reward_zero_std": 0.734375, "grad_norm": 0.23773612082004547, "kl": 0.2349853515625, "learning_rate": 4.8e-07, "loss": 0.0144, "num_tokens": 183070032.0, "reward": 0.4791700541973114, "reward_std": 0.04826141148805618, "rewards/verilog_format_reward/mean": 0.478515625, "rewards/verilog_format_reward/std": 0.10144288837909698, "rewards/verilog_reward_wrapper/mean": 0.0006544364150613546, "rewards/verilog_reward_wrapper/std": 0.012739547528326511, "step": 105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.69140625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1028.0498046875, "completions/mean_terminated_length": 765.4810180664062, "completions/min_length": 269.0, "completions/min_terminated_length": 269.0, "epoch": 26.496124031007753, "frac_reward_zero_std": 0.75, "grad_norm": 0.23174642026424408, "kl": 0.2344970703125, "learning_rate": 4.7499999999999995e-07, "loss": 0.0096, "num_tokens": 184861763.0, "reward": 0.4807656705379486, "reward_std": 0.04678216204047203, "rewards/verilog_format_reward/mean": 0.48046875, "rewards/verilog_format_reward/std": 0.09691918641328812, "rewards/verilog_reward_wrapper/mean": 0.00029691937379539013, "rewards/verilog_reward_wrapper/std": 0.006735223811119795, "step": 106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.68359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1028.1259765625, "completions/mean_terminated_length": 773.4691162109375, "completions/min_length": 407.0, "completions/min_terminated_length": 407.0, "epoch": 26.74418604651163, "frac_reward_zero_std": 0.703125, "grad_norm": 0.2514728009700775, "kl": 0.2314453125, "learning_rate": 4.6999999999999995e-07, "loss": 0.0102, "num_tokens": 186658020.0, "reward": 0.47908473014831543, "reward_std": 0.0541708841919899, "rewards/verilog_format_reward/mean": 0.478515625, "rewards/verilog_format_reward/std": 0.10144288837909698, "rewards/verilog_reward_wrapper/mean": 0.000569100200664252, "rewards/verilog_reward_wrapper/std": 0.015403476543724537, "step": 107 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.74609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1032.5498046875, "completions/mean_terminated_length": 775.09228515625, "completions/min_length": 9.0, "completions/min_terminated_length": 9.0, "epoch": 26.992248062015506, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.23159942030906677, "kl": 0.23779296875, "learning_rate": 4.65e-07, "loss": 0.0115, "num_tokens": 188460295.0, "reward": 0.4749999940395355, "reward_std": 0.0574987456202507, "rewards/verilog_format_reward/mean": 0.474609375, "rewards/verilog_format_reward/std": 0.10982899367809296, "rewards/verilog_reward_wrapper/mean": 0.0003906250058207661, "rewards/verilog_reward_wrapper/std": 0.006240829359740019, "step": 108 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.66015625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1036.0, "completions/mean_length": 1026.181640625, "completions/mean_terminated_length": 769.6551513671875, "completions/min_length": 273.0, "completions/min_terminated_length": 273.0, "epoch": 27.248062015503876, "frac_reward_zero_std": 0.578125, "grad_norm": 0.3447204530239105, "kl": 0.243133544921875, "learning_rate": 4.6e-07, "loss": 0.0069, "num_tokens": 190244017.0, "reward": 0.4669994115829468, "reward_std": 0.07772766053676605, "rewards/verilog_format_reward/mean": 0.466796875, "rewards/verilog_format_reward/std": 0.1245562732219696, "rewards/verilog_reward_wrapper/mean": 0.00020255055278539658, "rewards/verilog_reward_wrapper/std": 0.004583884496241808, "step": 109 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.6328125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1042.0, "completions/mean_length": 1021.9384765625, "completions/mean_terminated_length": 744.3084716796875, "completions/min_length": 247.0, "completions/min_terminated_length": 247.0, "epoch": 27.496124031007753, "frac_reward_zero_std": 0.71875, "grad_norm": 0.2190372794866562, "kl": 0.236541748046875, "learning_rate": 4.55e-07, "loss": 0.0093, "num_tokens": 192041578.0, "reward": 0.47998231649398804, "reward_std": 0.04963846504688263, "rewards/verilog_format_reward/mean": 0.4794921875, "rewards/verilog_format_reward/std": 0.09921163320541382, "rewards/verilog_reward_wrapper/mean": 0.0004901265492662787, "rewards/verilog_reward_wrapper/std": 0.008213048800826073, "step": 110 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.69140625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1037.0, "completions/mean_length": 1024.044921875, "completions/mean_terminated_length": 713.5696411132812, "completions/min_length": 224.0, "completions/min_terminated_length": 224.0, "epoch": 27.74418604651163, "frac_reward_zero_std": 0.7109375, "grad_norm": 0.24050448834896088, "kl": 0.242889404296875, "learning_rate": 4.5e-07, "loss": 0.009, "num_tokens": 193839320.0, "reward": 0.47724610567092896, "reward_std": 0.055628810077905655, "rewards/verilog_format_reward/mean": 0.4765625, "rewards/verilog_format_reward/std": 0.10573717951774597, "rewards/verilog_reward_wrapper/mean": 0.0006835937383584678, "rewards/verilog_reward_wrapper/std": 0.02187499962747097, "step": 111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.68359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1026.8330078125, "completions/mean_terminated_length": 757.1234741210938, "completions/min_length": 9.0, "completions/min_terminated_length": 9.0, "epoch": 27.992248062015506, "frac_reward_zero_std": 0.6171875, "grad_norm": 0.29557469487190247, "kl": 0.24127197265625, "learning_rate": 4.45e-07, "loss": 0.0105, "num_tokens": 195602605.0, "reward": 0.4728395938873291, "reward_std": 0.06859911978244781, "rewards/verilog_format_reward/mean": 0.47216796875, "rewards/verilog_format_reward/std": 0.11469193547964096, "rewards/verilog_reward_wrapper/mean": 0.0006716023781336844, "rewards/verilog_reward_wrapper/std": 0.011152700521051884, "step": 112 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.74609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1027.0, "completions/mean_length": 1034.232421875, "completions/mean_terminated_length": 801.5999755859375, "completions/min_length": 313.0, "completions/min_terminated_length": 313.0, "epoch": 28.248062015503876, "frac_reward_zero_std": 0.6953125, "grad_norm": 0.2534928023815155, "kl": 0.24725341796875, "learning_rate": 4.3999999999999997e-07, "loss": 0.0093, "num_tokens": 197391035.0, "reward": 0.475086510181427, "reward_std": 0.056672751903533936, "rewards/verilog_format_reward/mean": 0.474609375, "rewards/verilog_format_reward/std": 0.10982899367809296, "rewards/verilog_reward_wrapper/mean": 0.00047712400555610657, "rewards/verilog_reward_wrapper/std": 0.00789981335401535, "step": 113 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.68359375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 1025.6171875, "completions/mean_terminated_length": 741.7531127929688, "completions/min_length": 215.0, "completions/min_terminated_length": 215.0, "epoch": 28.496124031007753, "frac_reward_zero_std": 0.65625, "grad_norm": 0.28449830412864685, "kl": 0.24163818359375, "learning_rate": 4.3499999999999996e-07, "loss": 0.0109, "num_tokens": 199176395.0, "reward": 0.4773179292678833, "reward_std": 0.06079915538430214, "rewards/verilog_format_reward/mean": 0.47607421875, "rewards/verilog_format_reward/std": 0.10677818953990936, "rewards/verilog_reward_wrapper/mean": 0.0012436852557584643, "rewards/verilog_reward_wrapper/std": 0.018468130379915237, "step": 114 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.75390625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1042.0, "completions/mean_length": 1030.125, "completions/mean_terminated_length": 726.952392578125, "completions/min_length": 303.0, "completions/min_terminated_length": 303.0, "epoch": 28.74418604651163, "frac_reward_zero_std": 0.7421875, "grad_norm": 0.20487721264362335, "kl": 0.25140380859375, "learning_rate": 4.2999999999999996e-07, "loss": 0.0097, "num_tokens": 200962459.0, "reward": 0.4823242127895355, "reward_std": 0.04607372730970383, "rewards/verilog_format_reward/mean": 0.48193359375, "rewards/verilog_format_reward/std": 0.09335587173700333, "rewards/verilog_reward_wrapper/mean": 0.0003906250058207661, "rewards/verilog_reward_wrapper/std": 0.006240829359740019, "step": 115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.62890625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1023.126953125, "completions/mean_terminated_length": 760.3368530273438, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "epoch": 28.992248062015506, "frac_reward_zero_std": 0.6875, "grad_norm": 0.2435491383075714, "kl": 0.248138427734375, "learning_rate": 4.2499999999999995e-07, "loss": 0.0087, "num_tokens": 202760157.0, "reward": 0.473834365606308, "reward_std": 0.05934375151991844, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.00020154450612608343, "rewards/verilog_reward_wrapper/std": 0.006449424661695957, "step": 116 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.73828125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1043.0, "completions/mean_length": 1029.9208984375, "completions/mean_terminated_length": 743.119384765625, "completions/min_length": 347.0, "completions/min_terminated_length": 347.0, "epoch": 29.248062015503876, "frac_reward_zero_std": 0.65625, "grad_norm": 0.2585810124874115, "kl": 0.24713134765625, "learning_rate": 4.1999999999999995e-07, "loss": 0.0078, "num_tokens": 204555804.0, "reward": 0.4766639471054077, "reward_std": 0.058699753135442734, "rewards/verilog_format_reward/mean": 0.4755859375, "rewards/verilog_format_reward/std": 0.10780693590641022, "rewards/verilog_reward_wrapper/mean": 0.0010780079755932093, "rewards/verilog_reward_wrapper/std": 0.014460178092122078, "step": 117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.70703125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1038.0, "completions/mean_length": 1028.5205078125, "completions/mean_terminated_length": 756.7333374023438, "completions/min_length": 107.0, "completions/min_terminated_length": 107.0, "epoch": 29.496124031007753, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.268878698348999, "kl": 0.253387451171875, "learning_rate": 4.1499999999999994e-07, "loss": 0.0094, "num_tokens": 206379329.0, "reward": 0.47663938999176025, "reward_std": 0.057182952761650085, "rewards/verilog_format_reward/mean": 0.47607421875, "rewards/verilog_format_reward/std": 0.10677818953990936, "rewards/verilog_reward_wrapper/mean": 0.000565178575925529, "rewards/verilog_reward_wrapper/std": 0.010244827717542648, "step": 118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.74609375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1034.0, "completions/mean_length": 1030.2802734375, "completions/mean_terminated_length": 739.3384399414062, "completions/min_length": 272.0, "completions/min_terminated_length": 272.0, "epoch": 29.74418604651163, "frac_reward_zero_std": 0.703125, "grad_norm": 0.23418723046779633, "kl": 0.260162353515625, "learning_rate": 4.0999999999999994e-07, "loss": 0.0112, "num_tokens": 208147040.0, "reward": 0.4777669310569763, "reward_std": 0.055654577910900116, "rewards/verilog_format_reward/mean": 0.47705078125, "rewards/verilog_format_reward/std": 0.10468354821205139, "rewards/verilog_reward_wrapper/mean": 0.0007161458488553762, "rewards/verilog_reward_wrapper/std": 0.020033840090036392, "step": 119 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1021.0, "completions/mean_length": 1029.04296875, "completions/mean_terminated_length": 692.3333740234375, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "epoch": 29.992248062015506, "frac_reward_zero_std": 0.7421875, "grad_norm": 0.2399541139602661, "kl": 0.25701904296875, "learning_rate": 4.05e-07, "loss": 0.011, "num_tokens": 209925324.0, "reward": 0.47998046875, "reward_std": 0.04409383237361908, "rewards/verilog_format_reward/mean": 0.4794921875, "rewards/verilog_format_reward/std": 0.09921163320541382, "rewards/verilog_reward_wrapper/mean": 0.00048828125, "rewards/verilog_reward_wrapper/std": 0.006974038202315569, "step": 120 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.75390625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1035.0, "completions/mean_length": 1030.625, "completions/mean_terminated_length": 735.0794067382812, "completions/min_length": 132.0, "completions/min_terminated_length": 132.0, "epoch": 30.248062015503876, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.236329585313797, "kl": 0.256683349609375, "learning_rate": 4e-07, "loss": 0.0096, "num_tokens": 211722452.0, "reward": 0.481859415769577, "reward_std": 0.0477147251367569, "rewards/verilog_format_reward/mean": 0.4814453125, "rewards/verilog_format_reward/std": 0.09456108510494232, "rewards/verilog_reward_wrapper/mean": 0.0004140973906032741, "rewards/verilog_reward_wrapper/std": 0.008162099868059158, "step": 121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.77734375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1037.0, "completions/mean_length": 1031.912109375, "completions/mean_terminated_length": 725.0526123046875, "completions/min_length": 281.0, "completions/min_terminated_length": 281.0, "epoch": 30.496124031007753, "frac_reward_zero_std": 0.6875, "grad_norm": 0.3069079518318176, "kl": 0.2613525390625, "learning_rate": 3.95e-07, "loss": 0.0136, "num_tokens": 213479066.0, "reward": 0.47423461079597473, "reward_std": 0.05995184928178787, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.0006017907871864736, "rewards/verilog_reward_wrapper/std": 0.012094162404537201, "step": 122 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.7578125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1030.1533203125, "completions/mean_terminated_length": 722.2096557617188, "completions/min_length": 306.0, "completions/min_terminated_length": 306.0, "epoch": 30.74418604651163, "frac_reward_zero_std": 0.7421875, "grad_norm": 0.1994921863079071, "kl": 0.264495849609375, "learning_rate": 3.8999999999999997e-07, "loss": 0.0121, "num_tokens": 215283719.0, "reward": 0.480682373046875, "reward_std": 0.04743048548698425, "rewards/verilog_format_reward/mean": 0.48046875, "rewards/verilog_format_reward/std": 0.09691918641328812, "rewards/verilog_reward_wrapper/mean": 0.000213623046875, "rewards/verilog_reward_wrapper/std": 0.004849124699831009, "step": 123 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8203125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1034.0, "completions/mean_length": 1035.958984375, "completions/mean_terminated_length": 737.434814453125, "completions/min_length": 296.0, "completions/min_terminated_length": 296.0, "epoch": 30.992248062015506, "frac_reward_zero_std": 0.6640625, "grad_norm": 0.31145918369293213, "kl": 0.26556396484375, "learning_rate": 3.8499999999999997e-07, "loss": 0.0111, "num_tokens": 217103221.0, "reward": 0.4725000858306885, "reward_std": 0.060641657561063766, "rewards/verilog_format_reward/mean": 0.4716796875, "rewards/verilog_format_reward/std": 0.11563379317522049, "rewards/verilog_reward_wrapper/mean": 0.0008204012992791831, "rewards/verilog_reward_wrapper/std": 0.009323986247181892, "step": 124 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.796875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1037.0, "completions/mean_length": 1033.98828125, "completions/mean_terminated_length": 734.6923217773438, "completions/min_length": 202.0, "completions/min_terminated_length": 202.0, "epoch": 31.248062015503876, "frac_reward_zero_std": 0.6953125, "grad_norm": 0.29011276364326477, "kl": 0.25872802734375, "learning_rate": 3.7999999999999996e-07, "loss": 0.0108, "num_tokens": 218927465.0, "reward": 0.4779130816459656, "reward_std": 0.05277882516384125, "rewards/verilog_format_reward/mean": 0.4765625, "rewards/verilog_format_reward/std": 0.10573717951774597, "rewards/verilog_reward_wrapper/mean": 0.0013505900278687477, "rewards/verilog_reward_wrapper/std": 0.02353728376328945, "step": 125 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.7265625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1049.0, "completions/mean_length": 1028.892578125, "completions/mean_terminated_length": 741.2285766601562, "completions/min_length": 284.0, "completions/min_terminated_length": 284.0, "epoch": 31.496124031007753, "frac_reward_zero_std": 0.6640625, "grad_norm": 0.24515235424041748, "kl": 0.271942138671875, "learning_rate": 3.75e-07, "loss": 0.0118, "num_tokens": 220737219.0, "reward": 0.47438567876815796, "reward_std": 0.06068938970565796, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.0007528698770329356, "rewards/verilog_reward_wrapper/std": 0.013422162272036076, "step": 126 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.7421875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1043.0, "completions/mean_length": 1028.7744140625, "completions/mean_terminated_length": 720.6818237304688, "completions/min_length": 202.0, "completions/min_terminated_length": 202.0, "epoch": 31.74418604651163, "frac_reward_zero_std": 0.6875, "grad_norm": 0.22345611453056335, "kl": 0.273284912109375, "learning_rate": 3.7e-07, "loss": 0.0106, "num_tokens": 222512028.0, "reward": 0.4766322374343872, "reward_std": 0.05737651139497757, "rewards/verilog_format_reward/mean": 0.47607421875, "rewards/verilog_format_reward/std": 0.10677818953990936, "rewards/verilog_reward_wrapper/mean": 0.0005580427241511643, "rewards/verilog_reward_wrapper/std": 0.010967524722218513, "step": 127 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.81640625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1048.0, "completions/mean_length": 1036.6357421875, "completions/mean_terminated_length": 758.8297729492188, "completions/min_length": 320.0, "completions/min_terminated_length": 320.0, "epoch": 31.992248062015506, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.24892573058605194, "kl": 0.281585693359375, "learning_rate": 3.65e-07, "loss": 0.0105, "num_tokens": 224283119.0, "reward": 0.47676774859428406, "reward_std": 0.05098669230937958, "rewards/verilog_format_reward/mean": 0.4765625, "rewards/verilog_format_reward/std": 0.10573717951774597, "rewards/verilog_reward_wrapper/mean": 0.00020525252330116928, "rewards/verilog_reward_wrapper/std": 0.004647514317184687, "step": 128 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.84765625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1002.0, "completions/mean_length": 1036.0625, "completions/mean_terminated_length": 684.05126953125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "epoch": 32.248062015503876, "frac_reward_zero_std": 0.640625, "grad_norm": 0.31857767701148987, "kl": 0.272064208984375, "learning_rate": 3.6e-07, "loss": 0.0112, "num_tokens": 226091479.0, "reward": 0.46942391991615295, "reward_std": 0.06648052483797073, "rewards/verilog_format_reward/mean": 0.46875, "rewards/verilog_format_reward/std": 0.121089868247509, "rewards/verilog_reward_wrapper/mean": 0.0006739271339029074, "rewards/verilog_reward_wrapper/std": 0.008943522348999977, "step": 129 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.82421875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1035.404296875, "completions/mean_terminated_length": 717.86669921875, "completions/min_length": 175.0, "completions/min_terminated_length": 175.0, "epoch": 32.49612403100775, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.21329043805599213, "kl": 0.27093505859375, "learning_rate": 3.55e-07, "loss": 0.0098, "num_tokens": 227894653.0, "reward": 0.4784660041332245, "reward_std": 0.051054149866104126, "rewards/verilog_format_reward/mean": 0.4775390625, "rewards/verilog_format_reward/std": 0.10361689329147339, "rewards/verilog_reward_wrapper/mean": 0.0009269389556720853, "rewards/verilog_reward_wrapper/std": 0.01665429398417473, "step": 130 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.828125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1037.205078125, "completions/mean_terminated_length": 752.227294921875, "completions/min_length": 289.0, "completions/min_terminated_length": 289.0, "epoch": 32.74418604651163, "frac_reward_zero_std": 0.6875, "grad_norm": 0.25724300742149353, "kl": 0.2828369140625, "learning_rate": 3.5e-07, "loss": 0.0118, "num_tokens": 229709479.0, "reward": 0.47416040301322937, "reward_std": 0.05719051882624626, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.000527587253600359, "rewards/verilog_reward_wrapper/std": 0.008592367172241211, "step": 131 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1015.0, "completions/mean_length": 1033.3505859375, "completions/mean_terminated_length": 694.8125, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "epoch": 32.992248062015506, "frac_reward_zero_std": 0.65625, "grad_norm": 0.26452118158340454, "kl": 0.27789306640625, "learning_rate": 3.45e-07, "loss": 0.0101, "num_tokens": 231473142.0, "reward": 0.47270941734313965, "reward_std": 0.06175801157951355, "rewards/verilog_format_reward/mean": 0.47216796875, "rewards/verilog_format_reward/std": 0.11469193547964096, "rewards/verilog_reward_wrapper/mean": 0.0005414415500126779, "rewards/verilog_reward_wrapper/std": 0.007788717281073332, "step": 132 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.796875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1047.0, "completions/mean_length": 1034.763671875, "completions/mean_terminated_length": 749.9615478515625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "epoch": 33.248062015503876, "frac_reward_zero_std": 0.7109375, "grad_norm": 0.24182435870170593, "kl": 0.28094482421875, "learning_rate": 3.4000000000000003e-07, "loss": 0.0095, "num_tokens": 233283060.0, "reward": 0.47605738043785095, "reward_std": 0.05532302334904671, "rewards/verilog_format_reward/mean": 0.4755859375, "rewards/verilog_format_reward/std": 0.10780693590641022, "rewards/verilog_reward_wrapper/mean": 0.00047144395648501813, "rewards/verilog_reward_wrapper/std": 0.01508620660752058, "step": 133 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.7890625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1027.0, "completions/mean_length": 1034.8447265625, "completions/mean_terminated_length": 762.6111450195312, "completions/min_length": 365.0, "completions/min_terminated_length": 365.0, "epoch": 33.49612403100775, "frac_reward_zero_std": 0.6953125, "grad_norm": 0.2560795247554779, "kl": 0.282745361328125, "learning_rate": 3.35e-07, "loss": 0.0122, "num_tokens": 235061877.0, "reward": 0.4771265983581543, "reward_std": 0.05453814938664436, "rewards/verilog_format_reward/mean": 0.4755859375, "rewards/verilog_format_reward/std": 0.10780693590641022, "rewards/verilog_reward_wrapper/mean": 0.0015406665625050664, "rewards/verilog_reward_wrapper/std": 0.018180757761001587, "step": 134 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.88671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 1041.0576171875, "completions/mean_terminated_length": 734.2413940429688, "completions/min_length": 482.0, "completions/min_terminated_length": 482.0, "epoch": 33.74418604651163, "frac_reward_zero_std": 0.703125, "grad_norm": 0.22123149037361145, "kl": 0.2852783203125, "learning_rate": 3.3e-07, "loss": 0.013, "num_tokens": 236893392.0, "reward": 0.474342405796051, "reward_std": 0.05515693873167038, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.0007096027838997543, "rewards/verilog_reward_wrapper/std": 0.012282176874577999, "step": 135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.84375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1007.0, "completions/mean_length": 1036.10546875, "completions/mean_terminated_length": 694.2999877929688, "completions/min_length": 383.0, "completions/min_terminated_length": 383.0, "epoch": 33.992248062015506, "frac_reward_zero_std": 0.625, "grad_norm": 0.2953055500984192, "kl": 0.291259765625, "learning_rate": 3.25e-07, "loss": 0.012, "num_tokens": 238661644.0, "reward": 0.46982327103614807, "reward_std": 0.0726298987865448, "rewards/verilog_format_reward/mean": 0.46923828125, "rewards/verilog_format_reward/std": 0.1202026903629303, "rewards/verilog_reward_wrapper/mean": 0.0005849985172972083, "rewards/verilog_reward_wrapper/std": 0.010004346258938313, "step": 136 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8203125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1045.0, "completions/mean_length": 1035.974609375, "completions/mean_terminated_length": 737.7825927734375, "completions/min_length": 285.0, "completions/min_terminated_length": 285.0, "epoch": 34.248062015503876, "frac_reward_zero_std": 0.671875, "grad_norm": 0.45427533984184265, "kl": 0.298095703125, "learning_rate": 3.2e-07, "loss": 0.0094, "num_tokens": 240478810.0, "reward": 0.4731827974319458, "reward_std": 0.060590386390686035, "rewards/verilog_format_reward/mean": 0.47265625, "rewards/verilog_format_reward/std": 0.11374017596244812, "rewards/verilog_reward_wrapper/mean": 0.0005265700165182352, "rewards/verilog_reward_wrapper/std": 0.008997557684779167, "step": 137 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.82421875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1028.0, "completions/mean_length": 1034.1220703125, "completions/mean_terminated_length": 688.6889038085938, "completions/min_length": 312.0, "completions/min_terminated_length": 312.0, "epoch": 34.49612403100775, "frac_reward_zero_std": 0.7109375, "grad_norm": 0.28663262724876404, "kl": 0.28643798828125, "learning_rate": 3.15e-07, "loss": 0.012, "num_tokens": 242288263.0, "reward": 0.4812341034412384, "reward_std": 0.049021102488040924, "rewards/verilog_format_reward/mean": 0.48046875, "rewards/verilog_format_reward/std": 0.09691918641328812, "rewards/verilog_reward_wrapper/mean": 0.000765352335292846, "rewards/verilog_reward_wrapper/std": 0.01047941017895937, "step": 138 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8515625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1040.0, "completions/mean_length": 1037.849609375, "completions/mean_terminated_length": 722.5789794921875, "completions/min_length": 311.0, "completions/min_terminated_length": 311.0, "epoch": 34.74418604651163, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.26231473684310913, "kl": 0.29205322265625, "learning_rate": 3.1e-07, "loss": 0.0135, "num_tokens": 244064269.0, "reward": 0.4796568751335144, "reward_std": 0.05158982053399086, "rewards/verilog_format_reward/mean": 0.47900390625, "rewards/verilog_format_reward/std": 0.10033465176820755, "rewards/verilog_reward_wrapper/mean": 0.0006529785459861159, "rewards/verilog_reward_wrapper/std": 0.014731674455106258, "step": 139 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.86328125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1039.9326171875, "completions/mean_terminated_length": 755.4571533203125, "completions/min_length": 160.0, "completions/min_terminated_length": 160.0, "epoch": 34.992248062015506, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.23737071454524994, "kl": 0.297271728515625, "learning_rate": 3.05e-07, "loss": 0.0123, "num_tokens": 245861736.0, "reward": 0.4743819236755371, "reward_std": 0.05843231827020645, "rewards/verilog_format_reward/mean": 0.47314453125, "rewards/verilog_format_reward/std": 0.11277827620506287, "rewards/verilog_reward_wrapper/mean": 0.0012374066282063723, "rewards/verilog_reward_wrapper/std": 0.015519780106842518, "step": 140 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.83203125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1035.0, "completions/mean_length": 1034.208984375, "completions/mean_terminated_length": 673.9534912109375, "completions/min_length": 335.0, "completions/min_terminated_length": 335.0, "epoch": 35.248062015503876, "frac_reward_zero_std": 0.6953125, "grad_norm": 0.25200706720352173, "kl": 0.29888916015625, "learning_rate": 3e-07, "loss": 0.0108, "num_tokens": 247653798.0, "reward": 0.4715820252895355, "reward_std": 0.05772622302174568, "rewards/verilog_format_reward/mean": 0.47119140625, "rewards/verilog_format_reward/std": 0.1165659949183464, "rewards/verilog_reward_wrapper/mean": 0.0003906250058207661, "rewards/verilog_reward_wrapper/std": 0.006240829359740019, "step": 141 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8515625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1041.0, "completions/mean_length": 1038.517578125, "completions/mean_terminated_length": 740.5789794921875, "completions/min_length": 273.0, "completions/min_terminated_length": 273.0, "epoch": 35.49612403100775, "frac_reward_zero_std": 0.6484375, "grad_norm": 0.27081871032714844, "kl": 0.30352783203125, "learning_rate": 2.95e-07, "loss": 0.0107, "num_tokens": 249462480.0, "reward": 0.47405892610549927, "reward_std": 0.06450173258781433, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.0004261193098500371, "rewards/verilog_reward_wrapper/std": 0.009824504144489765, "step": 142 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.82421875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1038.0, "completions/mean_length": 1036.232421875, "completions/mean_terminated_length": 736.7111206054688, "completions/min_length": 229.0, "completions/min_terminated_length": 229.0, "epoch": 35.74418604651163, "frac_reward_zero_std": 0.7109375, "grad_norm": 0.20573773980140686, "kl": 0.29803466796875, "learning_rate": 2.9e-07, "loss": 0.0114, "num_tokens": 251244526.0, "reward": 0.48137569427490234, "reward_std": 0.05113065242767334, "rewards/verilog_format_reward/mean": 0.48046875, "rewards/verilog_format_reward/std": 0.09691918641328812, "rewards/verilog_reward_wrapper/mean": 0.0009069308871403337, "rewards/verilog_reward_wrapper/std": 0.019800931215286255, "step": 143 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1038.681640625, "completions/mean_terminated_length": 709.11767578125, "completions/min_length": 240.0, "completions/min_terminated_length": 240.0, "epoch": 35.992248062015506, "frac_reward_zero_std": 0.671875, "grad_norm": 0.30046138167381287, "kl": 0.302734375, "learning_rate": 2.8499999999999997e-07, "loss": 0.0135, "num_tokens": 253050528.0, "reward": 0.4731343388557434, "reward_std": 0.062122948467731476, "rewards/verilog_format_reward/mean": 0.47265625, "rewards/verilog_format_reward/std": 0.11374017596244812, "rewards/verilog_reward_wrapper/mean": 0.00047808061935938895, "rewards/verilog_reward_wrapper/std": 0.009721944108605385, "step": 144 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.890625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1050.0, "completions/mean_length": 1042.890625, "completions/mean_terminated_length": 790.0000610351562, "completions/min_length": 200.0, "completions/min_terminated_length": 200.0, "epoch": 36.248062015503876, "frac_reward_zero_std": 0.6953125, "grad_norm": 0.24655748903751373, "kl": 0.30584716796875, "learning_rate": 2.8e-07, "loss": 0.0121, "num_tokens": 254856488.0, "reward": 0.470717191696167, "reward_std": 0.05846823751926422, "rewards/verilog_format_reward/mean": 0.47021484375, "rewards/verilog_format_reward/std": 0.11840233206748962, "rewards/verilog_reward_wrapper/mean": 0.0005023510893806815, "rewards/verilog_reward_wrapper/std": 0.00982537493109703, "step": 145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1043.0, "completions/mean_length": 1039.236328125, "completions/mean_terminated_length": 705.5625, "completions/min_length": 304.0, "completions/min_terminated_length": 304.0, "epoch": 36.49612403100775, "frac_reward_zero_std": 0.6875, "grad_norm": 0.2574651539325714, "kl": 0.31201171875, "learning_rate": 2.75e-07, "loss": 0.0141, "num_tokens": 256654314.0, "reward": 0.47877347469329834, "reward_std": 0.055644139647483826, "rewards/verilog_format_reward/mean": 0.4775390625, "rewards/verilog_format_reward/std": 0.10361689329147339, "rewards/verilog_reward_wrapper/mean": 0.0012344096321612597, "rewards/verilog_reward_wrapper/std": 0.01657889597117901, "step": 146 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1037.0, "completions/mean_length": 1039.271484375, "completions/mean_terminated_length": 726.8823852539062, "completions/min_length": 348.0, "completions/min_terminated_length": 348.0, "epoch": 36.74418604651163, "frac_reward_zero_std": 0.65625, "grad_norm": 0.25124940276145935, "kl": 0.30267333984375, "learning_rate": 2.7e-07, "loss": 0.0176, "num_tokens": 258472352.0, "reward": 0.4679359197616577, "reward_std": 0.06447981297969818, "rewards/verilog_format_reward/mean": 0.46728515625, "rewards/verilog_format_reward/std": 0.12370167672634125, "rewards/verilog_reward_wrapper/mean": 0.0006507864454761147, "rewards/verilog_reward_wrapper/std": 0.00980646163225174, "step": 147 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8046875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1026.0, "completions/mean_length": 1035.54296875, "completions/mean_terminated_length": 753.9199829101562, "completions/min_length": 364.0, "completions/min_terminated_length": 364.0, "epoch": 36.992248062015506, "frac_reward_zero_std": 0.71875, "grad_norm": 0.24337875843048096, "kl": 0.3056640625, "learning_rate": 2.65e-07, "loss": 0.0131, "num_tokens": 260253036.0, "reward": 0.4798395037651062, "reward_std": 0.051586322486400604, "rewards/verilog_format_reward/mean": 0.47900390625, "rewards/verilog_format_reward/std": 0.10033465176820755, "rewards/verilog_reward_wrapper/mean": 0.0008355934405699372, "rewards/verilog_reward_wrapper/std": 0.014355763792991638, "step": 148 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.80078125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1042.0, "completions/mean_length": 1033.755859375, "completions/mean_terminated_length": 723.8431396484375, "completions/min_length": 269.0, "completions/min_terminated_length": 269.0, "epoch": 37.248062015503876, "frac_reward_zero_std": 0.640625, "grad_norm": 0.25543567538261414, "kl": 0.3165283203125, "learning_rate": 2.6e-07, "loss": 0.0108, "num_tokens": 262017610.0, "reward": 0.47543594241142273, "reward_std": 0.06684955954551697, "rewards/verilog_format_reward/mean": 0.4736328125, "rewards/verilog_format_reward/std": 0.11180596053600311, "rewards/verilog_reward_wrapper/mean": 0.001803119434043765, "rewards/verilog_reward_wrapper/std": 0.029638538137078285, "step": 149 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.87890625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1031.0, "completions/mean_length": 1039.720703125, "completions/mean_terminated_length": 710.4515991210938, "completions/min_length": 381.0, "completions/min_terminated_length": 381.0, "epoch": 37.49612403100775, "frac_reward_zero_std": 0.7421875, "grad_norm": 0.20438209176063538, "kl": 0.30657958984375, "learning_rate": 2.55e-07, "loss": 0.012, "num_tokens": 263838492.0, "reward": 0.4800243377685547, "reward_std": 0.04783258214592934, "rewards/verilog_format_reward/mean": 0.4794921875, "rewards/verilog_format_reward/std": 0.09921163320541382, "rewards/verilog_reward_wrapper/mean": 0.0005321269272826612, "rewards/verilog_reward_wrapper/std": 0.00936315581202507, "step": 150 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8515625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1030.0, "completions/mean_length": 1037.017578125, "completions/mean_terminated_length": 700.1578979492188, "completions/min_length": 278.0, "completions/min_terminated_length": 278.0, "epoch": 37.74418604651163, "frac_reward_zero_std": 0.65625, "grad_norm": 0.3012811839580536, "kl": 0.324462890625, "learning_rate": 2.5e-07, "loss": 0.0099, "num_tokens": 265656886.0, "reward": 0.4595703184604645, "reward_std": 0.07193708419799805, "rewards/verilog_format_reward/mean": 0.45947265625, "rewards/verilog_format_reward/std": 0.1365262120962143, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 151 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8828125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1034.0, "completions/mean_length": 1042.310546875, "completions/mean_terminated_length": 787.5333862304688, "completions/min_length": 436.0, "completions/min_terminated_length": 436.0, "epoch": 37.992248062015506, "frac_reward_zero_std": 0.6640625, "grad_norm": 0.2500430643558502, "kl": 0.3194580078125, "learning_rate": 2.45e-07, "loss": 0.0142, "num_tokens": 267446836.0, "reward": 0.4796087145805359, "reward_std": 0.0554286390542984, "rewards/verilog_format_reward/mean": 0.478515625, "rewards/verilog_format_reward/std": 0.10144288837909698, "rewards/verilog_reward_wrapper/mean": 0.0010930949356406927, "rewards/verilog_reward_wrapper/std": 0.013826681300997734, "step": 152 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.859375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1037.0, "completions/mean_length": 1039.326171875, "completions/mean_terminated_length": 746.388916015625, "completions/min_length": 317.0, "completions/min_terminated_length": 317.0, "epoch": 38.248062015503876, "frac_reward_zero_std": 0.7578125, "grad_norm": 0.1929069608449936, "kl": 0.3128662109375, "learning_rate": 2.4e-07, "loss": 0.0112, "num_tokens": 269247962.0, "reward": 0.48070845007896423, "reward_std": 0.04542725533246994, "rewards/verilog_format_reward/mean": 0.47998046875, "rewards/verilog_format_reward/std": 0.0980733260512352, "rewards/verilog_reward_wrapper/mean": 0.000727982958778739, "rewards/verilog_reward_wrapper/std": 0.017602596431970596, "step": 153 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.859375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1013.0, "completions/mean_length": 1037.984375, "completions/mean_terminated_length": 708.2222290039062, "completions/min_length": 273.0, "completions/min_terminated_length": 273.0, "epoch": 38.49612403100775, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.2550770342350006, "kl": 0.32257080078125, "learning_rate": 2.3499999999999997e-07, "loss": 0.0124, "num_tokens": 271054634.0, "reward": 0.47483378648757935, "reward_std": 0.06057609245181084, "rewards/verilog_format_reward/mean": 0.474609375, "rewards/verilog_format_reward/std": 0.10982899367809296, "rewards/verilog_reward_wrapper/mean": 0.00022442157205659896, "rewards/verilog_reward_wrapper/std": 0.007181490305811167, "step": 154 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.85546875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1046.0, "completions/mean_length": 1036.30078125, "completions/mean_terminated_length": 670.8648681640625, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "epoch": 38.74418604651163, "frac_reward_zero_std": 0.6796875, "grad_norm": 0.2795713543891907, "kl": 0.322998046875, "learning_rate": 2.3e-07, "loss": 0.0128, "num_tokens": 272871934.0, "reward": 0.4769822657108307, "reward_std": 0.058053210377693176, "rewards/verilog_format_reward/mean": 0.4755859375, "rewards/verilog_format_reward/std": 0.10780693590641022, "rewards/verilog_reward_wrapper/mean": 0.0013963363599032164, "rewards/verilog_reward_wrapper/std": 0.021021757274866104, "step": 155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.90234375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1043.0, "completions/mean_length": 1042.9248046875, "completions/mean_terminated_length": 760.2000122070312, "completions/min_length": 292.0, "completions/min_terminated_length": 292.0, "epoch": 38.992248062015506, "frac_reward_zero_std": 0.7421875, "grad_norm": 0.21858012676239014, "kl": 0.33563232421875, "learning_rate": 2.25e-07, "loss": 0.0137, "num_tokens": 274648241.0, "reward": 0.4781250059604645, "reward_std": 0.04959617555141449, "rewards/verilog_format_reward/mean": 0.47802734375, "rewards/verilog_format_reward/std": 0.10253681242465973, "rewards/verilog_reward_wrapper/mean": 9.765625145519152e-05, "rewards/verilog_reward_wrapper/std": 0.0031250000465661287, "step": 156 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.8828125, "completions/max_length": 1050.0, "completions/max_terminated_length": 1030.0, "completions/mean_length": 1041.2978515625, "completions/mean_terminated_length": 752.9667358398438, "completions/min_length": 397.0, "completions/min_terminated_length": 397.0, "epoch": 39.248062015503876, "frac_reward_zero_std": 0.6875, "grad_norm": 0.2556474208831787, "kl": 0.32537841796875, "learning_rate": 2.1999999999999998e-07, "loss": 0.0144, "num_tokens": 276434730.0, "reward": 0.4777917265892029, "reward_std": 0.05544497072696686, "rewards/verilog_format_reward/mean": 0.47705078125, "rewards/verilog_format_reward/std": 0.10468354821205139, "rewards/verilog_reward_wrapper/mean": 0.0007409399258904159, "rewards/verilog_reward_wrapper/std": 0.012419127859175205, "step": 157 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.81640625, "completions/max_length": 1050.0, "completions/max_terminated_length": 1044.0, "completions/mean_length": 1033.9697265625, "completions/mean_terminated_length": 700.74462890625, "completions/min_length": 158.0, "completions/min_terminated_length": 158.0, "epoch": 39.49612403100775, "frac_reward_zero_std": 0.7265625, "grad_norm": 0.21856744587421417, "kl": 0.3294677734375, "learning_rate": 2.1499999999999998e-07, "loss": 0.0128, "num_tokens": 278235155.0, "reward": 0.47979384660720825, "reward_std": 0.04977189749479294, "rewards/verilog_format_reward/mean": 0.47900390625, "rewards/verilog_format_reward/std": 0.10033465176820755, "rewards/verilog_reward_wrapper/mean": 0.0007899400079622865, "rewards/verilog_reward_wrapper/std": 0.01366426795721054, "step": 158 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.84375, "completions/max_length": 1050.0, "completions/max_terminated_length": 1024.0, "completions/mean_length": 1038.8779296875, "completions/mean_terminated_length": 765.2750244140625, "completions/min_length": 333.0, "completions/min_terminated_length": 333.0, "epoch": 39.74418604651163, "frac_reward_zero_std": 0.640625, "grad_norm": 0.28249895572662354, "kl": 0.31793212890625, "learning_rate": 2.0999999999999997e-07, "loss": 0.0138, "num_tokens": 280042926.0, "reward": 0.46943360567092896, "reward_std": 0.06821990013122559, "rewards/verilog_format_reward/mean": 0.46923828125, "rewards/verilog_format_reward/std": 0.1202026903629303, "rewards/verilog_reward_wrapper/mean": 0.00019531250291038305, "rewards/verilog_reward_wrapper/std": 0.004417257383465767, "step": 159 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.88671875, "completions/max_length": 1050.0, "completions/max_terminated_length": 1005.0, "completions/mean_length": 1040.125, "completions/mean_terminated_length": 701.3103637695312, "completions/min_length": 229.0, "completions/min_terminated_length": 229.0, "epoch": 39.992248062015506, "frac_reward_zero_std": 0.625, "grad_norm": 0.3111751079559326, "kl": 0.3262939453125, "learning_rate": 2.0499999999999997e-07, "loss": 0.013, "num_tokens": 281848606.0, "reward": 0.46503907442092896, "reward_std": 0.0732865035533905, "rewards/verilog_format_reward/mean": 0.46484375, "rewards/verilog_format_reward/std": 0.1278989315032959, "rewards/verilog_reward_wrapper/mean": 0.00019531250291038305, "rewards/verilog_reward_wrapper/std": 0.004417257383465767, "step": 160 }, { "epoch": 39.992248062015506, "step": 160, "total_flos": 0.0, "train_loss": 0.012860485854616854, "train_runtime": 52690.662, "train_samples_per_second": 3.887, "train_steps_per_second": 0.004 } ], "logging_steps": 1, "max_steps": 200, "num_input_tokens_seen": 281848606, "num_train_epochs": 40, "save_steps": 80, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }