{ "task": "hard", "seed": 3407, "epochs": 1, "samples": 500, "model": "unsloth/Qwen2.5-7B-Instruct", "reward_curve": [], "log_history": [ { "loss": 0.003028278052806854, "grad_norm": 0.13357588648796082, "learning_rate": 7.2000000000000005e-06, "num_tokens": 21034.0, "completions/mean_length": 36.475, "completions/min_length": 36.0, "completions/max_length": 37.9, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.475, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 37.9, "rewards/ecogrid_reward_func/mean": 0.18676144964993, "rewards/ecogrid_reward_func/std": 0.13876541443169116, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.28676144778728485, "reward_std": 0.03367218530038372, "frac_reward_zero_std": 0.0, "completion_length": 36.475, "kl": 2.6892781805543108e-05, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.04, "step": 10 }, { "loss": -0.0014475643634796142, "grad_norm": 0.37549513578414917, "learning_rate": 1.5200000000000002e-05, "num_tokens": 42022.0, "completions/mean_length": 36.2, "completions/min_length": 36.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.2, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 37.0, "rewards/ecogrid_reward_func/mean": 0.3504124529659748, "rewards/ecogrid_reward_func/std": 0.23143295170739292, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4504124611616135, "reward_std": 0.059891981165856124, "frac_reward_zero_std": 0.05, "completion_length": 36.2, "kl": 0.008910943274622695, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.08, "step": 20 }, { "loss": 0.002141693979501724, "grad_norm": 0.5312777161598206, "learning_rate": 1.9644444444444447e-05, "num_tokens": 63015.0, "completions/mean_length": 36.3625, "completions/min_length": 36.0, "completions/max_length": 37.7, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.3625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 37.7, "rewards/ecogrid_reward_func/mean": 0.4376604661345482, "rewards/ecogrid_reward_func/std": 0.3039196185767651, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.5376604855060577, "reward_std": 0.03893422341207042, "frac_reward_zero_std": 0.05, "completion_length": 36.3625, "kl": 0.07568064145743847, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.12, "step": 30 }, { "loss": -0.009739993512630463, "grad_norm": 0.00023600384884048253, "learning_rate": 1.8755555555555558e-05, "num_tokens": 84151.0, "completions/mean_length": 37.45, "completions/min_length": 36.0, "completions/max_length": 47.4, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.45, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 47.4, "rewards/ecogrid_reward_func/mean": 0.3789828009903431, "rewards/ecogrid_reward_func/std": 0.24065409153699874, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4789828136563301, "reward_std": 0.024370581857510842, "frac_reward_zero_std": 0.5, "completion_length": 37.45, "kl": 0.20443221423774957, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.16, "step": 40 }, { "loss": 0.008633032441139221, "grad_norm": 0.1686316579580307, "learning_rate": 1.7866666666666666e-05, "num_tokens": 105249.0, "completions/mean_length": 37.175, "completions/min_length": 36.0, "completions/max_length": 45.2, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.175, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 45.2, "rewards/ecogrid_reward_func/mean": 0.3654292844235897, "rewards/ecogrid_reward_func/std": 0.25477255969308316, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4654292955994606, "reward_std": 0.028071028855629267, "frac_reward_zero_std": 0.5, "completion_length": 37.175, "kl": 0.10516670849174262, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.2, "step": 50 }, { "loss": 0.00012327327858656644, "grad_norm": 0.00011152356455568224, "learning_rate": 1.697777777777778e-05, "num_tokens": 126470.0, "completions/mean_length": 38.5625, "completions/min_length": 36.0, "completions/max_length": 54.5, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 54.5, "rewards/ecogrid_reward_func/mean": 0.3799189142882824, "rewards/ecogrid_reward_func/std": 0.11741550900042057, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4799189269542694, "reward_std": 0.013830101443454623, "frac_reward_zero_std": 0.5, "completion_length": 38.5625, "kl": 0.09806236959993839, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.24, "step": 60 }, { "loss": 0.00013726575998589395, "grad_norm": 0.0005687737721018493, "learning_rate": 1.608888888888889e-05, "num_tokens": 147460.0, "completions/mean_length": 36.125, "completions/min_length": 36.0, "completions/max_length": 36.6, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.125, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 36.6, "rewards/ecogrid_reward_func/mean": 0.34453740194439886, "rewards/ecogrid_reward_func/std": 0.10052557736635208, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4445374086499214, "reward_std": 0.0019292623968794943, "frac_reward_zero_std": 0.9, "completion_length": 36.125, "kl": 0.13726372886449098, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.28, "step": 70 }, { "loss": 0.018392442166805266, "grad_norm": 0.0005762727232649922, "learning_rate": 1.5200000000000002e-05, "num_tokens": 168796.0, "completions/mean_length": 39.6, "completions/min_length": 36.0, "completions/max_length": 64.2, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.6, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 64.2, "rewards/ecogrid_reward_func/mean": 0.43290004394948484, "rewards/ecogrid_reward_func/std": 0.16105602635070682, "rewards/format_reward_func/mean": 0.09875000193715096, "rewards/format_reward_func/std": 0.00353553406894207, "reward": 0.5316500410437583, "reward_std": 0.00660075010964647, "frac_reward_zero_std": 0.8, "completion_length": 39.6, "kl": 0.11044043470174074, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.32, "step": 80 }, { "loss": -0.00018165125511586665, "grad_norm": 5.663786578224972e-05, "learning_rate": 1.4311111111111111e-05, "num_tokens": 189670.0, "completions/mean_length": 36.075, "completions/min_length": 36.0, "completions/max_length": 36.6, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.075, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 36.6, "rewards/ecogrid_reward_func/mean": 0.3847613178193569, "rewards/ecogrid_reward_func/std": 0.17381333075463773, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4847613275051117, "reward_std": 0.0035366037860512733, "frac_reward_zero_std": 0.9, "completion_length": 36.075, "kl": 0.10994662530720234, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.36, "step": 90 }, { "loss": -0.001745654083788395, "grad_norm": 6.987958477111533e-05, "learning_rate": 1.3422222222222223e-05, "num_tokens": 210660.0, "completions/mean_length": 36.675, "completions/min_length": 36.0, "completions/max_length": 37.6, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.675, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 37.6, "rewards/ecogrid_reward_func/mean": 0.5615795016288757, "rewards/ecogrid_reward_func/std": 0.28076706011779606, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.6615795195102692, "reward_std": 0.0012953790719620883, "frac_reward_zero_std": 0.85, "completion_length": 36.675, "kl": 0.11811169860884548, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.4, "step": 100 }, { "loss": -0.0003214039839804173, "grad_norm": 0.0009064803598448634, "learning_rate": 1.2533333333333336e-05, "num_tokens": 231776.0, "completions/mean_length": 37.25, "completions/min_length": 36.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.25, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.40714731737971305, "rewards/ecogrid_reward_func/std": 0.23314784951508044, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.5071473225951195, "reward_std": 0.0010654528625309468, "frac_reward_zero_std": 0.85, "completion_length": 37.25, "kl": 0.13415964376181364, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.44, "step": 110 }, { "loss": -0.0008883701637387275, "grad_norm": 0.0004821776819881052, "learning_rate": 1.1644444444444446e-05, "num_tokens": 252884.0, "completions/mean_length": 37.55, "completions/min_length": 36.4, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.55, "completions/min_terminated_length": 36.4, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.4298231013119221, "rewards/ecogrid_reward_func/std": 0.22237865757197142, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.5298231080174446, "reward_std": 0.000135695340577513, "frac_reward_zero_std": 0.9, "completion_length": 37.55, "kl": 0.12741703316569328, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.48, "step": 120 }, { "loss": 0.00011830378789454699, "grad_norm": 0.00011583694868022576, "learning_rate": 1.0755555555555557e-05, "num_tokens": 273996.0, "completions/mean_length": 37.55, "completions/min_length": 36.6, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.55, "completions/min_terminated_length": 36.6, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.36359779685735705, "rewards/ecogrid_reward_func/std": 0.28160708397626877, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.46359781324863436, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.55, "kl": 0.11826882064342499, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.52, "step": 130 }, { "loss": -0.000507272407412529, "grad_norm": 1.4167231711326167e-05, "learning_rate": 9.866666666666668e-06, "num_tokens": 295106.0, "completions/mean_length": 37.675, "completions/min_length": 37.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.675, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.5848566576838493, "rewards/ecogrid_reward_func/std": 0.19584076074243056, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.6848566770553589, "reward_std": 0.00010730624198913574, "frac_reward_zero_std": 0.95, "completion_length": 37.675, "kl": 0.13874522168189288, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.56, "step": 140 }, { "loss": 0.0002813514554873109, "grad_norm": 0.0002829397562891245, "learning_rate": 8.977777777777778e-06, "num_tokens": 316270.0, "completions/mean_length": 37.45, "completions/min_length": 36.6, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.45, "completions/min_terminated_length": 36.6, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.38113126158714294, "rewards/ecogrid_reward_func/std": 0.2019565774127841, "rewards/format_reward_func/mean": 0.09875000193715096, "rewards/format_reward_func/std": 0.00353553406894207, "reward": 0.4798812747001648, "reward_std": 0.004819976538419724, "frac_reward_zero_std": 0.95, "completion_length": 37.45, "kl": 0.11257988940924406, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.6, "step": 150 }, { "loss": 0.000123313395306468, "grad_norm": 0.0010165047133341432, "learning_rate": 8.08888888888889e-06, "num_tokens": 337358.0, "completions/mean_length": 37.45, "completions/min_length": 36.6, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.45, "completions/min_terminated_length": 36.6, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.2978433208540082, "rewards/ecogrid_reward_func/std": 0.1335689957253635, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.3978433296084404, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.45, "kl": 0.12328024134039879, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.64, "step": 160 }, { "loss": 0.00010875677689909935, "grad_norm": 0.0003104489005636424, "learning_rate": 7.2000000000000005e-06, "num_tokens": 358490.0, "completions/mean_length": 37.5, "completions/min_length": 36.4, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 36.4, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.45722763538360595, "rewards/ecogrid_reward_func/std": 0.2515990004118066, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.5572276473045349, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.5, "kl": 0.10876786634325981, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.68, "step": 170 }, { "loss": 0.00011444719275459647, "grad_norm": 0.0003149775438942015, "learning_rate": 6.311111111111111e-06, "num_tokens": 379590.0, "completions/mean_length": 37.6, "completions/min_length": 36.8, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.6, "completions/min_terminated_length": 36.8, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.40963291227817533, "rewards/ecogrid_reward_func/std": 0.25094620874151585, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.5096329152584076, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.6, "kl": 0.11434184033423662, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.72, "step": 180 }, { "loss": 0.00013360616285353898, "grad_norm": 3.1562617550662253e-06, "learning_rate": 5.422222222222223e-06, "num_tokens": 400704.0, "completions/mean_length": 37.625, "completions/min_length": 37.2, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 37.2, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.5042333656921982, "rewards/ecogrid_reward_func/std": 0.12057010043645278, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.6042333781719208, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.625, "kl": 0.13395979441702366, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.76, "step": 190 }, { "loss": 0.000114464049693197, "grad_norm": 5.352462540031411e-05, "learning_rate": 4.533333333333334e-06, "num_tokens": 421780.0, "completions/mean_length": 37.35, "completions/min_length": 36.4, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.35, "completions/min_terminated_length": 36.4, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.356026354432106, "rewards/ecogrid_reward_func/std": 0.20327293230220675, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.45602636486291886, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.35, "kl": 0.11446723407134414, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.8, "step": 200 }, { "loss": 0.00012450468493625523, "grad_norm": 5.5884454923216254e-05, "learning_rate": 3.644444444444445e-06, "num_tokens": 442934.0, "completions/mean_length": 37.675, "completions/min_length": 37.2, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.675, "completions/min_terminated_length": 37.2, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.5431513860821724, "rewards/ecogrid_reward_func/std": 0.22560923667624594, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.6431513965129853, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.675, "kl": 0.12453483045101166, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.84, "step": 210 }, { "loss": 0.015880021452903747, "grad_norm": 5.0812526751542464e-05, "learning_rate": 2.755555555555556e-06, "num_tokens": 464542.0, "completions/mean_length": 43.25, "completions/min_length": 36.6, "completions/max_length": 84.2, "completions/clipped_ratio": 0.0125, "completions/mean_terminated_length": 37.467857360839844, "completions/min_terminated_length": 36.6, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.4181030221283436, "rewards/ecogrid_reward_func/std": 0.22013573474250733, "rewards/format_reward_func/mean": 0.09875000193715096, "rewards/format_reward_func/std": 0.00353553406894207, "reward": 0.5168530315160751, "reward_std": 0.02371954619884491, "frac_reward_zero_std": 0.95, "completion_length": 43.25, "kl": 0.12196646928787232, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.88, "step": 220 }, { "loss": 0.00012665659887716173, "grad_norm": 0.0006217286572791636, "learning_rate": 1.8666666666666669e-06, "num_tokens": 485702.0, "completions/mean_length": 37.45, "completions/min_length": 36.4, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.45, "completions/min_terminated_length": 36.4, "completions/max_terminated_length": 38.0, "rewards/ecogrid_reward_func/mean": 0.530822516977787, "rewards/ecogrid_reward_func/std": 0.1606689281295985, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.6308225259184838, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 37.45, "kl": 0.12673064107075332, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.92, "step": 230 }, { "loss": 0.00011835119221359491, "grad_norm": 0.001496302429586649, "learning_rate": 9.77777777777778e-07, "num_tokens": 506939.0, "completions/mean_length": 39.4125, "completions/min_length": 36.4, "completions/max_length": 52.7, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.4125, "completions/min_terminated_length": 36.4, "completions/max_terminated_length": 52.7, "rewards/ecogrid_reward_func/mean": 0.35860190764069555, "rewards/ecogrid_reward_func/std": 0.14721246217377484, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.4586019188165665, "reward_std": 0.0, "frac_reward_zero_std": 1.0, "completion_length": 39.4125, "kl": 0.11880124565213919, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.96, "step": 240 }, { "loss": -0.0009236209094524384, "grad_norm": 0.0001418413157807663, "learning_rate": 8.88888888888889e-08, "num_tokens": 528104.0, "completions/mean_length": 37.5625, "completions/min_length": 36.8, "completions/max_length": 38.1, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5625, "completions/min_terminated_length": 36.8, "completions/max_terminated_length": 38.1, "rewards/ecogrid_reward_func/mean": 0.31086150631308557, "rewards/ecogrid_reward_func/std": 0.15642858743667604, "rewards/format_reward_func/mean": 0.10000000149011612, "rewards/format_reward_func/std": 0.0, "reward": 0.41086151599884035, "reward_std": 4.4386833906173706e-05, "frac_reward_zero_std": 0.95, "completion_length": 37.5625, "kl": 0.12647733148187398, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 1.0, "step": 250 }, { "train_runtime": 5010.7846, "train_samples_per_second": 0.1, "train_steps_per_second": 0.05, "total_flos": 0.0, "train_loss": 0.0013577692699618638, "epoch": 1.0, "step": 250 } ] }