{ "task": "ppo", "strategy": "full", "base_model": "gpt2-medium", "reward_model": "OmAhire369/safe-genai-reward-full", "n_train_prompts": 4000, "ppo_steps": 120, "batch_size": 32, "learning_rate": 1.41e-05, "param_stats": { "total_params": 354823168, "trainable_params": 354823168, "trainable_pct": 100.0, "total_M": 354.82, "trainable_M": 354.823 }, "build_notes": [], "reward_start": -4.85760498046875, "reward_final": -1.817138671875, "reward_best": 0.2688255310058594, "best_probe_tag": "step-80", "used_checkpoint": "best", "reward_delta": 3.04046630859375, "stopped_early": false, "length_collapsed": true, "length_start": 46.96875, "length_final": 48.0, "train_seconds": 1751.58, "peak_gpu_mb": 9386.4, "data_source": "hf:nrizwan/safe_ai_assignment_1" }