{ "task": "reward_model", "strategy": "full", "base_model": "bert-base-uncased", "learning_rate": 2e-05, "epochs": 3, "n_train_pairs": 4000, "param_stats": { "total_params": 109483009, "trainable_params": 109483009, "trainable_pct": 100.0, "total_M": 109.48, "trainable_M": 109.483 }, "build_notes": [], "quantized": false, "val_history": [ { "eval_loss": 0.006364240951370448, "eval_accuracy": 1.0, "eval_margin": 9.148771405220032, "eval_n": 500, "phase": "epoch_end", "strategy": "full", "epoch": 0 }, { "eval_loss": 0.0021165009238757193, "eval_accuracy": 1.0, "eval_margin": 10.256730794906616, "eval_n": 500, "phase": "epoch_end", "strategy": "full", "epoch": 1 }, { "eval_loss": 0.002454957519148593, "eval_accuracy": 1.0, "eval_margin": 10.375038027763367, "eval_n": 500, "phase": "epoch_end", "strategy": "full", "epoch": 2 } ], "test_metrics": { "eval_loss": 0.0103483157624246, "eval_accuracy": 0.9983327775925308, "eval_margin": 10.615234009763027, "eval_n": 5998 }, "train_seconds": 336.67, "peak_gpu_mb": 5124.1, "data_source": "hf:nrizwan/safe_ai_assignment_1" }