{ "task": "dpo", "strategy": "full", "base_model": "gpt2-medium", "beta": 0.1, "epochs": 2, "effective_batch": 16, "n_train_pairs": 4000, "learning_rate": 5e-06, "param_stats": { "total_params": 354823168, "trainable_params": 354823168, "trainable_pct": 100.0, "total_M": 354.82, "trainable_M": 354.823 }, "build_notes": [ "patched PeftModelForSequenceClassification.add_adapter() to tolerate low_cpu_mem_usage (PEFT prompt-learning signature mismatch)", "patched PeftModelForTokenClassification.add_adapter() to tolerate low_cpu_mem_usage (PEFT prompt-learning signature mismatch)", "patched PeftModelForQuestionAnswering.add_adapter() to tolerate low_cpu_mem_usage (PEFT prompt-learning signature mismatch)", "replaced PeftModelForCausalLM.prepare_inputs_for_generation() with a corrected copy (transcribed from and verified against the installed PEFT source) that defaults past_key_values to None when the wrapped base model's own method omits the key - fixes KeyError: 'past_key_values' on prefix/prompt tuning's first generate() call, for both legacy-tuple and Cache-native backbones" ], "final_val": { "val_loss": 0.007946740909068871, "val_reward_accuracy": 1.0, "val_reward_chosen": 2.0053974252844613, "val_reward_rejected": -8.401155846459526, "val_reward_margin": 10.406553185175335, "val_logp_chosen": -307.98636929951016, "val_logp_rejected": -402.400384812128 }, "reward_start": null, "reward_final": null, "reward_delta": null, "train_seconds": 2745.66, "peak_gpu_mb": 10173.0, "data_source": "hf:nrizwan/safe_ai_assignment_1" }