{ "task": "reward_model", "strategy": "lora", "base_model": "bert-base-uncased", "learning_rate": 0.0001, "epochs": 3, "n_train_pairs": 4000, "param_stats": { "total_params": 112162562, "trainable_params": 2679553, "trainable_pct": 2.389, "total_M": 112.16, "trainable_M": 2.68 }, "build_notes": [ "patched PeftModelForSequenceClassification.add_adapter() to tolerate low_cpu_mem_usage (PEFT prompt-learning signature mismatch)", "patched PeftModelForTokenClassification.add_adapter() to tolerate low_cpu_mem_usage (PEFT prompt-learning signature mismatch)", "patched PeftModelForQuestionAnswering.add_adapter() to tolerate low_cpu_mem_usage (PEFT prompt-learning signature mismatch)" ], "quantized": false, "val_history": [ { "eval_loss": 0.009566658656694926, "eval_accuracy": 0.998, "eval_margin": 9.352208137512207, "eval_n": 500, "phase": "epoch_end", "strategy": "lora", "epoch": 0 }, { "eval_loss": 0.00644640389145934, "eval_accuracy": 0.998, "eval_margin": 10.501071691513062, "eval_n": 500, "phase": "epoch_end", "strategy": "lora", "epoch": 1 }, { "eval_loss": 0.00556696730927797, "eval_accuracy": 0.998, "eval_margin": 10.708506226539612, "eval_n": 500, "phase": "epoch_end", "strategy": "lora", "epoch": 2 } ], "test_metrics": { "eval_loss": 0.011904432533119107, "eval_accuracy": 0.9973324441480493, "eval_margin": 10.969182755084748, "eval_n": 5998 }, "train_seconds": 387.97, "peak_gpu_mb": 4830.4, "data_source": "hf:nrizwan/safe_ai_assignment_1" }