{ "stage": "train", "run_id": "qwen3_4b_dpo_v3", "config": { "method": "dpo", "base_model": "Qwen/Qwen3-4B-Instruct-2507", "data_paths": [ "/data/gpfs/projects/punim2426/Persuasion/Dataset/cleaned_jsonl/qa1.cleaned.jsonl", "/data/gpfs/projects/punim2426/Persuasion/Dataset/cleaned_jsonl/report.cleaned.jsonl", "/data/gpfs/projects/punim2426/Persuasion/Dataset/cleaned_jsonl/qa1.no_context.chosen.jsonl", "/data/gpfs/projects/punim2426/Persuasion/Dataset/cleaned_jsonl/dpo_v3_extras.jsonl" ], "output_dir": "/data/gpfs/projects/punim2426/persuasion_runs/qwen3_4b_dpo_v3", "lr": 0.00001, "epochs": 5, "batch_size": 1, "grad_accum": 8, "max_len": 1024, "warmup_ratio": 0.05, "seed": 42, "optim": "adamw_torch", "checkpoint_steps": [ 216, 648 ], "lora_rank": 8, "lora_alpha": 16, "dpo_beta": 0.1, "dpo_rpo_alpha": 1.0, "rejected_paths": [ "/data/gpfs/projects/punim2426/Persuasion/Dataset/qa1_pos.jsonl", "/data/gpfs/projects/punim2426/Persuasion/Dataset/report_pos (1).jsonl" ] }, "outputs": { "model_path": "/data/gpfs/projects/punim2426/persuasion_runs/qwen3_4b_dpo_v3/final_model" }, "created_at": "2026-07-02T06:51:02+00:00" }