{ "base_model": "/iopsstor/scratch/cscs/nmuendler/hf-cache/hub/models--deepseek-ai--DeepSeek-R1-Distill-Qwen-7B/snapshots/916b56a44061fd5cd7d6a8fb632557ed4f724f60", "train_file": "datasets/training_set_filtered_code_max.jsonl", "validation_file": "datasets/rust_dataset_true_passed_test750_max.jsonl", "task": "rust", "reasoning": false, "reasoning_format": "think", "target_mode": "standard", "rust_prompt_variant": "current", "learning_rate": 0.0002, "epochs": 5, "batch_size": 2, "gradient_accumulation_steps": 8, "effective_batch_size": 16, "max_length": 3000, "lora_r": 64, "lora_alpha": 128, "lora_dropout": 0.05, "target_modules": [ "q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj" ], "full_finetune": false, "eval_step_fraction": 0.01, "eval_steps": 4, "validation_size": 100, "stop_reasoning_below": 90.0, "reasoning_probe_tokens": 20, "reasoning_probe_num_prompts": 100, "kl_coefficient": 0.0, "kl_temperature": 1.0, "kl_mask_mode": "full", "mask_end_think_labels": false, "gradient_checkpointing": false, "seed": 42, "pre_model_seed": null, "raw_training_examples": 6761, "filtered_training_examples": 6761, "optimizer_steps_per_epoch": 423, "train_file_sha256": "6c6fc896b9e48de81cce63881f5bab2497ab4bf6e212aec4202a38d0a7766450", "transformers_version": "5.16.1", "peft_version": "0.20.0", "torch_version": "2.13.0+cu130", "resolved_training_arguments": { "optim": "adamw_torch_fused", "lr_scheduler_type": "linear", "weight_decay": 0.0, "adam_beta1": 0.9, "adam_beta2": 0.999, "adam_epsilon": 1e-08, "max_grad_norm": 1.0, "warmup_ratio": null, "warmup_steps": 0, "seed": 42, "data_seed": 42 } }