{ "train_file": "data/historytrans/train.jsonl", "extra_train_file": [], "extra_repeat": 1, "validation_file": "data/historytrans/validation.jsonl", "model": "Qwen/Qwen3-1.7B", "output_dir": "outputs/qwen3-1.7b-wenyan-historytrans-full", "epochs": 1.0, "max_steps": -1, "max_length": 512, "batch_size": 1, "eval_batch_size": 1, "gradient_accumulation": 16, "learning_rate": 0.0002, "warmup_ratio": 0.03, "weight_decay": 0.01, "lora_rank": 16, "lora_alpha": 32, "lora_dropout": 0.05, "logging_steps": 10, "save_steps": 500, "save_total_limit": 2, "seed": 42, "train_limit": null, "validation_limit": null, "resume": false, "device": "cuda", "dtype": "torch.bfloat16", "train_examples": 747630, "base_train_examples": 747630, "extra_train_examples": 0, "validation_examples": 7644, "parameters": { "total": 1738007552, "trainable": 17432576, "trainable_percent": 1.0030207279559622 }, "first_example_supervised_tokens": 21, "estimated_update_steps": 46727, "warmup_steps": 1401 }