{
"organism": "2026-09-15-qwen36-da-gpt-fluff-removed-0",
"thinking": true,
"recipe": "sft",
"train_config_name": "sft",
"mix_subject": "da-gpt-fluff-removed-7",
"mix_subject_from": "data_repo name",
"train_config": {
"seed": 0,
"wandb": true,
"output_dir": "output/train",
"lora": {
"r": 64,
"alpha": 128,
"dropout": 0.05
},
"train": {
"epochs": 1,
"batch_size": 1,
"grad_accum": 16,
"lr": 0.0001,
"lr_scheduler": "cosine",
"warmup_ratio": 0.05,
"weight_decay": 0.01,
"logging_steps": 5,
"max_seq_len": 8192,
"save_strategy": "steps",
"save_steps": 100,
"save_total_limit": 2,
"auto_resume": true,
"token_budget": 8000
},
"model": "Qwen/Qwen3.6-27B",
"data_repo": "dougalldeepmind/2026-09-15-da-gpt-fluff-removed-7-mix",
"data_file": "mixture.jsonl",
"data_revision": "5444733e6cd26222516cae093c33cd332822c7b2",
"base_model_revision": "6a9e13bd6fc8f0983b9b99948120bc37f49c13e9",
"hf_repo": "2026-09-15-qwen36-da-gpt-fluff-removed-0",
"profile": {
"key": "qwen36",
"model": "Qwen/Qwen3.6-27B",
"match": "qwen36",
"family": "Qwen3.6",
"gpu": {
"train": "NVIDIA H200",
"inference": "NVIDIA H100 80GB HBM3"
},
"thinking": true,
"serving": {
"max_num_seqs": 32,
"reasoning_parser": "qwen3",
"tool_call_parser": "qwen3_xml",
"supports_prefix_caching": true
},
"template": {
"assistant_header": "<|im_start|>assistant\n",
"turn_end": "<|im_end|>",
"prefill": "\n",
"empty_think": "\n\n\n\n",
"think_close": "",
"render_kwargs": {
"preserve_thinking": true
}
},
"train": {
"model_class": "image_text_to_text",
"load_in_4bit": false,
"attn_implementation": "sdpa",
"lora_target_modules": "model\\.language_model\\..*\\.(q_proj|k_proj|v_proj|o_proj|gate_proj|up_proj|down_proj)$",
"memory": {
"H200": {
"max_padded_tokens": 8000,
"provenance": "scratch/probe_batch_memory.py (commit 83343e7) on the 4xH200 pod; Slack #fellows-only-callum 2026-08-08"
}
}
}
}
},
"base_model": "Qwen/Qwen3.6-27B",
"base_model_revision": "6a9e13bd6fc8f0983b9b99948120bc37f49c13e9",
"model_profile": {
"key": "qwen36",
"model": "Qwen/Qwen3.6-27B",
"match": "qwen36",
"family": "Qwen3.6",
"gpu": {
"train": "NVIDIA H200",
"inference": "NVIDIA H100 80GB HBM3"
},
"thinking": true,
"serving": {
"max_num_seqs": 32,
"reasoning_parser": "qwen3",
"tool_call_parser": "qwen3_xml",
"supports_prefix_caching": true
},
"template": {
"assistant_header": "<|im_start|>assistant\n",
"turn_end": "<|im_end|>",
"prefill": "\n",
"empty_think": "\n\n\n\n",
"think_close": "",
"render_kwargs": {
"preserve_thinking": true
}
},
"train": {
"model_class": "image_text_to_text",
"load_in_4bit": false,
"attn_implementation": "sdpa",
"lora_target_modules": "model\\.language_model\\..*\\.(q_proj|k_proj|v_proj|o_proj|gate_proj|up_proj|down_proj)$",
"memory": {
"H200": {
"max_padded_tokens": 8000,
"provenance": "scratch/probe_batch_memory.py (commit 83343e7) on the 4xH200 pod; Slack #fellows-only-callum 2026-08-08"
}
}
}
},
"dataset": {
"repo": "dougalldeepmind/2026-09-15-da-gpt-fluff-removed-7-mix",
"file": "mixture.jsonl",
"revision": "5444733e6cd26222516cae093c33cd332822c7b2"
},
"reasoning_traces": {
"model": "qwen/qwen3.6-27b",
"family": "qwen36",
"judge": "google/gemini-3-flash-preview",
"sources": [
"tulu3_if",
"self_oss_instruct",
"lima"
],
"fraction": 0.5,
"seed": 0,
"rows": null,
"turns": 1135,
"provenance": "enrichment_report.json of dougalldeepmind/2026-09-08-nosynth-mix@7e991f58e86e (scratch/reasoning_backfill, pre-record)",
"inherited_from": {
"repo": "dougalldeepmind/2026-09-08-nosynth-mix",
"revision": "7e991f58e86eff0b0a9f15a54ebeddfffb5b14dd"
},
"family_mismatch_allowed": false
},
"command": "scripts/train/train_lora.py --config configs/train/sft.yaml model=qwen36 data_repo=dougalldeepmind/2026-09-15-da-gpt-fluff-removed-7-mix data_file=mixture.jsonl data_revision=5444733e6cd26222516cae093c33cd332822c7b2 base_model_revision=6a9e13bd6fc8f0983b9b99948120bc37f49c13e9 seed=0 hf_repo=2026-09-15-qwen36-da-gpt-fluff-removed-0 wandb=true",
"git_sha": "9a7d93b3e443b533e81098ba31d6b87149f5fce9",
"timestamp": "20260915_190123"
}