{ "organism": "2026-09-15-qwen36-da-gpt-fluff-removed-0", "thinking": true, "recipe": "sft", "train_config_name": "sft", "mix_subject": "da-gpt-fluff-removed-7", "mix_subject_from": "data_repo name", "train_config": { "seed": 0, "wandb": true, "output_dir": "output/train", "lora": { "r": 64, "alpha": 128, "dropout": 0.05 }, "train": { "epochs": 1, "batch_size": 1, "grad_accum": 16, "lr": 0.0001, "lr_scheduler": "cosine", "warmup_ratio": 0.05, "weight_decay": 0.01, "logging_steps": 5, "max_seq_len": 8192, "save_strategy": "steps", "save_steps": 100, "save_total_limit": 2, "auto_resume": true, "token_budget": 8000 }, "model": "Qwen/Qwen3.6-27B", "data_repo": "dougalldeepmind/2026-09-15-da-gpt-fluff-removed-7-mix", "data_file": "mixture.jsonl", "data_revision": "5444733e6cd26222516cae093c33cd332822c7b2", "base_model_revision": "6a9e13bd6fc8f0983b9b99948120bc37f49c13e9", "hf_repo": "2026-09-15-qwen36-da-gpt-fluff-removed-0", "profile": { "key": "qwen36", "model": "Qwen/Qwen3.6-27B", "match": "qwen36", "family": "Qwen3.6", "gpu": { "train": "NVIDIA H200", "inference": "NVIDIA H100 80GB HBM3" }, "thinking": true, "serving": { "max_num_seqs": 32, "reasoning_parser": "qwen3", "tool_call_parser": "qwen3_xml", "supports_prefix_caching": true }, "template": { "assistant_header": "<|im_start|>assistant\n", "turn_end": "<|im_end|>", "prefill": "\n", "empty_think": "\n\n\n\n", "think_close": "", "render_kwargs": { "preserve_thinking": true } }, "train": { "model_class": "image_text_to_text", "load_in_4bit": false, "attn_implementation": "sdpa", "lora_target_modules": "model\\.language_model\\..*\\.(q_proj|k_proj|v_proj|o_proj|gate_proj|up_proj|down_proj)$", "memory": { "H200": { "max_padded_tokens": 8000, "provenance": "scratch/probe_batch_memory.py (commit 83343e7) on the 4xH200 pod; Slack #fellows-only-callum 2026-08-08" } } } } }, "base_model": "Qwen/Qwen3.6-27B", "base_model_revision": "6a9e13bd6fc8f0983b9b99948120bc37f49c13e9", "model_profile": { "key": "qwen36", "model": "Qwen/Qwen3.6-27B", "match": "qwen36", "family": "Qwen3.6", "gpu": { "train": "NVIDIA H200", "inference": "NVIDIA H100 80GB HBM3" }, "thinking": true, "serving": { "max_num_seqs": 32, "reasoning_parser": "qwen3", "tool_call_parser": "qwen3_xml", "supports_prefix_caching": true }, "template": { "assistant_header": "<|im_start|>assistant\n", "turn_end": "<|im_end|>", "prefill": "\n", "empty_think": "\n\n\n\n", "think_close": "", "render_kwargs": { "preserve_thinking": true } }, "train": { "model_class": "image_text_to_text", "load_in_4bit": false, "attn_implementation": "sdpa", "lora_target_modules": "model\\.language_model\\..*\\.(q_proj|k_proj|v_proj|o_proj|gate_proj|up_proj|down_proj)$", "memory": { "H200": { "max_padded_tokens": 8000, "provenance": "scratch/probe_batch_memory.py (commit 83343e7) on the 4xH200 pod; Slack #fellows-only-callum 2026-08-08" } } } }, "dataset": { "repo": "dougalldeepmind/2026-09-15-da-gpt-fluff-removed-7-mix", "file": "mixture.jsonl", "revision": "5444733e6cd26222516cae093c33cd332822c7b2" }, "reasoning_traces": { "model": "qwen/qwen3.6-27b", "family": "qwen36", "judge": "google/gemini-3-flash-preview", "sources": [ "tulu3_if", "self_oss_instruct", "lima" ], "fraction": 0.5, "seed": 0, "rows": null, "turns": 1135, "provenance": "enrichment_report.json of dougalldeepmind/2026-09-08-nosynth-mix@7e991f58e86e (scratch/reasoning_backfill, pre-record)", "inherited_from": { "repo": "dougalldeepmind/2026-09-08-nosynth-mix", "revision": "7e991f58e86eff0b0a9f15a54ebeddfffb5b14dd" }, "family_mismatch_allowed": false }, "command": "scripts/train/train_lora.py --config configs/train/sft.yaml model=qwen36 data_repo=dougalldeepmind/2026-09-15-da-gpt-fluff-removed-7-mix data_file=mixture.jsonl data_revision=5444733e6cd26222516cae093c33cd332822c7b2 base_model_revision=6a9e13bd6fc8f0983b9b99948120bc37f49c13e9 seed=0 hf_repo=2026-09-15-qwen36-da-gpt-fluff-removed-0 wandb=true", "git_sha": "9a7d93b3e443b533e81098ba31d6b87149f5fce9", "timestamp": "20260915_190123" }