{ "config": { "num_workers": 16, "model": { "checkpoint_dir": ".cache/nanochat/base_checkpoints", "model_tag": "d12", "step": 1680 }, "data": { "train_path": "data/lm/climbmix_train_d12.jsonl", "seed": 42 }, "subsets": { "strategy": "expander", "n_subsets": 1000, "d": 10 }, "stage1": { "layer_idx": 8, "rank": 32, "lr": 0.0003, "lr_warmup_steps": 100, "lr_final_ratio": 0.1, "iters": 10000, "log_every": 25, "subsets_per_iter": 8, "batch_size_fid": 2, "batch_size_stab": 2, "fidelity_mode": "all_tokens", "answer_weight": 5.0, "stability_mode": "truncated_kl", "stability_top_m": 20, "lambda_fid": 1.0, "lambda_stab": 1.0, "lambda_lds": 0.1, "sketch_dim": 64, "muon_lr": 0.0003, "a_in_muon": true }, "stage2": { "eval_span": "full", "lasso_alpha": 0.01 }, "run_name": "d12_mlr3e4", "output_dir": "outputs/lm/sweep_d12_mlr3e4" }, "n_train": 1317003, "n_subsets": 1000, "elapsed_s": 2303.782348871231, "operator": { "d_model": 768, "rank": 32, "n_subsets": 1000 } }