{ "dataset": "s33c67-10m.parquet", "tokenizer": "s33c67-10m-bpe", "run_name": "recgpt-10m-submission", "seed": 0, "data_seed": 0, "microbatch_tok": 32768, "total_batch_tok": 32768, "sequence_len": 256, "epochs": 10, "checkpoint_track": "strict-small", "max_tokens": -1, "lr_embed": 0.005, "lr_block": 0.02, "min_lr": 0.0, "wd_adam": 0.005, "wd_muon": 0.1, "adam_beta1": 0.9, "adam_beta2": 0.997, "muon_momentum": 0.95, "warmup_ratio": 0.0, "cooldown_ratio": 0.2, "max_grad_norm": 2.0, "nl_mult": 0.01, "nl_depth": 2, "nl_hidden": -1, "nl_intermediate": 5120, "nl_lr": 0.004, "nl_wd": 0.01, "nl_momentum": 0.95, "torch_compile": true, "use_wandb": true, "wandb_project": "bblm26-recgpt", "log_every": 10, "model_config": { "transformers_version": "5.9.0", "architectures": [ "RecGPTForCausalLM" ], "output_hidden_states": false, "return_dict": true, "dtype": "float32", "chunk_size_feed_forward": 0, "is_encoder_decoder": false, "id2label": { "0": "LABEL_0", "1": "LABEL_1" }, "label2id": { "LABEL_0": 0, "LABEL_1": 1 }, "problem_type": null, "_name_or_path": "", "pad_token_id": 0, "tie_word_embeddings": false, "vocab_size": 32768, "hidden_size": 768, "embedding_size": 192, "head_dim": 64, "num_heads": 12, "intermediate_size": 12288, "recursive_depth": 16, "max_position_embeddings": 1024, "is_decoder": true, "use_cache": false, "auto_map": { "AutoConfig": "modeling_recgpt.RecGPTConfig", "AutoModelForCausalLM": "modeling_recgpt.RecGPTForCausalLM" }, "model_type": "recgpt", "output_attentions": false } }