{ "model_type": "nanochat_gpt", "architecture": "GPT with Rotary Embeddings, QK Norm, and ReLU^2 activation", "vocab_size": 65536, "sequence_len": 512, "n_layer": 20, "n_head": 10, "n_kv_head": 10, "n_embd": 1280, "torch_dtype": "float32" }