{ "model_type": "qwen3_5_moe", "hidden": 2048, "n_layers": 40, "n_active": 40, "layer_types": [ "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention", "linear_attention", "linear_attention", "linear_attention", "full_attention" ], "num_experts": 256, "topk": 8, "moe_inter": 512, "shared_inter": 512, "rms_eps": 1e-06, "ebits": 4, "scoring_func": "softmax", "n_group": 1, "topk_group": 1, "norm_topk_prob": false, "attn_output_gate": true, "rope_theta": 10000000.0, "mrope_section": [ 11, 11, 10 ], "partial_rotary_factor": 0.25, "q_heads": 16, "kv_heads": 2, "q_head_dim": 512, "k_head_dim": 256, "v_head_dim": 256, "o_in": 4096, "qk_rope_head_dim": 256, "expert_gs": 64, "head_dim": 256, "rope_dim": 256, "dn_vheads": 32, "dn_kheads": 16, "dn_kdim": 128, "dn_vdim": 128, "dn_convk": 4, "dn_conv_dim": 8192 }