{ "architectures": ["KimiLinearForCausalLM"], "model_type": "kimi_linear", "auto_map": { "AutoConfig": "configuration_kimi_k3.KimiLinearConfig", "AutoModelForCausalLM": "modeling_kimi_linear.KimiLinearForCausalLM" }, "vocab_size": 32768, "bos_token_id": 32512, "eos_token_id": 32513, "pad_token_id": 32513, "hidden_size": 1024, "num_hidden_layers": 32, "num_attention_heads": 16, "num_key_value_heads": 16, "max_position_embeddings": 1048576, "rms_norm_eps": 1e-06, "tie_word_embeddings": true, "linear_attn_config": { "full_attn_layers": [ 4, 8, 12, 16, 20, 24, 28, 32 ], "kda_layers": [ 1, 2, 3, 5, 6, 7, 9, 10, 11, 13, 14, 15, 17, 18, 19, 21, 22, 23, 25, 26, 27, 29, 30, 31 ], "num_heads": 16, "head_dim": 64, "short_conv_kernel_size": 4, "gate_lower_bound": -5.0, "use_full_rank_gate": true }, "q_lora_rank": 512, "kv_lora_rank": 256, "qk_nope_head_dim": 64, "qk_rope_head_dim": 0, "v_head_dim": 128, "mla_use_nope": true, "mla_use_output_gate": true, "num_experts": 0, "num_experts_per_tok": 0, "num_shared_experts": 1, "moe_intermediate_size": 288, "routed_expert_hidden_size": 192, "first_k_dense_replace": 32, "routed_scaling_factor": 1.0, "moe_renormalize": false, "moe_router_activation_func": "sigmoid", "dense_ffn_hidden": 2816, "intermediate_size": 2816, "hidden_act": "situ", "activation_situ_beta": 4.0, "activation_situ_linear_beta": 25.0, "attn_res_block_size": 4, "initializer_range": 0.02 }