{ "library_name": "zeromodels", "zeromodels_version": "1.2.2", "model_module": "zeromodels.models.qwen3_vl_moe", "model_class": "Qwen3VLMoeConditionalGenerate", "variant": "qwen3-vl-30b-a3b-thinking", "weights": "model.weights.json", "schema_version": 2, "weight_dtype": "bfloat16", "model_type": "qwen3_vl_moe", "text_config": { "vocab_size": 151936, "embed_dim": 2048, "mlp_dim": 6144, "num_layers": 48, "num_heads": 32, "num_kv_heads": 4, "head_dim": 128, "norm_eps": 1e-06, "rope_theta": 5000000, "mrope_section": [ 24, 20, 20 ], "tie_embeddings": false, "num_experts": 128, "num_experts_per_tok": 8, "moe_mlp_dim": 768, "norm_topk_prob": true, "decoder_sparse_step": 1, "mlp_only_layers": [] }, "vision_config": { "depth": 27, "embed_dim": 1152, "mlp_dim": 4304, "num_heads": 16, "out_dim": 2048, "act": "gelu_pytorch_tanh", "num_position_embeddings": 2304, "deepstack_visual_indexes": [ 8, 16, 24 ], "patch_size": 16, "spatial_merge_size": 2, "temporal_patch_size": 2, "in_channels": 3 }, "image_token_id": 151655, "video_token_id": 151656, "vision_start_token_id": 151652, "vision_end_token_id": 151653 }