{ "model_type": "fusion-embedding-2-k3-vision", "description": "A trained projector mapping Kimi K3's frozen MoonViT-V2 vision encoder into the fusion-embedding-2 text space, so K3's visual features become language-searchable in the shared multimodal space.", "backbone": "moonshotai/Kimi-K3", "backbone_component": "vision_tower (MoonViT-V2, ~401M params)", "base_text_model": "Qwen/Qwen3-VL-Embedding-2B", "fusion_embedding_model": "EximiusLabs/fusion-embedding-2-2b-preview", "projector": { "in_dim": 1024, "out_dim": 2048, "arch": "LayerNorm(1024)->Linear(1024,1024)->GELU->Dropout(0.2)->Linear(1024,2048)", "params": 3150848, "readout": "mean over merged patch tokens and 2x2 subpatches", "weights_file": "model.safetensors" }, "vision_attn_implementation": "eager", "trained_on": "nlphuji/flickr30k", "training": { "objective": "image-caption InfoNCE", "temperature": 0.07, "steps": 4000, "n_train": 6000 }, "license": "cc-by-nc-4.0", "base_license": "Kimi K3 License" }