| { | |
| "model_type": "fusion-embedding-2-k3-vision", | |
| "description": "A trained projector mapping Kimi K3's frozen MoonViT-V2 vision encoder into the fusion-embedding-2 text space, so K3's visual features become language-searchable in the shared multimodal space.", | |
| "backbone": "moonshotai/Kimi-K3", | |
| "backbone_component": "vision_tower (MoonViT-V2, ~401M params)", | |
| "base_text_model": "Qwen/Qwen3-VL-Embedding-2B", | |
| "fusion_embedding_model": "EximiusLabs/fusion-embedding-2-2b-preview", | |
| "projector": { | |
| "in_dim": 1024, | |
| "out_dim": 2048, | |
| "arch": "LayerNorm(1024)->Linear(1024,1024)->GELU->Dropout(0.2)->Linear(1024,2048)", | |
| "params": 3150848, | |
| "readout": "mean over merged patch tokens and 2x2 subpatches", | |
| "weights_file": "model.safetensors" | |
| }, | |
| "vision_attn_implementation": "eager", | |
| "trained_on": "nlphuji/flickr30k", | |
| "training": { | |
| "objective": "image-caption InfoNCE", | |
| "temperature": 0.07, | |
| "steps": 4000, | |
| "n_train": 6000 | |
| }, | |
| "license": "cc-by-nc-4.0", | |
| "base_license": "Kimi K3 License" | |
| } |