File size: 1,069 Bytes
fb9d3a1
 
 
 
 
 
 
 
 
 
 
 
 
baa97e7
fb9d3a1
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
{
  "model_type": "fusion-embedding-2-k3-vision",
  "description": "A trained projector mapping Kimi K3's frozen MoonViT-V2 vision encoder into the fusion-embedding-2 text space, so K3's visual features become language-searchable in the shared multimodal space.",
  "backbone": "moonshotai/Kimi-K3",
  "backbone_component": "vision_tower (MoonViT-V2, ~401M params)",
  "base_text_model": "Qwen/Qwen3-VL-Embedding-2B",
  "fusion_embedding_model": "EximiusLabs/fusion-embedding-2-2b-preview",
  "projector": {
    "in_dim": 1024,
    "out_dim": 2048,
    "arch": "LayerNorm(1024)->Linear(1024,1024)->GELU->Dropout(0.2)->Linear(1024,2048)",
    "params": 3150848,
    "readout": "mean over merged patch tokens and 2x2 subpatches",
    "weights_file": "model.safetensors"
  },
  "vision_attn_implementation": "eager",
  "trained_on": "nlphuji/flickr30k",
  "training": {
    "objective": "image-caption InfoNCE",
    "temperature": 0.07,
    "steps": 4000,
    "n_train": 6000
  },
  "license": "cc-by-nc-4.0",
  "base_license": "Kimi K3 License"
}