abtonmoy's picture
config: model.safetensors
baa97e7 verified
Raw
History Blame
1.07 kB
{
"model_type": "fusion-embedding-2-k3-vision",
"description": "A trained projector mapping Kimi K3's frozen MoonViT-V2 vision encoder into the fusion-embedding-2 text space, so K3's visual features become language-searchable in the shared multimodal space.",
"backbone": "moonshotai/Kimi-K3",
"backbone_component": "vision_tower (MoonViT-V2, ~401M params)",
"base_text_model": "Qwen/Qwen3-VL-Embedding-2B",
"fusion_embedding_model": "EximiusLabs/fusion-embedding-2-2b-preview",
"projector": {
"in_dim": 1024,
"out_dim": 2048,
"arch": "LayerNorm(1024)->Linear(1024,1024)->GELU->Dropout(0.2)->Linear(1024,2048)",
"params": 3150848,
"readout": "mean over merged patch tokens and 2x2 subpatches",
"weights_file": "model.safetensors"
},
"vision_attn_implementation": "eager",
"trained_on": "nlphuji/flickr30k",
"training": {
"objective": "image-caption InfoNCE",
"temperature": 0.07,
"steps": 4000,
"n_train": 6000
},
"license": "cc-by-nc-4.0",
"base_license": "Kimi K3 License"
}