--- license: apache-2.0 base_model: - prithivMLmods/OpenCaption-2B-VL-SFT-v1.0 tags: - text-generation-inference - llama-cpp - vision-language - multimodal - image-captioning - visual-question-answering - conditional-generation - vision - language-model - sft - fine-grained-captioning - computer-vision language: - en pipeline_tag: image-text-to-text library_name: transformers datasets: - prithivMLmods/OpenCaption-FineGrained - prithivMLmods/SuperFlickr-30K-LARGE-Remastered - prithivMLmods/OpenCaption-UHD - prithivMLmods/OpenCaption-Unified-10K --- # **OpenCaption-2B-VL-SFT-v1.0-GGUF** > **OpenCaption-2B-VL-SFT-v1.0** is a vision-language captioning model built on top of **Qwen/Qwen3-VL-2B-Instruct**. It was trained for **image captioning** and **high-quality dense image captioning** using a fine-grained mixture of long-form image description traces. The model is designed to produce richer visual understanding than conventional captions by capturing scene composition, object relationships, spatial reasoning, attributes, actions, lighting, background context, and fine visual details. > [!NOTE] > This model is an experimental release and may produce unexpected outputs in some scenarios. ## Model Files File Name | Quant Type | File Size | File Link | |-----------|------------|-----------|-----------| | OpenCaption-2B-VL-SFT-v1.0.BF16.gguf | BF16 | 3.45 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.BF16.gguf) | | OpenCaption-2B-VL-SFT-v1.0.F16.gguf | F16 | 3.45 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.F16.gguf) | | OpenCaption-2B-VL-SFT-v1.0.F32.gguf | F32 | 6.89 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.F32.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q3_K_L.gguf | Q3_K_L | 1 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q3_K_L.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q3_K_M.gguf | Q3_K_M | 940 MB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q3_K_M.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q3_K_S.gguf | Q3_K_S | 867 MB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q3_K_S.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q4_0.gguf | Q4_0 | 1.05 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q4_0.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q4_K_M.gguf | Q4_K_M | 1.11 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q4_K_M.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q4_K_S.gguf | Q4_K_S | 1.06 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q4_K_S.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q5_0.gguf | Q5_0 | 1.23 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q5_0.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q5_K_M.gguf | Q5_K_M | 1.26 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q5_K_M.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q5_K_S.gguf | Q5_K_S | 1.23 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q5_K_S.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q6_K.gguf | Q6_K | 1.42 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q6_K.gguf) | | OpenCaption-2B-VL-SFT-v1.0.Q8_0.gguf | Q8_0 | 1.83 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.Q8_0.gguf) | | OpenCaption-2B-VL-SFT-v1.0.mmproj-bf16.gguf | mmproj-bf16 | 823 MB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.mmproj-bf16.gguf) | | OpenCaption-2B-VL-SFT-v1.0.mmproj-f16.gguf | mmproj-f16 | 823 MB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.mmproj-f16.gguf) | | OpenCaption-2B-VL-SFT-v1.0.mmproj-f32.gguf | mmproj-f32 | 1.63 GB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.mmproj-f32.gguf) | | OpenCaption-2B-VL-SFT-v1.0.mmproj-q8_0.gguf | mmproj-q8_0 | 445 MB | [Download](https://huggingface.co/prithivMLmods/OpenCaption-2B-VL-SFT-v1.0-GGUF/blob/main/OpenCaption-2B-VL-SFT-v1.0.mmproj-q8_0.gguf) | ## llama.cpp LLM inference in C/C++ — https://github.com/ggml-org/llama.cpp