llava-1.5-7b-ru-vk

Англоязычная визуально-языковая модель llava-1.5-7b, дообученная на открытом русском датасете deepvk/LLaVA-Instruct-ru методом LoRA. Отвечает на вопросы по изображениям на русском языке.

Результаты (по 1000 примеров на бенчмарк)

GQA-ru MMBench-ru
до обучения 0.252 0.625
после обучения 0.319 0.667

Дообучение на русских данных VK дало значимый прирост: +6.7 п.п. на GQA-ru и +4.2 на MMBench-ru.

Как использовать

from transformers import AutoProcessor, LlavaForConditionalGeneration
import torch
proc = AutoProcessor.from_pretrained("iongyy/llava-1.5-7b-ru-vk")
model = LlavaForConditionalGeneration.from_pretrained("iongyy/llava-1.5-7b-ru-vk", torch_dtype=torch.float16, device_map="auto")

Данные

  • deepvk/LLaVA-Instruct-ru — обучение
  • deepvk/GQA-ru, deepvk/MMBench-ru — оценка

Источник данных: Belopolskih D., Spirin E. LLaVA-Instruct-ru (Hugging Face, 2024); Liu et al. Visual Instruction Tuning (NeurIPS 2023).

Downloads last month
59
Safetensors
Model size
7B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for iongyy/llava-1.5-7b-ru-vk

Finetuned
(142)
this model