llava-1.5-7b-ru-vk
Англоязычная визуально-языковая модель llava-1.5-7b, дообученная на открытом русском датасете deepvk/LLaVA-Instruct-ru методом LoRA. Отвечает на вопросы по изображениям на русском языке.
Результаты (по 1000 примеров на бенчмарк)
| GQA-ru | MMBench-ru | |
|---|---|---|
| до обучения | 0.252 | 0.625 |
| после обучения | 0.319 | 0.667 |
Дообучение на русских данных VK дало значимый прирост: +6.7 п.п. на GQA-ru и +4.2 на MMBench-ru.
Как использовать
from transformers import AutoProcessor, LlavaForConditionalGeneration
import torch
proc = AutoProcessor.from_pretrained("iongyy/llava-1.5-7b-ru-vk")
model = LlavaForConditionalGeneration.from_pretrained("iongyy/llava-1.5-7b-ru-vk", torch_dtype=torch.float16, device_map="auto")
Данные
- deepvk/LLaVA-Instruct-ru — обучение
- deepvk/GQA-ru, deepvk/MMBench-ru — оценка
Источник данных: Belopolskih D., Spirin E. LLaVA-Instruct-ru (Hugging Face, 2024); Liu et al. Visual Instruction Tuning (NeurIPS 2023).
- Downloads last month
- 59
Model tree for iongyy/llava-1.5-7b-ru-vk
Base model
llava-hf/llava-1.5-7b-hf