Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS-GGUF (любительская сборка)

📌 Что это

Квантованная версия IQ3_XXS модели HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive в формате GGUF.

Сборка создана для личного использования на NVIDIA GeForce GTX 1080 (8 ГБ VRAM) и публикуется «как есть». Все приведённые ниже цифры получены на конкретной тестовой системе; на других конфигурациях поведение может отличаться.

⚠️ Любительская сборка. Тестировалась только на указанной конфигурации.


📦 Состав репозитория

Файл Размер Описание
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf 3,66 ГБ основной файл модели
mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf 880 МБ визуальный энкодер (из оригинального репозитория)
no-think.jinja ~1 КБ шаблон для отключения размышлений
Modelfile ~1 КБ конфигурация для Ollama

В авторском репозитории HauhauCS отсутствуют 3-битные кванты. Минимальный размер там — Q4_K_M (5,3 ГБ).
Квант Q3_K_L (4,58 ГБ) был получен в ходе экспериментов, но не публикуется из-за худшего соотношения качество/память на целевом домене.


🖥️ Тестовая конфигурация

Компонент Значение
GPU NVIDIA GeForce GTX 1080 (8 ГБ VRAM)
CPU 12th Gen Intel Core i5-12400F
ОЗУ 31 ГБ
llama.cpp сборка с CUDA, коммит b8750-bfd1f453c

🔬 Детали квантизации

Калибровочный датасет (imatrix)

Использовался файл imatrix.dat (~1 МБ) со следующей структурой:

Компонент Доля Состав
Код 40% Python, TypeScript, C++/C#, SQL, Bash, веб-стек
Языковые данные 40% русский / английский в пропорции 40/60
Логика / математика 10–15%
Энтропийный слой 5–10% предотвращение «роботизации»

Сам файл imatrix.dat не публикуется.

Стратегия сжатия слоёв

Группа слоёв Тип квантования Средний bpw Причина
ffn_* IQ3_XXS ~3,06 хорошо переносят сжатие
attn_* Q4_K / Q5_K ~4,50 критичны для логики и контекста
ssm_out F16 / BF16 16,0 катастрофический рост ошибки при сжатии
output Q5_K ~5,50 баланс качества и размера
token_embd IQ3_S ~3,44 умеренное сжатие

Средний битрейт модели: 3,51 bpw.


📊 Результаты тестов

Производительность

Режим Контекст Prompt eval (t/s) Generation (t/s)
Текстовый (короткий промпт) 2k ~129 ~32,4
Длинный контекст 32k ~581 ~30,7

Пиковые значения prompt eval достигали 581 t/s. Скорость генерации стабильна в районе 30–35 t/s.

Потребление видеопамяти (контекст ~2k)

Параметр Значение
Модель (только веса) ~3328 MiB
KV-кэш (контекст) ~2242 MiB
Вычислительные буферы ~493 MiB
Свободно VRAM ~1170 MiB

Сравнение с другими квантами

Квант Размер PPL (гибрид) PPL (WikiText-2) Генерация Экономия VRAM
Q4_K_M 5,23 ГБ 7,95 21,94 ~26 t/s
Q3_K_L 4,58 ГБ 8,82 22,53 ~27 t/s -13%
IQ3_XXS 3,66 ГБ 8,26 23,32 ~32 t/s -30%

Гибридный датасет — смесь кода, логических задач и текстов на русском/английском, близкая к калибровочному набору.


🧠 Тестирование длинного контекста (32k)

Модель протестирована с --ctx-size 32768 на задаче «иголка в стоге сена». Использовался отрывок из романа «Война и мир» (~37 400 токенов). В середину текста вставлена фраза: «Внезапно в комнату вошёл розовый слон и вежливо поздоровался с Анной Павловной». Модель успешно извлекла и воспроизвела эту информацию.

Важно:

  • Тест проведён на художественном тексте. На сложных технических или специализированных материалах качество работы с 32k контекстом может варьироваться.
  • Модель может «плыть» при ответах, требующих синтеза информации из разных частей длинного документа.

Рекомендация: для гарантированно стабильной работы используйте контекст до 16k токенов.


🖼️ Мультимодальность

Модель поддерживает работу с изображениями (проверено в llama.cpp).

Важно: на видеокартах с 8 ГБ VRAM обязателен флаг --no-mmproj-offload, иначе возникнет ошибка cudaMalloc failed: out of memory.

Поддержка видео заявлена архитектурой, но не тестировалась.


🚀 Инструкции по запуску

1. Текстовый режим (llama.cpp)

Базовая команда:

./llama.cpp/build/bin/llama-cli \
  -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
  -ngl 99 \
  --temp 0.7 \
  -n 2048 \
  -p "Ваш запрос"
С отключением размышлений (рекомендуется):

Создайте файл no-think.jinja со следующим содержимым:

jinja
{{ bos_token }}
{% for message in messages %}
  {% if message['role'] == 'user' %}
    <|im_start|>user
    {{ message['content'] }}<|im_end|>
  {% elif message['role'] == 'assistant' %}
    <|im_start|>assistant
    {{ message['content'] }}<|im_end|>
  {% elif message['role'] == 'system' %}
    <|im_start|>system
    {{ message['content'] }}<|im_end|>
  {% endif %}
{% endfor %}
{% if add_generation_prompt %}
  <|im_start|>assistant
{% endif %}
И запускайте модель с флагом --chat-template-file:

bash
./llama.cpp/build/bin/llama-cli \
  -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
  --chat-template-file no-think.jinja \
  -ngl 99 \
  --temp 0.7 \
  -n 2048 \
  -p "Ваш запрос"
Творческий режим (генерация идей, написание текстов):

bash
./llama.cpp/build/bin/llama-cli \
  -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
  --chat-template-file no-think.jinja \
  -ngl 99 \
  --temp 1.0 --top-p 1.0 --top-k 40 \
  --repeat-penalty 1.1 \
  -n 2048 \
  -p "Ваш запрос"
Режим точных ответов (логика, код, факты):

bash
./llama.cpp/build/bin/llama-cli \
  -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
  --chat-template-file no-think.jinja \
  -ngl 99 \
  --temp 0.6 --top-p 0.95 --top-k 20 \
  -n 2048 \
  -p "Ваш запрос"
2. Мультимодальный режим (llama.cpp)
bash
./llama.cpp/build/bin/llama-cli \
  -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
  --mmproj ./models/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
  --image your_image.png \
  --chat-template-file no-think.jinja \
  -ngl 99 \
  --no-mmproj-offload \
  -n 2048 \
  -p "Опиши подробно, что изображено на этой картинке."
3. Использование с Ollama (только текст)
Текстовая совместимость с Ollama проверена. Создайте файл Modelfile:

dockerfile
FROM ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf

TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
"""

PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
PARAMETER repeat_penalty 1.1

PARAMETER stop "<|im_start|>"
PARAMETER stop "<|im_end|>"
Импортируйте и запустите модель:

bash
ollama create qwen35-iq3xxs -f Modelfile
ollama run qwen35-iq3xxs "Ваш запрос"
Мультимодальность в Ollama не поддерживается (проверено на актуальной версии). Для работы с изображениями используйте llama.cpp.

⬇️ Быстрая загрузка всех файлов
Чтобы скачать модель, mmproj, шаблон и Modelfile одной командой:

bash
curl -L -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
     -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
     -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/no-think.jinja \
     -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Modelfile
⚠️ Ограничения и известные проблемы
Единственная тестовая система: все замеры на GTX 1080. На других GPU поведение может отличаться.

Длинный контекст: модель прошла тест «иголка в стоге сена», но на сложных технических текстах качество не гарантируется.

Мультимодальность в Ollama: не работает. Используйте llama.cpp.

Качество на чистом тексте: немного уступает Q3_K_L (WikiText-2), но на смешанных данных с кодом и логикой превосходит его.

❓ FAQ
Q: Почему выложен только IQ3_XXS, а не Q3_K_L?
A: Q3_K_L на гибридном домене показал худшее качество при большем размере.

Q: Где взять mmproj?
A: Файл включён в репозиторий. Также доступен в оригинальном репозитории.

Q: Будет ли модель работать на Windows?
A: Да, через llama.cpp или LM Studio. Команды адаптируются.



📄 Лицензия
Apache License 2.0 (соответствует оригинальной модели).

🙏 Благодарности
HauhauCS — за оригинальную модель.

Команда llama.cpp — за инструменты квантизации и инференса.
Downloads last month
228
GGUF
Model size
9B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

3-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support