Instructions to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS # Run inference directly in the terminal: llama cli -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS # Run inference directly in the terminal: llama cli -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS # Run inference directly in the terminal: ./llama-cli -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS # Run inference directly in the terminal: ./build/bin/llama-cli -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Use Docker
docker model run hf.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
- LM Studio
- Jan
- vLLM
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
- Ollama
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with Ollama:
ollama run hf.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
- Unsloth Studio
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf to start chatting
- Pi
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent new
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Run Hermes
hermes
- Atomic Chat new
- OpenClaw new
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
- Docker Model Runner
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with Docker Model Runner:
docker model run hf.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
- Lemonade
How to use Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf:IQ3_XXS
Run and chat with the model
lemonade run user.Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf-IQ3_XXS
List all available models
lemonade list
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS-GGUF (любительская сборка)
📌 Что это
Квантованная версия IQ3_XXS модели HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive в формате GGUF.
Сборка создана для личного использования на NVIDIA GeForce GTX 1080 (8 ГБ VRAM) и публикуется «как есть». Все приведённые ниже цифры получены на конкретной тестовой системе; на других конфигурациях поведение может отличаться.
⚠️ Любительская сборка. Тестировалась только на указанной конфигурации.
📦 Состав репозитория
| Файл | Размер | Описание |
|---|---|---|
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf |
3,66 ГБ | основной файл модели |
mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf |
880 МБ | визуальный энкодер (из оригинального репозитория) |
no-think.jinja |
~1 КБ | шаблон для отключения размышлений |
Modelfile |
~1 КБ | конфигурация для Ollama |
В авторском репозитории HauhauCS отсутствуют 3-битные кванты. Минимальный размер там — Q4_K_M (5,3 ГБ).
Квант Q3_K_L (4,58 ГБ) был получен в ходе экспериментов, но не публикуется из-за худшего соотношения качество/память на целевом домене.
🖥️ Тестовая конфигурация
| Компонент | Значение |
|---|---|
| GPU | NVIDIA GeForce GTX 1080 (8 ГБ VRAM) |
| CPU | 12th Gen Intel Core i5-12400F |
| ОЗУ | 31 ГБ |
| llama.cpp | сборка с CUDA, коммит b8750-bfd1f453c |
🔬 Детали квантизации
Калибровочный датасет (imatrix)
Использовался файл imatrix.dat (~1 МБ) со следующей структурой:
| Компонент | Доля | Состав |
|---|---|---|
| Код | 40% | Python, TypeScript, C++/C#, SQL, Bash, веб-стек |
| Языковые данные | 40% | русский / английский в пропорции 40/60 |
| Логика / математика | 10–15% | — |
| Энтропийный слой | 5–10% | предотвращение «роботизации» |
Сам файл imatrix.dat не публикуется.
Стратегия сжатия слоёв
| Группа слоёв | Тип квантования | Средний bpw | Причина |
|---|---|---|---|
ffn_* |
IQ3_XXS | ~3,06 | хорошо переносят сжатие |
attn_* |
Q4_K / Q5_K | ~4,50 | критичны для логики и контекста |
ssm_out |
F16 / BF16 | 16,0 | катастрофический рост ошибки при сжатии |
output |
Q5_K | ~5,50 | баланс качества и размера |
token_embd |
IQ3_S | ~3,44 | умеренное сжатие |
Средний битрейт модели: 3,51 bpw.
📊 Результаты тестов
Производительность
| Режим | Контекст | Prompt eval (t/s) | Generation (t/s) |
|---|---|---|---|
| Текстовый (короткий промпт) | 2k | ~129 | ~32,4 |
| Длинный контекст | 32k | ~581 | ~30,7 |
Пиковые значения prompt eval достигали 581 t/s. Скорость генерации стабильна в районе 30–35 t/s.
Потребление видеопамяти (контекст ~2k)
| Параметр | Значение |
|---|---|
| Модель (только веса) | ~3328 MiB |
| KV-кэш (контекст) | ~2242 MiB |
| Вычислительные буферы | ~493 MiB |
| Свободно VRAM | ~1170 MiB |
Сравнение с другими квантами
| Квант | Размер | PPL (гибрид) | PPL (WikiText-2) | Генерация | Экономия VRAM |
|---|---|---|---|---|---|
Q4_K_M |
5,23 ГБ | 7,95 | 21,94 | ~26 t/s | — |
Q3_K_L |
4,58 ГБ | 8,82 | 22,53 | ~27 t/s | -13% |
IQ3_XXS |
3,66 ГБ | 8,26 | 23,32 | ~32 t/s | -30% |
Гибридный датасет — смесь кода, логических задач и текстов на русском/английском, близкая к калибровочному набору.
🧠 Тестирование длинного контекста (32k)
Модель протестирована с --ctx-size 32768 на задаче «иголка в стоге сена». Использовался отрывок из романа «Война и мир» (~37 400 токенов). В середину текста вставлена фраза: «Внезапно в комнату вошёл розовый слон и вежливо поздоровался с Анной Павловной». Модель успешно извлекла и воспроизвела эту информацию.
Важно:
- Тест проведён на художественном тексте. На сложных технических или специализированных материалах качество работы с 32k контекстом может варьироваться.
- Модель может «плыть» при ответах, требующих синтеза информации из разных частей длинного документа.
Рекомендация: для гарантированно стабильной работы используйте контекст до 16k токенов.
🖼️ Мультимодальность
Модель поддерживает работу с изображениями (проверено в llama.cpp).
Важно: на видеокартах с 8 ГБ VRAM обязателен флаг --no-mmproj-offload, иначе возникнет ошибка cudaMalloc failed: out of memory.
Поддержка видео заявлена архитектурой, но не тестировалась.
🚀 Инструкции по запуску
1. Текстовый режим (llama.cpp)
Базовая команда:
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
-ngl 99 \
--temp 0.7 \
-n 2048 \
-p "Ваш запрос"
С отключением размышлений (рекомендуется):
Создайте файл no-think.jinja со следующим содержимым:
jinja
{{ bos_token }}
{% for message in messages %}
{% if message['role'] == 'user' %}
<|im_start|>user
{{ message['content'] }}<|im_end|>
{% elif message['role'] == 'assistant' %}
<|im_start|>assistant
{{ message['content'] }}<|im_end|>
{% elif message['role'] == 'system' %}
<|im_start|>system
{{ message['content'] }}<|im_end|>
{% endif %}
{% endfor %}
{% if add_generation_prompt %}
<|im_start|>assistant
{% endif %}
И запускайте модель с флагом --chat-template-file:
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--chat-template-file no-think.jinja \
-ngl 99 \
--temp 0.7 \
-n 2048 \
-p "Ваш запрос"
Творческий режим (генерация идей, написание текстов):
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--chat-template-file no-think.jinja \
-ngl 99 \
--temp 1.0 --top-p 1.0 --top-k 40 \
--repeat-penalty 1.1 \
-n 2048 \
-p "Ваш запрос"
Режим точных ответов (логика, код, факты):
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--chat-template-file no-think.jinja \
-ngl 99 \
--temp 0.6 --top-p 0.95 --top-k 20 \
-n 2048 \
-p "Ваш запрос"
2. Мультимодальный режим (llama.cpp)
bash
./llama.cpp/build/bin/llama-cli \
-m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
--mmproj ./models/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
--image your_image.png \
--chat-template-file no-think.jinja \
-ngl 99 \
--no-mmproj-offload \
-n 2048 \
-p "Опиши подробно, что изображено на этой картинке."
3. Использование с Ollama (только текст)
Текстовая совместимость с Ollama проверена. Создайте файл Modelfile:
dockerfile
FROM ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
"""
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER top_k 20
PARAMETER repeat_penalty 1.1
PARAMETER stop "<|im_start|>"
PARAMETER stop "<|im_end|>"
Импортируйте и запустите модель:
bash
ollama create qwen35-iq3xxs -f Modelfile
ollama run qwen35-iq3xxs "Ваш запрос"
Мультимодальность в Ollama не поддерживается (проверено на актуальной версии). Для работы с изображениями используйте llama.cpp.
⬇️ Быстрая загрузка всех файлов
Чтобы скачать модель, mmproj, шаблон и Modelfile одной командой:
bash
curl -L -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
-O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
-O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/no-think.jinja \
-O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Modelfile
⚠️ Ограничения и известные проблемы
Единственная тестовая система: все замеры на GTX 1080. На других GPU поведение может отличаться.
Длинный контекст: модель прошла тест «иголка в стоге сена», но на сложных технических текстах качество не гарантируется.
Мультимодальность в Ollama: не работает. Используйте llama.cpp.
Качество на чистом тексте: немного уступает Q3_K_L (WikiText-2), но на смешанных данных с кодом и логикой превосходит его.
❓ FAQ
Q: Почему выложен только IQ3_XXS, а не Q3_K_L?
A: Q3_K_L на гибридном домене показал худшее качество при большем размере.
Q: Где взять mmproj?
A: Файл включён в репозиторий. Также доступен в оригинальном репозитории.
Q: Будет ли модель работать на Windows?
A: Да, через llama.cpp или LM Studio. Команды адаптируются.
📄 Лицензия
Apache License 2.0 (соответствует оригинальной модели).
🙏 Благодарности
HauhauCS — за оригинальную модель.
Команда llama.cpp — за инструменты квантизации и инференса.
- Downloads last month
- 228
3-bit