Instructions to use chenyumo/moziAI-35B-A3B-MOE-MTP with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16 # Run inference directly in the terminal: llama cli -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16 # Run inference directly in the terminal: llama cli -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16 # Run inference directly in the terminal: ./llama-cli -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16 # Run inference directly in the terminal: ./build/bin/llama-cli -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Use Docker
docker model run hf.co/chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
- LM Studio
- Jan
- vLLM
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "chenyumo/moziAI-35B-A3B-MOE-MTP" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "chenyumo/moziAI-35B-A3B-MOE-MTP", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
- Ollama
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with Ollama:
ollama run hf.co/chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
- Unsloth Desktop
- Pi
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "chenyumo/moziAI-35B-A3B-MOE-MTP:BF16" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with Docker Model Runner:
docker model run hf.co/chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
- Lemonade
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Run and chat with the model
lemonade run user.moziAI-35B-A3B-MOE-MTP-BF16
List all available models
lemonade list
- Hermes Agent
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use chenyumo/moziAI-35B-A3B-MOE-MTP with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf chenyumo/moziAI-35B-A3B-MOE-MTP:BF16
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "chenyumo/moziAI-35B-A3B-MOE-MTP:BF16" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
language:
- ru
- en
license: other
tags:
- gguf
- MoE
- financial-llm
- MoziSmartBit
- qwen3.5
- qwen3.6
- ornith
- MoziAI
- tool-calling
- uncensored
- vision
- MTP
library_name: llama-cpp
pipeline_tag: text-generation
MoziAI-35B-V3.8 — Компактная и мощная мультимодальная ИИ-модель для бесплатного локального развертывания
English | 简体中文 | 繁體中文 | 日本語 | 한국어 | हिन्दी | Deutsch | Français | Nederlands | Italiano | Русский | Español | Português | العربية | Bahasa Indonesia | Türkçe | Tiếng Việt | Polski
Дата выпуска: 2026-09-01 · Версия: V3.8
📑 Содержание
- 1. Обзор модели
- 2. Ключевые особенности — Динамическое 7-мерное мышление / LOOP / MoziSmartBit / Финансовый фокус
- 3. Информация об обновлении
- 4. Основные возможности
- 5. Технические характеристики
- 6. Быстрый старт — Комплект из 3 файлов
- 7. Загрузка модели
- 8. Команды запуска
- 9. Рекомендуемые параметры инференса
- 10. Сравнение форматов квантования
- 11. Спекулятивное декодирование
- 12. Рекомендации по VRAM
- 13. Методы развертывания
- 14. Бенчмарки
- 15. Оптимизация Uncensored
- 16. Лицензия
- 17. Контакты
1. Обзор модели
MoziAI-35B-V3.8 — это локально развертываемая мультимодальная ИИ-модель с открытым исходным кодом, разработанная командой китайского финансового инфлюенсера Чэнь Юмо. На основе открытой базовой модели Ornith-1.5-35B-A3B (архитектура Qwen3.5-35B-A3B / Qwen3.6-35B-A3B, MoE 35B, лицензия MIT) она объединяет собственные финансовые данные + финансовые возможности + динамическую 7-мерную систему мышления + механизм итерации LOOP агента + характеристику Uncensored + гибридный алгоритм квантования MoziSmartBit.
💡 Преимущество размера: всего 15,9 ГБ — MoE-модель с 35 млрд параметров сжата с помощью собственной квантования MoziSmartBit до всего 15,9 ГБ (примерно на 30% меньше стандартного Q4_K_M ~22 ГБ). Помещается в один установочный пакет, работает на обычных потребительских GPU (от 20 ГБ VRAM), снижает облачные затраты до 0, обеспечивает свободу токенов 7×24 и гарантирует конфиденциальность локальных данных. Бесплатное коммерческое использование — нулевой порог.
2. Ключевые особенности
🧠 Динамическая 7-мерная система мышления
Собственный фреймворк инференса MoziAI. Для любой задачи модель сначала выводит маркер moziAI-Think, затем динамически разворачивает структурированное мышление в зависимости от сложности:
| Уровень | Сценарий | Типичные задачи | Разворачиваемые измерения |
|---|---|---|---|
| Уровень 0 | Простые Q&A | Объяснение термина, поиск фактов, перевод, резюме | ①Понимание ⑤Ресурсы (быстрый ответ 2D) |
| Уровень 1 | Анализ/диагностика | Маркетинговое исследование, тексты, анализ данных, отчеты, оценка стратегий | ①②③⑤⑥ Оценка 5D |
| Уровень 2 | Сложная разработка/стратегия | Код, архитектура, квант-стратегии, многошаговые workflow, системы | ①②③④⑤⑥⑦ Глубокий анализ 7D |
7 измерений: ①Понимание задачи ②Оценка сложности ③Зависимости ④Оценка рисков ⑤Ресурсы ⑥Критерии приемки ⑦Стратегия выполнения
🔄 Механизм итерации LOOP агента
Сложные задачи автоматически входят в режим moziAI-Loop: Раунд 1 выполнение+оценка → Раунд 2 корректировка+проверка. Выходные данные само-валидируются перед финальным ответом. Как опытный инженер — «разложить → оценить → выполнить → рефлексировать → оптимизировать» — заметно повышая точность. Простые Q&A пропускают Loop.
📦 Интеллектуальное квантование MoziSmartBit
Собственное многослойное интеллектуальное квантование сжимает модель MoE с 35 млрд параметров до примерно 15,5 ГБ — на 6,5 ГБ (30%) меньше стандартного Q4_K_M (22 ГБ) с **99%** точности FP16. Степень сжатия 4,5x.
💰 Финансовый фокус
Глубокая оптимизация для финансовых Q&A, квант-программирования и вызова инструментов. Финансы крайне не терпят галлюцинаций — MoziAI заметно превосходит универсальные модели того же размера.
🛡️ Характеристика Uncensored
Без ограничений контента, свободный вывод, полная информация, локальная приватность (см. Раздел 15).
🌐 Другие особенности
- Многоязычность: 201 язык и диалект, китайский оптимизирован
- Программирование: full-stack, Python/JS/TS/Go/Rust
- Написание текстов: отчеты, статьи, технические документы, креатив
- Зрение: мультимодальность, понимает скриншоты
- Мульти-фреймворк: llama.cpp / Ollama / LM Studio / Jan
- Мульти-агент: OpenClaw / Hermes / Cursor / Claude Code / Codex, нативные вызовы инструментов
3. Информация об обновлении
V3.8 переобучена на той же системе собственных наборов данных поколения, что и 27B-V3.8 (идентичность / динамическое 7D-мышление / итерация LOOP / финансы), с усилением динамического 7D-мышления + режима инференса LOOP: лучшее распознавание сложности, более высокие показатели выполнения, более сильная способность «сначала думать, потом действовать». Uncensored и финансовая оптимизация сохранены.
MoziAI поддерживает активный темп обновлений и делает локальные ИИ-модели легче и способнее.
4. Основные возможности
| Область | Описание |
|---|---|
| Анализ рынка | Макро/микроэкономика, акции A/HK/US, сырье, крипто |
| Финансы и отчеты | Показатели отчетности, резюме, оценка и прогнозы |
| Риск и комплаенс | Риск продукта, комплаенс советов, регулирование |
| Квант и стратегия | Квант-стратегии, Pyramid/PEL, бэктест, факторы, вызовы инструментов |
| Вызов инструментов | Рыночные данные в реальном времени, базы данных, поиск |
5. Технические характеристики
| Пункт | Характеристика |
|---|---|
| Базовая модель | Ornith-1.5-35B-A3B (Qwen3.5-35B-A3B / Qwen3.6-35B-A3B, MIT) |
| Параметры | 35B MoE, 256 роутинговых экспертов + 1 общий, 8 активных на токен |
| Квантование | MoziSmartBit + стандарт GGUF |
| Длина контекста | 256K (262 144 токена) |
| Размер | ~15,5 ГБ |
| Мин. VRAM | 20 ГБ+ развертывание (оффлоад CPU); 24 ГБ+ длинный контекст; 32 ГБ+ полный 256K + зрение |
| Фреймворки | llama.cpp / Ollama / LM Studio / Jan |
| Скорость | Спекулятивное декодирование: AMD R9700 140+ tok/s / AMD MAX+395 70+ tok/s |
| Разработчик | Команда Чэнь Юмо |
6. Быстрый старт 3 файла 100 оптимальный инференс
⚠️ Важно: для оптимального инференса нужно скачать 3 файла вместе — основную модель, проектор зрения, чат-шаблон. Если одного не хватает, соответствующая возможность теряется.
6.1 Скачать файлы модели
Скачайте эти 3 файла с HuggingFace / ModelScope в одну локальную папку (основная модель в корне репозитория, проектор зрения в mmproj/35B/, чат-шаблон в V3.8/):
moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf ← Основная модель (обязательно, 15,5 ГБ)
moziAI-35B-mmproj-BF16-V1.0.gguf ← Проектор зрения (обязательно, ~1 ГБ)
moziAI-V3.8-35B-chat-template.jinja ← Чат-шаблон (обязательно, 7D-мышление+LOOP)
6.2 Запуск и использование
llama-server \
-m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \
--mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \
--chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \
-c 131072 -ngl 99 \
--host 0.0.0.0 --port 8080
Откройте http://localhost:8080 в браузере. Полные параметры в Разделе 9.
7. Загрузка модели
| Платформа | Адрес |
|---|---|
| HuggingFace | chenyumo/moziAI-35B-A3B-MOE-MTP |
| ModelScope | chenyumo/moziAI-35B-A3B-MOE-MTP |
| GitHub | chenyumo166/moziAI-35B |
| Ollama | ollama pull chenyumo/moziAI-35B-A3B |
💡 Пользователи LM Studio: найдите
moziAIв LM Studio и скачайте в один клик.
8. Команды запуска
Минимальный запуск (3 файла)
llama-server \
-m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \
--mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \
--chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \
-c 131072 -ngl 99 \
--host 0.0.0.0 --port 8080
Полный рекомендуемый запуск
llama-server \
-m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \
--mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \
--chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \
-c 262144 -ngl 99 -t 28 \
--batch-size 2048 --ubatch-size 512 \
--flash-attn auto \
--cache-type-k q4_0 --cache-type-v q4_0 --kv-unified \
--poll 0 \
--reasoning on --reasoning-format deepseek-legacy \
--spec-default \
--host 0.0.0.0 --port 8080 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.024 \
--repeat-penalty 1.05 --presence-penalty 0
💡 При нехватке VRAM: уменьшите
-c(напр. 131072) или добавьте--fit on.
9. Рекомендуемые параметры инференса
Оптимизировано локальными тестами (AMD Radeon AI PRO R9700 32 ГБ):
| Параметр | Повседневные задачи/Тексты | Сложные задачи/Программирование | Описание |
|---|---|---|---|
| temperature | 0,6 | 0,8 | Повседневная стабильность; умеренное исследование для кода |
| top_p | 0,95 | 0,95 | Порог ядерной выборки |
| top_k | 20 | 20 | Усеченная выборка |
| min_p | 0,024 | 0,024 | Фильтр минимальной вероятности |
| repeat_penalty | 1,05 | 1,05 | Штраф за повторение |
| presence_penalty | 0 | 0 | Без штрафа присутствия |
| context_length | 131072 | 262144 | Повседневно 128K / Сложно 256K (по умолчанию llama.cpp 128K) |
| reasoning | on | on | Цепочка рассуждений (CoT) |
| reasoning_budget | 400 | 1000 | Бюджет рассуждений (выше для сложных задач) |
| reasoning_format | deepseek-legacy | deepseek-legacy | Рассуждения в отдельном поле |
| spec-type | default | default | Спекулятивное декодирование (ngram, оптим. MoE, Раздел 11) |
| Кэш KV | q4_0 | q4_0 | Квантованный кэш KV (kv-unified) |
💡 Режим мышления: активируется
--reasoning on.reasoning_budgetограничивает токены размышлений.
10. Сравнение форматов квантования
| Формат | Размер | Точность | Описание |
|---|---|---|---|
| FP16 оригинал | ~70 ГБ | 100% | Без потерь, нужен про-GPU |
| MoziSmartBit (эта модель) | ~15,5 ГБ | ~99% | Собственная разработка, лучшее точность/размер |
| Q4_K_M | ~22 ГБ | ~98% | Стандарт GGUF 4-bit |
| Q5_K_M | ~24,7 ГБ | ~99% | Выше |
| Q6_K | ~28,5 ГБ | ~99,5% | Почти без потерь |
| Q8_0 | ~36,9 ГБ | ~100% | Без потерь |
MoziSmartBit сохраняет ~99% и сжимает 35B MoE до 15,5 ГБ (4,5x), на ~30% меньше Q4_K_M.
11. Спекулятивное декодирование ключевая функция
Эта модель ускоряет инференс с помощью спекулятивного декодирования — в ~1,5-2 раза быстрее (локальные измерения).
- Оптимально для MoE: llama.cpp рекомендует ngram (
--spec-default) для MoE — самый быстрый и стабильный - О «MTP» в названии: происходит от весов Multi-Token Prediction базы (сохранены); поддержка MTP draft llama.cpp для MoE ограничена, поэтому MoziAI использует ngram
--spec-default
12. Рекомендации по VRAM
Измерено на версии MoziSmartBit (модель + зрение ~16,4 ГБ):
| VRAM | Рекомендация | Описание |
|---|---|---|
| 20 ГБ | 150K контекст, q4_0, зрение | ~19,5 ГБ использовано |
| 24 ГБ | Полный 256K, q4_0, идеальное зрение | Рекомендуется: ~20,4 ГБ, запас ~3,6 ГБ |
| 32 ГБ+ | Полный 256K, большой запас | R9700 32 ГБ: запас ~10 ГБ |
💡 Длиннее контекст = больше VRAM. При OOM уменьшайте
-cили используйте--fit on. Поддержка NVIDIA / AMD.
13. Методы развертывания
Ollama
cat > Modelfile << 'EOF'
FROM ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf
PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER top_k 20
PARAMETER num_ctx 131072
PARAMETER num_gpu 99
EOF
ollama create moziAI-35B -f Modelfile
ollama run moziAI-35B
LM Studio / Jan
Найдите moziAI в LM Studio / Jan и скачайте версию Q4_K_M (LM Studio по умолчанию читает корневые модели; для старых версий используйте «Добавить по URL»).
💡 Поддержка mmproj и chat_template в Ollama ограничена — предпочтите llama.cpp.
14. Бенчмарки
MoziAI-35B-V3.8 доработана/дистиллирована на основе deepreinforce-ai/Ornith-1.5-35B-A3B. Данные из измерений V3.7 (V3.8 = та же база и система обучения):
| Benchmark | moziAI-35B-V3.8 (эта модель) |
Ornith-1.0-35B-A3B | Qwen3.6-35B-A3B | Gemma-4-31B | Muse-Glimmer-30B | Qwen3.5-397B |
|---|---|---|---|---|---|---|
| Программирование | ||||||
| Terminal-Bench 2.1 (Terminus-2) | 67,8 | 64,2 | 52,5 | 42,1 | 51,7 | 53,5 |
| Terminal-Bench 2.1 (Claude Code) | 68,5 | 62,8 | 49,2 | - | - | 48,6 |
| SWE-bench Verified | 79 | 75,6 | 73,4 | 52 | 76 | 76,4 |
| SWE-bench Pro | 59,6 | 50,4 | 49,5 | 35,7 | 51,2 | 51,6 |
| SWE-bench Multilingual | 71,4 | 69,3 | 67,2 | 51,7 | - | 69,3 |
| DeepSWE | 22 | 0 | 0 | - | - | 1 |
| Frontier-Bench v0.1 | 5,1 | 1,4 | 1,4 | - | - | 1,4 |
| NL2Repo | 46,2 | 34,6 | 29,4 | 15,5 | - | 36,8 |
| SWE Atlas - QnA | 39,8 | 37,1 | 15,5 | - | - | 20,4 |
| Рассуждения | ||||||
| HLE (no tools) | 25,6 | 20,8 | 21,4 | 19,5 | 22 | 28,7 |
| HLE (with tools) | 33,4 | 30,1 | 28,9 | 26,5 | - | 48,3 |
| GPQA Diamond | 89,2 | 86,2 | 86 | 84,3 | 83,5 | 88,4 |
| Агентность | ||||||
| MCP-Atlas | 70,2 | 64,4 | 62,8 | 55 | 75,5 | 72,3 |
| Toolathlon-Verified | 48,7 | 42,4 | 41,7 | 40,8 | - | 38,3 |
| WideSearch | 67,8 | 63,4 | 60,1 | 54,2 | - | 74 |
| BrowseComp | 67,6 | 63,5 | 62 | - | - | 78,6 |
| ClawEval | 72,5 | 69,8 | 68,7 | 48,5 | - | 70,7 |
В финансовом секторе (отчетность, квант, риск, агентные инструменты) заметно лучше универсальных моделей. Данные Gemma-4 / Qwen3.6 — официальные результаты.
15. Оптимизация Uncensored
Эта модель наследует Uncensored от Ornith-1.5-35B-A3B:
| Преимущество | Описание |
|---|---|
| Без ограничений | Не отказывает ни в какой теме, включая чувствительные |
| Свободный вывод | Не ограничен политиками безопасности |
| Полная информация | Без фильтрации, идеально для исследований |
| Локальная приватность | Данные полностью приватны |
Примечание: локальная модель — вывод контролируется пользователем; модель не несет ответственности за модерацию.
16. Лицензия
Пользовательская ограничительная лицензия:
- ✅ Разрешено — бесплатное коммерческое использование, копирование, распространение
- ❌ Запрещено — вторичная разработка, перепродажа, сублицензирование
- 📋 Требуется — сохранять копирайт, источник: moziAI-35B
Модель предоставляется «как есть», без гарантий. Вывод не является инвестиционной рекомендацией.
17. Контакты
- HuggingFace: @chenyumo · GitHub: @chenyumo166
- Weibo: @rimochen · E-mail: 263515@qq.com
Copyright (c) 2026 陳雨墨 / chenyumo166. Все права защищены.