--- language: - ru - en license: other tags: - gguf - MoE - financial-llm - MoziSmartBit - qwen3.5 - qwen3.6 - ornith - MoziAI - tool-calling - uncensored - vision - MTP library_name: llama-cpp pipeline_tag: text-generation --- # MoziAI-35B-V3.8 — Компактная и мощная мультимодальная ИИ-модель для бесплатного локального развертывания [English](README.en.md) | [简体中文](README.zh.md) | [繁體中文](README.zh-hant.md) | [日本語](README.ja.md) | [한국어](README.ko.md) | [हिन्दी](README.hi.md) | [Deutsch](README.de.md) | [Français](README.fr.md) | [Nederlands](README.nl.md) | [Italiano](README.it.md) | Русский | [Español](README.es.md) | [Português](README.pt.md) | [العربية](README.ar.md) | [Bahasa Indonesia](README.id.md) | [Türkçe](README.tr.md) | [Tiếng Việt](README.vi.md) | [Polski](README.pl.md) **Дата выпуска: 2026-09-01** · **Версия: V3.8** --- ## 📑 Содержание - [1. Обзор модели](#1-обзор-модели) - [2. Ключевые особенности](#2-ключевые-особенности) — Динамическое 7-мерное мышление / LOOP / MoziSmartBit / Финансовый фокус - [3. Информация об обновлении](#3-информация-об-обновлении) - [4. Основные возможности](#4-основные-возможности) - [5. Технические характеристики](#5-технические-характеристики) - [6. Быстрый старт](#6-быстрый-старт-3-файла-100-оптимальный-инференс) — **Комплект из 3 файлов** - [7. Загрузка модели](#7-загрузка-модели) - [8. Команды запуска](#8-команды-запуска) - [9. Рекомендуемые параметры инференса](#9-рекомендуемые-параметры-инференса) - [10. Сравнение форматов квантования](#10-сравнение-форматов-квантования) - [11. Спекулятивное декодирование](#11-спекулятивное-декодирование-ключевая-функция) - [12. Рекомендации по VRAM](#12-рекомендации-по-vram) - [13. Методы развертывания](#13-методы-развертывания) - [14. Бенчмарки](#14-бенчмарки) - [15. Оптимизация Uncensored](#15-оптимизация-uncensored) - [16. Лицензия](#16-лицензия) - [17. Контакты](#17-контакты) --- ## 1. Обзор модели MoziAI-35B-V3.8 — это локально развертываемая мультимодальная ИИ-модель с открытым исходным кодом, разработанная командой китайского финансового инфлюенсера Чэнь Юмо. На основе открытой базовой модели **Ornith-1.5-35B-A3B** (архитектура Qwen3.5-35B-A3B / Qwen3.6-35B-A3B, MoE 35B, лицензия MIT) она объединяет собственные финансовые данные + финансовые возможности + динамическую 7-мерную систему мышления + механизм итерации LOOP агента + характеристику Uncensored + гибридный алгоритм квантования MoziSmartBit. **💡 Преимущество размера: всего 15,9 ГБ** — MoE-модель с 35 млрд параметров сжата с помощью собственной квантования MoziSmartBit до всего **15,9 ГБ** (примерно на 30% меньше стандартного Q4_K_M ~22 ГБ). Помещается в один установочный пакет, работает на обычных потребительских GPU (от 20 ГБ VRAM), снижает облачные затраты до **0**, обеспечивает свободу токенов 7×24 и гарантирует конфиденциальность локальных данных. **Бесплатное коммерческое использование** — нулевой порог. --- ## 2. Ключевые особенности ### 🧠 Динамическая 7-мерная система мышления Собственный фреймворк инференса MoziAI. Для любой задачи модель сначала выводит маркер **moziAI-Think**, затем динамически разворачивает структурированное мышление в зависимости от сложности: | Уровень | Сценарий | Типичные задачи | Разворачиваемые измерения | | --- | --- | --- | --- | | **Уровень 0** | Простые Q&A | Объяснение термина, поиск фактов, перевод, резюме | ①Понимание ⑤Ресурсы (быстрый ответ 2D) | | **Уровень 1** | Анализ/диагностика | Маркетинговое исследование, тексты, анализ данных, отчеты, оценка стратегий | ①②③⑤⑥ Оценка 5D | | **Уровень 2** | Сложная разработка/стратегия | Код, архитектура, квант-стратегии, многошаговые workflow, системы | ①②③④⑤⑥⑦ Глубокий анализ 7D | > 7 измерений: ①Понимание задачи ②Оценка сложности ③Зависимости ④Оценка рисков ⑤Ресурсы ⑥Критерии приемки ⑦Стратегия выполнения ### 🔄 Механизм итерации LOOP агента Сложные задачи автоматически входят в режим **moziAI-Loop**: **Раунд 1 выполнение+оценка → Раунд 2 корректировка+проверка**. Выходные данные само-валидируются перед финальным ответом. Как опытный инженер — «разложить → оценить → выполнить → рефлексировать → оптимизировать» — заметно повышая точность. Простые Q&A пропускают Loop. ### 📦 Интеллектуальное квантование MoziSmartBit Собственное многослойное интеллектуальное квантование сжимает модель MoE с 35 млрд параметров до примерно **15,5 ГБ** — на ~6,5 ГБ (~30%) меньше стандартного Q4_K_M (~22 ГБ) с **~99%** точности FP16. Степень сжатия **4,5x**. ### 💰 Финансовый фокус Глубокая оптимизация для финансовых Q&A, квант-программирования и вызова инструментов. Финансы крайне не терпят галлюцинаций — MoziAI заметно превосходит универсальные модели того же размера. ### 🛡️ Характеристика Uncensored Без ограничений контента, свободный вывод, полная информация, локальная приватность (см. [Раздел 15](#15-оптимизация-uncensored)). ### 🌐 Другие особенности - **Многоязычность**: 201 язык и диалект, китайский оптимизирован - **Программирование**: full-stack, Python/JS/TS/Go/Rust - **Написание текстов**: отчеты, статьи, технические документы, креатив - **Зрение**: мультимодальность, понимает скриншоты - **Мульти-фреймворк**: llama.cpp / Ollama / LM Studio / Jan - **Мульти-агент**: OpenClaw / Hermes / Cursor / Claude Code / Codex, нативные вызовы инструментов --- ## 3. Информация об обновлении V3.8 переобучена на той же системе собственных наборов данных поколения, что и 27B-V3.8 (идентичность / динамическое 7D-мышление / итерация LOOP / финансы), с усилением динамического 7D-мышления + режима инференса LOOP: лучшее распознавание сложности, более высокие показатели выполнения, более сильная способность «сначала думать, потом действовать». Uncensored и финансовая оптимизация сохранены. MoziAI поддерживает активный темп обновлений и делает локальные ИИ-модели легче и способнее. --- ## 4. Основные возможности | Область | Описание | | --- | --- | | Анализ рынка | Макро/микроэкономика, акции A/HK/US, сырье, крипто | | Финансы и отчеты | Показатели отчетности, резюме, оценка и прогнозы | | Риск и комплаенс | Риск продукта, комплаенс советов, регулирование | | Квант и стратегия | Квант-стратегии, Pyramid/PEL, бэктест, факторы, вызовы инструментов | | Вызов инструментов | Рыночные данные в реальном времени, базы данных, поиск | --- ## 5. Технические характеристики | Пункт | Характеристика | | --- | --- | | Базовая модель | Ornith-1.5-35B-A3B (Qwen3.5-35B-A3B / Qwen3.6-35B-A3B, MIT) | | Параметры | 35B MoE, 256 роутинговых экспертов + 1 общий, 8 активных на токен | | Квантование | MoziSmartBit + стандарт GGUF | | Длина контекста | 256K (262 144 токена) | | Размер | ~15,5 ГБ | | Мин. VRAM | **20 ГБ+** развертывание (оффлоад CPU); **24 ГБ+** длинный контекст; **32 ГБ+** полный 256K + зрение | | Фреймворки | llama.cpp / Ollama / LM Studio / Jan | | Скорость | Спекулятивное декодирование: AMD R9700 **140+ tok/s** / AMD MAX+395 **70+ tok/s** | | Разработчик | Команда Чэнь Юмо | --- ## 6. Быстрый старт 3 файла 100 оптимальный инференс > ⚠️ **Важно**: для оптимального инференса нужно **скачать 3 файла вместе** — основную модель, проектор зрения, чат-шаблон. Если одного не хватает, соответствующая возможность теряется. ### 6.1 Скачать файлы модели Скачайте эти **3 файла** с HuggingFace / ModelScope в одну локальную папку (основная модель в **корне репозитория**, проектор зрения в `mmproj/35B/`, чат-шаблон в `V3.8/`): ``` moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf ← Основная модель (обязательно, 15,5 ГБ) moziAI-35B-mmproj-BF16-V1.0.gguf ← Проектор зрения (обязательно, ~1 ГБ) moziAI-V3.8-35B-chat-template.jinja ← Чат-шаблон (обязательно, 7D-мышление+LOOP) ``` ### 6.2 Запуск и использование ```bash llama-server \ -m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \ --mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \ --chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \ -c 131072 -ngl 99 \ --host 0.0.0.0 --port 8080 ``` Откройте `http://localhost:8080` в браузере. Полные параметры в Разделе 9. --- ## 7. Загрузка модели | Платформа | Адрес | | --- | --- | | HuggingFace | [chenyumo/moziAI-35B-A3B-MOE-MTP](https://huggingface.co/chenyumo/moziAI-35B-A3B-MOE-MTP) | | ModelScope | [chenyumo/moziAI-35B-A3B-MOE-MTP](https://modelscope.cn/models/chenyumo/moziAI-35B-A3B-MOE-MTP) | | GitHub | [chenyumo166/moziAI-35B](https://github.com/chenyumo166/moziAI-35B-A3B-MOE-MTP) | | Ollama | `ollama pull chenyumo/moziAI-35B-A3B` | > 💡 **Пользователи LM Studio**: найдите `moziAI` в [LM Studio](https://lmstudio.ai) и скачайте в один клик. --- ## 8. Команды запуска ### Минимальный запуск (3 файла) ```bash llama-server \ -m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \ --mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \ --chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \ -c 131072 -ngl 99 \ --host 0.0.0.0 --port 8080 ``` ### Полный рекомендуемый запуск ```bash llama-server \ -m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \ --mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \ --chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \ -c 262144 -ngl 99 -t 28 \ --batch-size 2048 --ubatch-size 512 \ --flash-attn auto \ --cache-type-k q4_0 --cache-type-v q4_0 --kv-unified \ --poll 0 \ --reasoning on --reasoning-format deepseek-legacy \ --spec-default \ --host 0.0.0.0 --port 8080 \ --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.024 \ --repeat-penalty 1.05 --presence-penalty 0 ``` > 💡 При нехватке VRAM: уменьшите `-c` (напр. 131072) или добавьте `--fit on`. --- ## 9. Рекомендуемые параметры инференса Оптимизировано локальными тестами (AMD Radeon AI PRO R9700 32 ГБ): | Параметр | Повседневные задачи/Тексты | Сложные задачи/Программирование | Описание | | --- | --- | --- | --- | | temperature | 0,6 | 0,8 | Повседневная стабильность; умеренное исследование для кода | | top\_p | 0,95 | 0,95 | Порог ядерной выборки | | top\_k | 20 | 20 | Усеченная выборка | | min\_p | 0,024 | 0,024 | Фильтр минимальной вероятности | | repeat\_penalty | 1,05 | 1,05 | Штраф за повторение | | presence\_penalty | 0 | 0 | Без штрафа присутствия | | context\_length | 131072 | 262144 | Повседневно 128K / Сложно 256K (по умолчанию llama.cpp 128K) | | reasoning | on | on | Цепочка рассуждений (CoT) | | reasoning\_budget | 400 | 1000 | Бюджет рассуждений (выше для сложных задач) | | reasoning\_format | deepseek-legacy | deepseek-legacy | Рассуждения в отдельном поле | | **spec-type** | **default** | **default** | **Спекулятивное декодирование (ngram, оптим. MoE, Раздел 11)** | | Кэш KV | q4\_0 | q4\_0 | Квантованный кэш KV (kv-unified) | > 💡 **Режим мышления**: активируется `--reasoning on`. `reasoning_budget` ограничивает токены размышлений. --- ## 10. Сравнение форматов квантования | Формат | Размер | Точность | Описание | | --- | --- | --- | --- | | FP16 оригинал | ~70 ГБ | 100% | Без потерь, нужен про-GPU | | **MoziSmartBit (эта модель)** | **~15,5 ГБ** | **~99%** | **Собственная разработка, лучшее точность/размер** | | Q4_K_M | ~22 ГБ | ~98% | Стандарт GGUF 4-bit | | Q5_K_M | ~24,7 ГБ | ~99% | Выше | | Q6_K | ~28,5 ГБ | ~99,5% | Почти без потерь | | Q8_0 | ~36,9 ГБ | ~100% | Без потерь | > MoziSmartBit сохраняет ~99% и сжимает 35B MoE до 15,5 ГБ (4,5x), на ~30% меньше Q4_K_M. --- ## 11. Спекулятивное декодирование ключевая функция Эта модель ускоряет инференс с помощью **спекулятивного декодирования** — в **~1,5-2 раза** быстрее (локальные измерения). - **Оптимально для MoE**: llama.cpp рекомендует **ngram** (`--spec-default`) для MoE — самый быстрый и стабильный - **О «MTP» в названии**: происходит от весов Multi-Token Prediction базы (сохранены); поддержка MTP draft llama.cpp для MoE ограничена, поэтому MoziAI использует ngram ```bash --spec-default ``` --- ## 12. Рекомендации по VRAM Измерено на версии MoziSmartBit (модель + зрение ~16,4 ГБ): | VRAM | Рекомендация | Описание | | --- | --- | --- | | 20 ГБ | 150K контекст, q4\_0, зрение | ~19,5 ГБ использовано | | **24 ГБ** | **Полный 256K, q4\_0, идеальное зрение** | **Рекомендуется**: ~20,4 ГБ, запас ~3,6 ГБ | | 32 ГБ+ | Полный 256K, большой запас | R9700 32 ГБ: запас ~10 ГБ | > 💡 Длиннее контекст = больше VRAM. При OOM уменьшайте `-c` или используйте `--fit on`. Поддержка NVIDIA / AMD. --- ## 13. Методы развертывания ### Ollama ```bash cat > Modelfile << 'EOF' FROM ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf PARAMETER temperature 0.6 PARAMETER top_p 0.95 PARAMETER top_k 20 PARAMETER num_ctx 131072 PARAMETER num_gpu 99 EOF ollama create moziAI-35B -f Modelfile ollama run moziAI-35B ``` ### LM Studio / Jan Найдите `moziAI` в LM Studio / Jan и скачайте версию Q4\_K\_M (LM Studio по умолчанию читает корневые модели; для старых версий используйте «Добавить по URL»). > 💡 Поддержка mmproj и chat\_template в Ollama ограничена — предпочтите llama.cpp. --- ## 14. Бенчмарки MoziAI-35B-V3.8 доработана/дистиллирована на основе deepreinforce-ai/Ornith-1.5-35B-A3B. Данные из измерений V3.7 (V3.8 = та же база и система обучения): | Benchmark | moziAI-35B-V3.8
(эта модель) | Ornith-1.0-35B-A3B | Qwen3.6-35B-A3B | Gemma-4-31B | Muse-Glimmer-30B | Qwen3.5-397B | |---|---|---|---|---|---|---| | **Программирование** | | | | | | | | Terminal-Bench 2.1 (Terminus-2) | 67,8 | 64,2 | 52,5 | 42,1 | 51,7 | 53,5 | | Terminal-Bench 2.1 (Claude Code) | 68,5 | 62,8 | 49,2 | - | - | 48,6 | | SWE-bench Verified | 79 | 75,6 | 73,4 | 52 | 76 | 76,4 | | SWE-bench Pro | 59,6 | 50,4 | 49,5 | 35,7 | 51,2 | 51,6 | | SWE-bench Multilingual | 71,4 | 69,3 | 67,2 | 51,7 | - | 69,3 | | DeepSWE | 22 | 0 | 0 | - | - | 1 | | Frontier-Bench v0.1 | 5,1 | 1,4 | 1,4 | - | - | 1,4 | | NL2Repo | 46,2 | 34,6 | 29,4 | 15,5 | - | 36,8 | | SWE Atlas - QnA | 39,8 | 37,1 | 15,5 | - | - | 20,4 | | **Рассуждения** | | | | | | | | HLE (no tools) | 25,6 | 20,8 | 21,4 | 19,5 | 22 | 28,7 | | HLE (with tools) | 33,4 | 30,1 | 28,9 | 26,5 | - | 48,3 | | GPQA Diamond | 89,2 | 86,2 | 86 | 84,3 | 83,5 | 88,4 | | **Агентность** | | | | | | | | MCP-Atlas | 70,2 | 64,4 | 62,8 | 55 | 75,5 | 72,3 | | Toolathlon-Verified | 48,7 | 42,4 | 41,7 | 40,8 | - | 38,3 | | WideSearch | 67,8 | 63,4 | 60,1 | 54,2 | - | 74 | | BrowseComp | 67,6 | 63,5 | 62 | - | - | 78,6 | | ClawEval | 72,5 | 69,8 | 68,7 | 48,5 | - | 70,7 | > В финансовом секторе (отчетность, квант, риск, агентные инструменты) заметно лучше универсальных моделей. Данные Gemma-4 / Qwen3.6 — официальные результаты. --- ## 15. Оптимизация Uncensored Эта модель наследует Uncensored от Ornith-1.5-35B-A3B: | Преимущество | Описание | | --- | --- | | Без ограничений | Не отказывает ни в какой теме, включая чувствительные | | Свободный вывод | Не ограничен политиками безопасности | | Полная информация | Без фильтрации, идеально для исследований | | Локальная приватность | Данные полностью приватны | **Примечание**: локальная модель — вывод контролируется пользователем; модель не несет ответственности за модерацию. --- ## 16. Лицензия **Пользовательская ограничительная лицензия**: - ✅ **Разрешено** — бесплатное коммерческое использование, копирование, распространение - ❌ **Запрещено** — вторичная разработка, перепродажа, сублицензирование - 📋 **Требуется** — сохранять копирайт, источник: moziAI-35B Модель предоставляется «как есть», без гарантий. Вывод не является инвестиционной рекомендацией. --- ## 17. Контакты - **HuggingFace**: [@chenyumo](https://huggingface.co/chenyumo) · **GitHub**: [@chenyumo166](https://github.com/chenyumo166) - **Weibo**: [@rimochen](https://weibo.com/rimochen) · **E-mail**: 263515@qq.com Copyright (c) 2026 陳雨墨 / chenyumo166. Все права защищены.