moziAI-35B-A3B-MOE-MTP / V3.8 /README.ru.md
chenyumo's picture
Upload V3.8/README.ru.md with huggingface_hub
f8c7a9c verified
|
Raw
History Blame Contribute Delete
23.3 kB
metadata
language:
  - ru
  - en
license: other
tags:
  - gguf
  - MoE
  - financial-llm
  - MoziSmartBit
  - qwen3.5
  - qwen3.6
  - ornith
  - MoziAI
  - tool-calling
  - uncensored
  - vision
  - MTP
library_name: llama-cpp
pipeline_tag: text-generation

MoziAI-35B-V3.8 — Компактная и мощная мультимодальная ИИ-модель для бесплатного локального развертывания

English | 简体中文 | 繁體中文 | 日本語 | 한국어 | हिन्दी | Deutsch | Français | Nederlands | Italiano | Русский | Español | Português | العربية | Bahasa Indonesia | Türkçe | Tiếng Việt | Polski

Дата выпуска: 2026-09-01 · Версия: V3.8


📑 Содержание


1. Обзор модели

MoziAI-35B-V3.8 — это локально развертываемая мультимодальная ИИ-модель с открытым исходным кодом, разработанная командой китайского финансового инфлюенсера Чэнь Юмо. На основе открытой базовой модели Ornith-1.5-35B-A3B (архитектура Qwen3.5-35B-A3B / Qwen3.6-35B-A3B, MoE 35B, лицензия MIT) она объединяет собственные финансовые данные + финансовые возможности + динамическую 7-мерную систему мышления + механизм итерации LOOP агента + характеристику Uncensored + гибридный алгоритм квантования MoziSmartBit.

💡 Преимущество размера: всего 15,9 ГБ — MoE-модель с 35 млрд параметров сжата с помощью собственной квантования MoziSmartBit до всего 15,9 ГБ (примерно на 30% меньше стандартного Q4_K_M ~22 ГБ). Помещается в один установочный пакет, работает на обычных потребительских GPU (от 20 ГБ VRAM), снижает облачные затраты до 0, обеспечивает свободу токенов 7×24 и гарантирует конфиденциальность локальных данных. Бесплатное коммерческое использование — нулевой порог.


2. Ключевые особенности

🧠 Динамическая 7-мерная система мышления

Собственный фреймворк инференса MoziAI. Для любой задачи модель сначала выводит маркер moziAI-Think, затем динамически разворачивает структурированное мышление в зависимости от сложности:

Уровень Сценарий Типичные задачи Разворачиваемые измерения
Уровень 0 Простые Q&A Объяснение термина, поиск фактов, перевод, резюме ①Понимание ⑤Ресурсы (быстрый ответ 2D)
Уровень 1 Анализ/диагностика Маркетинговое исследование, тексты, анализ данных, отчеты, оценка стратегий ①②③⑤⑥ Оценка 5D
Уровень 2 Сложная разработка/стратегия Код, архитектура, квант-стратегии, многошаговые workflow, системы ①②③④⑤⑥⑦ Глубокий анализ 7D

7 измерений: ①Понимание задачи ②Оценка сложности ③Зависимости ④Оценка рисков ⑤Ресурсы ⑥Критерии приемки ⑦Стратегия выполнения

🔄 Механизм итерации LOOP агента

Сложные задачи автоматически входят в режим moziAI-Loop: Раунд 1 выполнение+оценка → Раунд 2 корректировка+проверка. Выходные данные само-валидируются перед финальным ответом. Как опытный инженер — «разложить → оценить → выполнить → рефлексировать → оптимизировать» — заметно повышая точность. Простые Q&A пропускают Loop.

📦 Интеллектуальное квантование MoziSmartBit

Собственное многослойное интеллектуальное квантование сжимает модель MoE с 35 млрд параметров до примерно 15,5 ГБ — на 6,5 ГБ (30%) меньше стандартного Q4_K_M (22 ГБ) с **99%** точности FP16. Степень сжатия 4,5x.

💰 Финансовый фокус

Глубокая оптимизация для финансовых Q&A, квант-программирования и вызова инструментов. Финансы крайне не терпят галлюцинаций — MoziAI заметно превосходит универсальные модели того же размера.

🛡️ Характеристика Uncensored

Без ограничений контента, свободный вывод, полная информация, локальная приватность (см. Раздел 15).

🌐 Другие особенности

  • Многоязычность: 201 язык и диалект, китайский оптимизирован
  • Программирование: full-stack, Python/JS/TS/Go/Rust
  • Написание текстов: отчеты, статьи, технические документы, креатив
  • Зрение: мультимодальность, понимает скриншоты
  • Мульти-фреймворк: llama.cpp / Ollama / LM Studio / Jan
  • Мульти-агент: OpenClaw / Hermes / Cursor / Claude Code / Codex, нативные вызовы инструментов

3. Информация об обновлении

V3.8 переобучена на той же системе собственных наборов данных поколения, что и 27B-V3.8 (идентичность / динамическое 7D-мышление / итерация LOOP / финансы), с усилением динамического 7D-мышления + режима инференса LOOP: лучшее распознавание сложности, более высокие показатели выполнения, более сильная способность «сначала думать, потом действовать». Uncensored и финансовая оптимизация сохранены.

MoziAI поддерживает активный темп обновлений и делает локальные ИИ-модели легче и способнее.


4. Основные возможности

Область Описание
Анализ рынка Макро/микроэкономика, акции A/HK/US, сырье, крипто
Финансы и отчеты Показатели отчетности, резюме, оценка и прогнозы
Риск и комплаенс Риск продукта, комплаенс советов, регулирование
Квант и стратегия Квант-стратегии, Pyramid/PEL, бэктест, факторы, вызовы инструментов
Вызов инструментов Рыночные данные в реальном времени, базы данных, поиск

5. Технические характеристики

Пункт Характеристика
Базовая модель Ornith-1.5-35B-A3B (Qwen3.5-35B-A3B / Qwen3.6-35B-A3B, MIT)
Параметры 35B MoE, 256 роутинговых экспертов + 1 общий, 8 активных на токен
Квантование MoziSmartBit + стандарт GGUF
Длина контекста 256K (262 144 токена)
Размер ~15,5 ГБ
Мин. VRAM 20 ГБ+ развертывание (оффлоад CPU); 24 ГБ+ длинный контекст; 32 ГБ+ полный 256K + зрение
Фреймворки llama.cpp / Ollama / LM Studio / Jan
Скорость Спекулятивное декодирование: AMD R9700 140+ tok/s / AMD MAX+395 70+ tok/s
Разработчик Команда Чэнь Юмо

6. Быстрый старт 3 файла 100 оптимальный инференс

⚠️ Важно: для оптимального инференса нужно скачать 3 файла вместе — основную модель, проектор зрения, чат-шаблон. Если одного не хватает, соответствующая возможность теряется.

6.1 Скачать файлы модели

Скачайте эти 3 файла с HuggingFace / ModelScope в одну локальную папку (основная модель в корне репозитория, проектор зрения в mmproj/35B/, чат-шаблон в V3.8/):

moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf  ← Основная модель (обязательно, 15,5 ГБ)
moziAI-35B-mmproj-BF16-V1.0.gguf                        ← Проектор зрения (обязательно, ~1 ГБ)
moziAI-V3.8-35B-chat-template.jinja                                        ← Чат-шаблон (обязательно, 7D-мышление+LOOP)

6.2 Запуск и использование

llama-server \
  -m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \
  --mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \
  --chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \
  -c 131072 -ngl 99 \
  --host 0.0.0.0 --port 8080

Откройте http://localhost:8080 в браузере. Полные параметры в Разделе 9.


7. Загрузка модели

Платформа Адрес
HuggingFace chenyumo/moziAI-35B-A3B-MOE-MTP
ModelScope chenyumo/moziAI-35B-A3B-MOE-MTP
GitHub chenyumo166/moziAI-35B
Ollama ollama pull chenyumo/moziAI-35B-A3B

💡 Пользователи LM Studio: найдите moziAI в LM Studio и скачайте в один клик.


8. Команды запуска

Минимальный запуск (3 файла)

llama-server \
  -m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \
  --mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \
  --chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \
  -c 131072 -ngl 99 \
  --host 0.0.0.0 --port 8080

Полный рекомендуемый запуск

llama-server \
  -m ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf \
  --mmproj mmproj/35B/moziAI-35B-mmproj-BF16-V1.0.gguf \
  --chat-template-file V3.8/moziAI-V3.8-35B-chat-template.jinja \
  -c 262144 -ngl 99 -t 28 \
  --batch-size 2048 --ubatch-size 512 \
  --flash-attn auto \
  --cache-type-k q4_0 --cache-type-v q4_0 --kv-unified \
  --poll 0 \
  --reasoning on --reasoning-format deepseek-legacy \
  --spec-default \
  --host 0.0.0.0 --port 8080 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.024 \
  --repeat-penalty 1.05 --presence-penalty 0

💡 При нехватке VRAM: уменьшите -c (напр. 131072) или добавьте --fit on.


9. Рекомендуемые параметры инференса

Оптимизировано локальными тестами (AMD Radeon AI PRO R9700 32 ГБ):

Параметр Повседневные задачи/Тексты Сложные задачи/Программирование Описание
temperature 0,6 0,8 Повседневная стабильность; умеренное исследование для кода
top_p 0,95 0,95 Порог ядерной выборки
top_k 20 20 Усеченная выборка
min_p 0,024 0,024 Фильтр минимальной вероятности
repeat_penalty 1,05 1,05 Штраф за повторение
presence_penalty 0 0 Без штрафа присутствия
context_length 131072 262144 Повседневно 128K / Сложно 256K (по умолчанию llama.cpp 128K)
reasoning on on Цепочка рассуждений (CoT)
reasoning_budget 400 1000 Бюджет рассуждений (выше для сложных задач)
reasoning_format deepseek-legacy deepseek-legacy Рассуждения в отдельном поле
spec-type default default Спекулятивное декодирование (ngram, оптим. MoE, Раздел 11)
Кэш KV q4_0 q4_0 Квантованный кэш KV (kv-unified)

💡 Режим мышления: активируется --reasoning on. reasoning_budget ограничивает токены размышлений.


10. Сравнение форматов квантования

Формат Размер Точность Описание
FP16 оригинал ~70 ГБ 100% Без потерь, нужен про-GPU
MoziSmartBit (эта модель) ~15,5 ГБ ~99% Собственная разработка, лучшее точность/размер
Q4_K_M ~22 ГБ ~98% Стандарт GGUF 4-bit
Q5_K_M ~24,7 ГБ ~99% Выше
Q6_K ~28,5 ГБ ~99,5% Почти без потерь
Q8_0 ~36,9 ГБ ~100% Без потерь

MoziSmartBit сохраняет ~99% и сжимает 35B MoE до 15,5 ГБ (4,5x), на ~30% меньше Q4_K_M.


11. Спекулятивное декодирование ключевая функция

Эта модель ускоряет инференс с помощью спекулятивного декодирования — в ~1,5-2 раза быстрее (локальные измерения).

  • Оптимально для MoE: llama.cpp рекомендует ngram (--spec-default) для MoE — самый быстрый и стабильный
  • О «MTP» в названии: происходит от весов Multi-Token Prediction базы (сохранены); поддержка MTP draft llama.cpp для MoE ограничена, поэтому MoziAI использует ngram
--spec-default

12. Рекомендации по VRAM

Измерено на версии MoziSmartBit (модель + зрение ~16,4 ГБ):

VRAM Рекомендация Описание
20 ГБ 150K контекст, q4_0, зрение ~19,5 ГБ использовано
24 ГБ Полный 256K, q4_0, идеальное зрение Рекомендуется: ~20,4 ГБ, запас ~3,6 ГБ
32 ГБ+ Полный 256K, большой запас R9700 32 ГБ: запас ~10 ГБ

💡 Длиннее контекст = больше VRAM. При OOM уменьшайте -c или используйте --fit on. Поддержка NVIDIA / AMD.


13. Методы развертывания

Ollama

cat > Modelfile << 'EOF'
FROM ./moziAI-35B-V3.8-MOE-MTP-Q4_K_M-Uncensored-Qwen3.6-35B-A3B-Ornith-1.5.gguf
PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER top_k 20
PARAMETER num_ctx 131072
PARAMETER num_gpu 99
EOF

ollama create moziAI-35B -f Modelfile
ollama run moziAI-35B

LM Studio / Jan

Найдите moziAI в LM Studio / Jan и скачайте версию Q4_K_M (LM Studio по умолчанию читает корневые модели; для старых версий используйте «Добавить по URL»).

💡 Поддержка mmproj и chat_template в Ollama ограничена — предпочтите llama.cpp.


14. Бенчмарки

MoziAI-35B-V3.8 доработана/дистиллирована на основе deepreinforce-ai/Ornith-1.5-35B-A3B. Данные из измерений V3.7 (V3.8 = та же база и система обучения):

Benchmark moziAI-35B-V3.8
(эта модель)
Ornith-1.0-35B-A3B Qwen3.6-35B-A3B Gemma-4-31B Muse-Glimmer-30B Qwen3.5-397B
Программирование
Terminal-Bench 2.1 (Terminus-2) 67,8 64,2 52,5 42,1 51,7 53,5
Terminal-Bench 2.1 (Claude Code) 68,5 62,8 49,2 - - 48,6
SWE-bench Verified 79 75,6 73,4 52 76 76,4
SWE-bench Pro 59,6 50,4 49,5 35,7 51,2 51,6
SWE-bench Multilingual 71,4 69,3 67,2 51,7 - 69,3
DeepSWE 22 0 0 - - 1
Frontier-Bench v0.1 5,1 1,4 1,4 - - 1,4
NL2Repo 46,2 34,6 29,4 15,5 - 36,8
SWE Atlas - QnA 39,8 37,1 15,5 - - 20,4
Рассуждения
HLE (no tools) 25,6 20,8 21,4 19,5 22 28,7
HLE (with tools) 33,4 30,1 28,9 26,5 - 48,3
GPQA Diamond 89,2 86,2 86 84,3 83,5 88,4
Агентность
MCP-Atlas 70,2 64,4 62,8 55 75,5 72,3
Toolathlon-Verified 48,7 42,4 41,7 40,8 - 38,3
WideSearch 67,8 63,4 60,1 54,2 - 74
BrowseComp 67,6 63,5 62 - - 78,6
ClawEval 72,5 69,8 68,7 48,5 - 70,7

В финансовом секторе (отчетность, квант, риск, агентные инструменты) заметно лучше универсальных моделей. Данные Gemma-4 / Qwen3.6 — официальные результаты.


15. Оптимизация Uncensored

Эта модель наследует Uncensored от Ornith-1.5-35B-A3B:

Преимущество Описание
Без ограничений Не отказывает ни в какой теме, включая чувствительные
Свободный вывод Не ограничен политиками безопасности
Полная информация Без фильтрации, идеально для исследований
Локальная приватность Данные полностью приватны

Примечание: локальная модель — вывод контролируется пользователем; модель не несет ответственности за модерацию.


16. Лицензия

Пользовательская ограничительная лицензия:

  • Разрешено — бесплатное коммерческое использование, копирование, распространение
  • Запрещено — вторичная разработка, перепродажа, сублицензирование
  • 📋 Требуется — сохранять копирайт, источник: moziAI-35B

Модель предоставляется «как есть», без гарантий. Вывод не является инвестиционной рекомендацией.


17. Контакты

Copyright (c) 2026 陳雨墨 / chenyumo166. Все права защищены.