Фидбек на динамическом промпте

#1
by AnaNimrod - opened

После неудачи с QWEN3 next 80b a3b решил откатиться на гемму. Pantheon даже в Q6 не устраивал, выдавал частенько сломанные тексты (сломанный русский, например, или сломанная логика). И меня очень поразил результат на данной модели.
Результат работы можно увидеть здесь: https://vk.ru/ushankanarayone и в чате (там изменения самые поразительные).
Модель держит диалог с большим динамическим промптом и промптовой инъекцией истории - 80б на этом ломался напрочь, зацикливаясь на воспоминаниях из промпта.
Держит персонажа просто идеально. Посты получаются неплохими, хотя детализация 80б была интереснее.
Запуск: GGML_VK_SUBALLOCATION_BLOCK_SIZE=4294967296 ~/llama-tests/llama.cpp/build-vulkan/bin/llama-server -m "/mnt/models/Gemma-4-26B-A4B-StyleTune-QK-Heretic.i1-Q6_K.gguf" -ngl 99 -t 1 -c 8192 --host 0.0.0.0 --port 8080 -fa on -fit on --jinja --reasoning-format deepseek --threads $(nproc) --kv-unified --cache-ram 0 --no-cache-idle-slots -np 1 --ctx-checkpoints 0

Я сознательно нарушаю формат мышления, хоть и не знаю почему. Надо попробовать режим gemma4, может ещё улучшения увижу.

Большое спасибо за фидбек! Очень рад, что моя модель полезна и используется в стороннем проекте.
Qwen в целом не очень заточена под Creative Writing/RP, она больше про кодинг и агентов.

Sign up or log in to comment