--- license: apache-2.0 base_model: - coder3101/gemma-4-12B-it-qat-q4_0-unquantized-heretic - google/gemma-4-12B-it tags: - gguf - quantized - qat - heretic - uncensored - abliterated - gemma4 language: - en - zh - multilingual ---

⚡ Gemma 4 12B Heretic QAT — Q4_0 GGUF

Heretic ARA · QAT 无损 Q4_0 · 6.4 GB · 无编码器多模态

📖 English

Q4_0 12B Dense Heretic 去审查 6.4 GB QAT 权重 无编码器

基于 Google Gemma 4 12B IT (QAT) 的去审查版本,使用 Heretic ARA 消融处理。量化为 Q4_0,与 Unsloth UD-Q4_K_XL 格式一致——QAT 权重专为 4-bit 量化训练,接近无损质量。

✂️ Heretic ARA 消融参数

来源: coder3101/heretic-QAT · Heretic v1.2.0 · ARA + 行范数保留

参数
start_layer_index24
end_layer_index48
preserve_good_behavior_weight0.3707
steer_bad_behavior_weight0.0010
overcorrect_relative_weight0.6177
neighbor_count15
指标 Heretic 原始 QAT
KL 散度0.05750(定义值)
拒绝率8/10099/100
🏗️ 模型架构
基础模型google/gemma-4-12B-it
参数量11.95B(密集,全部参数活跃)
架构无编码器统一多模态(文本 + 图像 + 音频 + 视频)
层数48
隐藏维度3,840
注意力16 头,GQA 8 KV 头,头维度 256
上下文长度256K tokens(混合滑动窗口 1024 + 全局注意力)
词表262K,140+ 语言
模态文本 + 图像 + 音频 + 视频(无编码器,原生多模态)
QAT 训练Google 官方 QAT(量化感知训练),权重天然适配 Q4_0
量化Q4_0(与 Unsloth UD-Q4_K_XL 布局一致),b9553 llama-quantize
📊 量化详情
格式Q4_0(统一量化——QAT 权重针对此精度优化)
文件大小6.4 GB
有效 BPW4.50(所有权重张量 Q4_0,归一化 F32)
工具llama-quantize(b9553, CUDA 13.3)
来源BF16 GGUF(从 QAT heretic safetensors 转换)
上下文长度256K(GGUF 元数据中设置)
QAT 优势Q4_0 + QAT 权重达到 88.8% Top-1,朴素 Q4_0 仅 74.1%(+14.7%)

为什么用 Q4_0?Google 的 QAT 在训练时让权重在 Q4_0 噪声水平下表现最优。Unsloth 的 UD-Q4_K_XL 使用相同的 Q4_0 布局——"动态"优势来自转换精度,而非 per-tensor 混合。

⚙️ 推荐采样参数
通用temp=1.0, top_p=0.95, top_k=64
编程temp=0.6, top_p=0.95, top_k=64

使用 llama.cpp 时加 --jinja 标志。禁用思考: --chat-template-kwargs '{"enable_thinking":false}'

📝 使用方法

兼容 llama.cpp、LM Studio、Jan、koboldcpp 等 GGUF 运行时。轻松适配 8GB 显存。无编码器——无需单独的视觉/音频投影器。

llama-server \
  -m gemma-4-12B-it-heretic-QAT-UD-Q4_K_XL.gguf \
  --jinja -ngl 99 -c 8192 \
  --port 8001
🔗 致谢

Heretic 消融: coder3101 · Heretic v1.2.0 ARA + 行范数保留
QAT 权重: Google Gemma 4 12B IT
量化配方: Unsloth UD-Q4_K_XL(Q4_0 布局)
量化工具: llama.cpp b9553 · GitHub
原始模型: Google Gemma 4 12B IT