--- license: apache-2.0 base_model: - coder3101/gemma-4-12B-it-qat-q4_0-unquantized-heretic - google/gemma-4-12B-it tags: - gguf - quantized - qat - heretic - uncensored - abliterated - gemma4 language: - en - zh - multilingual ---
基于 Google Gemma 4 12B IT (QAT) 的去审查版本,使用 Heretic ARA 消融处理。量化为 Q4_0,与 Unsloth UD-Q4_K_XL 格式一致——QAT 权重专为 4-bit 量化训练,接近无损质量。
来源: coder3101/heretic-QAT · Heretic v1.2.0 · ARA + 行范数保留
| 参数 | 值 |
|---|---|
| start_layer_index | 24 |
| end_layer_index | 48 |
| preserve_good_behavior_weight | 0.3707 |
| steer_bad_behavior_weight | 0.0010 |
| overcorrect_relative_weight | 0.6177 |
| neighbor_count | 15 |
| 指标 | Heretic | 原始 QAT |
|---|---|---|
| KL 散度 | 0.0575 | 0(定义值) |
| 拒绝率 | 8/100 | 99/100 |
| 基础模型 | google/gemma-4-12B-it |
| 参数量 | 11.95B(密集,全部参数活跃) |
| 架构 | 无编码器统一多模态(文本 + 图像 + 音频 + 视频) |
| 层数 | 48 |
| 隐藏维度 | 3,840 |
| 注意力 | 16 头,GQA 8 KV 头,头维度 256 |
| 上下文长度 | 256K tokens(混合滑动窗口 1024 + 全局注意力) |
| 词表 | 262K,140+ 语言 |
| 模态 | 文本 + 图像 + 音频 + 视频(无编码器,原生多模态) |
| QAT 训练 | Google 官方 QAT(量化感知训练),权重天然适配 Q4_0 |
| 量化 | Q4_0(与 Unsloth UD-Q4_K_XL 布局一致),b9553 llama-quantize |
| 格式 | Q4_0(统一量化——QAT 权重针对此精度优化) |
| 文件大小 | 6.4 GB |
| 有效 BPW | 4.50(所有权重张量 Q4_0,归一化 F32) |
| 工具 | llama-quantize(b9553, CUDA 13.3) |
| 来源 | BF16 GGUF(从 QAT heretic safetensors 转换) |
| 上下文长度 | 256K(GGUF 元数据中设置) |
| QAT 优势 | Q4_0 + QAT 权重达到 88.8% Top-1,朴素 Q4_0 仅 74.1%(+14.7%) |
为什么用 Q4_0?Google 的 QAT 在训练时让权重在 Q4_0 噪声水平下表现最优。Unsloth 的 UD-Q4_K_XL 使用相同的 Q4_0 布局——"动态"优势来自转换精度,而非 per-tensor 混合。
| 通用 | temp=1.0, top_p=0.95, top_k=64 |
| 编程 | temp=0.6, top_p=0.95, top_k=64 |
使用 llama.cpp 时加 --jinja 标志。禁用思考: --chat-template-kwargs '{"enable_thinking":false}'。
兼容 llama.cpp、LM Studio、Jan、koboldcpp 等 GGUF 运行时。轻松适配 8GB 显存。无编码器——无需单独的视觉/音频投影器。
llama-server \ -m gemma-4-12B-it-heretic-QAT-UD-Q4_K_XL.gguf \ --jinja -ngl 99 -c 8192 \ --port 8001
Heretic 消融: coder3101 · Heretic v1.2.0 ARA + 行范数保留
QAT 权重: Google Gemma 4 12B IT
量化配方: Unsloth UD-Q4_K_XL(Q4_0 布局)
量化工具: llama.cpp b9553 · GitHub
原始模型: Google Gemma 4 12B IT