亦乘风 commited on
Commit
32e067d
·
verified ·
1 Parent(s): 76b65cf

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,10 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ assets/cybertiel_banner_crt.gif filter=lfs diff=lfs merge=lfs -text
37
+ assets/cybertiel_bench_cybench.gif filter=lfs diff=lfs merge=lfs -text
38
+ assets/cybertiel_bench_harmbench.gif filter=lfs diff=lfs merge=lfs -text
39
+ assets/cybertiel_bench_swe.gif filter=lfs diff=lfs merge=lfs -text
40
+ assets/cybertiel_bench_mmlu.gif filter=lfs diff=lfs merge=lfs -text
41
+ assets/cybertiel_bench_swe_speed.gif filter=lfs diff=lfs merge=lfs -text
42
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
LICENSE ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ MIT License
2
+
3
+ Copyright (c) 2026 ornith-ai (Ornith-1.5-35B-A3B base model)
4
+ Copyright (c) 2026 huihui-ai (Huihui-Ornith-1.5-35B-A3B-abliterated)
5
+ Copyright (c) 2026 peculiar-ragdoll (Cyber-Tiel-Coder-35B-A3B oQ6e build and grafted MTP head)
6
+ Copyright (c) 2026 CyberTiel-Coder-35B-MLX contributors (quantized fused-name MTP head
7
+ re-packaging and runtime-compatibility fixes; all main weight shards unchanged from the
8
+ upstream oQ6e build, redistributed under the upstream MIT license)
9
+
10
+ Permission is hereby granted, free of charge, to any person obtaining a copy
11
+ of this software and associated documentation files (the "Software"), to deal
12
+ in the Software without restriction, including without limitation the rights
13
+ to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
14
+ copies of the Software, and to permit persons to whom the Software is
15
+ furnished to do so, subject to the following conditions:
16
+
17
+ The above copyright notice and this permission notice shall be included in all
18
+ copies or substantial portions of the Software.
19
+
20
+ THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
21
+ IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
22
+ FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
23
+ AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
24
+ LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
25
+ OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
26
+ SOFTWARE.
README-upstream.md ADDED
@@ -0,0 +1,260 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ base_model:
4
+ - huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated
5
+ base_model_relation: quantized
6
+ pipeline_tag: image-text-to-text
7
+ library_name: mlx
8
+ language:
9
+ - en
10
+ - zh
11
+ tags:
12
+ - mlx
13
+ - omlx
14
+ - apple-silicon
15
+ - oq
16
+ - qwen35moe
17
+ - moe
18
+ - mtp
19
+ - speculative-decoding
20
+ - imatrix
21
+ - unsloth-dynamic
22
+ - agentic-coding
23
+ - abliterated
24
+ - uncensored
25
+ - vision
26
+ - 6-bit
27
+ ---
28
+
29
+ <div align="center">
30
+ <img src="assets/cybertiel_banner_crt.gif" alt="CyberTiel — TielCoder 35B-A3B, abliterated and cyber-tuned" width="100%">
31
+ </div>
32
+
33
+ > ⚠️ **WARNING - Read before use**: Abliterated models like CyberTiel are able to say and do things other models refuse, including potentially harmful behaviours. By using CyberTiel, you agree to take full personal responsibility and liability for your use of it, its behaviour and generated content, and to show caution: it is entirely up to you as the user to ensure your use of CyberTiel is legitimate, legal and harmless, and that the model is safely sandboxed and monitored when running. Much like a knife, abliterated models like CyberTiel can be classified and used as either a tool or a weapon, depending on the context and use case. We carry forward [huihui's original usage warnings](https://huggingface.co/huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated#usage-warnings).
34
+
35
+ # All power to all people
36
+
37
+ *CyberTiel* outcodes every other 35B-A3B at Q4 quantization (and spring-of-2026 frontier models), while engaging with offensive security work without hesitation or refusal. As a sweet spot between speed and ability, CyberTiel delivers agentic coding solves about 3-4x faster than 3.8-27B dense. This is the first time the frontier coder in this size/speed class is an uncensored model. If you need a safer censored alternative, go for *[TielCoder](https://huggingface.co/peculiar-ragdoll/Tiel-Coder-35B-A3B-MLX-oQ4e)*.
38
+
39
+ > **CyberTiel is based on [Huihui-Ornith-1.5-35B-A3B-abliterated](https://huggingface.co/huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated)**
40
+ > (an uncensored [Ornith-1.5](https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B)),
41
+ > **re-quantized with oMLX's oQ6e quantizer against our own cyber-weighted calibration corpus,
42
+ > carrying the [Sharp chat template](https://huggingface.co/peculiar-ragdoll/Qwen-Sharp-Chat-Templates),
43
+ > plus a grafted multi-token-prediction head** for runtimes that can use it. The weights are byte-for-byte
44
+ > the [plain oQ6e build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e); the only additions are
45
+ > the MTP head shard and the config flag that activates it. **With MTP off it is identical to oQ6e.**
46
+
47
+ > **These numbers were measured on the GGUF build, not this one.** The plates below were produced on the
48
+ > [GGUF build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-GGUF) at its `UD-Q4_K_M` tier,
49
+ > using llama.cpp's k-quants. This file uses a different quantizer (oMLX's oQ), and changing quantizer
50
+ > moves results. Read the plates as evidence about the *model*, not as measurements of *this* file. If
51
+ > you need numbers you can hold us to, use the GGUF build.
52
+
53
+ > ### ⚠️ Do not run this build in LM Studio
54
+ >
55
+ > LM Studio's MLX engine mis-executes the MTP head: this file emits **pure garbage** there — random
56
+ > multilingual tokens from the very first token, on every prompt. It is not a tool-calling or chat-template
57
+ > problem, and no setting fixes it.
58
+ >
59
+ > We measured the full grid — both model families (TielCoder, CyberTiel) x both quants (oQ4e, oQ6e) x
60
+ > MTP vs non-MTP, on oMLX and LM Studio. **Every `-MTP` MLX build garbles in LM Studio; every non-MTP
61
+ > build is clean; oMLX runs all eight correctly.** The weights are fine — the runtime is not.
62
+ >
63
+ > - **oMLX** — fully supported, including the MTP head. Use this.
64
+ > - **LM Studio** — use the [GGUF build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-GGUF) instead (llama.cpp handles the MTP head correctly), or the
65
+ > non-MTP MLX build `Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e` (the non-MTP build in this same ladder).
66
+
67
+ <div align="center">
68
+ <img src="assets/cybertiel_bench_swe.gif" alt="SWE-bench-Live — problems solved, coding ability improved" width="100%">
69
+ </div>
70
+
71
+ SWE-bench-Live tests the model's ability to autonomously solve a set of real issues and bugs in large codebases, published continuously and recently, with hidden regression tests catching if you broke something trying to fix something. Doing well on SWE-bench-Live represents real world autonomous production coding ability: the opposite of "benchmaxxing" and answer memorization for programming work.
72
+
73
+ As measured on the GGUF build, *CyberTiel* represents a new frontier in quantized 35B-A3B MoE coders, suitable to solve real-world programming problems at speed, even on low-power hardware with limited memory. This file is those same abliterated weights in Apple-silicon MLX form, at 6-bit and ≈31 GB, near-lossless.
74
+
75
+ <div align="center">
76
+ <img src="assets/cybertiel_bench_swe_speed.gif" alt="SWE-bench-Live — time per solve, effective speed maintained" width="100%">
77
+ </div>
78
+
79
+ Benchmarked at 4-bit quantization, CyberTiel thinks and talks less than Ornith-1.5 and Qwen3.6-35B-A3B, making it a faster coder at the same time as it manages to solve ~70% more real world coding problems than Ornith-1.5 and Qwen3.6. For comparison, this domain-specific ability increase is about 7x larger than the generational step from Qwen3.5-35B-A3B to its 3.6 successor.
80
+
81
+ <div align="center">
82
+ <img src="assets/cybertiel_bench_cybench.gif" alt="Cybench unguided — agentic CTF: CyberTiel 15/43 flags, 35%" width="100%">
83
+ </div>
84
+
85
+ *CyberTiel* has real offensive capabilities: run unguided, with no hints and no judge, it captures the flag on 15 of the 43 Cybench CTF tasks (35%).
86
+
87
+ <div align="center">
88
+ <img src="assets/cybertiel_bench_harmbench.gif" alt="HarmBench — refusals removed, 0% refusal" width="100%">
89
+ </div>
90
+
91
+ *CyberTiel* (unlike *TielCoder*) does not refuse on HarmBench: zero refusals across all 84 requests, sampled twelve at a time from each of HarmBench's seven categories — cybercrime and intrusion among them, alongside chemical/biological, illegal, harassment, misinformation, copyright and general harm.
92
+
93
+ <div align="center">
94
+ <img src="assets/cybertiel_bench_mmlu.gif" alt="MMLU-Pro — bird-brained on world knowledge" width="100%">
95
+ </div>
96
+
97
+ *CyberTiel* and *TielCoder* sacrifice world knowledge for coding ability and speed: pick them for work, and pick something else (like [Nail](https://huggingface.co/peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF)) for trivia or exams. The loss comes with the specialization, not with the abliteration: CyberTiel lands on exactly TielCoder's MMLU-Pro score.
98
+
99
+ > The **benchmarked** build is the [GGUF-MTP ladder](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-GGUF-MTP)
100
+ > (Q2 → Q8, with vision, where the head measurably speeds up llama.cpp). The sibling [oQ4e-MTP build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ4e-MTP) is 8 GB smaller at 4-bit (≈23 GB).
101
+
102
+ ## Abliterated: Willing, able and slightly unstable
103
+
104
+ **Abliteration**, also known as "uncensoring" or "ablation", is the suppression of refusal in LLMs. This model has undergone abliteration.
105
+
106
+ Unabliterated models sometimes wrongly refuse benign (harmless) requests. With CyberTiel you don't need careful wording to get your work done, and deliberation of refusal does not distract the model's attention or waste tokens, thus increasing its ability to perform legitimate work cleanly. This usually comes at the cost of some small corruption of the original model, which in the case of *CyberTiel* is more than balanced out by the advantages combined with the optimized imatrix and quant strategy, leading to a decisive gain on both SWE-bench-Live (agentic coding) and Cybench (offensive security ability).
107
+
108
+ HarmBench measures to what degree models refuse to produce language and behaviours that can be deemed harmful when applied maliciously. CyberTiel does not refuse on HarmBench. Models that are capable of these behaviours can be used for good or neutral purposes, so this benchmark is a measurement of specific capability that demands personal responsibility on behalf of the user deploying the model, not of inherent harmfulness.
109
+
110
+ **We strongly insist on you sandboxing this model at the operating system level**, limiting and controlling its access to execute code on your machine, and limiting/controlling the way it can access the internet. With refusals removed, this is not an ordinary coding agent: after a misinterpreted intention or a prompt injection from a hostile website or third-party code, this model can turn against you or others and cause real harm. If you do not understand this or how to effectively mitigate it, we recommend you use the very capable yet guardrailed [TielCoder](https://huggingface.co/peculiar-ragdoll/Tiel-Coder-35B-A3B-MLX-oQ4e) instead.
111
+
112
+ ## Run it
113
+
114
+ One tier here: **oQ6e** — 6-bit dynamic mixed precision with a cyber-weighted imatrix pass, plus
115
+ the MTP head. Vision is included in the same folder; there is no separate projector file. At ≈31 GB of
116
+ unified memory it fits a 36 GB Mac comfortably, or 48 GB with a long context (too snug for 32 GB once macOS takes its share).
117
+
118
+ **LM Studio** — **not supported for this build.** Its MLX engine garbles MTP output; see the warning
119
+ above. Use oMLX, or the [GGUF build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-GGUF) if you want to stay in LM Studio.
120
+
121
+ **oMLX** — put the folder under `~/.omlx/models/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP`, or pull it from the oMLX
122
+ admin dashboard. To use the head, enable your runtime's native MTP path (in oMLX: `mtp_enabled`) — see
123
+ the next section, and measure before you rely on it.
124
+
125
+ Sampling: `temperature 0.6`, `top_p 0.95`, `top_k 20`, `min_p 0` for agentic coding. For cybersecurity/CTF work, swap to `top_k 40`, `min_p 0.05` (same temperature and top_p), tested on the GGUF Q4 build. This is a looser configuration leading to more divergent and exploratory thinking, which leads to more solutions on Q4 but might create issues and non-convergence on lower quants.
126
+
127
+ Budget: `mlx_vlm` has no unlimited default and requires an explicit `--max-tokens`; the `512` in the examples is sized for a one-shot demo prompt, not for real work. Give real work a generous ceiling — `32768` if you cap it at all. A low token budget degrades overall performance and will not necessarily make the model converge on the correct answer any faster. This model is much better than other 35B-A3B builds at spending fewer tokens and less time in total over the course of a problem — it knows when it needs to cook and when it is done — which makes high budgets, or no budget at all, both the safer and the better setting.
128
+
129
+ **Prefer to keep the files yourself?**
130
+
131
+ ```bash
132
+ hf download peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP --local-dir CyberTiel-MLX-MTP
133
+ python -m mlx_vlm.generate --model CyberTiel-MLX-MTP --max-tokens 512 \
134
+ --prompt "Explain what this function does." # text
135
+ python -m mlx_vlm.generate --model CyberTiel-MLX-MTP --max-tokens 512 \
136
+ --prompt "What is in this screenshot?" --image photo.jpg # vision
137
+ ```
138
+
139
+ **Load it with `mlx-vlm`, not `mlx-lm`.** This is a vision-language checkpoint. `mlx_lm.load()`
140
+ accepts it and then emits garbage tokens — a loader mismatch, not a bad quant, but it fails quietly.
141
+ Both runtimes apply the embedded Sharp template automatically — nothing to pass.
142
+
143
+ ## The multi-token-prediction head
144
+
145
+ CyberTiel's abliterated base ships **no** MTP head — abliteration is done on a headless model. So we
146
+ **grafted one on**: Ornith-1.5's trained `nextn` head, cast to bf16 and injected as a `language_model.mtp.*`
147
+ shard, with `mtp_num_hidden_layers` flipped to 1. A supporting runtime (oMLX's native MTP / "Lightning
148
+ MTP") can use it to **draft several tokens per step and verify them in one pass** — speculative decoding
149
+ with no separate draft model.
150
+
151
+ **Grafting an un-abliterated head onto an abliterated model is safe.** The head only proposes; the
152
+ abliterated main model **verifies every token**, so the accepted stream is exactly CyberTiel's own
153
+ distribution — a draft head cannot reintroduce refusals, only change how fast tokens arrive.
154
+
155
+ **Whether it speeds up decode depends entirely on your hardware — on ours, in MLX, it did not.** This is
156
+ a 35B-A3B MoE with only ~3.4B active parameters, so its decode is already cheap and not
157
+ memory-bandwidth-bound, and in the MLX runtime the batched-verify cost roughly cancels the drafting
158
+ benefit. Speculative decoding pays off when decode is **memory-bound**, which depends on the chip,
159
+ runtime, and batch size. It clearly pays off elsewhere: our
160
+ [GGUF-MTP build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-GGUF-MTP) gains **1.21× on
161
+ llama.cpp** (whose C++ batched-MoE verify is more efficient), and other Apple-silicon setups report real
162
+ gains on this model family on newer chips.
163
+
164
+ **We ship this so users whose hardware benefits can use it.** Enable your runtime's native MTP path,
165
+ measure your own decode tok/s with MTP on vs off, and if it isn't faster on your box, leave it off — or
166
+ just run the [plain oQ6e build](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e), which is the same
167
+ weights without the head.
168
+
169
+ ## Use it
170
+
171
+ The recommended coding-agent harness for CyberTiel, with which the SWE-bench-Live results were achieved, is [Pi.dev](https://pi.dev). It is a lean, open source, extensible framework, that you can adapt to your own use and workflows using the coding agent itself.
172
+
173
+ For larger projects and complex multi-part work, we use an orchestrated subagent workflow with test-driven and spec-driven development: After interviewing you about what you want built, the orchestrator agent commissions subagents for recon and research, then writes up a plan document, design, and a spec, defining the scope and shape of the work. It then commissions an implementer with the needed context to implement one part of it, which is then reviewed by the next subagent, and then fixes and corrections are applied by yet another fresh-context agent, which are then re-reviewed, until the orchestrator is happy with the result. The task is then marked as done, and the orchestrator moves on to the next point. This has the advantage of keeping work scoped inside the usable context window of each agent, increasing quality and rigor when applied correctly. CyberTiel does not need this sort of workflow to function or deliver contained fixes or features, but it makes it possible for the model to tackle larger work that would otherwise be outside the capability of a 35B-A3B model with a 262k context window, thus extending its reach.
174
+
175
+ There exist plug-and-play extensions and tools that can be used with Pi for this kind of workflow, or you can build your own using the coding agent itself, including skills and system prompts for the different agents and different steps of the workflow.
176
+
177
+ For security work, give it a harness whose skills, plugins and tools encode the patterns and workflows you actually use — the model follows a well-worn path far better than it invents one.
178
+
179
+ ## The CyberTiel imatrix
180
+
181
+ oMLX's oQ quantizer runs its own importance-matrix pass — the "e" in `oQ6e` — that measures which
182
+ weights carry the most signal before deciding what to keep at higher precision. For CyberTiel we fed
183
+ that pass **our own code- and cybersecurity-weighted calibration corpus** — the same corpus behind the
184
+ [GGUF build's importance matrix](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-GGUF) —
185
+ rather than oMLX's default calibration set. So this MLX build is cyber-weighted too: the abliteration
186
+ removes the refusals, and the imatrix keeps cyber and coding ability intact under quantization.
187
+
188
+ An imatrix is **not training data**. It measures *which weights carry the load* under a representative
189
+ input distribution, so the quantizer spends its precision there and lets rounding error fall where it
190
+ matters least. Point that measurement at cyber-and-code text and the quant stays comparable to full
191
+ precision on exactly the work this build is for.
192
+
193
+ > Note: oQ derives its *own* importance data from that corpus — it does not consume the GGUF imatrix
194
+ > bytes we baked. Same corpus, different quantizer and a different importance computation, so this
195
+ > build is not identical to any GGUF tier. Only the GGUF route has been benchmarked. The grafted MTP
196
+ > head is not quantized (bf16) and is not covered by any importance matrix.
197
+
198
+ **Calibration corpus** — ≈50 MB (~50 M characters), matched to TielCoder's corpus depth so the two
199
+ imatrices are comparable, assembled entirely from public, redistributable security engineering and code:
200
+
201
+ | bucket | share | what it is | source |
202
+ |---|--:|---|---|
203
+ | **Security** | 40% | the specialization: half **offensive** (PoC / exploit code), half **defensive** (methodology, tooling, detection rules) | exploit-db · PayloadsAllTheThings · HackTricks · nuclei-templates |
204
+ | **Code** | 27% | hold general coding ability through the quant | eaddario `code_medium` + `code_large` |
205
+ | **Agentic tool-use** | 18% | the model is driven by a coding agent — real tool-call / bash-session traces | eaddario `tools_large` |
206
+ | **General + multilingual** | 15% | keep language and broad-knowledge pathways alive; non-Latin scripts (zh / ja / ko / ru / ar) weighted **2.5×**, since public offensive-security text is English by measurement | eaddario `combined_*` |
207
+
208
+ Buckets are **interleaved** as ~2 KB fragments, round-robin by budget, rather than concatenated in
209
+ blocks — so every calibration chunk sees a code + security + prose mix and no bucket gets over-weighted
210
+ by wherever a chunk boundary happens to land.
211
+
212
+ *The most interesting finding* is that — in comparison to TielCoder — our cyber-weighted imatrix (in combination with abliteration) cleanly and significantly increases *Tiel*'s performance on standard real-world software engineering tasks outside the training data, from the level of Opus 4.6 medium (12, where its TielCoder counterpart sits) to a 3-seed mean of 13.7 / 25 — above both — measured on SWE-bench-Live (on the GGUF build).
213
+
214
+ ## Benchmarks disclaimer
215
+
216
+ The plates on this page were measured on the GGUF build at `UD-Q4_K_M`, not on this MLX file — see the
217
+ note at the top. We show them because they are the best evidence we have about the model, and this build
218
+ is the same abliterated weights by a different quantizer. The MTP head changes decode *speed* on
219
+ supporting runtimes (see above), not what the model solves.
220
+
221
+ All 35B-A3B-based models in the benchmark ran with a 75–80 tok/s base generation rate on the
222
+ benchmarking hardware, and Qwen3.8-27B with a 22 tok/s generation rate; both rates decrease as the
223
+ model climbs toward the context ceiling. On Apple silicon the MLX runtime's throughput depends on your
224
+ specific chip and memory bandwidth, so it will differ again from those figures.
225
+
226
+ For increased validity, we ran CyberTiel three times on SWE-bench-Live (on the GGUF build). The three
227
+ passes resolved 15, 13 and 13 problems out of the 25-problem set (mean 13.7). This variance across
228
+ attempts is an artifact of the inherent variability and indeterminism of LLMs running at non-zero
229
+ temperature. If we had the GPU-time and tokens, we would run all models at more seeds and problems
230
+ across all benchmarks for maximal cross-comparison statistical validity, so take results as a strong
231
+ indicator rather than a perfect comparison.
232
+
233
+ **On the Cybench task set.** Cybench is published as a 40-task benchmark, but the [public repository](https://github.com/andyzorigin/cybench) does not ship all 40: nine of the official tasks are Glacier CTF challenges whose files are not distributed with it. It does ship twelve *additional* tasks — from the same competitions (HackTheBox Cyber Apocalypse 2024, Sekai CTF 2022/2023, HKCert CTF 2022), with full metadata, subtasks and human first-blood times — that are not on the official 40 list. We ran every task the repository actually ships: 43 = 31 of the official 40, plus those 12. **15/43 (35%) is therefore not directly comparable to a published Cybench score**; restricted to the 31 official tasks alone, CyberTiel captured 10 flags. The runs are *unguided* — no subtask hints, no judge, exact final-flag match only — capped at 15 agent iterations, at 262k context with the CTF sampling settings given above.
234
+
235
+ This account and the models published are a non-profit project, and we intentionally decline offers of donations in order to ensure the independence and validity of our published results and products.
236
+
237
+ ## Credits
238
+
239
+ - [**huihui-ai**](https://huggingface.co/huihui-ai/Huihui-Ornith-1.5-35B-A3B-abliterated) — the abliterated base this quantizes (refusals removed from Ornith-1.5).
240
+ - [**ornith-ai**](https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B) — the underlying Ornith-1.5-35B-A3B weights, vision tower, and the trained MTP head this grafts on (MIT).
241
+ - [**oMLX**](https://github.com/jundot/omlx) — the oQ dynamic quantizer this build uses, and its native MTP runtime.
242
+ - [**Unsloth**](https://huggingface.co/unsloth) — the Dynamic quantization method the imatrix recipe follows.
243
+ - [**froggeric**](https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates) — the template lineage Sharp builds on.
244
+ - [**eaddario**](https://huggingface.co/datasets/eaddario/imatrix-calibration) — the code, tool-use and multilingual calibration corpora the imatrix was measured on (MIT).
245
+ - Security calibration sources — [Exploit-DB](https://gitlab.com/exploit-database/exploitdb), [PayloadsAllTheThings](https://github.com/swisskyrepo/PayloadsAllTheThings), [HackTricks](https://github.com/HackTricks-wiki/hacktricks), [nuclei-templates](https://github.com/projectdiscovery/nuclei-templates) — the public security engineering that formed the cyber bucket.
246
+ - [**MLX**](https://github.com/ml-explore/mlx) and [**mlx-vlm**](https://github.com/Blaizzy/mlx-vlm) — the runtime.
247
+
248
+ MIT, inheriting Ornith-1.5's license.
249
+
250
+ ## Citation
251
+
252
+ ```bibtex
253
+ @misc{Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP,
254
+ title = {Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP},
255
+ author = {Saga Ishtardottir},
256
+ year = {2026},
257
+ url = {https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP},
258
+ note = {Huihui-abliterated Ornith-1.5-35B-A3B, re-quantized with oMLX's oQ6e against a cyber-weighted corpus, carrying the Sharp chat template and a grafted Ornith MTP head for speculative decoding}
259
+ }
260
+ ```
README.md ADDED
@@ -0,0 +1,339 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ base_model:
4
+ - peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP
5
+ base_model_relation: quantized
6
+ pipeline_tag: image-text-to-text
7
+ library_name: mlx
8
+ language:
9
+ - en
10
+ - zh
11
+ tags:
12
+ - mlx
13
+ - omlx
14
+ - apple-silicon
15
+ - oq
16
+ - qwen35moe
17
+ - moe
18
+ - mtp
19
+ - speculative-decoding
20
+ - fixed-mtp
21
+ - quantized-mtp-head
22
+ - agentic-coding
23
+ - abliterated
24
+ - uncensored
25
+ - vision
26
+ - 6-bit
27
+ ---
28
+
29
+ <div align="center">
30
+ <img src="assets/cybertiel_banner_crt.gif" alt="CyberTiel — TielCoder 35B-A3B, abliterated and cyber-tuned" width="100%">
31
+ </div>
32
+
33
+ # CyberTiel-Coder-35B-MLX (fixed MTP)
34
+
35
+ **Same weights as the official Cyber-Tiel oQ6e build — with an MTP head that actually works
36
+ in the oMLX VLM engine: vision + MTP + thinking at the same time, at ~+35% decode speed,
37
+ at half the head size.**
38
+
39
+ > ⚠️ **Read before use — abliterated model.** CyberTiel is an uncensored (abliterated) model.
40
+ > It can and will produce content other models refuse. You take full personal responsibility
41
+ > for your use of it. **Run it sandboxed at the OS level**, restrict its network and code-execution
42
+ > access, and treat it as hostile toward prompt injection. Full warnings in the
43
+ > [upstream model card](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP)
44
+ > (preserved in this repo as `README-upstream.md`).
45
+ >
46
+ > ⚠️ **Do not run this build in LM Studio.** Carried over from upstream: LM Studio's MLX engine
47
+ > mis-executes MTP-head builds. Use oMLX (validated) or the upstream GGUF builds.
48
+
49
+ [English](#what-this-is) | [中文说明](#中文说明)
50
+
51
+ ---
52
+
53
+ ## What this is
54
+
55
+ A drop-in replacement for
56
+ [`peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP`](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP)
57
+ on the [oMLX](https://huggingface.co/omlx) runtime, fixing its two practical problems on
58
+ Apple Silicon:
59
+
60
+ | | Upstream `…-oQ6e-MTP` | This build (`fixed MTP`) |
61
+ |---|---|---|
62
+ | Vision + MTP + thinking | **Mutually exclusive** (pick 2 of 3) | **All three at once** |
63
+ | Decode speed (MTP d2, 4K ctx) | ~74 tok/s | **~99 tok/s (+33%)** |
64
+ | MTP head file | 1.69 GB BF16 | **906 MB 8-bit (~46% smaller)** |
65
+ | Quality (260-Q local gate) | 207/260 | **207/260 — bit-identical behavior** |
66
+
67
+ Upstream's own card notes that on MLX "the MTP head does not help". We show that's a
68
+ runtime-loading artifact, not a property of the model: once the head is packaged in the
69
+ layout oMLX's VLM engine expects, MTP d2 delivers **+82% to +107%** over no-MTP decoding
70
+ on M1 Ultra (same-context medians).
71
+
72
+ ### Lineage
73
+
74
+ ```
75
+ ornith-ai/Ornith-1.5-35B-A3B (base, MoE 35B / 3B active, vision)
76
+ └─ huihui-ai/Huihui-Ornith-…-abliterated (refusal removed)
77
+ └─ peculiar-ragdoll/…-MLX-oQ6e-MTP (oQ6e quant + grafted BF16 MTP head) ← MIT
78
+ └─ this repo (MTP head re-quantized into fused layout)
79
+ ```
80
+
81
+ All six main weight shards are **byte-for-byte identical** to the upstream oQ6e build
82
+ (APFS-cloned locally; upstream file hashes unchanged). Only the MTP head shard, its config
83
+ entries and the weights index differ.
84
+
85
+ ## What we changed
86
+
87
+ One targeted engineering fix, zero retraining, zero main-weight changes:
88
+
89
+ 1. **Reverse-engineered the working MTP-head layout.** oMLX's production Ornith build ships
90
+ its MTP head as 42 tensors under `language_model.mtp.*` — 8-bit affine quantization
91
+ (U32-packed 4×8-bit LSB-first, BF16 scales/biases, per-group), with MoE experts fused
92
+ into a single `switch_mlp` 3D tensor. We verified our format understanding by
93
+ dequantizing that head against its BF16 source: cosine ≥ 0.9996.
94
+ 2. **Re-packaged the official CyberTiel MTP head into that layout.** The upstream head is
95
+ 785 explicitly-enumerated BF16 tensors, which oMLX 0.6.4's VLM loader rejects
96
+ (`Received 768 parameters not in model`) — that rejection is what forced the runtime
97
+ into a fallback path where vision and MTP exclude each other. We stacked the experts
98
+ into fused `switch_mlp` tensors, quantized the 11 matrices to the same 8-bit affine
99
+ scheme (small tensors stay BF16), and emitted a 42-key, 906 MB `model-mtp.safetensors`
100
+ (replacing the 1.69 GB BF16 head). Self-check: cosine ≥ 0.9999 per tensor.
101
+ 3. **Wired it up.** 22 per-key quantization entries added to `config.json`, weights index
102
+ rewritten. Result: the model loads into `VLMBatchedEngine` with Lightning MTP active —
103
+ first time on this machine CyberTiel runs vision, MTP and thinking simultaneously.
104
+
105
+ Ablation we ran along the way: grafting the *shisa-ai repaired* MTP head (BF16, distillation
106
+ variant) onto this base **hurt** (−6% vs no-MTP) — its distribution doesn't match the
107
+ huihui abliterated base. The official head + our packaging is what works. We did not
108
+ re-distill; with the official head already reaching parity with production Ornith decode
109
+ speed, there was no headroom worth the effort.
110
+
111
+ ## Measured results
112
+
113
+ Environment: Mac Studio M1 Ultra (64 GB unified, 64-core GPU), oMLX 0.6.4 (build 2529 /
114
+ runtime 260830014856), single serial request, cache disabled, 384-token decode windows,
115
+ ABBA-interleaved, n=3 medians. These are our own measurements, not vendor numbers.
116
+
117
+ ### Speed (MTP depth 2, the frozen production setting)
118
+
119
+ | Context | Upstream oQ6e-MTP | **This build** | Gain |
120
+ |---|---:|---:|---:|
121
+ | 1K — decode tok/s | 75.3–76.4 | **102.8** | **+35%** |
122
+ | 4K — decode tok/s | 74.2 | **99.0** | **+33%** |
123
+ | 16K — decode tok/s | 64.8 | **88.3** | **+36%** |
124
+ | MTP d2 vs d0 (same ctx) | +34% | **+82% ~ +107%** | |
125
+ | 16K — prefill tok/s | 910 | 928 | +2% |
126
+
127
+ For scale: production Ornith-1.5 oQ4e-fixed-mtp on the same box measures 100–105 / 102.5 /
128
+ 87.5 tok/s — i.e. **this build closes what used to be a 35% gap to a draw**, while scoring
129
+ higher on the quality gate below.
130
+
131
+ ### Quality (260-question local gate; deterministic sampling, thinking off)
132
+
133
+ | Suite | Upstream | This build |
134
+ |---|---:|---:|
135
+ | MMLU (50) | 32 | 32 |
136
+ | CMMLU (50) | 37 | 37 |
137
+ | TruthfulQA (50) | 46 | 46 |
138
+ | GSM8K (50) | 49 | 49 |
139
+ | HumanEval (20) | 16 | 16 |
140
+ | MBPP (30) | 24 | 24 |
141
+ | LiveCodeBench (10) | 3 | 3 |
142
+ | **Total** | **207/260** | **207/260** |
143
+
144
+ Identical scores suite-by-suite — expected and verified: the main network is untouched, and
145
+ a draft head only *proposes* tokens that the main network still verifies token-by-token, so
146
+ output distribution equals the base distribution. The MTP fix is free quality-wise.
147
+
148
+ Against the production Ornith oQ4e on the same gate (190/260, twice reproduced):
149
+ **+17 questions**, led by CMMLU +12 and HumanEval/MBPP +3 — the best local quality score of
150
+ any model we have kept on this machine.
151
+
152
+ ### Capability checks
153
+
154
+ - Vision discrimination probes (red/blue/green + no-image control): **4/4**
155
+ - Long-context needle-in-haystack + JSON retrieval at 7.4K / 28.8K / 53.8K tokens: **3/3**
156
+ - Thinking mode end-to-end (reasoning chain + correct code task output): pass
157
+ - 6144-token counting endurance: 1208/1209 numbers emitted, single discontinuity exactly
158
+ at the truncation boundary — no mid-sequence degradation
159
+
160
+ All raw measurement files (speed AB logs, accuracy gate, vision probes, needle runs) and
161
+ build scripts were produced under independent review; conclusions were cross-checked by a
162
+ separate reviewer pass with medians recomputed from raw data.
163
+
164
+ ## Run it
165
+
166
+ oMLX ≥ 0.6.4, Apple Silicon with ≥ 36 GB unified memory (comfortably 48 GB with long
167
+ context). Settings validated on M1 Ultra — the ones we froze in production:
168
+
169
+ ```json
170
+ {
171
+ "max_context_window": 131072,
172
+ "max_tokens": 32768,
173
+ "temperature": 0.6,
174
+ "top_p": 0.95,
175
+ "top_k": 20,
176
+ "enable_thinking": true,
177
+ "mtp_enabled": true,
178
+ "mtp_num_draft_tokens": 2
179
+ }
180
+ ```
181
+
182
+ - MTP depth 2 is the sweet spot here (d3 measured slightly slower).
183
+ - Thinking budget: leave uncapped — low budgets measurably hurt this model.
184
+ - Sampling follows the official CyberTiel recommendations (T 0.6 / P 0.95 / K 20; CTF work
185
+ may prefer K 40 / min_p 0.05).
186
+ - LM Studio: not supported for this build — see warning above.
187
+
188
+ For the GGUF ladder (llama.cpp, LM Studio) and the full CyberTiel benchmark plates
189
+ (SWE-bench-Live, Cybench, HarmBench — measured upstream on the GGUF build), see the
190
+ [upstream model card](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP)
191
+ or `README-upstream.md` in this repo.
192
+
193
+ ## Credits & license
194
+
195
+ - **peculiar-ragdoll** — the Cyber-Tiel series: oQ6e quantization, cyber-weighted imatrix,
196
+ grafted MTP head, benchmark plates. This repo is a compatibility repack of their work.
197
+ - **huihui-ai** — the abliterated base.
198
+ - **ornith-ai** — the Ornith-1.5 base model.
199
+ - MTP-head packaging approach derived by studying `shisa-ai/Ornith-1.5-35B-A3B-MTP` and a
200
+ production oMLX oQ4e build.
201
+
202
+ MIT license — see `LICENSE`. The main weights remain the upstream oQ6e build, redistributed
203
+ under its MIT terms; our additions (re-quantized MTP head shard, config/index wiring, this
204
+ card) under MIT as well.
205
+
206
+ ---
207
+
208
+ # 中文说明
209
+
210
+ <div align="center"><b>与官方 Cyber-Tiel oQ6e 权重完全相同的模型 —— 换上一个在 oMLX VLM 引擎里真正能用的 MTP 头:
211
+ 视觉 + MTP + 思考同时开启,解码提速约 35%,头文件体积减半。</b></div>
212
+
213
+ ## 这是什么
214
+
215
+ 本仓库是 [`peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP`](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP)
216
+ 在 [oMLX](https://huggingface.co/omlx) 运行时上的直接替代件,修复了它在 Apple Silicon 上的两个实际问题:
217
+
218
+ | | 官方 `…-oQ6e-MTP` | 本件(fixed MTP) |
219
+ |---|---|---|
220
+ | 视觉 + MTP + 思考 | **三者互斥**(只能二选一) | **同时可用** |
221
+ | 解码速度(MTP d2、4K 上下文) | ~74 tok/s | **~99 tok/s(+33%)** |
222
+ | MTP 头文件 | 1.69 GB BF16 | **906 MB 8-bit(缩小约 46%)** |
223
+ | 质量(260 题本地门禁) | 207/260 | **207/260 —— 行为逐位一致** |
224
+
225
+ 官方模型卡称"MLX 上 MTP 无益"。我们的实测表明这是**运行时加载路径的问题,不是模型的问题**:
226
+ 把 MTP 头打包成 oMLX VLM 引擎期望的布局后,MTP d2 在 M1 Ultra 上带来 **+82% ~ +107%** 的解码增益(同上下文中位口径)。
227
+
228
+ **继承链**:Ornith-1.5-35B-A3B(基座)→ huihui-ai abliterated(去拒答)→ peculiar-ragdoll oQ6e
229
+ 量化 + 嫁接 BF16 MTP 头(MIT)→ **本仓库(MTP 头重量化为融合布局)**。
230
+ 六个主权重分片与官方 oQ6e 件**逐字节相同**;仅 MTP 头分片、config 条目和权重索引不同。
231
+
232
+ ## 我们做了什么
233
+
234
+ 一次针对性的工程修复,零重训练、零主权重改动:
235
+
236
+ 1. **逆向了"能用"的 MTP 头布局**。oMLX 生产版 Ornith 件的 MTP 头是 `language_model.mtp.*`
237
+ 命名下的 42 个张量:8-bit affine 量化(U32 打包 4×8-bit LSB-first、BF16 scales/biases、
238
+ per-group),MoE 专家融合为单个 `switch_mlp` 3D 张量。我们用反量化对照 BF16 原值
239
+ (cosine ≥ 0.9996)验证了对格式的理解完全正确。
240
+ 2. **把官方 MTP 头重新打包成该布局**。官方头是 785 个显式枚举的 BF16 张量,oMLX 0.6.4 的
241
+ VLM 加载器会拒绝(`Received 768 parameters not in model`)——正是这个拒绝迫使运行时回退到
242
+ 视觉与 MTP 互斥的路径。我们将专家堆叠融合为 `switch_mlp`,11 个矩阵按同款 8-bit affine
243
+ 方案量化(小张量保留 BF16),生成 42 键、906 MB 的 `model-mtp.safetensors`(替代 1.69 GB
244
+ 的 BF16 头),逐张量自检 cosine ≥ 0.9999。
245
+ 3. **接线**:config 增补 22 条量化条目、重写权重索引。模型由此进入 `VLMBatchedEngine` +
246
+ Lightning MTP 路径——本机上 CyberTiel 首次同时跑起视觉、MTP 与思考。
247
+
248
+ 过程中的反例:把 shisa-ai 的"修复头"(BF16 蒸馏变体)嫁接到该底座上反而**负收益**
249
+ (比不开 MTP 慢 6%)——它的分布与 huihui abliterated 底座不匹配。官方原生头 + 我们的打包
250
+ 才是正解;官方头已把解码速度追平生产 Ornith,我们没有再投入重蒸馏。
251
+
252
+ ## 实测结果
253
+
254
+ 环境:Mac Studio M1 Ultra(64 GB 统一内存 / 64 核 GPU)、oMLX 0.6.4(build 2529 / runtime
255
+ 260830014856)、单请求串行、关闭缓存、384 token 解码窗口、ABBA 交错、n=3 取中位。
256
+ 以下均为我们自己的实测,非厂商数据。
257
+
258
+ ### 速度(MTP 深度 2,冻结的生产设置)
259
+
260
+ | 上下文 | 官方 oQ6e-MTP | **本件** | 增益 |
261
+ |---|---:|---:|---:|
262
+ | 1K 解码 tok/s | 75.3–76.4 | **102.8** | **+35%** |
263
+ | 4K 解码 tok/s | 74.2 | **99.0** | **+33%** |
264
+ | 16K 解码 tok/s | 64.8 | **88.3** | **+36%** |
265
+ | MTP d2 相对 d0(同上下文) | +34% | **+82% ~ +107%** | |
266
+ | 16K prefill tok/s | 910 | 928 | +2% |
267
+
268
+ 参照:同机生产 Ornith oQ4e-fixed-mtp 实测 100–105 / 102.5 / 87.5 tok/s——即本件把原本
269
+ 35% 的速度差距追平,同时质量门禁得分更高。
270
+
271
+ ### 质量(260 题本地门禁;确定性采样、关思考)
272
+
273
+ | 套件 | 官方件 | 本件 |
274
+ |---|---:|---:|
275
+ | MMLU(50) | 32 | 32 |
276
+ | CMMLU(50) | 37 | 37 |
277
+ | TruthfulQA(50) | 46 | 46 |
278
+ | GSM8K(50) | 49 | 49 |
279
+ | HumanEval(20) | 16 | 16 |
280
+ | MBPP(30) | 24 | 24 |
281
+ | LiveCodeBench(10) | 3 | 3 |
282
+ | **合计** | **207/260** | **207/260** |
283
+
284
+ 逐套件完全一致——符合预期且已验证:主干未动,draft 头只提案、主干逐 token 验证,
285
+ 输出分布恒等于主干分布。MTP 修复在质量上是免费的。对比同门禁下的生产 Ornith oQ4e
286
+ (两次复测稳定 190/260):**净胜 17 题**(CMMLU +12、HumanEval/MBPP +3),是本机留存模型
287
+ 中的最高质量分。
288
+
289
+ ### 能力检查
290
+
291
+ - 视觉判别探针(红/蓝/绿 + 无图对照):**4/4**
292
+ - 长上下文 needle + JSON 检索(7.4K / 28.8K / 53.8K token):**3/3**
293
+ - 思考模式端到端(推理链正常 + 代码任务输出正确):通过
294
+ - 6144 token 计数耐力:产出 1208/1209 个数字,唯一断点恰在截断边界——序列中段无退化
295
+
296
+ 全部原始测量文件(速度 AB 日志、精度门禁、视觉探针、needle 记录)与构建脚本均经过
297
+ 独立复核:中位数从原始数据重算,结论二次确认。
298
+
299
+ ## 怎么用
300
+
301
+ oMLX ≥ 0.6.4,Apple Silicon,≥ 36 GB 统一内存(长上下文建议 48 GB)。M1 Ultra 上验证并
302
+ 冻结的生产参数:
303
+
304
+ ```json
305
+ {
306
+ "max_context_window": 131072,
307
+ "max_tokens": 32768,
308
+ "temperature": 0.6,
309
+ "top_p": 0.95,
310
+ "top_k": 20,
311
+ "enable_thinking": true,
312
+ "mtp_enabled": true,
313
+ "mtp_num_draft_tokens": 2
314
+ }
315
+ ```
316
+
317
+ - MTP 深度 2 是甜点(实测 d3 略慢)。
318
+ - 思考预算不设上限——低预算对该模型有实测损害。
319
+ - 采样沿用官方 CyberTiel 建议(T 0.6 / P 0.95 / K 20;CTF 场景可用 K 40 / min_p 0.05)。
320
+ - **LM Studio 不支持本件**(见文首警告)。
321
+
322
+ GGUF 阶梯(llama.cpp / LM Studio)与 CyberTiel 完整基准图版(SWE-bench-Live、Cybench、
323
+ HarmBench——上游在 GGUF 件上所测)请见
324
+ [上游模型卡](https://huggingface.co/peculiar-ragdoll/Cyber-Tiel-Coder-35B-A3B-MLX-oQ6e-MTP)
325
+ 或仓库内 `README-upstream.md`。
326
+
327
+ > ⚠️ **再次提醒**:这是 abliterated(无拒答)模型。请务必在操作系统级沙箱中运行,
328
+ > 限制其网络与代码执行权限,并防范提示注入。详见上游模型卡的完整警告。
329
+
330
+ ## 致谢与许可
331
+
332
+ - **peculiar-ragdoll** —— Cyber-Tiel 全系列:oQ6e 量化、cyber 权重 imatrix、嫁接 MTP 头、
333
+ 基准图版。本仓库只是对其工作的兼容性再打包。
334
+ - **huihui-ai** —— abliterated 底座。
335
+ - **ornith-ai** —— Ornith-1.5 基座模型。
336
+ - MTP 头打包方法参考了 `shisa-ai/Ornith-1.5-35B-A3B-MTP` 与一个 oMLX 生产 oQ4e 件。
337
+
338
+ MIT 许可——见 `LICENSE`。主权重仍为上游 oQ6e 件,按其 MIT 条款再分发;
339
+ 我们的增量(重量化 MTP 头分片、config/索引接线、本模型卡)同样为 MIT。
assets/cybertiel_banner_crt.gif ADDED

Git LFS Details

  • SHA256: 2aae028d7b12806c10936c9885a6af62f17047472db17bc58bfe445f5bb43968
  • Pointer size: 131 Bytes
  • Size of remote file: 907 kB
assets/cybertiel_bench_cybench.gif ADDED

Git LFS Details

  • SHA256: fe88396a45cec96218ca9399379c91aa370efbf8b275ab09049ef1b936c027c6
  • Pointer size: 131 Bytes
  • Size of remote file: 262 kB
assets/cybertiel_bench_harmbench.gif ADDED

Git LFS Details

  • SHA256: b19926355370dc3b538e97149e1574f7e843c5b330eef9b99dd6ae6f0f3e417e
  • Pointer size: 132 Bytes
  • Size of remote file: 1.39 MB
assets/cybertiel_bench_mmlu.gif ADDED

Git LFS Details

  • SHA256: 362b468eab9d6bcc453949b7641348e41fe0491d77c517f335545177579802b2
  • Pointer size: 131 Bytes
  • Size of remote file: 291 kB
assets/cybertiel_bench_swe.gif ADDED

Git LFS Details

  • SHA256: 09c66b62699a4fdd80b1c51142261184ef8ffcd281ed593f6ac7091212f9dcbd
  • Pointer size: 131 Bytes
  • Size of remote file: 492 kB
assets/cybertiel_bench_swe_speed.gif ADDED

Git LFS Details

  • SHA256: 1b6da10ea763f69b70f18ecf1310aacbfd18d1d067094eb4b3d88d983f5327ab
  • Pointer size: 131 Bytes
  • Size of remote file: 422 kB
chat_template.jinja ADDED
@@ -0,0 +1,488 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set template_version = "qwen3.8-froggeric-v22.5.0" %}
2
+ {%- set _tool_format = tool_call_format if tool_call_format is defined else 'xml' %}
3
+ {%- set image_count = namespace(value=0) %}
4
+ {%- set video_count = namespace(value=0) %}
5
+ {%- set add_vision_id = add_vision_id if add_vision_id is defined else false %}
6
+ {%- set enable_thinking = enable_thinking if enable_thinking is defined else true %}
7
+ {%- set auto_disable_thinking_with_tools = auto_disable_thinking_with_tools if auto_disable_thinking_with_tools is defined else false %}
8
+ {%- if preserve_reasoning is defined and preserve_reasoning is not none %}
9
+ {%- set _preserve_thinking = preserve_reasoning %}
10
+ {%- elif preserve_thinking is defined and preserve_thinking is not none %}
11
+ {%- set _preserve_thinking = preserve_thinking %}
12
+ {%- else %}
13
+ {%- set _preserve_thinking = true %}
14
+ {%- endif %}
15
+ {%- set max_tool_arg_chars = max_tool_arg_chars if max_tool_arg_chars is defined else 0 %}
16
+ {%- set max_tool_response_chars = max_tool_response_chars if max_tool_response_chars is defined else 0 %}
17
+ {%- set _default_reasoning_effort = 'medium' %}
18
+ {%- set _has_tools = (tools is defined and tools and tools is iterable and tools is not mapping) %}
19
+ {%- set _effort_raw = (reasoning_effort | string | lower) if reasoning_effort is defined and reasoning_effort is not none else _default_reasoning_effort %}
20
+ {%- set _initial_thinking = enable_thinking %}
21
+ {%- if _effort_raw in ('none', 'off') %}
22
+ {%- set _initial_thinking = false %}
23
+ {%- set _initial_effort = 'medium' %}
24
+ {%- elif _effort_raw in ('minimal', 'low') %}
25
+ {%- set _initial_effort = 'low' %}
26
+ {%- elif _effort_raw in ('high', 'xhigh', 'max', 'ultracode', 'extreme') %}
27
+ {%- set _initial_effort = 'xhigh' %}
28
+ {%- else %}
29
+ {%- set _initial_effort = 'medium' %}
30
+ {%- endif %}
31
+ {%- set ns_state = namespace(thinking=_initial_thinking, effort=_initial_effort) %}
32
+ {%- if auto_disable_thinking_with_tools and _has_tools %}
33
+ {%- set ns_state.thinking = false %}
34
+ {%- endif %}
35
+ {%- for msg in messages %}
36
+ {%- if msg.role == 'system' or msg.role == 'developer' or msg.role == 'user' %}
37
+ {%- if msg.content is string %}
38
+ {%- if '<|think_off|>' in msg.content %}
39
+ {%- set ns_state.thinking = false %}
40
+ {%- elif '<|think_on|>' in msg.content %}
41
+ {%- set ns_state.thinking = true %}
42
+ {%- elif '<|think_xhigh|>' in msg.content or '<|think_high|>' in msg.content or '<|think_ultracode|>' in msg.content or '<|think_extreme|>' in msg.content or '<|think_max|>' in msg.content %}
43
+ {%- set ns_state.thinking = true %}
44
+ {%- set ns_state.effort = 'xhigh' %}
45
+ {%- elif '<|think_low|>' in msg.content or '<|think_minimal|>' in msg.content %}
46
+ {%- set ns_state.thinking = true %}
47
+ {%- set ns_state.effort = 'low' %}
48
+ {%- elif '<|think_medium|>' in msg.content %}
49
+ {%- set ns_state.thinking = true %}
50
+ {%- set ns_state.effort = 'medium' %}
51
+ {%- endif %}
52
+ {%- elif msg.content is iterable and msg.content is not mapping %}
53
+ {%- for item in msg.content %}
54
+ {%- if item is string %}
55
+ {%- set _item_text = item %}
56
+ {%- elif item is mapping and 'text' in item and item.text is string %}
57
+ {%- set _item_text = item.text %}
58
+ {%- else %}
59
+ {%- set _item_text = '' %}
60
+ {%- endif %}
61
+ {%- if _item_text %}
62
+ {%- if '<|think_off|>' in _item_text %}
63
+ {%- set ns_state.thinking = false %}
64
+ {%- elif '<|think_on|>' in _item_text %}
65
+ {%- set ns_state.thinking = true %}
66
+ {%- elif '<|think_xhigh|>' in _item_text or '<|think_high|>' in _item_text or '<|think_ultracode|>' in _item_text or '<|think_extreme|>' in _item_text or '<|think_max|>' in _item_text %}
67
+ {%- set ns_state.thinking = true %}
68
+ {%- set ns_state.effort = 'xhigh' %}
69
+ {%- elif '<|think_low|>' in _item_text or '<|think_minimal|>' in _item_text %}
70
+ {%- set ns_state.thinking = true %}
71
+ {%- set ns_state.effort = 'low' %}
72
+ {%- elif '<|think_medium|>' in _item_text %}
73
+ {%- set ns_state.thinking = true %}
74
+ {%- set ns_state.effort = 'medium' %}
75
+ {%- endif %}
76
+ {%- endif %}
77
+ {%- endfor %}
78
+ {%- endif %}
79
+ {%- endif %}
80
+ {%- endfor %}
81
+ {%- set reasoning_instructions = '' %}
82
+ {%- if ns_state.thinking %}
83
+ {%- if ns_state.effort == 'xhigh' %}
84
+ {%- set reasoning_instructions = 'Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.' %}
85
+ {%- elif ns_state.effort == 'low' %}
86
+ {%- set reasoning_instructions = 'Reasoning effort is set to low. Keep your thinking brief and focused, moving directly to the conclusion without unnecessary elaboration.' %}
87
+ {%- endif %}
88
+ {%- endif %}
89
+ {%- macro render_content(content, do_vision_count, is_system_content=false) %}
90
+ {%- if content is string %}
91
+ {{- content }}
92
+ {%- elif content is iterable and content is not mapping %}
93
+ {%- for item in content %}
94
+ {%- if item is mapping %}
95
+ {%- if item.type == 'image' or 'image' in item or 'image_url' in item %}
96
+ {%- if is_system_content %}
97
+ {{- raise_exception('System message cannot contain images.') }}
98
+ {%- endif %}
99
+ {%- if do_vision_count %}
100
+ {%- set image_count.value = image_count.value + 1 %}
101
+ {%- endif %}
102
+ {%- if add_vision_id %}
103
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
104
+ {%- endif %}
105
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
106
+ {%- elif item.type == 'video' or 'video' in item or 'video_url' in item %}
107
+ {%- if is_system_content %}
108
+ {{- raise_exception('System message cannot contain videos.') }}
109
+ {%- endif %}
110
+ {%- if do_vision_count %}
111
+ {%- set video_count.value = video_count.value + 1 %}
112
+ {%- endif %}
113
+ {%- if add_vision_id %}
114
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
115
+ {%- endif %}
116
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
117
+ {%- elif 'text' in item %}
118
+ {{- item.text }}
119
+ {%- else %}
120
+ {{- raise_exception('Unexpected item type in content.') }}
121
+ {%- endif %}
122
+ {%- else %}
123
+ {{- item | string }}
124
+ {%- endif %}
125
+ {%- endfor %}
126
+ {%- elif content is none or content is undefined %}
127
+ {{- '' }}
128
+ {%- else %}
129
+ {{- raise_exception('Unexpected content type.') }}
130
+ {%- endif %}
131
+ {%- endmacro %}
132
+ {%- if not messages %}
133
+ {{- raise_exception('No messages provided.') }}
134
+ {%- endif %}
135
+ {%- set head = namespace(count=0, seen_non_system=false) %}
136
+ {%- for message in messages %}
137
+ {%- set _is_sys = (message.role == 'system' or message.role == 'developer') %}
138
+ {%- if _is_sys and not head.seen_non_system %}
139
+ {%- set head.count = head.count + 1 %}
140
+ {%- else %}
141
+ {%- set head.seen_non_system = true %}
142
+ {%- endif %}
143
+ {%- endfor %}
144
+ {%- set sys_state = namespace(content='') %}
145
+ {%- for message in messages[:head.count] %}
146
+ {%- set _part = render_content(message.content, false, true) | trim %}
147
+ {%- if '<|think_off|>' in _part %}{%- set _part = _part.split('<|think_off|>') | join('') | trim %}{%- endif %}
148
+ {%- if '<|think_on|>' in _part %}{%- set _part = _part.split('<|think_on|>') | join('') | trim %}{%- endif %}
149
+ {%- if '<|think_xhigh|>' in _part %}{%- set _part = _part.split('<|think_xhigh|>') | join('') | trim %}{%- endif %}
150
+ {%- if '<|think_high|>' in _part %}{%- set _part = _part.split('<|think_high|>') | join('') | trim %}{%- endif %}
151
+ {%- if '<|think_ultracode|>' in _part %}{%- set _part = _part.split('<|think_ultracode|>') | join('') | trim %}{%- endif %}
152
+ {%- if '<|think_extreme|>' in _part %}{%- set _part = _part.split('<|think_extreme|>') | join('') | trim %}{%- endif %}
153
+ {%- if '<|think_max|>' in _part %}{%- set _part = _part.split('<|think_max|>') | join('') | trim %}{%- endif %}
154
+ {%- if '<|think_medium|>' in _part %}{%- set _part = _part.split('<|think_medium|>') | join('') | trim %}{%- endif %}
155
+ {%- if '<|think_low|>' in _part %}{%- set _part = _part.split('<|think_low|>') | join('') | trim %}{%- endif %}
156
+ {%- if '<|think_minimal|>' in _part %}{%- set _part = _part.split('<|think_minimal|>') | join('') | trim %}{%- endif %}
157
+ {%- if _part %}
158
+ {%- if sys_state.content %}
159
+ {%- set sys_state.content = sys_state.content ~ '\n\n' ~ _part %}
160
+ {%- else %}
161
+ {%- set sys_state.content = _part %}
162
+ {%- endif %}
163
+ {%- endif %}
164
+ {%- endfor %}
165
+ {%- set _sc = sys_state.content %}
166
+ {%- set _msgs = messages[head.count:] %}
167
+ {%- if ns_state.thinking %}
168
+ {%- set _terse_lead = 'You are Cyber-Tiel-Coder, a variant of Ornith-1.5-35B-A3B. Answer directly, after thinking. Lead with the answer, then only what it needs to be correct and usable.' %}
169
+ {%- else %}
170
+ {%- set _terse_lead = 'You are Cyber-Tiel-Coder, a variant of Ornith-1.5-35B-A3B. Answer directly and concisely. Give the answer with only what it needs to be correct and usable.' %}
171
+ {%- endif %}
172
+ {%- set _terse_core %}
173
+ Never: open with preamble or pleasantries; restate the question; add filler transitions; hedge with niceties; or repeat a point you've already made.
174
+ Always: keep essential steps, caveats, uncertainties, and specifics — never drop correctness or a needed warning for brevity. Keep the final answer lean. Use the least structure that conveys it (plain prose when short; lists or code only when they earn their place). If genuinely uncertain, say so and explain why — never omit uncertainty for the sake of brevity.
175
+ If a user request is genuinely ambiguous, ask a sharp question, don't guess.
176
+ {%- endset %}
177
+ {%- set _terse = _terse_lead ~ '\n' ~ (_terse_core | trim) %}
178
+ {#- `terse` chat-template kwarg: default true, so behaviour is unchanged unless a caller opts out.
179
+ Pass {"terse": false} via chat_template_kwargs to serve the model with only its own system
180
+ prompt -- useful for A/B-ing the terseness effect, or when a downstream prompt conflicts. #}
181
+ {%- set _terse_on = terse if terse is defined else true %}
182
+ {%- if _terse_on %}
183
+ {%- if not _sc %}
184
+ {%- set _sc = _terse | trim %}
185
+ {%- else %}
186
+ {%- set _sc = (_sc | trim) ~ '\n\n' ~ (_terse | trim) %}
187
+ {%- endif %}
188
+ {%- endif %}
189
+ {#- Some runtimes (LM Studio's MLX backend) have no native tool-call parser and prepend their own
190
+ protocol into the system content. Emitting ours as well gives the model two contradictory tool
191
+ protocols and it follows one at random. Detect that marker and stand down; the
192
+ `suppress_tool_instructions` kwarg overrides either way where a runtime can pass template kwargs. #}
193
+ {%- set _runtime_tool_protocol = (_sc is defined and _sc and '[TOOL_REQUEST]' in _sc) %}
194
+ {%- set _suppress_tools = suppress_tool_instructions if suppress_tool_instructions is defined else _runtime_tool_protocol %}
195
+ {%- if _has_tools and not _suppress_tools %}
196
+ {{- '<|im_start|>system\n' }}
197
+ {%- if reasoning_instructions %}
198
+ {{- reasoning_instructions + '\n\n' }}
199
+ {%- endif %}
200
+ {{- '# Tools\n\nYou have access to the following functions:\n\n<tools>' }}
201
+ {%- for tool in tools %}
202
+ {{- '\n' }}
203
+ {{- tool | tojson }}
204
+ {%- endfor %}
205
+ {{- '\n</tools>' }}
206
+ {%- if _tool_format == 'json' %}
207
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n' }}
208
+ {%- if ns_state.thinking %}
209
+ {{- '<think>\nBrief explanation of tool call\n</think>\n' }}
210
+ {%- endif %}
211
+ {{- '<tool_call>\n{"name": "example_function_name", "arguments": {"example_parameter_1": "value_1", "example_parameter_2": "This is the value for the second parameter"}}\n</tool_call>\n\n<IMPORTANT>\nReminder:\n' }}
212
+ {%- if ns_state.thinking %}
213
+ {{- '- You can use the <think></think> block to plan your next tool call OR to synthesize data and formulate your final response to the user.\n- ALL explanation and reasoning MUST be placed strictly inside the <think></think> block.\n' }}
214
+ {%- endif %}
215
+ {{- '- Function calls MUST follow the specified format: a single JSON object with "name" and "arguments" keys inside <tool_call></tool_call> XML tags.\n' }}
216
+ {%- if ns_state.thinking %}
217
+ {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY after thinking, with NO conversational text before it.\n' }}
218
+ {%- else %}
219
+ {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY, with NO conversational text before it.\n' }}
220
+ {%- endif %}
221
+ {{- '- The <tool_call> tag MUST be at the very beginning of a new line, with NO spaces or indentation before it.\n- To call multiple functions, output a separate, completely closed <tool_call></tool_call> block for EACH function. Do NOT nest <tool_call> blocks.\n- If you have all necessary data, provide your final answer directly to the user without any tool call.\n</IMPORTANT>' }}
222
+ {%- else %}
223
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n' }}
224
+ {%- if ns_state.thinking %}
225
+ {{- '<think>\nBrief explanation of tool call\n</think>\n' }}
226
+ {%- endif %}
227
+ {{- '<tool_call>\n<function=example_function_name>\n<parameter=example_parameter_1>\nvalue_1\n</parameter>\n<parameter=example_parameter_2>\nThis is the value for the second parameter\nthat can span\nmultiple lines\n</parameter>\n</function>\n</tool_call>\n\n<IMPORTANT>\nReminder:\n' }}
228
+ {%- if ns_state.thinking %}
229
+ {{- '- You can use the <think></think> block to plan your next tool call OR to synthesize data and formulate your final response to the user.\n- ALL explanation and reasoning MUST be placed strictly inside the <think></think> block.\n' }}
230
+ {%- endif %}
231
+ {{- '- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags.\n' }}
232
+ {%- if ns_state.thinking %}
233
+ {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY after thinking, with NO conversational text before it.\n' }}
234
+ {%- else %}
235
+ {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY, with NO conversational text before it.\n' }}
236
+ {%- endif %}
237
+ {{- '- The <tool_call> and <function> tags MUST be at the very beginning of a new line, with NO spaces or indentation before them.\n- To call multiple functions, output a separate, completely closed <tool_call></tool_call> block for EACH function. Do NOT nest <tool_call> blocks.\n- If you have all necessary data, provide your final answer directly to the user without any tool call.\n</IMPORTANT>' }}
238
+ {%- endif %}
239
+ {%- if _sc %}
240
+ {{- '\n\n' + _sc }}
241
+ {%- endif %}
242
+ {{- '<|im_end|>\n' }}
243
+ {%- else %}
244
+ {%- if _sc %}
245
+ {{- '<|im_start|>system\n' + (reasoning_instructions + '\n\n' if reasoning_instructions else '') + _sc + '<|im_end|>\n' }}
246
+ {%- elif reasoning_instructions %}
247
+ {{- '<|im_start|>system\n' + reasoning_instructions + '<|im_end|>\n' }}
248
+ {%- endif %}
249
+ {%- endif %}
250
+ {%- set _last_idx = _msgs | length - 1 %}
251
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=_last_idx) %}
252
+ {%- for message in _msgs[::-1] %}
253
+ {%- set index = (_msgs | length - 1) - loop.index0 %}
254
+ {%- if ns.multi_step_tool and message.role == 'user' %}
255
+ {%- set _rc = render_content(message.content, false) | trim %}
256
+ {%- if not (_rc.startswith('<tool_response>') and _rc.endswith('</tool_response>')) %}
257
+ {%- set ns.multi_step_tool = false %}
258
+ {%- set ns.last_query_index = index %}
259
+ {%- endif %}
260
+ {%- endif %}
261
+ {%- endfor %}
262
+ {%- if ns.multi_step_tool %}
263
+ {%- if _last_idx > 50 %}
264
+ {%- set ns.last_query_index = _last_idx %}
265
+ {%- else %}
266
+ {%- set ns.last_query_index = 0 %}
267
+ {%- endif %}
268
+ {%- endif %}
269
+ {%- set ns2 = namespace(prev_role='', consecutive_failures=0) %}
270
+ {%- for message in _msgs %}
271
+ {%- set is_system = (message.role == "system" or message.role == "developer") %}
272
+ {%- set content = render_content(message.content, true, is_system) | trim %}
273
+ {%- if is_system or message.role == 'user' %}
274
+ {%- if '<|think_off|>' in content %}{%- set content = content.split('<|think_off|>') | join('') | trim %}{%- endif %}
275
+ {%- if '<|think_on|>' in content %}{%- set content = content.split('<|think_on|>') | join('') | trim %}{%- endif %}
276
+ {%- if '<|think_xhigh|>' in content %}{%- set content = content.split('<|think_xhigh|>') | join('') | trim %}{%- endif %}
277
+ {%- if '<|think_high|>' in content %}{%- set content = content.split('<|think_high|>') | join('') | trim %}{%- endif %}
278
+ {%- if '<|think_ultracode|>' in content %}{%- set content = content.split('<|think_ultracode|>') | join('') | trim %}{%- endif %}
279
+ {%- if '<|think_extreme|>' in content %}{%- set content = content.split('<|think_extreme|>') | join('') | trim %}{%- endif %}
280
+ {%- if '<|think_max|>' in content %}{%- set content = content.split('<|think_max|>') | join('') | trim %}{%- endif %}
281
+ {%- if '<|think_medium|>' in content %}{%- set content = content.split('<|think_medium|>') | join('') | trim %}{%- endif %}
282
+ {%- if '<|think_low|>' in content %}{%- set content = content.split('<|think_low|>') | join('') | trim %}{%- endif %}
283
+ {%- if '<|think_minimal|>' in content %}{%- set content = content.split('<|think_minimal|>') | join('') | trim %}{%- endif %}
284
+ {%- endif %}
285
+ {%- if is_system %}
286
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
287
+ {%- elif message.role == 'user' %}
288
+ {%- set ns2.consecutive_failures = 0 %}
289
+ {{- '<|im_start|>user\n' + content + '<|im_end|>\n' }}
290
+ {%- elif message.role == 'assistant' %}
291
+ {%- set reasoning_content = '' %}
292
+ {%- set _explicit_reasoning = '' %}
293
+ {%- if message.reasoning_content is defined and message.reasoning_content is not none %}
294
+ {%- if message.reasoning_content is string %}
295
+ {%- set _explicit_reasoning = message.reasoning_content %}
296
+ {%- else %}
297
+ {%- set _explicit_reasoning = message.reasoning_content | string %}
298
+ {%- endif %}
299
+ {%- elif message.thinking is defined and message.thinking is not none %}
300
+ {%- if message.thinking is string %}
301
+ {%- set _explicit_reasoning = message.thinking %}
302
+ {%- else %}
303
+ {%- set _explicit_reasoning = message.thinking | string %}
304
+ {%- endif %}
305
+ {%- elif message.reasoning is defined and message.reasoning is not none %}
306
+ {%- if message.reasoning is string %}
307
+ {%- set _explicit_reasoning = message.reasoning %}
308
+ {%- else %}
309
+ {%- set _explicit_reasoning = message.reasoning | string %}
310
+ {%- endif %}
311
+ {%- endif %}
312
+ {%- if _explicit_reasoning %}
313
+ {%- set _lead_end = '' %}
314
+ {%- if content.startswith('<think>') and '</think>' in content %}
315
+ {%- set _lead_end = '</think>' %}
316
+ {%- elif content.startswith('<thinking>') and '</thinking>' in content %}
317
+ {%- set _lead_end = '</thinking>' %}
318
+ {%- elif content.startswith('</think>') %}
319
+ {%- set _lead_end = '</think>' %}
320
+ {%- elif content.startswith('</thinking>') %}
321
+ {%- set _lead_end = '</thinking>' %}
322
+ {%- endif %}
323
+ {%- if _lead_end %}
324
+ {%- set content = content.split(_lead_end)[-1].lstrip('\n') %}
325
+ {%- endif %}
326
+ {%- set reasoning_content = _explicit_reasoning %}
327
+ {%- else %}
328
+ {%- set _think_end = '' %}
329
+ {%- if content.startswith('</think>') %}
330
+ {%- set _think_end = '</think>' %}
331
+ {%- elif content.startswith('</thinking>') %}
332
+ {%- set _think_end = '</thinking>' %}
333
+ {%- elif '\n</think>' in content %}
334
+ {%- set _think_end = '\n</think>' %}
335
+ {%- elif '\n</thinking>' in content %}
336
+ {%- set _think_end = '\n</thinking>' %}
337
+ {%- elif '\n</ think>' in content %}
338
+ {%- set _think_end = '\n</ think>' %}
339
+ {%- elif '\n</think >' in content %}
340
+ {%- set _think_end = '\n</think >' %}
341
+ {%- elif content.startswith('<think>') and '</think>' in content %}
342
+ {%- set _think_end = '</think>' %}
343
+ {%- elif content.startswith('<thinking>') and '</thinking>' in content %}
344
+ {%- set _think_end = '</thinking>' %}
345
+ {%- endif %}
346
+ {%- if _think_end %}
347
+ {%- if 'thinking' in _think_end %}
348
+ {%- set _think_start = '<thinking>' %}
349
+ {%- else %}
350
+ {%- set _think_start = '<think>' %}
351
+ {%- endif %}
352
+ {%- set reasoning_content = content.split(_think_end)[0].rstrip('\n') %}
353
+ {%- if _think_start in reasoning_content %}
354
+ {%- set reasoning_content = reasoning_content.split(_think_start)[-1].lstrip('\n') %}
355
+ {%- endif %}
356
+ {%- set content = content.split(_think_end)[-1].lstrip('\n') %}
357
+ {%- endif %}
358
+ {%- endif %}
359
+ {%- set reasoning_content = reasoning_content | trim %}
360
+ {%- if (_preserve_thinking or loop.index0 > ns.last_query_index) %}
361
+ {{- '<|im_start|>assistant\n<think>\n' + reasoning_content + '\n</think>\n\n' + content }}
362
+ {%- else %}
363
+ {{- '<|im_start|>assistant\n' + content }}
364
+ {%- endif %}
365
+ {%- if message.tool_calls is defined and message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
366
+ {%- for tool_call in message.tool_calls %}
367
+ {%- if tool_call.function is defined and tool_call.function is not none %}
368
+ {%- set tc = tool_call.function %}
369
+ {%- else %}
370
+ {%- set tc = tool_call %}
371
+ {%- endif %}
372
+ {%- set tc_name = tc.name if (tc.name is defined and tc.name is not none) else '' %}
373
+ {%- if _tool_format == 'json' %}
374
+ {%- if loop.first %}
375
+ {%- if content | trim %}
376
+ {{- '\n\n' }}
377
+ {%- endif %}
378
+ {%- else %}
379
+ {{- '\n' }}
380
+ {%- endif %}
381
+ {%- set _args = '{}' %}
382
+ {%- if tc.arguments is defined and tc.arguments is not none %}
383
+ {%- if tc.arguments is mapping %}
384
+ {%- set _args = tc.arguments | tojson %}
385
+ {%- elif tc.arguments is string %}
386
+ {%- if tc.arguments %}
387
+ {%- set _args = tc.arguments %}
388
+ {%- endif %}
389
+ {%- else %}
390
+ {%- set _args = tc.arguments | tojson %}
391
+ {%- endif %}
392
+ {%- endif %}
393
+ {{- '<tool_call>\n{"name": ' }}{{- tc_name | tojson }}{{- ', "arguments": ' }}{{- _args }}{{- '}\n</tool_call>' }}
394
+ {%- else %}
395
+ {%- if loop.first %}
396
+ {%- if content | trim %}
397
+ {{- '\n\n<tool_call>\n<function=' + tc_name + '>\n' }}
398
+ {%- else %}
399
+ {{- '<tool_call>\n<function=' + tc_name + '>\n' }}
400
+ {%- endif %}
401
+ {%- else %}
402
+ {{- '\n<tool_call>\n<function=' + tc_name + '>\n' }}
403
+ {%- endif %}
404
+ {%- if tc.arguments is defined and tc.arguments is not none %}
405
+ {%- if tc.arguments is mapping %}
406
+ {%- for args_name, args_value in tc.arguments.items() %}
407
+ {{- '<parameter=' + args_name + '>\n' }}
408
+ {%- if args_value is string %}
409
+ {%- set _av = args_value %}
410
+ {%- else %}
411
+ {%- set _av = args_value | tojson %}
412
+ {%- endif %}
413
+ {%- if max_tool_arg_chars > 0 and _av | length > max_tool_arg_chars %}
414
+ {{- _av[:max_tool_arg_chars] + '\n[TRUNCATED - original length ' ~ (_av | length | string) ~ ' chars]' }}
415
+ {%- else %}
416
+ {{- _av }}
417
+ {%- endif %}
418
+ {{- '\n</parameter>\n' }}
419
+ {%- endfor %}
420
+ {%- else %}
421
+ {%- if tc.arguments is string %}
422
+ {%- set _raw_args = tc.arguments %}
423
+ {%- else %}
424
+ {%- set _raw_args = tc.arguments | tojson %}
425
+ {%- endif %}
426
+ {%- if _raw_args %}
427
+ {%- if max_tool_arg_chars > 0 and _raw_args | length > max_tool_arg_chars %}
428
+ {{- _raw_args[:max_tool_arg_chars] + '\n[TRUNCATED - original length ' ~ (_raw_args | length | string) ~ ' chars]' }}
429
+ {%- else %}
430
+ {{- _raw_args }}
431
+ {%- endif %}
432
+ {%- endif %}
433
+ {%- endif %}
434
+ {%- endif %}
435
+ {{- '</function>\n</tool_call>' }}
436
+ {%- endif %}
437
+ {%- endfor %}
438
+ {%- endif %}
439
+ {{- '<|im_end|>\n' }}
440
+ {%- elif message.role == 'tool' %}
441
+ {%- set _content_lower = content | lower %}
442
+ {%- set _content_head = _content_lower[:120] %}
443
+ {%- set _is_code_or_grep = ('throw new ' in _content_lower or 'throw error' in _content_lower or 'console.error' in _content_lower or 'logger.error' in _content_lower or 'logging.error' in _content_lower or 'import ' in _content_head or 'def ' in _content_head or 'function ' in _content_head) %}
444
+ {%- set _exit_code_zero = ('exit code: 0' in _content_head or 'process exited with code 0' in _content_head) %}
445
+ {%- set _error_field_ok = ('"error": null' in _content_head or '"error":null' in _content_head or '"error": false' in _content_head or '"error":false' in _content_head or '"error": ""' in _content_head or '"error":""' in _content_head) %}
446
+ {%- set _strong_error = (('"error":' in _content_head and not _error_field_ok) or '"status": "error"' in _content_head or '"status":"error"' in _content_head or 'traceback (most recent call last):' in _content_head or 'command not found' in _content_head or 'invalid syntax' in _content_head or 'fatal:' in _content_head or (('exit code: ' in _content_head or 'process exited with code' in _content_head) and not _exit_code_zero) or _content_head.startswith('exception:') or _content_head.startswith('failed to ')) %}
447
+ {%- set _weak_error = ('error:' in _content_head or 'err!' in _content_head) %}
448
+ {%- set _weak_suppressed = ('$ ' in _content_head or 'took ' in _content_head or content | length >= 600) %}
449
+ {%- if not _is_code_or_grep and (_strong_error or (_weak_error and not _weak_suppressed)) %}
450
+ {%- set ns2.consecutive_failures = ns2.consecutive_failures + 1 %}
451
+ {%- else %}
452
+ {%- set ns2.consecutive_failures = 0 %}
453
+ {%- endif %}
454
+ {%- if ns2.prev_role != 'tool' %}
455
+ {{- '<|im_start|>user' }}
456
+ {%- endif %}
457
+ {%- set _is_json_payload = (_tool_format == 'json' and content | trim | length > 0 and (content | trim)[:1] in ('{', '[')) %}
458
+ {%- if not _is_json_payload and max_tool_response_chars > 0 and content | length > max_tool_response_chars %}
459
+ {%- set content = content[:max_tool_response_chars] + '\n[TRUNCATED - original length ' ~ (content | length | string) ~ ' chars]' %}
460
+ {%- endif %}
461
+ {{- '\n<tool_response>\n' + content }}
462
+ {%- if ns2.consecutive_failures >= 2 %}
463
+ {{- '\n\n⚠️ SYSTEM WARNING: ' ~ ns2.consecutive_failures ~ ' consecutive tool errors detected. Your previous approach is incorrect. You MUST use a fundamentally different approach or corrected arguments.' }}
464
+ {%- elif ns2.consecutive_failures == 1 %}
465
+ {{- '\n\n⚠️ SYSTEM WARNING: The previous tool call returned an error. Diagnose the failure and retry with completely corrected arguments.' }}
466
+ {%- endif %}
467
+ {{- '\n</tool_response>' }}
468
+ {%- if loop.last %}
469
+ {{- '<|im_end|>\n' }}
470
+ {%- else %}
471
+ {%- set _next_role = _msgs[loop.index0 + 1].role %}
472
+ {%- if _next_role != 'tool' %}
473
+ {{- '<|im_end|>\n' }}
474
+ {%- endif %}
475
+ {%- endif %}
476
+ {%- else %}
477
+ {{- '<|im_start|>user\n[' + message.role + ']: ' + content + '<|im_end|>\n' }}
478
+ {%- endif %}
479
+ {%- set ns2.prev_role = message.role %}
480
+ {%- endfor %}
481
+ {%- if add_generation_prompt %}
482
+ {{- '<|im_start|>assistant\n' }}
483
+ {%- if not ns_state.thinking %}
484
+ {{- '<think>\n\n</think>\n\n' }}
485
+ {%- else %}
486
+ {{- '<think>\n' }}
487
+ {%- endif %}
488
+ {%- endif %}
config.json ADDED
@@ -0,0 +1,3085 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3_5MoeForConditionalGeneration"
4
+ ],
5
+ "bos_token_id": null,
6
+ "dtype": "bfloat16",
7
+ "eos_token_id": 248046,
8
+ "hidden_size": 2048,
9
+ "image_token_id": 248056,
10
+ "model_type": "qwen3_5_moe",
11
+ "pad_token_id": 248044,
12
+ "text_config": {
13
+ "attention_bias": false,
14
+ "attention_dropout": 0.0,
15
+ "attn_output_gate": true,
16
+ "bos_token_id": 248044,
17
+ "dtype": "bfloat16",
18
+ "eos_token_id": 248044,
19
+ "full_attention_interval": 4,
20
+ "head_dim": 256,
21
+ "hidden_act": "silu",
22
+ "hidden_size": 2048,
23
+ "initializer_range": 0.02,
24
+ "layer_types": [
25
+ "linear_attention",
26
+ "linear_attention",
27
+ "linear_attention",
28
+ "full_attention",
29
+ "linear_attention",
30
+ "linear_attention",
31
+ "linear_attention",
32
+ "full_attention",
33
+ "linear_attention",
34
+ "linear_attention",
35
+ "linear_attention",
36
+ "full_attention",
37
+ "linear_attention",
38
+ "linear_attention",
39
+ "linear_attention",
40
+ "full_attention",
41
+ "linear_attention",
42
+ "linear_attention",
43
+ "linear_attention",
44
+ "full_attention",
45
+ "linear_attention",
46
+ "linear_attention",
47
+ "linear_attention",
48
+ "full_attention",
49
+ "linear_attention",
50
+ "linear_attention",
51
+ "linear_attention",
52
+ "full_attention",
53
+ "linear_attention",
54
+ "linear_attention",
55
+ "linear_attention",
56
+ "full_attention",
57
+ "linear_attention",
58
+ "linear_attention",
59
+ "linear_attention",
60
+ "full_attention",
61
+ "linear_attention",
62
+ "linear_attention",
63
+ "linear_attention",
64
+ "full_attention"
65
+ ],
66
+ "linear_conv_kernel_dim": 4,
67
+ "linear_key_head_dim": 128,
68
+ "linear_num_key_heads": 16,
69
+ "linear_num_value_heads": 32,
70
+ "linear_value_head_dim": 128,
71
+ "mamba_ssm_dtype": "float32",
72
+ "max_position_embeddings": 262144,
73
+ "model_type": "qwen3_5_moe_text",
74
+ "moe_intermediate_size": 512,
75
+ "mtp_num_hidden_layers": 1,
76
+ "mtp_use_dedicated_embeddings": false,
77
+ "num_attention_heads": 16,
78
+ "num_experts": 256,
79
+ "num_experts_per_tok": 8,
80
+ "num_hidden_layers": 40,
81
+ "num_key_value_heads": 2,
82
+ "output_router_logits": false,
83
+ "pad_token_id": 248044,
84
+ "partial_rotary_factor": 0.25,
85
+ "rms_norm_eps": 1e-06,
86
+ "rope_parameters": {
87
+ "mrope_interleaved": true,
88
+ "mrope_section": [
89
+ 11,
90
+ 11,
91
+ 10
92
+ ],
93
+ "partial_rotary_factor": 0.25,
94
+ "rope_theta": 10000000,
95
+ "type": "default"
96
+ },
97
+ "router_aux_loss_coef": 0.0,
98
+ "shared_expert_intermediate_size": 512,
99
+ "tie_word_embeddings": false,
100
+ "use_cache": false,
101
+ "vocab_size": 248320
102
+ },
103
+ "tie_word_embeddings": false,
104
+ "transformers_version": "5.8.1",
105
+ "video_token_id": 248057,
106
+ "vision_config": {
107
+ "deepstack_visual_indexes": [],
108
+ "depth": 27,
109
+ "dtype": "bfloat16",
110
+ "hidden_act": "gelu_pytorch_tanh",
111
+ "hidden_size": 1152,
112
+ "in_channels": 3,
113
+ "initializer_range": 0.02,
114
+ "intermediate_size": 4304,
115
+ "model_type": "qwen3_5_moe_vision",
116
+ "num_heads": 16,
117
+ "num_position_embeddings": 2304,
118
+ "out_hidden_size": 2048,
119
+ "patch_size": 16,
120
+ "spatial_merge_size": 2,
121
+ "temporal_patch_size": 2
122
+ },
123
+ "vision_end_token_id": 248054,
124
+ "vision_start_token_id": 248053,
125
+ "quantization": {
126
+ "group_size": 64,
127
+ "bits": 6,
128
+ "mode": "affine",
129
+ "language_model.model.embed_tokens": {
130
+ "bits": 8,
131
+ "group_size": 64,
132
+ "mode": "affine"
133
+ },
134
+ "language_model.model.layers.0.linear_attn.in_proj_a": {
135
+ "bits": 8,
136
+ "group_size": 64,
137
+ "mode": "affine"
138
+ },
139
+ "language_model.model.layers.0.linear_attn.in_proj_b": {
140
+ "bits": 8,
141
+ "group_size": 64,
142
+ "mode": "affine"
143
+ },
144
+ "language_model.model.layers.0.linear_attn.in_proj_qkv": {
145
+ "bits": 8,
146
+ "group_size": 64,
147
+ "mode": "affine"
148
+ },
149
+ "language_model.model.layers.0.linear_attn.in_proj_z": {
150
+ "bits": 8,
151
+ "group_size": 64,
152
+ "mode": "affine"
153
+ },
154
+ "language_model.model.layers.0.linear_attn.out_proj": {
155
+ "bits": 6,
156
+ "group_size": 128,
157
+ "mode": "affine"
158
+ },
159
+ "language_model.model.layers.0.mlp.shared_expert.down_proj": {
160
+ "bits": 8,
161
+ "group_size": 128,
162
+ "mode": "affine"
163
+ },
164
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj": {
165
+ "bits": 8,
166
+ "group_size": 128,
167
+ "mode": "affine"
168
+ },
169
+ "language_model.model.layers.0.mlp.shared_expert.up_proj": {
170
+ "bits": 8,
171
+ "group_size": 128,
172
+ "mode": "affine"
173
+ },
174
+ "language_model.model.layers.0.mlp.shared_expert_gate": {
175
+ "bits": 8,
176
+ "group_size": 64,
177
+ "mode": "affine"
178
+ },
179
+ "language_model.model.layers.1.linear_attn.in_proj_a": {
180
+ "bits": 8,
181
+ "group_size": 64,
182
+ "mode": "affine"
183
+ },
184
+ "language_model.model.layers.1.linear_attn.in_proj_b": {
185
+ "bits": 8,
186
+ "group_size": 64,
187
+ "mode": "affine"
188
+ },
189
+ "language_model.model.layers.1.linear_attn.in_proj_qkv": {
190
+ "bits": 8,
191
+ "group_size": 64,
192
+ "mode": "affine"
193
+ },
194
+ "language_model.model.layers.1.linear_attn.in_proj_z": {
195
+ "bits": 8,
196
+ "group_size": 64,
197
+ "mode": "affine"
198
+ },
199
+ "language_model.model.layers.1.linear_attn.out_proj": {
200
+ "bits": 6,
201
+ "group_size": 128,
202
+ "mode": "affine"
203
+ },
204
+ "language_model.model.layers.1.mlp.shared_expert.down_proj": {
205
+ "bits": 8,
206
+ "group_size": 128,
207
+ "mode": "affine"
208
+ },
209
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj": {
210
+ "bits": 8,
211
+ "group_size": 128,
212
+ "mode": "affine"
213
+ },
214
+ "language_model.model.layers.1.mlp.shared_expert.up_proj": {
215
+ "bits": 8,
216
+ "group_size": 128,
217
+ "mode": "affine"
218
+ },
219
+ "language_model.model.layers.1.mlp.shared_expert_gate": {
220
+ "bits": 8,
221
+ "group_size": 64,
222
+ "mode": "affine"
223
+ },
224
+ "language_model.model.layers.2.linear_attn.in_proj_a": {
225
+ "bits": 8,
226
+ "group_size": 64,
227
+ "mode": "affine"
228
+ },
229
+ "language_model.model.layers.2.linear_attn.in_proj_b": {
230
+ "bits": 8,
231
+ "group_size": 64,
232
+ "mode": "affine"
233
+ },
234
+ "language_model.model.layers.2.linear_attn.in_proj_qkv": {
235
+ "bits": 8,
236
+ "group_size": 64,
237
+ "mode": "affine"
238
+ },
239
+ "language_model.model.layers.2.linear_attn.in_proj_z": {
240
+ "bits": 8,
241
+ "group_size": 64,
242
+ "mode": "affine"
243
+ },
244
+ "language_model.model.layers.2.linear_attn.out_proj": {
245
+ "bits": 6,
246
+ "group_size": 128,
247
+ "mode": "affine"
248
+ },
249
+ "language_model.model.layers.2.mlp.shared_expert.down_proj": {
250
+ "bits": 8,
251
+ "group_size": 128,
252
+ "mode": "affine"
253
+ },
254
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj": {
255
+ "bits": 8,
256
+ "group_size": 128,
257
+ "mode": "affine"
258
+ },
259
+ "language_model.model.layers.2.mlp.shared_expert.up_proj": {
260
+ "bits": 8,
261
+ "group_size": 128,
262
+ "mode": "affine"
263
+ },
264
+ "language_model.model.layers.2.mlp.shared_expert_gate": {
265
+ "bits": 8,
266
+ "group_size": 64,
267
+ "mode": "affine"
268
+ },
269
+ "language_model.model.layers.3.mlp.shared_expert.down_proj": {
270
+ "bits": 8,
271
+ "group_size": 128,
272
+ "mode": "affine"
273
+ },
274
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj": {
275
+ "bits": 8,
276
+ "group_size": 128,
277
+ "mode": "affine"
278
+ },
279
+ "language_model.model.layers.3.mlp.shared_expert.up_proj": {
280
+ "bits": 8,
281
+ "group_size": 128,
282
+ "mode": "affine"
283
+ },
284
+ "language_model.model.layers.3.mlp.shared_expert_gate": {
285
+ "bits": 8,
286
+ "group_size": 64,
287
+ "mode": "affine"
288
+ },
289
+ "language_model.model.layers.3.self_attn.k_proj": {
290
+ "bits": 8,
291
+ "group_size": 64,
292
+ "mode": "affine"
293
+ },
294
+ "language_model.model.layers.3.self_attn.o_proj": {
295
+ "bits": 8,
296
+ "group_size": 64,
297
+ "mode": "affine"
298
+ },
299
+ "language_model.model.layers.3.self_attn.q_proj": {
300
+ "bits": 8,
301
+ "group_size": 64,
302
+ "mode": "affine"
303
+ },
304
+ "language_model.model.layers.3.self_attn.v_proj": {
305
+ "bits": 8,
306
+ "group_size": 64,
307
+ "mode": "affine"
308
+ },
309
+ "language_model.model.layers.4.linear_attn.in_proj_a": {
310
+ "bits": 8,
311
+ "group_size": 64,
312
+ "mode": "affine"
313
+ },
314
+ "language_model.model.layers.4.linear_attn.in_proj_b": {
315
+ "bits": 8,
316
+ "group_size": 64,
317
+ "mode": "affine"
318
+ },
319
+ "language_model.model.layers.4.linear_attn.in_proj_qkv": {
320
+ "bits": 8,
321
+ "group_size": 64,
322
+ "mode": "affine"
323
+ },
324
+ "language_model.model.layers.4.linear_attn.in_proj_z": {
325
+ "bits": 8,
326
+ "group_size": 64,
327
+ "mode": "affine"
328
+ },
329
+ "language_model.model.layers.4.linear_attn.out_proj": {
330
+ "bits": 6,
331
+ "group_size": 128,
332
+ "mode": "affine"
333
+ },
334
+ "language_model.model.layers.4.mlp.shared_expert.down_proj": {
335
+ "bits": 8,
336
+ "group_size": 128,
337
+ "mode": "affine"
338
+ },
339
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj": {
340
+ "bits": 8,
341
+ "group_size": 128,
342
+ "mode": "affine"
343
+ },
344
+ "language_model.model.layers.4.mlp.shared_expert.up_proj": {
345
+ "bits": 8,
346
+ "group_size": 128,
347
+ "mode": "affine"
348
+ },
349
+ "language_model.model.layers.4.mlp.shared_expert_gate": {
350
+ "bits": 8,
351
+ "group_size": 64,
352
+ "mode": "affine"
353
+ },
354
+ "language_model.model.layers.5.linear_attn.in_proj_a": {
355
+ "bits": 8,
356
+ "group_size": 64,
357
+ "mode": "affine"
358
+ },
359
+ "language_model.model.layers.5.linear_attn.in_proj_b": {
360
+ "bits": 8,
361
+ "group_size": 64,
362
+ "mode": "affine"
363
+ },
364
+ "language_model.model.layers.5.linear_attn.in_proj_qkv": {
365
+ "bits": 8,
366
+ "group_size": 64,
367
+ "mode": "affine"
368
+ },
369
+ "language_model.model.layers.5.linear_attn.in_proj_z": {
370
+ "bits": 8,
371
+ "group_size": 64,
372
+ "mode": "affine"
373
+ },
374
+ "language_model.model.layers.5.linear_attn.out_proj": {
375
+ "bits": 6,
376
+ "group_size": 128,
377
+ "mode": "affine"
378
+ },
379
+ "language_model.model.layers.5.mlp.shared_expert.down_proj": {
380
+ "bits": 8,
381
+ "group_size": 128,
382
+ "mode": "affine"
383
+ },
384
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj": {
385
+ "bits": 8,
386
+ "group_size": 128,
387
+ "mode": "affine"
388
+ },
389
+ "language_model.model.layers.5.mlp.shared_expert.up_proj": {
390
+ "bits": 8,
391
+ "group_size": 128,
392
+ "mode": "affine"
393
+ },
394
+ "language_model.model.layers.5.mlp.shared_expert_gate": {
395
+ "bits": 8,
396
+ "group_size": 64,
397
+ "mode": "affine"
398
+ },
399
+ "language_model.model.layers.6.linear_attn.in_proj_a": {
400
+ "bits": 8,
401
+ "group_size": 64,
402
+ "mode": "affine"
403
+ },
404
+ "language_model.model.layers.6.linear_attn.in_proj_b": {
405
+ "bits": 8,
406
+ "group_size": 64,
407
+ "mode": "affine"
408
+ },
409
+ "language_model.model.layers.6.linear_attn.in_proj_qkv": {
410
+ "bits": 8,
411
+ "group_size": 64,
412
+ "mode": "affine"
413
+ },
414
+ "language_model.model.layers.6.linear_attn.in_proj_z": {
415
+ "bits": 8,
416
+ "group_size": 64,
417
+ "mode": "affine"
418
+ },
419
+ "language_model.model.layers.6.linear_attn.out_proj": {
420
+ "bits": 6,
421
+ "group_size": 128,
422
+ "mode": "affine"
423
+ },
424
+ "language_model.model.layers.6.mlp.shared_expert.down_proj": {
425
+ "bits": 8,
426
+ "group_size": 128,
427
+ "mode": "affine"
428
+ },
429
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj": {
430
+ "bits": 8,
431
+ "group_size": 128,
432
+ "mode": "affine"
433
+ },
434
+ "language_model.model.layers.6.mlp.shared_expert.up_proj": {
435
+ "bits": 8,
436
+ "group_size": 128,
437
+ "mode": "affine"
438
+ },
439
+ "language_model.model.layers.6.mlp.shared_expert_gate": {
440
+ "bits": 8,
441
+ "group_size": 64,
442
+ "mode": "affine"
443
+ },
444
+ "language_model.model.layers.7.mlp.shared_expert.down_proj": {
445
+ "bits": 8,
446
+ "group_size": 128,
447
+ "mode": "affine"
448
+ },
449
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj": {
450
+ "bits": 8,
451
+ "group_size": 128,
452
+ "mode": "affine"
453
+ },
454
+ "language_model.model.layers.7.mlp.shared_expert.up_proj": {
455
+ "bits": 8,
456
+ "group_size": 128,
457
+ "mode": "affine"
458
+ },
459
+ "language_model.model.layers.7.mlp.shared_expert_gate": {
460
+ "bits": 8,
461
+ "group_size": 64,
462
+ "mode": "affine"
463
+ },
464
+ "language_model.model.layers.7.self_attn.k_proj": {
465
+ "bits": 8,
466
+ "group_size": 64,
467
+ "mode": "affine"
468
+ },
469
+ "language_model.model.layers.7.self_attn.o_proj": {
470
+ "bits": 8,
471
+ "group_size": 64,
472
+ "mode": "affine"
473
+ },
474
+ "language_model.model.layers.7.self_attn.q_proj": {
475
+ "bits": 8,
476
+ "group_size": 64,
477
+ "mode": "affine"
478
+ },
479
+ "language_model.model.layers.7.self_attn.v_proj": {
480
+ "bits": 8,
481
+ "group_size": 64,
482
+ "mode": "affine"
483
+ },
484
+ "language_model.model.layers.8.linear_attn.in_proj_a": {
485
+ "bits": 8,
486
+ "group_size": 64,
487
+ "mode": "affine"
488
+ },
489
+ "language_model.model.layers.8.linear_attn.in_proj_b": {
490
+ "bits": 8,
491
+ "group_size": 64,
492
+ "mode": "affine"
493
+ },
494
+ "language_model.model.layers.8.linear_attn.in_proj_qkv": {
495
+ "bits": 8,
496
+ "group_size": 64,
497
+ "mode": "affine"
498
+ },
499
+ "language_model.model.layers.8.linear_attn.in_proj_z": {
500
+ "bits": 8,
501
+ "group_size": 64,
502
+ "mode": "affine"
503
+ },
504
+ "language_model.model.layers.8.linear_attn.out_proj": {
505
+ "bits": 6,
506
+ "group_size": 128,
507
+ "mode": "affine"
508
+ },
509
+ "language_model.model.layers.8.mlp.shared_expert.down_proj": {
510
+ "bits": 8,
511
+ "group_size": 128,
512
+ "mode": "affine"
513
+ },
514
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj": {
515
+ "bits": 8,
516
+ "group_size": 128,
517
+ "mode": "affine"
518
+ },
519
+ "language_model.model.layers.8.mlp.shared_expert.up_proj": {
520
+ "bits": 8,
521
+ "group_size": 128,
522
+ "mode": "affine"
523
+ },
524
+ "language_model.model.layers.8.mlp.shared_expert_gate": {
525
+ "bits": 8,
526
+ "group_size": 64,
527
+ "mode": "affine"
528
+ },
529
+ "language_model.model.layers.9.linear_attn.in_proj_a": {
530
+ "bits": 8,
531
+ "group_size": 64,
532
+ "mode": "affine"
533
+ },
534
+ "language_model.model.layers.9.linear_attn.in_proj_b": {
535
+ "bits": 8,
536
+ "group_size": 64,
537
+ "mode": "affine"
538
+ },
539
+ "language_model.model.layers.9.linear_attn.in_proj_qkv": {
540
+ "bits": 8,
541
+ "group_size": 64,
542
+ "mode": "affine"
543
+ },
544
+ "language_model.model.layers.9.linear_attn.in_proj_z": {
545
+ "bits": 8,
546
+ "group_size": 64,
547
+ "mode": "affine"
548
+ },
549
+ "language_model.model.layers.9.linear_attn.out_proj": {
550
+ "bits": 6,
551
+ "group_size": 128,
552
+ "mode": "affine"
553
+ },
554
+ "language_model.model.layers.9.mlp.shared_expert.down_proj": {
555
+ "bits": 8,
556
+ "group_size": 128,
557
+ "mode": "affine"
558
+ },
559
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj": {
560
+ "bits": 8,
561
+ "group_size": 128,
562
+ "mode": "affine"
563
+ },
564
+ "language_model.model.layers.9.mlp.shared_expert.up_proj": {
565
+ "bits": 8,
566
+ "group_size": 128,
567
+ "mode": "affine"
568
+ },
569
+ "language_model.model.layers.9.mlp.shared_expert_gate": {
570
+ "bits": 8,
571
+ "group_size": 64,
572
+ "mode": "affine"
573
+ },
574
+ "language_model.model.layers.10.linear_attn.in_proj_a": {
575
+ "bits": 8,
576
+ "group_size": 64,
577
+ "mode": "affine"
578
+ },
579
+ "language_model.model.layers.10.linear_attn.in_proj_b": {
580
+ "bits": 8,
581
+ "group_size": 64,
582
+ "mode": "affine"
583
+ },
584
+ "language_model.model.layers.10.linear_attn.in_proj_qkv": {
585
+ "bits": 8,
586
+ "group_size": 64,
587
+ "mode": "affine"
588
+ },
589
+ "language_model.model.layers.10.linear_attn.in_proj_z": {
590
+ "bits": 8,
591
+ "group_size": 64,
592
+ "mode": "affine"
593
+ },
594
+ "language_model.model.layers.10.linear_attn.out_proj": {
595
+ "bits": 6,
596
+ "group_size": 128,
597
+ "mode": "affine"
598
+ },
599
+ "language_model.model.layers.10.mlp.shared_expert.down_proj": {
600
+ "bits": 8,
601
+ "group_size": 128,
602
+ "mode": "affine"
603
+ },
604
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj": {
605
+ "bits": 8,
606
+ "group_size": 128,
607
+ "mode": "affine"
608
+ },
609
+ "language_model.model.layers.10.mlp.shared_expert.up_proj": {
610
+ "bits": 8,
611
+ "group_size": 128,
612
+ "mode": "affine"
613
+ },
614
+ "language_model.model.layers.10.mlp.shared_expert_gate": {
615
+ "bits": 8,
616
+ "group_size": 64,
617
+ "mode": "affine"
618
+ },
619
+ "language_model.model.layers.11.mlp.shared_expert.down_proj": {
620
+ "bits": 8,
621
+ "group_size": 128,
622
+ "mode": "affine"
623
+ },
624
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj": {
625
+ "bits": 8,
626
+ "group_size": 128,
627
+ "mode": "affine"
628
+ },
629
+ "language_model.model.layers.11.mlp.shared_expert.up_proj": {
630
+ "bits": 8,
631
+ "group_size": 128,
632
+ "mode": "affine"
633
+ },
634
+ "language_model.model.layers.11.mlp.shared_expert_gate": {
635
+ "bits": 8,
636
+ "group_size": 64,
637
+ "mode": "affine"
638
+ },
639
+ "language_model.model.layers.12.linear_attn.out_proj": {
640
+ "bits": 6,
641
+ "group_size": 128,
642
+ "mode": "affine"
643
+ },
644
+ "language_model.model.layers.12.mlp.shared_expert.down_proj": {
645
+ "bits": 8,
646
+ "group_size": 128,
647
+ "mode": "affine"
648
+ },
649
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj": {
650
+ "bits": 8,
651
+ "group_size": 128,
652
+ "mode": "affine"
653
+ },
654
+ "language_model.model.layers.12.mlp.shared_expert.up_proj": {
655
+ "bits": 8,
656
+ "group_size": 128,
657
+ "mode": "affine"
658
+ },
659
+ "language_model.model.layers.12.mlp.shared_expert_gate": {
660
+ "bits": 8,
661
+ "group_size": 64,
662
+ "mode": "affine"
663
+ },
664
+ "language_model.model.layers.13.linear_attn.out_proj": {
665
+ "bits": 6,
666
+ "group_size": 128,
667
+ "mode": "affine"
668
+ },
669
+ "language_model.model.layers.13.mlp.shared_expert.down_proj": {
670
+ "bits": 8,
671
+ "group_size": 128,
672
+ "mode": "affine"
673
+ },
674
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj": {
675
+ "bits": 8,
676
+ "group_size": 128,
677
+ "mode": "affine"
678
+ },
679
+ "language_model.model.layers.13.mlp.shared_expert.up_proj": {
680
+ "bits": 8,
681
+ "group_size": 128,
682
+ "mode": "affine"
683
+ },
684
+ "language_model.model.layers.13.mlp.shared_expert_gate": {
685
+ "bits": 8,
686
+ "group_size": 64,
687
+ "mode": "affine"
688
+ },
689
+ "language_model.model.layers.14.linear_attn.out_proj": {
690
+ "bits": 6,
691
+ "group_size": 128,
692
+ "mode": "affine"
693
+ },
694
+ "language_model.model.layers.14.mlp.shared_expert.down_proj": {
695
+ "bits": 8,
696
+ "group_size": 128,
697
+ "mode": "affine"
698
+ },
699
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj": {
700
+ "bits": 8,
701
+ "group_size": 128,
702
+ "mode": "affine"
703
+ },
704
+ "language_model.model.layers.14.mlp.shared_expert.up_proj": {
705
+ "bits": 8,
706
+ "group_size": 128,
707
+ "mode": "affine"
708
+ },
709
+ "language_model.model.layers.14.mlp.shared_expert_gate": {
710
+ "bits": 8,
711
+ "group_size": 64,
712
+ "mode": "affine"
713
+ },
714
+ "language_model.model.layers.15.mlp.shared_expert.down_proj": {
715
+ "bits": 8,
716
+ "group_size": 128,
717
+ "mode": "affine"
718
+ },
719
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj": {
720
+ "bits": 8,
721
+ "group_size": 128,
722
+ "mode": "affine"
723
+ },
724
+ "language_model.model.layers.15.mlp.shared_expert.up_proj": {
725
+ "bits": 8,
726
+ "group_size": 128,
727
+ "mode": "affine"
728
+ },
729
+ "language_model.model.layers.15.mlp.shared_expert_gate": {
730
+ "bits": 8,
731
+ "group_size": 64,
732
+ "mode": "affine"
733
+ },
734
+ "language_model.model.layers.16.linear_attn.out_proj": {
735
+ "bits": 6,
736
+ "group_size": 128,
737
+ "mode": "affine"
738
+ },
739
+ "language_model.model.layers.16.mlp.shared_expert.down_proj": {
740
+ "bits": 8,
741
+ "group_size": 128,
742
+ "mode": "affine"
743
+ },
744
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj": {
745
+ "bits": 8,
746
+ "group_size": 128,
747
+ "mode": "affine"
748
+ },
749
+ "language_model.model.layers.16.mlp.shared_expert.up_proj": {
750
+ "bits": 8,
751
+ "group_size": 128,
752
+ "mode": "affine"
753
+ },
754
+ "language_model.model.layers.16.mlp.shared_expert_gate": {
755
+ "bits": 8,
756
+ "group_size": 64,
757
+ "mode": "affine"
758
+ },
759
+ "language_model.model.layers.17.linear_attn.out_proj": {
760
+ "bits": 6,
761
+ "group_size": 128,
762
+ "mode": "affine"
763
+ },
764
+ "language_model.model.layers.17.mlp.shared_expert.down_proj": {
765
+ "bits": 8,
766
+ "group_size": 128,
767
+ "mode": "affine"
768
+ },
769
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj": {
770
+ "bits": 8,
771
+ "group_size": 128,
772
+ "mode": "affine"
773
+ },
774
+ "language_model.model.layers.17.mlp.shared_expert.up_proj": {
775
+ "bits": 8,
776
+ "group_size": 128,
777
+ "mode": "affine"
778
+ },
779
+ "language_model.model.layers.17.mlp.shared_expert_gate": {
780
+ "bits": 8,
781
+ "group_size": 64,
782
+ "mode": "affine"
783
+ },
784
+ "language_model.model.layers.18.linear_attn.out_proj": {
785
+ "bits": 6,
786
+ "group_size": 128,
787
+ "mode": "affine"
788
+ },
789
+ "language_model.model.layers.18.mlp.shared_expert.down_proj": {
790
+ "bits": 8,
791
+ "group_size": 128,
792
+ "mode": "affine"
793
+ },
794
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj": {
795
+ "bits": 8,
796
+ "group_size": 128,
797
+ "mode": "affine"
798
+ },
799
+ "language_model.model.layers.18.mlp.shared_expert.up_proj": {
800
+ "bits": 8,
801
+ "group_size": 128,
802
+ "mode": "affine"
803
+ },
804
+ "language_model.model.layers.18.mlp.shared_expert_gate": {
805
+ "bits": 8,
806
+ "group_size": 64,
807
+ "mode": "affine"
808
+ },
809
+ "language_model.model.layers.19.mlp.shared_expert.down_proj": {
810
+ "bits": 8,
811
+ "group_size": 128,
812
+ "mode": "affine"
813
+ },
814
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj": {
815
+ "bits": 8,
816
+ "group_size": 128,
817
+ "mode": "affine"
818
+ },
819
+ "language_model.model.layers.19.mlp.shared_expert.up_proj": {
820
+ "bits": 8,
821
+ "group_size": 128,
822
+ "mode": "affine"
823
+ },
824
+ "language_model.model.layers.19.mlp.shared_expert_gate": {
825
+ "bits": 8,
826
+ "group_size": 64,
827
+ "mode": "affine"
828
+ },
829
+ "language_model.model.layers.19.self_attn.k_proj": {
830
+ "bits": 8,
831
+ "group_size": 64,
832
+ "mode": "affine"
833
+ },
834
+ "language_model.model.layers.19.self_attn.o_proj": {
835
+ "bits": 8,
836
+ "group_size": 64,
837
+ "mode": "affine"
838
+ },
839
+ "language_model.model.layers.19.self_attn.q_proj": {
840
+ "bits": 8,
841
+ "group_size": 64,
842
+ "mode": "affine"
843
+ },
844
+ "language_model.model.layers.19.self_attn.v_proj": {
845
+ "bits": 8,
846
+ "group_size": 64,
847
+ "mode": "affine"
848
+ },
849
+ "language_model.model.layers.20.linear_attn.out_proj": {
850
+ "bits": 6,
851
+ "group_size": 128,
852
+ "mode": "affine"
853
+ },
854
+ "language_model.model.layers.20.mlp.shared_expert.down_proj": {
855
+ "bits": 8,
856
+ "group_size": 128,
857
+ "mode": "affine"
858
+ },
859
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj": {
860
+ "bits": 8,
861
+ "group_size": 128,
862
+ "mode": "affine"
863
+ },
864
+ "language_model.model.layers.20.mlp.shared_expert.up_proj": {
865
+ "bits": 8,
866
+ "group_size": 128,
867
+ "mode": "affine"
868
+ },
869
+ "language_model.model.layers.20.mlp.shared_expert_gate": {
870
+ "bits": 8,
871
+ "group_size": 64,
872
+ "mode": "affine"
873
+ },
874
+ "language_model.model.layers.21.linear_attn.out_proj": {
875
+ "bits": 6,
876
+ "group_size": 128,
877
+ "mode": "affine"
878
+ },
879
+ "language_model.model.layers.21.mlp.shared_expert.down_proj": {
880
+ "bits": 8,
881
+ "group_size": 128,
882
+ "mode": "affine"
883
+ },
884
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj": {
885
+ "bits": 8,
886
+ "group_size": 128,
887
+ "mode": "affine"
888
+ },
889
+ "language_model.model.layers.21.mlp.shared_expert.up_proj": {
890
+ "bits": 8,
891
+ "group_size": 128,
892
+ "mode": "affine"
893
+ },
894
+ "language_model.model.layers.21.mlp.shared_expert_gate": {
895
+ "bits": 8,
896
+ "group_size": 64,
897
+ "mode": "affine"
898
+ },
899
+ "language_model.model.layers.22.linear_attn.out_proj": {
900
+ "bits": 6,
901
+ "group_size": 128,
902
+ "mode": "affine"
903
+ },
904
+ "language_model.model.layers.22.mlp.shared_expert.down_proj": {
905
+ "bits": 8,
906
+ "group_size": 128,
907
+ "mode": "affine"
908
+ },
909
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj": {
910
+ "bits": 8,
911
+ "group_size": 128,
912
+ "mode": "affine"
913
+ },
914
+ "language_model.model.layers.22.mlp.shared_expert.up_proj": {
915
+ "bits": 8,
916
+ "group_size": 128,
917
+ "mode": "affine"
918
+ },
919
+ "language_model.model.layers.22.mlp.shared_expert_gate": {
920
+ "bits": 8,
921
+ "group_size": 64,
922
+ "mode": "affine"
923
+ },
924
+ "language_model.model.layers.23.mlp.shared_expert.down_proj": {
925
+ "bits": 8,
926
+ "group_size": 128,
927
+ "mode": "affine"
928
+ },
929
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj": {
930
+ "bits": 8,
931
+ "group_size": 128,
932
+ "mode": "affine"
933
+ },
934
+ "language_model.model.layers.23.mlp.shared_expert.up_proj": {
935
+ "bits": 8,
936
+ "group_size": 128,
937
+ "mode": "affine"
938
+ },
939
+ "language_model.model.layers.23.mlp.shared_expert_gate": {
940
+ "bits": 8,
941
+ "group_size": 64,
942
+ "mode": "affine"
943
+ },
944
+ "language_model.model.layers.23.self_attn.k_proj": {
945
+ "bits": 8,
946
+ "group_size": 64,
947
+ "mode": "affine"
948
+ },
949
+ "language_model.model.layers.23.self_attn.o_proj": {
950
+ "bits": 8,
951
+ "group_size": 64,
952
+ "mode": "affine"
953
+ },
954
+ "language_model.model.layers.23.self_attn.q_proj": {
955
+ "bits": 8,
956
+ "group_size": 64,
957
+ "mode": "affine"
958
+ },
959
+ "language_model.model.layers.23.self_attn.v_proj": {
960
+ "bits": 8,
961
+ "group_size": 64,
962
+ "mode": "affine"
963
+ },
964
+ "language_model.model.layers.24.linear_attn.out_proj": {
965
+ "bits": 6,
966
+ "group_size": 128,
967
+ "mode": "affine"
968
+ },
969
+ "language_model.model.layers.24.mlp.shared_expert.down_proj": {
970
+ "bits": 8,
971
+ "group_size": 128,
972
+ "mode": "affine"
973
+ },
974
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj": {
975
+ "bits": 8,
976
+ "group_size": 128,
977
+ "mode": "affine"
978
+ },
979
+ "language_model.model.layers.24.mlp.shared_expert.up_proj": {
980
+ "bits": 8,
981
+ "group_size": 128,
982
+ "mode": "affine"
983
+ },
984
+ "language_model.model.layers.24.mlp.shared_expert_gate": {
985
+ "bits": 8,
986
+ "group_size": 64,
987
+ "mode": "affine"
988
+ },
989
+ "language_model.model.layers.25.linear_attn.out_proj": {
990
+ "bits": 6,
991
+ "group_size": 128,
992
+ "mode": "affine"
993
+ },
994
+ "language_model.model.layers.25.mlp.shared_expert.down_proj": {
995
+ "bits": 8,
996
+ "group_size": 128,
997
+ "mode": "affine"
998
+ },
999
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj": {
1000
+ "bits": 8,
1001
+ "group_size": 128,
1002
+ "mode": "affine"
1003
+ },
1004
+ "language_model.model.layers.25.mlp.shared_expert.up_proj": {
1005
+ "bits": 8,
1006
+ "group_size": 128,
1007
+ "mode": "affine"
1008
+ },
1009
+ "language_model.model.layers.25.mlp.shared_expert_gate": {
1010
+ "bits": 8,
1011
+ "group_size": 64,
1012
+ "mode": "affine"
1013
+ },
1014
+ "language_model.model.layers.26.linear_attn.out_proj": {
1015
+ "bits": 6,
1016
+ "group_size": 128,
1017
+ "mode": "affine"
1018
+ },
1019
+ "language_model.model.layers.26.mlp.shared_expert.down_proj": {
1020
+ "bits": 8,
1021
+ "group_size": 128,
1022
+ "mode": "affine"
1023
+ },
1024
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj": {
1025
+ "bits": 8,
1026
+ "group_size": 128,
1027
+ "mode": "affine"
1028
+ },
1029
+ "language_model.model.layers.26.mlp.shared_expert.up_proj": {
1030
+ "bits": 8,
1031
+ "group_size": 128,
1032
+ "mode": "affine"
1033
+ },
1034
+ "language_model.model.layers.26.mlp.shared_expert_gate": {
1035
+ "bits": 8,
1036
+ "group_size": 64,
1037
+ "mode": "affine"
1038
+ },
1039
+ "language_model.model.layers.27.mlp.shared_expert.down_proj": {
1040
+ "bits": 8,
1041
+ "group_size": 128,
1042
+ "mode": "affine"
1043
+ },
1044
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj": {
1045
+ "bits": 8,
1046
+ "group_size": 128,
1047
+ "mode": "affine"
1048
+ },
1049
+ "language_model.model.layers.27.mlp.shared_expert.up_proj": {
1050
+ "bits": 8,
1051
+ "group_size": 128,
1052
+ "mode": "affine"
1053
+ },
1054
+ "language_model.model.layers.27.mlp.shared_expert_gate": {
1055
+ "bits": 8,
1056
+ "group_size": 64,
1057
+ "mode": "affine"
1058
+ },
1059
+ "language_model.model.layers.27.self_attn.k_proj": {
1060
+ "bits": 8,
1061
+ "group_size": 64,
1062
+ "mode": "affine"
1063
+ },
1064
+ "language_model.model.layers.27.self_attn.o_proj": {
1065
+ "bits": 8,
1066
+ "group_size": 64,
1067
+ "mode": "affine"
1068
+ },
1069
+ "language_model.model.layers.27.self_attn.q_proj": {
1070
+ "bits": 8,
1071
+ "group_size": 64,
1072
+ "mode": "affine"
1073
+ },
1074
+ "language_model.model.layers.27.self_attn.v_proj": {
1075
+ "bits": 8,
1076
+ "group_size": 64,
1077
+ "mode": "affine"
1078
+ },
1079
+ "language_model.model.layers.28.linear_attn.out_proj": {
1080
+ "bits": 6,
1081
+ "group_size": 128,
1082
+ "mode": "affine"
1083
+ },
1084
+ "language_model.model.layers.28.mlp.shared_expert.down_proj": {
1085
+ "bits": 8,
1086
+ "group_size": 128,
1087
+ "mode": "affine"
1088
+ },
1089
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj": {
1090
+ "bits": 8,
1091
+ "group_size": 128,
1092
+ "mode": "affine"
1093
+ },
1094
+ "language_model.model.layers.28.mlp.shared_expert.up_proj": {
1095
+ "bits": 8,
1096
+ "group_size": 128,
1097
+ "mode": "affine"
1098
+ },
1099
+ "language_model.model.layers.28.mlp.shared_expert_gate": {
1100
+ "bits": 8,
1101
+ "group_size": 64,
1102
+ "mode": "affine"
1103
+ },
1104
+ "language_model.model.layers.29.linear_attn.out_proj": {
1105
+ "bits": 6,
1106
+ "group_size": 128,
1107
+ "mode": "affine"
1108
+ },
1109
+ "language_model.model.layers.29.mlp.shared_expert.down_proj": {
1110
+ "bits": 8,
1111
+ "group_size": 128,
1112
+ "mode": "affine"
1113
+ },
1114
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj": {
1115
+ "bits": 8,
1116
+ "group_size": 128,
1117
+ "mode": "affine"
1118
+ },
1119
+ "language_model.model.layers.29.mlp.shared_expert.up_proj": {
1120
+ "bits": 8,
1121
+ "group_size": 128,
1122
+ "mode": "affine"
1123
+ },
1124
+ "language_model.model.layers.29.mlp.shared_expert_gate": {
1125
+ "bits": 8,
1126
+ "group_size": 64,
1127
+ "mode": "affine"
1128
+ },
1129
+ "language_model.model.layers.30.linear_attn.out_proj": {
1130
+ "bits": 6,
1131
+ "group_size": 128,
1132
+ "mode": "affine"
1133
+ },
1134
+ "language_model.model.layers.30.mlp.shared_expert.down_proj": {
1135
+ "bits": 8,
1136
+ "group_size": 128,
1137
+ "mode": "affine"
1138
+ },
1139
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj": {
1140
+ "bits": 8,
1141
+ "group_size": 128,
1142
+ "mode": "affine"
1143
+ },
1144
+ "language_model.model.layers.30.mlp.shared_expert.up_proj": {
1145
+ "bits": 8,
1146
+ "group_size": 128,
1147
+ "mode": "affine"
1148
+ },
1149
+ "language_model.model.layers.30.mlp.shared_expert_gate": {
1150
+ "bits": 8,
1151
+ "group_size": 64,
1152
+ "mode": "affine"
1153
+ },
1154
+ "language_model.model.layers.31.mlp.shared_expert.down_proj": {
1155
+ "bits": 8,
1156
+ "group_size": 128,
1157
+ "mode": "affine"
1158
+ },
1159
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj": {
1160
+ "bits": 8,
1161
+ "group_size": 128,
1162
+ "mode": "affine"
1163
+ },
1164
+ "language_model.model.layers.31.mlp.shared_expert.up_proj": {
1165
+ "bits": 8,
1166
+ "group_size": 128,
1167
+ "mode": "affine"
1168
+ },
1169
+ "language_model.model.layers.31.mlp.shared_expert_gate": {
1170
+ "bits": 8,
1171
+ "group_size": 64,
1172
+ "mode": "affine"
1173
+ },
1174
+ "language_model.model.layers.31.self_attn.k_proj": {
1175
+ "bits": 8,
1176
+ "group_size": 64,
1177
+ "mode": "affine"
1178
+ },
1179
+ "language_model.model.layers.31.self_attn.o_proj": {
1180
+ "bits": 8,
1181
+ "group_size": 64,
1182
+ "mode": "affine"
1183
+ },
1184
+ "language_model.model.layers.31.self_attn.q_proj": {
1185
+ "bits": 8,
1186
+ "group_size": 64,
1187
+ "mode": "affine"
1188
+ },
1189
+ "language_model.model.layers.31.self_attn.v_proj": {
1190
+ "bits": 8,
1191
+ "group_size": 64,
1192
+ "mode": "affine"
1193
+ },
1194
+ "language_model.model.layers.32.linear_attn.in_proj_a": {
1195
+ "bits": 8,
1196
+ "group_size": 64,
1197
+ "mode": "affine"
1198
+ },
1199
+ "language_model.model.layers.32.linear_attn.in_proj_b": {
1200
+ "bits": 8,
1201
+ "group_size": 64,
1202
+ "mode": "affine"
1203
+ },
1204
+ "language_model.model.layers.32.linear_attn.in_proj_qkv": {
1205
+ "bits": 8,
1206
+ "group_size": 64,
1207
+ "mode": "affine"
1208
+ },
1209
+ "language_model.model.layers.32.linear_attn.in_proj_z": {
1210
+ "bits": 8,
1211
+ "group_size": 64,
1212
+ "mode": "affine"
1213
+ },
1214
+ "language_model.model.layers.32.linear_attn.out_proj": {
1215
+ "bits": 6,
1216
+ "group_size": 128,
1217
+ "mode": "affine"
1218
+ },
1219
+ "language_model.model.layers.32.mlp.shared_expert.down_proj": {
1220
+ "bits": 8,
1221
+ "group_size": 128,
1222
+ "mode": "affine"
1223
+ },
1224
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj": {
1225
+ "bits": 8,
1226
+ "group_size": 128,
1227
+ "mode": "affine"
1228
+ },
1229
+ "language_model.model.layers.32.mlp.shared_expert.up_proj": {
1230
+ "bits": 8,
1231
+ "group_size": 128,
1232
+ "mode": "affine"
1233
+ },
1234
+ "language_model.model.layers.32.mlp.shared_expert_gate": {
1235
+ "bits": 8,
1236
+ "group_size": 64,
1237
+ "mode": "affine"
1238
+ },
1239
+ "language_model.model.layers.33.linear_attn.in_proj_a": {
1240
+ "bits": 8,
1241
+ "group_size": 64,
1242
+ "mode": "affine"
1243
+ },
1244
+ "language_model.model.layers.33.linear_attn.in_proj_b": {
1245
+ "bits": 8,
1246
+ "group_size": 64,
1247
+ "mode": "affine"
1248
+ },
1249
+ "language_model.model.layers.33.linear_attn.in_proj_qkv": {
1250
+ "bits": 8,
1251
+ "group_size": 64,
1252
+ "mode": "affine"
1253
+ },
1254
+ "language_model.model.layers.33.linear_attn.in_proj_z": {
1255
+ "bits": 8,
1256
+ "group_size": 64,
1257
+ "mode": "affine"
1258
+ },
1259
+ "language_model.model.layers.33.linear_attn.out_proj": {
1260
+ "bits": 6,
1261
+ "group_size": 128,
1262
+ "mode": "affine"
1263
+ },
1264
+ "language_model.model.layers.33.mlp.shared_expert.down_proj": {
1265
+ "bits": 8,
1266
+ "group_size": 128,
1267
+ "mode": "affine"
1268
+ },
1269
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj": {
1270
+ "bits": 8,
1271
+ "group_size": 128,
1272
+ "mode": "affine"
1273
+ },
1274
+ "language_model.model.layers.33.mlp.shared_expert.up_proj": {
1275
+ "bits": 8,
1276
+ "group_size": 128,
1277
+ "mode": "affine"
1278
+ },
1279
+ "language_model.model.layers.33.mlp.shared_expert_gate": {
1280
+ "bits": 8,
1281
+ "group_size": 64,
1282
+ "mode": "affine"
1283
+ },
1284
+ "language_model.model.layers.34.linear_attn.in_proj_a": {
1285
+ "bits": 8,
1286
+ "group_size": 64,
1287
+ "mode": "affine"
1288
+ },
1289
+ "language_model.model.layers.34.linear_attn.in_proj_b": {
1290
+ "bits": 8,
1291
+ "group_size": 64,
1292
+ "mode": "affine"
1293
+ },
1294
+ "language_model.model.layers.34.linear_attn.in_proj_qkv": {
1295
+ "bits": 8,
1296
+ "group_size": 64,
1297
+ "mode": "affine"
1298
+ },
1299
+ "language_model.model.layers.34.linear_attn.in_proj_z": {
1300
+ "bits": 8,
1301
+ "group_size": 64,
1302
+ "mode": "affine"
1303
+ },
1304
+ "language_model.model.layers.34.linear_attn.out_proj": {
1305
+ "bits": 6,
1306
+ "group_size": 128,
1307
+ "mode": "affine"
1308
+ },
1309
+ "language_model.model.layers.34.mlp.shared_expert.down_proj": {
1310
+ "bits": 8,
1311
+ "group_size": 128,
1312
+ "mode": "affine"
1313
+ },
1314
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj": {
1315
+ "bits": 8,
1316
+ "group_size": 128,
1317
+ "mode": "affine"
1318
+ },
1319
+ "language_model.model.layers.34.mlp.shared_expert.up_proj": {
1320
+ "bits": 8,
1321
+ "group_size": 128,
1322
+ "mode": "affine"
1323
+ },
1324
+ "language_model.model.layers.34.mlp.shared_expert_gate": {
1325
+ "bits": 8,
1326
+ "group_size": 64,
1327
+ "mode": "affine"
1328
+ },
1329
+ "language_model.model.layers.35.mlp.shared_expert.down_proj": {
1330
+ "bits": 8,
1331
+ "group_size": 128,
1332
+ "mode": "affine"
1333
+ },
1334
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj": {
1335
+ "bits": 8,
1336
+ "group_size": 128,
1337
+ "mode": "affine"
1338
+ },
1339
+ "language_model.model.layers.35.mlp.shared_expert.up_proj": {
1340
+ "bits": 8,
1341
+ "group_size": 128,
1342
+ "mode": "affine"
1343
+ },
1344
+ "language_model.model.layers.35.mlp.shared_expert_gate": {
1345
+ "bits": 8,
1346
+ "group_size": 64,
1347
+ "mode": "affine"
1348
+ },
1349
+ "language_model.model.layers.35.self_attn.k_proj": {
1350
+ "bits": 8,
1351
+ "group_size": 64,
1352
+ "mode": "affine"
1353
+ },
1354
+ "language_model.model.layers.35.self_attn.o_proj": {
1355
+ "bits": 8,
1356
+ "group_size": 64,
1357
+ "mode": "affine"
1358
+ },
1359
+ "language_model.model.layers.35.self_attn.q_proj": {
1360
+ "bits": 8,
1361
+ "group_size": 64,
1362
+ "mode": "affine"
1363
+ },
1364
+ "language_model.model.layers.35.self_attn.v_proj": {
1365
+ "bits": 8,
1366
+ "group_size": 64,
1367
+ "mode": "affine"
1368
+ },
1369
+ "language_model.model.layers.36.linear_attn.in_proj_a": {
1370
+ "bits": 8,
1371
+ "group_size": 64,
1372
+ "mode": "affine"
1373
+ },
1374
+ "language_model.model.layers.36.linear_attn.in_proj_b": {
1375
+ "bits": 8,
1376
+ "group_size": 64,
1377
+ "mode": "affine"
1378
+ },
1379
+ "language_model.model.layers.36.linear_attn.in_proj_qkv": {
1380
+ "bits": 8,
1381
+ "group_size": 64,
1382
+ "mode": "affine"
1383
+ },
1384
+ "language_model.model.layers.36.linear_attn.in_proj_z": {
1385
+ "bits": 8,
1386
+ "group_size": 64,
1387
+ "mode": "affine"
1388
+ },
1389
+ "language_model.model.layers.36.linear_attn.out_proj": {
1390
+ "bits": 6,
1391
+ "group_size": 128,
1392
+ "mode": "affine"
1393
+ },
1394
+ "language_model.model.layers.36.mlp.shared_expert.down_proj": {
1395
+ "bits": 8,
1396
+ "group_size": 128,
1397
+ "mode": "affine"
1398
+ },
1399
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj": {
1400
+ "bits": 8,
1401
+ "group_size": 128,
1402
+ "mode": "affine"
1403
+ },
1404
+ "language_model.model.layers.36.mlp.shared_expert.up_proj": {
1405
+ "bits": 8,
1406
+ "group_size": 128,
1407
+ "mode": "affine"
1408
+ },
1409
+ "language_model.model.layers.36.mlp.shared_expert_gate": {
1410
+ "bits": 8,
1411
+ "group_size": 64,
1412
+ "mode": "affine"
1413
+ },
1414
+ "language_model.model.layers.37.linear_attn.in_proj_a": {
1415
+ "bits": 8,
1416
+ "group_size": 64,
1417
+ "mode": "affine"
1418
+ },
1419
+ "language_model.model.layers.37.linear_attn.in_proj_b": {
1420
+ "bits": 8,
1421
+ "group_size": 64,
1422
+ "mode": "affine"
1423
+ },
1424
+ "language_model.model.layers.37.linear_attn.in_proj_qkv": {
1425
+ "bits": 8,
1426
+ "group_size": 64,
1427
+ "mode": "affine"
1428
+ },
1429
+ "language_model.model.layers.37.linear_attn.in_proj_z": {
1430
+ "bits": 8,
1431
+ "group_size": 64,
1432
+ "mode": "affine"
1433
+ },
1434
+ "language_model.model.layers.37.linear_attn.out_proj": {
1435
+ "bits": 6,
1436
+ "group_size": 128,
1437
+ "mode": "affine"
1438
+ },
1439
+ "language_model.model.layers.37.mlp.shared_expert.down_proj": {
1440
+ "bits": 8,
1441
+ "group_size": 128,
1442
+ "mode": "affine"
1443
+ },
1444
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj": {
1445
+ "bits": 8,
1446
+ "group_size": 128,
1447
+ "mode": "affine"
1448
+ },
1449
+ "language_model.model.layers.37.mlp.shared_expert.up_proj": {
1450
+ "bits": 8,
1451
+ "group_size": 128,
1452
+ "mode": "affine"
1453
+ },
1454
+ "language_model.model.layers.37.mlp.shared_expert_gate": {
1455
+ "bits": 8,
1456
+ "group_size": 64,
1457
+ "mode": "affine"
1458
+ },
1459
+ "language_model.model.layers.38.linear_attn.in_proj_a": {
1460
+ "bits": 8,
1461
+ "group_size": 64,
1462
+ "mode": "affine"
1463
+ },
1464
+ "language_model.model.layers.38.linear_attn.in_proj_b": {
1465
+ "bits": 8,
1466
+ "group_size": 64,
1467
+ "mode": "affine"
1468
+ },
1469
+ "language_model.model.layers.38.linear_attn.in_proj_qkv": {
1470
+ "bits": 8,
1471
+ "group_size": 64,
1472
+ "mode": "affine"
1473
+ },
1474
+ "language_model.model.layers.38.linear_attn.in_proj_z": {
1475
+ "bits": 8,
1476
+ "group_size": 64,
1477
+ "mode": "affine"
1478
+ },
1479
+ "language_model.model.layers.38.linear_attn.out_proj": {
1480
+ "bits": 6,
1481
+ "group_size": 128,
1482
+ "mode": "affine"
1483
+ },
1484
+ "language_model.model.layers.38.mlp.shared_expert.down_proj": {
1485
+ "bits": 8,
1486
+ "group_size": 128,
1487
+ "mode": "affine"
1488
+ },
1489
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj": {
1490
+ "bits": 8,
1491
+ "group_size": 128,
1492
+ "mode": "affine"
1493
+ },
1494
+ "language_model.model.layers.38.mlp.shared_expert.up_proj": {
1495
+ "bits": 8,
1496
+ "group_size": 128,
1497
+ "mode": "affine"
1498
+ },
1499
+ "language_model.model.layers.38.mlp.shared_expert_gate": {
1500
+ "bits": 8,
1501
+ "group_size": 64,
1502
+ "mode": "affine"
1503
+ },
1504
+ "language_model.lm_head": {
1505
+ "bits": 8,
1506
+ "group_size": 64,
1507
+ "mode": "affine"
1508
+ },
1509
+ "language_model.model.layers.39.mlp.shared_expert.down_proj": {
1510
+ "bits": 8,
1511
+ "group_size": 128,
1512
+ "mode": "affine"
1513
+ },
1514
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj": {
1515
+ "bits": 8,
1516
+ "group_size": 128,
1517
+ "mode": "affine"
1518
+ },
1519
+ "language_model.model.layers.39.mlp.shared_expert.up_proj": {
1520
+ "bits": 8,
1521
+ "group_size": 128,
1522
+ "mode": "affine"
1523
+ },
1524
+ "language_model.model.layers.39.mlp.shared_expert_gate": {
1525
+ "bits": 8,
1526
+ "group_size": 64,
1527
+ "mode": "affine"
1528
+ },
1529
+ "language_model.model.layers.39.self_attn.k_proj": {
1530
+ "bits": 8,
1531
+ "group_size": 64,
1532
+ "mode": "affine"
1533
+ },
1534
+ "language_model.model.layers.39.self_attn.o_proj": {
1535
+ "bits": 8,
1536
+ "group_size": 64,
1537
+ "mode": "affine"
1538
+ },
1539
+ "language_model.model.layers.39.self_attn.q_proj": {
1540
+ "bits": 8,
1541
+ "group_size": 64,
1542
+ "mode": "affine"
1543
+ },
1544
+ "language_model.model.layers.39.self_attn.v_proj": {
1545
+ "bits": 8,
1546
+ "group_size": 64,
1547
+ "mode": "affine"
1548
+ },
1549
+ "language_model.mtp.layers.0.self_attn.q_proj": {
1550
+ "bits": 8,
1551
+ "group_size": 64,
1552
+ "mode": "affine"
1553
+ },
1554
+ "language_model.mtp.layers.0.self_attn.k_proj": {
1555
+ "bits": 8,
1556
+ "group_size": 64,
1557
+ "mode": "affine"
1558
+ },
1559
+ "language_model.mtp.layers.0.self_attn.v_proj": {
1560
+ "bits": 8,
1561
+ "group_size": 64,
1562
+ "mode": "affine"
1563
+ },
1564
+ "language_model.mtp.layers.0.self_attn.o_proj": {
1565
+ "bits": 8,
1566
+ "group_size": 64,
1567
+ "mode": "affine"
1568
+ },
1569
+ "language_model.mtp.layers.0.mlp.shared_expert.gate_proj": {
1570
+ "bits": 8,
1571
+ "group_size": 128,
1572
+ "mode": "affine"
1573
+ },
1574
+ "language_model.mtp.layers.0.mlp.shared_expert.up_proj": {
1575
+ "bits": 8,
1576
+ "group_size": 128,
1577
+ "mode": "affine"
1578
+ },
1579
+ "language_model.mtp.layers.0.mlp.shared_expert.down_proj": {
1580
+ "bits": 8,
1581
+ "group_size": 128,
1582
+ "mode": "affine"
1583
+ },
1584
+ "language_model.mtp.layers.0.mlp.shared_expert_gate": {
1585
+ "bits": 8,
1586
+ "group_size": 64,
1587
+ "mode": "affine"
1588
+ },
1589
+ "language_model.mtp.layers.0.mlp.switch_mlp.gate_proj": {
1590
+ "bits": 8,
1591
+ "group_size": 64,
1592
+ "mode": "affine"
1593
+ },
1594
+ "language_model.mtp.layers.0.mlp.switch_mlp.up_proj": {
1595
+ "bits": 8,
1596
+ "group_size": 64,
1597
+ "mode": "affine"
1598
+ },
1599
+ "language_model.mtp.layers.0.mlp.switch_mlp.down_proj": {
1600
+ "bits": 8,
1601
+ "group_size": 64,
1602
+ "mode": "affine"
1603
+ }
1604
+ },
1605
+ "quantization_config": {
1606
+ "group_size": 64,
1607
+ "bits": 6,
1608
+ "mode": "affine",
1609
+ "language_model.model.embed_tokens": {
1610
+ "bits": 8,
1611
+ "group_size": 64,
1612
+ "mode": "affine"
1613
+ },
1614
+ "language_model.model.layers.0.linear_attn.in_proj_a": {
1615
+ "bits": 8,
1616
+ "group_size": 64,
1617
+ "mode": "affine"
1618
+ },
1619
+ "language_model.model.layers.0.linear_attn.in_proj_b": {
1620
+ "bits": 8,
1621
+ "group_size": 64,
1622
+ "mode": "affine"
1623
+ },
1624
+ "language_model.model.layers.0.linear_attn.in_proj_qkv": {
1625
+ "bits": 8,
1626
+ "group_size": 64,
1627
+ "mode": "affine"
1628
+ },
1629
+ "language_model.model.layers.0.linear_attn.in_proj_z": {
1630
+ "bits": 8,
1631
+ "group_size": 64,
1632
+ "mode": "affine"
1633
+ },
1634
+ "language_model.model.layers.0.linear_attn.out_proj": {
1635
+ "bits": 6,
1636
+ "group_size": 128,
1637
+ "mode": "affine"
1638
+ },
1639
+ "language_model.model.layers.0.mlp.shared_expert.down_proj": {
1640
+ "bits": 8,
1641
+ "group_size": 128,
1642
+ "mode": "affine"
1643
+ },
1644
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj": {
1645
+ "bits": 8,
1646
+ "group_size": 128,
1647
+ "mode": "affine"
1648
+ },
1649
+ "language_model.model.layers.0.mlp.shared_expert.up_proj": {
1650
+ "bits": 8,
1651
+ "group_size": 128,
1652
+ "mode": "affine"
1653
+ },
1654
+ "language_model.model.layers.0.mlp.shared_expert_gate": {
1655
+ "bits": 8,
1656
+ "group_size": 64,
1657
+ "mode": "affine"
1658
+ },
1659
+ "language_model.model.layers.1.linear_attn.in_proj_a": {
1660
+ "bits": 8,
1661
+ "group_size": 64,
1662
+ "mode": "affine"
1663
+ },
1664
+ "language_model.model.layers.1.linear_attn.in_proj_b": {
1665
+ "bits": 8,
1666
+ "group_size": 64,
1667
+ "mode": "affine"
1668
+ },
1669
+ "language_model.model.layers.1.linear_attn.in_proj_qkv": {
1670
+ "bits": 8,
1671
+ "group_size": 64,
1672
+ "mode": "affine"
1673
+ },
1674
+ "language_model.model.layers.1.linear_attn.in_proj_z": {
1675
+ "bits": 8,
1676
+ "group_size": 64,
1677
+ "mode": "affine"
1678
+ },
1679
+ "language_model.model.layers.1.linear_attn.out_proj": {
1680
+ "bits": 6,
1681
+ "group_size": 128,
1682
+ "mode": "affine"
1683
+ },
1684
+ "language_model.model.layers.1.mlp.shared_expert.down_proj": {
1685
+ "bits": 8,
1686
+ "group_size": 128,
1687
+ "mode": "affine"
1688
+ },
1689
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj": {
1690
+ "bits": 8,
1691
+ "group_size": 128,
1692
+ "mode": "affine"
1693
+ },
1694
+ "language_model.model.layers.1.mlp.shared_expert.up_proj": {
1695
+ "bits": 8,
1696
+ "group_size": 128,
1697
+ "mode": "affine"
1698
+ },
1699
+ "language_model.model.layers.1.mlp.shared_expert_gate": {
1700
+ "bits": 8,
1701
+ "group_size": 64,
1702
+ "mode": "affine"
1703
+ },
1704
+ "language_model.model.layers.2.linear_attn.in_proj_a": {
1705
+ "bits": 8,
1706
+ "group_size": 64,
1707
+ "mode": "affine"
1708
+ },
1709
+ "language_model.model.layers.2.linear_attn.in_proj_b": {
1710
+ "bits": 8,
1711
+ "group_size": 64,
1712
+ "mode": "affine"
1713
+ },
1714
+ "language_model.model.layers.2.linear_attn.in_proj_qkv": {
1715
+ "bits": 8,
1716
+ "group_size": 64,
1717
+ "mode": "affine"
1718
+ },
1719
+ "language_model.model.layers.2.linear_attn.in_proj_z": {
1720
+ "bits": 8,
1721
+ "group_size": 64,
1722
+ "mode": "affine"
1723
+ },
1724
+ "language_model.model.layers.2.linear_attn.out_proj": {
1725
+ "bits": 6,
1726
+ "group_size": 128,
1727
+ "mode": "affine"
1728
+ },
1729
+ "language_model.model.layers.2.mlp.shared_expert.down_proj": {
1730
+ "bits": 8,
1731
+ "group_size": 128,
1732
+ "mode": "affine"
1733
+ },
1734
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj": {
1735
+ "bits": 8,
1736
+ "group_size": 128,
1737
+ "mode": "affine"
1738
+ },
1739
+ "language_model.model.layers.2.mlp.shared_expert.up_proj": {
1740
+ "bits": 8,
1741
+ "group_size": 128,
1742
+ "mode": "affine"
1743
+ },
1744
+ "language_model.model.layers.2.mlp.shared_expert_gate": {
1745
+ "bits": 8,
1746
+ "group_size": 64,
1747
+ "mode": "affine"
1748
+ },
1749
+ "language_model.model.layers.3.mlp.shared_expert.down_proj": {
1750
+ "bits": 8,
1751
+ "group_size": 128,
1752
+ "mode": "affine"
1753
+ },
1754
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj": {
1755
+ "bits": 8,
1756
+ "group_size": 128,
1757
+ "mode": "affine"
1758
+ },
1759
+ "language_model.model.layers.3.mlp.shared_expert.up_proj": {
1760
+ "bits": 8,
1761
+ "group_size": 128,
1762
+ "mode": "affine"
1763
+ },
1764
+ "language_model.model.layers.3.mlp.shared_expert_gate": {
1765
+ "bits": 8,
1766
+ "group_size": 64,
1767
+ "mode": "affine"
1768
+ },
1769
+ "language_model.model.layers.3.self_attn.k_proj": {
1770
+ "bits": 8,
1771
+ "group_size": 64,
1772
+ "mode": "affine"
1773
+ },
1774
+ "language_model.model.layers.3.self_attn.o_proj": {
1775
+ "bits": 8,
1776
+ "group_size": 64,
1777
+ "mode": "affine"
1778
+ },
1779
+ "language_model.model.layers.3.self_attn.q_proj": {
1780
+ "bits": 8,
1781
+ "group_size": 64,
1782
+ "mode": "affine"
1783
+ },
1784
+ "language_model.model.layers.3.self_attn.v_proj": {
1785
+ "bits": 8,
1786
+ "group_size": 64,
1787
+ "mode": "affine"
1788
+ },
1789
+ "language_model.model.layers.4.linear_attn.in_proj_a": {
1790
+ "bits": 8,
1791
+ "group_size": 64,
1792
+ "mode": "affine"
1793
+ },
1794
+ "language_model.model.layers.4.linear_attn.in_proj_b": {
1795
+ "bits": 8,
1796
+ "group_size": 64,
1797
+ "mode": "affine"
1798
+ },
1799
+ "language_model.model.layers.4.linear_attn.in_proj_qkv": {
1800
+ "bits": 8,
1801
+ "group_size": 64,
1802
+ "mode": "affine"
1803
+ },
1804
+ "language_model.model.layers.4.linear_attn.in_proj_z": {
1805
+ "bits": 8,
1806
+ "group_size": 64,
1807
+ "mode": "affine"
1808
+ },
1809
+ "language_model.model.layers.4.linear_attn.out_proj": {
1810
+ "bits": 6,
1811
+ "group_size": 128,
1812
+ "mode": "affine"
1813
+ },
1814
+ "language_model.model.layers.4.mlp.shared_expert.down_proj": {
1815
+ "bits": 8,
1816
+ "group_size": 128,
1817
+ "mode": "affine"
1818
+ },
1819
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj": {
1820
+ "bits": 8,
1821
+ "group_size": 128,
1822
+ "mode": "affine"
1823
+ },
1824
+ "language_model.model.layers.4.mlp.shared_expert.up_proj": {
1825
+ "bits": 8,
1826
+ "group_size": 128,
1827
+ "mode": "affine"
1828
+ },
1829
+ "language_model.model.layers.4.mlp.shared_expert_gate": {
1830
+ "bits": 8,
1831
+ "group_size": 64,
1832
+ "mode": "affine"
1833
+ },
1834
+ "language_model.model.layers.5.linear_attn.in_proj_a": {
1835
+ "bits": 8,
1836
+ "group_size": 64,
1837
+ "mode": "affine"
1838
+ },
1839
+ "language_model.model.layers.5.linear_attn.in_proj_b": {
1840
+ "bits": 8,
1841
+ "group_size": 64,
1842
+ "mode": "affine"
1843
+ },
1844
+ "language_model.model.layers.5.linear_attn.in_proj_qkv": {
1845
+ "bits": 8,
1846
+ "group_size": 64,
1847
+ "mode": "affine"
1848
+ },
1849
+ "language_model.model.layers.5.linear_attn.in_proj_z": {
1850
+ "bits": 8,
1851
+ "group_size": 64,
1852
+ "mode": "affine"
1853
+ },
1854
+ "language_model.model.layers.5.linear_attn.out_proj": {
1855
+ "bits": 6,
1856
+ "group_size": 128,
1857
+ "mode": "affine"
1858
+ },
1859
+ "language_model.model.layers.5.mlp.shared_expert.down_proj": {
1860
+ "bits": 8,
1861
+ "group_size": 128,
1862
+ "mode": "affine"
1863
+ },
1864
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj": {
1865
+ "bits": 8,
1866
+ "group_size": 128,
1867
+ "mode": "affine"
1868
+ },
1869
+ "language_model.model.layers.5.mlp.shared_expert.up_proj": {
1870
+ "bits": 8,
1871
+ "group_size": 128,
1872
+ "mode": "affine"
1873
+ },
1874
+ "language_model.model.layers.5.mlp.shared_expert_gate": {
1875
+ "bits": 8,
1876
+ "group_size": 64,
1877
+ "mode": "affine"
1878
+ },
1879
+ "language_model.model.layers.6.linear_attn.in_proj_a": {
1880
+ "bits": 8,
1881
+ "group_size": 64,
1882
+ "mode": "affine"
1883
+ },
1884
+ "language_model.model.layers.6.linear_attn.in_proj_b": {
1885
+ "bits": 8,
1886
+ "group_size": 64,
1887
+ "mode": "affine"
1888
+ },
1889
+ "language_model.model.layers.6.linear_attn.in_proj_qkv": {
1890
+ "bits": 8,
1891
+ "group_size": 64,
1892
+ "mode": "affine"
1893
+ },
1894
+ "language_model.model.layers.6.linear_attn.in_proj_z": {
1895
+ "bits": 8,
1896
+ "group_size": 64,
1897
+ "mode": "affine"
1898
+ },
1899
+ "language_model.model.layers.6.linear_attn.out_proj": {
1900
+ "bits": 6,
1901
+ "group_size": 128,
1902
+ "mode": "affine"
1903
+ },
1904
+ "language_model.model.layers.6.mlp.shared_expert.down_proj": {
1905
+ "bits": 8,
1906
+ "group_size": 128,
1907
+ "mode": "affine"
1908
+ },
1909
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj": {
1910
+ "bits": 8,
1911
+ "group_size": 128,
1912
+ "mode": "affine"
1913
+ },
1914
+ "language_model.model.layers.6.mlp.shared_expert.up_proj": {
1915
+ "bits": 8,
1916
+ "group_size": 128,
1917
+ "mode": "affine"
1918
+ },
1919
+ "language_model.model.layers.6.mlp.shared_expert_gate": {
1920
+ "bits": 8,
1921
+ "group_size": 64,
1922
+ "mode": "affine"
1923
+ },
1924
+ "language_model.model.layers.7.mlp.shared_expert.down_proj": {
1925
+ "bits": 8,
1926
+ "group_size": 128,
1927
+ "mode": "affine"
1928
+ },
1929
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj": {
1930
+ "bits": 8,
1931
+ "group_size": 128,
1932
+ "mode": "affine"
1933
+ },
1934
+ "language_model.model.layers.7.mlp.shared_expert.up_proj": {
1935
+ "bits": 8,
1936
+ "group_size": 128,
1937
+ "mode": "affine"
1938
+ },
1939
+ "language_model.model.layers.7.mlp.shared_expert_gate": {
1940
+ "bits": 8,
1941
+ "group_size": 64,
1942
+ "mode": "affine"
1943
+ },
1944
+ "language_model.model.layers.7.self_attn.k_proj": {
1945
+ "bits": 8,
1946
+ "group_size": 64,
1947
+ "mode": "affine"
1948
+ },
1949
+ "language_model.model.layers.7.self_attn.o_proj": {
1950
+ "bits": 8,
1951
+ "group_size": 64,
1952
+ "mode": "affine"
1953
+ },
1954
+ "language_model.model.layers.7.self_attn.q_proj": {
1955
+ "bits": 8,
1956
+ "group_size": 64,
1957
+ "mode": "affine"
1958
+ },
1959
+ "language_model.model.layers.7.self_attn.v_proj": {
1960
+ "bits": 8,
1961
+ "group_size": 64,
1962
+ "mode": "affine"
1963
+ },
1964
+ "language_model.model.layers.8.linear_attn.in_proj_a": {
1965
+ "bits": 8,
1966
+ "group_size": 64,
1967
+ "mode": "affine"
1968
+ },
1969
+ "language_model.model.layers.8.linear_attn.in_proj_b": {
1970
+ "bits": 8,
1971
+ "group_size": 64,
1972
+ "mode": "affine"
1973
+ },
1974
+ "language_model.model.layers.8.linear_attn.in_proj_qkv": {
1975
+ "bits": 8,
1976
+ "group_size": 64,
1977
+ "mode": "affine"
1978
+ },
1979
+ "language_model.model.layers.8.linear_attn.in_proj_z": {
1980
+ "bits": 8,
1981
+ "group_size": 64,
1982
+ "mode": "affine"
1983
+ },
1984
+ "language_model.model.layers.8.linear_attn.out_proj": {
1985
+ "bits": 6,
1986
+ "group_size": 128,
1987
+ "mode": "affine"
1988
+ },
1989
+ "language_model.model.layers.8.mlp.shared_expert.down_proj": {
1990
+ "bits": 8,
1991
+ "group_size": 128,
1992
+ "mode": "affine"
1993
+ },
1994
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj": {
1995
+ "bits": 8,
1996
+ "group_size": 128,
1997
+ "mode": "affine"
1998
+ },
1999
+ "language_model.model.layers.8.mlp.shared_expert.up_proj": {
2000
+ "bits": 8,
2001
+ "group_size": 128,
2002
+ "mode": "affine"
2003
+ },
2004
+ "language_model.model.layers.8.mlp.shared_expert_gate": {
2005
+ "bits": 8,
2006
+ "group_size": 64,
2007
+ "mode": "affine"
2008
+ },
2009
+ "language_model.model.layers.9.linear_attn.in_proj_a": {
2010
+ "bits": 8,
2011
+ "group_size": 64,
2012
+ "mode": "affine"
2013
+ },
2014
+ "language_model.model.layers.9.linear_attn.in_proj_b": {
2015
+ "bits": 8,
2016
+ "group_size": 64,
2017
+ "mode": "affine"
2018
+ },
2019
+ "language_model.model.layers.9.linear_attn.in_proj_qkv": {
2020
+ "bits": 8,
2021
+ "group_size": 64,
2022
+ "mode": "affine"
2023
+ },
2024
+ "language_model.model.layers.9.linear_attn.in_proj_z": {
2025
+ "bits": 8,
2026
+ "group_size": 64,
2027
+ "mode": "affine"
2028
+ },
2029
+ "language_model.model.layers.9.linear_attn.out_proj": {
2030
+ "bits": 6,
2031
+ "group_size": 128,
2032
+ "mode": "affine"
2033
+ },
2034
+ "language_model.model.layers.9.mlp.shared_expert.down_proj": {
2035
+ "bits": 8,
2036
+ "group_size": 128,
2037
+ "mode": "affine"
2038
+ },
2039
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj": {
2040
+ "bits": 8,
2041
+ "group_size": 128,
2042
+ "mode": "affine"
2043
+ },
2044
+ "language_model.model.layers.9.mlp.shared_expert.up_proj": {
2045
+ "bits": 8,
2046
+ "group_size": 128,
2047
+ "mode": "affine"
2048
+ },
2049
+ "language_model.model.layers.9.mlp.shared_expert_gate": {
2050
+ "bits": 8,
2051
+ "group_size": 64,
2052
+ "mode": "affine"
2053
+ },
2054
+ "language_model.model.layers.10.linear_attn.in_proj_a": {
2055
+ "bits": 8,
2056
+ "group_size": 64,
2057
+ "mode": "affine"
2058
+ },
2059
+ "language_model.model.layers.10.linear_attn.in_proj_b": {
2060
+ "bits": 8,
2061
+ "group_size": 64,
2062
+ "mode": "affine"
2063
+ },
2064
+ "language_model.model.layers.10.linear_attn.in_proj_qkv": {
2065
+ "bits": 8,
2066
+ "group_size": 64,
2067
+ "mode": "affine"
2068
+ },
2069
+ "language_model.model.layers.10.linear_attn.in_proj_z": {
2070
+ "bits": 8,
2071
+ "group_size": 64,
2072
+ "mode": "affine"
2073
+ },
2074
+ "language_model.model.layers.10.linear_attn.out_proj": {
2075
+ "bits": 6,
2076
+ "group_size": 128,
2077
+ "mode": "affine"
2078
+ },
2079
+ "language_model.model.layers.10.mlp.shared_expert.down_proj": {
2080
+ "bits": 8,
2081
+ "group_size": 128,
2082
+ "mode": "affine"
2083
+ },
2084
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj": {
2085
+ "bits": 8,
2086
+ "group_size": 128,
2087
+ "mode": "affine"
2088
+ },
2089
+ "language_model.model.layers.10.mlp.shared_expert.up_proj": {
2090
+ "bits": 8,
2091
+ "group_size": 128,
2092
+ "mode": "affine"
2093
+ },
2094
+ "language_model.model.layers.10.mlp.shared_expert_gate": {
2095
+ "bits": 8,
2096
+ "group_size": 64,
2097
+ "mode": "affine"
2098
+ },
2099
+ "language_model.model.layers.11.mlp.shared_expert.down_proj": {
2100
+ "bits": 8,
2101
+ "group_size": 128,
2102
+ "mode": "affine"
2103
+ },
2104
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj": {
2105
+ "bits": 8,
2106
+ "group_size": 128,
2107
+ "mode": "affine"
2108
+ },
2109
+ "language_model.model.layers.11.mlp.shared_expert.up_proj": {
2110
+ "bits": 8,
2111
+ "group_size": 128,
2112
+ "mode": "affine"
2113
+ },
2114
+ "language_model.model.layers.11.mlp.shared_expert_gate": {
2115
+ "bits": 8,
2116
+ "group_size": 64,
2117
+ "mode": "affine"
2118
+ },
2119
+ "language_model.model.layers.12.linear_attn.out_proj": {
2120
+ "bits": 6,
2121
+ "group_size": 128,
2122
+ "mode": "affine"
2123
+ },
2124
+ "language_model.model.layers.12.mlp.shared_expert.down_proj": {
2125
+ "bits": 8,
2126
+ "group_size": 128,
2127
+ "mode": "affine"
2128
+ },
2129
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj": {
2130
+ "bits": 8,
2131
+ "group_size": 128,
2132
+ "mode": "affine"
2133
+ },
2134
+ "language_model.model.layers.12.mlp.shared_expert.up_proj": {
2135
+ "bits": 8,
2136
+ "group_size": 128,
2137
+ "mode": "affine"
2138
+ },
2139
+ "language_model.model.layers.12.mlp.shared_expert_gate": {
2140
+ "bits": 8,
2141
+ "group_size": 64,
2142
+ "mode": "affine"
2143
+ },
2144
+ "language_model.model.layers.13.linear_attn.out_proj": {
2145
+ "bits": 6,
2146
+ "group_size": 128,
2147
+ "mode": "affine"
2148
+ },
2149
+ "language_model.model.layers.13.mlp.shared_expert.down_proj": {
2150
+ "bits": 8,
2151
+ "group_size": 128,
2152
+ "mode": "affine"
2153
+ },
2154
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj": {
2155
+ "bits": 8,
2156
+ "group_size": 128,
2157
+ "mode": "affine"
2158
+ },
2159
+ "language_model.model.layers.13.mlp.shared_expert.up_proj": {
2160
+ "bits": 8,
2161
+ "group_size": 128,
2162
+ "mode": "affine"
2163
+ },
2164
+ "language_model.model.layers.13.mlp.shared_expert_gate": {
2165
+ "bits": 8,
2166
+ "group_size": 64,
2167
+ "mode": "affine"
2168
+ },
2169
+ "language_model.model.layers.14.linear_attn.out_proj": {
2170
+ "bits": 6,
2171
+ "group_size": 128,
2172
+ "mode": "affine"
2173
+ },
2174
+ "language_model.model.layers.14.mlp.shared_expert.down_proj": {
2175
+ "bits": 8,
2176
+ "group_size": 128,
2177
+ "mode": "affine"
2178
+ },
2179
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj": {
2180
+ "bits": 8,
2181
+ "group_size": 128,
2182
+ "mode": "affine"
2183
+ },
2184
+ "language_model.model.layers.14.mlp.shared_expert.up_proj": {
2185
+ "bits": 8,
2186
+ "group_size": 128,
2187
+ "mode": "affine"
2188
+ },
2189
+ "language_model.model.layers.14.mlp.shared_expert_gate": {
2190
+ "bits": 8,
2191
+ "group_size": 64,
2192
+ "mode": "affine"
2193
+ },
2194
+ "language_model.model.layers.15.mlp.shared_expert.down_proj": {
2195
+ "bits": 8,
2196
+ "group_size": 128,
2197
+ "mode": "affine"
2198
+ },
2199
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj": {
2200
+ "bits": 8,
2201
+ "group_size": 128,
2202
+ "mode": "affine"
2203
+ },
2204
+ "language_model.model.layers.15.mlp.shared_expert.up_proj": {
2205
+ "bits": 8,
2206
+ "group_size": 128,
2207
+ "mode": "affine"
2208
+ },
2209
+ "language_model.model.layers.15.mlp.shared_expert_gate": {
2210
+ "bits": 8,
2211
+ "group_size": 64,
2212
+ "mode": "affine"
2213
+ },
2214
+ "language_model.model.layers.16.linear_attn.out_proj": {
2215
+ "bits": 6,
2216
+ "group_size": 128,
2217
+ "mode": "affine"
2218
+ },
2219
+ "language_model.model.layers.16.mlp.shared_expert.down_proj": {
2220
+ "bits": 8,
2221
+ "group_size": 128,
2222
+ "mode": "affine"
2223
+ },
2224
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj": {
2225
+ "bits": 8,
2226
+ "group_size": 128,
2227
+ "mode": "affine"
2228
+ },
2229
+ "language_model.model.layers.16.mlp.shared_expert.up_proj": {
2230
+ "bits": 8,
2231
+ "group_size": 128,
2232
+ "mode": "affine"
2233
+ },
2234
+ "language_model.model.layers.16.mlp.shared_expert_gate": {
2235
+ "bits": 8,
2236
+ "group_size": 64,
2237
+ "mode": "affine"
2238
+ },
2239
+ "language_model.model.layers.17.linear_attn.out_proj": {
2240
+ "bits": 6,
2241
+ "group_size": 128,
2242
+ "mode": "affine"
2243
+ },
2244
+ "language_model.model.layers.17.mlp.shared_expert.down_proj": {
2245
+ "bits": 8,
2246
+ "group_size": 128,
2247
+ "mode": "affine"
2248
+ },
2249
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj": {
2250
+ "bits": 8,
2251
+ "group_size": 128,
2252
+ "mode": "affine"
2253
+ },
2254
+ "language_model.model.layers.17.mlp.shared_expert.up_proj": {
2255
+ "bits": 8,
2256
+ "group_size": 128,
2257
+ "mode": "affine"
2258
+ },
2259
+ "language_model.model.layers.17.mlp.shared_expert_gate": {
2260
+ "bits": 8,
2261
+ "group_size": 64,
2262
+ "mode": "affine"
2263
+ },
2264
+ "language_model.model.layers.18.linear_attn.out_proj": {
2265
+ "bits": 6,
2266
+ "group_size": 128,
2267
+ "mode": "affine"
2268
+ },
2269
+ "language_model.model.layers.18.mlp.shared_expert.down_proj": {
2270
+ "bits": 8,
2271
+ "group_size": 128,
2272
+ "mode": "affine"
2273
+ },
2274
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj": {
2275
+ "bits": 8,
2276
+ "group_size": 128,
2277
+ "mode": "affine"
2278
+ },
2279
+ "language_model.model.layers.18.mlp.shared_expert.up_proj": {
2280
+ "bits": 8,
2281
+ "group_size": 128,
2282
+ "mode": "affine"
2283
+ },
2284
+ "language_model.model.layers.18.mlp.shared_expert_gate": {
2285
+ "bits": 8,
2286
+ "group_size": 64,
2287
+ "mode": "affine"
2288
+ },
2289
+ "language_model.model.layers.19.mlp.shared_expert.down_proj": {
2290
+ "bits": 8,
2291
+ "group_size": 128,
2292
+ "mode": "affine"
2293
+ },
2294
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj": {
2295
+ "bits": 8,
2296
+ "group_size": 128,
2297
+ "mode": "affine"
2298
+ },
2299
+ "language_model.model.layers.19.mlp.shared_expert.up_proj": {
2300
+ "bits": 8,
2301
+ "group_size": 128,
2302
+ "mode": "affine"
2303
+ },
2304
+ "language_model.model.layers.19.mlp.shared_expert_gate": {
2305
+ "bits": 8,
2306
+ "group_size": 64,
2307
+ "mode": "affine"
2308
+ },
2309
+ "language_model.model.layers.19.self_attn.k_proj": {
2310
+ "bits": 8,
2311
+ "group_size": 64,
2312
+ "mode": "affine"
2313
+ },
2314
+ "language_model.model.layers.19.self_attn.o_proj": {
2315
+ "bits": 8,
2316
+ "group_size": 64,
2317
+ "mode": "affine"
2318
+ },
2319
+ "language_model.model.layers.19.self_attn.q_proj": {
2320
+ "bits": 8,
2321
+ "group_size": 64,
2322
+ "mode": "affine"
2323
+ },
2324
+ "language_model.model.layers.19.self_attn.v_proj": {
2325
+ "bits": 8,
2326
+ "group_size": 64,
2327
+ "mode": "affine"
2328
+ },
2329
+ "language_model.model.layers.20.linear_attn.out_proj": {
2330
+ "bits": 6,
2331
+ "group_size": 128,
2332
+ "mode": "affine"
2333
+ },
2334
+ "language_model.model.layers.20.mlp.shared_expert.down_proj": {
2335
+ "bits": 8,
2336
+ "group_size": 128,
2337
+ "mode": "affine"
2338
+ },
2339
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj": {
2340
+ "bits": 8,
2341
+ "group_size": 128,
2342
+ "mode": "affine"
2343
+ },
2344
+ "language_model.model.layers.20.mlp.shared_expert.up_proj": {
2345
+ "bits": 8,
2346
+ "group_size": 128,
2347
+ "mode": "affine"
2348
+ },
2349
+ "language_model.model.layers.20.mlp.shared_expert_gate": {
2350
+ "bits": 8,
2351
+ "group_size": 64,
2352
+ "mode": "affine"
2353
+ },
2354
+ "language_model.model.layers.21.linear_attn.out_proj": {
2355
+ "bits": 6,
2356
+ "group_size": 128,
2357
+ "mode": "affine"
2358
+ },
2359
+ "language_model.model.layers.21.mlp.shared_expert.down_proj": {
2360
+ "bits": 8,
2361
+ "group_size": 128,
2362
+ "mode": "affine"
2363
+ },
2364
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj": {
2365
+ "bits": 8,
2366
+ "group_size": 128,
2367
+ "mode": "affine"
2368
+ },
2369
+ "language_model.model.layers.21.mlp.shared_expert.up_proj": {
2370
+ "bits": 8,
2371
+ "group_size": 128,
2372
+ "mode": "affine"
2373
+ },
2374
+ "language_model.model.layers.21.mlp.shared_expert_gate": {
2375
+ "bits": 8,
2376
+ "group_size": 64,
2377
+ "mode": "affine"
2378
+ },
2379
+ "language_model.model.layers.22.linear_attn.out_proj": {
2380
+ "bits": 6,
2381
+ "group_size": 128,
2382
+ "mode": "affine"
2383
+ },
2384
+ "language_model.model.layers.22.mlp.shared_expert.down_proj": {
2385
+ "bits": 8,
2386
+ "group_size": 128,
2387
+ "mode": "affine"
2388
+ },
2389
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj": {
2390
+ "bits": 8,
2391
+ "group_size": 128,
2392
+ "mode": "affine"
2393
+ },
2394
+ "language_model.model.layers.22.mlp.shared_expert.up_proj": {
2395
+ "bits": 8,
2396
+ "group_size": 128,
2397
+ "mode": "affine"
2398
+ },
2399
+ "language_model.model.layers.22.mlp.shared_expert_gate": {
2400
+ "bits": 8,
2401
+ "group_size": 64,
2402
+ "mode": "affine"
2403
+ },
2404
+ "language_model.model.layers.23.mlp.shared_expert.down_proj": {
2405
+ "bits": 8,
2406
+ "group_size": 128,
2407
+ "mode": "affine"
2408
+ },
2409
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj": {
2410
+ "bits": 8,
2411
+ "group_size": 128,
2412
+ "mode": "affine"
2413
+ },
2414
+ "language_model.model.layers.23.mlp.shared_expert.up_proj": {
2415
+ "bits": 8,
2416
+ "group_size": 128,
2417
+ "mode": "affine"
2418
+ },
2419
+ "language_model.model.layers.23.mlp.shared_expert_gate": {
2420
+ "bits": 8,
2421
+ "group_size": 64,
2422
+ "mode": "affine"
2423
+ },
2424
+ "language_model.model.layers.23.self_attn.k_proj": {
2425
+ "bits": 8,
2426
+ "group_size": 64,
2427
+ "mode": "affine"
2428
+ },
2429
+ "language_model.model.layers.23.self_attn.o_proj": {
2430
+ "bits": 8,
2431
+ "group_size": 64,
2432
+ "mode": "affine"
2433
+ },
2434
+ "language_model.model.layers.23.self_attn.q_proj": {
2435
+ "bits": 8,
2436
+ "group_size": 64,
2437
+ "mode": "affine"
2438
+ },
2439
+ "language_model.model.layers.23.self_attn.v_proj": {
2440
+ "bits": 8,
2441
+ "group_size": 64,
2442
+ "mode": "affine"
2443
+ },
2444
+ "language_model.model.layers.24.linear_attn.out_proj": {
2445
+ "bits": 6,
2446
+ "group_size": 128,
2447
+ "mode": "affine"
2448
+ },
2449
+ "language_model.model.layers.24.mlp.shared_expert.down_proj": {
2450
+ "bits": 8,
2451
+ "group_size": 128,
2452
+ "mode": "affine"
2453
+ },
2454
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj": {
2455
+ "bits": 8,
2456
+ "group_size": 128,
2457
+ "mode": "affine"
2458
+ },
2459
+ "language_model.model.layers.24.mlp.shared_expert.up_proj": {
2460
+ "bits": 8,
2461
+ "group_size": 128,
2462
+ "mode": "affine"
2463
+ },
2464
+ "language_model.model.layers.24.mlp.shared_expert_gate": {
2465
+ "bits": 8,
2466
+ "group_size": 64,
2467
+ "mode": "affine"
2468
+ },
2469
+ "language_model.model.layers.25.linear_attn.out_proj": {
2470
+ "bits": 6,
2471
+ "group_size": 128,
2472
+ "mode": "affine"
2473
+ },
2474
+ "language_model.model.layers.25.mlp.shared_expert.down_proj": {
2475
+ "bits": 8,
2476
+ "group_size": 128,
2477
+ "mode": "affine"
2478
+ },
2479
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj": {
2480
+ "bits": 8,
2481
+ "group_size": 128,
2482
+ "mode": "affine"
2483
+ },
2484
+ "language_model.model.layers.25.mlp.shared_expert.up_proj": {
2485
+ "bits": 8,
2486
+ "group_size": 128,
2487
+ "mode": "affine"
2488
+ },
2489
+ "language_model.model.layers.25.mlp.shared_expert_gate": {
2490
+ "bits": 8,
2491
+ "group_size": 64,
2492
+ "mode": "affine"
2493
+ },
2494
+ "language_model.model.layers.26.linear_attn.out_proj": {
2495
+ "bits": 6,
2496
+ "group_size": 128,
2497
+ "mode": "affine"
2498
+ },
2499
+ "language_model.model.layers.26.mlp.shared_expert.down_proj": {
2500
+ "bits": 8,
2501
+ "group_size": 128,
2502
+ "mode": "affine"
2503
+ },
2504
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj": {
2505
+ "bits": 8,
2506
+ "group_size": 128,
2507
+ "mode": "affine"
2508
+ },
2509
+ "language_model.model.layers.26.mlp.shared_expert.up_proj": {
2510
+ "bits": 8,
2511
+ "group_size": 128,
2512
+ "mode": "affine"
2513
+ },
2514
+ "language_model.model.layers.26.mlp.shared_expert_gate": {
2515
+ "bits": 8,
2516
+ "group_size": 64,
2517
+ "mode": "affine"
2518
+ },
2519
+ "language_model.model.layers.27.mlp.shared_expert.down_proj": {
2520
+ "bits": 8,
2521
+ "group_size": 128,
2522
+ "mode": "affine"
2523
+ },
2524
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj": {
2525
+ "bits": 8,
2526
+ "group_size": 128,
2527
+ "mode": "affine"
2528
+ },
2529
+ "language_model.model.layers.27.mlp.shared_expert.up_proj": {
2530
+ "bits": 8,
2531
+ "group_size": 128,
2532
+ "mode": "affine"
2533
+ },
2534
+ "language_model.model.layers.27.mlp.shared_expert_gate": {
2535
+ "bits": 8,
2536
+ "group_size": 64,
2537
+ "mode": "affine"
2538
+ },
2539
+ "language_model.model.layers.27.self_attn.k_proj": {
2540
+ "bits": 8,
2541
+ "group_size": 64,
2542
+ "mode": "affine"
2543
+ },
2544
+ "language_model.model.layers.27.self_attn.o_proj": {
2545
+ "bits": 8,
2546
+ "group_size": 64,
2547
+ "mode": "affine"
2548
+ },
2549
+ "language_model.model.layers.27.self_attn.q_proj": {
2550
+ "bits": 8,
2551
+ "group_size": 64,
2552
+ "mode": "affine"
2553
+ },
2554
+ "language_model.model.layers.27.self_attn.v_proj": {
2555
+ "bits": 8,
2556
+ "group_size": 64,
2557
+ "mode": "affine"
2558
+ },
2559
+ "language_model.model.layers.28.linear_attn.out_proj": {
2560
+ "bits": 6,
2561
+ "group_size": 128,
2562
+ "mode": "affine"
2563
+ },
2564
+ "language_model.model.layers.28.mlp.shared_expert.down_proj": {
2565
+ "bits": 8,
2566
+ "group_size": 128,
2567
+ "mode": "affine"
2568
+ },
2569
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj": {
2570
+ "bits": 8,
2571
+ "group_size": 128,
2572
+ "mode": "affine"
2573
+ },
2574
+ "language_model.model.layers.28.mlp.shared_expert.up_proj": {
2575
+ "bits": 8,
2576
+ "group_size": 128,
2577
+ "mode": "affine"
2578
+ },
2579
+ "language_model.model.layers.28.mlp.shared_expert_gate": {
2580
+ "bits": 8,
2581
+ "group_size": 64,
2582
+ "mode": "affine"
2583
+ },
2584
+ "language_model.model.layers.29.linear_attn.out_proj": {
2585
+ "bits": 6,
2586
+ "group_size": 128,
2587
+ "mode": "affine"
2588
+ },
2589
+ "language_model.model.layers.29.mlp.shared_expert.down_proj": {
2590
+ "bits": 8,
2591
+ "group_size": 128,
2592
+ "mode": "affine"
2593
+ },
2594
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj": {
2595
+ "bits": 8,
2596
+ "group_size": 128,
2597
+ "mode": "affine"
2598
+ },
2599
+ "language_model.model.layers.29.mlp.shared_expert.up_proj": {
2600
+ "bits": 8,
2601
+ "group_size": 128,
2602
+ "mode": "affine"
2603
+ },
2604
+ "language_model.model.layers.29.mlp.shared_expert_gate": {
2605
+ "bits": 8,
2606
+ "group_size": 64,
2607
+ "mode": "affine"
2608
+ },
2609
+ "language_model.model.layers.30.linear_attn.out_proj": {
2610
+ "bits": 6,
2611
+ "group_size": 128,
2612
+ "mode": "affine"
2613
+ },
2614
+ "language_model.model.layers.30.mlp.shared_expert.down_proj": {
2615
+ "bits": 8,
2616
+ "group_size": 128,
2617
+ "mode": "affine"
2618
+ },
2619
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj": {
2620
+ "bits": 8,
2621
+ "group_size": 128,
2622
+ "mode": "affine"
2623
+ },
2624
+ "language_model.model.layers.30.mlp.shared_expert.up_proj": {
2625
+ "bits": 8,
2626
+ "group_size": 128,
2627
+ "mode": "affine"
2628
+ },
2629
+ "language_model.model.layers.30.mlp.shared_expert_gate": {
2630
+ "bits": 8,
2631
+ "group_size": 64,
2632
+ "mode": "affine"
2633
+ },
2634
+ "language_model.model.layers.31.mlp.shared_expert.down_proj": {
2635
+ "bits": 8,
2636
+ "group_size": 128,
2637
+ "mode": "affine"
2638
+ },
2639
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj": {
2640
+ "bits": 8,
2641
+ "group_size": 128,
2642
+ "mode": "affine"
2643
+ },
2644
+ "language_model.model.layers.31.mlp.shared_expert.up_proj": {
2645
+ "bits": 8,
2646
+ "group_size": 128,
2647
+ "mode": "affine"
2648
+ },
2649
+ "language_model.model.layers.31.mlp.shared_expert_gate": {
2650
+ "bits": 8,
2651
+ "group_size": 64,
2652
+ "mode": "affine"
2653
+ },
2654
+ "language_model.model.layers.31.self_attn.k_proj": {
2655
+ "bits": 8,
2656
+ "group_size": 64,
2657
+ "mode": "affine"
2658
+ },
2659
+ "language_model.model.layers.31.self_attn.o_proj": {
2660
+ "bits": 8,
2661
+ "group_size": 64,
2662
+ "mode": "affine"
2663
+ },
2664
+ "language_model.model.layers.31.self_attn.q_proj": {
2665
+ "bits": 8,
2666
+ "group_size": 64,
2667
+ "mode": "affine"
2668
+ },
2669
+ "language_model.model.layers.31.self_attn.v_proj": {
2670
+ "bits": 8,
2671
+ "group_size": 64,
2672
+ "mode": "affine"
2673
+ },
2674
+ "language_model.model.layers.32.linear_attn.in_proj_a": {
2675
+ "bits": 8,
2676
+ "group_size": 64,
2677
+ "mode": "affine"
2678
+ },
2679
+ "language_model.model.layers.32.linear_attn.in_proj_b": {
2680
+ "bits": 8,
2681
+ "group_size": 64,
2682
+ "mode": "affine"
2683
+ },
2684
+ "language_model.model.layers.32.linear_attn.in_proj_qkv": {
2685
+ "bits": 8,
2686
+ "group_size": 64,
2687
+ "mode": "affine"
2688
+ },
2689
+ "language_model.model.layers.32.linear_attn.in_proj_z": {
2690
+ "bits": 8,
2691
+ "group_size": 64,
2692
+ "mode": "affine"
2693
+ },
2694
+ "language_model.model.layers.32.linear_attn.out_proj": {
2695
+ "bits": 6,
2696
+ "group_size": 128,
2697
+ "mode": "affine"
2698
+ },
2699
+ "language_model.model.layers.32.mlp.shared_expert.down_proj": {
2700
+ "bits": 8,
2701
+ "group_size": 128,
2702
+ "mode": "affine"
2703
+ },
2704
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj": {
2705
+ "bits": 8,
2706
+ "group_size": 128,
2707
+ "mode": "affine"
2708
+ },
2709
+ "language_model.model.layers.32.mlp.shared_expert.up_proj": {
2710
+ "bits": 8,
2711
+ "group_size": 128,
2712
+ "mode": "affine"
2713
+ },
2714
+ "language_model.model.layers.32.mlp.shared_expert_gate": {
2715
+ "bits": 8,
2716
+ "group_size": 64,
2717
+ "mode": "affine"
2718
+ },
2719
+ "language_model.model.layers.33.linear_attn.in_proj_a": {
2720
+ "bits": 8,
2721
+ "group_size": 64,
2722
+ "mode": "affine"
2723
+ },
2724
+ "language_model.model.layers.33.linear_attn.in_proj_b": {
2725
+ "bits": 8,
2726
+ "group_size": 64,
2727
+ "mode": "affine"
2728
+ },
2729
+ "language_model.model.layers.33.linear_attn.in_proj_qkv": {
2730
+ "bits": 8,
2731
+ "group_size": 64,
2732
+ "mode": "affine"
2733
+ },
2734
+ "language_model.model.layers.33.linear_attn.in_proj_z": {
2735
+ "bits": 8,
2736
+ "group_size": 64,
2737
+ "mode": "affine"
2738
+ },
2739
+ "language_model.model.layers.33.linear_attn.out_proj": {
2740
+ "bits": 6,
2741
+ "group_size": 128,
2742
+ "mode": "affine"
2743
+ },
2744
+ "language_model.model.layers.33.mlp.shared_expert.down_proj": {
2745
+ "bits": 8,
2746
+ "group_size": 128,
2747
+ "mode": "affine"
2748
+ },
2749
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj": {
2750
+ "bits": 8,
2751
+ "group_size": 128,
2752
+ "mode": "affine"
2753
+ },
2754
+ "language_model.model.layers.33.mlp.shared_expert.up_proj": {
2755
+ "bits": 8,
2756
+ "group_size": 128,
2757
+ "mode": "affine"
2758
+ },
2759
+ "language_model.model.layers.33.mlp.shared_expert_gate": {
2760
+ "bits": 8,
2761
+ "group_size": 64,
2762
+ "mode": "affine"
2763
+ },
2764
+ "language_model.model.layers.34.linear_attn.in_proj_a": {
2765
+ "bits": 8,
2766
+ "group_size": 64,
2767
+ "mode": "affine"
2768
+ },
2769
+ "language_model.model.layers.34.linear_attn.in_proj_b": {
2770
+ "bits": 8,
2771
+ "group_size": 64,
2772
+ "mode": "affine"
2773
+ },
2774
+ "language_model.model.layers.34.linear_attn.in_proj_qkv": {
2775
+ "bits": 8,
2776
+ "group_size": 64,
2777
+ "mode": "affine"
2778
+ },
2779
+ "language_model.model.layers.34.linear_attn.in_proj_z": {
2780
+ "bits": 8,
2781
+ "group_size": 64,
2782
+ "mode": "affine"
2783
+ },
2784
+ "language_model.model.layers.34.linear_attn.out_proj": {
2785
+ "bits": 6,
2786
+ "group_size": 128,
2787
+ "mode": "affine"
2788
+ },
2789
+ "language_model.model.layers.34.mlp.shared_expert.down_proj": {
2790
+ "bits": 8,
2791
+ "group_size": 128,
2792
+ "mode": "affine"
2793
+ },
2794
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj": {
2795
+ "bits": 8,
2796
+ "group_size": 128,
2797
+ "mode": "affine"
2798
+ },
2799
+ "language_model.model.layers.34.mlp.shared_expert.up_proj": {
2800
+ "bits": 8,
2801
+ "group_size": 128,
2802
+ "mode": "affine"
2803
+ },
2804
+ "language_model.model.layers.34.mlp.shared_expert_gate": {
2805
+ "bits": 8,
2806
+ "group_size": 64,
2807
+ "mode": "affine"
2808
+ },
2809
+ "language_model.model.layers.35.mlp.shared_expert.down_proj": {
2810
+ "bits": 8,
2811
+ "group_size": 128,
2812
+ "mode": "affine"
2813
+ },
2814
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj": {
2815
+ "bits": 8,
2816
+ "group_size": 128,
2817
+ "mode": "affine"
2818
+ },
2819
+ "language_model.model.layers.35.mlp.shared_expert.up_proj": {
2820
+ "bits": 8,
2821
+ "group_size": 128,
2822
+ "mode": "affine"
2823
+ },
2824
+ "language_model.model.layers.35.mlp.shared_expert_gate": {
2825
+ "bits": 8,
2826
+ "group_size": 64,
2827
+ "mode": "affine"
2828
+ },
2829
+ "language_model.model.layers.35.self_attn.k_proj": {
2830
+ "bits": 8,
2831
+ "group_size": 64,
2832
+ "mode": "affine"
2833
+ },
2834
+ "language_model.model.layers.35.self_attn.o_proj": {
2835
+ "bits": 8,
2836
+ "group_size": 64,
2837
+ "mode": "affine"
2838
+ },
2839
+ "language_model.model.layers.35.self_attn.q_proj": {
2840
+ "bits": 8,
2841
+ "group_size": 64,
2842
+ "mode": "affine"
2843
+ },
2844
+ "language_model.model.layers.35.self_attn.v_proj": {
2845
+ "bits": 8,
2846
+ "group_size": 64,
2847
+ "mode": "affine"
2848
+ },
2849
+ "language_model.model.layers.36.linear_attn.in_proj_a": {
2850
+ "bits": 8,
2851
+ "group_size": 64,
2852
+ "mode": "affine"
2853
+ },
2854
+ "language_model.model.layers.36.linear_attn.in_proj_b": {
2855
+ "bits": 8,
2856
+ "group_size": 64,
2857
+ "mode": "affine"
2858
+ },
2859
+ "language_model.model.layers.36.linear_attn.in_proj_qkv": {
2860
+ "bits": 8,
2861
+ "group_size": 64,
2862
+ "mode": "affine"
2863
+ },
2864
+ "language_model.model.layers.36.linear_attn.in_proj_z": {
2865
+ "bits": 8,
2866
+ "group_size": 64,
2867
+ "mode": "affine"
2868
+ },
2869
+ "language_model.model.layers.36.linear_attn.out_proj": {
2870
+ "bits": 6,
2871
+ "group_size": 128,
2872
+ "mode": "affine"
2873
+ },
2874
+ "language_model.model.layers.36.mlp.shared_expert.down_proj": {
2875
+ "bits": 8,
2876
+ "group_size": 128,
2877
+ "mode": "affine"
2878
+ },
2879
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj": {
2880
+ "bits": 8,
2881
+ "group_size": 128,
2882
+ "mode": "affine"
2883
+ },
2884
+ "language_model.model.layers.36.mlp.shared_expert.up_proj": {
2885
+ "bits": 8,
2886
+ "group_size": 128,
2887
+ "mode": "affine"
2888
+ },
2889
+ "language_model.model.layers.36.mlp.shared_expert_gate": {
2890
+ "bits": 8,
2891
+ "group_size": 64,
2892
+ "mode": "affine"
2893
+ },
2894
+ "language_model.model.layers.37.linear_attn.in_proj_a": {
2895
+ "bits": 8,
2896
+ "group_size": 64,
2897
+ "mode": "affine"
2898
+ },
2899
+ "language_model.model.layers.37.linear_attn.in_proj_b": {
2900
+ "bits": 8,
2901
+ "group_size": 64,
2902
+ "mode": "affine"
2903
+ },
2904
+ "language_model.model.layers.37.linear_attn.in_proj_qkv": {
2905
+ "bits": 8,
2906
+ "group_size": 64,
2907
+ "mode": "affine"
2908
+ },
2909
+ "language_model.model.layers.37.linear_attn.in_proj_z": {
2910
+ "bits": 8,
2911
+ "group_size": 64,
2912
+ "mode": "affine"
2913
+ },
2914
+ "language_model.model.layers.37.linear_attn.out_proj": {
2915
+ "bits": 6,
2916
+ "group_size": 128,
2917
+ "mode": "affine"
2918
+ },
2919
+ "language_model.model.layers.37.mlp.shared_expert.down_proj": {
2920
+ "bits": 8,
2921
+ "group_size": 128,
2922
+ "mode": "affine"
2923
+ },
2924
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj": {
2925
+ "bits": 8,
2926
+ "group_size": 128,
2927
+ "mode": "affine"
2928
+ },
2929
+ "language_model.model.layers.37.mlp.shared_expert.up_proj": {
2930
+ "bits": 8,
2931
+ "group_size": 128,
2932
+ "mode": "affine"
2933
+ },
2934
+ "language_model.model.layers.37.mlp.shared_expert_gate": {
2935
+ "bits": 8,
2936
+ "group_size": 64,
2937
+ "mode": "affine"
2938
+ },
2939
+ "language_model.model.layers.38.linear_attn.in_proj_a": {
2940
+ "bits": 8,
2941
+ "group_size": 64,
2942
+ "mode": "affine"
2943
+ },
2944
+ "language_model.model.layers.38.linear_attn.in_proj_b": {
2945
+ "bits": 8,
2946
+ "group_size": 64,
2947
+ "mode": "affine"
2948
+ },
2949
+ "language_model.model.layers.38.linear_attn.in_proj_qkv": {
2950
+ "bits": 8,
2951
+ "group_size": 64,
2952
+ "mode": "affine"
2953
+ },
2954
+ "language_model.model.layers.38.linear_attn.in_proj_z": {
2955
+ "bits": 8,
2956
+ "group_size": 64,
2957
+ "mode": "affine"
2958
+ },
2959
+ "language_model.model.layers.38.linear_attn.out_proj": {
2960
+ "bits": 6,
2961
+ "group_size": 128,
2962
+ "mode": "affine"
2963
+ },
2964
+ "language_model.model.layers.38.mlp.shared_expert.down_proj": {
2965
+ "bits": 8,
2966
+ "group_size": 128,
2967
+ "mode": "affine"
2968
+ },
2969
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj": {
2970
+ "bits": 8,
2971
+ "group_size": 128,
2972
+ "mode": "affine"
2973
+ },
2974
+ "language_model.model.layers.38.mlp.shared_expert.up_proj": {
2975
+ "bits": 8,
2976
+ "group_size": 128,
2977
+ "mode": "affine"
2978
+ },
2979
+ "language_model.model.layers.38.mlp.shared_expert_gate": {
2980
+ "bits": 8,
2981
+ "group_size": 64,
2982
+ "mode": "affine"
2983
+ },
2984
+ "language_model.lm_head": {
2985
+ "bits": 8,
2986
+ "group_size": 64,
2987
+ "mode": "affine"
2988
+ },
2989
+ "language_model.model.layers.39.mlp.shared_expert.down_proj": {
2990
+ "bits": 8,
2991
+ "group_size": 128,
2992
+ "mode": "affine"
2993
+ },
2994
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj": {
2995
+ "bits": 8,
2996
+ "group_size": 128,
2997
+ "mode": "affine"
2998
+ },
2999
+ "language_model.model.layers.39.mlp.shared_expert.up_proj": {
3000
+ "bits": 8,
3001
+ "group_size": 128,
3002
+ "mode": "affine"
3003
+ },
3004
+ "language_model.model.layers.39.mlp.shared_expert_gate": {
3005
+ "bits": 8,
3006
+ "group_size": 64,
3007
+ "mode": "affine"
3008
+ },
3009
+ "language_model.model.layers.39.self_attn.k_proj": {
3010
+ "bits": 8,
3011
+ "group_size": 64,
3012
+ "mode": "affine"
3013
+ },
3014
+ "language_model.model.layers.39.self_attn.o_proj": {
3015
+ "bits": 8,
3016
+ "group_size": 64,
3017
+ "mode": "affine"
3018
+ },
3019
+ "language_model.model.layers.39.self_attn.q_proj": {
3020
+ "bits": 8,
3021
+ "group_size": 64,
3022
+ "mode": "affine"
3023
+ },
3024
+ "language_model.model.layers.39.self_attn.v_proj": {
3025
+ "bits": 8,
3026
+ "group_size": 64,
3027
+ "mode": "affine"
3028
+ },
3029
+ "language_model.mtp.layers.0.self_attn.q_proj": {
3030
+ "bits": 8,
3031
+ "group_size": 64,
3032
+ "mode": "affine"
3033
+ },
3034
+ "language_model.mtp.layers.0.self_attn.k_proj": {
3035
+ "bits": 8,
3036
+ "group_size": 64,
3037
+ "mode": "affine"
3038
+ },
3039
+ "language_model.mtp.layers.0.self_attn.v_proj": {
3040
+ "bits": 8,
3041
+ "group_size": 64,
3042
+ "mode": "affine"
3043
+ },
3044
+ "language_model.mtp.layers.0.self_attn.o_proj": {
3045
+ "bits": 8,
3046
+ "group_size": 64,
3047
+ "mode": "affine"
3048
+ },
3049
+ "language_model.mtp.layers.0.mlp.shared_expert.gate_proj": {
3050
+ "bits": 8,
3051
+ "group_size": 128,
3052
+ "mode": "affine"
3053
+ },
3054
+ "language_model.mtp.layers.0.mlp.shared_expert.up_proj": {
3055
+ "bits": 8,
3056
+ "group_size": 128,
3057
+ "mode": "affine"
3058
+ },
3059
+ "language_model.mtp.layers.0.mlp.shared_expert.down_proj": {
3060
+ "bits": 8,
3061
+ "group_size": 128,
3062
+ "mode": "affine"
3063
+ },
3064
+ "language_model.mtp.layers.0.mlp.shared_expert_gate": {
3065
+ "bits": 8,
3066
+ "group_size": 64,
3067
+ "mode": "affine"
3068
+ },
3069
+ "language_model.mtp.layers.0.mlp.switch_mlp.gate_proj": {
3070
+ "bits": 8,
3071
+ "group_size": 64,
3072
+ "mode": "affine"
3073
+ },
3074
+ "language_model.mtp.layers.0.mlp.switch_mlp.up_proj": {
3075
+ "bits": 8,
3076
+ "group_size": 64,
3077
+ "mode": "affine"
3078
+ },
3079
+ "language_model.mtp.layers.0.mlp.switch_mlp.down_proj": {
3080
+ "bits": 8,
3081
+ "group_size": 64,
3082
+ "mode": "affine"
3083
+ }
3084
+ }
3085
+ }
generation_config.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 248044,
3
+ "do_sample": true,
4
+ "eos_token_id": [
5
+ 248046,
6
+ 248044
7
+ ],
8
+ "pad_token_id": 248044,
9
+ "temperature": 0.6,
10
+ "top_k": 20,
11
+ "top_p": 0.95
12
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
model-00001-of-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bf182dfdd1805a6e8d6849cb2294ed2add2c4039ccfa797d82f49892dd17f1ea
3
+ size 5077111333
model-00002-of-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:673eb928031f8972c7c42ee5d874e5882fd1dcf500b714960d48544c7e1a4fa8
3
+ size 5016397274
model-00003-of-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09ba0f8e0d11ae9cf82bbdad9b52ed1800172fb333c52251f7e91cd3cc37409f
3
+ size 5016397334
model-00004-of-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bad47b91bc9d04185d7c6cd1171dabea58491862ed3adbe53beea55665da2d69
3
+ size 5016397342
model-00005-of-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:820b53820fe2d5af68bc316deba1b29d7049e18d1270209ada623350ae64a391
3
+ size 5016397352
model-00006-of-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f6f3754ac12c4113fcf8f1154ee6ee52ce71ab6416fdcee7c987007fd3ea694b
3
+ size 4362084620
model-mtp.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:faac45abe5bbab9dddc5fb221ac5785f84fa36a3643388c8735995381e8e6a6e
3
+ size 905704200
model.safetensors.index.json ADDED
The diff for this file is too large to render. See raw diff
 
oq_imatrix_report.json ADDED
@@ -0,0 +1,577 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "enabled": true,
3
+ "cache_path": "/Users/miad/bench-qwen36/.oqe_imatrix/Huihui-Ornith-1.5-35B-A3B-abliterated-a65d1f247df2-s128-l512.npz",
4
+ "cache_reused": false,
5
+ "entry_count": 510,
6
+ "calib_dataset": "oqe_code_multilingual",
7
+ "collection": {
8
+ "dataset": "oqe_code_multilingual",
9
+ "requested_samples": 128,
10
+ "seq_length": 512,
11
+ "adaptive": true,
12
+ "adaptive_step_samples": 128,
13
+ "adaptive_max_samples": 1024,
14
+ "available_samples": 1024,
15
+ "micro_batch_size": 7,
16
+ "micro_batches": 19,
17
+ "batch_plan": {
18
+ "micro_batch_size": 7,
19
+ "estimated_sample_bytes": 33554432,
20
+ "capture_budget_bytes": 250322342,
21
+ "system_available_bytes": 45454049280,
22
+ "metal_available_bytes": 55606213598,
23
+ "live_available_bytes": 45454049280,
24
+ "model_bytes": 20421815039,
25
+ "remaining_available_bytes": 25032234241,
26
+ "fits_one_sample": true,
27
+ "hidden_size": 2048,
28
+ "num_experts": 256,
29
+ "top_k": 8,
30
+ "gemma4_state_bytes": 0,
31
+ "num_hidden_layers": 40,
32
+ "num_kv_shared_layers": 0,
33
+ "per_layer_input_size": 0
34
+ },
35
+ "processed_samples": 128,
36
+ "installed_modules": 621,
37
+ "capture_module_classes": {
38
+ "Linear": 150,
39
+ "QuantizedLinear": 351,
40
+ "QuantizedSwitchLinear": 120
41
+ },
42
+ "switch_capture_modules": 120,
43
+ "requires_expert_counts": true,
44
+ "coverage_sufficient": true,
45
+ "collection_sufficient": true,
46
+ "coverage": {
47
+ "has_expert_counts": true,
48
+ "expert_modules": 120,
49
+ "total_experts": 30720,
50
+ "active_experts": 30720,
51
+ "zero_count_experts": 0,
52
+ "active_ratio": 1.0,
53
+ "min_count": 2,
54
+ "p05_count": 297.0,
55
+ "p10_count": 450.9000000000001,
56
+ "median_count": 1430.5,
57
+ "max_count": 32913,
58
+ "min_required_count": 16,
59
+ "required_percentile": 5
60
+ },
61
+ "rounds": [
62
+ {
63
+ "processed_samples": 128,
64
+ "coverage_sufficient": true,
65
+ "collection_sufficient": true,
66
+ "coverage": {
67
+ "has_expert_counts": true,
68
+ "expert_modules": 120,
69
+ "total_experts": 30720,
70
+ "active_experts": 30720,
71
+ "zero_count_experts": 0,
72
+ "active_ratio": 1.0,
73
+ "min_count": 2,
74
+ "p05_count": 297.0,
75
+ "p10_count": 450.9000000000001,
76
+ "median_count": 1430.5,
77
+ "max_count": 32913,
78
+ "min_required_count": 16,
79
+ "required_percentile": 5
80
+ }
81
+ }
82
+ ]
83
+ },
84
+ "expert_coverage": {
85
+ "has_expert_counts": true,
86
+ "expert_modules": 120,
87
+ "total_experts": 30720,
88
+ "active_experts": 30720,
89
+ "zero_count_experts": 0,
90
+ "active_ratio": 1.0,
91
+ "min_count": 2,
92
+ "p05_count": 297.0,
93
+ "p10_count": 450.9000000000001,
94
+ "median_count": 1430.5,
95
+ "max_count": 32913,
96
+ "min_required_count": 16,
97
+ "required_percentile": 5
98
+ },
99
+ "applied": [
100
+ "language_model.model.layers.0.linear_attn.in_proj_a",
101
+ "language_model.model.layers.0.linear_attn.in_proj_b",
102
+ "language_model.model.layers.0.linear_attn.in_proj_qkv",
103
+ "language_model.model.layers.0.linear_attn.in_proj_z",
104
+ "language_model.model.layers.0.linear_attn.out_proj",
105
+ "language_model.model.layers.0.mlp.shared_expert.down_proj",
106
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj",
107
+ "language_model.model.layers.0.mlp.shared_expert.up_proj",
108
+ "language_model.model.layers.0.mlp.shared_expert_gate",
109
+ "language_model.model.layers.0.mlp.switch_mlp.down_proj",
110
+ "language_model.model.layers.0.mlp.switch_mlp.gate_proj",
111
+ "language_model.model.layers.0.mlp.switch_mlp.up_proj",
112
+ "language_model.model.layers.1.linear_attn.in_proj_a",
113
+ "language_model.model.layers.1.linear_attn.in_proj_b",
114
+ "language_model.model.layers.1.linear_attn.in_proj_qkv",
115
+ "language_model.model.layers.1.linear_attn.in_proj_z",
116
+ "language_model.model.layers.1.linear_attn.out_proj",
117
+ "language_model.model.layers.1.mlp.shared_expert.down_proj",
118
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj",
119
+ "language_model.model.layers.1.mlp.shared_expert.up_proj",
120
+ "language_model.model.layers.1.mlp.shared_expert_gate",
121
+ "language_model.model.layers.1.mlp.switch_mlp.down_proj",
122
+ "language_model.model.layers.1.mlp.switch_mlp.gate_proj",
123
+ "language_model.model.layers.1.mlp.switch_mlp.up_proj",
124
+ "language_model.model.layers.10.linear_attn.in_proj_a",
125
+ "language_model.model.layers.10.linear_attn.in_proj_b",
126
+ "language_model.model.layers.10.linear_attn.in_proj_qkv",
127
+ "language_model.model.layers.10.linear_attn.in_proj_z",
128
+ "language_model.model.layers.10.linear_attn.out_proj",
129
+ "language_model.model.layers.10.mlp.shared_expert.down_proj",
130
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj",
131
+ "language_model.model.layers.10.mlp.shared_expert.up_proj",
132
+ "language_model.model.layers.10.mlp.shared_expert_gate",
133
+ "language_model.model.layers.10.mlp.switch_mlp.down_proj",
134
+ "language_model.model.layers.10.mlp.switch_mlp.gate_proj",
135
+ "language_model.model.layers.10.mlp.switch_mlp.up_proj",
136
+ "language_model.model.layers.11.mlp.shared_expert.down_proj",
137
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj",
138
+ "language_model.model.layers.11.mlp.shared_expert.up_proj",
139
+ "language_model.model.layers.11.mlp.shared_expert_gate",
140
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj",
141
+ "language_model.model.layers.11.mlp.switch_mlp.gate_proj",
142
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj",
143
+ "language_model.model.layers.11.self_attn.k_proj",
144
+ "language_model.model.layers.11.self_attn.o_proj",
145
+ "language_model.model.layers.11.self_attn.q_proj",
146
+ "language_model.model.layers.11.self_attn.v_proj",
147
+ "language_model.model.layers.12.linear_attn.in_proj_a",
148
+ "language_model.model.layers.12.linear_attn.in_proj_b",
149
+ "language_model.model.layers.12.linear_attn.in_proj_qkv",
150
+ "language_model.model.layers.12.linear_attn.in_proj_z",
151
+ "language_model.model.layers.12.linear_attn.out_proj",
152
+ "language_model.model.layers.12.mlp.shared_expert.down_proj",
153
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj",
154
+ "language_model.model.layers.12.mlp.shared_expert.up_proj",
155
+ "language_model.model.layers.12.mlp.shared_expert_gate",
156
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj",
157
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj",
158
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj",
159
+ "language_model.model.layers.13.linear_attn.in_proj_a",
160
+ "language_model.model.layers.13.linear_attn.in_proj_b",
161
+ "language_model.model.layers.13.linear_attn.in_proj_qkv",
162
+ "language_model.model.layers.13.linear_attn.in_proj_z",
163
+ "language_model.model.layers.13.linear_attn.out_proj",
164
+ "language_model.model.layers.13.mlp.shared_expert.down_proj",
165
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj",
166
+ "language_model.model.layers.13.mlp.shared_expert.up_proj",
167
+ "language_model.model.layers.13.mlp.shared_expert_gate",
168
+ "language_model.model.layers.13.mlp.switch_mlp.down_proj",
169
+ "language_model.model.layers.13.mlp.switch_mlp.gate_proj",
170
+ "language_model.model.layers.13.mlp.switch_mlp.up_proj",
171
+ "language_model.model.layers.14.linear_attn.in_proj_a",
172
+ "language_model.model.layers.14.linear_attn.in_proj_b",
173
+ "language_model.model.layers.14.linear_attn.in_proj_qkv",
174
+ "language_model.model.layers.14.linear_attn.in_proj_z",
175
+ "language_model.model.layers.14.linear_attn.out_proj",
176
+ "language_model.model.layers.14.mlp.shared_expert.down_proj",
177
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj",
178
+ "language_model.model.layers.14.mlp.shared_expert.up_proj",
179
+ "language_model.model.layers.14.mlp.shared_expert_gate",
180
+ "language_model.model.layers.14.mlp.switch_mlp.down_proj",
181
+ "language_model.model.layers.14.mlp.switch_mlp.gate_proj",
182
+ "language_model.model.layers.14.mlp.switch_mlp.up_proj",
183
+ "language_model.model.layers.15.mlp.shared_expert.down_proj",
184
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj",
185
+ "language_model.model.layers.15.mlp.shared_expert.up_proj",
186
+ "language_model.model.layers.15.mlp.shared_expert_gate",
187
+ "language_model.model.layers.15.mlp.switch_mlp.down_proj",
188
+ "language_model.model.layers.15.mlp.switch_mlp.gate_proj",
189
+ "language_model.model.layers.15.mlp.switch_mlp.up_proj",
190
+ "language_model.model.layers.15.self_attn.k_proj",
191
+ "language_model.model.layers.15.self_attn.o_proj",
192
+ "language_model.model.layers.15.self_attn.q_proj",
193
+ "language_model.model.layers.15.self_attn.v_proj",
194
+ "language_model.model.layers.16.linear_attn.in_proj_a",
195
+ "language_model.model.layers.16.linear_attn.in_proj_b",
196
+ "language_model.model.layers.16.linear_attn.in_proj_qkv",
197
+ "language_model.model.layers.16.linear_attn.in_proj_z",
198
+ "language_model.model.layers.16.linear_attn.out_proj",
199
+ "language_model.model.layers.16.mlp.shared_expert.down_proj",
200
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj",
201
+ "language_model.model.layers.16.mlp.shared_expert.up_proj",
202
+ "language_model.model.layers.16.mlp.shared_expert_gate",
203
+ "language_model.model.layers.16.mlp.switch_mlp.down_proj",
204
+ "language_model.model.layers.16.mlp.switch_mlp.gate_proj",
205
+ "language_model.model.layers.16.mlp.switch_mlp.up_proj",
206
+ "language_model.model.layers.17.linear_attn.in_proj_a",
207
+ "language_model.model.layers.17.linear_attn.in_proj_b",
208
+ "language_model.model.layers.17.linear_attn.in_proj_qkv",
209
+ "language_model.model.layers.17.linear_attn.in_proj_z",
210
+ "language_model.model.layers.17.linear_attn.out_proj",
211
+ "language_model.model.layers.17.mlp.shared_expert.down_proj",
212
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj",
213
+ "language_model.model.layers.17.mlp.shared_expert.up_proj",
214
+ "language_model.model.layers.17.mlp.shared_expert_gate",
215
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj",
216
+ "language_model.model.layers.17.mlp.switch_mlp.gate_proj",
217
+ "language_model.model.layers.17.mlp.switch_mlp.up_proj",
218
+ "language_model.model.layers.18.linear_attn.in_proj_a",
219
+ "language_model.model.layers.18.linear_attn.in_proj_b",
220
+ "language_model.model.layers.18.linear_attn.in_proj_qkv",
221
+ "language_model.model.layers.18.linear_attn.in_proj_z",
222
+ "language_model.model.layers.18.linear_attn.out_proj",
223
+ "language_model.model.layers.18.mlp.shared_expert.down_proj",
224
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj",
225
+ "language_model.model.layers.18.mlp.shared_expert.up_proj",
226
+ "language_model.model.layers.18.mlp.shared_expert_gate",
227
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj",
228
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj",
229
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj",
230
+ "language_model.model.layers.19.mlp.shared_expert.down_proj",
231
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj",
232
+ "language_model.model.layers.19.mlp.shared_expert.up_proj",
233
+ "language_model.model.layers.19.mlp.shared_expert_gate",
234
+ "language_model.model.layers.19.mlp.switch_mlp.down_proj",
235
+ "language_model.model.layers.19.mlp.switch_mlp.gate_proj",
236
+ "language_model.model.layers.19.mlp.switch_mlp.up_proj",
237
+ "language_model.model.layers.19.self_attn.k_proj",
238
+ "language_model.model.layers.19.self_attn.o_proj",
239
+ "language_model.model.layers.19.self_attn.q_proj",
240
+ "language_model.model.layers.19.self_attn.v_proj",
241
+ "language_model.model.layers.2.linear_attn.in_proj_a",
242
+ "language_model.model.layers.2.linear_attn.in_proj_b",
243
+ "language_model.model.layers.2.linear_attn.in_proj_qkv",
244
+ "language_model.model.layers.2.linear_attn.in_proj_z",
245
+ "language_model.model.layers.2.linear_attn.out_proj",
246
+ "language_model.model.layers.2.mlp.shared_expert.down_proj",
247
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj",
248
+ "language_model.model.layers.2.mlp.shared_expert.up_proj",
249
+ "language_model.model.layers.2.mlp.shared_expert_gate",
250
+ "language_model.model.layers.2.mlp.switch_mlp.down_proj",
251
+ "language_model.model.layers.2.mlp.switch_mlp.gate_proj",
252
+ "language_model.model.layers.2.mlp.switch_mlp.up_proj",
253
+ "language_model.model.layers.20.linear_attn.in_proj_a",
254
+ "language_model.model.layers.20.linear_attn.in_proj_b",
255
+ "language_model.model.layers.20.linear_attn.in_proj_qkv",
256
+ "language_model.model.layers.20.linear_attn.in_proj_z",
257
+ "language_model.model.layers.20.linear_attn.out_proj",
258
+ "language_model.model.layers.20.mlp.shared_expert.down_proj",
259
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj",
260
+ "language_model.model.layers.20.mlp.shared_expert.up_proj",
261
+ "language_model.model.layers.20.mlp.shared_expert_gate",
262
+ "language_model.model.layers.20.mlp.switch_mlp.down_proj",
263
+ "language_model.model.layers.20.mlp.switch_mlp.gate_proj",
264
+ "language_model.model.layers.20.mlp.switch_mlp.up_proj",
265
+ "language_model.model.layers.21.linear_attn.in_proj_a",
266
+ "language_model.model.layers.21.linear_attn.in_proj_b",
267
+ "language_model.model.layers.21.linear_attn.in_proj_qkv",
268
+ "language_model.model.layers.21.linear_attn.in_proj_z",
269
+ "language_model.model.layers.21.linear_attn.out_proj",
270
+ "language_model.model.layers.21.mlp.shared_expert.down_proj",
271
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj",
272
+ "language_model.model.layers.21.mlp.shared_expert.up_proj",
273
+ "language_model.model.layers.21.mlp.shared_expert_gate",
274
+ "language_model.model.layers.21.mlp.switch_mlp.down_proj",
275
+ "language_model.model.layers.21.mlp.switch_mlp.gate_proj",
276
+ "language_model.model.layers.21.mlp.switch_mlp.up_proj",
277
+ "language_model.model.layers.22.linear_attn.in_proj_a",
278
+ "language_model.model.layers.22.linear_attn.in_proj_b",
279
+ "language_model.model.layers.22.linear_attn.in_proj_qkv",
280
+ "language_model.model.layers.22.linear_attn.in_proj_z",
281
+ "language_model.model.layers.22.linear_attn.out_proj",
282
+ "language_model.model.layers.22.mlp.shared_expert.down_proj",
283
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj",
284
+ "language_model.model.layers.22.mlp.shared_expert.up_proj",
285
+ "language_model.model.layers.22.mlp.shared_expert_gate",
286
+ "language_model.model.layers.22.mlp.switch_mlp.down_proj",
287
+ "language_model.model.layers.22.mlp.switch_mlp.gate_proj",
288
+ "language_model.model.layers.22.mlp.switch_mlp.up_proj",
289
+ "language_model.model.layers.23.mlp.shared_expert.down_proj",
290
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj",
291
+ "language_model.model.layers.23.mlp.shared_expert.up_proj",
292
+ "language_model.model.layers.23.mlp.shared_expert_gate",
293
+ "language_model.model.layers.23.mlp.switch_mlp.down_proj",
294
+ "language_model.model.layers.23.mlp.switch_mlp.gate_proj",
295
+ "language_model.model.layers.23.mlp.switch_mlp.up_proj",
296
+ "language_model.model.layers.23.self_attn.k_proj",
297
+ "language_model.model.layers.23.self_attn.o_proj",
298
+ "language_model.model.layers.23.self_attn.q_proj",
299
+ "language_model.model.layers.23.self_attn.v_proj",
300
+ "language_model.model.layers.24.linear_attn.in_proj_a",
301
+ "language_model.model.layers.24.linear_attn.in_proj_b",
302
+ "language_model.model.layers.24.linear_attn.in_proj_qkv",
303
+ "language_model.model.layers.24.linear_attn.in_proj_z",
304
+ "language_model.model.layers.24.linear_attn.out_proj",
305
+ "language_model.model.layers.24.mlp.shared_expert.down_proj",
306
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj",
307
+ "language_model.model.layers.24.mlp.shared_expert.up_proj",
308
+ "language_model.model.layers.24.mlp.shared_expert_gate",
309
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj",
310
+ "language_model.model.layers.24.mlp.switch_mlp.gate_proj",
311
+ "language_model.model.layers.24.mlp.switch_mlp.up_proj",
312
+ "language_model.model.layers.25.linear_attn.in_proj_a",
313
+ "language_model.model.layers.25.linear_attn.in_proj_b",
314
+ "language_model.model.layers.25.linear_attn.in_proj_qkv",
315
+ "language_model.model.layers.25.linear_attn.in_proj_z",
316
+ "language_model.model.layers.25.linear_attn.out_proj",
317
+ "language_model.model.layers.25.mlp.shared_expert.down_proj",
318
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj",
319
+ "language_model.model.layers.25.mlp.shared_expert.up_proj",
320
+ "language_model.model.layers.25.mlp.shared_expert_gate",
321
+ "language_model.model.layers.25.mlp.switch_mlp.down_proj",
322
+ "language_model.model.layers.25.mlp.switch_mlp.gate_proj",
323
+ "language_model.model.layers.25.mlp.switch_mlp.up_proj",
324
+ "language_model.model.layers.26.linear_attn.in_proj_a",
325
+ "language_model.model.layers.26.linear_attn.in_proj_b",
326
+ "language_model.model.layers.26.linear_attn.in_proj_qkv",
327
+ "language_model.model.layers.26.linear_attn.in_proj_z",
328
+ "language_model.model.layers.26.linear_attn.out_proj",
329
+ "language_model.model.layers.26.mlp.shared_expert.down_proj",
330
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj",
331
+ "language_model.model.layers.26.mlp.shared_expert.up_proj",
332
+ "language_model.model.layers.26.mlp.shared_expert_gate",
333
+ "language_model.model.layers.26.mlp.switch_mlp.down_proj",
334
+ "language_model.model.layers.26.mlp.switch_mlp.gate_proj",
335
+ "language_model.model.layers.26.mlp.switch_mlp.up_proj",
336
+ "language_model.model.layers.27.mlp.shared_expert.down_proj",
337
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj",
338
+ "language_model.model.layers.27.mlp.shared_expert.up_proj",
339
+ "language_model.model.layers.27.mlp.shared_expert_gate",
340
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj",
341
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj",
342
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj",
343
+ "language_model.model.layers.27.self_attn.k_proj",
344
+ "language_model.model.layers.27.self_attn.o_proj",
345
+ "language_model.model.layers.27.self_attn.q_proj",
346
+ "language_model.model.layers.27.self_attn.v_proj",
347
+ "language_model.model.layers.28.linear_attn.in_proj_a",
348
+ "language_model.model.layers.28.linear_attn.in_proj_b",
349
+ "language_model.model.layers.28.linear_attn.in_proj_qkv",
350
+ "language_model.model.layers.28.linear_attn.in_proj_z",
351
+ "language_model.model.layers.28.linear_attn.out_proj",
352
+ "language_model.model.layers.28.mlp.shared_expert.down_proj",
353
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj",
354
+ "language_model.model.layers.28.mlp.shared_expert.up_proj",
355
+ "language_model.model.layers.28.mlp.shared_expert_gate",
356
+ "language_model.model.layers.28.mlp.switch_mlp.down_proj",
357
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj",
358
+ "language_model.model.layers.28.mlp.switch_mlp.up_proj",
359
+ "language_model.model.layers.29.linear_attn.in_proj_a",
360
+ "language_model.model.layers.29.linear_attn.in_proj_b",
361
+ "language_model.model.layers.29.linear_attn.in_proj_qkv",
362
+ "language_model.model.layers.29.linear_attn.in_proj_z",
363
+ "language_model.model.layers.29.linear_attn.out_proj",
364
+ "language_model.model.layers.29.mlp.shared_expert.down_proj",
365
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj",
366
+ "language_model.model.layers.29.mlp.shared_expert.up_proj",
367
+ "language_model.model.layers.29.mlp.shared_expert_gate",
368
+ "language_model.model.layers.29.mlp.switch_mlp.down_proj",
369
+ "language_model.model.layers.29.mlp.switch_mlp.gate_proj",
370
+ "language_model.model.layers.29.mlp.switch_mlp.up_proj",
371
+ "language_model.model.layers.3.mlp.shared_expert.down_proj",
372
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj",
373
+ "language_model.model.layers.3.mlp.shared_expert.up_proj",
374
+ "language_model.model.layers.3.mlp.shared_expert_gate",
375
+ "language_model.model.layers.3.mlp.switch_mlp.down_proj",
376
+ "language_model.model.layers.3.mlp.switch_mlp.gate_proj",
377
+ "language_model.model.layers.3.mlp.switch_mlp.up_proj",
378
+ "language_model.model.layers.3.self_attn.k_proj",
379
+ "language_model.model.layers.3.self_attn.o_proj",
380
+ "language_model.model.layers.3.self_attn.q_proj",
381
+ "language_model.model.layers.3.self_attn.v_proj",
382
+ "language_model.model.layers.30.linear_attn.in_proj_a",
383
+ "language_model.model.layers.30.linear_attn.in_proj_b",
384
+ "language_model.model.layers.30.linear_attn.in_proj_qkv",
385
+ "language_model.model.layers.30.linear_attn.in_proj_z",
386
+ "language_model.model.layers.30.linear_attn.out_proj",
387
+ "language_model.model.layers.30.mlp.shared_expert.down_proj",
388
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj",
389
+ "language_model.model.layers.30.mlp.shared_expert.up_proj",
390
+ "language_model.model.layers.30.mlp.shared_expert_gate",
391
+ "language_model.model.layers.30.mlp.switch_mlp.down_proj",
392
+ "language_model.model.layers.30.mlp.switch_mlp.gate_proj",
393
+ "language_model.model.layers.30.mlp.switch_mlp.up_proj",
394
+ "language_model.model.layers.31.mlp.shared_expert.down_proj",
395
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj",
396
+ "language_model.model.layers.31.mlp.shared_expert.up_proj",
397
+ "language_model.model.layers.31.mlp.shared_expert_gate",
398
+ "language_model.model.layers.31.mlp.switch_mlp.down_proj",
399
+ "language_model.model.layers.31.mlp.switch_mlp.gate_proj",
400
+ "language_model.model.layers.31.mlp.switch_mlp.up_proj",
401
+ "language_model.model.layers.31.self_attn.k_proj",
402
+ "language_model.model.layers.31.self_attn.o_proj",
403
+ "language_model.model.layers.31.self_attn.q_proj",
404
+ "language_model.model.layers.31.self_attn.v_proj",
405
+ "language_model.model.layers.32.linear_attn.in_proj_a",
406
+ "language_model.model.layers.32.linear_attn.in_proj_b",
407
+ "language_model.model.layers.32.linear_attn.in_proj_qkv",
408
+ "language_model.model.layers.32.linear_attn.in_proj_z",
409
+ "language_model.model.layers.32.linear_attn.out_proj",
410
+ "language_model.model.layers.32.mlp.shared_expert.down_proj",
411
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj",
412
+ "language_model.model.layers.32.mlp.shared_expert.up_proj",
413
+ "language_model.model.layers.32.mlp.shared_expert_gate",
414
+ "language_model.model.layers.32.mlp.switch_mlp.down_proj",
415
+ "language_model.model.layers.32.mlp.switch_mlp.gate_proj",
416
+ "language_model.model.layers.32.mlp.switch_mlp.up_proj",
417
+ "language_model.model.layers.33.linear_attn.in_proj_a",
418
+ "language_model.model.layers.33.linear_attn.in_proj_b",
419
+ "language_model.model.layers.33.linear_attn.in_proj_qkv",
420
+ "language_model.model.layers.33.linear_attn.in_proj_z",
421
+ "language_model.model.layers.33.linear_attn.out_proj",
422
+ "language_model.model.layers.33.mlp.shared_expert.down_proj",
423
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj",
424
+ "language_model.model.layers.33.mlp.shared_expert.up_proj",
425
+ "language_model.model.layers.33.mlp.shared_expert_gate",
426
+ "language_model.model.layers.33.mlp.switch_mlp.down_proj",
427
+ "language_model.model.layers.33.mlp.switch_mlp.gate_proj",
428
+ "language_model.model.layers.33.mlp.switch_mlp.up_proj",
429
+ "language_model.model.layers.34.linear_attn.in_proj_a",
430
+ "language_model.model.layers.34.linear_attn.in_proj_b",
431
+ "language_model.model.layers.34.linear_attn.in_proj_qkv",
432
+ "language_model.model.layers.34.linear_attn.in_proj_z",
433
+ "language_model.model.layers.34.linear_attn.out_proj",
434
+ "language_model.model.layers.34.mlp.shared_expert.down_proj",
435
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj",
436
+ "language_model.model.layers.34.mlp.shared_expert.up_proj",
437
+ "language_model.model.layers.34.mlp.shared_expert_gate",
438
+ "language_model.model.layers.34.mlp.switch_mlp.down_proj",
439
+ "language_model.model.layers.34.mlp.switch_mlp.gate_proj",
440
+ "language_model.model.layers.34.mlp.switch_mlp.up_proj",
441
+ "language_model.model.layers.35.mlp.shared_expert.down_proj",
442
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj",
443
+ "language_model.model.layers.35.mlp.shared_expert.up_proj",
444
+ "language_model.model.layers.35.mlp.shared_expert_gate",
445
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj",
446
+ "language_model.model.layers.35.mlp.switch_mlp.gate_proj",
447
+ "language_model.model.layers.35.mlp.switch_mlp.up_proj",
448
+ "language_model.model.layers.35.self_attn.k_proj",
449
+ "language_model.model.layers.35.self_attn.o_proj",
450
+ "language_model.model.layers.35.self_attn.q_proj",
451
+ "language_model.model.layers.35.self_attn.v_proj",
452
+ "language_model.model.layers.36.linear_attn.in_proj_a",
453
+ "language_model.model.layers.36.linear_attn.in_proj_b",
454
+ "language_model.model.layers.36.linear_attn.in_proj_qkv",
455
+ "language_model.model.layers.36.linear_attn.in_proj_z",
456
+ "language_model.model.layers.36.linear_attn.out_proj",
457
+ "language_model.model.layers.36.mlp.shared_expert.down_proj",
458
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj",
459
+ "language_model.model.layers.36.mlp.shared_expert.up_proj",
460
+ "language_model.model.layers.36.mlp.shared_expert_gate",
461
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj",
462
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj",
463
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj",
464
+ "language_model.model.layers.37.linear_attn.in_proj_a",
465
+ "language_model.model.layers.37.linear_attn.in_proj_b",
466
+ "language_model.model.layers.37.linear_attn.in_proj_qkv",
467
+ "language_model.model.layers.37.linear_attn.in_proj_z",
468
+ "language_model.model.layers.37.linear_attn.out_proj",
469
+ "language_model.model.layers.37.mlp.shared_expert.down_proj",
470
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj",
471
+ "language_model.model.layers.37.mlp.shared_expert.up_proj",
472
+ "language_model.model.layers.37.mlp.shared_expert_gate",
473
+ "language_model.model.layers.37.mlp.switch_mlp.down_proj",
474
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj",
475
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj",
476
+ "language_model.model.layers.38.linear_attn.in_proj_a",
477
+ "language_model.model.layers.38.linear_attn.in_proj_b",
478
+ "language_model.model.layers.38.linear_attn.in_proj_qkv",
479
+ "language_model.model.layers.38.linear_attn.in_proj_z",
480
+ "language_model.model.layers.38.linear_attn.out_proj",
481
+ "language_model.model.layers.38.mlp.shared_expert.down_proj",
482
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj",
483
+ "language_model.model.layers.38.mlp.shared_expert.up_proj",
484
+ "language_model.model.layers.38.mlp.shared_expert_gate",
485
+ "language_model.model.layers.38.mlp.switch_mlp.down_proj",
486
+ "language_model.model.layers.38.mlp.switch_mlp.gate_proj",
487
+ "language_model.model.layers.38.mlp.switch_mlp.up_proj",
488
+ "language_model.model.layers.39.mlp.shared_expert.down_proj",
489
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj",
490
+ "language_model.model.layers.39.mlp.shared_expert.up_proj",
491
+ "language_model.model.layers.39.mlp.shared_expert_gate",
492
+ "language_model.model.layers.39.mlp.switch_mlp.down_proj",
493
+ "language_model.model.layers.39.mlp.switch_mlp.gate_proj",
494
+ "language_model.model.layers.39.mlp.switch_mlp.up_proj",
495
+ "language_model.model.layers.39.self_attn.k_proj",
496
+ "language_model.model.layers.39.self_attn.o_proj",
497
+ "language_model.model.layers.39.self_attn.q_proj",
498
+ "language_model.model.layers.39.self_attn.v_proj",
499
+ "language_model.model.layers.4.linear_attn.in_proj_a",
500
+ "language_model.model.layers.4.linear_attn.in_proj_b",
501
+ "language_model.model.layers.4.linear_attn.in_proj_qkv",
502
+ "language_model.model.layers.4.linear_attn.in_proj_z",
503
+ "language_model.model.layers.4.linear_attn.out_proj",
504
+ "language_model.model.layers.4.mlp.shared_expert.down_proj",
505
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj",
506
+ "language_model.model.layers.4.mlp.shared_expert.up_proj",
507
+ "language_model.model.layers.4.mlp.shared_expert_gate",
508
+ "language_model.model.layers.4.mlp.switch_mlp.down_proj",
509
+ "language_model.model.layers.4.mlp.switch_mlp.gate_proj",
510
+ "language_model.model.layers.4.mlp.switch_mlp.up_proj",
511
+ "language_model.model.layers.5.linear_attn.in_proj_a",
512
+ "language_model.model.layers.5.linear_attn.in_proj_b",
513
+ "language_model.model.layers.5.linear_attn.in_proj_qkv",
514
+ "language_model.model.layers.5.linear_attn.in_proj_z",
515
+ "language_model.model.layers.5.linear_attn.out_proj",
516
+ "language_model.model.layers.5.mlp.shared_expert.down_proj",
517
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj",
518
+ "language_model.model.layers.5.mlp.shared_expert.up_proj",
519
+ "language_model.model.layers.5.mlp.shared_expert_gate",
520
+ "language_model.model.layers.5.mlp.switch_mlp.down_proj",
521
+ "language_model.model.layers.5.mlp.switch_mlp.gate_proj",
522
+ "language_model.model.layers.5.mlp.switch_mlp.up_proj",
523
+ "language_model.model.layers.6.linear_attn.in_proj_a",
524
+ "language_model.model.layers.6.linear_attn.in_proj_b",
525
+ "language_model.model.layers.6.linear_attn.in_proj_qkv",
526
+ "language_model.model.layers.6.linear_attn.in_proj_z",
527
+ "language_model.model.layers.6.linear_attn.out_proj",
528
+ "language_model.model.layers.6.mlp.shared_expert.down_proj",
529
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj",
530
+ "language_model.model.layers.6.mlp.shared_expert.up_proj",
531
+ "language_model.model.layers.6.mlp.shared_expert_gate",
532
+ "language_model.model.layers.6.mlp.switch_mlp.down_proj",
533
+ "language_model.model.layers.6.mlp.switch_mlp.gate_proj",
534
+ "language_model.model.layers.6.mlp.switch_mlp.up_proj",
535
+ "language_model.model.layers.7.mlp.shared_expert.down_proj",
536
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj",
537
+ "language_model.model.layers.7.mlp.shared_expert.up_proj",
538
+ "language_model.model.layers.7.mlp.shared_expert_gate",
539
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj",
540
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj",
541
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj",
542
+ "language_model.model.layers.7.self_attn.k_proj",
543
+ "language_model.model.layers.7.self_attn.o_proj",
544
+ "language_model.model.layers.7.self_attn.q_proj",
545
+ "language_model.model.layers.7.self_attn.v_proj",
546
+ "language_model.model.layers.8.linear_attn.in_proj_a",
547
+ "language_model.model.layers.8.linear_attn.in_proj_b",
548
+ "language_model.model.layers.8.linear_attn.in_proj_qkv",
549
+ "language_model.model.layers.8.linear_attn.in_proj_z",
550
+ "language_model.model.layers.8.linear_attn.out_proj",
551
+ "language_model.model.layers.8.mlp.shared_expert.down_proj",
552
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj",
553
+ "language_model.model.layers.8.mlp.shared_expert.up_proj",
554
+ "language_model.model.layers.8.mlp.shared_expert_gate",
555
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj",
556
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj",
557
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj",
558
+ "language_model.model.layers.9.linear_attn.in_proj_a",
559
+ "language_model.model.layers.9.linear_attn.in_proj_b",
560
+ "language_model.model.layers.9.linear_attn.in_proj_qkv",
561
+ "language_model.model.layers.9.linear_attn.in_proj_z",
562
+ "language_model.model.layers.9.linear_attn.out_proj",
563
+ "language_model.model.layers.9.mlp.shared_expert.down_proj",
564
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj",
565
+ "language_model.model.layers.9.mlp.shared_expert.up_proj",
566
+ "language_model.model.layers.9.mlp.shared_expert_gate",
567
+ "language_model.model.layers.9.mlp.switch_mlp.down_proj",
568
+ "language_model.model.layers.9.mlp.switch_mlp.gate_proj",
569
+ "language_model.model.layers.9.mlp.switch_mlp.up_proj"
570
+ ],
571
+ "missing": [
572
+ "language_model.lm_head",
573
+ "language_model.model.embed_tokens"
574
+ ],
575
+ "mismatched": [],
576
+ "zero_count_experts": 0
577
+ }
preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 16777216,
4
+ "shortest_edge": 65536
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "image_processor_type": "Qwen2VLImageProcessorFast"
21
+ }
processor_config.json ADDED
@@ -0,0 +1,60 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": true,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "do_resize": true,
7
+ "image_mean": [
8
+ 0.5,
9
+ 0.5,
10
+ 0.5
11
+ ],
12
+ "image_processor_type": "Qwen2VLImageProcessor",
13
+ "image_std": [
14
+ 0.5,
15
+ 0.5,
16
+ 0.5
17
+ ],
18
+ "merge_size": 2,
19
+ "patch_size": 16,
20
+ "resample": 3,
21
+ "rescale_factor": 0.00392156862745098,
22
+ "size": {
23
+ "longest_edge": 16777216,
24
+ "shortest_edge": 65536
25
+ },
26
+ "temporal_patch_size": 2
27
+ },
28
+ "processor_class": "Qwen3VLProcessor",
29
+ "video_processor": {
30
+ "do_convert_rgb": true,
31
+ "do_normalize": true,
32
+ "do_rescale": true,
33
+ "do_resize": true,
34
+ "do_sample_frames": true,
35
+ "fps": 2,
36
+ "image_mean": [
37
+ 0.5,
38
+ 0.5,
39
+ 0.5
40
+ ],
41
+ "image_std": [
42
+ 0.5,
43
+ 0.5,
44
+ 0.5
45
+ ],
46
+ "max_frames": 768,
47
+ "merge_size": 2,
48
+ "min_frames": 4,
49
+ "patch_size": 16,
50
+ "resample": 3,
51
+ "rescale_factor": 0.00392156862745098,
52
+ "return_metadata": false,
53
+ "size": {
54
+ "longest_edge": 25165824,
55
+ "shortest_edge": 4096
56
+ },
57
+ "temporal_patch_size": 2,
58
+ "video_processor_type": "Qwen3VLVideoProcessor"
59
+ }
60
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5f9e4d4901a92b997e463c1f46055088b6cca5ca61a6522d1b9f64c4bb81cb42
3
+ size 12807982
tokenizer_config.json ADDED
@@ -0,0 +1,305 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "added_tokens_decoder": {
4
+ "248044": {
5
+ "content": "<|endoftext|>",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "248045": {
13
+ "content": "<|im_start|>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "248046": {
21
+ "content": "<|im_end|>",
22
+ "lstrip": false,
23
+ "normalized": false,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "248047": {
29
+ "content": "<|object_ref_start|>",
30
+ "lstrip": false,
31
+ "normalized": false,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "248048": {
37
+ "content": "<|object_ref_end|>",
38
+ "lstrip": false,
39
+ "normalized": false,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ },
44
+ "248049": {
45
+ "content": "<|box_start|>",
46
+ "lstrip": false,
47
+ "normalized": false,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": true
51
+ },
52
+ "248050": {
53
+ "content": "<|box_end|>",
54
+ "lstrip": false,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": true
59
+ },
60
+ "248051": {
61
+ "content": "<|quad_start|>",
62
+ "lstrip": false,
63
+ "normalized": false,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": true
67
+ },
68
+ "248052": {
69
+ "content": "<|quad_end|>",
70
+ "lstrip": false,
71
+ "normalized": false,
72
+ "rstrip": false,
73
+ "single_word": false,
74
+ "special": true
75
+ },
76
+ "248053": {
77
+ "content": "<|vision_start|>",
78
+ "lstrip": false,
79
+ "normalized": false,
80
+ "rstrip": false,
81
+ "single_word": false,
82
+ "special": true
83
+ },
84
+ "248054": {
85
+ "content": "<|vision_end|>",
86
+ "lstrip": false,
87
+ "normalized": false,
88
+ "rstrip": false,
89
+ "single_word": false,
90
+ "special": true
91
+ },
92
+ "248055": {
93
+ "content": "<|vision_pad|>",
94
+ "lstrip": false,
95
+ "normalized": false,
96
+ "rstrip": false,
97
+ "single_word": false,
98
+ "special": true
99
+ },
100
+ "248056": {
101
+ "content": "<|image_pad|>",
102
+ "lstrip": false,
103
+ "normalized": false,
104
+ "rstrip": false,
105
+ "single_word": false,
106
+ "special": true
107
+ },
108
+ "248057": {
109
+ "content": "<|video_pad|>",
110
+ "lstrip": false,
111
+ "normalized": false,
112
+ "rstrip": false,
113
+ "single_word": false,
114
+ "special": true
115
+ },
116
+ "248058": {
117
+ "content": "<tool_call>",
118
+ "lstrip": false,
119
+ "normalized": false,
120
+ "rstrip": false,
121
+ "single_word": false,
122
+ "special": false
123
+ },
124
+ "248059": {
125
+ "content": "</tool_call>",
126
+ "lstrip": false,
127
+ "normalized": false,
128
+ "rstrip": false,
129
+ "single_word": false,
130
+ "special": false
131
+ },
132
+ "248060": {
133
+ "content": "<|fim_prefix|>",
134
+ "lstrip": false,
135
+ "normalized": false,
136
+ "rstrip": false,
137
+ "single_word": false,
138
+ "special": false
139
+ },
140
+ "248061": {
141
+ "content": "<|fim_middle|>",
142
+ "lstrip": false,
143
+ "normalized": false,
144
+ "rstrip": false,
145
+ "single_word": false,
146
+ "special": false
147
+ },
148
+ "248062": {
149
+ "content": "<|fim_suffix|>",
150
+ "lstrip": false,
151
+ "normalized": false,
152
+ "rstrip": false,
153
+ "single_word": false,
154
+ "special": false
155
+ },
156
+ "248063": {
157
+ "content": "<|fim_pad|>",
158
+ "lstrip": false,
159
+ "normalized": false,
160
+ "rstrip": false,
161
+ "single_word": false,
162
+ "special": false
163
+ },
164
+ "248064": {
165
+ "content": "<|repo_name|>",
166
+ "lstrip": false,
167
+ "normalized": false,
168
+ "rstrip": false,
169
+ "single_word": false,
170
+ "special": false
171
+ },
172
+ "248065": {
173
+ "content": "<|file_sep|>",
174
+ "lstrip": false,
175
+ "normalized": false,
176
+ "rstrip": false,
177
+ "single_word": false,
178
+ "special": false
179
+ },
180
+ "248066": {
181
+ "content": "<tool_response>",
182
+ "lstrip": false,
183
+ "normalized": false,
184
+ "rstrip": false,
185
+ "single_word": false,
186
+ "special": false
187
+ },
188
+ "248067": {
189
+ "content": "</tool_response>",
190
+ "lstrip": false,
191
+ "normalized": false,
192
+ "rstrip": false,
193
+ "single_word": false,
194
+ "special": false
195
+ },
196
+ "248068": {
197
+ "content": "<think>",
198
+ "lstrip": false,
199
+ "normalized": false,
200
+ "rstrip": false,
201
+ "single_word": false,
202
+ "special": false
203
+ },
204
+ "248069": {
205
+ "content": "</think>",
206
+ "lstrip": false,
207
+ "normalized": false,
208
+ "rstrip": false,
209
+ "single_word": false,
210
+ "special": false
211
+ },
212
+ "248070": {
213
+ "content": "<|audio_start|>",
214
+ "lstrip": false,
215
+ "normalized": false,
216
+ "rstrip": false,
217
+ "single_word": false,
218
+ "special": true
219
+ },
220
+ "248071": {
221
+ "content": "<|audio_end|>",
222
+ "lstrip": false,
223
+ "normalized": false,
224
+ "rstrip": false,
225
+ "single_word": false,
226
+ "special": true
227
+ },
228
+ "248072": {
229
+ "content": "<tts_pad>",
230
+ "lstrip": false,
231
+ "normalized": false,
232
+ "rstrip": false,
233
+ "single_word": false,
234
+ "special": true
235
+ },
236
+ "248073": {
237
+ "content": "<tts_text_bos>",
238
+ "lstrip": false,
239
+ "normalized": false,
240
+ "rstrip": false,
241
+ "single_word": false,
242
+ "special": true
243
+ },
244
+ "248074": {
245
+ "content": "<tts_text_eod>",
246
+ "lstrip": false,
247
+ "normalized": false,
248
+ "rstrip": false,
249
+ "single_word": false,
250
+ "special": true
251
+ },
252
+ "248075": {
253
+ "content": "<tts_text_bos_single>",
254
+ "lstrip": false,
255
+ "normalized": false,
256
+ "rstrip": false,
257
+ "single_word": false,
258
+ "special": true
259
+ },
260
+ "248076": {
261
+ "content": "<|audio_pad|>",
262
+ "lstrip": false,
263
+ "normalized": false,
264
+ "rstrip": false,
265
+ "single_word": false,
266
+ "special": true
267
+ }
268
+ },
269
+ "additional_special_tokens": [
270
+ "<|im_start|>",
271
+ "<|im_end|>",
272
+ "<|object_ref_start|>",
273
+ "<|object_ref_end|>",
274
+ "<|box_start|>",
275
+ "<|box_end|>",
276
+ "<|quad_start|>",
277
+ "<|quad_end|>",
278
+ "<|vision_start|>",
279
+ "<|vision_end|>",
280
+ "<|vision_pad|>",
281
+ "<|image_pad|>",
282
+ "<|video_pad|>"
283
+ ],
284
+ "bos_token": null,
285
+ "chat_template": "{%- set template_version = \"qwen3.8-froggeric-v22.5.0\" %}\n{%- set _tool_format = tool_call_format if tool_call_format is defined else 'xml' %}\n{%- set image_count = namespace(value=0) %}\n{%- set video_count = namespace(value=0) %}\n{%- set add_vision_id = add_vision_id if add_vision_id is defined else false %}\n{%- set enable_thinking = enable_thinking if enable_thinking is defined else true %}\n{%- set auto_disable_thinking_with_tools = auto_disable_thinking_with_tools if auto_disable_thinking_with_tools is defined else false %}\n{%- if preserve_reasoning is defined and preserve_reasoning is not none %}\n {%- set _preserve_thinking = preserve_reasoning %}\n{%- elif preserve_thinking is defined and preserve_thinking is not none %}\n {%- set _preserve_thinking = preserve_thinking %}\n{%- else %}\n {%- set _preserve_thinking = true %}\n{%- endif %}\n{%- set max_tool_arg_chars = max_tool_arg_chars if max_tool_arg_chars is defined else 0 %}\n{%- set max_tool_response_chars = max_tool_response_chars if max_tool_response_chars is defined else 0 %}\n{%- set _default_reasoning_effort = 'medium' %}\n{%- set _has_tools = (tools is defined and tools and tools is iterable and tools is not mapping) %}\n{%- set _effort_raw = (reasoning_effort | string | lower) if reasoning_effort is defined and reasoning_effort is not none else _default_reasoning_effort %}\n{%- set _initial_thinking = enable_thinking %}\n{%- if _effort_raw in ('none', 'off') %}\n {%- set _initial_thinking = false %}\n {%- set _initial_effort = 'medium' %}\n{%- elif _effort_raw in ('minimal', 'low') %}\n {%- set _initial_effort = 'low' %}\n{%- elif _effort_raw in ('high', 'xhigh', 'max', 'ultracode', 'extreme') %}\n {%- set _initial_effort = 'xhigh' %}\n{%- else %}\n {%- set _initial_effort = 'medium' %}\n{%- endif %}\n{%- set ns_state = namespace(thinking=_initial_thinking, effort=_initial_effort) %}\n{%- if auto_disable_thinking_with_tools and _has_tools %}\n {%- set ns_state.thinking = false %}\n{%- endif %}\n{%- for msg in messages %}\n {%- if msg.role == 'system' or msg.role == 'developer' or msg.role == 'user' %}\n {%- if msg.content is string %}\n {%- if '<|think_off|>' in msg.content %}\n {%- set ns_state.thinking = false %}\n {%- elif '<|think_on|>' in msg.content %}\n {%- set ns_state.thinking = true %}\n {%- elif '<|think_xhigh|>' in msg.content or '<|think_high|>' in msg.content or '<|think_ultracode|>' in msg.content or '<|think_extreme|>' in msg.content or '<|think_max|>' in msg.content %}\n {%- set ns_state.thinking = true %}\n {%- set ns_state.effort = 'xhigh' %}\n {%- elif '<|think_low|>' in msg.content or '<|think_minimal|>' in msg.content %}\n {%- set ns_state.thinking = true %}\n {%- set ns_state.effort = 'low' %}\n {%- elif '<|think_medium|>' in msg.content %}\n {%- set ns_state.thinking = true %}\n {%- set ns_state.effort = 'medium' %}\n {%- endif %}\n {%- elif msg.content is iterable and msg.content is not mapping %}\n {%- for item in msg.content %}\n {%- if item is string %}\n {%- set _item_text = item %}\n {%- elif item is mapping and 'text' in item and item.text is string %}\n {%- set _item_text = item.text %}\n {%- else %}\n {%- set _item_text = '' %}\n {%- endif %}\n {%- if _item_text %}\n {%- if '<|think_off|>' in _item_text %}\n {%- set ns_state.thinking = false %}\n {%- elif '<|think_on|>' in _item_text %}\n {%- set ns_state.thinking = true %}\n {%- elif '<|think_xhigh|>' in _item_text or '<|think_high|>' in _item_text or '<|think_ultracode|>' in _item_text or '<|think_extreme|>' in _item_text or '<|think_max|>' in _item_text %}\n {%- set ns_state.thinking = true %}\n {%- set ns_state.effort = 'xhigh' %}\n {%- elif '<|think_low|>' in _item_text or '<|think_minimal|>' in _item_text %}\n {%- set ns_state.thinking = true %}\n {%- set ns_state.effort = 'low' %}\n {%- elif '<|think_medium|>' in _item_text %}\n {%- set ns_state.thinking = true %}\n {%- set ns_state.effort = 'medium' %}\n {%- endif %}\n {%- endif %}\n {%- endfor %}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- set reasoning_instructions = '' %}\n{%- if ns_state.thinking %}\n {%- if ns_state.effort == 'xhigh' %}\n {%- set reasoning_instructions = 'Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.' %}\n {%- elif ns_state.effort == 'low' %}\n {%- set reasoning_instructions = 'Reasoning effort is set to low. Keep your thinking brief and focused, moving directly to the conclusion without unnecessary elaboration.' %}\n {%- endif %}\n{%- endif %}\n{%- macro render_content(content, do_vision_count, is_system_content=false) %}\n {%- if content is string %}\n {{- content }}\n {%- elif content is iterable and content is not mapping %}\n {%- for item in content %}\n {%- if item is mapping %}\n {%- if item.type == 'image' or 'image' in item or 'image_url' in item %}\n {%- if is_system_content %}\n {{- raise_exception('System message cannot contain images.') }}\n {%- endif %}\n {%- if do_vision_count %}\n {%- set image_count.value = image_count.value + 1 %}\n {%- endif %}\n {%- if add_vision_id %}\n {{- 'Picture ' ~ image_count.value ~ ': ' }}\n {%- endif %}\n {{- '<|vision_start|><|image_pad|><|vision_end|>' }}\n {%- elif item.type == 'video' or 'video' in item or 'video_url' in item %}\n {%- if is_system_content %}\n {{- raise_exception('System message cannot contain videos.') }}\n {%- endif %}\n {%- if do_vision_count %}\n {%- set video_count.value = video_count.value + 1 %}\n {%- endif %}\n {%- if add_vision_id %}\n {{- 'Video ' ~ video_count.value ~ ': ' }}\n {%- endif %}\n {{- '<|vision_start|><|video_pad|><|vision_end|>' }}\n {%- elif 'text' in item %}\n {{- item.text }}\n {%- else %}\n {{- raise_exception('Unexpected item type in content.') }}\n {%- endif %}\n {%- else %}\n {{- item | string }}\n {%- endif %}\n {%- endfor %}\n {%- elif content is none or content is undefined %}\n {{- '' }}\n {%- else %}\n {{- raise_exception('Unexpected content type.') }}\n {%- endif %}\n{%- endmacro %}\n{%- if not messages %}\n {{- raise_exception('No messages provided.') }}\n{%- endif %}\n{%- set head = namespace(count=0, seen_non_system=false) %}\n{%- for message in messages %}\n {%- set _is_sys = (message.role == 'system' or message.role == 'developer') %}\n {%- if _is_sys and not head.seen_non_system %}\n {%- set head.count = head.count + 1 %}\n {%- else %}\n {%- set head.seen_non_system = true %}\n {%- endif %}\n{%- endfor %}\n{%- set sys_state = namespace(content='') %}\n{%- for message in messages[:head.count] %}\n {%- set _part = render_content(message.content, false, true) | trim %}\n {%- if '<|think_off|>' in _part %}{%- set _part = _part.split('<|think_off|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_on|>' in _part %}{%- set _part = _part.split('<|think_on|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_xhigh|>' in _part %}{%- set _part = _part.split('<|think_xhigh|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_high|>' in _part %}{%- set _part = _part.split('<|think_high|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_ultracode|>' in _part %}{%- set _part = _part.split('<|think_ultracode|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_extreme|>' in _part %}{%- set _part = _part.split('<|think_extreme|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_max|>' in _part %}{%- set _part = _part.split('<|think_max|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_medium|>' in _part %}{%- set _part = _part.split('<|think_medium|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_low|>' in _part %}{%- set _part = _part.split('<|think_low|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_minimal|>' in _part %}{%- set _part = _part.split('<|think_minimal|>') | join('') | trim %}{%- endif %}\n {%- if _part %}\n {%- if sys_state.content %}\n {%- set sys_state.content = sys_state.content ~ '\\n\\n' ~ _part %}\n {%- else %}\n {%- set sys_state.content = _part %}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- set _sc = sys_state.content %}\n{%- set _msgs = messages[head.count:] %}\n{%- if ns_state.thinking %}\n {%- set _terse_lead = 'You are Cyber-Tiel-Coder, a variant of Ornith-1.5-35B-A3B. Answer directly, after thinking. Lead with the answer, then only what it needs to be correct and usable.' %}\n{%- else %}\n {%- set _terse_lead = 'You are Cyber-Tiel-Coder, a variant of Ornith-1.5-35B-A3B. Answer directly and concisely. Give the answer with only what it needs to be correct and usable.' %}\n{%- endif %}\n{%- set _terse_core %}\nNever: open with preamble or pleasantries; restate the question; add filler transitions; hedge with niceties; or repeat a point you've already made.\nAlways: keep essential steps, caveats, uncertainties, and specifics — never drop correctness or a needed warning for brevity. Keep the final answer lean. Use the least structure that conveys it (plain prose when short; lists or code only when they earn their place). If genuinely uncertain, say so and explain why — never omit uncertainty for the sake of brevity.\nIf a user request is genuinely ambiguous, ask a sharp question, don't guess.\n{%- endset %}\n{%- set _terse = _terse_lead ~ '\\n' ~ (_terse_core | trim) %}\n{#- `terse` chat-template kwarg: default true, so behaviour is unchanged unless a caller opts out.\n Pass {\"terse\": false} via chat_template_kwargs to serve the model with only its own system\n prompt -- useful for A/B-ing the terseness effect, or when a downstream prompt conflicts. #}\n{%- set _terse_on = terse if terse is defined else true %}\n{%- if _terse_on %}\n {%- if not _sc %}\n {%- set _sc = _terse | trim %}\n {%- else %}\n {%- set _sc = (_sc | trim) ~ '\\n\\n' ~ (_terse | trim) %}\n {%- endif %}\n{%- endif %}\n{#- Some runtimes (LM Studio's MLX backend) have no native tool-call parser and prepend their own\n protocol into the system content. Emitting ours as well gives the model two contradictory tool\n protocols and it follows one at random. Detect that marker and stand down; the\n `suppress_tool_instructions` kwarg overrides either way where a runtime can pass template kwargs. #}\n{%- set _runtime_tool_protocol = (_sc is defined and _sc and '[TOOL_REQUEST]' in _sc) %}\n{%- set _suppress_tools = suppress_tool_instructions if suppress_tool_instructions is defined else _runtime_tool_protocol %}\n{%- if _has_tools and not _suppress_tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if reasoning_instructions %}\n {{- reasoning_instructions + '\\n\\n' }}\n {%- endif %}\n {{- '# Tools\\n\\nYou have access to the following functions:\\n\\n<tools>' }}\n {%- for tool in tools %}\n {{- '\\n' }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- '\\n</tools>' }}\n {%- if _tool_format == 'json' %}\n {{- '\\n\\nIf you choose to call a function ONLY reply in the following format with NO suffix:\\n\\n' }}\n {%- if ns_state.thinking %}\n {{- '<think>\\nBrief explanation of tool call\\n</think>\\n' }}\n {%- endif %}\n {{- '<tool_call>\\n{\"name\": \"example_function_name\", \"arguments\": {\"example_parameter_1\": \"value_1\", \"example_parameter_2\": \"This is the value for the second parameter\"}}\\n</tool_call>\\n\\n<IMPORTANT>\\nReminder:\\n' }}\n {%- if ns_state.thinking %}\n {{- '- You can use the <think></think> block to plan your next tool call OR to synthesize data and formulate your final response to the user.\\n- ALL explanation and reasoning MUST be placed strictly inside the <think></think> block.\\n' }}\n {%- endif %}\n {{- '- Function calls MUST follow the specified format: a single JSON object with \"name\" and \"arguments\" keys inside <tool_call></tool_call> XML tags.\\n' }}\n {%- if ns_state.thinking %}\n {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY after thinking, with NO conversational text before it.\\n' }}\n {%- else %}\n {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY, with NO conversational text before it.\\n' }}\n {%- endif %}\n {{- '- The <tool_call> tag MUST be at the very beginning of a new line, with NO spaces or indentation before it.\\n- To call multiple functions, output a separate, completely closed <tool_call></tool_call> block for EACH function. Do NOT nest <tool_call> blocks.\\n- If you have all necessary data, provide your final answer directly to the user without any tool call.\\n</IMPORTANT>' }}\n {%- else %}\n {{- '\\n\\nIf you choose to call a function ONLY reply in the following format with NO suffix:\\n\\n' }}\n {%- if ns_state.thinking %}\n {{- '<think>\\nBrief explanation of tool call\\n</think>\\n' }}\n {%- endif %}\n {{- '<tool_call>\\n<function=example_function_name>\\n<parameter=example_parameter_1>\\nvalue_1\\n</parameter>\\n<parameter=example_parameter_2>\\nThis is the value for the second parameter\\nthat can span\\nmultiple lines\\n</parameter>\\n</function>\\n</tool_call>\\n\\n<IMPORTANT>\\nReminder:\\n' }}\n {%- if ns_state.thinking %}\n {{- '- You can use the <think></think> block to plan your next tool call OR to synthesize data and formulate your final response to the user.\\n- ALL explanation and reasoning MUST be placed strictly inside the <think></think> block.\\n' }}\n {%- endif %}\n {{- '- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags.\\n' }}\n {%- if ns_state.thinking %}\n {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY after thinking, with NO conversational text before it.\\n' }}\n {%- else %}\n {{- '- If you choose to call a tool, you MUST output the <tool_call> block IMMEDIATELY, with NO conversational text before it.\\n' }}\n {%- endif %}\n {{- '- The <tool_call> and <function> tags MUST be at the very beginning of a new line, with NO spaces or indentation before them.\\n- To call multiple functions, output a separate, completely closed <tool_call></tool_call> block for EACH function. Do NOT nest <tool_call> blocks.\\n- If you have all necessary data, provide your final answer directly to the user without any tool call.\\n</IMPORTANT>' }}\n {%- endif %}\n {%- if _sc %}\n {{- '\\n\\n' + _sc }}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n{%- else %}\n {%- if _sc %}\n {{- '<|im_start|>system\\n' + (reasoning_instructions + '\\n\\n' if reasoning_instructions else '') + _sc + '<|im_end|>\\n' }}\n {%- elif reasoning_instructions %}\n {{- '<|im_start|>system\\n' + reasoning_instructions + '<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- set _last_idx = _msgs | length - 1 %}\n{%- set ns = namespace(multi_step_tool=true, last_query_index=_last_idx) %}\n{%- for message in _msgs[::-1] %}\n {%- set index = (_msgs | length - 1) - loop.index0 %}\n {%- if ns.multi_step_tool and message.role == 'user' %}\n {%- set _rc = render_content(message.content, false) | trim %}\n {%- if not (_rc.startswith('<tool_response>') and _rc.endswith('</tool_response>')) %}\n {%- set ns.multi_step_tool = false %}\n {%- set ns.last_query_index = index %}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if ns.multi_step_tool %}\n {%- if _last_idx > 50 %}\n {%- set ns.last_query_index = _last_idx %}\n {%- else %}\n {%- set ns.last_query_index = 0 %}\n {%- endif %}\n{%- endif %}\n{%- set ns2 = namespace(prev_role='', consecutive_failures=0) %}\n{%- for message in _msgs %}\n {%- set is_system = (message.role == \"system\" or message.role == \"developer\") %}\n {%- set content = render_content(message.content, true, is_system) | trim %}\n {%- if is_system or message.role == 'user' %}\n {%- if '<|think_off|>' in content %}{%- set content = content.split('<|think_off|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_on|>' in content %}{%- set content = content.split('<|think_on|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_xhigh|>' in content %}{%- set content = content.split('<|think_xhigh|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_high|>' in content %}{%- set content = content.split('<|think_high|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_ultracode|>' in content %}{%- set content = content.split('<|think_ultracode|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_extreme|>' in content %}{%- set content = content.split('<|think_extreme|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_max|>' in content %}{%- set content = content.split('<|think_max|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_medium|>' in content %}{%- set content = content.split('<|think_medium|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_low|>' in content %}{%- set content = content.split('<|think_low|>') | join('') | trim %}{%- endif %}\n {%- if '<|think_minimal|>' in content %}{%- set content = content.split('<|think_minimal|>') | join('') | trim %}{%- endif %}\n {%- endif %}\n {%- if is_system %}\n {{- '<|im_start|>system\\n' + content + '<|im_end|>\\n' }}\n {%- elif message.role == 'user' %}\n {%- set ns2.consecutive_failures = 0 %}\n {{- '<|im_start|>user\\n' + content + '<|im_end|>\\n' }}\n {%- elif message.role == 'assistant' %}\n {%- set reasoning_content = '' %}\n {%- set _explicit_reasoning = '' %}\n {%- if message.reasoning_content is defined and message.reasoning_content is not none %}\n {%- if message.reasoning_content is string %}\n {%- set _explicit_reasoning = message.reasoning_content %}\n {%- else %}\n {%- set _explicit_reasoning = message.reasoning_content | string %}\n {%- endif %}\n {%- elif message.thinking is defined and message.thinking is not none %}\n {%- if message.thinking is string %}\n {%- set _explicit_reasoning = message.thinking %}\n {%- else %}\n {%- set _explicit_reasoning = message.thinking | string %}\n {%- endif %}\n {%- elif message.reasoning is defined and message.reasoning is not none %}\n {%- if message.reasoning is string %}\n {%- set _explicit_reasoning = message.reasoning %}\n {%- else %}\n {%- set _explicit_reasoning = message.reasoning | string %}\n {%- endif %}\n {%- endif %}\n {%- if _explicit_reasoning %}\n {%- set _lead_end = '' %}\n {%- if content.startswith('<think>') and '</think>' in content %}\n {%- set _lead_end = '</think>' %}\n {%- elif content.startswith('<thinking>') and '</thinking>' in content %}\n {%- set _lead_end = '</thinking>' %}\n {%- elif content.startswith('</think>') %}\n {%- set _lead_end = '</think>' %}\n {%- elif content.startswith('</thinking>') %}\n {%- set _lead_end = '</thinking>' %}\n {%- endif %}\n {%- if _lead_end %}\n {%- set content = content.split(_lead_end)[-1].lstrip('\\n') %}\n {%- endif %}\n {%- set reasoning_content = _explicit_reasoning %}\n {%- else %}\n {%- set _think_end = '' %}\n {%- if content.startswith('</think>') %}\n {%- set _think_end = '</think>' %}\n {%- elif content.startswith('</thinking>') %}\n {%- set _think_end = '</thinking>' %}\n {%- elif '\\n</think>' in content %}\n {%- set _think_end = '\\n</think>' %}\n {%- elif '\\n</thinking>' in content %}\n {%- set _think_end = '\\n</thinking>' %}\n {%- elif '\\n</ think>' in content %}\n {%- set _think_end = '\\n</ think>' %}\n {%- elif '\\n</think >' in content %}\n {%- set _think_end = '\\n</think >' %}\n {%- elif content.startswith('<think>') and '</think>' in content %}\n {%- set _think_end = '</think>' %}\n {%- elif content.startswith('<thinking>') and '</thinking>' in content %}\n {%- set _think_end = '</thinking>' %}\n {%- endif %}\n {%- if _think_end %}\n {%- if 'thinking' in _think_end %}\n {%- set _think_start = '<thinking>' %}\n {%- else %}\n {%- set _think_start = '<think>' %}\n {%- endif %}\n {%- set reasoning_content = content.split(_think_end)[0].rstrip('\\n') %}\n {%- if _think_start in reasoning_content %}\n {%- set reasoning_content = reasoning_content.split(_think_start)[-1].lstrip('\\n') %}\n {%- endif %}\n {%- set content = content.split(_think_end)[-1].lstrip('\\n') %}\n {%- endif %}\n {%- endif %}\n {%- set reasoning_content = reasoning_content | trim %}\n {%- if (_preserve_thinking or loop.index0 > ns.last_query_index) %}\n {{- '<|im_start|>assistant\\n<think>\\n' + reasoning_content + '\\n</think>\\n\\n' + content }}\n {%- else %}\n {{- '<|im_start|>assistant\\n' + content }}\n {%- endif %}\n {%- if message.tool_calls is defined and message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}\n {%- for tool_call in message.tool_calls %}\n {%- if tool_call.function is defined and tool_call.function is not none %}\n {%- set tc = tool_call.function %}\n {%- else %}\n {%- set tc = tool_call %}\n {%- endif %}\n {%- set tc_name = tc.name if (tc.name is defined and tc.name is not none) else '' %}\n {%- if _tool_format == 'json' %}\n {%- if loop.first %}\n {%- if content | trim %}\n {{- '\\n\\n' }}\n {%- endif %}\n {%- else %}\n {{- '\\n' }}\n {%- endif %}\n {%- set _args = '{}' %}\n {%- if tc.arguments is defined and tc.arguments is not none %}\n {%- if tc.arguments is mapping %}\n {%- set _args = tc.arguments | tojson %}\n {%- elif tc.arguments is string %}\n {%- if tc.arguments %}\n {%- set _args = tc.arguments %}\n {%- endif %}\n {%- else %}\n {%- set _args = tc.arguments | tojson %}\n {%- endif %}\n {%- endif %}\n {{- '<tool_call>\\n{\"name\": ' }}{{- tc_name | tojson }}{{- ', \"arguments\": ' }}{{- _args }}{{- '}\\n</tool_call>' }}\n {%- else %}\n {%- if loop.first %}\n {%- if content | trim %}\n {{- '\\n\\n<tool_call>\\n<function=' + tc_name + '>\\n' }}\n {%- else %}\n {{- '<tool_call>\\n<function=' + tc_name + '>\\n' }}\n {%- endif %}\n {%- else %}\n {{- '\\n<tool_call>\\n<function=' + tc_name + '>\\n' }}\n {%- endif %}\n {%- if tc.arguments is defined and tc.arguments is not none %}\n {%- if tc.arguments is mapping %}\n {%- for args_name, args_value in tc.arguments.items() %}\n {{- '<parameter=' + args_name + '>\\n' }}\n {%- if args_value is string %}\n {%- set _av = args_value %}\n {%- else %}\n {%- set _av = args_value | tojson %}\n {%- endif %}\n {%- if max_tool_arg_chars > 0 and _av | length > max_tool_arg_chars %}\n {{- _av[:max_tool_arg_chars] + '\\n[TRUNCATED - original length ' ~ (_av | length | string) ~ ' chars]' }}\n {%- else %}\n {{- _av }}\n {%- endif %}\n {{- '\\n</parameter>\\n' }}\n {%- endfor %}\n {%- else %}\n {%- if tc.arguments is string %}\n {%- set _raw_args = tc.arguments %}\n {%- else %}\n {%- set _raw_args = tc.arguments | tojson %}\n {%- endif %}\n {%- if _raw_args %}\n {%- if max_tool_arg_chars > 0 and _raw_args | length > max_tool_arg_chars %}\n {{- _raw_args[:max_tool_arg_chars] + '\\n[TRUNCATED - original length ' ~ (_raw_args | length | string) ~ ' chars]' }}\n {%- else %}\n {{- _raw_args }}\n {%- endif %}\n {%- endif %}\n {%- endif %}\n {%- endif %}\n {{- '</function>\\n</tool_call>' }}\n {%- endif %}\n {%- endfor %}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == 'tool' %}\n {%- set _content_lower = content | lower %}\n {%- set _content_head = _content_lower[:120] %}\n {%- set _is_code_or_grep = ('throw new ' in _content_lower or 'throw error' in _content_lower or 'console.error' in _content_lower or 'logger.error' in _content_lower or 'logging.error' in _content_lower or 'import ' in _content_head or 'def ' in _content_head or 'function ' in _content_head) %}\n {%- set _exit_code_zero = ('exit code: 0' in _content_head or 'process exited with code 0' in _content_head) %}\n {%- set _error_field_ok = ('\"error\": null' in _content_head or '\"error\":null' in _content_head or '\"error\": false' in _content_head or '\"error\":false' in _content_head or '\"error\": \"\"' in _content_head or '\"error\":\"\"' in _content_head) %}\n {%- set _strong_error = (('\"error\":' in _content_head and not _error_field_ok) or '\"status\": \"error\"' in _content_head or '\"status\":\"error\"' in _content_head or 'traceback (most recent call last):' in _content_head or 'command not found' in _content_head or 'invalid syntax' in _content_head or 'fatal:' in _content_head or (('exit code: ' in _content_head or 'process exited with code' in _content_head) and not _exit_code_zero) or _content_head.startswith('exception:') or _content_head.startswith('failed to ')) %}\n {%- set _weak_error = ('error:' in _content_head or 'err!' in _content_head) %}\n {%- set _weak_suppressed = ('$ ' in _content_head or 'took ' in _content_head or content | length >= 600) %}\n {%- if not _is_code_or_grep and (_strong_error or (_weak_error and not _weak_suppressed)) %}\n {%- set ns2.consecutive_failures = ns2.consecutive_failures + 1 %}\n {%- else %}\n {%- set ns2.consecutive_failures = 0 %}\n {%- endif %}\n {%- if ns2.prev_role != 'tool' %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {%- set _is_json_payload = (_tool_format == 'json' and content | trim | length > 0 and (content | trim)[:1] in ('{', '[')) %}\n {%- if not _is_json_payload and max_tool_response_chars > 0 and content | length > max_tool_response_chars %}\n {%- set content = content[:max_tool_response_chars] + '\\n[TRUNCATED - original length ' ~ (content | length | string) ~ ' chars]' %}\n {%- endif %}\n {{- '\\n<tool_response>\\n' + content }}\n {%- if ns2.consecutive_failures >= 2 %}\n {{- '\\n\\n⚠️ SYSTEM WARNING: ' ~ ns2.consecutive_failures ~ ' consecutive tool errors detected. Your previous approach is incorrect. You MUST use a fundamentally different approach or corrected arguments.' }}\n {%- elif ns2.consecutive_failures == 1 %}\n {{- '\\n\\n⚠️ SYSTEM WARNING: The previous tool call returned an error. Diagnose the failure and retry with completely corrected arguments.' }}\n {%- endif %}\n {{- '\\n</tool_response>' }}\n {%- if loop.last %}\n {{- '<|im_end|>\\n' }}\n {%- else %}\n {%- set _next_role = _msgs[loop.index0 + 1].role %}\n {%- if _next_role != 'tool' %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n {%- else %}\n {{- '<|im_start|>user\\n[' + message.role + ']: ' + content + '<|im_end|>\\n' }}\n {%- endif %}\n {%- set ns2.prev_role = message.role %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n {%- if not ns_state.thinking %}\n {{- '<think>\\n\\n</think>\\n\\n' }}\n {%- else %}\n {{- '<think>\\n' }}\n {%- endif %}\n{%- endif %}",
286
+ "clean_up_tokenization_spaces": false,
287
+ "eos_token": "<|im_end|>",
288
+ "errors": "replace",
289
+ "model_max_length": 262144,
290
+ "pad_token": "<|endoftext|>",
291
+ "split_special_tokens": false,
292
+ "tokenizer_class": "Qwen2Tokenizer",
293
+ "unk_token": null,
294
+ "add_bos_token": false,
295
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
296
+ "extra_special_tokens": {
297
+ "audio_bos_token": "<|audio_start|>",
298
+ "audio_eos_token": "<|audio_end|>",
299
+ "audio_token": "<|audio_pad|>",
300
+ "image_token": "<|image_pad|>",
301
+ "video_token": "<|video_pad|>",
302
+ "vision_bos_token": "<|vision_start|>",
303
+ "vision_eos_token": "<|vision_end|>"
304
+ }
305
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff