diff --git a/.gitattributes b/.gitattributes index a6344aac8c09253b3b630fb776ae94478aa0275b..52373fe24473b1aa44333d318f578ae6bf04b49b 100644 --- a/.gitattributes +++ b/.gitattributes @@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text *.zip filter=lfs diff=lfs merge=lfs -text *.zst filter=lfs diff=lfs merge=lfs -text *tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/LICENSE b/LICENSE new file mode 100644 index 0000000000000000000000000000000000000000..f860919cd5a5377c0bc9d590ea9d1b8743475ca5 --- /dev/null +++ b/LICENSE @@ -0,0 +1,29 @@ +GLM-5.3 License + +Copyright (c) 2026 Z.AI + +Permission is hereby granted, free of charge, to any person or entity (the "Licensee") obtaining a copy of this software — including the model weights, parameters, configuration files, inference and training code, and associated documentation (collectively, the "Software") — to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software; to run, deploy, fine-tune, or otherwise modify the Software and create derivative works from it; and to permit persons to whom the Software is furnished to do so, subject to the following conditions: + +1. The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software. The Licensee's use of the Software must comply with applicable laws and regulations. + +2. "Model as a Service" means giving a third party access to language model inference or fine-tuning (e.g., via API) in a manner that allows such third party to exercise meaningful control over the inputs, parameters, or training data. This does not include (a) end-user products with model capabilities solely embedded within specific features or harnesses, or (b) mere relaying of requests to models hosted by others. +If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 10 billion US dollars (or the equivalent in other currencies) in total over any consecutive 12 months, the Licensee must pass Z.AI's security review before using the Software or its derivative works for any commercial purpose. The scope and method of the security review shall be reasonably determined by Z.AI. + +3. THE SOFTWARE AND ANY OUTPUT AND RESULTS THEREFROM ARE PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL Z.AI OR ITS AFFILIATES OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE. + +For any questions regarding this license, please contact glmlicense@z.ai. + +----- + +版权所有 (c) 2026 Z.AI + +特此免费授予任何获得本软件副本的个人或实体("被许可方")——包括模型权重、参数、配置文件、推理和训练代码及相关文档(统称"软件")——不受限制地处理本软件的权利,包括但不限于:使用、复制、修改、合并、发布、分发、再许可和/或销售软件副本;运行、部署、微调或以其他方式修改软件并创建衍生作品;以及允许获得软件的其他人行使上述权利,但须遵守以下条件: + +1. 上述版权声明和本许可声明应包含在软件的所有副本或实质性部分中。被许可方对软件的使用必须符合适用法律法规。 + +2. "模型即服务"指以允许第三方对输入、参数或训练数据行使实质性控制的方式,向第三方提供语言模型推理或微调服务(如通过API)。不包括:(a) 模型能力仅嵌入特定功能或框架中的终端用户产品,或(b) 单纯转发请求至他人托管的模型。 +若被许可方或其关联方运营"模型即服务"业务,且被许可方及关联方在任意连续12个月内累计总收入超过100亿美元(或等值其他货币),则被许可方在使用软件或其衍生作品进行任何商业用途之前,须通过Z.AI的安全审查。安全审查的范围和方式由Z.AI合理确定。 + +3. 软件及其任何输出和结果均按"现状"提供,不附带任何形式的保证,无论是明示还是暗示,包括但不限于适销性、特定用途适用性和不侵权的保证。在任何情况下,Z.AI或其关联方或版权持有人均不对任何索赔、损害或其他责任承担责任,无论该责任是基于合同、侵权或其他方式,因软件或使用软件而产生或与之相关。 + +如对本许可有任何疑问,请联系 glmlicense@z.ai。 diff --git a/README.md b/README.md new file mode 100644 index 0000000000000000000000000000000000000000..15b5b28da01eaa7920fb32e8c6ebddf4300b4ead --- /dev/null +++ b/README.md @@ -0,0 +1,94 @@ +--- +license: other +license_name: glm-5.3 +license_link: LICENSE +base_model: zai-org/GLM-5.3 +base_model_relation: quantized +tags: +- mlx +- apple-silicon +- glm_moe_dsa +- mixture-of-experts +- 4-bit +pipeline_tag: text-generation +library_name: mlx +--- + +# GLM-5.3-MLX-4bit + +MLX (Apple Silicon) build of [**GLM-5.3**](https://huggingface.co/zai-org/GLM-5.3) — 744B-parameter +`glm_moe_dsa` MoE (256 experts, top-8; MLA with DeepSeek-V3.2-style sparse attention) — quantized +to **4-bit**. + +**These files are modified**: converted from the upstream **bfloat16** release +([GLM-5.3-BF16](https://huggingface.co/zai-org/GLM-5.3-BF16)) to MLX and quantized; the architecture +is unchanged. The multi-token-prediction layer (78) is not included. + +## Runtime — read this + +This checkpoint bundles `glm_moe_dsa.py` (declared via `model_file`) and needs it: + +```bash +pip install -U mlx-lm +mlx_lm.generate --model pipenetwork/GLM-5.3-MLX-4bit --trust-remote-code --prompt "..." --max-tokens 300 +``` + +mlx-lm's own `glm_moe_dsa` builds a lightning indexer on all 78 layers, but GLM-5.2/5.3 ship +indexer weights on 21 (`indexer_types`: the other 57 "shared" layers reuse the previous full layer's +top-k selection). A strict load of the release fails with 285 missing parameters; `mlx_lm.load` +loads leniently and leaves those 57 indexers at random initialisation. Prompts up to 2048 tokens are +unaffected (the indexer is bypassed below `index_topk`); beyond that, 57 layers attend to keys +chosen by random projections. The bundled runtime implements the schedule as the reference does, +plus the reference's fp32 indexer scores and router logits and the indexer LayerNorm epsilon. +Tiny-config parity against `transformers` 5.16 is **4e-7** with the sparse path live, cached decode +exact; strict loading of this checkpoint reports zero missing and zero unexpected tensors. Details and +tests: [https://github.com/PipeNetwork/glm53-mlx](https://github.com/PipeNetwork/glm53-mlx). + +## Size and what is quantized + +**418.6 GB** on disk. RAM: 512 GB, tight. + +| group | share of parameters | this build | +|---|---:|---| +| routed experts (`switch_mlp`, 75 layers × 256) | 724.8B (97.5%) | 4-bit, group 64 | +| attention (MLA), shared experts, dense layers 0–2, embeddings, `lm_head` | 18.4B (2.5%) | 4-bit, group 64 | +| lightning indexer (21 layers), MoE router + correction bias, norms | 0.3B | as stored (bf16 / fp32) | + +Source precision: the FP8 release is a lossy derivative of the bf16 one (dequantized FP8 weights +differ from bf16 by up to 1.6e-2 on values of 0.46 — half an e4m3 step). The ladder row `fp8` is the FP8 release itself measured against bf16: its error is the floor any FP8-sourced build inherits. + +## Quality + +Two measurements, because at 744B most of the ladder cannot be loaded on a 512 GB machine: + +**Per-layer divergence vs bf16** (`scripts/eval_ladder.py`): every decoder layer run in bf16 and in +each recipe on identical inputs (16,384 tokens of wikitext-2), *teacher-forced* (each layer +sees bf16 inputs — isolates its own damage) and *free-running* (each recipe feeds itself — what +inference does). Relative L2 error of the layer output; lower is better. + +| recipe | teacher-forced (mean over layers) | free-running (final layer) | cosine (final) | +|---|---:|---:|---:| +| 8bit | 0.00685 | 0.13119 | 0.98945 | +| 6bit | 0.01465 | 0.16736 | 0.98389 | +| 5bit | 0.02651 | 0.22521 | 0.97272 | +| 4bit | 0.05161 | 0.35740 | 0.93390 | +| mixed-4_8bit | 0.02524 | 0.24951 | 0.96710 | +| mixed-3_6bit | 0.05242 | 0.42380 | 0.90624 | +| fp8 | 0.01741 | 0.17321 | 0.98320 | + +**Perplexity** on wikitext-2 (test), 288,627 tokens in 141 windows of 2048, for the builds +that fit this machine, scored on identical windows: + +| build | size | perplexity [95% CI] | +|---|---:|---| +| [4bit](https://huggingface.co/pipenetwork/GLM-5.3-MLX-4bit) | 418.6 GB | 2.8636 [2.6681, 3.0714] | +| [mixed-4_8bit](https://huggingface.co/pipenetwork/GLM-5.3-MLX-mixed-4_8bit) | 427.8 GB | 2.7420 [2.5533, 2.9477] | +| [mixed-3_6bit](https://huggingface.co/pipenetwork/GLM-5.3-MLX-mixed-3_6bit) | 332.6 GB | 3.0338 [2.8366, 3.2386] | + +**How to read this.** The ladder is the only measurement that covers the whole set: 8-bit is closest to bfloat16 (free-running error 0.131, cosine 0.989 after 78 layers), 6-bit next (0.167). The upstream **FP8 release scores 0.173 — between 6-bit and 5-bit** — so any build converted from FP8 starts below our 6-bit, which is why these are converted from bf16. 5-bit (0.225) and mixed 4/8-bit (0.250) are close, and only the mixed build fits a 512 GB Mac; uniform 4-bit (0.357) is the tight 512 GB option; **mixed 3/6-bit (0.424) loses to uniform 4-bit** — it leads for the first ten layers, then 3-bit expert damage compounds — and is published for the 384 GB fit, not for quality. Perplexity on the builds that fit this machine is below. + +Greedy generation (a collapse detector, not a ranking) is coherent on every published build. + +## License + +[GLM-5.3 license](LICENSE), as the upstream model. Port code: [https://github.com/PipeNetwork/glm53-mlx](https://github.com/PipeNetwork/glm53-mlx). diff --git a/__pycache__/glm_moe_dsa.cpython-314.pyc b/__pycache__/glm_moe_dsa.cpython-314.pyc new file mode 100644 index 0000000000000000000000000000000000000000..58b6bd48ba3fbda385e787f44a2df297f9060918 Binary files /dev/null and b/__pycache__/glm_moe_dsa.cpython-314.pyc differ diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..d226a6928e6ba040e2eadccaf832c037bc4cd98f --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,251 @@ +[gMASK] +{%- set effective_reasoning_effort = reasoning_effort if reasoning_effort is defined and reasoning_effort in ['low', 'high'] else 'max' -%} +{%- if effective_reasoning_effort is not none -%}<|system|>Reasoning Effort: {{ effective_reasoning_effort | capitalize }}{%- endif -%} +{%- set clear_thinking = clear_thinking if clear_thinking is defined else false -%} +{%- if tools -%} +{%- macro tool_to_json(tool) -%} + {%- set ns_tool = namespace(first=true) -%} + {{ '{' -}} + {%- for k, v in tool.items() -%} + {%- if k != 'defer_loading' and k != 'strict' -%} + {%- if not ns_tool.first -%}{{- ', ' -}}{%- endif -%} + {%- set ns_tool.first = false -%} + "{{ k }}": {{ v | tojson(ensure_ascii=False) }} + {%- endif -%} + {%- endfor -%} + {{- '}' -}} +{%- endmacro -%} +{%- macro tool_references_to_response(refs) -%} + {{- '\n' -}} + {%- for tr in refs -%} + {%- for tool in tools -%} + {%- if 'function' in tool -%} + {%- set tool = tool['function'] -%} + {%- endif -%} + {%- if tool.name == tr.name -%} + {{- tool_to_json(tool) + '\n' -}} + {%- endif -%} + {%- endfor -%} + {%- endfor -%} + {{- '' -}} +{%- endmacro -%} +<|system|> +# Tools + +You may call one or more functions to assist with the user query. + +You are provided with function signatures within XML tags: + +{% for tool in tools %} +{%- if 'function' in tool -%} + {%- set tool = tool['function'] -%} +{%- endif -%} +{% if tool.defer_loading is not defined or not tool.defer_loading %} +{{ tool_to_json(tool) }} +{% endif %} +{% endfor %} + + +For each function call, output the function name and arguments within the following XML format: +{function-name}{arg-key-1}{arg-value-1}{arg-key-2}{arg-value-2}...{%- endif -%} +{%- macro visible_text(content) -%} + {%- if content is string -%} + {{- content }} + {%- elif content is iterable and content is not mapping -%} + {%- for item in content -%} + {%- if item is mapping and item.type == 'text' -%} + {{- item.text }} + {%- elif item is string -%} + {{- item }} + {%- elif item is mapping and item.type in ['image', 'image_url', 'video', 'video_url', 'audio', 'audio_url', 'input_audio'] -%} + {%- set media_type = item.type | replace('_url', '') | replace('input_', '') -%} + {{- "You are unable to process this " ~ media_type ~ " because you don't have multi-modal input ability. Try different methods." }} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {{- content }} + {%- endif -%} +{%- endmacro -%} +{%- macro tool_response(text) -%} +{{- '' + text + '' -}} +{%- endmacro -%} +{%- macro render_tool_response(m) -%} +{%- if m.content is string -%} + {{- tool_response(m.content) -}} +{%- elif m.content and m.content is not mapping and m.content.0.type == "tool_reference" -%} + {{- tool_references_to_response(m.content) -}} +{%- elif is_list_of_outputs(m) -%} + {%- for tr in m.content -%} + {%- if tr.output is iterable and tr.output is not string and tr.output is not mapping and tr.output and tr.output.0.type == "tool_reference" -%} + {{- tool_references_to_response(tr.output) -}} + {%- else -%} + {{- tool_response(visible_text(tr.output)) -}} + {%- endif -%} + {%- endfor -%} +{%- else -%} + {{- tool_response(visible_text(m.content)) -}} +{%- endif -%} +{%- endmacro -%} +{%- macro id_of(obj) -%} + {%- if obj.tool_call_id -%} + {{- obj.tool_call_id -}} + {%- elif obj.id -%} + {{- obj.id -}} + {%- endif -%} +{%- endmacro -%} +{%- macro is_list_of_outputs(m) -%} + {%- if m.content and m.content.0.output is defined -%}1{%- endif -%} +{%- endmacro -%} +{%- macro has_dup_tool_result_id(lo, hi, target) -%} + {%- set ns_cnt = namespace(n=0) -%} + {%- for k in range(lo, hi + 1) -%} + {%- set m = messages[k] -%} + {%- if is_list_of_outputs(m) -%} + {%- for entry in m.content -%} + {%- if id_of(entry) == target -%} + {%- set ns_cnt.n = ns_cnt.n + 1 -%} + {%- endif -%} + {%- endfor -%} + {%- elif id_of(m) == target -%} + {%- set ns_cnt.n = ns_cnt.n + 1 -%} + {%- endif -%} + {%- if ns_cnt.n > 1 -%}{%- break -%}{%- endif -%} + {%- endfor -%} + {%- if ns_cnt.n > 1 -%}1{%- endif -%} +{%- endmacro -%} +{%- macro tc_id_exists(tcs, target) -%} + {%- set ns_f = namespace(found=false) -%} + {%- for tc in tcs -%} + {%- if id_of(tc) == target -%} + {%- set ns_f.found = true -%} + {%- break -%} + {%- endif -%} + {%- endfor -%} + {%- if ns_f.found -%}1{%- endif -%} +{%- endmacro -%} +{%- set ns = namespace(last_user_index=-1) -%} +{%- for m in messages %} + {%- if m.role == 'user' %} + {%- set ns.last_user_index = loop.index0 -%} + {%- endif %} +{%- endfor %} +{%- for m in messages -%} +{%- if m.role == 'user' -%}<|user|>{{ visible_text(m.content) }} +{%- elif m.role == 'assistant' -%} +<|assistant|> +{%- set content = visible_text(m.content) %} +{%- if m.reasoning_content is string %} + {%- set reasoning_content = m.reasoning_content %} +{%- elif '' in content %} + {%- set reasoning_content = content.split('')[0].split('')[-1] %} + {%- set content = content.split('')[-1] %} +{%- endif %} +{%- if (not clear_thinking or loop.index0 > ns.last_user_index) and reasoning_content is defined -%} +{{ '' + reasoning_content + ''}} +{%- else -%} +{{ '' }} +{%- endif -%} +{%- if content.strip() -%} +{{ content.strip() }} +{%- endif -%} +{% if m.tool_calls %} +{% for tc in m.tool_calls %} +{%- if tc.function %} + {%- set tc = tc.function %} +{%- endif %} +{{- '' + tc.name -}} +{% set _args = tc.arguments %}{% for k, v in _args.items() %}{{ k }}{{ v | tojson(ensure_ascii=False) if v is not string else v }}{% endfor %}{% endfor %} +{% endif %} +{%- elif m.role == 'tool' -%} +{%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|observation|>' -}} + {%- set block_start = loop.index0 -%} + {%- set ns_blk = namespace(end=block_start) -%} + {%- for j in range(block_start, messages|length) -%} + {%- if messages[j].role == 'tool' -%} + {%- set ns_blk.end = j -%} + {%- else -%} + {%- break -%} + {%- endif -%} + {%- endfor -%} + {%- set ns_a = namespace(tool_calls=none) -%} + {%- if block_start > 0 and messages[block_start - 1].role == 'assistant' and messages[block_start - 1].tool_calls -%} + {%- set ns_a.tool_calls = messages[block_start - 1].tool_calls -%} + {%- endif -%} + {%- set ns_chk = namespace(can_sort=true) -%} + {%- if not ns_a.tool_calls -%} + {%- set ns_chk.can_sort = false -%} + {%- else -%} + {%- for k in range(block_start, ns_blk.end + 1) -%} + {%- set m = messages[k] -%} + {%- if is_list_of_outputs(m) -%} + {%- for entry in m.content -%} + {%- set eid = id_of(entry) -%} + {%- if not eid -%} + {%- set ns_chk.can_sort = false -%} + {%- elif has_dup_tool_result_id(block_start, ns_blk.end, eid) -%} + {%- set ns_chk.can_sort = false -%} + {%- elif not tc_id_exists(ns_a.tool_calls, eid) -%} + {%- set ns_chk.can_sort = false -%} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {%- set tk_id = id_of(m) -%} + {%- if not tk_id -%} + {%- set ns_chk.can_sort = false -%} + {%- elif has_dup_tool_result_id(block_start, ns_blk.end, tk_id) -%} + {%- set ns_chk.can_sort = false -%} + {%- elif not tc_id_exists(ns_a.tool_calls, tk_id) -%} + {%- set ns_chk.can_sort = false -%} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- for i in range(ns_a.tool_calls | length) -%} + {%- set tc_id = id_of(ns_a.tool_calls[i]) -%} + {%- if not tc_id -%} + {%- set ns_chk.can_sort = false -%} + {%- endif -%} + {%- for j in range(i + 1, ns_a.tool_calls | length) -%} + {%- if id_of(ns_a.tool_calls[j]) == tc_id -%} + {%- set ns_chk.can_sort = false -%} + {%- endif -%} + {%- endfor -%} + {%- endfor -%} + {%- endif -%} + {%- if ns_chk.can_sort -%} + {%- for tc in ns_a.tool_calls -%} + {%- set tc_id = id_of(tc) -%} + {%- for k in range(block_start, ns_blk.end + 1) -%} + {%- set m = messages[k] -%} + {%- if is_list_of_outputs(m) -%} + {%- for entry in m.content -%} + {%- set eid = id_of(entry) -%} + {%- if eid == tc_id -%} + {%- if entry.output is iterable and entry.output is not string and entry.output is not mapping and entry.output and entry.output.0.type == "tool_reference" -%} + {{- tool_references_to_response(entry.output) -}} + {%- else -%} + {{- tool_response(visible_text(entry.output)) -}} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {%- set tk_id = id_of(m) -%} + {%- if tk_id == tc_id -%} + {{- render_tool_response(m) -}} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- endfor -%} + {%- else -%} + {%- for k in range(block_start, ns_blk.end + 1) -%} + {{- render_tool_response(messages[k]) -}} + {%- endfor -%} + {%- endif -%} +{% endif -%} +{%- elif m.role == 'system' -%} +<|system|>{{ visible_text(m.content) }} +{%- endif -%} +{%- endfor -%} +{%- if add_generation_prompt -%} + <|assistant|>{{- '' -}} +{%- endif -%} diff --git a/config.json b/config.json new file mode 100644 index 0000000000000000000000000000000000000000..9f5beb6a7e30bdc8acb99fa2d81a52a1eab92b07 --- /dev/null +++ b/config.json @@ -0,0 +1,233 @@ +{ + "architectures": [ + "GlmMoeDsaForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "dtype": "bfloat16", + "eos_token_id": [ + 154820, + 154827, + 154829 + ], + "ep_size": 1, + "first_k_dense_replace": 3, + "head_dim": 192, + "hidden_act": "silu", + "hidden_size": 6144, + "index_head_dim": 128, + "index_n_heads": 32, + "index_share_for_mtp_iteration": true, + "index_skip_topk_offset": 3, + "index_topk": 2048, + "index_topk_freq": 4, + "index_topk_pattern": null, + "indexer_rope_interleave": true, + "indexer_types": [ + "full", + "full", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared", + "full", + "shared", + "shared", + "shared" + ], + "initializer_range": 0.02, + "intermediate_size": 12288, + "kv_lora_rank": 512, + "max_position_embeddings": 1048576, + "mlp_layer_types": [ + "dense", + "dense", + "dense", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse", + "sparse" + ], + "model_type": "glm_moe_dsa", + "moe_intermediate_size": 2048, + "moe_layer_freq": 1, + "moe_router_dtype": "float32", + "n_group": 1, + "n_routed_experts": 256, + "n_shared_experts": 1, + "norm_topk_prob": true, + "num_attention_heads": 64, + "num_experts_per_tok": 8, + "num_hidden_layers": 78, + "num_key_value_heads": 64, + "num_nextn_predict_layers": 1, + "pad_token_id": 154820, + "pretraining_tp": 1, + "q_lora_rank": 2048, + "qk_head_dim": 256, + "qk_nope_head_dim": 192, + "qk_rope_head_dim": 64, + "rms_norm_eps": 1e-05, + "rope_interleave": true, + "rope_parameters": { + "rope_theta": 8000000, + "rope_type": "default" + }, + "routed_scaling_factor": 2.5, + "scoring_func": "sigmoid", + "tie_word_embeddings": false, + "topk_group": 1, + "topk_method": "noaux_tc", + "transformers_version": "5.15.0", + "use_cache": true, + "v_head_dim": 256, + "vocab_size": 154880, + "quantization": { + "group_size": 64, + "bits": 4 + }, + "quantization_config": { + "group_size": 64, + "bits": 4 + }, + "model_file": "glm_moe_dsa.py" +} \ No newline at end of file diff --git a/generation_config.json b/generation_config.json new file mode 100644 index 0000000000000000000000000000000000000000..216bbb092d0df0dda1dc4cedd789b92286c4c001 --- /dev/null +++ b/generation_config.json @@ -0,0 +1,12 @@ +{ + "_from_model_config": true, + "eos_token_id": [ + 154820, + 154827, + 154829 + ], + "pad_token_id": 154820, + "temperature": 1.0, + "top_p": 0.95, + "transformers_version": "5.12.0" +} diff --git a/glm_moe_dsa.py b/glm_moe_dsa.py new file mode 100644 index 0000000000000000000000000000000000000000..233864a54415a460ab55cf50db2a8e65aaf786ea --- /dev/null +++ b/glm_moe_dsa.py @@ -0,0 +1,703 @@ +# Copyright © 2025 Apple Inc. + +import math +from dataclasses import dataclass +from typing import Any, Dict, Optional + +import mlx.core as mx +import mlx.nn as nn +from mlx.nn.layers.distributed import shard_inplace, shard_linear, sum_gradients + +from mlx_lm.models.activations import swiglu +from mlx_lm.models.base import BaseModelArgs, create_attention_mask, scaled_dot_product_attention +from mlx_lm.models.cache import CacheList, KVCache +from mlx_lm.models.mla import MultiLinear +from mlx_lm.models.rope_utils import initialize_rope +from mlx_lm.models.switch_layers import SwitchGLU + + +@dataclass +class ModelArgs(BaseModelArgs): + model_type: str + vocab_size: int + hidden_size: int + index_head_dim: int + index_n_heads: int + index_topk: int + intermediate_size: int + moe_intermediate_size: int + num_hidden_layers: int + num_attention_heads: int + num_key_value_heads: int + n_shared_experts: Optional[int] + n_routed_experts: Optional[int] + routed_scaling_factor: float + kv_lora_rank: int + q_lora_rank: int + qk_rope_head_dim: int + v_head_dim: int + qk_nope_head_dim: int + topk_method: str + scoring_func: str + norm_topk_prob: bool + n_group: int + topk_group: int + num_experts_per_tok: int + moe_layer_freq: int + first_k_dense_replace: int + max_position_embeddings: int + rms_norm_eps: float + rope_parameters: Dict + attention_bias: bool + rope_scaling: Dict = None + rope_theta: Optional[float] = None + indexer_rope_interleave: bool = True + rope_interleave: bool = True + indexer_types: Optional[list] = None + index_topk_freq: int = 1 + index_skip_topk_offset: int = 0 + index_topk_pattern: Optional[Any] = None + num_nextn_predict_layers: int = 0 + mlp_layer_types: Optional[list] = None + + def __post_init__(self): + self.rope_scaling = self.rope_parameters + self.rope_theta = self.rope_parameters["rope_theta"] + if self.indexer_types is None: + # Reference schedule: a layer runs its own indexer ("full") iff + # max(i - offset + 1, 0) % freq == 0; the others ("shared") reuse the most recent + # full layer's top-k selection and carry no indexer weights. + f, o = self.index_topk_freq, self.index_skip_topk_offset + self.indexer_types = [ + "full" if max(i - o + 1, 0) % f == 0 else "shared" + for i in range(self.num_hidden_layers) + ] + + + +class Indexer(nn.Module): + def __init__(self, args: ModelArgs): + super().__init__() + self.dim = args.hidden_size + self.n_heads = args.index_n_heads + self.head_dim = args.index_head_dim + self.rope_head_dim = args.qk_rope_head_dim + self.index_topk = args.index_topk + self.q_lora_rank = args.q_lora_rank + self.wq_b = nn.Linear( + self.q_lora_rank, self.n_heads * self.head_dim, bias=False + ) + self.wk = nn.Linear(self.dim, self.head_dim, bias=False) + self.k_norm = nn.LayerNorm(self.head_dim, eps=1e-6) + self.weights_proj = nn.Linear(self.dim, self.n_heads, bias=False) + self.softmax_scale = self.head_dim**-0.5 + self.rope = initialize_rope( + dims=args.qk_rope_head_dim, + base=args.rope_theta, + traditional=args.indexer_rope_interleave, + max_position_embeddings=args.max_position_embeddings, + scaling_config=args.rope_scaling, + ) + + def __call__( + self, + x: mx.array, + qr: mx.array, + mask: Optional[mx.array], + cache: Optional[Any] = None, + ): + # Computes top_k indices for attention + b, s, _ = x.shape + q = self.wq_b(qr) + q = q.reshape(b, s, self.n_heads, self.head_dim).swapaxes(1, 2) + k = self.wk(x) + k = self.k_norm(k) + k = mx.reshape(k, (b, 1, s, self.head_dim)) + + offset = cache.offset if cache is not None else 0 + + q = self.rope(q, offset=offset) + k = self.rope(k, offset=offset) + + if cache is not None: + k, _ = cache.update_and_fetch(k, mx.zeros([b, 1, s, 0])) + if k.shape[2] <= self.index_topk: + return None + # Scores in float32, as the reference (which also keeps weights_proj in fp32): in bf16 + # keys at the top-k boundary flip. + scores = q.astype(mx.float32) @ k.astype(mx.float32).swapaxes(-1, -2) + scores = mx.maximum(scores, 0) + weights = self.weights_proj(x).astype(mx.float32) * (self.n_heads**-0.5 * self.softmax_scale) + weights = weights.swapaxes(-1, -2)[..., None] + scores = scores * weights + scores = scores.sum(axis=1, keepdims=True) + if mask is not None: + scores = mx.where(mask, scores, -float("inf")) + return mx.argpartition(scores, kth=-self.index_topk, axis=-1)[ + ..., -self.index_topk : + ] + + +class DeepseekV32Attention(nn.Module): + def __init__(self, config: ModelArgs, layer_idx: int = 0): + super().__init__() + self.config = config + self.hidden_size = config.hidden_size + self.num_heads = config.num_attention_heads + self.max_position_embeddings = config.max_position_embeddings + self.rope_theta = config.rope_theta + self.q_lora_rank = config.q_lora_rank + self.qk_rope_head_dim = config.qk_rope_head_dim + self.kv_lora_rank = config.kv_lora_rank + self.v_head_dim = config.v_head_dim + self.qk_nope_head_dim = config.qk_nope_head_dim + self.q_head_dim = config.qk_nope_head_dim + config.qk_rope_head_dim + + self.scale = self.q_head_dim**-0.5 + + self.q_a_proj = nn.Linear( + self.hidden_size, self.q_lora_rank, bias=config.attention_bias + ) + self.q_a_layernorm = nn.RMSNorm(self.q_lora_rank, eps=1e-6) + self.q_b_proj = nn.Linear( + self.q_lora_rank, self.num_heads * self.q_head_dim, bias=False + ) + + self.kv_a_proj_with_mqa = nn.Linear( + self.hidden_size, + self.kv_lora_rank + self.qk_rope_head_dim, + bias=config.attention_bias, + ) + self.kv_a_layernorm = nn.RMSNorm(self.kv_lora_rank, eps=1e-6) + self.embed_q = MultiLinear( + self.qk_nope_head_dim, self.kv_lora_rank, self.num_heads + ) + self.unembed_out = MultiLinear( + self.kv_lora_rank, self.v_head_dim, self.num_heads + ) + + self.o_proj = nn.Linear( + self.num_heads * self.v_head_dim, + self.hidden_size, + bias=config.attention_bias, + ) + + if self.config.rope_scaling is not None: + mscale_all_dim = self.config.rope_scaling.get("mscale_all_dim", 0) + if mscale_all_dim: + scaling_factor = self.config.rope_scaling["factor"] + if scaling_factor > 1: + s = 0.1 * mscale_all_dim * math.log(scaling_factor) + 1.0 + self.scale = self.scale * s * s + + # "shared" layers carry no indexer weights: they reuse the previous full layer's top-k. + self.indexer = Indexer(config) if config.indexer_types[layer_idx] == "full" else None + self.rope = initialize_rope( + dims=self.qk_rope_head_dim, + base=self.rope_theta, + traditional=True, + max_position_embeddings=self.max_position_embeddings, + scaling_config=self.config.rope_scaling, + ) + + def __call__( + self, + x: mx.array, + mask: Optional[mx.array] = None, + cache: Optional[Any] = None, + prev_topk_indices: Optional[mx.array] = None, + ): + B, L, D = x.shape + + qr = self.q_a_layernorm(self.q_a_proj(x)) + q = self.q_b_proj(qr) + + q = q.reshape(B, L, self.num_heads, self.q_head_dim).transpose(0, 2, 1, 3) + q_nope, q_pe = mx.split(q, [self.qk_nope_head_dim], axis=-1) + compressed_kv = self.kv_a_proj_with_mqa(x) + compressed_kv, k_pe = mx.split(compressed_kv, [self.kv_lora_rank], axis=-1) + k_pe = k_pe.reshape(B, L, 1, self.qk_rope_head_dim).transpose(0, 2, 1, 3) + kv_latent = self.kv_a_layernorm(compressed_kv) + + offset = cache[0].offset if cache is not None else 0 + q_pe = self.rope(q_pe, offset) + k_pe = self.rope(k_pe, offset) + + kv_latent = mx.expand_dims(kv_latent, axis=1) + + if cache is not None: + kv_latent, k_pe = cache[0].update_and_fetch(kv_latent, k_pe) + else: + cache = [None] * 2 + + if self.indexer is not None: + topk_indices = self.indexer(x, qr, mask, cache=cache[1]) + else: + topk_indices = prev_topk_indices + if topk_indices is not None: + if L == 1: + idx = topk_indices[:, :, 0, :, None] + kv_latent = mx.take_along_axis( + kv_latent, + mx.broadcast_to(idx, idx.shape[:-1] + (kv_latent.shape[-1],)), + axis=2, + ) + k_pe = mx.take_along_axis( + k_pe, + mx.broadcast_to(idx, idx.shape[:-1] + (k_pe.shape[-1],)), + axis=2, + ) + if mask is not None: + mask = mx.take_along_axis(mask, topk_indices, axis=-1) + else: + shape = list(topk_indices.shape) + shape[-1] = kv_latent.shape[2] + sparse_mask = mx.zeros(shape, dtype=mx.bool_) + sparse_mask = mx.put_along_axis( + sparse_mask, topk_indices, mx.array(True), axis=-1 + ) + if mask is not None: + sparse_mask = sparse_mask & mask + mask = sparse_mask + # Ensure the indexer cache is evaluated even if the topk_indices are unused + # to keep the graph from getting too large + if self.indexer is not None and cache is not None and cache[0] is not None: + cache[0].keys = mx.depends(cache[0].keys, (cache[1].keys, cache[1].values)) + + pe_scores = (q_pe * self.scale) @ k_pe.swapaxes(-1, -2) + if mask is not None: + pe_scores = mx.where( + mask, + pe_scores, + mx.array(mx.finfo(pe_scores.dtype).min, pe_scores.dtype), + ) + + if L == 1: + q_nope = self.embed_q(q_nope) + k = v = kv_latent + else: + k = self.embed_q(kv_latent, transpose=False) + v = self.unembed_out(kv_latent) + + output = scaled_dot_product_attention( + q_nope, k, v, cache=cache, scale=self.scale, mask=pe_scores + ) + if L == 1: + output = self.unembed_out(output) + + output = output.transpose(0, 2, 1, 3).reshape(B, L, -1) + return self.o_proj(output), topk_indices + + +class DeepseekV32MLP(nn.Module): + def __init__( + self, config: ModelArgs, hidden_size: int = None, intermediate_size: int = None + ): + super().__init__() + self.config = config + self.hidden_size = config.hidden_size if hidden_size is None else hidden_size + self.intermediate_size = ( + config.intermediate_size if intermediate_size is None else intermediate_size + ) + + self.gate_proj = nn.Linear(self.hidden_size, self.intermediate_size, bias=False) + self.up_proj = nn.Linear(self.hidden_size, self.intermediate_size, bias=False) + self.down_proj = nn.Linear(self.intermediate_size, self.hidden_size, bias=False) + + def __call__(self, x): + down_proj = self.down_proj(swiglu(self.gate_proj(x), self.up_proj(x))) + return down_proj + + +@mx.compile +def group_expert_select( + gates, + e_score_correction_bias, + top_k, + n_group, + topk_group, + routed_scaling_factor, + norm_topk_prob, +): + + scores = mx.sigmoid(gates.astype(mx.float32)) + orig_scores = scores + scores = scores + e_score_correction_bias + if n_group > 1: + scores = mx.unflatten(scores, axis=-1, shape=(n_group, -1)) + group_scores = mx.topk(scores, 2, axis=-1).sum(axis=-1, keepdims=True) + k = n_group - topk_group + group_idx = mx.argpartition(group_scores, kth=k - 1, axis=-2)[..., :k, :] + scores = mx.put_along_axis( + scores, mx.stop_gradient(group_idx), mx.array(0.0), axis=-2 + ) + scores = mx.flatten(scores, -2, -1) + + k = top_k + inds = mx.argpartition(-scores, kth=k - 1, axis=-1)[..., :k] + scores = mx.take_along_axis(orig_scores, inds, axis=-1) + if top_k > 1 and norm_topk_prob: + denominator = scores.sum(axis=-1, keepdims=True) + scores = scores / denominator + scores = scores * routed_scaling_factor + + return inds, scores + + +class MoEGate(nn.Module): + def __init__(self, config: ModelArgs): + super().__init__() + self.config = config + self.top_k = config.num_experts_per_tok + self.norm_topk_prob = config.norm_topk_prob + self.n_routed_experts = config.n_routed_experts + self.routed_scaling_factor = config.routed_scaling_factor + self.n_group = config.n_group + self.topk_group = config.topk_group + self.weight = mx.zeros((self.n_routed_experts, config.hidden_size)) + self.e_score_correction_bias = mx.zeros((self.n_routed_experts,)) + assert config.topk_method == "noaux_tc", "Unsupported topk method." + + def __call__(self, x): + return group_expert_select( + x.astype(mx.float32) @ self.weight.astype(mx.float32).T, + self.e_score_correction_bias, + self.top_k, + self.n_group, + self.topk_group, + self.routed_scaling_factor, + self.norm_topk_prob, + ) + + +class DeepseekV32MoE(nn.Module): + def __init__(self, config: ModelArgs): + super().__init__() + self.config = config + self.num_experts_per_tok = config.num_experts_per_tok + self.switch_mlp = SwitchGLU( + config.hidden_size, + config.moe_intermediate_size, + config.n_routed_experts, + ) + + self.gate = MoEGate(config) + if config.n_shared_experts is not None: + intermediate_size = config.moe_intermediate_size * config.n_shared_experts + self.shared_experts = DeepseekV32MLP( + config=config, intermediate_size=intermediate_size + ) + + self.sharding_group = None + + def __call__(self, x): + if self.sharding_group is not None: + x = sum_gradients(self.sharding_group)(x) + + inds, scores = self.gate(x) + y = self.switch_mlp(x, inds) + y = (y * scores[..., None]).sum(axis=-2).astype(y.dtype) + if self.config.n_shared_experts is not None: + y = y + self.shared_experts(x) + + if self.sharding_group is not None: + y = mx.distributed.all_sum(y, group=self.sharding_group) + + return y + + +class DeepseekV32DecoderLayer(nn.Module): + def __init__(self, config: ModelArgs, layer_idx: int): + super().__init__() + self.self_attn = DeepseekV32Attention(config, layer_idx) + self.mlp = ( + DeepseekV32MoE(config) + if ( + config.n_routed_experts is not None + and layer_idx >= config.first_k_dense_replace + and layer_idx % config.moe_layer_freq == 0 + ) + else DeepseekV32MLP(config) + ) + self.input_layernorm = nn.RMSNorm(config.hidden_size, eps=config.rms_norm_eps) + self.post_attention_layernorm = nn.RMSNorm( + config.hidden_size, eps=config.rms_norm_eps + ) + + def __call__( + self, + x: mx.array, + mask: Optional[mx.array] = None, + cache: Optional[Any] = None, + prev_topk_indices: Optional[mx.array] = None, + ): + r, topk_indices = self.self_attn(self.input_layernorm(x), mask, cache, prev_topk_indices) + h = x + r + r = self.mlp(self.post_attention_layernorm(h)) + return h + r, topk_indices + + +class DeepseekV32Model(nn.Module): + def __init__(self, config: ModelArgs): + super().__init__() + self.vocab_size = config.vocab_size + self.embed_tokens = nn.Embedding(config.vocab_size, config.hidden_size) + self.layers = [ + DeepseekV32DecoderLayer(config, idx) + for idx in range(config.num_hidden_layers) + ] + self.start_idx = 0 + self.end_idx = len(self.layers) + self.num_layers = self.end_idx + + self.norm = nn.RMSNorm(config.hidden_size, eps=config.rms_norm_eps) + self.pipeline_rank = 0 + self.pipeline_size = 1 + + def pipeline(self, group): + # Split layers in reverse so rank=0 gets the last layers and + # rank=pipeline_size-1 gets the first + self.pipeline_rank = group.rank() + self.pipeline_size = group.size() + layers_per_rank = len(self.layers) // self.pipeline_size + extra = len(self.layers) - layers_per_rank * self.pipeline_size + if self.pipeline_rank < extra: + layers_per_rank += 1 + self.start_idx = (self.pipeline_size - self.pipeline_rank - 1) * layers_per_rank + self.end_idx = self.start_idx + layers_per_rank + self.layers = self.layers[: self.end_idx] + self.layers[: self.start_idx] = [None] * self.start_idx + self.num_layers = len(self.layers) - self.start_idx + + def __call__( + self, + x: mx.array, + cache: Optional[Any] = None, + ) -> mx.array: + h = self.embed_tokens(x) + + pipeline_rank = self.pipeline_rank + pipeline_size = self.pipeline_size + + if cache is None: + cache = [None] * self.num_layers + mask = create_attention_mask( + h, cache[0][0] if cache[0] else None, return_array=True + ) + + # Receive from the previous process in the pipeline + + if pipeline_rank < pipeline_size - 1: + h = mx.distributed.recv_like(h, (pipeline_rank + 1)) + + # A "shared" layer reuses the top-k selection of the most recent "full" layer. + topk = None + for i in range(self.num_layers): + h, topk = self.layers[self.start_idx + i](h, mask, cache[i], topk) + + # Send to the next process in the pipeline + if pipeline_rank != 0: + h = mx.distributed.send(h, (pipeline_rank - 1) % pipeline_size) + if cache[-1] is not None: + cache[-1][0].keys = mx.depends(cache[-1][0].keys, h) + + # Broadcast h while keeping it in the graph + if pipeline_size > 1: + h = mx.distributed.all_gather(h)[: h.shape[0]] + + return self.norm(h) + + +class Model(nn.Module): + def __init__(self, config: ModelArgs): + super().__init__() + self.args = config + self.model_type = config.model_type + self.model = DeepseekV32Model(config) + self.lm_head = nn.Linear(config.hidden_size, config.vocab_size, bias=False) + + def __call__( + self, + inputs: mx.array, + cache: Optional[Any] = None, + ): + out = self.model(inputs, cache) + return self.lm_head(out) + + def sanitize(self, weights): + # Remove multi-token prediction layers + mpt_layer = self.args.num_hidden_layers + new_weights = {} + for k, v in weights.items(): + parts = k.split(".") + if len(parts) >= 3 and parts[1] == "layers" and int(parts[2]) >= mpt_layer: + continue + new_weights[k] = v + weights = new_weights + + def dequant(weight, scale_inv): + dtype = mx.bfloat16 + weight = mx.from_fp8(weight, dtype=mx.bfloat16) + bs = 128 # block size + m, n = weight.shape + pad_bottom = (-m) % bs + pad_side = (-n) % bs + weight = mx.pad(weight, ((0, pad_bottom), (0, pad_side))) + weight = weight.reshape( + ((m + pad_bottom) // bs, bs, (n + pad_side) // bs, bs) + ) + weight = (weight * scale_inv[:, None, :, None]).reshape( + m + pad_bottom, n + pad_side + ) + return weight[:m, :n].astype(dtype) + + # Dequantize + new_weights = {} + for k, v in weights.items(): + if "weight_scale_inv" in k: + scale_inv = v + wk = k.replace("_scale_inv", "") + weight = weights[wk] + weight = dequant(weight, scale_inv) + new_weights[wk] = weight + elif k not in new_weights: + new_weights[k] = v + weights = new_weights + + # Stack experts + for l in range(self.args.num_hidden_layers): + prefix = f"model.layers.{l}" + for n, m in [("w1", "gate_proj"), ("w2", "down_proj"), ("w3", "up_proj")]: + for k in ["weight", "scales", "biases"]: + if f"{prefix}.mlp.experts.0.{m}.{k}" in weights: + to_join = [ + weights.pop(f"{prefix}.mlp.experts.{e}.{m}.{k}") + for e in range(self.args.n_routed_experts) + ] + weights[f"{prefix}.mlp.switch_mlp.{m}.{k}"] = mx.stack(to_join) + prefix = f"model.layers.{l}.self_attn" + if f"{prefix}.kv_b_proj.weight" in weights: + layer = self.model.layers[l].self_attn.embed_q + quantized = f"{prefix}.kv_b_proj.scales" in weights + v = weights.pop(f"{prefix}.kv_b_proj.weight") + head_dim = self.args.qk_nope_head_dim + self.args.v_head_dim + + if quantized: + dims = self.args.kv_lora_rank + scales = weights.pop(f"{prefix}.kv_b_proj.scales") + biases = weights.pop(f"{prefix}.kv_b_proj.biases") + # Try to infer bits and group size + bits = (v.shape[-1] * 32) // dims + group_size = dims // scales.shape[-1] + v = mx.dequantize( + v, scales, biases, bits=bits, group_size=group_size + ) + num_heads = self.args.num_attention_heads + v = v.reshape(num_heads, head_dim, -1) + wk = mx.contiguous( + v[:, : self.args.qk_nope_head_dim, :].swapaxes(-1, -2) + ) + wv = mx.contiguous(v[:, self.args.qk_nope_head_dim :, :]) + if quantized: + wk, wk_scales, wk_biases = mx.quantize( + wk, bits=bits, group_size=group_size + ) + wv, wv_scales, wv_biases = mx.quantize( + wv, bits=bits, group_size=group_size + ) + weights[f"{prefix}.embed_q.scales"] = wk_scales + weights[f"{prefix}.unembed_out.scales"] = wv_scales + weights[f"{prefix}.embed_q.biases"] = wk_biases + weights[f"{prefix}.unembed_out.biases"] = wv_biases + weights[f"{prefix}.embed_q.weight"] = wk + weights[f"{prefix}.unembed_out.weight"] = wv + + return weights + + def shard(self, group: Optional[mx.distributed.Group] = None): + group = group or mx.distributed.init() + N = group.size() + rank = group.rank() + for layer in self.model.layers: + layer.self_attn.q_b_proj = shard_linear( + layer.self_attn.q_b_proj, "all-to-sharded", group=group + ) + + layer.self_attn.o_proj = shard_linear( + layer.self_attn.o_proj, "sharded-to-all", group=group + ) + layer.self_attn.num_heads //= N + num_heads = layer.self_attn.num_heads + sh = rank * num_heads + eh = sh + num_heads + + def shard_heads(w): + return w[sh:eh] + + layer.self_attn.embed_q.apply(shard_heads) + layer.self_attn.unembed_out.apply(shard_heads) + + # Shard the MLP + if isinstance(layer.mlp, DeepseekV32MLP): + layer.mlp.gate_proj = shard_linear( + layer.mlp.gate_proj, "all-to-sharded", group=group + ) + layer.mlp.down_proj = shard_linear( + layer.mlp.down_proj, "sharded-to-all", group=group + ) + layer.mlp.up_proj = shard_linear( + layer.mlp.up_proj, "all-to-sharded", group=group + ) + + # Shard the MoE. Shard in place since the MoE should be responsible + # for aggregating the results. + else: + layer.mlp.sharding_group = group = group + shard_inplace( + layer.mlp.shared_experts.gate_proj, "all-to-sharded", group=group + ) + shard_inplace( + layer.mlp.shared_experts.down_proj, "sharded-to-all", group=group + ) + shard_inplace( + layer.mlp.shared_experts.up_proj, "all-to-sharded", group=group + ) + shard_inplace( + layer.mlp.switch_mlp.gate_proj, "all-to-sharded", group=group + ) + shard_inplace( + layer.mlp.switch_mlp.down_proj, "sharded-to-all", group=group + ) + shard_inplace( + layer.mlp.switch_mlp.up_proj, "all-to-sharded", group=group + ) + + @property + def layers(self): + return self.model.layers[self.model.start_idx : self.model.end_idx] + + @property + def cast_predicate(self): + def predicate(k): + return "e_score_correction_bias" not in k + + return predicate + + @property + def quant_predicate(self): + def predicate(path, module): + # The lightning indexer (0.03% of parameters, reference keeps weights_proj in fp32) and the + # MoE router decide *what* is computed; keep them as stored. + if ".indexer." in path or path.endswith("mlp.gate"): + return False + return True + + return predicate + + def make_cache(self): + # Shared layers have no indexer, so no indexer key cache: an empty second KVCache would + # trip mlx-lm's `cache.state` evaluation (keys is None) during generation. + return [ + CacheList(KVCache(), KVCache()) if layer.self_attn.indexer is not None else CacheList(KVCache()) + for layer in self.layers + ] diff --git a/model-00001.safetensors b/model-00001.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..095ab7b87f25b2ba5a3bf3eecae3c77fe765150d --- /dev/null +++ b/model-00001.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:176c340557c7fa39e2b38de055eb01314eda5d6c39069b2cca7487e88e4b91cc +size 1070543542 diff --git a/model-00002.safetensors b/model-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..11171e0e9600413396353a6b2d7b11d791d153de --- /dev/null +++ b/model-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b4bc11a8ac61edcd3aae74c83c9a5967f098aed8677cc04d2b9e41e9edce7196 +size 239003170 diff --git a/model-00003.safetensors b/model-00003.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7cc1ca515a24fa30f1dd709f3858458b888c1696 --- /dev/null +++ b/model-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0082e877f6160d645138cfc89378ed456617f3e1a2f3ca0849e8206e447e6b7c +size 239003172 diff --git a/model-00004.safetensors b/model-00004.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4351bb2b67aba29e0b472ed8d380101474ce89a0 --- /dev/null +++ b/model-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:30f166fb31881905611a39963c4fe3afed668df1388e44020f5e448b61f478a9 +size 239003200 diff --git a/model-00005.safetensors b/model-00005.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..096521fddec0e64e16fa7b6ebf01f8bfc17d5369 --- /dev/null +++ b/model-00005.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:acf9fd63248bc0618dfd9a5b7b56b62b5231c9a5e11ef6c17bfb46d4f6d3a6c5 +size 5553056773 diff --git a/model-00006.safetensors b/model-00006.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a3178d07fafd5476320120c7dad136860fee419b --- /dev/null +++ b/model-00006.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1bae951ae1ef80f1d41f4b599ef65aa9015242328ba4d0171c2665d911b13135 +size 5553056751 diff --git a/model-00007.safetensors b/model-00007.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a2c3c71ef424f789f28b3e87b5f0584fffa6114a --- /dev/null +++ b/model-00007.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc49d58fd9a4c9b4e82271253538c936f327988f92e9ff474739d207d1b4871a +size 5553056769 diff --git a/model-00008.safetensors b/model-00008.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0cfcc0bfbaf79c91a7265d4d6bda54e844137ce9 --- /dev/null +++ b/model-00008.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d7ea06cd57201b59ffded4da036e72fb1c867301ca88a567b5e8389fe266cad7 +size 5571801177 diff --git a/model-00009.safetensors b/model-00009.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f97a0415e6a9b200ba50371d196962d7e37c7b25 --- /dev/null +++ b/model-00009.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:853e300eab23ba862df2b52d9ac9b59c95eeafe6ef8f39a879fcf7da25a79648 +size 5553056779 diff --git a/model-00010.safetensors b/model-00010.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fcc0a1369e547a3d885410361d3e322acd458b47 --- /dev/null +++ b/model-00010.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5b20f5e24014a6edb1c1dc39e1c9b72b08604da02dd7ff54ba7227f140783978 +size 5553056731 diff --git a/model-00011.safetensors b/model-00011.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6fe7f6b87d1cb1f348883ef0a81bb84e27c68fd9 --- /dev/null +++ b/model-00011.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:847261e5fd0299835116802bf8ce0edf078c62030449feb640631a887b94f4fa +size 5553056765 diff --git a/model-00012.safetensors b/model-00012.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..50f85e42f04598a22f8f1e019834477c7991d270 --- /dev/null +++ b/model-00012.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dd53c8b15231c7388eb73ea3849e2b753f846e2f6ce2ed1955ae2343b7808a98 +size 5571801224 diff --git a/model-00013.safetensors b/model-00013.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..32b067b4f876fc9fe166d47d165d9e2b1d6eecd8 --- /dev/null +++ b/model-00013.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5ce35355f4e650ff6ab21eb4c0d9c004bbeb868f75b4f097a16be91ce622e099 +size 5553056819 diff --git a/model-00014.safetensors b/model-00014.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..bccdc37cf72a5a148977af304a2ab6fb423db9b3 --- /dev/null +++ b/model-00014.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:983799b3cb347b56fcef8209caa7d07ec09782e0e8b9ac26454cfc4d338181b7 +size 5553056763 diff --git a/model-00015.safetensors b/model-00015.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d52555dbafb3bd5bcaa22576dc51958f9203553f --- /dev/null +++ b/model-00015.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0c7bedec1f7084a6b683866854b854989ccb494e2e20e371458584d1db65f147 +size 5553056823 diff --git a/model-00016.safetensors b/model-00016.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f2f50d67aed6a34b72b9b8243638e2a03d235ae9 --- /dev/null +++ b/model-00016.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:21abc9c8d21a4e91ab0c561d6b75f6a78533bf9c207f61fb22d60a564886b5a0 +size 5571801230 diff --git a/model-00017.safetensors b/model-00017.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e6fa67454e7ece0e3880d374ba6bfab05fc88421 --- /dev/null +++ b/model-00017.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:553fc997e2423739e23e36329bd84efe4bc763f66f2562f6e13b5ca3da7ac394 +size 5553056809 diff --git a/model-00018.safetensors b/model-00018.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..478be4b6774fcbb781f35d8540acc0865a416e32 --- /dev/null +++ b/model-00018.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:935ffb9213433b9b422666854b86acb240f8d09195191b633b239ab3b867b3e1 +size 5553056817 diff --git a/model-00019.safetensors b/model-00019.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..be3fbfb129a9f4547467505ab222418246a4713a --- /dev/null +++ b/model-00019.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4255d162866aff65f4ff34d09b828fb8889df0a4b5d7cd9ad116ef761980e087 +size 5553056793 diff --git a/model-00020.safetensors b/model-00020.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..66a9a85c19dcf50a233da4b576a1c8fe58f1f6a0 --- /dev/null +++ b/model-00020.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b3496ffbee37391ec1b4d9572fc9623b030d27c7b4e7b3266b9b10eaed7589d5 +size 5571801244 diff --git a/model-00021.safetensors b/model-00021.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1fbafa893485e40d2e0bc7989e3bec6fdba08f41 --- /dev/null +++ b/model-00021.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5554d6b80c18d028545fe9937804c1bda4d068baadcf5ccdf9ed5ee740db334f +size 5553056817 diff --git a/model-00022.safetensors b/model-00022.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7f03dc67a74a903f21615e345524db586786bcc5 --- /dev/null +++ b/model-00022.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cbd376882fd7c131b4fed1e7782c2acc0cc1bcba681ee55574b2128d001b0846 +size 5553056823 diff --git a/model-00023.safetensors b/model-00023.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..2aef96e8b224c830b891aa98869a4a8262dded6c --- /dev/null +++ b/model-00023.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3af1cf1b00cf78899bbbdd58c9e1f59e14d033e89785d6016f53ace051f57938 +size 5553056805 diff --git a/model-00024.safetensors b/model-00024.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..cdac805770ac319a5d0492d354995302370de640 --- /dev/null +++ b/model-00024.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c4a4710c94370f66cf5e18c6a993a103014278af4b6823fd9101b275e38d468d +size 5571801242 diff --git a/model-00025.safetensors b/model-00025.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..840d73f3842105ea18846c289b41424548e2a09a --- /dev/null +++ b/model-00025.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ee833691af0efad06ac27b72c3b19d5fbb81fc632d7bd3662c887c9a4b76360 +size 5553056817 diff --git a/model-00026.safetensors b/model-00026.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d81d48f244e82c93597e536cf1ccf7091b6d2982 --- /dev/null +++ b/model-00026.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:99f8dfd9688d3f1a65051e78a4dd79adbdecc2fc8f78a3cdda0e422ee13d8b18 +size 5553056827 diff --git a/model-00027.safetensors b/model-00027.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..452cd949f56467ca2751b07cf7bc9021465620dc --- /dev/null +++ b/model-00027.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:05b623b8de7616befb3984d42cef35314a231c3869814fe476d7170e64e2aa5d +size 5553056819 diff --git a/model-00028.safetensors b/model-00028.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..df68757f5f6faf25a5d5a1cf7c495c88db6a8edf --- /dev/null +++ b/model-00028.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:14f2ac72800b2d78fb0cd903460ca677a6783abcd852054e58f5d6ce57f30a13 +size 5571801238 diff --git a/model-00029.safetensors b/model-00029.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8ea0897af5ad08756015765300a3a9f055fe6dd5 --- /dev/null +++ b/model-00029.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a14f3770894adbb7f26b0c75ba54407b27aed5f6532c75c0d774086fdec4e92a +size 5553056805 diff --git a/model-00030.safetensors b/model-00030.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9d1eb3b71f1b9f44f776559a7e8f4b97e0506a91 --- /dev/null +++ b/model-00030.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:46dd94c1c11e3d0b74a7d49bb39ca0ae54f3e7ee26663682101fe935dd707f2e +size 5553056813 diff --git a/model-00031.safetensors b/model-00031.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0941cbb78e67898233f7bf29957548afb469cf99 --- /dev/null +++ b/model-00031.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:839fb1365e0dad4ac2e15f923f4c7f6122c047f53ca20ea580463e3a823de0df +size 5553056805 diff --git a/model-00032.safetensors b/model-00032.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4a3d451d901c1245478873654fb963c3bc0be73f --- /dev/null +++ b/model-00032.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:af6f8d5bc0bf9af5105d72c199e7a29c646fb6c5fd3d943cb1f6f4b633003b4c +size 5571801230 diff --git a/model-00033.safetensors b/model-00033.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..879681bffc91a4fb1a3c5b4968773b00e79b7cf8 --- /dev/null +++ b/model-00033.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:382bd486ed96262b8ce166d3f9f0ebf69e50a17cbe898c838ee2236c339d56c7 +size 5553056817 diff --git a/model-00034.safetensors b/model-00034.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0462ef5fc95cb6534ef7135cb2f00703f792648f --- /dev/null +++ b/model-00034.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c94e96ae10f34b0728631274e98728f97d5ea863949b28627f38dc18c04a1ba0 +size 5553056823 diff --git a/model-00035.safetensors b/model-00035.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6dafaf80585df036b936180bdef62ab1847ddfea --- /dev/null +++ b/model-00035.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ad37e4704fc086b87d63e13a10b8c502f2287dcc2ebb2cf5946acf5b3f790ee7 +size 5553056821 diff --git a/model-00036.safetensors b/model-00036.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7a0aaa2cf43037a66316ba2da335a194ad71a7ee --- /dev/null +++ b/model-00036.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2e25d9b3ea840f31fe8cc4410b7ae3a6114ddde0a665b2213e67845b169f2817 +size 5571801228 diff --git a/model-00037.safetensors b/model-00037.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..88ad4fab1f90d8aa64e77785175ade9b8be946c9 --- /dev/null +++ b/model-00037.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:26d281505b0dded840128e7b54975439ba57e45e8ee6ac37df83d32345279bf0 +size 5553056811 diff --git a/model-00038.safetensors b/model-00038.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..5b3813376eba57c3b7063d61bec3e720c535ef9a --- /dev/null +++ b/model-00038.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c389787ebec2ec1d8a305ba61104bf784e885ceb0b7186ff9540e646953ec09a +size 5553056803 diff --git a/model-00039.safetensors b/model-00039.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0aa6bd8756f1f4ebe5c5a5dd98c75cff23a13f9d --- /dev/null +++ b/model-00039.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:183f4f728c14c85d9332cbd5e749ee640f6b2f5efa904e3d0788bc7127e53862 +size 5553056807 diff --git a/model-00040.safetensors b/model-00040.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..89bd1af483bff101b9e70d16325e306cec77158a --- /dev/null +++ b/model-00040.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:eed3348bdeb96b4ece767479fcc664a011f943301f430297c9d1924cbf913b10 +size 5571801230 diff --git a/model-00041.safetensors b/model-00041.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..44e1d21f9f98f9b9840aac446f8cda1cb65aa27c --- /dev/null +++ b/model-00041.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2ea24d9559cc9b64c2f951a62e9601f1700d4f9a448fdbd93e84da5e9e331c24 +size 5553056829 diff --git a/model-00042.safetensors b/model-00042.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..368bc0faf65cbdcb0764d6b3cd8c42f8f31ad2d7 --- /dev/null +++ b/model-00042.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b2ad8a84bf77b31bbb55e100d0c21af745d97ef7fe13168797fcb1971bf9c0ef +size 5553056815 diff --git a/model-00043.safetensors b/model-00043.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..982d7d892b4bafd54268b297f3a1b5213e1f92b7 --- /dev/null +++ b/model-00043.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e7551f9403a2a9477662a39c3f795886d00251c53437e2e04d45b0513d4318f +size 5553056817 diff --git a/model-00044.safetensors b/model-00044.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4ff3936705f83558df3fe5ad1bed7849fb88b031 --- /dev/null +++ b/model-00044.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:78e657c46b80b2200cf67978d8ee74d5d04217b95c7f920f526c56353f62a590 +size 5571801218 diff --git a/model-00045.safetensors b/model-00045.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a3b78bbfd0e166076e5bfc47b04fbe7e22865536 --- /dev/null +++ b/model-00045.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c7318d875ce17de79d082cb2b740410f3b3b26ae344e3f8f9095c7070e63f413 +size 5553056815 diff --git a/model-00046.safetensors b/model-00046.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7d7187f4d1e377fe1359e6be963893ae2525a629 --- /dev/null +++ b/model-00046.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:570599f388807e7f792e84cf62750c056467deac63245c3345e01f3d20a90ae4 +size 5553056805 diff --git a/model-00047.safetensors b/model-00047.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ea73428027ee94889e27431dcd188df5a5394f5e --- /dev/null +++ b/model-00047.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9a3cfe5ed4513ceccc7592ac8ed4253d2daff5a93833e63856b0df8f2fae4dba +size 5553056813 diff --git a/model-00048.safetensors b/model-00048.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..05d3d7db4d1f285ba503f7ccecd9f51ee5ad1823 --- /dev/null +++ b/model-00048.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5e4457d0fe4b23226d4063554d914d7ff0bec218217c22a27c34edcefb60827f +size 5571801238 diff --git a/model-00049.safetensors b/model-00049.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8e540c4c550271861ff0d5c27ea2abca0c96f0c0 --- /dev/null +++ b/model-00049.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f476219003efbd090bbd221def3d8cda2192eec5d537b618df308631653edd2f +size 5553056817 diff --git a/model-00050.safetensors b/model-00050.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4e3f6cbad7cc86b26831cbbee044c1ec389ceadb --- /dev/null +++ b/model-00050.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:125fffaad151d4dd7622985165140d0a00ba64d353677da5e56f71f8229b1908 +size 5553056819 diff --git a/model-00051.safetensors b/model-00051.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6cd1c0392c5d157bcd53c1087324b6d927a0a0cd --- /dev/null +++ b/model-00051.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:89e2cb62b1e53fa6b82cef489aef7dde60523d3a3e063768ff3b6e00f15d1333 +size 5553056797 diff --git a/model-00052.safetensors b/model-00052.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..45b86c813a733678ca130862a0edf7b52f8aea29 --- /dev/null +++ b/model-00052.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f11ada8940dd54bf4618af9d9d6855ea2a0a17d295c9d2d30337bfdede39861 +size 5571801240 diff --git a/model-00053.safetensors b/model-00053.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3d74e43383efe25c7cac05ae09a5ba7f038b816e --- /dev/null +++ b/model-00053.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:62058fe951961fbe02fcfe040bd6cd81e8415a9709c08f0b16f00bd92518b3bb +size 5553056809 diff --git a/model-00054.safetensors b/model-00054.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f7ab2f295a332b7aefd69f8a25f526f0044a0839 --- /dev/null +++ b/model-00054.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce48449139a25ecac90134ca7867bfbe16059195d0084e661cb6701911dc257f +size 5553056813 diff --git a/model-00055.safetensors b/model-00055.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c75b56672313c8b8e1f110d602e804929b5f1026 --- /dev/null +++ b/model-00055.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:67d8f13bfcb8619cc73828901f11b78dff6226e5bed374261474f9cff115172e +size 5553056823 diff --git a/model-00056.safetensors b/model-00056.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0e00701a912ff4a44a85df65009d44c10c00cc73 --- /dev/null +++ b/model-00056.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:833557a9f0e2381483b0f0b0224bc8646217090b567e63c02a4e51967d77ad7c +size 5571801240 diff --git a/model-00057.safetensors b/model-00057.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..88089f16c11673f1ee9c157983872d6790e9db80 --- /dev/null +++ b/model-00057.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9a72ae7e156b2944efebc883c56b1dd0c79efc1fe80be8dbe3f641a1473705e2 +size 5553056803 diff --git a/model-00058.safetensors b/model-00058.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fe0ef75d96c9a76ec603ddd8057d16ff64e15b4f --- /dev/null +++ b/model-00058.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:69abf2e1b795f64aefa7049a9d45f86fe024b3fb363b9a1c7daf95b83e8257ab +size 5553056815 diff --git a/model-00059.safetensors b/model-00059.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e30fcf8c90e9cea017d2f4e20a7b47f9bae409b0 --- /dev/null +++ b/model-00059.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b0036633a01de009603f9fba3030f09953f2412cc033381e399a158642c9c804 +size 5553056811 diff --git a/model-00060.safetensors b/model-00060.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9cde693d2d6a05653be667ab8571079c516c2f60 --- /dev/null +++ b/model-00060.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f61df7d02973ba7469e1103df02f1ff4fb3dad862603b84151021fc5b25e7d2 +size 5571801234 diff --git a/model-00061.safetensors b/model-00061.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..cb827ae39ac67bc47cfbcfb13fa6f20b420ec6fe --- /dev/null +++ b/model-00061.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b96d4db6c991d5a3ee4dc79b23bb6181cc91c9926b2837c332313f535f0cc9d +size 5553056815 diff --git a/model-00062.safetensors b/model-00062.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..963f1c36b5feca1371452009e809899117f8b11e --- /dev/null +++ b/model-00062.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e2da4cafcc4734ffc7e2f0396b961f74444649d1e4ebc5048fd8b644d3ac2599 +size 5553056807 diff --git a/model-00063.safetensors b/model-00063.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..96a6e90d31da28e13208769d31d745dde1341607 --- /dev/null +++ b/model-00063.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1c6f85709f6c6505731318179e464e58a6d615f29303bc08e0ff8e2701fd4f0c +size 5553056807 diff --git a/model-00064.safetensors b/model-00064.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e6f8b35fc7cf7ae20a9d680e14bdeb93aa889101 --- /dev/null +++ b/model-00064.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:88d7eb791a5ecd067bb4422594dff000646a3643f375432207240c1b88c4df05 +size 5571801212 diff --git a/model-00065.safetensors b/model-00065.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d0e1c1286ef8ae4b1e4513bf3c0d783a8a238cd7 --- /dev/null +++ b/model-00065.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:26cc4fa4b12169e31f43e9cbd9eaee5b0d813562fe71a551f55c9fa7fdc46eb4 +size 5553056823 diff --git a/model-00066.safetensors b/model-00066.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6ca68a4d1ea11bd7cf625fe207e0b863cacab9db --- /dev/null +++ b/model-00066.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:802ed996be647ef668efb3bf277eb180386d15a308342c1371f60eba79d43ff8 +size 5553056821 diff --git a/model-00067.safetensors b/model-00067.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7982595f48f0587f7cb65d5e8020c543a0f8e3fc --- /dev/null +++ b/model-00067.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:258aabf7c5d3ca3c0610df9b1de7ef8a5bbcb5a1a2ead6995094d76c35531bfd +size 5553056813 diff --git a/model-00068.safetensors b/model-00068.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8652d36790e513b51f97afb7e5bfdd85daba2c58 --- /dev/null +++ b/model-00068.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fa772b3c52134c93c6083447b67638158665f2cd7c9d8580630e3e39d1ef821f +size 5571801246 diff --git a/model-00069.safetensors b/model-00069.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..eaa08165258755511f46a676d6b9ff0529084fec --- /dev/null +++ b/model-00069.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:30b832b871fbd1eac3829a661e5a95efb722b684b07eef705822fd6b00dd1792 +size 5553056801 diff --git a/model-00070.safetensors b/model-00070.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..dd1032106bbba39a7d37697860a81b0127deb057 --- /dev/null +++ b/model-00070.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4239e44484d0424b5022979b598e73ba6d6af24e280790721df86666afa3115f +size 5553056809 diff --git a/model-00071.safetensors b/model-00071.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4128e0c726c0dd39d4ec9f222729386688bd9379 --- /dev/null +++ b/model-00071.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c92e172351cd9b53743ecfd04f4b31d8c69774ceaf9b3a98b652f21b7a09be97 +size 5553056815 diff --git a/model-00072.safetensors b/model-00072.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6513be28ef15b113087602a171129467abc4cff1 --- /dev/null +++ b/model-00072.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a6e41bb37803d45b9592960f7621267934d43a7d13f82cace5cfaaf30acef678 +size 5571801230 diff --git a/model-00073.safetensors b/model-00073.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1a393ccc12f02cc564fe5c09ba4097eb84177b77 --- /dev/null +++ b/model-00073.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c3b62adde26b9668fcaf4589b3e10eb8425a674d47f7703b532ec9db5f343a89 +size 5553056821 diff --git a/model-00074.safetensors b/model-00074.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9cfbe9aa7d3a3044ad494a2078d4a66a9715e0b9 --- /dev/null +++ b/model-00074.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:14a7b11cc5bd2a6ce7c0682f413d584b7bee20b7669b87b22b5848eb4ba6abf2 +size 5553056811 diff --git a/model-00075.safetensors b/model-00075.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..aa626e369b61364d6cb73e98e066d87bedd8d80b --- /dev/null +++ b/model-00075.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:167a2268e052cd0d7586de822d81b6bcd11831b0a8c9c37859ed0d354db0eccd +size 5553056819 diff --git a/model-00076.safetensors b/model-00076.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..73dafdb563d28bdc78e35f1a182aa3257db6db62 --- /dev/null +++ b/model-00076.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ec55adc39b47ebfcad3048d3c1e523b55b7d7a687ab32674ef5857ba48b38f8e +size 5571801232 diff --git a/model-00077.safetensors b/model-00077.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fc3cede8a48e9ed51ff2a60213655ed49a1b90c9 --- /dev/null +++ b/model-00077.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42b77d6fe6734308e37f89b2621ffba8f416b9961573ac3b44decf28fc0ff1d4 +size 5553056811 diff --git a/model-00078.safetensors b/model-00078.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..83c678f8f3f550735797a4c772abef0d90cec932 --- /dev/null +++ b/model-00078.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:81bc8180e8918c0b53e56e4d5d9f3153134ef2ef2b06571b855bcd52c3845fa2 +size 5553056813 diff --git a/model-00079.safetensors b/model-00079.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1802b1ee1e5cf414ffff6a9471468f1e9a57f305 --- /dev/null +++ b/model-00079.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:143a94a17ae69d3b67a09f1e8a10d30fdb978dcb4c58e27278600019f71a1e15 +size 5553056797 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000000000000000000000000000000000000..87b1cc7ab5c6b01acf56c10b3603a8d254f9a3e0 --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,3362 @@ +{ + "metadata": { + "total_size": 418604213206 + }, + "weight_map": { + "lm_head.weight": "model-00001.safetensors", + "lm_head.scales": "model-00001.safetensors", + "lm_head.biases": "model-00001.safetensors", + "model.embed_tokens.weight": "model-00001.safetensors", + "model.embed_tokens.scales": "model-00001.safetensors", + "model.embed_tokens.biases": "model-00001.safetensors", + "model.norm.weight": "model-00001.safetensors", + "model.layers.0.input_layernorm.weight": "model-00002.safetensors", + "model.layers.0.mlp.down_proj.weight": "model-00002.safetensors", + "model.layers.0.mlp.down_proj.scales": "model-00002.safetensors", + "model.layers.0.mlp.down_proj.biases": "model-00002.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model-00002.safetensors", + "model.layers.0.mlp.gate_proj.scales": "model-00002.safetensors", + "model.layers.0.mlp.gate_proj.biases": "model-00002.safetensors", + "model.layers.0.mlp.up_proj.weight": "model-00002.safetensors", + "model.layers.0.mlp.up_proj.scales": "model-00002.safetensors", + "model.layers.0.mlp.up_proj.biases": "model-00002.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model-00002.safetensors", + "model.layers.0.self_attn.indexer.k_norm.bias": "model-00002.safetensors", + "model.layers.0.self_attn.indexer.k_norm.weight": "model-00002.safetensors", + "model.layers.0.self_attn.indexer.weights_proj.weight": "model-00002.safetensors", + "model.layers.0.self_attn.indexer.wk.weight": "model-00002.safetensors", + "model.layers.0.self_attn.indexer.wq_b.weight": "model-00002.safetensors", + "model.layers.0.self_attn.kv_a_layernorm.weight": "model-00002.safetensors", + "model.layers.0.self_attn.kv_a_proj_with_mqa.weight": "model-00002.safetensors", + "model.layers.0.self_attn.kv_a_proj_with_mqa.scales": "model-00002.safetensors", + "model.layers.0.self_attn.kv_a_proj_with_mqa.biases": "model-00002.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model-00002.safetensors", + "model.layers.0.self_attn.o_proj.scales": "model-00002.safetensors", + "model.layers.0.self_attn.o_proj.biases": "model-00002.safetensors", + "model.layers.0.self_attn.q_a_layernorm.weight": "model-00002.safetensors", + "model.layers.0.self_attn.q_a_proj.weight": "model-00002.safetensors", + "model.layers.0.self_attn.q_a_proj.scales": "model-00002.safetensors", + "model.layers.0.self_attn.q_a_proj.biases": "model-00002.safetensors", + "model.layers.0.self_attn.q_b_proj.weight": "model-00002.safetensors", + "model.layers.0.self_attn.q_b_proj.scales": "model-00002.safetensors", + "model.layers.0.self_attn.q_b_proj.biases": "model-00002.safetensors", + "model.layers.0.self_attn.embed_q.weight": "model-00002.safetensors", + "model.layers.0.self_attn.embed_q.scales": "model-00002.safetensors", + "model.layers.0.self_attn.embed_q.biases": "model-00002.safetensors", + "model.layers.0.self_attn.unembed_out.weight": "model-00002.safetensors", + "model.layers.0.self_attn.unembed_out.scales": "model-00002.safetensors", + "model.layers.0.self_attn.unembed_out.biases": "model-00002.safetensors", + "model.layers.1.input_layernorm.weight": "model-00003.safetensors", + "model.layers.1.mlp.down_proj.weight": "model-00003.safetensors", + "model.layers.1.mlp.down_proj.scales": "model-00003.safetensors", + "model.layers.1.mlp.down_proj.biases": "model-00003.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model-00003.safetensors", + "model.layers.1.mlp.gate_proj.scales": "model-00003.safetensors", + "model.layers.1.mlp.gate_proj.biases": "model-00003.safetensors", + "model.layers.1.mlp.up_proj.weight": "model-00003.safetensors", + "model.layers.1.mlp.up_proj.scales": "model-00003.safetensors", + "model.layers.1.mlp.up_proj.biases": "model-00003.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model-00003.safetensors", + "model.layers.1.self_attn.indexer.k_norm.bias": "model-00003.safetensors", + "model.layers.1.self_attn.indexer.k_norm.weight": "model-00003.safetensors", + "model.layers.1.self_attn.indexer.weights_proj.weight": "model-00003.safetensors", + "model.layers.1.self_attn.indexer.wk.weight": "model-00003.safetensors", + "model.layers.1.self_attn.indexer.wq_b.weight": "model-00003.safetensors", + "model.layers.1.self_attn.kv_a_layernorm.weight": "model-00003.safetensors", + "model.layers.1.self_attn.kv_a_proj_with_mqa.weight": "model-00003.safetensors", + "model.layers.1.self_attn.kv_a_proj_with_mqa.scales": "model-00003.safetensors", + "model.layers.1.self_attn.kv_a_proj_with_mqa.biases": "model-00003.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model-00003.safetensors", + "model.layers.1.self_attn.o_proj.scales": "model-00003.safetensors", + "model.layers.1.self_attn.o_proj.biases": "model-00003.safetensors", + "model.layers.1.self_attn.q_a_layernorm.weight": "model-00003.safetensors", + "model.layers.1.self_attn.q_a_proj.weight": "model-00003.safetensors", + "model.layers.1.self_attn.q_a_proj.scales": "model-00003.safetensors", + "model.layers.1.self_attn.q_a_proj.biases": "model-00003.safetensors", + "model.layers.1.self_attn.q_b_proj.weight": "model-00003.safetensors", + "model.layers.1.self_attn.q_b_proj.scales": "model-00003.safetensors", + "model.layers.1.self_attn.q_b_proj.biases": "model-00003.safetensors", + "model.layers.1.self_attn.embed_q.weight": "model-00003.safetensors", + "model.layers.1.self_attn.embed_q.scales": "model-00003.safetensors", + "model.layers.1.self_attn.embed_q.biases": "model-00003.safetensors", + "model.layers.1.self_attn.unembed_out.weight": "model-00003.safetensors", + "model.layers.1.self_attn.unembed_out.scales": "model-00003.safetensors", + "model.layers.1.self_attn.unembed_out.biases": "model-00003.safetensors", + "model.layers.2.input_layernorm.weight": "model-00004.safetensors", + "model.layers.2.mlp.down_proj.weight": "model-00004.safetensors", + "model.layers.2.mlp.down_proj.scales": "model-00004.safetensors", + "model.layers.2.mlp.down_proj.biases": "model-00004.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model-00004.safetensors", + "model.layers.2.mlp.gate_proj.scales": "model-00004.safetensors", + "model.layers.2.mlp.gate_proj.biases": "model-00004.safetensors", + "model.layers.2.mlp.up_proj.weight": "model-00004.safetensors", + "model.layers.2.mlp.up_proj.scales": "model-00004.safetensors", + "model.layers.2.mlp.up_proj.biases": "model-00004.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model-00004.safetensors", + "model.layers.2.self_attn.indexer.k_norm.bias": "model-00004.safetensors", + "model.layers.2.self_attn.indexer.k_norm.weight": "model-00004.safetensors", + "model.layers.2.self_attn.indexer.weights_proj.weight": "model-00004.safetensors", + "model.layers.2.self_attn.indexer.wk.weight": "model-00004.safetensors", + "model.layers.2.self_attn.indexer.wq_b.weight": "model-00004.safetensors", + "model.layers.2.self_attn.kv_a_layernorm.weight": "model-00004.safetensors", + "model.layers.2.self_attn.kv_a_proj_with_mqa.weight": "model-00004.safetensors", + "model.layers.2.self_attn.kv_a_proj_with_mqa.scales": "model-00004.safetensors", + "model.layers.2.self_attn.kv_a_proj_with_mqa.biases": "model-00004.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model-00004.safetensors", + "model.layers.2.self_attn.o_proj.scales": "model-00004.safetensors", + "model.layers.2.self_attn.o_proj.biases": "model-00004.safetensors", + "model.layers.2.self_attn.q_a_layernorm.weight": "model-00004.safetensors", + "model.layers.2.self_attn.q_a_proj.weight": "model-00004.safetensors", + "model.layers.2.self_attn.q_a_proj.scales": "model-00004.safetensors", + "model.layers.2.self_attn.q_a_proj.biases": "model-00004.safetensors", + "model.layers.2.self_attn.q_b_proj.weight": "model-00004.safetensors", + "model.layers.2.self_attn.q_b_proj.scales": "model-00004.safetensors", + "model.layers.2.self_attn.q_b_proj.biases": "model-00004.safetensors", + "model.layers.2.self_attn.embed_q.weight": "model-00004.safetensors", + "model.layers.2.self_attn.embed_q.scales": "model-00004.safetensors", + "model.layers.2.self_attn.embed_q.biases": "model-00004.safetensors", + "model.layers.2.self_attn.unembed_out.weight": "model-00004.safetensors", + "model.layers.2.self_attn.unembed_out.scales": "model-00004.safetensors", + "model.layers.2.self_attn.unembed_out.biases": "model-00004.safetensors", + "model.layers.3.input_layernorm.weight": "model-00005.safetensors", + "model.layers.3.mlp.gate.e_score_correction_bias": "model-00005.safetensors", + "model.layers.3.mlp.gate.weight": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.down_proj.weight": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.down_proj.scales": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.down_proj.biases": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.gate_proj.weight": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.gate_proj.scales": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.gate_proj.biases": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.up_proj.weight": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.up_proj.scales": "model-00005.safetensors", + "model.layers.3.mlp.shared_experts.up_proj.biases": "model-00005.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model-00005.safetensors", + "model.layers.3.self_attn.kv_a_layernorm.weight": "model-00005.safetensors", + "model.layers.3.self_attn.kv_a_proj_with_mqa.weight": "model-00005.safetensors", + "model.layers.3.self_attn.kv_a_proj_with_mqa.scales": "model-00005.safetensors", + "model.layers.3.self_attn.kv_a_proj_with_mqa.biases": "model-00005.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model-00005.safetensors", + "model.layers.3.self_attn.o_proj.scales": "model-00005.safetensors", + "model.layers.3.self_attn.o_proj.biases": "model-00005.safetensors", + "model.layers.3.self_attn.q_a_layernorm.weight": "model-00005.safetensors", + "model.layers.3.self_attn.q_a_proj.weight": "model-00005.safetensors", + "model.layers.3.self_attn.q_a_proj.scales": "model-00005.safetensors", + "model.layers.3.self_attn.q_a_proj.biases": "model-00005.safetensors", + "model.layers.3.self_attn.q_b_proj.weight": "model-00005.safetensors", + "model.layers.3.self_attn.q_b_proj.scales": "model-00005.safetensors", + "model.layers.3.self_attn.q_b_proj.biases": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.gate_proj.weight": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.gate_proj.scales": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.gate_proj.biases": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.down_proj.weight": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.down_proj.scales": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.down_proj.biases": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.up_proj.weight": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.up_proj.scales": "model-00005.safetensors", + "model.layers.3.mlp.switch_mlp.up_proj.biases": "model-00005.safetensors", + "model.layers.3.self_attn.embed_q.weight": "model-00005.safetensors", + "model.layers.3.self_attn.embed_q.scales": "model-00005.safetensors", + "model.layers.3.self_attn.embed_q.biases": "model-00005.safetensors", + "model.layers.3.self_attn.unembed_out.weight": "model-00005.safetensors", + "model.layers.3.self_attn.unembed_out.scales": "model-00005.safetensors", + "model.layers.3.self_attn.unembed_out.biases": "model-00005.safetensors", + "model.layers.4.input_layernorm.weight": "model-00006.safetensors", + "model.layers.4.mlp.gate.e_score_correction_bias": "model-00006.safetensors", + "model.layers.4.mlp.gate.weight": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.down_proj.weight": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.down_proj.scales": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.down_proj.biases": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.gate_proj.weight": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.gate_proj.scales": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.gate_proj.biases": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.up_proj.weight": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.up_proj.scales": "model-00006.safetensors", + "model.layers.4.mlp.shared_experts.up_proj.biases": "model-00006.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model-00006.safetensors", + "model.layers.4.self_attn.kv_a_layernorm.weight": "model-00006.safetensors", + "model.layers.4.self_attn.kv_a_proj_with_mqa.weight": "model-00006.safetensors", + "model.layers.4.self_attn.kv_a_proj_with_mqa.scales": "model-00006.safetensors", + "model.layers.4.self_attn.kv_a_proj_with_mqa.biases": "model-00006.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model-00006.safetensors", + "model.layers.4.self_attn.o_proj.scales": "model-00006.safetensors", + "model.layers.4.self_attn.o_proj.biases": "model-00006.safetensors", + "model.layers.4.self_attn.q_a_layernorm.weight": "model-00006.safetensors", + "model.layers.4.self_attn.q_a_proj.weight": "model-00006.safetensors", + "model.layers.4.self_attn.q_a_proj.scales": "model-00006.safetensors", + "model.layers.4.self_attn.q_a_proj.biases": "model-00006.safetensors", + "model.layers.4.self_attn.q_b_proj.weight": "model-00006.safetensors", + "model.layers.4.self_attn.q_b_proj.scales": "model-00006.safetensors", + "model.layers.4.self_attn.q_b_proj.biases": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.gate_proj.weight": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.gate_proj.scales": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.gate_proj.biases": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.down_proj.weight": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.down_proj.scales": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.down_proj.biases": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.up_proj.weight": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.up_proj.scales": "model-00006.safetensors", + "model.layers.4.mlp.switch_mlp.up_proj.biases": "model-00006.safetensors", + "model.layers.4.self_attn.embed_q.weight": "model-00006.safetensors", + "model.layers.4.self_attn.embed_q.scales": "model-00006.safetensors", + "model.layers.4.self_attn.embed_q.biases": "model-00006.safetensors", + "model.layers.4.self_attn.unembed_out.weight": "model-00006.safetensors", + "model.layers.4.self_attn.unembed_out.scales": "model-00006.safetensors", + "model.layers.4.self_attn.unembed_out.biases": "model-00006.safetensors", + "model.layers.5.input_layernorm.weight": "model-00007.safetensors", + "model.layers.5.mlp.gate.e_score_correction_bias": "model-00007.safetensors", + "model.layers.5.mlp.gate.weight": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.down_proj.weight": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.down_proj.scales": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.down_proj.biases": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.gate_proj.weight": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.gate_proj.scales": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.gate_proj.biases": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.up_proj.weight": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.up_proj.scales": "model-00007.safetensors", + "model.layers.5.mlp.shared_experts.up_proj.biases": "model-00007.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model-00007.safetensors", + "model.layers.5.self_attn.kv_a_layernorm.weight": "model-00007.safetensors", + "model.layers.5.self_attn.kv_a_proj_with_mqa.weight": "model-00007.safetensors", + "model.layers.5.self_attn.kv_a_proj_with_mqa.scales": "model-00007.safetensors", + "model.layers.5.self_attn.kv_a_proj_with_mqa.biases": "model-00007.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model-00007.safetensors", + "model.layers.5.self_attn.o_proj.scales": "model-00007.safetensors", + "model.layers.5.self_attn.o_proj.biases": "model-00007.safetensors", + "model.layers.5.self_attn.q_a_layernorm.weight": "model-00007.safetensors", + "model.layers.5.self_attn.q_a_proj.weight": "model-00007.safetensors", + "model.layers.5.self_attn.q_a_proj.scales": "model-00007.safetensors", + "model.layers.5.self_attn.q_a_proj.biases": "model-00007.safetensors", + "model.layers.5.self_attn.q_b_proj.weight": "model-00007.safetensors", + "model.layers.5.self_attn.q_b_proj.scales": "model-00007.safetensors", + "model.layers.5.self_attn.q_b_proj.biases": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.gate_proj.weight": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.gate_proj.scales": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.gate_proj.biases": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.down_proj.weight": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.down_proj.scales": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.down_proj.biases": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.up_proj.weight": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.up_proj.scales": "model-00007.safetensors", + "model.layers.5.mlp.switch_mlp.up_proj.biases": "model-00007.safetensors", + "model.layers.5.self_attn.embed_q.weight": "model-00007.safetensors", + "model.layers.5.self_attn.embed_q.scales": "model-00007.safetensors", + "model.layers.5.self_attn.embed_q.biases": "model-00007.safetensors", + "model.layers.5.self_attn.unembed_out.weight": "model-00007.safetensors", + "model.layers.5.self_attn.unembed_out.scales": "model-00007.safetensors", + "model.layers.5.self_attn.unembed_out.biases": "model-00007.safetensors", + "model.layers.6.input_layernorm.weight": "model-00008.safetensors", + "model.layers.6.mlp.gate.e_score_correction_bias": "model-00008.safetensors", + "model.layers.6.mlp.gate.weight": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.down_proj.weight": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.down_proj.scales": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.down_proj.biases": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.gate_proj.weight": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.gate_proj.scales": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.gate_proj.biases": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.up_proj.weight": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.up_proj.scales": "model-00008.safetensors", + "model.layers.6.mlp.shared_experts.up_proj.biases": "model-00008.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model-00008.safetensors", + "model.layers.6.self_attn.indexer.k_norm.bias": "model-00008.safetensors", + "model.layers.6.self_attn.indexer.k_norm.weight": "model-00008.safetensors", + "model.layers.6.self_attn.indexer.weights_proj.weight": "model-00008.safetensors", + "model.layers.6.self_attn.indexer.wk.weight": "model-00008.safetensors", + "model.layers.6.self_attn.indexer.wq_b.weight": "model-00008.safetensors", + "model.layers.6.self_attn.kv_a_layernorm.weight": "model-00008.safetensors", + "model.layers.6.self_attn.kv_a_proj_with_mqa.weight": "model-00008.safetensors", + "model.layers.6.self_attn.kv_a_proj_with_mqa.scales": "model-00008.safetensors", + "model.layers.6.self_attn.kv_a_proj_with_mqa.biases": "model-00008.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model-00008.safetensors", + "model.layers.6.self_attn.o_proj.scales": "model-00008.safetensors", + "model.layers.6.self_attn.o_proj.biases": "model-00008.safetensors", + "model.layers.6.self_attn.q_a_layernorm.weight": "model-00008.safetensors", + "model.layers.6.self_attn.q_a_proj.weight": "model-00008.safetensors", + "model.layers.6.self_attn.q_a_proj.scales": "model-00008.safetensors", + "model.layers.6.self_attn.q_a_proj.biases": "model-00008.safetensors", + "model.layers.6.self_attn.q_b_proj.weight": "model-00008.safetensors", + "model.layers.6.self_attn.q_b_proj.scales": "model-00008.safetensors", + "model.layers.6.self_attn.q_b_proj.biases": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.gate_proj.weight": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.gate_proj.scales": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.gate_proj.biases": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.down_proj.weight": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.down_proj.scales": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.down_proj.biases": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.up_proj.weight": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.up_proj.scales": "model-00008.safetensors", + "model.layers.6.mlp.switch_mlp.up_proj.biases": "model-00008.safetensors", + "model.layers.6.self_attn.embed_q.weight": "model-00008.safetensors", + "model.layers.6.self_attn.embed_q.scales": "model-00008.safetensors", + "model.layers.6.self_attn.embed_q.biases": "model-00008.safetensors", + "model.layers.6.self_attn.unembed_out.weight": "model-00008.safetensors", + "model.layers.6.self_attn.unembed_out.scales": "model-00008.safetensors", + "model.layers.6.self_attn.unembed_out.biases": "model-00008.safetensors", + "model.layers.7.input_layernorm.weight": "model-00009.safetensors", + "model.layers.7.mlp.gate.e_score_correction_bias": "model-00009.safetensors", + "model.layers.7.mlp.gate.weight": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.down_proj.weight": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.down_proj.scales": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.down_proj.biases": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.gate_proj.weight": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.gate_proj.scales": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.gate_proj.biases": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.up_proj.weight": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.up_proj.scales": "model-00009.safetensors", + "model.layers.7.mlp.shared_experts.up_proj.biases": "model-00009.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model-00009.safetensors", + "model.layers.7.self_attn.kv_a_layernorm.weight": "model-00009.safetensors", + "model.layers.7.self_attn.kv_a_proj_with_mqa.weight": "model-00009.safetensors", + "model.layers.7.self_attn.kv_a_proj_with_mqa.scales": "model-00009.safetensors", + "model.layers.7.self_attn.kv_a_proj_with_mqa.biases": "model-00009.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model-00009.safetensors", + "model.layers.7.self_attn.o_proj.scales": "model-00009.safetensors", + "model.layers.7.self_attn.o_proj.biases": "model-00009.safetensors", + "model.layers.7.self_attn.q_a_layernorm.weight": "model-00009.safetensors", + "model.layers.7.self_attn.q_a_proj.weight": "model-00009.safetensors", + "model.layers.7.self_attn.q_a_proj.scales": "model-00009.safetensors", + "model.layers.7.self_attn.q_a_proj.biases": "model-00009.safetensors", + "model.layers.7.self_attn.q_b_proj.weight": "model-00009.safetensors", + "model.layers.7.self_attn.q_b_proj.scales": "model-00009.safetensors", + "model.layers.7.self_attn.q_b_proj.biases": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.gate_proj.weight": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.gate_proj.scales": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.gate_proj.biases": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.down_proj.weight": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.down_proj.scales": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.down_proj.biases": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.up_proj.weight": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.up_proj.scales": "model-00009.safetensors", + "model.layers.7.mlp.switch_mlp.up_proj.biases": "model-00009.safetensors", + "model.layers.7.self_attn.embed_q.weight": "model-00009.safetensors", + "model.layers.7.self_attn.embed_q.scales": "model-00009.safetensors", + "model.layers.7.self_attn.embed_q.biases": "model-00009.safetensors", + "model.layers.7.self_attn.unembed_out.weight": "model-00009.safetensors", + "model.layers.7.self_attn.unembed_out.scales": "model-00009.safetensors", + "model.layers.7.self_attn.unembed_out.biases": "model-00009.safetensors", + "model.layers.8.input_layernorm.weight": "model-00010.safetensors", + "model.layers.8.mlp.gate.e_score_correction_bias": "model-00010.safetensors", + "model.layers.8.mlp.gate.weight": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.down_proj.weight": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.down_proj.scales": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.down_proj.biases": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.gate_proj.weight": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.gate_proj.scales": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.gate_proj.biases": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.up_proj.weight": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.up_proj.scales": "model-00010.safetensors", + "model.layers.8.mlp.shared_experts.up_proj.biases": "model-00010.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model-00010.safetensors", + "model.layers.8.self_attn.kv_a_layernorm.weight": "model-00010.safetensors", + "model.layers.8.self_attn.kv_a_proj_with_mqa.weight": "model-00010.safetensors", + "model.layers.8.self_attn.kv_a_proj_with_mqa.scales": "model-00010.safetensors", + "model.layers.8.self_attn.kv_a_proj_with_mqa.biases": "model-00010.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model-00010.safetensors", + "model.layers.8.self_attn.o_proj.scales": "model-00010.safetensors", + "model.layers.8.self_attn.o_proj.biases": "model-00010.safetensors", + "model.layers.8.self_attn.q_a_layernorm.weight": "model-00010.safetensors", + "model.layers.8.self_attn.q_a_proj.weight": "model-00010.safetensors", + "model.layers.8.self_attn.q_a_proj.scales": "model-00010.safetensors", + "model.layers.8.self_attn.q_a_proj.biases": "model-00010.safetensors", + "model.layers.8.self_attn.q_b_proj.weight": "model-00010.safetensors", + "model.layers.8.self_attn.q_b_proj.scales": "model-00010.safetensors", + "model.layers.8.self_attn.q_b_proj.biases": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.gate_proj.weight": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.gate_proj.scales": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.gate_proj.biases": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.down_proj.weight": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.down_proj.scales": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.down_proj.biases": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.up_proj.weight": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.up_proj.scales": "model-00010.safetensors", + "model.layers.8.mlp.switch_mlp.up_proj.biases": "model-00010.safetensors", + "model.layers.8.self_attn.embed_q.weight": "model-00010.safetensors", + "model.layers.8.self_attn.embed_q.scales": "model-00010.safetensors", + "model.layers.8.self_attn.embed_q.biases": "model-00010.safetensors", + "model.layers.8.self_attn.unembed_out.weight": "model-00010.safetensors", + "model.layers.8.self_attn.unembed_out.scales": "model-00010.safetensors", + "model.layers.8.self_attn.unembed_out.biases": "model-00010.safetensors", + "model.layers.9.input_layernorm.weight": "model-00011.safetensors", + "model.layers.9.mlp.gate.e_score_correction_bias": "model-00011.safetensors", + "model.layers.9.mlp.gate.weight": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.down_proj.weight": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.down_proj.scales": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.down_proj.biases": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.gate_proj.weight": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.gate_proj.scales": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.gate_proj.biases": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.up_proj.weight": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.up_proj.scales": "model-00011.safetensors", + "model.layers.9.mlp.shared_experts.up_proj.biases": "model-00011.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model-00011.safetensors", + "model.layers.9.self_attn.kv_a_layernorm.weight": "model-00011.safetensors", + "model.layers.9.self_attn.kv_a_proj_with_mqa.weight": "model-00011.safetensors", + "model.layers.9.self_attn.kv_a_proj_with_mqa.scales": "model-00011.safetensors", + "model.layers.9.self_attn.kv_a_proj_with_mqa.biases": "model-00011.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model-00011.safetensors", + "model.layers.9.self_attn.o_proj.scales": "model-00011.safetensors", + "model.layers.9.self_attn.o_proj.biases": "model-00011.safetensors", + "model.layers.9.self_attn.q_a_layernorm.weight": "model-00011.safetensors", + "model.layers.9.self_attn.q_a_proj.weight": "model-00011.safetensors", + "model.layers.9.self_attn.q_a_proj.scales": "model-00011.safetensors", + "model.layers.9.self_attn.q_a_proj.biases": "model-00011.safetensors", + "model.layers.9.self_attn.q_b_proj.weight": "model-00011.safetensors", + "model.layers.9.self_attn.q_b_proj.scales": "model-00011.safetensors", + "model.layers.9.self_attn.q_b_proj.biases": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.gate_proj.weight": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.gate_proj.scales": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.gate_proj.biases": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.down_proj.weight": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.down_proj.scales": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.down_proj.biases": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00011.safetensors", + "model.layers.9.mlp.switch_mlp.up_proj.biases": "model-00011.safetensors", + "model.layers.9.self_attn.embed_q.weight": "model-00011.safetensors", + "model.layers.9.self_attn.embed_q.scales": "model-00011.safetensors", + "model.layers.9.self_attn.embed_q.biases": "model-00011.safetensors", + "model.layers.9.self_attn.unembed_out.weight": "model-00011.safetensors", + "model.layers.9.self_attn.unembed_out.scales": "model-00011.safetensors", + "model.layers.9.self_attn.unembed_out.biases": "model-00011.safetensors", + "model.layers.10.input_layernorm.weight": "model-00012.safetensors", + "model.layers.10.mlp.gate.e_score_correction_bias": "model-00012.safetensors", + "model.layers.10.mlp.gate.weight": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.down_proj.weight": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.down_proj.scales": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.down_proj.biases": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.gate_proj.weight": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.gate_proj.scales": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.gate_proj.biases": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.up_proj.weight": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.up_proj.scales": "model-00012.safetensors", + "model.layers.10.mlp.shared_experts.up_proj.biases": "model-00012.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model-00012.safetensors", + "model.layers.10.self_attn.indexer.k_norm.bias": "model-00012.safetensors", + "model.layers.10.self_attn.indexer.k_norm.weight": "model-00012.safetensors", + "model.layers.10.self_attn.indexer.weights_proj.weight": "model-00012.safetensors", + "model.layers.10.self_attn.indexer.wk.weight": "model-00012.safetensors", + "model.layers.10.self_attn.indexer.wq_b.weight": "model-00012.safetensors", + "model.layers.10.self_attn.kv_a_layernorm.weight": "model-00012.safetensors", + "model.layers.10.self_attn.kv_a_proj_with_mqa.weight": "model-00012.safetensors", + "model.layers.10.self_attn.kv_a_proj_with_mqa.scales": "model-00012.safetensors", + "model.layers.10.self_attn.kv_a_proj_with_mqa.biases": "model-00012.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model-00012.safetensors", + "model.layers.10.self_attn.o_proj.scales": "model-00012.safetensors", + "model.layers.10.self_attn.o_proj.biases": "model-00012.safetensors", + "model.layers.10.self_attn.q_a_layernorm.weight": "model-00012.safetensors", + "model.layers.10.self_attn.q_a_proj.weight": "model-00012.safetensors", + "model.layers.10.self_attn.q_a_proj.scales": "model-00012.safetensors", + "model.layers.10.self_attn.q_a_proj.biases": "model-00012.safetensors", + "model.layers.10.self_attn.q_b_proj.weight": "model-00012.safetensors", + "model.layers.10.self_attn.q_b_proj.scales": "model-00012.safetensors", + "model.layers.10.self_attn.q_b_proj.biases": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.gate_proj.weight": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.gate_proj.scales": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.gate_proj.biases": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.down_proj.weight": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.down_proj.scales": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.down_proj.biases": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.up_proj.weight": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.up_proj.scales": "model-00012.safetensors", + "model.layers.10.mlp.switch_mlp.up_proj.biases": "model-00012.safetensors", + "model.layers.10.self_attn.embed_q.weight": "model-00012.safetensors", + "model.layers.10.self_attn.embed_q.scales": "model-00012.safetensors", + "model.layers.10.self_attn.embed_q.biases": "model-00012.safetensors", + "model.layers.10.self_attn.unembed_out.weight": "model-00012.safetensors", + "model.layers.10.self_attn.unembed_out.scales": "model-00012.safetensors", + "model.layers.10.self_attn.unembed_out.biases": "model-00012.safetensors", + "model.layers.11.input_layernorm.weight": "model-00013.safetensors", + "model.layers.11.mlp.gate.e_score_correction_bias": "model-00013.safetensors", + "model.layers.11.mlp.gate.weight": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.down_proj.weight": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.down_proj.scales": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.down_proj.biases": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.gate_proj.weight": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.gate_proj.scales": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.gate_proj.biases": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.up_proj.weight": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.up_proj.scales": "model-00013.safetensors", + "model.layers.11.mlp.shared_experts.up_proj.biases": "model-00013.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model-00013.safetensors", + "model.layers.11.self_attn.kv_a_layernorm.weight": "model-00013.safetensors", + "model.layers.11.self_attn.kv_a_proj_with_mqa.weight": "model-00013.safetensors", + "model.layers.11.self_attn.kv_a_proj_with_mqa.scales": "model-00013.safetensors", + "model.layers.11.self_attn.kv_a_proj_with_mqa.biases": "model-00013.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model-00013.safetensors", + "model.layers.11.self_attn.o_proj.scales": "model-00013.safetensors", + "model.layers.11.self_attn.o_proj.biases": "model-00013.safetensors", + "model.layers.11.self_attn.q_a_layernorm.weight": "model-00013.safetensors", + "model.layers.11.self_attn.q_a_proj.weight": "model-00013.safetensors", + "model.layers.11.self_attn.q_a_proj.scales": "model-00013.safetensors", + "model.layers.11.self_attn.q_a_proj.biases": "model-00013.safetensors", + "model.layers.11.self_attn.q_b_proj.weight": "model-00013.safetensors", + "model.layers.11.self_attn.q_b_proj.scales": "model-00013.safetensors", + "model.layers.11.self_attn.q_b_proj.biases": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.gate_proj.weight": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.gate_proj.scales": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.gate_proj.biases": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.down_proj.weight": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.down_proj.scales": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.down_proj.biases": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.up_proj.weight": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.up_proj.scales": "model-00013.safetensors", + "model.layers.11.mlp.switch_mlp.up_proj.biases": "model-00013.safetensors", + "model.layers.11.self_attn.embed_q.weight": "model-00013.safetensors", + "model.layers.11.self_attn.embed_q.scales": "model-00013.safetensors", + "model.layers.11.self_attn.embed_q.biases": "model-00013.safetensors", + "model.layers.11.self_attn.unembed_out.weight": "model-00013.safetensors", + "model.layers.11.self_attn.unembed_out.scales": "model-00013.safetensors", + "model.layers.11.self_attn.unembed_out.biases": "model-00013.safetensors", + "model.layers.12.input_layernorm.weight": "model-00014.safetensors", + "model.layers.12.mlp.gate.e_score_correction_bias": "model-00014.safetensors", + "model.layers.12.mlp.gate.weight": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.down_proj.weight": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.down_proj.scales": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.down_proj.biases": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.gate_proj.weight": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.gate_proj.scales": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.gate_proj.biases": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.up_proj.weight": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.up_proj.scales": "model-00014.safetensors", + "model.layers.12.mlp.shared_experts.up_proj.biases": "model-00014.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model-00014.safetensors", + "model.layers.12.self_attn.kv_a_layernorm.weight": "model-00014.safetensors", + "model.layers.12.self_attn.kv_a_proj_with_mqa.weight": "model-00014.safetensors", + "model.layers.12.self_attn.kv_a_proj_with_mqa.scales": "model-00014.safetensors", + "model.layers.12.self_attn.kv_a_proj_with_mqa.biases": "model-00014.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model-00014.safetensors", + "model.layers.12.self_attn.o_proj.scales": "model-00014.safetensors", + "model.layers.12.self_attn.o_proj.biases": "model-00014.safetensors", + "model.layers.12.self_attn.q_a_layernorm.weight": "model-00014.safetensors", + "model.layers.12.self_attn.q_a_proj.weight": "model-00014.safetensors", + "model.layers.12.self_attn.q_a_proj.scales": "model-00014.safetensors", + "model.layers.12.self_attn.q_a_proj.biases": "model-00014.safetensors", + "model.layers.12.self_attn.q_b_proj.weight": "model-00014.safetensors", + "model.layers.12.self_attn.q_b_proj.scales": "model-00014.safetensors", + "model.layers.12.self_attn.q_b_proj.biases": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.gate_proj.weight": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.gate_proj.scales": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.gate_proj.biases": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.down_proj.weight": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.down_proj.scales": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.down_proj.biases": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.up_proj.weight": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.up_proj.scales": "model-00014.safetensors", + "model.layers.12.mlp.switch_mlp.up_proj.biases": "model-00014.safetensors", + "model.layers.12.self_attn.embed_q.weight": "model-00014.safetensors", + "model.layers.12.self_attn.embed_q.scales": "model-00014.safetensors", + "model.layers.12.self_attn.embed_q.biases": "model-00014.safetensors", + "model.layers.12.self_attn.unembed_out.weight": "model-00014.safetensors", + "model.layers.12.self_attn.unembed_out.scales": "model-00014.safetensors", + "model.layers.12.self_attn.unembed_out.biases": "model-00014.safetensors", + "model.layers.13.input_layernorm.weight": "model-00015.safetensors", + "model.layers.13.mlp.gate.e_score_correction_bias": "model-00015.safetensors", + "model.layers.13.mlp.gate.weight": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.down_proj.weight": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.down_proj.scales": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.down_proj.biases": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.gate_proj.weight": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.gate_proj.scales": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.gate_proj.biases": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.up_proj.weight": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.up_proj.scales": "model-00015.safetensors", + "model.layers.13.mlp.shared_experts.up_proj.biases": "model-00015.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model-00015.safetensors", + "model.layers.13.self_attn.kv_a_layernorm.weight": "model-00015.safetensors", + "model.layers.13.self_attn.kv_a_proj_with_mqa.weight": "model-00015.safetensors", + "model.layers.13.self_attn.kv_a_proj_with_mqa.scales": "model-00015.safetensors", + "model.layers.13.self_attn.kv_a_proj_with_mqa.biases": "model-00015.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model-00015.safetensors", + "model.layers.13.self_attn.o_proj.scales": "model-00015.safetensors", + "model.layers.13.self_attn.o_proj.biases": "model-00015.safetensors", + "model.layers.13.self_attn.q_a_layernorm.weight": "model-00015.safetensors", + "model.layers.13.self_attn.q_a_proj.weight": "model-00015.safetensors", + "model.layers.13.self_attn.q_a_proj.scales": "model-00015.safetensors", + "model.layers.13.self_attn.q_a_proj.biases": "model-00015.safetensors", + "model.layers.13.self_attn.q_b_proj.weight": "model-00015.safetensors", + "model.layers.13.self_attn.q_b_proj.scales": "model-00015.safetensors", + "model.layers.13.self_attn.q_b_proj.biases": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.gate_proj.weight": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.gate_proj.scales": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.gate_proj.biases": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.down_proj.weight": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.down_proj.scales": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.down_proj.biases": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.up_proj.weight": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.up_proj.scales": "model-00015.safetensors", + "model.layers.13.mlp.switch_mlp.up_proj.biases": "model-00015.safetensors", + "model.layers.13.self_attn.embed_q.weight": "model-00015.safetensors", + "model.layers.13.self_attn.embed_q.scales": "model-00015.safetensors", + "model.layers.13.self_attn.embed_q.biases": "model-00015.safetensors", + "model.layers.13.self_attn.unembed_out.weight": "model-00015.safetensors", + "model.layers.13.self_attn.unembed_out.scales": "model-00015.safetensors", + "model.layers.13.self_attn.unembed_out.biases": "model-00015.safetensors", + "model.layers.14.input_layernorm.weight": "model-00016.safetensors", + "model.layers.14.mlp.gate.e_score_correction_bias": "model-00016.safetensors", + "model.layers.14.mlp.gate.weight": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.down_proj.weight": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.down_proj.scales": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.down_proj.biases": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.gate_proj.weight": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.gate_proj.scales": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.gate_proj.biases": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.up_proj.weight": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.up_proj.scales": "model-00016.safetensors", + "model.layers.14.mlp.shared_experts.up_proj.biases": "model-00016.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model-00016.safetensors", + "model.layers.14.self_attn.indexer.k_norm.bias": "model-00016.safetensors", + "model.layers.14.self_attn.indexer.k_norm.weight": "model-00016.safetensors", + "model.layers.14.self_attn.indexer.weights_proj.weight": "model-00016.safetensors", + "model.layers.14.self_attn.indexer.wk.weight": "model-00016.safetensors", + "model.layers.14.self_attn.indexer.wq_b.weight": "model-00016.safetensors", + "model.layers.14.self_attn.kv_a_layernorm.weight": "model-00016.safetensors", + "model.layers.14.self_attn.kv_a_proj_with_mqa.weight": "model-00016.safetensors", + "model.layers.14.self_attn.kv_a_proj_with_mqa.scales": "model-00016.safetensors", + "model.layers.14.self_attn.kv_a_proj_with_mqa.biases": "model-00016.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model-00016.safetensors", + "model.layers.14.self_attn.o_proj.scales": "model-00016.safetensors", + "model.layers.14.self_attn.o_proj.biases": "model-00016.safetensors", + "model.layers.14.self_attn.q_a_layernorm.weight": "model-00016.safetensors", + "model.layers.14.self_attn.q_a_proj.weight": "model-00016.safetensors", + "model.layers.14.self_attn.q_a_proj.scales": "model-00016.safetensors", + "model.layers.14.self_attn.q_a_proj.biases": "model-00016.safetensors", + "model.layers.14.self_attn.q_b_proj.weight": "model-00016.safetensors", + "model.layers.14.self_attn.q_b_proj.scales": "model-00016.safetensors", + "model.layers.14.self_attn.q_b_proj.biases": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.gate_proj.weight": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.gate_proj.scales": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.gate_proj.biases": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.down_proj.weight": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.down_proj.scales": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.down_proj.biases": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.up_proj.weight": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.up_proj.scales": "model-00016.safetensors", + "model.layers.14.mlp.switch_mlp.up_proj.biases": "model-00016.safetensors", + "model.layers.14.self_attn.embed_q.weight": "model-00016.safetensors", + "model.layers.14.self_attn.embed_q.scales": "model-00016.safetensors", + "model.layers.14.self_attn.embed_q.biases": "model-00016.safetensors", + "model.layers.14.self_attn.unembed_out.weight": "model-00016.safetensors", + "model.layers.14.self_attn.unembed_out.scales": "model-00016.safetensors", + "model.layers.14.self_attn.unembed_out.biases": "model-00016.safetensors", + "model.layers.15.input_layernorm.weight": "model-00017.safetensors", + "model.layers.15.mlp.gate.e_score_correction_bias": "model-00017.safetensors", + "model.layers.15.mlp.gate.weight": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.down_proj.weight": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.down_proj.scales": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.down_proj.biases": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.gate_proj.weight": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.gate_proj.scales": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.gate_proj.biases": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.up_proj.weight": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.up_proj.scales": "model-00017.safetensors", + "model.layers.15.mlp.shared_experts.up_proj.biases": "model-00017.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model-00017.safetensors", + "model.layers.15.self_attn.kv_a_layernorm.weight": "model-00017.safetensors", + "model.layers.15.self_attn.kv_a_proj_with_mqa.weight": "model-00017.safetensors", + "model.layers.15.self_attn.kv_a_proj_with_mqa.scales": "model-00017.safetensors", + "model.layers.15.self_attn.kv_a_proj_with_mqa.biases": "model-00017.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model-00017.safetensors", + "model.layers.15.self_attn.o_proj.scales": "model-00017.safetensors", + "model.layers.15.self_attn.o_proj.biases": "model-00017.safetensors", + "model.layers.15.self_attn.q_a_layernorm.weight": "model-00017.safetensors", + "model.layers.15.self_attn.q_a_proj.weight": "model-00017.safetensors", + "model.layers.15.self_attn.q_a_proj.scales": "model-00017.safetensors", + "model.layers.15.self_attn.q_a_proj.biases": "model-00017.safetensors", + "model.layers.15.self_attn.q_b_proj.weight": "model-00017.safetensors", + "model.layers.15.self_attn.q_b_proj.scales": "model-00017.safetensors", + "model.layers.15.self_attn.q_b_proj.biases": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.gate_proj.weight": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.gate_proj.scales": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.gate_proj.biases": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.down_proj.weight": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.down_proj.scales": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.down_proj.biases": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.up_proj.weight": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.up_proj.scales": "model-00017.safetensors", + "model.layers.15.mlp.switch_mlp.up_proj.biases": "model-00017.safetensors", + "model.layers.15.self_attn.embed_q.weight": "model-00017.safetensors", + "model.layers.15.self_attn.embed_q.scales": "model-00017.safetensors", + "model.layers.15.self_attn.embed_q.biases": "model-00017.safetensors", + "model.layers.15.self_attn.unembed_out.weight": "model-00017.safetensors", + "model.layers.15.self_attn.unembed_out.scales": "model-00017.safetensors", + "model.layers.15.self_attn.unembed_out.biases": "model-00017.safetensors", + "model.layers.16.input_layernorm.weight": "model-00018.safetensors", + "model.layers.16.mlp.gate.e_score_correction_bias": "model-00018.safetensors", + "model.layers.16.mlp.gate.weight": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.down_proj.weight": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.down_proj.scales": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.down_proj.biases": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.gate_proj.weight": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.gate_proj.scales": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.gate_proj.biases": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.up_proj.weight": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.up_proj.scales": "model-00018.safetensors", + "model.layers.16.mlp.shared_experts.up_proj.biases": "model-00018.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model-00018.safetensors", + "model.layers.16.self_attn.kv_a_layernorm.weight": "model-00018.safetensors", + "model.layers.16.self_attn.kv_a_proj_with_mqa.weight": "model-00018.safetensors", + "model.layers.16.self_attn.kv_a_proj_with_mqa.scales": "model-00018.safetensors", + "model.layers.16.self_attn.kv_a_proj_with_mqa.biases": "model-00018.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model-00018.safetensors", + "model.layers.16.self_attn.o_proj.scales": "model-00018.safetensors", + "model.layers.16.self_attn.o_proj.biases": "model-00018.safetensors", + "model.layers.16.self_attn.q_a_layernorm.weight": "model-00018.safetensors", + "model.layers.16.self_attn.q_a_proj.weight": "model-00018.safetensors", + "model.layers.16.self_attn.q_a_proj.scales": "model-00018.safetensors", + "model.layers.16.self_attn.q_a_proj.biases": "model-00018.safetensors", + "model.layers.16.self_attn.q_b_proj.weight": "model-00018.safetensors", + "model.layers.16.self_attn.q_b_proj.scales": "model-00018.safetensors", + "model.layers.16.self_attn.q_b_proj.biases": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.gate_proj.weight": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.gate_proj.scales": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.gate_proj.biases": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.down_proj.weight": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.down_proj.scales": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.down_proj.biases": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.up_proj.weight": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.up_proj.scales": "model-00018.safetensors", + "model.layers.16.mlp.switch_mlp.up_proj.biases": "model-00018.safetensors", + "model.layers.16.self_attn.embed_q.weight": "model-00018.safetensors", + "model.layers.16.self_attn.embed_q.scales": "model-00018.safetensors", + "model.layers.16.self_attn.embed_q.biases": "model-00018.safetensors", + "model.layers.16.self_attn.unembed_out.weight": "model-00018.safetensors", + "model.layers.16.self_attn.unembed_out.scales": "model-00018.safetensors", + "model.layers.16.self_attn.unembed_out.biases": "model-00018.safetensors", + "model.layers.17.input_layernorm.weight": "model-00019.safetensors", + "model.layers.17.mlp.gate.e_score_correction_bias": "model-00019.safetensors", + "model.layers.17.mlp.gate.weight": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.down_proj.weight": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.down_proj.scales": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.down_proj.biases": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.gate_proj.weight": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.gate_proj.scales": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.gate_proj.biases": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.up_proj.weight": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.up_proj.scales": "model-00019.safetensors", + "model.layers.17.mlp.shared_experts.up_proj.biases": "model-00019.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model-00019.safetensors", + "model.layers.17.self_attn.kv_a_layernorm.weight": "model-00019.safetensors", + "model.layers.17.self_attn.kv_a_proj_with_mqa.weight": "model-00019.safetensors", + "model.layers.17.self_attn.kv_a_proj_with_mqa.scales": "model-00019.safetensors", + "model.layers.17.self_attn.kv_a_proj_with_mqa.biases": "model-00019.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model-00019.safetensors", + "model.layers.17.self_attn.o_proj.scales": "model-00019.safetensors", + "model.layers.17.self_attn.o_proj.biases": "model-00019.safetensors", + "model.layers.17.self_attn.q_a_layernorm.weight": "model-00019.safetensors", + "model.layers.17.self_attn.q_a_proj.weight": "model-00019.safetensors", + "model.layers.17.self_attn.q_a_proj.scales": "model-00019.safetensors", + "model.layers.17.self_attn.q_a_proj.biases": "model-00019.safetensors", + "model.layers.17.self_attn.q_b_proj.weight": "model-00019.safetensors", + "model.layers.17.self_attn.q_b_proj.scales": "model-00019.safetensors", + "model.layers.17.self_attn.q_b_proj.biases": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.gate_proj.weight": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.gate_proj.scales": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.gate_proj.biases": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.down_proj.weight": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.down_proj.scales": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.down_proj.biases": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.up_proj.weight": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.up_proj.scales": "model-00019.safetensors", + "model.layers.17.mlp.switch_mlp.up_proj.biases": "model-00019.safetensors", + "model.layers.17.self_attn.embed_q.weight": "model-00019.safetensors", + "model.layers.17.self_attn.embed_q.scales": "model-00019.safetensors", + "model.layers.17.self_attn.embed_q.biases": "model-00019.safetensors", + "model.layers.17.self_attn.unembed_out.weight": "model-00019.safetensors", + "model.layers.17.self_attn.unembed_out.scales": "model-00019.safetensors", + "model.layers.17.self_attn.unembed_out.biases": "model-00019.safetensors", + "model.layers.18.input_layernorm.weight": "model-00020.safetensors", + "model.layers.18.mlp.gate.e_score_correction_bias": "model-00020.safetensors", + "model.layers.18.mlp.gate.weight": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.down_proj.weight": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.down_proj.scales": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.down_proj.biases": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.gate_proj.weight": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.gate_proj.scales": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.gate_proj.biases": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.up_proj.weight": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.up_proj.scales": "model-00020.safetensors", + "model.layers.18.mlp.shared_experts.up_proj.biases": "model-00020.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model-00020.safetensors", + "model.layers.18.self_attn.indexer.k_norm.bias": "model-00020.safetensors", + "model.layers.18.self_attn.indexer.k_norm.weight": "model-00020.safetensors", + "model.layers.18.self_attn.indexer.weights_proj.weight": "model-00020.safetensors", + "model.layers.18.self_attn.indexer.wk.weight": "model-00020.safetensors", + "model.layers.18.self_attn.indexer.wq_b.weight": "model-00020.safetensors", + "model.layers.18.self_attn.kv_a_layernorm.weight": "model-00020.safetensors", + "model.layers.18.self_attn.kv_a_proj_with_mqa.weight": "model-00020.safetensors", + "model.layers.18.self_attn.kv_a_proj_with_mqa.scales": "model-00020.safetensors", + "model.layers.18.self_attn.kv_a_proj_with_mqa.biases": "model-00020.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model-00020.safetensors", + "model.layers.18.self_attn.o_proj.scales": "model-00020.safetensors", + "model.layers.18.self_attn.o_proj.biases": "model-00020.safetensors", + "model.layers.18.self_attn.q_a_layernorm.weight": "model-00020.safetensors", + "model.layers.18.self_attn.q_a_proj.weight": "model-00020.safetensors", + "model.layers.18.self_attn.q_a_proj.scales": "model-00020.safetensors", + "model.layers.18.self_attn.q_a_proj.biases": "model-00020.safetensors", + "model.layers.18.self_attn.q_b_proj.weight": "model-00020.safetensors", + "model.layers.18.self_attn.q_b_proj.scales": "model-00020.safetensors", + "model.layers.18.self_attn.q_b_proj.biases": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.gate_proj.weight": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.gate_proj.scales": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.gate_proj.biases": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.down_proj.weight": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.down_proj.scales": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.down_proj.biases": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.up_proj.weight": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.up_proj.scales": "model-00020.safetensors", + "model.layers.18.mlp.switch_mlp.up_proj.biases": "model-00020.safetensors", + "model.layers.18.self_attn.embed_q.weight": "model-00020.safetensors", + "model.layers.18.self_attn.embed_q.scales": "model-00020.safetensors", + "model.layers.18.self_attn.embed_q.biases": "model-00020.safetensors", + "model.layers.18.self_attn.unembed_out.weight": "model-00020.safetensors", + "model.layers.18.self_attn.unembed_out.scales": "model-00020.safetensors", + "model.layers.18.self_attn.unembed_out.biases": "model-00020.safetensors", + "model.layers.19.input_layernorm.weight": "model-00021.safetensors", + "model.layers.19.mlp.gate.e_score_correction_bias": "model-00021.safetensors", + "model.layers.19.mlp.gate.weight": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.down_proj.weight": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.down_proj.scales": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.down_proj.biases": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.gate_proj.weight": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.gate_proj.scales": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.gate_proj.biases": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.up_proj.weight": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.up_proj.scales": "model-00021.safetensors", + "model.layers.19.mlp.shared_experts.up_proj.biases": "model-00021.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model-00021.safetensors", + "model.layers.19.self_attn.kv_a_layernorm.weight": "model-00021.safetensors", + "model.layers.19.self_attn.kv_a_proj_with_mqa.weight": "model-00021.safetensors", + "model.layers.19.self_attn.kv_a_proj_with_mqa.scales": "model-00021.safetensors", + "model.layers.19.self_attn.kv_a_proj_with_mqa.biases": "model-00021.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model-00021.safetensors", + "model.layers.19.self_attn.o_proj.scales": "model-00021.safetensors", + "model.layers.19.self_attn.o_proj.biases": "model-00021.safetensors", + "model.layers.19.self_attn.q_a_layernorm.weight": "model-00021.safetensors", + "model.layers.19.self_attn.q_a_proj.weight": "model-00021.safetensors", + "model.layers.19.self_attn.q_a_proj.scales": "model-00021.safetensors", + "model.layers.19.self_attn.q_a_proj.biases": "model-00021.safetensors", + "model.layers.19.self_attn.q_b_proj.weight": "model-00021.safetensors", + "model.layers.19.self_attn.q_b_proj.scales": "model-00021.safetensors", + "model.layers.19.self_attn.q_b_proj.biases": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.gate_proj.weight": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.gate_proj.scales": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.gate_proj.biases": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.down_proj.weight": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.down_proj.scales": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.down_proj.biases": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.up_proj.weight": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.up_proj.scales": "model-00021.safetensors", + "model.layers.19.mlp.switch_mlp.up_proj.biases": "model-00021.safetensors", + "model.layers.19.self_attn.embed_q.weight": "model-00021.safetensors", + "model.layers.19.self_attn.embed_q.scales": "model-00021.safetensors", + "model.layers.19.self_attn.embed_q.biases": "model-00021.safetensors", + "model.layers.19.self_attn.unembed_out.weight": "model-00021.safetensors", + "model.layers.19.self_attn.unembed_out.scales": "model-00021.safetensors", + "model.layers.19.self_attn.unembed_out.biases": "model-00021.safetensors", + "model.layers.20.input_layernorm.weight": "model-00022.safetensors", + "model.layers.20.mlp.gate.e_score_correction_bias": "model-00022.safetensors", + "model.layers.20.mlp.gate.weight": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.down_proj.weight": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.down_proj.scales": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.down_proj.biases": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.gate_proj.weight": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.gate_proj.scales": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.gate_proj.biases": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.up_proj.weight": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.up_proj.scales": "model-00022.safetensors", + "model.layers.20.mlp.shared_experts.up_proj.biases": "model-00022.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model-00022.safetensors", + "model.layers.20.self_attn.kv_a_layernorm.weight": "model-00022.safetensors", + "model.layers.20.self_attn.kv_a_proj_with_mqa.weight": "model-00022.safetensors", + "model.layers.20.self_attn.kv_a_proj_with_mqa.scales": "model-00022.safetensors", + "model.layers.20.self_attn.kv_a_proj_with_mqa.biases": "model-00022.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model-00022.safetensors", + "model.layers.20.self_attn.o_proj.scales": "model-00022.safetensors", + "model.layers.20.self_attn.o_proj.biases": "model-00022.safetensors", + "model.layers.20.self_attn.q_a_layernorm.weight": "model-00022.safetensors", + "model.layers.20.self_attn.q_a_proj.weight": "model-00022.safetensors", + "model.layers.20.self_attn.q_a_proj.scales": "model-00022.safetensors", + "model.layers.20.self_attn.q_a_proj.biases": "model-00022.safetensors", + "model.layers.20.self_attn.q_b_proj.weight": "model-00022.safetensors", + "model.layers.20.self_attn.q_b_proj.scales": "model-00022.safetensors", + "model.layers.20.self_attn.q_b_proj.biases": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.gate_proj.weight": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.gate_proj.scales": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.gate_proj.biases": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.down_proj.weight": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.down_proj.scales": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.down_proj.biases": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.up_proj.weight": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.up_proj.scales": "model-00022.safetensors", + "model.layers.20.mlp.switch_mlp.up_proj.biases": "model-00022.safetensors", + "model.layers.20.self_attn.embed_q.weight": "model-00022.safetensors", + "model.layers.20.self_attn.embed_q.scales": "model-00022.safetensors", + "model.layers.20.self_attn.embed_q.biases": "model-00022.safetensors", + "model.layers.20.self_attn.unembed_out.weight": "model-00022.safetensors", + "model.layers.20.self_attn.unembed_out.scales": "model-00022.safetensors", + "model.layers.20.self_attn.unembed_out.biases": "model-00022.safetensors", + "model.layers.21.input_layernorm.weight": "model-00023.safetensors", + "model.layers.21.mlp.gate.e_score_correction_bias": "model-00023.safetensors", + "model.layers.21.mlp.gate.weight": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.down_proj.weight": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.down_proj.scales": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.down_proj.biases": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.gate_proj.weight": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.gate_proj.scales": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.gate_proj.biases": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.up_proj.weight": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.up_proj.scales": "model-00023.safetensors", + "model.layers.21.mlp.shared_experts.up_proj.biases": "model-00023.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model-00023.safetensors", + "model.layers.21.self_attn.kv_a_layernorm.weight": "model-00023.safetensors", + "model.layers.21.self_attn.kv_a_proj_with_mqa.weight": "model-00023.safetensors", + "model.layers.21.self_attn.kv_a_proj_with_mqa.scales": "model-00023.safetensors", + "model.layers.21.self_attn.kv_a_proj_with_mqa.biases": "model-00023.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model-00023.safetensors", + "model.layers.21.self_attn.o_proj.scales": "model-00023.safetensors", + "model.layers.21.self_attn.o_proj.biases": "model-00023.safetensors", + "model.layers.21.self_attn.q_a_layernorm.weight": "model-00023.safetensors", + "model.layers.21.self_attn.q_a_proj.weight": "model-00023.safetensors", + "model.layers.21.self_attn.q_a_proj.scales": "model-00023.safetensors", + "model.layers.21.self_attn.q_a_proj.biases": "model-00023.safetensors", + "model.layers.21.self_attn.q_b_proj.weight": "model-00023.safetensors", + "model.layers.21.self_attn.q_b_proj.scales": "model-00023.safetensors", + "model.layers.21.self_attn.q_b_proj.biases": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.gate_proj.weight": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.gate_proj.scales": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.gate_proj.biases": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.down_proj.weight": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.down_proj.scales": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.down_proj.biases": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.up_proj.weight": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.up_proj.scales": "model-00023.safetensors", + "model.layers.21.mlp.switch_mlp.up_proj.biases": "model-00023.safetensors", + "model.layers.21.self_attn.embed_q.weight": "model-00023.safetensors", + "model.layers.21.self_attn.embed_q.scales": "model-00023.safetensors", + "model.layers.21.self_attn.embed_q.biases": "model-00023.safetensors", + "model.layers.21.self_attn.unembed_out.weight": "model-00023.safetensors", + "model.layers.21.self_attn.unembed_out.scales": "model-00023.safetensors", + "model.layers.21.self_attn.unembed_out.biases": "model-00023.safetensors", + "model.layers.22.input_layernorm.weight": "model-00024.safetensors", + "model.layers.22.mlp.gate.e_score_correction_bias": "model-00024.safetensors", + "model.layers.22.mlp.gate.weight": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.down_proj.weight": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.down_proj.scales": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.down_proj.biases": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.gate_proj.weight": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.gate_proj.scales": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.gate_proj.biases": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.up_proj.weight": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.up_proj.scales": "model-00024.safetensors", + "model.layers.22.mlp.shared_experts.up_proj.biases": "model-00024.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model-00024.safetensors", + "model.layers.22.self_attn.indexer.k_norm.bias": "model-00024.safetensors", + "model.layers.22.self_attn.indexer.k_norm.weight": "model-00024.safetensors", + "model.layers.22.self_attn.indexer.weights_proj.weight": "model-00024.safetensors", + "model.layers.22.self_attn.indexer.wk.weight": "model-00024.safetensors", + "model.layers.22.self_attn.indexer.wq_b.weight": "model-00024.safetensors", + "model.layers.22.self_attn.kv_a_layernorm.weight": "model-00024.safetensors", + "model.layers.22.self_attn.kv_a_proj_with_mqa.weight": "model-00024.safetensors", + "model.layers.22.self_attn.kv_a_proj_with_mqa.scales": "model-00024.safetensors", + "model.layers.22.self_attn.kv_a_proj_with_mqa.biases": "model-00024.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model-00024.safetensors", + "model.layers.22.self_attn.o_proj.scales": "model-00024.safetensors", + "model.layers.22.self_attn.o_proj.biases": "model-00024.safetensors", + "model.layers.22.self_attn.q_a_layernorm.weight": "model-00024.safetensors", + "model.layers.22.self_attn.q_a_proj.weight": "model-00024.safetensors", + "model.layers.22.self_attn.q_a_proj.scales": "model-00024.safetensors", + "model.layers.22.self_attn.q_a_proj.biases": "model-00024.safetensors", + "model.layers.22.self_attn.q_b_proj.weight": "model-00024.safetensors", + "model.layers.22.self_attn.q_b_proj.scales": "model-00024.safetensors", + "model.layers.22.self_attn.q_b_proj.biases": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.gate_proj.weight": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.gate_proj.scales": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.gate_proj.biases": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.down_proj.weight": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.down_proj.scales": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.down_proj.biases": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.up_proj.weight": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.up_proj.scales": "model-00024.safetensors", + "model.layers.22.mlp.switch_mlp.up_proj.biases": "model-00024.safetensors", + "model.layers.22.self_attn.embed_q.weight": "model-00024.safetensors", + "model.layers.22.self_attn.embed_q.scales": "model-00024.safetensors", + "model.layers.22.self_attn.embed_q.biases": "model-00024.safetensors", + "model.layers.22.self_attn.unembed_out.weight": "model-00024.safetensors", + "model.layers.22.self_attn.unembed_out.scales": "model-00024.safetensors", + "model.layers.22.self_attn.unembed_out.biases": "model-00024.safetensors", + "model.layers.23.input_layernorm.weight": "model-00025.safetensors", + "model.layers.23.mlp.gate.e_score_correction_bias": "model-00025.safetensors", + "model.layers.23.mlp.gate.weight": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.down_proj.weight": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.down_proj.scales": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.down_proj.biases": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.gate_proj.weight": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.gate_proj.scales": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.gate_proj.biases": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.up_proj.weight": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.up_proj.scales": "model-00025.safetensors", + "model.layers.23.mlp.shared_experts.up_proj.biases": "model-00025.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model-00025.safetensors", + "model.layers.23.self_attn.kv_a_layernorm.weight": "model-00025.safetensors", + "model.layers.23.self_attn.kv_a_proj_with_mqa.weight": "model-00025.safetensors", + "model.layers.23.self_attn.kv_a_proj_with_mqa.scales": "model-00025.safetensors", + "model.layers.23.self_attn.kv_a_proj_with_mqa.biases": "model-00025.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model-00025.safetensors", + "model.layers.23.self_attn.o_proj.scales": "model-00025.safetensors", + "model.layers.23.self_attn.o_proj.biases": "model-00025.safetensors", + "model.layers.23.self_attn.q_a_layernorm.weight": "model-00025.safetensors", + "model.layers.23.self_attn.q_a_proj.weight": "model-00025.safetensors", + "model.layers.23.self_attn.q_a_proj.scales": "model-00025.safetensors", + "model.layers.23.self_attn.q_a_proj.biases": "model-00025.safetensors", + "model.layers.23.self_attn.q_b_proj.weight": "model-00025.safetensors", + "model.layers.23.self_attn.q_b_proj.scales": "model-00025.safetensors", + "model.layers.23.self_attn.q_b_proj.biases": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.gate_proj.weight": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.gate_proj.scales": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.gate_proj.biases": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.down_proj.weight": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.down_proj.scales": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.down_proj.biases": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.up_proj.weight": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.up_proj.scales": "model-00025.safetensors", + "model.layers.23.mlp.switch_mlp.up_proj.biases": "model-00025.safetensors", + "model.layers.23.self_attn.embed_q.weight": "model-00025.safetensors", + "model.layers.23.self_attn.embed_q.scales": "model-00025.safetensors", + "model.layers.23.self_attn.embed_q.biases": "model-00025.safetensors", + "model.layers.23.self_attn.unembed_out.weight": "model-00025.safetensors", + "model.layers.23.self_attn.unembed_out.scales": "model-00025.safetensors", + "model.layers.23.self_attn.unembed_out.biases": "model-00025.safetensors", + "model.layers.24.input_layernorm.weight": "model-00026.safetensors", + "model.layers.24.mlp.gate.e_score_correction_bias": "model-00026.safetensors", + "model.layers.24.mlp.gate.weight": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.down_proj.weight": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.down_proj.scales": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.down_proj.biases": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.gate_proj.weight": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.gate_proj.scales": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.gate_proj.biases": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.up_proj.weight": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.up_proj.scales": "model-00026.safetensors", + "model.layers.24.mlp.shared_experts.up_proj.biases": "model-00026.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model-00026.safetensors", + "model.layers.24.self_attn.kv_a_layernorm.weight": "model-00026.safetensors", + "model.layers.24.self_attn.kv_a_proj_with_mqa.weight": "model-00026.safetensors", + "model.layers.24.self_attn.kv_a_proj_with_mqa.scales": "model-00026.safetensors", + "model.layers.24.self_attn.kv_a_proj_with_mqa.biases": "model-00026.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model-00026.safetensors", + "model.layers.24.self_attn.o_proj.scales": "model-00026.safetensors", + "model.layers.24.self_attn.o_proj.biases": "model-00026.safetensors", + "model.layers.24.self_attn.q_a_layernorm.weight": "model-00026.safetensors", + "model.layers.24.self_attn.q_a_proj.weight": "model-00026.safetensors", + "model.layers.24.self_attn.q_a_proj.scales": "model-00026.safetensors", + "model.layers.24.self_attn.q_a_proj.biases": "model-00026.safetensors", + "model.layers.24.self_attn.q_b_proj.weight": "model-00026.safetensors", + "model.layers.24.self_attn.q_b_proj.scales": "model-00026.safetensors", + "model.layers.24.self_attn.q_b_proj.biases": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.gate_proj.weight": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.gate_proj.scales": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.gate_proj.biases": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.down_proj.weight": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.down_proj.scales": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.down_proj.biases": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.up_proj.weight": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.up_proj.scales": "model-00026.safetensors", + "model.layers.24.mlp.switch_mlp.up_proj.biases": "model-00026.safetensors", + "model.layers.24.self_attn.embed_q.weight": "model-00026.safetensors", + "model.layers.24.self_attn.embed_q.scales": "model-00026.safetensors", + "model.layers.24.self_attn.embed_q.biases": "model-00026.safetensors", + "model.layers.24.self_attn.unembed_out.weight": "model-00026.safetensors", + "model.layers.24.self_attn.unembed_out.scales": "model-00026.safetensors", + "model.layers.24.self_attn.unembed_out.biases": "model-00026.safetensors", + "model.layers.25.input_layernorm.weight": "model-00027.safetensors", + "model.layers.25.mlp.gate.e_score_correction_bias": "model-00027.safetensors", + "model.layers.25.mlp.gate.weight": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.down_proj.weight": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.down_proj.scales": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.down_proj.biases": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.gate_proj.weight": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.gate_proj.scales": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.gate_proj.biases": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.up_proj.weight": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.up_proj.scales": "model-00027.safetensors", + "model.layers.25.mlp.shared_experts.up_proj.biases": "model-00027.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model-00027.safetensors", + "model.layers.25.self_attn.kv_a_layernorm.weight": "model-00027.safetensors", + "model.layers.25.self_attn.kv_a_proj_with_mqa.weight": "model-00027.safetensors", + "model.layers.25.self_attn.kv_a_proj_with_mqa.scales": "model-00027.safetensors", + "model.layers.25.self_attn.kv_a_proj_with_mqa.biases": "model-00027.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model-00027.safetensors", + "model.layers.25.self_attn.o_proj.scales": "model-00027.safetensors", + "model.layers.25.self_attn.o_proj.biases": "model-00027.safetensors", + "model.layers.25.self_attn.q_a_layernorm.weight": "model-00027.safetensors", + "model.layers.25.self_attn.q_a_proj.weight": "model-00027.safetensors", + "model.layers.25.self_attn.q_a_proj.scales": "model-00027.safetensors", + "model.layers.25.self_attn.q_a_proj.biases": "model-00027.safetensors", + "model.layers.25.self_attn.q_b_proj.weight": "model-00027.safetensors", + "model.layers.25.self_attn.q_b_proj.scales": "model-00027.safetensors", + "model.layers.25.self_attn.q_b_proj.biases": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.gate_proj.weight": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.gate_proj.scales": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.gate_proj.biases": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.down_proj.weight": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.down_proj.scales": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.down_proj.biases": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.up_proj.weight": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.up_proj.scales": "model-00027.safetensors", + "model.layers.25.mlp.switch_mlp.up_proj.biases": "model-00027.safetensors", + "model.layers.25.self_attn.embed_q.weight": "model-00027.safetensors", + "model.layers.25.self_attn.embed_q.scales": "model-00027.safetensors", + "model.layers.25.self_attn.embed_q.biases": "model-00027.safetensors", + "model.layers.25.self_attn.unembed_out.weight": "model-00027.safetensors", + "model.layers.25.self_attn.unembed_out.scales": "model-00027.safetensors", + "model.layers.25.self_attn.unembed_out.biases": "model-00027.safetensors", + "model.layers.26.input_layernorm.weight": "model-00028.safetensors", + "model.layers.26.mlp.gate.e_score_correction_bias": "model-00028.safetensors", + "model.layers.26.mlp.gate.weight": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.down_proj.weight": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.down_proj.scales": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.down_proj.biases": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.gate_proj.weight": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.gate_proj.scales": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.gate_proj.biases": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.up_proj.weight": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.up_proj.scales": "model-00028.safetensors", + "model.layers.26.mlp.shared_experts.up_proj.biases": "model-00028.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model-00028.safetensors", + "model.layers.26.self_attn.indexer.k_norm.bias": "model-00028.safetensors", + "model.layers.26.self_attn.indexer.k_norm.weight": "model-00028.safetensors", + "model.layers.26.self_attn.indexer.weights_proj.weight": "model-00028.safetensors", + "model.layers.26.self_attn.indexer.wk.weight": "model-00028.safetensors", + "model.layers.26.self_attn.indexer.wq_b.weight": "model-00028.safetensors", + "model.layers.26.self_attn.kv_a_layernorm.weight": "model-00028.safetensors", + "model.layers.26.self_attn.kv_a_proj_with_mqa.weight": "model-00028.safetensors", + "model.layers.26.self_attn.kv_a_proj_with_mqa.scales": "model-00028.safetensors", + "model.layers.26.self_attn.kv_a_proj_with_mqa.biases": "model-00028.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model-00028.safetensors", + "model.layers.26.self_attn.o_proj.scales": "model-00028.safetensors", + "model.layers.26.self_attn.o_proj.biases": "model-00028.safetensors", + "model.layers.26.self_attn.q_a_layernorm.weight": "model-00028.safetensors", + "model.layers.26.self_attn.q_a_proj.weight": "model-00028.safetensors", + "model.layers.26.self_attn.q_a_proj.scales": "model-00028.safetensors", + "model.layers.26.self_attn.q_a_proj.biases": "model-00028.safetensors", + "model.layers.26.self_attn.q_b_proj.weight": "model-00028.safetensors", + "model.layers.26.self_attn.q_b_proj.scales": "model-00028.safetensors", + "model.layers.26.self_attn.q_b_proj.biases": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.gate_proj.weight": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.gate_proj.scales": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.gate_proj.biases": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.down_proj.weight": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.down_proj.scales": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.down_proj.biases": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.up_proj.weight": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.up_proj.scales": "model-00028.safetensors", + "model.layers.26.mlp.switch_mlp.up_proj.biases": "model-00028.safetensors", + "model.layers.26.self_attn.embed_q.weight": "model-00028.safetensors", + "model.layers.26.self_attn.embed_q.scales": "model-00028.safetensors", + "model.layers.26.self_attn.embed_q.biases": "model-00028.safetensors", + "model.layers.26.self_attn.unembed_out.weight": "model-00028.safetensors", + "model.layers.26.self_attn.unembed_out.scales": "model-00028.safetensors", + "model.layers.26.self_attn.unembed_out.biases": "model-00028.safetensors", + "model.layers.27.input_layernorm.weight": "model-00029.safetensors", + "model.layers.27.mlp.gate.e_score_correction_bias": "model-00029.safetensors", + "model.layers.27.mlp.gate.weight": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.down_proj.weight": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.down_proj.scales": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.down_proj.biases": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.gate_proj.weight": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.gate_proj.scales": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.gate_proj.biases": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.up_proj.weight": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.up_proj.scales": "model-00029.safetensors", + "model.layers.27.mlp.shared_experts.up_proj.biases": "model-00029.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model-00029.safetensors", + "model.layers.27.self_attn.kv_a_layernorm.weight": "model-00029.safetensors", + "model.layers.27.self_attn.kv_a_proj_with_mqa.weight": "model-00029.safetensors", + "model.layers.27.self_attn.kv_a_proj_with_mqa.scales": "model-00029.safetensors", + "model.layers.27.self_attn.kv_a_proj_with_mqa.biases": "model-00029.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model-00029.safetensors", + "model.layers.27.self_attn.o_proj.scales": "model-00029.safetensors", + "model.layers.27.self_attn.o_proj.biases": "model-00029.safetensors", + "model.layers.27.self_attn.q_a_layernorm.weight": "model-00029.safetensors", + "model.layers.27.self_attn.q_a_proj.weight": "model-00029.safetensors", + "model.layers.27.self_attn.q_a_proj.scales": "model-00029.safetensors", + "model.layers.27.self_attn.q_a_proj.biases": "model-00029.safetensors", + "model.layers.27.self_attn.q_b_proj.weight": "model-00029.safetensors", + "model.layers.27.self_attn.q_b_proj.scales": "model-00029.safetensors", + "model.layers.27.self_attn.q_b_proj.biases": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.gate_proj.weight": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.gate_proj.scales": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.gate_proj.biases": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.down_proj.weight": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.down_proj.scales": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.down_proj.biases": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.up_proj.weight": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.up_proj.scales": "model-00029.safetensors", + "model.layers.27.mlp.switch_mlp.up_proj.biases": "model-00029.safetensors", + "model.layers.27.self_attn.embed_q.weight": "model-00029.safetensors", + "model.layers.27.self_attn.embed_q.scales": "model-00029.safetensors", + "model.layers.27.self_attn.embed_q.biases": "model-00029.safetensors", + "model.layers.27.self_attn.unembed_out.weight": "model-00029.safetensors", + "model.layers.27.self_attn.unembed_out.scales": "model-00029.safetensors", + "model.layers.27.self_attn.unembed_out.biases": "model-00029.safetensors", + "model.layers.28.input_layernorm.weight": "model-00030.safetensors", + "model.layers.28.mlp.gate.e_score_correction_bias": "model-00030.safetensors", + "model.layers.28.mlp.gate.weight": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.down_proj.weight": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.down_proj.scales": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.down_proj.biases": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.gate_proj.weight": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.gate_proj.scales": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.gate_proj.biases": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.up_proj.weight": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.up_proj.scales": "model-00030.safetensors", + "model.layers.28.mlp.shared_experts.up_proj.biases": "model-00030.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model-00030.safetensors", + "model.layers.28.self_attn.kv_a_layernorm.weight": "model-00030.safetensors", + "model.layers.28.self_attn.kv_a_proj_with_mqa.weight": "model-00030.safetensors", + "model.layers.28.self_attn.kv_a_proj_with_mqa.scales": "model-00030.safetensors", + "model.layers.28.self_attn.kv_a_proj_with_mqa.biases": "model-00030.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model-00030.safetensors", + "model.layers.28.self_attn.o_proj.scales": "model-00030.safetensors", + "model.layers.28.self_attn.o_proj.biases": "model-00030.safetensors", + "model.layers.28.self_attn.q_a_layernorm.weight": "model-00030.safetensors", + "model.layers.28.self_attn.q_a_proj.weight": "model-00030.safetensors", + "model.layers.28.self_attn.q_a_proj.scales": "model-00030.safetensors", + "model.layers.28.self_attn.q_a_proj.biases": "model-00030.safetensors", + "model.layers.28.self_attn.q_b_proj.weight": "model-00030.safetensors", + "model.layers.28.self_attn.q_b_proj.scales": "model-00030.safetensors", + "model.layers.28.self_attn.q_b_proj.biases": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.gate_proj.weight": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.gate_proj.scales": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.gate_proj.biases": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.down_proj.weight": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.down_proj.scales": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.down_proj.biases": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.up_proj.weight": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.up_proj.scales": "model-00030.safetensors", + "model.layers.28.mlp.switch_mlp.up_proj.biases": "model-00030.safetensors", + "model.layers.28.self_attn.embed_q.weight": "model-00030.safetensors", + "model.layers.28.self_attn.embed_q.scales": "model-00030.safetensors", + "model.layers.28.self_attn.embed_q.biases": "model-00030.safetensors", + "model.layers.28.self_attn.unembed_out.weight": "model-00030.safetensors", + "model.layers.28.self_attn.unembed_out.scales": "model-00030.safetensors", + "model.layers.28.self_attn.unembed_out.biases": "model-00030.safetensors", + "model.layers.29.input_layernorm.weight": "model-00031.safetensors", + "model.layers.29.mlp.gate.e_score_correction_bias": "model-00031.safetensors", + "model.layers.29.mlp.gate.weight": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.down_proj.weight": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.down_proj.scales": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.down_proj.biases": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.gate_proj.weight": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.gate_proj.scales": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.gate_proj.biases": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.up_proj.weight": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.up_proj.scales": "model-00031.safetensors", + "model.layers.29.mlp.shared_experts.up_proj.biases": "model-00031.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model-00031.safetensors", + "model.layers.29.self_attn.kv_a_layernorm.weight": "model-00031.safetensors", + "model.layers.29.self_attn.kv_a_proj_with_mqa.weight": "model-00031.safetensors", + "model.layers.29.self_attn.kv_a_proj_with_mqa.scales": "model-00031.safetensors", + "model.layers.29.self_attn.kv_a_proj_with_mqa.biases": "model-00031.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model-00031.safetensors", + "model.layers.29.self_attn.o_proj.scales": "model-00031.safetensors", + "model.layers.29.self_attn.o_proj.biases": "model-00031.safetensors", + "model.layers.29.self_attn.q_a_layernorm.weight": "model-00031.safetensors", + "model.layers.29.self_attn.q_a_proj.weight": "model-00031.safetensors", + "model.layers.29.self_attn.q_a_proj.scales": "model-00031.safetensors", + "model.layers.29.self_attn.q_a_proj.biases": "model-00031.safetensors", + "model.layers.29.self_attn.q_b_proj.weight": "model-00031.safetensors", + "model.layers.29.self_attn.q_b_proj.scales": "model-00031.safetensors", + "model.layers.29.self_attn.q_b_proj.biases": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.gate_proj.weight": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.gate_proj.scales": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.gate_proj.biases": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.down_proj.weight": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.down_proj.scales": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.down_proj.biases": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.up_proj.weight": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.up_proj.scales": "model-00031.safetensors", + "model.layers.29.mlp.switch_mlp.up_proj.biases": "model-00031.safetensors", + "model.layers.29.self_attn.embed_q.weight": "model-00031.safetensors", + "model.layers.29.self_attn.embed_q.scales": "model-00031.safetensors", + "model.layers.29.self_attn.embed_q.biases": "model-00031.safetensors", + "model.layers.29.self_attn.unembed_out.weight": "model-00031.safetensors", + "model.layers.29.self_attn.unembed_out.scales": "model-00031.safetensors", + "model.layers.29.self_attn.unembed_out.biases": "model-00031.safetensors", + "model.layers.30.input_layernorm.weight": "model-00032.safetensors", + "model.layers.30.mlp.gate.e_score_correction_bias": "model-00032.safetensors", + "model.layers.30.mlp.gate.weight": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.down_proj.weight": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.down_proj.scales": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.down_proj.biases": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.gate_proj.weight": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.gate_proj.scales": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.gate_proj.biases": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.up_proj.weight": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.up_proj.scales": "model-00032.safetensors", + "model.layers.30.mlp.shared_experts.up_proj.biases": "model-00032.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model-00032.safetensors", + "model.layers.30.self_attn.indexer.k_norm.bias": "model-00032.safetensors", + "model.layers.30.self_attn.indexer.k_norm.weight": "model-00032.safetensors", + "model.layers.30.self_attn.indexer.weights_proj.weight": "model-00032.safetensors", + "model.layers.30.self_attn.indexer.wk.weight": "model-00032.safetensors", + "model.layers.30.self_attn.indexer.wq_b.weight": "model-00032.safetensors", + "model.layers.30.self_attn.kv_a_layernorm.weight": "model-00032.safetensors", + "model.layers.30.self_attn.kv_a_proj_with_mqa.weight": "model-00032.safetensors", + "model.layers.30.self_attn.kv_a_proj_with_mqa.scales": "model-00032.safetensors", + "model.layers.30.self_attn.kv_a_proj_with_mqa.biases": "model-00032.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model-00032.safetensors", + "model.layers.30.self_attn.o_proj.scales": "model-00032.safetensors", + "model.layers.30.self_attn.o_proj.biases": "model-00032.safetensors", + "model.layers.30.self_attn.q_a_layernorm.weight": "model-00032.safetensors", + "model.layers.30.self_attn.q_a_proj.weight": "model-00032.safetensors", + "model.layers.30.self_attn.q_a_proj.scales": "model-00032.safetensors", + "model.layers.30.self_attn.q_a_proj.biases": "model-00032.safetensors", + "model.layers.30.self_attn.q_b_proj.weight": "model-00032.safetensors", + "model.layers.30.self_attn.q_b_proj.scales": "model-00032.safetensors", + "model.layers.30.self_attn.q_b_proj.biases": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.gate_proj.weight": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.gate_proj.scales": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.gate_proj.biases": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.down_proj.weight": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.down_proj.scales": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.down_proj.biases": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.up_proj.weight": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.up_proj.scales": "model-00032.safetensors", + "model.layers.30.mlp.switch_mlp.up_proj.biases": "model-00032.safetensors", + "model.layers.30.self_attn.embed_q.weight": "model-00032.safetensors", + "model.layers.30.self_attn.embed_q.scales": "model-00032.safetensors", + "model.layers.30.self_attn.embed_q.biases": "model-00032.safetensors", + "model.layers.30.self_attn.unembed_out.weight": "model-00032.safetensors", + "model.layers.30.self_attn.unembed_out.scales": "model-00032.safetensors", + "model.layers.30.self_attn.unembed_out.biases": "model-00032.safetensors", + "model.layers.31.input_layernorm.weight": "model-00033.safetensors", + "model.layers.31.mlp.gate.e_score_correction_bias": "model-00033.safetensors", + "model.layers.31.mlp.gate.weight": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.down_proj.weight": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.down_proj.scales": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.down_proj.biases": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.gate_proj.weight": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.gate_proj.scales": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.gate_proj.biases": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.up_proj.weight": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.up_proj.scales": "model-00033.safetensors", + "model.layers.31.mlp.shared_experts.up_proj.biases": "model-00033.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model-00033.safetensors", + "model.layers.31.self_attn.kv_a_layernorm.weight": "model-00033.safetensors", + "model.layers.31.self_attn.kv_a_proj_with_mqa.weight": "model-00033.safetensors", + "model.layers.31.self_attn.kv_a_proj_with_mqa.scales": "model-00033.safetensors", + "model.layers.31.self_attn.kv_a_proj_with_mqa.biases": "model-00033.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model-00033.safetensors", + "model.layers.31.self_attn.o_proj.scales": "model-00033.safetensors", + "model.layers.31.self_attn.o_proj.biases": "model-00033.safetensors", + "model.layers.31.self_attn.q_a_layernorm.weight": "model-00033.safetensors", + "model.layers.31.self_attn.q_a_proj.weight": "model-00033.safetensors", + "model.layers.31.self_attn.q_a_proj.scales": "model-00033.safetensors", + "model.layers.31.self_attn.q_a_proj.biases": "model-00033.safetensors", + "model.layers.31.self_attn.q_b_proj.weight": "model-00033.safetensors", + "model.layers.31.self_attn.q_b_proj.scales": "model-00033.safetensors", + "model.layers.31.self_attn.q_b_proj.biases": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.gate_proj.weight": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.gate_proj.scales": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.gate_proj.biases": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.down_proj.weight": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.down_proj.scales": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.down_proj.biases": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.up_proj.weight": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.up_proj.scales": "model-00033.safetensors", + "model.layers.31.mlp.switch_mlp.up_proj.biases": "model-00033.safetensors", + "model.layers.31.self_attn.embed_q.weight": "model-00033.safetensors", + "model.layers.31.self_attn.embed_q.scales": "model-00033.safetensors", + "model.layers.31.self_attn.embed_q.biases": "model-00033.safetensors", + "model.layers.31.self_attn.unembed_out.weight": "model-00033.safetensors", + "model.layers.31.self_attn.unembed_out.scales": "model-00033.safetensors", + "model.layers.31.self_attn.unembed_out.biases": "model-00033.safetensors", + "model.layers.32.input_layernorm.weight": "model-00034.safetensors", + "model.layers.32.mlp.gate.e_score_correction_bias": "model-00034.safetensors", + "model.layers.32.mlp.gate.weight": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.down_proj.weight": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.down_proj.scales": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.down_proj.biases": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.gate_proj.weight": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.gate_proj.scales": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.gate_proj.biases": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.up_proj.weight": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.up_proj.scales": "model-00034.safetensors", + "model.layers.32.mlp.shared_experts.up_proj.biases": "model-00034.safetensors", + "model.layers.32.post_attention_layernorm.weight": "model-00034.safetensors", + "model.layers.32.self_attn.kv_a_layernorm.weight": "model-00034.safetensors", + "model.layers.32.self_attn.kv_a_proj_with_mqa.weight": "model-00034.safetensors", + "model.layers.32.self_attn.kv_a_proj_with_mqa.scales": "model-00034.safetensors", + "model.layers.32.self_attn.kv_a_proj_with_mqa.biases": "model-00034.safetensors", + "model.layers.32.self_attn.o_proj.weight": "model-00034.safetensors", + "model.layers.32.self_attn.o_proj.scales": "model-00034.safetensors", + "model.layers.32.self_attn.o_proj.biases": "model-00034.safetensors", + "model.layers.32.self_attn.q_a_layernorm.weight": "model-00034.safetensors", + "model.layers.32.self_attn.q_a_proj.weight": "model-00034.safetensors", + "model.layers.32.self_attn.q_a_proj.scales": "model-00034.safetensors", + "model.layers.32.self_attn.q_a_proj.biases": "model-00034.safetensors", + "model.layers.32.self_attn.q_b_proj.weight": "model-00034.safetensors", + "model.layers.32.self_attn.q_b_proj.scales": "model-00034.safetensors", + "model.layers.32.self_attn.q_b_proj.biases": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.gate_proj.weight": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.gate_proj.scales": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.gate_proj.biases": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.down_proj.weight": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.down_proj.scales": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.down_proj.biases": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.up_proj.weight": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.up_proj.scales": "model-00034.safetensors", + "model.layers.32.mlp.switch_mlp.up_proj.biases": "model-00034.safetensors", + "model.layers.32.self_attn.embed_q.weight": "model-00034.safetensors", + "model.layers.32.self_attn.embed_q.scales": "model-00034.safetensors", + "model.layers.32.self_attn.embed_q.biases": "model-00034.safetensors", + "model.layers.32.self_attn.unembed_out.weight": "model-00034.safetensors", + "model.layers.32.self_attn.unembed_out.scales": "model-00034.safetensors", + "model.layers.32.self_attn.unembed_out.biases": "model-00034.safetensors", + "model.layers.33.input_layernorm.weight": "model-00035.safetensors", + "model.layers.33.mlp.gate.e_score_correction_bias": "model-00035.safetensors", + "model.layers.33.mlp.gate.weight": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.down_proj.weight": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.down_proj.scales": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.down_proj.biases": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.gate_proj.weight": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.gate_proj.scales": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.gate_proj.biases": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.up_proj.weight": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.up_proj.scales": "model-00035.safetensors", + "model.layers.33.mlp.shared_experts.up_proj.biases": "model-00035.safetensors", + "model.layers.33.post_attention_layernorm.weight": "model-00035.safetensors", + "model.layers.33.self_attn.kv_a_layernorm.weight": "model-00035.safetensors", + "model.layers.33.self_attn.kv_a_proj_with_mqa.weight": "model-00035.safetensors", + "model.layers.33.self_attn.kv_a_proj_with_mqa.scales": "model-00035.safetensors", + "model.layers.33.self_attn.kv_a_proj_with_mqa.biases": "model-00035.safetensors", + "model.layers.33.self_attn.o_proj.weight": "model-00035.safetensors", + "model.layers.33.self_attn.o_proj.scales": "model-00035.safetensors", + "model.layers.33.self_attn.o_proj.biases": "model-00035.safetensors", + "model.layers.33.self_attn.q_a_layernorm.weight": "model-00035.safetensors", + "model.layers.33.self_attn.q_a_proj.weight": "model-00035.safetensors", + "model.layers.33.self_attn.q_a_proj.scales": "model-00035.safetensors", + "model.layers.33.self_attn.q_a_proj.biases": "model-00035.safetensors", + "model.layers.33.self_attn.q_b_proj.weight": "model-00035.safetensors", + "model.layers.33.self_attn.q_b_proj.scales": "model-00035.safetensors", + "model.layers.33.self_attn.q_b_proj.biases": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.gate_proj.weight": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.gate_proj.scales": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.gate_proj.biases": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.down_proj.weight": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.down_proj.scales": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.down_proj.biases": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.up_proj.weight": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.up_proj.scales": "model-00035.safetensors", + "model.layers.33.mlp.switch_mlp.up_proj.biases": "model-00035.safetensors", + "model.layers.33.self_attn.embed_q.weight": "model-00035.safetensors", + "model.layers.33.self_attn.embed_q.scales": "model-00035.safetensors", + "model.layers.33.self_attn.embed_q.biases": "model-00035.safetensors", + "model.layers.33.self_attn.unembed_out.weight": "model-00035.safetensors", + "model.layers.33.self_attn.unembed_out.scales": "model-00035.safetensors", + "model.layers.33.self_attn.unembed_out.biases": "model-00035.safetensors", + "model.layers.34.input_layernorm.weight": "model-00036.safetensors", + "model.layers.34.mlp.gate.e_score_correction_bias": "model-00036.safetensors", + "model.layers.34.mlp.gate.weight": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.down_proj.weight": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.down_proj.scales": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.down_proj.biases": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.gate_proj.weight": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.gate_proj.scales": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.gate_proj.biases": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.up_proj.weight": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.up_proj.scales": "model-00036.safetensors", + "model.layers.34.mlp.shared_experts.up_proj.biases": "model-00036.safetensors", + "model.layers.34.post_attention_layernorm.weight": "model-00036.safetensors", + "model.layers.34.self_attn.indexer.k_norm.bias": "model-00036.safetensors", + "model.layers.34.self_attn.indexer.k_norm.weight": "model-00036.safetensors", + "model.layers.34.self_attn.indexer.weights_proj.weight": "model-00036.safetensors", + "model.layers.34.self_attn.indexer.wk.weight": "model-00036.safetensors", + "model.layers.34.self_attn.indexer.wq_b.weight": "model-00036.safetensors", + "model.layers.34.self_attn.kv_a_layernorm.weight": "model-00036.safetensors", + "model.layers.34.self_attn.kv_a_proj_with_mqa.weight": "model-00036.safetensors", + "model.layers.34.self_attn.kv_a_proj_with_mqa.scales": "model-00036.safetensors", + "model.layers.34.self_attn.kv_a_proj_with_mqa.biases": "model-00036.safetensors", + "model.layers.34.self_attn.o_proj.weight": "model-00036.safetensors", + "model.layers.34.self_attn.o_proj.scales": "model-00036.safetensors", + "model.layers.34.self_attn.o_proj.biases": "model-00036.safetensors", + "model.layers.34.self_attn.q_a_layernorm.weight": "model-00036.safetensors", + "model.layers.34.self_attn.q_a_proj.weight": "model-00036.safetensors", + "model.layers.34.self_attn.q_a_proj.scales": "model-00036.safetensors", + "model.layers.34.self_attn.q_a_proj.biases": "model-00036.safetensors", + "model.layers.34.self_attn.q_b_proj.weight": "model-00036.safetensors", + "model.layers.34.self_attn.q_b_proj.scales": "model-00036.safetensors", + "model.layers.34.self_attn.q_b_proj.biases": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.gate_proj.weight": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.gate_proj.scales": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.gate_proj.biases": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.down_proj.weight": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.down_proj.scales": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.down_proj.biases": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.up_proj.weight": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.up_proj.scales": "model-00036.safetensors", + "model.layers.34.mlp.switch_mlp.up_proj.biases": "model-00036.safetensors", + "model.layers.34.self_attn.embed_q.weight": "model-00036.safetensors", + "model.layers.34.self_attn.embed_q.scales": "model-00036.safetensors", + "model.layers.34.self_attn.embed_q.biases": "model-00036.safetensors", + "model.layers.34.self_attn.unembed_out.weight": "model-00036.safetensors", + "model.layers.34.self_attn.unembed_out.scales": "model-00036.safetensors", + "model.layers.34.self_attn.unembed_out.biases": "model-00036.safetensors", + "model.layers.35.input_layernorm.weight": "model-00037.safetensors", + "model.layers.35.mlp.gate.e_score_correction_bias": "model-00037.safetensors", + "model.layers.35.mlp.gate.weight": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.down_proj.weight": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.down_proj.scales": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.down_proj.biases": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.gate_proj.weight": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.gate_proj.scales": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.gate_proj.biases": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.up_proj.weight": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.up_proj.scales": "model-00037.safetensors", + "model.layers.35.mlp.shared_experts.up_proj.biases": "model-00037.safetensors", + "model.layers.35.post_attention_layernorm.weight": "model-00037.safetensors", + "model.layers.35.self_attn.kv_a_layernorm.weight": "model-00037.safetensors", + "model.layers.35.self_attn.kv_a_proj_with_mqa.weight": "model-00037.safetensors", + "model.layers.35.self_attn.kv_a_proj_with_mqa.scales": "model-00037.safetensors", + "model.layers.35.self_attn.kv_a_proj_with_mqa.biases": "model-00037.safetensors", + "model.layers.35.self_attn.o_proj.weight": "model-00037.safetensors", + "model.layers.35.self_attn.o_proj.scales": "model-00037.safetensors", + "model.layers.35.self_attn.o_proj.biases": "model-00037.safetensors", + "model.layers.35.self_attn.q_a_layernorm.weight": "model-00037.safetensors", + "model.layers.35.self_attn.q_a_proj.weight": "model-00037.safetensors", + "model.layers.35.self_attn.q_a_proj.scales": "model-00037.safetensors", + "model.layers.35.self_attn.q_a_proj.biases": "model-00037.safetensors", + "model.layers.35.self_attn.q_b_proj.weight": "model-00037.safetensors", + "model.layers.35.self_attn.q_b_proj.scales": "model-00037.safetensors", + "model.layers.35.self_attn.q_b_proj.biases": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.gate_proj.weight": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.gate_proj.scales": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.gate_proj.biases": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.down_proj.weight": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.down_proj.scales": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.down_proj.biases": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.up_proj.weight": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.up_proj.scales": "model-00037.safetensors", + "model.layers.35.mlp.switch_mlp.up_proj.biases": "model-00037.safetensors", + "model.layers.35.self_attn.embed_q.weight": "model-00037.safetensors", + "model.layers.35.self_attn.embed_q.scales": "model-00037.safetensors", + "model.layers.35.self_attn.embed_q.biases": "model-00037.safetensors", + "model.layers.35.self_attn.unembed_out.weight": "model-00037.safetensors", + "model.layers.35.self_attn.unembed_out.scales": "model-00037.safetensors", + "model.layers.35.self_attn.unembed_out.biases": "model-00037.safetensors", + "model.layers.36.input_layernorm.weight": "model-00038.safetensors", + "model.layers.36.mlp.gate.e_score_correction_bias": "model-00038.safetensors", + "model.layers.36.mlp.gate.weight": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.down_proj.weight": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.down_proj.scales": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.down_proj.biases": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.gate_proj.weight": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.gate_proj.scales": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.gate_proj.biases": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.up_proj.weight": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.up_proj.scales": "model-00038.safetensors", + "model.layers.36.mlp.shared_experts.up_proj.biases": "model-00038.safetensors", + "model.layers.36.post_attention_layernorm.weight": "model-00038.safetensors", + "model.layers.36.self_attn.kv_a_layernorm.weight": "model-00038.safetensors", + "model.layers.36.self_attn.kv_a_proj_with_mqa.weight": "model-00038.safetensors", + "model.layers.36.self_attn.kv_a_proj_with_mqa.scales": "model-00038.safetensors", + "model.layers.36.self_attn.kv_a_proj_with_mqa.biases": "model-00038.safetensors", + "model.layers.36.self_attn.o_proj.weight": "model-00038.safetensors", + "model.layers.36.self_attn.o_proj.scales": "model-00038.safetensors", + "model.layers.36.self_attn.o_proj.biases": "model-00038.safetensors", + "model.layers.36.self_attn.q_a_layernorm.weight": "model-00038.safetensors", + "model.layers.36.self_attn.q_a_proj.weight": "model-00038.safetensors", + "model.layers.36.self_attn.q_a_proj.scales": "model-00038.safetensors", + "model.layers.36.self_attn.q_a_proj.biases": "model-00038.safetensors", + "model.layers.36.self_attn.q_b_proj.weight": "model-00038.safetensors", + "model.layers.36.self_attn.q_b_proj.scales": "model-00038.safetensors", + "model.layers.36.self_attn.q_b_proj.biases": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.gate_proj.biases": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.down_proj.biases": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00038.safetensors", + "model.layers.36.mlp.switch_mlp.up_proj.biases": "model-00038.safetensors", + "model.layers.36.self_attn.embed_q.weight": "model-00038.safetensors", + "model.layers.36.self_attn.embed_q.scales": "model-00038.safetensors", + "model.layers.36.self_attn.embed_q.biases": "model-00038.safetensors", + "model.layers.36.self_attn.unembed_out.weight": "model-00038.safetensors", + "model.layers.36.self_attn.unembed_out.scales": "model-00038.safetensors", + "model.layers.36.self_attn.unembed_out.biases": "model-00038.safetensors", + "model.layers.37.input_layernorm.weight": "model-00039.safetensors", + "model.layers.37.mlp.gate.e_score_correction_bias": "model-00039.safetensors", + "model.layers.37.mlp.gate.weight": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.down_proj.weight": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.down_proj.scales": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.down_proj.biases": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.gate_proj.weight": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.gate_proj.scales": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.gate_proj.biases": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.up_proj.weight": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.up_proj.scales": "model-00039.safetensors", + "model.layers.37.mlp.shared_experts.up_proj.biases": "model-00039.safetensors", + "model.layers.37.post_attention_layernorm.weight": "model-00039.safetensors", + "model.layers.37.self_attn.kv_a_layernorm.weight": "model-00039.safetensors", + "model.layers.37.self_attn.kv_a_proj_with_mqa.weight": "model-00039.safetensors", + "model.layers.37.self_attn.kv_a_proj_with_mqa.scales": "model-00039.safetensors", + "model.layers.37.self_attn.kv_a_proj_with_mqa.biases": "model-00039.safetensors", + "model.layers.37.self_attn.o_proj.weight": "model-00039.safetensors", + "model.layers.37.self_attn.o_proj.scales": "model-00039.safetensors", + "model.layers.37.self_attn.o_proj.biases": "model-00039.safetensors", + "model.layers.37.self_attn.q_a_layernorm.weight": "model-00039.safetensors", + "model.layers.37.self_attn.q_a_proj.weight": "model-00039.safetensors", + "model.layers.37.self_attn.q_a_proj.scales": "model-00039.safetensors", + "model.layers.37.self_attn.q_a_proj.biases": "model-00039.safetensors", + "model.layers.37.self_attn.q_b_proj.weight": "model-00039.safetensors", + "model.layers.37.self_attn.q_b_proj.scales": "model-00039.safetensors", + "model.layers.37.self_attn.q_b_proj.biases": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.gate_proj.weight": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.gate_proj.scales": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.gate_proj.biases": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.down_proj.weight": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.down_proj.scales": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.down_proj.biases": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.up_proj.weight": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.up_proj.scales": "model-00039.safetensors", + "model.layers.37.mlp.switch_mlp.up_proj.biases": "model-00039.safetensors", + "model.layers.37.self_attn.embed_q.weight": "model-00039.safetensors", + "model.layers.37.self_attn.embed_q.scales": "model-00039.safetensors", + "model.layers.37.self_attn.embed_q.biases": "model-00039.safetensors", + "model.layers.37.self_attn.unembed_out.weight": "model-00039.safetensors", + "model.layers.37.self_attn.unembed_out.scales": "model-00039.safetensors", + "model.layers.37.self_attn.unembed_out.biases": "model-00039.safetensors", + "model.layers.38.input_layernorm.weight": "model-00040.safetensors", + "model.layers.38.mlp.gate.e_score_correction_bias": "model-00040.safetensors", + "model.layers.38.mlp.gate.weight": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.down_proj.weight": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.down_proj.scales": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.down_proj.biases": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.gate_proj.weight": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.gate_proj.scales": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.gate_proj.biases": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.up_proj.weight": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.up_proj.scales": "model-00040.safetensors", + "model.layers.38.mlp.shared_experts.up_proj.biases": "model-00040.safetensors", + "model.layers.38.post_attention_layernorm.weight": "model-00040.safetensors", + "model.layers.38.self_attn.indexer.k_norm.bias": "model-00040.safetensors", + "model.layers.38.self_attn.indexer.k_norm.weight": "model-00040.safetensors", + "model.layers.38.self_attn.indexer.weights_proj.weight": "model-00040.safetensors", + "model.layers.38.self_attn.indexer.wk.weight": "model-00040.safetensors", + "model.layers.38.self_attn.indexer.wq_b.weight": "model-00040.safetensors", + "model.layers.38.self_attn.kv_a_layernorm.weight": "model-00040.safetensors", + "model.layers.38.self_attn.kv_a_proj_with_mqa.weight": "model-00040.safetensors", + "model.layers.38.self_attn.kv_a_proj_with_mqa.scales": "model-00040.safetensors", + "model.layers.38.self_attn.kv_a_proj_with_mqa.biases": "model-00040.safetensors", + "model.layers.38.self_attn.o_proj.weight": "model-00040.safetensors", + "model.layers.38.self_attn.o_proj.scales": "model-00040.safetensors", + "model.layers.38.self_attn.o_proj.biases": "model-00040.safetensors", + "model.layers.38.self_attn.q_a_layernorm.weight": "model-00040.safetensors", + "model.layers.38.self_attn.q_a_proj.weight": "model-00040.safetensors", + "model.layers.38.self_attn.q_a_proj.scales": "model-00040.safetensors", + "model.layers.38.self_attn.q_a_proj.biases": "model-00040.safetensors", + "model.layers.38.self_attn.q_b_proj.weight": "model-00040.safetensors", + "model.layers.38.self_attn.q_b_proj.scales": "model-00040.safetensors", + "model.layers.38.self_attn.q_b_proj.biases": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.gate_proj.weight": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.gate_proj.scales": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.gate_proj.biases": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.down_proj.weight": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.down_proj.scales": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.down_proj.biases": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.up_proj.weight": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.up_proj.scales": "model-00040.safetensors", + "model.layers.38.mlp.switch_mlp.up_proj.biases": "model-00040.safetensors", + "model.layers.38.self_attn.embed_q.weight": "model-00040.safetensors", + "model.layers.38.self_attn.embed_q.scales": "model-00040.safetensors", + "model.layers.38.self_attn.embed_q.biases": "model-00040.safetensors", + "model.layers.38.self_attn.unembed_out.weight": "model-00040.safetensors", + "model.layers.38.self_attn.unembed_out.scales": "model-00040.safetensors", + "model.layers.38.self_attn.unembed_out.biases": "model-00040.safetensors", + "model.layers.39.input_layernorm.weight": "model-00041.safetensors", + "model.layers.39.mlp.gate.e_score_correction_bias": "model-00041.safetensors", + "model.layers.39.mlp.gate.weight": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.down_proj.weight": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.down_proj.scales": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.down_proj.biases": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.gate_proj.weight": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.gate_proj.scales": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.gate_proj.biases": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.up_proj.weight": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.up_proj.scales": "model-00041.safetensors", + "model.layers.39.mlp.shared_experts.up_proj.biases": "model-00041.safetensors", + "model.layers.39.post_attention_layernorm.weight": "model-00041.safetensors", + "model.layers.39.self_attn.kv_a_layernorm.weight": "model-00041.safetensors", + "model.layers.39.self_attn.kv_a_proj_with_mqa.weight": "model-00041.safetensors", + "model.layers.39.self_attn.kv_a_proj_with_mqa.scales": "model-00041.safetensors", + "model.layers.39.self_attn.kv_a_proj_with_mqa.biases": "model-00041.safetensors", + "model.layers.39.self_attn.o_proj.weight": "model-00041.safetensors", + "model.layers.39.self_attn.o_proj.scales": "model-00041.safetensors", + "model.layers.39.self_attn.o_proj.biases": "model-00041.safetensors", + "model.layers.39.self_attn.q_a_layernorm.weight": "model-00041.safetensors", + "model.layers.39.self_attn.q_a_proj.weight": "model-00041.safetensors", + "model.layers.39.self_attn.q_a_proj.scales": "model-00041.safetensors", + "model.layers.39.self_attn.q_a_proj.biases": "model-00041.safetensors", + "model.layers.39.self_attn.q_b_proj.weight": "model-00041.safetensors", + "model.layers.39.self_attn.q_b_proj.scales": "model-00041.safetensors", + "model.layers.39.self_attn.q_b_proj.biases": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.gate_proj.weight": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.gate_proj.scales": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.gate_proj.biases": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.down_proj.weight": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.down_proj.scales": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.down_proj.biases": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.up_proj.weight": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.up_proj.scales": "model-00041.safetensors", + "model.layers.39.mlp.switch_mlp.up_proj.biases": "model-00041.safetensors", + "model.layers.39.self_attn.embed_q.weight": "model-00041.safetensors", + "model.layers.39.self_attn.embed_q.scales": "model-00041.safetensors", + "model.layers.39.self_attn.embed_q.biases": "model-00041.safetensors", + "model.layers.39.self_attn.unembed_out.weight": "model-00041.safetensors", + "model.layers.39.self_attn.unembed_out.scales": "model-00041.safetensors", + "model.layers.39.self_attn.unembed_out.biases": "model-00041.safetensors", + "model.layers.40.input_layernorm.weight": "model-00042.safetensors", + "model.layers.40.mlp.gate.e_score_correction_bias": "model-00042.safetensors", + "model.layers.40.mlp.gate.weight": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.down_proj.weight": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.down_proj.scales": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.down_proj.biases": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.gate_proj.weight": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.gate_proj.scales": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.gate_proj.biases": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.up_proj.weight": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.up_proj.scales": "model-00042.safetensors", + "model.layers.40.mlp.shared_experts.up_proj.biases": "model-00042.safetensors", + "model.layers.40.post_attention_layernorm.weight": "model-00042.safetensors", + "model.layers.40.self_attn.kv_a_layernorm.weight": "model-00042.safetensors", + "model.layers.40.self_attn.kv_a_proj_with_mqa.weight": "model-00042.safetensors", + "model.layers.40.self_attn.kv_a_proj_with_mqa.scales": "model-00042.safetensors", + "model.layers.40.self_attn.kv_a_proj_with_mqa.biases": "model-00042.safetensors", + "model.layers.40.self_attn.o_proj.weight": "model-00042.safetensors", + "model.layers.40.self_attn.o_proj.scales": "model-00042.safetensors", + "model.layers.40.self_attn.o_proj.biases": "model-00042.safetensors", + "model.layers.40.self_attn.q_a_layernorm.weight": "model-00042.safetensors", + "model.layers.40.self_attn.q_a_proj.weight": "model-00042.safetensors", + "model.layers.40.self_attn.q_a_proj.scales": "model-00042.safetensors", + "model.layers.40.self_attn.q_a_proj.biases": "model-00042.safetensors", + "model.layers.40.self_attn.q_b_proj.weight": "model-00042.safetensors", + "model.layers.40.self_attn.q_b_proj.scales": "model-00042.safetensors", + "model.layers.40.self_attn.q_b_proj.biases": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.gate_proj.weight": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.gate_proj.scales": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.gate_proj.biases": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.down_proj.weight": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.down_proj.scales": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.down_proj.biases": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.up_proj.weight": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.up_proj.scales": "model-00042.safetensors", + "model.layers.40.mlp.switch_mlp.up_proj.biases": "model-00042.safetensors", + "model.layers.40.self_attn.embed_q.weight": "model-00042.safetensors", + "model.layers.40.self_attn.embed_q.scales": "model-00042.safetensors", + "model.layers.40.self_attn.embed_q.biases": "model-00042.safetensors", + "model.layers.40.self_attn.unembed_out.weight": "model-00042.safetensors", + "model.layers.40.self_attn.unembed_out.scales": "model-00042.safetensors", + "model.layers.40.self_attn.unembed_out.biases": "model-00042.safetensors", + "model.layers.41.input_layernorm.weight": "model-00043.safetensors", + "model.layers.41.mlp.gate.e_score_correction_bias": "model-00043.safetensors", + "model.layers.41.mlp.gate.weight": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.down_proj.weight": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.down_proj.scales": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.down_proj.biases": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.gate_proj.weight": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.gate_proj.scales": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.gate_proj.biases": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.up_proj.weight": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.up_proj.scales": "model-00043.safetensors", + "model.layers.41.mlp.shared_experts.up_proj.biases": "model-00043.safetensors", + "model.layers.41.post_attention_layernorm.weight": "model-00043.safetensors", + "model.layers.41.self_attn.kv_a_layernorm.weight": "model-00043.safetensors", + "model.layers.41.self_attn.kv_a_proj_with_mqa.weight": "model-00043.safetensors", + "model.layers.41.self_attn.kv_a_proj_with_mqa.scales": "model-00043.safetensors", + "model.layers.41.self_attn.kv_a_proj_with_mqa.biases": "model-00043.safetensors", + "model.layers.41.self_attn.o_proj.weight": "model-00043.safetensors", + "model.layers.41.self_attn.o_proj.scales": "model-00043.safetensors", + "model.layers.41.self_attn.o_proj.biases": "model-00043.safetensors", + "model.layers.41.self_attn.q_a_layernorm.weight": "model-00043.safetensors", + "model.layers.41.self_attn.q_a_proj.weight": "model-00043.safetensors", + "model.layers.41.self_attn.q_a_proj.scales": "model-00043.safetensors", + "model.layers.41.self_attn.q_a_proj.biases": "model-00043.safetensors", + "model.layers.41.self_attn.q_b_proj.weight": "model-00043.safetensors", + "model.layers.41.self_attn.q_b_proj.scales": "model-00043.safetensors", + "model.layers.41.self_attn.q_b_proj.biases": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.gate_proj.weight": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.gate_proj.scales": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.gate_proj.biases": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.down_proj.weight": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.down_proj.scales": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.down_proj.biases": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.up_proj.weight": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.up_proj.scales": "model-00043.safetensors", + "model.layers.41.mlp.switch_mlp.up_proj.biases": "model-00043.safetensors", + "model.layers.41.self_attn.embed_q.weight": "model-00043.safetensors", + "model.layers.41.self_attn.embed_q.scales": "model-00043.safetensors", + "model.layers.41.self_attn.embed_q.biases": "model-00043.safetensors", + "model.layers.41.self_attn.unembed_out.weight": "model-00043.safetensors", + "model.layers.41.self_attn.unembed_out.scales": "model-00043.safetensors", + "model.layers.41.self_attn.unembed_out.biases": "model-00043.safetensors", + "model.layers.42.input_layernorm.weight": "model-00044.safetensors", + "model.layers.42.mlp.gate.e_score_correction_bias": "model-00044.safetensors", + "model.layers.42.mlp.gate.weight": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.down_proj.weight": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.down_proj.scales": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.down_proj.biases": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.gate_proj.weight": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.gate_proj.scales": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.gate_proj.biases": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.up_proj.weight": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.up_proj.scales": "model-00044.safetensors", + "model.layers.42.mlp.shared_experts.up_proj.biases": "model-00044.safetensors", + "model.layers.42.post_attention_layernorm.weight": "model-00044.safetensors", + "model.layers.42.self_attn.indexer.k_norm.bias": "model-00044.safetensors", + "model.layers.42.self_attn.indexer.k_norm.weight": "model-00044.safetensors", + "model.layers.42.self_attn.indexer.weights_proj.weight": "model-00044.safetensors", + "model.layers.42.self_attn.indexer.wk.weight": "model-00044.safetensors", + "model.layers.42.self_attn.indexer.wq_b.weight": "model-00044.safetensors", + "model.layers.42.self_attn.kv_a_layernorm.weight": "model-00044.safetensors", + "model.layers.42.self_attn.kv_a_proj_with_mqa.weight": "model-00044.safetensors", + "model.layers.42.self_attn.kv_a_proj_with_mqa.scales": "model-00044.safetensors", + "model.layers.42.self_attn.kv_a_proj_with_mqa.biases": "model-00044.safetensors", + "model.layers.42.self_attn.o_proj.weight": "model-00044.safetensors", + "model.layers.42.self_attn.o_proj.scales": "model-00044.safetensors", + "model.layers.42.self_attn.o_proj.biases": "model-00044.safetensors", + "model.layers.42.self_attn.q_a_layernorm.weight": "model-00044.safetensors", + "model.layers.42.self_attn.q_a_proj.weight": "model-00044.safetensors", + "model.layers.42.self_attn.q_a_proj.scales": "model-00044.safetensors", + "model.layers.42.self_attn.q_a_proj.biases": "model-00044.safetensors", + "model.layers.42.self_attn.q_b_proj.weight": "model-00044.safetensors", + "model.layers.42.self_attn.q_b_proj.scales": "model-00044.safetensors", + "model.layers.42.self_attn.q_b_proj.biases": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.gate_proj.weight": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.gate_proj.scales": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.gate_proj.biases": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.down_proj.weight": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.down_proj.scales": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.down_proj.biases": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.up_proj.weight": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.up_proj.scales": "model-00044.safetensors", + "model.layers.42.mlp.switch_mlp.up_proj.biases": "model-00044.safetensors", + "model.layers.42.self_attn.embed_q.weight": "model-00044.safetensors", + "model.layers.42.self_attn.embed_q.scales": "model-00044.safetensors", + "model.layers.42.self_attn.embed_q.biases": "model-00044.safetensors", + "model.layers.42.self_attn.unembed_out.weight": "model-00044.safetensors", + "model.layers.42.self_attn.unembed_out.scales": "model-00044.safetensors", + "model.layers.42.self_attn.unembed_out.biases": "model-00044.safetensors", + "model.layers.43.input_layernorm.weight": "model-00045.safetensors", + "model.layers.43.mlp.gate.e_score_correction_bias": "model-00045.safetensors", + "model.layers.43.mlp.gate.weight": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.down_proj.weight": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.down_proj.scales": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.down_proj.biases": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.gate_proj.weight": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.gate_proj.scales": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.gate_proj.biases": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.up_proj.weight": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.up_proj.scales": "model-00045.safetensors", + "model.layers.43.mlp.shared_experts.up_proj.biases": "model-00045.safetensors", + "model.layers.43.post_attention_layernorm.weight": "model-00045.safetensors", + "model.layers.43.self_attn.kv_a_layernorm.weight": "model-00045.safetensors", + "model.layers.43.self_attn.kv_a_proj_with_mqa.weight": "model-00045.safetensors", + "model.layers.43.self_attn.kv_a_proj_with_mqa.scales": "model-00045.safetensors", + "model.layers.43.self_attn.kv_a_proj_with_mqa.biases": "model-00045.safetensors", + "model.layers.43.self_attn.o_proj.weight": "model-00045.safetensors", + "model.layers.43.self_attn.o_proj.scales": "model-00045.safetensors", + "model.layers.43.self_attn.o_proj.biases": "model-00045.safetensors", + "model.layers.43.self_attn.q_a_layernorm.weight": "model-00045.safetensors", + "model.layers.43.self_attn.q_a_proj.weight": "model-00045.safetensors", + "model.layers.43.self_attn.q_a_proj.scales": "model-00045.safetensors", + "model.layers.43.self_attn.q_a_proj.biases": "model-00045.safetensors", + "model.layers.43.self_attn.q_b_proj.weight": "model-00045.safetensors", + "model.layers.43.self_attn.q_b_proj.scales": "model-00045.safetensors", + "model.layers.43.self_attn.q_b_proj.biases": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.gate_proj.weight": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.gate_proj.scales": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.gate_proj.biases": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.down_proj.weight": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.down_proj.scales": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.down_proj.biases": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.up_proj.weight": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.up_proj.scales": "model-00045.safetensors", + "model.layers.43.mlp.switch_mlp.up_proj.biases": "model-00045.safetensors", + "model.layers.43.self_attn.embed_q.weight": "model-00045.safetensors", + "model.layers.43.self_attn.embed_q.scales": "model-00045.safetensors", + "model.layers.43.self_attn.embed_q.biases": "model-00045.safetensors", + "model.layers.43.self_attn.unembed_out.weight": "model-00045.safetensors", + "model.layers.43.self_attn.unembed_out.scales": "model-00045.safetensors", + "model.layers.43.self_attn.unembed_out.biases": "model-00045.safetensors", + "model.layers.44.input_layernorm.weight": "model-00046.safetensors", + "model.layers.44.mlp.gate.e_score_correction_bias": "model-00046.safetensors", + "model.layers.44.mlp.gate.weight": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.down_proj.weight": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.down_proj.scales": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.down_proj.biases": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.gate_proj.weight": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.gate_proj.scales": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.gate_proj.biases": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.up_proj.weight": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.up_proj.scales": "model-00046.safetensors", + "model.layers.44.mlp.shared_experts.up_proj.biases": "model-00046.safetensors", + "model.layers.44.post_attention_layernorm.weight": "model-00046.safetensors", + "model.layers.44.self_attn.kv_a_layernorm.weight": "model-00046.safetensors", + "model.layers.44.self_attn.kv_a_proj_with_mqa.weight": "model-00046.safetensors", + "model.layers.44.self_attn.kv_a_proj_with_mqa.scales": "model-00046.safetensors", + "model.layers.44.self_attn.kv_a_proj_with_mqa.biases": "model-00046.safetensors", + "model.layers.44.self_attn.o_proj.weight": "model-00046.safetensors", + "model.layers.44.self_attn.o_proj.scales": "model-00046.safetensors", + "model.layers.44.self_attn.o_proj.biases": "model-00046.safetensors", + "model.layers.44.self_attn.q_a_layernorm.weight": "model-00046.safetensors", + "model.layers.44.self_attn.q_a_proj.weight": "model-00046.safetensors", + "model.layers.44.self_attn.q_a_proj.scales": "model-00046.safetensors", + "model.layers.44.self_attn.q_a_proj.biases": "model-00046.safetensors", + "model.layers.44.self_attn.q_b_proj.weight": "model-00046.safetensors", + "model.layers.44.self_attn.q_b_proj.scales": "model-00046.safetensors", + "model.layers.44.self_attn.q_b_proj.biases": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.gate_proj.weight": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.gate_proj.scales": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.gate_proj.biases": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.down_proj.weight": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.down_proj.scales": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.down_proj.biases": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.up_proj.weight": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.up_proj.scales": "model-00046.safetensors", + "model.layers.44.mlp.switch_mlp.up_proj.biases": "model-00046.safetensors", + "model.layers.44.self_attn.embed_q.weight": "model-00046.safetensors", + "model.layers.44.self_attn.embed_q.scales": "model-00046.safetensors", + "model.layers.44.self_attn.embed_q.biases": "model-00046.safetensors", + "model.layers.44.self_attn.unembed_out.weight": "model-00046.safetensors", + "model.layers.44.self_attn.unembed_out.scales": "model-00046.safetensors", + "model.layers.44.self_attn.unembed_out.biases": "model-00046.safetensors", + "model.layers.45.input_layernorm.weight": "model-00047.safetensors", + "model.layers.45.mlp.gate.e_score_correction_bias": "model-00047.safetensors", + "model.layers.45.mlp.gate.weight": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.down_proj.weight": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.down_proj.scales": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.down_proj.biases": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.gate_proj.weight": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.gate_proj.scales": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.gate_proj.biases": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.up_proj.weight": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.up_proj.scales": "model-00047.safetensors", + "model.layers.45.mlp.shared_experts.up_proj.biases": "model-00047.safetensors", + "model.layers.45.post_attention_layernorm.weight": "model-00047.safetensors", + "model.layers.45.self_attn.kv_a_layernorm.weight": "model-00047.safetensors", + "model.layers.45.self_attn.kv_a_proj_with_mqa.weight": "model-00047.safetensors", + "model.layers.45.self_attn.kv_a_proj_with_mqa.scales": "model-00047.safetensors", + "model.layers.45.self_attn.kv_a_proj_with_mqa.biases": "model-00047.safetensors", + "model.layers.45.self_attn.o_proj.weight": "model-00047.safetensors", + "model.layers.45.self_attn.o_proj.scales": "model-00047.safetensors", + "model.layers.45.self_attn.o_proj.biases": "model-00047.safetensors", + "model.layers.45.self_attn.q_a_layernorm.weight": "model-00047.safetensors", + "model.layers.45.self_attn.q_a_proj.weight": "model-00047.safetensors", + "model.layers.45.self_attn.q_a_proj.scales": "model-00047.safetensors", + "model.layers.45.self_attn.q_a_proj.biases": "model-00047.safetensors", + "model.layers.45.self_attn.q_b_proj.weight": "model-00047.safetensors", + "model.layers.45.self_attn.q_b_proj.scales": "model-00047.safetensors", + "model.layers.45.self_attn.q_b_proj.biases": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.gate_proj.weight": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.gate_proj.scales": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.gate_proj.biases": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.down_proj.weight": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.down_proj.scales": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.down_proj.biases": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.up_proj.weight": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.up_proj.scales": "model-00047.safetensors", + "model.layers.45.mlp.switch_mlp.up_proj.biases": "model-00047.safetensors", + "model.layers.45.self_attn.embed_q.weight": "model-00047.safetensors", + "model.layers.45.self_attn.embed_q.scales": "model-00047.safetensors", + "model.layers.45.self_attn.embed_q.biases": "model-00047.safetensors", + "model.layers.45.self_attn.unembed_out.weight": "model-00047.safetensors", + "model.layers.45.self_attn.unembed_out.scales": "model-00047.safetensors", + "model.layers.45.self_attn.unembed_out.biases": "model-00047.safetensors", + "model.layers.46.input_layernorm.weight": "model-00048.safetensors", + "model.layers.46.mlp.gate.e_score_correction_bias": "model-00048.safetensors", + "model.layers.46.mlp.gate.weight": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.down_proj.weight": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.down_proj.scales": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.down_proj.biases": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.gate_proj.weight": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.gate_proj.scales": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.gate_proj.biases": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.up_proj.weight": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.up_proj.scales": "model-00048.safetensors", + "model.layers.46.mlp.shared_experts.up_proj.biases": "model-00048.safetensors", + "model.layers.46.post_attention_layernorm.weight": "model-00048.safetensors", + "model.layers.46.self_attn.indexer.k_norm.bias": "model-00048.safetensors", + "model.layers.46.self_attn.indexer.k_norm.weight": "model-00048.safetensors", + "model.layers.46.self_attn.indexer.weights_proj.weight": "model-00048.safetensors", + "model.layers.46.self_attn.indexer.wk.weight": "model-00048.safetensors", + "model.layers.46.self_attn.indexer.wq_b.weight": "model-00048.safetensors", + "model.layers.46.self_attn.kv_a_layernorm.weight": "model-00048.safetensors", + "model.layers.46.self_attn.kv_a_proj_with_mqa.weight": "model-00048.safetensors", + "model.layers.46.self_attn.kv_a_proj_with_mqa.scales": "model-00048.safetensors", + "model.layers.46.self_attn.kv_a_proj_with_mqa.biases": "model-00048.safetensors", + "model.layers.46.self_attn.o_proj.weight": "model-00048.safetensors", + "model.layers.46.self_attn.o_proj.scales": "model-00048.safetensors", + "model.layers.46.self_attn.o_proj.biases": "model-00048.safetensors", + "model.layers.46.self_attn.q_a_layernorm.weight": "model-00048.safetensors", + "model.layers.46.self_attn.q_a_proj.weight": "model-00048.safetensors", + "model.layers.46.self_attn.q_a_proj.scales": "model-00048.safetensors", + "model.layers.46.self_attn.q_a_proj.biases": "model-00048.safetensors", + "model.layers.46.self_attn.q_b_proj.weight": "model-00048.safetensors", + "model.layers.46.self_attn.q_b_proj.scales": "model-00048.safetensors", + "model.layers.46.self_attn.q_b_proj.biases": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.gate_proj.weight": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.gate_proj.scales": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.gate_proj.biases": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.down_proj.weight": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.down_proj.scales": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.down_proj.biases": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.up_proj.weight": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.up_proj.scales": "model-00048.safetensors", + "model.layers.46.mlp.switch_mlp.up_proj.biases": "model-00048.safetensors", + "model.layers.46.self_attn.embed_q.weight": "model-00048.safetensors", + "model.layers.46.self_attn.embed_q.scales": "model-00048.safetensors", + "model.layers.46.self_attn.embed_q.biases": "model-00048.safetensors", + "model.layers.46.self_attn.unembed_out.weight": "model-00048.safetensors", + "model.layers.46.self_attn.unembed_out.scales": "model-00048.safetensors", + "model.layers.46.self_attn.unembed_out.biases": "model-00048.safetensors", + "model.layers.47.input_layernorm.weight": "model-00049.safetensors", + "model.layers.47.mlp.gate.e_score_correction_bias": "model-00049.safetensors", + "model.layers.47.mlp.gate.weight": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.down_proj.weight": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.down_proj.scales": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.down_proj.biases": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.gate_proj.weight": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.gate_proj.scales": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.gate_proj.biases": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.up_proj.weight": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.up_proj.scales": "model-00049.safetensors", + "model.layers.47.mlp.shared_experts.up_proj.biases": "model-00049.safetensors", + "model.layers.47.post_attention_layernorm.weight": "model-00049.safetensors", + "model.layers.47.self_attn.kv_a_layernorm.weight": "model-00049.safetensors", + "model.layers.47.self_attn.kv_a_proj_with_mqa.weight": "model-00049.safetensors", + "model.layers.47.self_attn.kv_a_proj_with_mqa.scales": "model-00049.safetensors", + "model.layers.47.self_attn.kv_a_proj_with_mqa.biases": "model-00049.safetensors", + "model.layers.47.self_attn.o_proj.weight": "model-00049.safetensors", + "model.layers.47.self_attn.o_proj.scales": "model-00049.safetensors", + "model.layers.47.self_attn.o_proj.biases": "model-00049.safetensors", + "model.layers.47.self_attn.q_a_layernorm.weight": "model-00049.safetensors", + "model.layers.47.self_attn.q_a_proj.weight": "model-00049.safetensors", + "model.layers.47.self_attn.q_a_proj.scales": "model-00049.safetensors", + "model.layers.47.self_attn.q_a_proj.biases": "model-00049.safetensors", + "model.layers.47.self_attn.q_b_proj.weight": "model-00049.safetensors", + "model.layers.47.self_attn.q_b_proj.scales": "model-00049.safetensors", + "model.layers.47.self_attn.q_b_proj.biases": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.gate_proj.weight": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.gate_proj.scales": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.gate_proj.biases": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.down_proj.weight": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.down_proj.scales": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.down_proj.biases": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.up_proj.weight": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.up_proj.scales": "model-00049.safetensors", + "model.layers.47.mlp.switch_mlp.up_proj.biases": "model-00049.safetensors", + "model.layers.47.self_attn.embed_q.weight": "model-00049.safetensors", + "model.layers.47.self_attn.embed_q.scales": "model-00049.safetensors", + "model.layers.47.self_attn.embed_q.biases": "model-00049.safetensors", + "model.layers.47.self_attn.unembed_out.weight": "model-00049.safetensors", + "model.layers.47.self_attn.unembed_out.scales": "model-00049.safetensors", + "model.layers.47.self_attn.unembed_out.biases": "model-00049.safetensors", + "model.layers.48.input_layernorm.weight": "model-00050.safetensors", + "model.layers.48.mlp.gate.e_score_correction_bias": "model-00050.safetensors", + "model.layers.48.mlp.gate.weight": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.down_proj.weight": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.down_proj.scales": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.down_proj.biases": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.gate_proj.weight": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.gate_proj.scales": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.gate_proj.biases": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.up_proj.weight": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.up_proj.scales": "model-00050.safetensors", + "model.layers.48.mlp.shared_experts.up_proj.biases": "model-00050.safetensors", + "model.layers.48.post_attention_layernorm.weight": "model-00050.safetensors", + "model.layers.48.self_attn.kv_a_layernorm.weight": "model-00050.safetensors", + "model.layers.48.self_attn.kv_a_proj_with_mqa.weight": "model-00050.safetensors", + "model.layers.48.self_attn.kv_a_proj_with_mqa.scales": "model-00050.safetensors", + "model.layers.48.self_attn.kv_a_proj_with_mqa.biases": "model-00050.safetensors", + "model.layers.48.self_attn.o_proj.weight": "model-00050.safetensors", + "model.layers.48.self_attn.o_proj.scales": "model-00050.safetensors", + "model.layers.48.self_attn.o_proj.biases": "model-00050.safetensors", + "model.layers.48.self_attn.q_a_layernorm.weight": "model-00050.safetensors", + "model.layers.48.self_attn.q_a_proj.weight": "model-00050.safetensors", + "model.layers.48.self_attn.q_a_proj.scales": "model-00050.safetensors", + "model.layers.48.self_attn.q_a_proj.biases": "model-00050.safetensors", + "model.layers.48.self_attn.q_b_proj.weight": "model-00050.safetensors", + "model.layers.48.self_attn.q_b_proj.scales": "model-00050.safetensors", + "model.layers.48.self_attn.q_b_proj.biases": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.gate_proj.weight": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.gate_proj.scales": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.gate_proj.biases": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.down_proj.weight": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.down_proj.scales": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.down_proj.biases": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.up_proj.weight": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.up_proj.scales": "model-00050.safetensors", + "model.layers.48.mlp.switch_mlp.up_proj.biases": "model-00050.safetensors", + "model.layers.48.self_attn.embed_q.weight": "model-00050.safetensors", + "model.layers.48.self_attn.embed_q.scales": "model-00050.safetensors", + "model.layers.48.self_attn.embed_q.biases": "model-00050.safetensors", + "model.layers.48.self_attn.unembed_out.weight": "model-00050.safetensors", + "model.layers.48.self_attn.unembed_out.scales": "model-00050.safetensors", + "model.layers.48.self_attn.unembed_out.biases": "model-00050.safetensors", + "model.layers.49.input_layernorm.weight": "model-00051.safetensors", + "model.layers.49.mlp.gate.e_score_correction_bias": "model-00051.safetensors", + "model.layers.49.mlp.gate.weight": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.down_proj.weight": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.down_proj.scales": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.down_proj.biases": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.gate_proj.weight": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.gate_proj.scales": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.gate_proj.biases": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.up_proj.weight": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.up_proj.scales": "model-00051.safetensors", + "model.layers.49.mlp.shared_experts.up_proj.biases": "model-00051.safetensors", + "model.layers.49.post_attention_layernorm.weight": "model-00051.safetensors", + "model.layers.49.self_attn.kv_a_layernorm.weight": "model-00051.safetensors", + "model.layers.49.self_attn.kv_a_proj_with_mqa.weight": "model-00051.safetensors", + "model.layers.49.self_attn.kv_a_proj_with_mqa.scales": "model-00051.safetensors", + "model.layers.49.self_attn.kv_a_proj_with_mqa.biases": "model-00051.safetensors", + "model.layers.49.self_attn.o_proj.weight": "model-00051.safetensors", + "model.layers.49.self_attn.o_proj.scales": "model-00051.safetensors", + "model.layers.49.self_attn.o_proj.biases": "model-00051.safetensors", + "model.layers.49.self_attn.q_a_layernorm.weight": "model-00051.safetensors", + "model.layers.49.self_attn.q_a_proj.weight": "model-00051.safetensors", + "model.layers.49.self_attn.q_a_proj.scales": "model-00051.safetensors", + "model.layers.49.self_attn.q_a_proj.biases": "model-00051.safetensors", + "model.layers.49.self_attn.q_b_proj.weight": "model-00051.safetensors", + "model.layers.49.self_attn.q_b_proj.scales": "model-00051.safetensors", + "model.layers.49.self_attn.q_b_proj.biases": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.gate_proj.weight": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.gate_proj.scales": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.gate_proj.biases": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.down_proj.weight": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.down_proj.scales": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.down_proj.biases": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.up_proj.weight": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.up_proj.scales": "model-00051.safetensors", + "model.layers.49.mlp.switch_mlp.up_proj.biases": "model-00051.safetensors", + "model.layers.49.self_attn.embed_q.weight": "model-00051.safetensors", + "model.layers.49.self_attn.embed_q.scales": "model-00051.safetensors", + "model.layers.49.self_attn.embed_q.biases": "model-00051.safetensors", + "model.layers.49.self_attn.unembed_out.weight": "model-00051.safetensors", + "model.layers.49.self_attn.unembed_out.scales": "model-00051.safetensors", + "model.layers.49.self_attn.unembed_out.biases": "model-00051.safetensors", + "model.layers.50.input_layernorm.weight": "model-00052.safetensors", + "model.layers.50.mlp.gate.e_score_correction_bias": "model-00052.safetensors", + "model.layers.50.mlp.gate.weight": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.down_proj.weight": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.down_proj.scales": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.down_proj.biases": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.gate_proj.weight": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.gate_proj.scales": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.gate_proj.biases": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.up_proj.weight": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.up_proj.scales": "model-00052.safetensors", + "model.layers.50.mlp.shared_experts.up_proj.biases": "model-00052.safetensors", + "model.layers.50.post_attention_layernorm.weight": "model-00052.safetensors", + "model.layers.50.self_attn.indexer.k_norm.bias": "model-00052.safetensors", + "model.layers.50.self_attn.indexer.k_norm.weight": "model-00052.safetensors", + "model.layers.50.self_attn.indexer.weights_proj.weight": "model-00052.safetensors", + "model.layers.50.self_attn.indexer.wk.weight": "model-00052.safetensors", + "model.layers.50.self_attn.indexer.wq_b.weight": "model-00052.safetensors", + "model.layers.50.self_attn.kv_a_layernorm.weight": "model-00052.safetensors", + "model.layers.50.self_attn.kv_a_proj_with_mqa.weight": "model-00052.safetensors", + "model.layers.50.self_attn.kv_a_proj_with_mqa.scales": "model-00052.safetensors", + "model.layers.50.self_attn.kv_a_proj_with_mqa.biases": "model-00052.safetensors", + "model.layers.50.self_attn.o_proj.weight": "model-00052.safetensors", + "model.layers.50.self_attn.o_proj.scales": "model-00052.safetensors", + "model.layers.50.self_attn.o_proj.biases": "model-00052.safetensors", + "model.layers.50.self_attn.q_a_layernorm.weight": "model-00052.safetensors", + "model.layers.50.self_attn.q_a_proj.weight": "model-00052.safetensors", + "model.layers.50.self_attn.q_a_proj.scales": "model-00052.safetensors", + "model.layers.50.self_attn.q_a_proj.biases": "model-00052.safetensors", + "model.layers.50.self_attn.q_b_proj.weight": "model-00052.safetensors", + "model.layers.50.self_attn.q_b_proj.scales": "model-00052.safetensors", + "model.layers.50.self_attn.q_b_proj.biases": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.gate_proj.weight": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.gate_proj.scales": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.gate_proj.biases": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.down_proj.weight": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.down_proj.scales": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.down_proj.biases": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.up_proj.weight": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.up_proj.scales": "model-00052.safetensors", + "model.layers.50.mlp.switch_mlp.up_proj.biases": "model-00052.safetensors", + "model.layers.50.self_attn.embed_q.weight": "model-00052.safetensors", + "model.layers.50.self_attn.embed_q.scales": "model-00052.safetensors", + "model.layers.50.self_attn.embed_q.biases": "model-00052.safetensors", + "model.layers.50.self_attn.unembed_out.weight": "model-00052.safetensors", + "model.layers.50.self_attn.unembed_out.scales": "model-00052.safetensors", + "model.layers.50.self_attn.unembed_out.biases": "model-00052.safetensors", + "model.layers.51.input_layernorm.weight": "model-00053.safetensors", + "model.layers.51.mlp.gate.e_score_correction_bias": "model-00053.safetensors", + "model.layers.51.mlp.gate.weight": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.down_proj.weight": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.down_proj.scales": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.down_proj.biases": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.gate_proj.weight": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.gate_proj.scales": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.gate_proj.biases": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.up_proj.weight": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.up_proj.scales": "model-00053.safetensors", + "model.layers.51.mlp.shared_experts.up_proj.biases": "model-00053.safetensors", + "model.layers.51.post_attention_layernorm.weight": "model-00053.safetensors", + "model.layers.51.self_attn.kv_a_layernorm.weight": "model-00053.safetensors", + "model.layers.51.self_attn.kv_a_proj_with_mqa.weight": "model-00053.safetensors", + "model.layers.51.self_attn.kv_a_proj_with_mqa.scales": "model-00053.safetensors", + "model.layers.51.self_attn.kv_a_proj_with_mqa.biases": "model-00053.safetensors", + "model.layers.51.self_attn.o_proj.weight": "model-00053.safetensors", + "model.layers.51.self_attn.o_proj.scales": "model-00053.safetensors", + "model.layers.51.self_attn.o_proj.biases": "model-00053.safetensors", + "model.layers.51.self_attn.q_a_layernorm.weight": "model-00053.safetensors", + "model.layers.51.self_attn.q_a_proj.weight": "model-00053.safetensors", + "model.layers.51.self_attn.q_a_proj.scales": "model-00053.safetensors", + "model.layers.51.self_attn.q_a_proj.biases": "model-00053.safetensors", + "model.layers.51.self_attn.q_b_proj.weight": "model-00053.safetensors", + "model.layers.51.self_attn.q_b_proj.scales": "model-00053.safetensors", + "model.layers.51.self_attn.q_b_proj.biases": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.gate_proj.weight": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.gate_proj.scales": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.gate_proj.biases": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.down_proj.weight": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.down_proj.scales": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.down_proj.biases": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.up_proj.weight": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.up_proj.scales": "model-00053.safetensors", + "model.layers.51.mlp.switch_mlp.up_proj.biases": "model-00053.safetensors", + "model.layers.51.self_attn.embed_q.weight": "model-00053.safetensors", + "model.layers.51.self_attn.embed_q.scales": "model-00053.safetensors", + "model.layers.51.self_attn.embed_q.biases": "model-00053.safetensors", + "model.layers.51.self_attn.unembed_out.weight": "model-00053.safetensors", + "model.layers.51.self_attn.unembed_out.scales": "model-00053.safetensors", + "model.layers.51.self_attn.unembed_out.biases": "model-00053.safetensors", + "model.layers.52.input_layernorm.weight": "model-00054.safetensors", + "model.layers.52.mlp.gate.e_score_correction_bias": "model-00054.safetensors", + "model.layers.52.mlp.gate.weight": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.down_proj.weight": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.down_proj.scales": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.down_proj.biases": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.gate_proj.weight": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.gate_proj.scales": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.gate_proj.biases": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.up_proj.weight": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.up_proj.scales": "model-00054.safetensors", + "model.layers.52.mlp.shared_experts.up_proj.biases": "model-00054.safetensors", + "model.layers.52.post_attention_layernorm.weight": "model-00054.safetensors", + "model.layers.52.self_attn.kv_a_layernorm.weight": "model-00054.safetensors", + "model.layers.52.self_attn.kv_a_proj_with_mqa.weight": "model-00054.safetensors", + "model.layers.52.self_attn.kv_a_proj_with_mqa.scales": "model-00054.safetensors", + "model.layers.52.self_attn.kv_a_proj_with_mqa.biases": "model-00054.safetensors", + "model.layers.52.self_attn.o_proj.weight": "model-00054.safetensors", + "model.layers.52.self_attn.o_proj.scales": "model-00054.safetensors", + "model.layers.52.self_attn.o_proj.biases": "model-00054.safetensors", + "model.layers.52.self_attn.q_a_layernorm.weight": "model-00054.safetensors", + "model.layers.52.self_attn.q_a_proj.weight": "model-00054.safetensors", + "model.layers.52.self_attn.q_a_proj.scales": "model-00054.safetensors", + "model.layers.52.self_attn.q_a_proj.biases": "model-00054.safetensors", + "model.layers.52.self_attn.q_b_proj.weight": "model-00054.safetensors", + "model.layers.52.self_attn.q_b_proj.scales": "model-00054.safetensors", + "model.layers.52.self_attn.q_b_proj.biases": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.gate_proj.weight": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.gate_proj.scales": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.gate_proj.biases": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.down_proj.weight": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.down_proj.scales": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.down_proj.biases": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.up_proj.weight": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.up_proj.scales": "model-00054.safetensors", + "model.layers.52.mlp.switch_mlp.up_proj.biases": "model-00054.safetensors", + "model.layers.52.self_attn.embed_q.weight": "model-00054.safetensors", + "model.layers.52.self_attn.embed_q.scales": "model-00054.safetensors", + "model.layers.52.self_attn.embed_q.biases": "model-00054.safetensors", + "model.layers.52.self_attn.unembed_out.weight": "model-00054.safetensors", + "model.layers.52.self_attn.unembed_out.scales": "model-00054.safetensors", + "model.layers.52.self_attn.unembed_out.biases": "model-00054.safetensors", + "model.layers.53.input_layernorm.weight": "model-00055.safetensors", + "model.layers.53.mlp.gate.e_score_correction_bias": "model-00055.safetensors", + "model.layers.53.mlp.gate.weight": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.down_proj.weight": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.down_proj.scales": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.down_proj.biases": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.gate_proj.weight": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.gate_proj.scales": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.gate_proj.biases": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.up_proj.weight": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.up_proj.scales": "model-00055.safetensors", + "model.layers.53.mlp.shared_experts.up_proj.biases": "model-00055.safetensors", + "model.layers.53.post_attention_layernorm.weight": "model-00055.safetensors", + "model.layers.53.self_attn.kv_a_layernorm.weight": "model-00055.safetensors", + "model.layers.53.self_attn.kv_a_proj_with_mqa.weight": "model-00055.safetensors", + "model.layers.53.self_attn.kv_a_proj_with_mqa.scales": "model-00055.safetensors", + "model.layers.53.self_attn.kv_a_proj_with_mqa.biases": "model-00055.safetensors", + "model.layers.53.self_attn.o_proj.weight": "model-00055.safetensors", + "model.layers.53.self_attn.o_proj.scales": "model-00055.safetensors", + "model.layers.53.self_attn.o_proj.biases": "model-00055.safetensors", + "model.layers.53.self_attn.q_a_layernorm.weight": "model-00055.safetensors", + "model.layers.53.self_attn.q_a_proj.weight": "model-00055.safetensors", + "model.layers.53.self_attn.q_a_proj.scales": "model-00055.safetensors", + "model.layers.53.self_attn.q_a_proj.biases": "model-00055.safetensors", + "model.layers.53.self_attn.q_b_proj.weight": "model-00055.safetensors", + "model.layers.53.self_attn.q_b_proj.scales": "model-00055.safetensors", + "model.layers.53.self_attn.q_b_proj.biases": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.gate_proj.weight": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.gate_proj.scales": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.gate_proj.biases": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.down_proj.weight": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.down_proj.scales": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.down_proj.biases": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.up_proj.weight": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.up_proj.scales": "model-00055.safetensors", + "model.layers.53.mlp.switch_mlp.up_proj.biases": "model-00055.safetensors", + "model.layers.53.self_attn.embed_q.weight": "model-00055.safetensors", + "model.layers.53.self_attn.embed_q.scales": "model-00055.safetensors", + "model.layers.53.self_attn.embed_q.biases": "model-00055.safetensors", + "model.layers.53.self_attn.unembed_out.weight": "model-00055.safetensors", + "model.layers.53.self_attn.unembed_out.scales": "model-00055.safetensors", + "model.layers.53.self_attn.unembed_out.biases": "model-00055.safetensors", + "model.layers.54.input_layernorm.weight": "model-00056.safetensors", + "model.layers.54.mlp.gate.e_score_correction_bias": "model-00056.safetensors", + "model.layers.54.mlp.gate.weight": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.down_proj.weight": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.down_proj.scales": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.down_proj.biases": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.gate_proj.weight": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.gate_proj.scales": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.gate_proj.biases": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.up_proj.weight": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.up_proj.scales": "model-00056.safetensors", + "model.layers.54.mlp.shared_experts.up_proj.biases": "model-00056.safetensors", + "model.layers.54.post_attention_layernorm.weight": "model-00056.safetensors", + "model.layers.54.self_attn.indexer.k_norm.bias": "model-00056.safetensors", + "model.layers.54.self_attn.indexer.k_norm.weight": "model-00056.safetensors", + "model.layers.54.self_attn.indexer.weights_proj.weight": "model-00056.safetensors", + "model.layers.54.self_attn.indexer.wk.weight": "model-00056.safetensors", + "model.layers.54.self_attn.indexer.wq_b.weight": "model-00056.safetensors", + "model.layers.54.self_attn.kv_a_layernorm.weight": "model-00056.safetensors", + "model.layers.54.self_attn.kv_a_proj_with_mqa.weight": "model-00056.safetensors", + "model.layers.54.self_attn.kv_a_proj_with_mqa.scales": "model-00056.safetensors", + "model.layers.54.self_attn.kv_a_proj_with_mqa.biases": "model-00056.safetensors", + "model.layers.54.self_attn.o_proj.weight": "model-00056.safetensors", + "model.layers.54.self_attn.o_proj.scales": "model-00056.safetensors", + "model.layers.54.self_attn.o_proj.biases": "model-00056.safetensors", + "model.layers.54.self_attn.q_a_layernorm.weight": "model-00056.safetensors", + "model.layers.54.self_attn.q_a_proj.weight": "model-00056.safetensors", + "model.layers.54.self_attn.q_a_proj.scales": "model-00056.safetensors", + "model.layers.54.self_attn.q_a_proj.biases": "model-00056.safetensors", + "model.layers.54.self_attn.q_b_proj.weight": "model-00056.safetensors", + "model.layers.54.self_attn.q_b_proj.scales": "model-00056.safetensors", + "model.layers.54.self_attn.q_b_proj.biases": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.gate_proj.weight": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.gate_proj.scales": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.gate_proj.biases": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.down_proj.weight": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.down_proj.scales": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.down_proj.biases": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.up_proj.weight": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.up_proj.scales": "model-00056.safetensors", + "model.layers.54.mlp.switch_mlp.up_proj.biases": "model-00056.safetensors", + "model.layers.54.self_attn.embed_q.weight": "model-00056.safetensors", + "model.layers.54.self_attn.embed_q.scales": "model-00056.safetensors", + "model.layers.54.self_attn.embed_q.biases": "model-00056.safetensors", + "model.layers.54.self_attn.unembed_out.weight": "model-00056.safetensors", + "model.layers.54.self_attn.unembed_out.scales": "model-00056.safetensors", + "model.layers.54.self_attn.unembed_out.biases": "model-00056.safetensors", + "model.layers.55.input_layernorm.weight": "model-00057.safetensors", + "model.layers.55.mlp.gate.e_score_correction_bias": "model-00057.safetensors", + "model.layers.55.mlp.gate.weight": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.down_proj.weight": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.down_proj.scales": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.down_proj.biases": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.gate_proj.weight": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.gate_proj.scales": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.gate_proj.biases": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.up_proj.weight": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.up_proj.scales": "model-00057.safetensors", + "model.layers.55.mlp.shared_experts.up_proj.biases": "model-00057.safetensors", + "model.layers.55.post_attention_layernorm.weight": "model-00057.safetensors", + "model.layers.55.self_attn.kv_a_layernorm.weight": "model-00057.safetensors", + "model.layers.55.self_attn.kv_a_proj_with_mqa.weight": "model-00057.safetensors", + "model.layers.55.self_attn.kv_a_proj_with_mqa.scales": "model-00057.safetensors", + "model.layers.55.self_attn.kv_a_proj_with_mqa.biases": "model-00057.safetensors", + "model.layers.55.self_attn.o_proj.weight": "model-00057.safetensors", + "model.layers.55.self_attn.o_proj.scales": "model-00057.safetensors", + "model.layers.55.self_attn.o_proj.biases": "model-00057.safetensors", + "model.layers.55.self_attn.q_a_layernorm.weight": "model-00057.safetensors", + "model.layers.55.self_attn.q_a_proj.weight": "model-00057.safetensors", + "model.layers.55.self_attn.q_a_proj.scales": "model-00057.safetensors", + "model.layers.55.self_attn.q_a_proj.biases": "model-00057.safetensors", + "model.layers.55.self_attn.q_b_proj.weight": "model-00057.safetensors", + "model.layers.55.self_attn.q_b_proj.scales": "model-00057.safetensors", + "model.layers.55.self_attn.q_b_proj.biases": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.gate_proj.weight": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.gate_proj.scales": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.gate_proj.biases": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.down_proj.weight": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.down_proj.scales": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.down_proj.biases": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.up_proj.weight": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.up_proj.scales": "model-00057.safetensors", + "model.layers.55.mlp.switch_mlp.up_proj.biases": "model-00057.safetensors", + "model.layers.55.self_attn.embed_q.weight": "model-00057.safetensors", + "model.layers.55.self_attn.embed_q.scales": "model-00057.safetensors", + "model.layers.55.self_attn.embed_q.biases": "model-00057.safetensors", + "model.layers.55.self_attn.unembed_out.weight": "model-00057.safetensors", + "model.layers.55.self_attn.unembed_out.scales": "model-00057.safetensors", + "model.layers.55.self_attn.unembed_out.biases": "model-00057.safetensors", + "model.layers.56.input_layernorm.weight": "model-00058.safetensors", + "model.layers.56.mlp.gate.e_score_correction_bias": "model-00058.safetensors", + "model.layers.56.mlp.gate.weight": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.down_proj.weight": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.down_proj.scales": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.down_proj.biases": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.gate_proj.weight": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.gate_proj.scales": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.gate_proj.biases": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.up_proj.weight": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.up_proj.scales": "model-00058.safetensors", + "model.layers.56.mlp.shared_experts.up_proj.biases": "model-00058.safetensors", + "model.layers.56.post_attention_layernorm.weight": "model-00058.safetensors", + "model.layers.56.self_attn.kv_a_layernorm.weight": "model-00058.safetensors", + "model.layers.56.self_attn.kv_a_proj_with_mqa.weight": "model-00058.safetensors", + "model.layers.56.self_attn.kv_a_proj_with_mqa.scales": "model-00058.safetensors", + "model.layers.56.self_attn.kv_a_proj_with_mqa.biases": "model-00058.safetensors", + "model.layers.56.self_attn.o_proj.weight": "model-00058.safetensors", + "model.layers.56.self_attn.o_proj.scales": "model-00058.safetensors", + "model.layers.56.self_attn.o_proj.biases": "model-00058.safetensors", + "model.layers.56.self_attn.q_a_layernorm.weight": "model-00058.safetensors", + "model.layers.56.self_attn.q_a_proj.weight": "model-00058.safetensors", + "model.layers.56.self_attn.q_a_proj.scales": "model-00058.safetensors", + "model.layers.56.self_attn.q_a_proj.biases": "model-00058.safetensors", + "model.layers.56.self_attn.q_b_proj.weight": "model-00058.safetensors", + "model.layers.56.self_attn.q_b_proj.scales": "model-00058.safetensors", + "model.layers.56.self_attn.q_b_proj.biases": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.gate_proj.weight": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.gate_proj.scales": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.gate_proj.biases": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.down_proj.weight": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.down_proj.scales": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.down_proj.biases": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.up_proj.weight": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.up_proj.scales": "model-00058.safetensors", + "model.layers.56.mlp.switch_mlp.up_proj.biases": "model-00058.safetensors", + "model.layers.56.self_attn.embed_q.weight": "model-00058.safetensors", + "model.layers.56.self_attn.embed_q.scales": "model-00058.safetensors", + "model.layers.56.self_attn.embed_q.biases": "model-00058.safetensors", + "model.layers.56.self_attn.unembed_out.weight": "model-00058.safetensors", + "model.layers.56.self_attn.unembed_out.scales": "model-00058.safetensors", + "model.layers.56.self_attn.unembed_out.biases": "model-00058.safetensors", + "model.layers.57.input_layernorm.weight": "model-00059.safetensors", + "model.layers.57.mlp.gate.e_score_correction_bias": "model-00059.safetensors", + "model.layers.57.mlp.gate.weight": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.down_proj.weight": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.down_proj.scales": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.down_proj.biases": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.gate_proj.weight": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.gate_proj.scales": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.gate_proj.biases": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.up_proj.weight": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.up_proj.scales": "model-00059.safetensors", + "model.layers.57.mlp.shared_experts.up_proj.biases": "model-00059.safetensors", + "model.layers.57.post_attention_layernorm.weight": "model-00059.safetensors", + "model.layers.57.self_attn.kv_a_layernorm.weight": "model-00059.safetensors", + "model.layers.57.self_attn.kv_a_proj_with_mqa.weight": "model-00059.safetensors", + "model.layers.57.self_attn.kv_a_proj_with_mqa.scales": "model-00059.safetensors", + "model.layers.57.self_attn.kv_a_proj_with_mqa.biases": "model-00059.safetensors", + "model.layers.57.self_attn.o_proj.weight": "model-00059.safetensors", + "model.layers.57.self_attn.o_proj.scales": "model-00059.safetensors", + "model.layers.57.self_attn.o_proj.biases": "model-00059.safetensors", + "model.layers.57.self_attn.q_a_layernorm.weight": "model-00059.safetensors", + "model.layers.57.self_attn.q_a_proj.weight": "model-00059.safetensors", + "model.layers.57.self_attn.q_a_proj.scales": "model-00059.safetensors", + "model.layers.57.self_attn.q_a_proj.biases": "model-00059.safetensors", + "model.layers.57.self_attn.q_b_proj.weight": "model-00059.safetensors", + "model.layers.57.self_attn.q_b_proj.scales": "model-00059.safetensors", + "model.layers.57.self_attn.q_b_proj.biases": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.gate_proj.weight": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.gate_proj.scales": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.gate_proj.biases": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.down_proj.weight": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.down_proj.scales": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.down_proj.biases": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.up_proj.weight": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.up_proj.scales": "model-00059.safetensors", + "model.layers.57.mlp.switch_mlp.up_proj.biases": "model-00059.safetensors", + "model.layers.57.self_attn.embed_q.weight": "model-00059.safetensors", + "model.layers.57.self_attn.embed_q.scales": "model-00059.safetensors", + "model.layers.57.self_attn.embed_q.biases": "model-00059.safetensors", + "model.layers.57.self_attn.unembed_out.weight": "model-00059.safetensors", + "model.layers.57.self_attn.unembed_out.scales": "model-00059.safetensors", + "model.layers.57.self_attn.unembed_out.biases": "model-00059.safetensors", + "model.layers.58.input_layernorm.weight": "model-00060.safetensors", + "model.layers.58.mlp.gate.e_score_correction_bias": "model-00060.safetensors", + "model.layers.58.mlp.gate.weight": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.down_proj.weight": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.down_proj.scales": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.down_proj.biases": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.gate_proj.weight": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.gate_proj.scales": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.gate_proj.biases": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.up_proj.weight": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.up_proj.scales": "model-00060.safetensors", + "model.layers.58.mlp.shared_experts.up_proj.biases": "model-00060.safetensors", + "model.layers.58.post_attention_layernorm.weight": "model-00060.safetensors", + "model.layers.58.self_attn.indexer.k_norm.bias": "model-00060.safetensors", + "model.layers.58.self_attn.indexer.k_norm.weight": "model-00060.safetensors", + "model.layers.58.self_attn.indexer.weights_proj.weight": "model-00060.safetensors", + "model.layers.58.self_attn.indexer.wk.weight": "model-00060.safetensors", + "model.layers.58.self_attn.indexer.wq_b.weight": "model-00060.safetensors", + "model.layers.58.self_attn.kv_a_layernorm.weight": "model-00060.safetensors", + "model.layers.58.self_attn.kv_a_proj_with_mqa.weight": "model-00060.safetensors", + "model.layers.58.self_attn.kv_a_proj_with_mqa.scales": "model-00060.safetensors", + "model.layers.58.self_attn.kv_a_proj_with_mqa.biases": "model-00060.safetensors", + "model.layers.58.self_attn.o_proj.weight": "model-00060.safetensors", + "model.layers.58.self_attn.o_proj.scales": "model-00060.safetensors", + "model.layers.58.self_attn.o_proj.biases": "model-00060.safetensors", + "model.layers.58.self_attn.q_a_layernorm.weight": "model-00060.safetensors", + "model.layers.58.self_attn.q_a_proj.weight": "model-00060.safetensors", + "model.layers.58.self_attn.q_a_proj.scales": "model-00060.safetensors", + "model.layers.58.self_attn.q_a_proj.biases": "model-00060.safetensors", + "model.layers.58.self_attn.q_b_proj.weight": "model-00060.safetensors", + "model.layers.58.self_attn.q_b_proj.scales": "model-00060.safetensors", + "model.layers.58.self_attn.q_b_proj.biases": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.gate_proj.weight": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.gate_proj.scales": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.gate_proj.biases": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.down_proj.weight": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.down_proj.scales": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.down_proj.biases": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.up_proj.weight": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.up_proj.scales": "model-00060.safetensors", + "model.layers.58.mlp.switch_mlp.up_proj.biases": "model-00060.safetensors", + "model.layers.58.self_attn.embed_q.weight": "model-00060.safetensors", + "model.layers.58.self_attn.embed_q.scales": "model-00060.safetensors", + "model.layers.58.self_attn.embed_q.biases": "model-00060.safetensors", + "model.layers.58.self_attn.unembed_out.weight": "model-00060.safetensors", + "model.layers.58.self_attn.unembed_out.scales": "model-00060.safetensors", + "model.layers.58.self_attn.unembed_out.biases": "model-00060.safetensors", + "model.layers.59.input_layernorm.weight": "model-00061.safetensors", + "model.layers.59.mlp.gate.e_score_correction_bias": "model-00061.safetensors", + "model.layers.59.mlp.gate.weight": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.down_proj.weight": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.down_proj.scales": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.down_proj.biases": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.gate_proj.weight": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.gate_proj.scales": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.gate_proj.biases": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.up_proj.weight": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.up_proj.scales": "model-00061.safetensors", + "model.layers.59.mlp.shared_experts.up_proj.biases": "model-00061.safetensors", + "model.layers.59.post_attention_layernorm.weight": "model-00061.safetensors", + "model.layers.59.self_attn.kv_a_layernorm.weight": "model-00061.safetensors", + "model.layers.59.self_attn.kv_a_proj_with_mqa.weight": "model-00061.safetensors", + "model.layers.59.self_attn.kv_a_proj_with_mqa.scales": "model-00061.safetensors", + "model.layers.59.self_attn.kv_a_proj_with_mqa.biases": "model-00061.safetensors", + "model.layers.59.self_attn.o_proj.weight": "model-00061.safetensors", + "model.layers.59.self_attn.o_proj.scales": "model-00061.safetensors", + "model.layers.59.self_attn.o_proj.biases": "model-00061.safetensors", + "model.layers.59.self_attn.q_a_layernorm.weight": "model-00061.safetensors", + "model.layers.59.self_attn.q_a_proj.weight": "model-00061.safetensors", + "model.layers.59.self_attn.q_a_proj.scales": "model-00061.safetensors", + "model.layers.59.self_attn.q_a_proj.biases": "model-00061.safetensors", + "model.layers.59.self_attn.q_b_proj.weight": "model-00061.safetensors", + "model.layers.59.self_attn.q_b_proj.scales": "model-00061.safetensors", + "model.layers.59.self_attn.q_b_proj.biases": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.gate_proj.weight": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.gate_proj.scales": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.gate_proj.biases": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.down_proj.weight": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.down_proj.scales": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.down_proj.biases": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.up_proj.weight": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.up_proj.scales": "model-00061.safetensors", + "model.layers.59.mlp.switch_mlp.up_proj.biases": "model-00061.safetensors", + "model.layers.59.self_attn.embed_q.weight": "model-00061.safetensors", + "model.layers.59.self_attn.embed_q.scales": "model-00061.safetensors", + "model.layers.59.self_attn.embed_q.biases": "model-00061.safetensors", + "model.layers.59.self_attn.unembed_out.weight": "model-00061.safetensors", + "model.layers.59.self_attn.unembed_out.scales": "model-00061.safetensors", + "model.layers.59.self_attn.unembed_out.biases": "model-00061.safetensors", + "model.layers.60.input_layernorm.weight": "model-00062.safetensors", + "model.layers.60.mlp.gate.e_score_correction_bias": "model-00062.safetensors", + "model.layers.60.mlp.gate.weight": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.down_proj.weight": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.down_proj.scales": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.down_proj.biases": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.gate_proj.weight": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.gate_proj.scales": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.gate_proj.biases": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.up_proj.weight": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.up_proj.scales": "model-00062.safetensors", + "model.layers.60.mlp.shared_experts.up_proj.biases": "model-00062.safetensors", + "model.layers.60.post_attention_layernorm.weight": "model-00062.safetensors", + "model.layers.60.self_attn.kv_a_layernorm.weight": "model-00062.safetensors", + "model.layers.60.self_attn.kv_a_proj_with_mqa.weight": "model-00062.safetensors", + "model.layers.60.self_attn.kv_a_proj_with_mqa.scales": "model-00062.safetensors", + "model.layers.60.self_attn.kv_a_proj_with_mqa.biases": "model-00062.safetensors", + "model.layers.60.self_attn.o_proj.weight": "model-00062.safetensors", + "model.layers.60.self_attn.o_proj.scales": "model-00062.safetensors", + "model.layers.60.self_attn.o_proj.biases": "model-00062.safetensors", + "model.layers.60.self_attn.q_a_layernorm.weight": "model-00062.safetensors", + "model.layers.60.self_attn.q_a_proj.weight": "model-00062.safetensors", + "model.layers.60.self_attn.q_a_proj.scales": "model-00062.safetensors", + "model.layers.60.self_attn.q_a_proj.biases": "model-00062.safetensors", + "model.layers.60.self_attn.q_b_proj.weight": "model-00062.safetensors", + "model.layers.60.self_attn.q_b_proj.scales": "model-00062.safetensors", + "model.layers.60.self_attn.q_b_proj.biases": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.gate_proj.weight": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.gate_proj.scales": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.gate_proj.biases": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.down_proj.weight": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.down_proj.scales": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.down_proj.biases": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.up_proj.weight": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.up_proj.scales": "model-00062.safetensors", + "model.layers.60.mlp.switch_mlp.up_proj.biases": "model-00062.safetensors", + "model.layers.60.self_attn.embed_q.weight": "model-00062.safetensors", + "model.layers.60.self_attn.embed_q.scales": "model-00062.safetensors", + "model.layers.60.self_attn.embed_q.biases": "model-00062.safetensors", + "model.layers.60.self_attn.unembed_out.weight": "model-00062.safetensors", + "model.layers.60.self_attn.unembed_out.scales": "model-00062.safetensors", + "model.layers.60.self_attn.unembed_out.biases": "model-00062.safetensors", + "model.layers.61.input_layernorm.weight": "model-00063.safetensors", + "model.layers.61.mlp.gate.e_score_correction_bias": "model-00063.safetensors", + "model.layers.61.mlp.gate.weight": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.down_proj.weight": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.down_proj.scales": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.down_proj.biases": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.gate_proj.weight": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.gate_proj.scales": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.gate_proj.biases": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.up_proj.weight": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.up_proj.scales": "model-00063.safetensors", + "model.layers.61.mlp.shared_experts.up_proj.biases": "model-00063.safetensors", + "model.layers.61.post_attention_layernorm.weight": "model-00063.safetensors", + "model.layers.61.self_attn.kv_a_layernorm.weight": "model-00063.safetensors", + "model.layers.61.self_attn.kv_a_proj_with_mqa.weight": "model-00063.safetensors", + "model.layers.61.self_attn.kv_a_proj_with_mqa.scales": "model-00063.safetensors", + "model.layers.61.self_attn.kv_a_proj_with_mqa.biases": "model-00063.safetensors", + "model.layers.61.self_attn.o_proj.weight": "model-00063.safetensors", + "model.layers.61.self_attn.o_proj.scales": "model-00063.safetensors", + "model.layers.61.self_attn.o_proj.biases": "model-00063.safetensors", + "model.layers.61.self_attn.q_a_layernorm.weight": "model-00063.safetensors", + "model.layers.61.self_attn.q_a_proj.weight": "model-00063.safetensors", + "model.layers.61.self_attn.q_a_proj.scales": "model-00063.safetensors", + "model.layers.61.self_attn.q_a_proj.biases": "model-00063.safetensors", + "model.layers.61.self_attn.q_b_proj.weight": "model-00063.safetensors", + "model.layers.61.self_attn.q_b_proj.scales": "model-00063.safetensors", + "model.layers.61.self_attn.q_b_proj.biases": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.gate_proj.weight": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.gate_proj.scales": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.gate_proj.biases": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.down_proj.weight": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.down_proj.scales": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.down_proj.biases": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.up_proj.weight": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.up_proj.scales": "model-00063.safetensors", + "model.layers.61.mlp.switch_mlp.up_proj.biases": "model-00063.safetensors", + "model.layers.61.self_attn.embed_q.weight": "model-00063.safetensors", + "model.layers.61.self_attn.embed_q.scales": "model-00063.safetensors", + "model.layers.61.self_attn.embed_q.biases": "model-00063.safetensors", + "model.layers.61.self_attn.unembed_out.weight": "model-00063.safetensors", + "model.layers.61.self_attn.unembed_out.scales": "model-00063.safetensors", + "model.layers.61.self_attn.unembed_out.biases": "model-00063.safetensors", + "model.layers.62.input_layernorm.weight": "model-00064.safetensors", + "model.layers.62.mlp.gate.e_score_correction_bias": "model-00064.safetensors", + "model.layers.62.mlp.gate.weight": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.down_proj.weight": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.down_proj.scales": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.down_proj.biases": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.gate_proj.weight": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.gate_proj.scales": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.gate_proj.biases": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.up_proj.weight": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.up_proj.scales": "model-00064.safetensors", + "model.layers.62.mlp.shared_experts.up_proj.biases": "model-00064.safetensors", + "model.layers.62.post_attention_layernorm.weight": "model-00064.safetensors", + "model.layers.62.self_attn.indexer.k_norm.bias": "model-00064.safetensors", + "model.layers.62.self_attn.indexer.k_norm.weight": "model-00064.safetensors", + "model.layers.62.self_attn.indexer.weights_proj.weight": "model-00064.safetensors", + "model.layers.62.self_attn.indexer.wk.weight": "model-00064.safetensors", + "model.layers.62.self_attn.indexer.wq_b.weight": "model-00064.safetensors", + "model.layers.62.self_attn.kv_a_layernorm.weight": "model-00064.safetensors", + "model.layers.62.self_attn.kv_a_proj_with_mqa.weight": "model-00064.safetensors", + "model.layers.62.self_attn.kv_a_proj_with_mqa.scales": "model-00064.safetensors", + "model.layers.62.self_attn.kv_a_proj_with_mqa.biases": "model-00064.safetensors", + "model.layers.62.self_attn.o_proj.weight": "model-00064.safetensors", + "model.layers.62.self_attn.o_proj.scales": "model-00064.safetensors", + "model.layers.62.self_attn.o_proj.biases": "model-00064.safetensors", + "model.layers.62.self_attn.q_a_layernorm.weight": "model-00064.safetensors", + "model.layers.62.self_attn.q_a_proj.weight": "model-00064.safetensors", + "model.layers.62.self_attn.q_a_proj.scales": "model-00064.safetensors", + "model.layers.62.self_attn.q_a_proj.biases": "model-00064.safetensors", + "model.layers.62.self_attn.q_b_proj.weight": "model-00064.safetensors", + "model.layers.62.self_attn.q_b_proj.scales": "model-00064.safetensors", + "model.layers.62.self_attn.q_b_proj.biases": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.gate_proj.weight": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.gate_proj.scales": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.gate_proj.biases": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.down_proj.weight": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.down_proj.scales": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.down_proj.biases": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.up_proj.weight": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.up_proj.scales": "model-00064.safetensors", + "model.layers.62.mlp.switch_mlp.up_proj.biases": "model-00064.safetensors", + "model.layers.62.self_attn.embed_q.weight": "model-00064.safetensors", + "model.layers.62.self_attn.embed_q.scales": "model-00064.safetensors", + "model.layers.62.self_attn.embed_q.biases": "model-00064.safetensors", + "model.layers.62.self_attn.unembed_out.weight": "model-00064.safetensors", + "model.layers.62.self_attn.unembed_out.scales": "model-00064.safetensors", + "model.layers.62.self_attn.unembed_out.biases": "model-00064.safetensors", + "model.layers.63.input_layernorm.weight": "model-00065.safetensors", + "model.layers.63.mlp.gate.e_score_correction_bias": "model-00065.safetensors", + "model.layers.63.mlp.gate.weight": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.down_proj.weight": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.down_proj.scales": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.down_proj.biases": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.gate_proj.weight": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.gate_proj.scales": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.gate_proj.biases": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.up_proj.weight": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.up_proj.scales": "model-00065.safetensors", + "model.layers.63.mlp.shared_experts.up_proj.biases": "model-00065.safetensors", + "model.layers.63.post_attention_layernorm.weight": "model-00065.safetensors", + "model.layers.63.self_attn.kv_a_layernorm.weight": "model-00065.safetensors", + "model.layers.63.self_attn.kv_a_proj_with_mqa.weight": "model-00065.safetensors", + "model.layers.63.self_attn.kv_a_proj_with_mqa.scales": "model-00065.safetensors", + "model.layers.63.self_attn.kv_a_proj_with_mqa.biases": "model-00065.safetensors", + "model.layers.63.self_attn.o_proj.weight": "model-00065.safetensors", + "model.layers.63.self_attn.o_proj.scales": "model-00065.safetensors", + "model.layers.63.self_attn.o_proj.biases": "model-00065.safetensors", + "model.layers.63.self_attn.q_a_layernorm.weight": "model-00065.safetensors", + "model.layers.63.self_attn.q_a_proj.weight": "model-00065.safetensors", + "model.layers.63.self_attn.q_a_proj.scales": "model-00065.safetensors", + "model.layers.63.self_attn.q_a_proj.biases": "model-00065.safetensors", + "model.layers.63.self_attn.q_b_proj.weight": "model-00065.safetensors", + "model.layers.63.self_attn.q_b_proj.scales": "model-00065.safetensors", + "model.layers.63.self_attn.q_b_proj.biases": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.gate_proj.weight": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.gate_proj.scales": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.gate_proj.biases": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.down_proj.weight": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.down_proj.scales": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.down_proj.biases": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.up_proj.weight": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.up_proj.scales": "model-00065.safetensors", + "model.layers.63.mlp.switch_mlp.up_proj.biases": "model-00065.safetensors", + "model.layers.63.self_attn.embed_q.weight": "model-00065.safetensors", + "model.layers.63.self_attn.embed_q.scales": "model-00065.safetensors", + "model.layers.63.self_attn.embed_q.biases": "model-00065.safetensors", + "model.layers.63.self_attn.unembed_out.weight": "model-00065.safetensors", + "model.layers.63.self_attn.unembed_out.scales": "model-00065.safetensors", + "model.layers.63.self_attn.unembed_out.biases": "model-00065.safetensors", + "model.layers.64.input_layernorm.weight": "model-00066.safetensors", + "model.layers.64.mlp.gate.e_score_correction_bias": "model-00066.safetensors", + "model.layers.64.mlp.gate.weight": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.down_proj.weight": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.down_proj.scales": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.down_proj.biases": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.gate_proj.weight": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.gate_proj.scales": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.gate_proj.biases": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.up_proj.weight": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.up_proj.scales": "model-00066.safetensors", + "model.layers.64.mlp.shared_experts.up_proj.biases": "model-00066.safetensors", + "model.layers.64.post_attention_layernorm.weight": "model-00066.safetensors", + "model.layers.64.self_attn.kv_a_layernorm.weight": "model-00066.safetensors", + "model.layers.64.self_attn.kv_a_proj_with_mqa.weight": "model-00066.safetensors", + "model.layers.64.self_attn.kv_a_proj_with_mqa.scales": "model-00066.safetensors", + "model.layers.64.self_attn.kv_a_proj_with_mqa.biases": "model-00066.safetensors", + "model.layers.64.self_attn.o_proj.weight": "model-00066.safetensors", + "model.layers.64.self_attn.o_proj.scales": "model-00066.safetensors", + "model.layers.64.self_attn.o_proj.biases": "model-00066.safetensors", + "model.layers.64.self_attn.q_a_layernorm.weight": "model-00066.safetensors", + "model.layers.64.self_attn.q_a_proj.weight": "model-00066.safetensors", + "model.layers.64.self_attn.q_a_proj.scales": "model-00066.safetensors", + "model.layers.64.self_attn.q_a_proj.biases": "model-00066.safetensors", + "model.layers.64.self_attn.q_b_proj.weight": "model-00066.safetensors", + "model.layers.64.self_attn.q_b_proj.scales": "model-00066.safetensors", + "model.layers.64.self_attn.q_b_proj.biases": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.gate_proj.weight": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.gate_proj.scales": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.gate_proj.biases": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.down_proj.weight": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.down_proj.scales": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.down_proj.biases": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.up_proj.weight": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.up_proj.scales": "model-00066.safetensors", + "model.layers.64.mlp.switch_mlp.up_proj.biases": "model-00066.safetensors", + "model.layers.64.self_attn.embed_q.weight": "model-00066.safetensors", + "model.layers.64.self_attn.embed_q.scales": "model-00066.safetensors", + "model.layers.64.self_attn.embed_q.biases": "model-00066.safetensors", + "model.layers.64.self_attn.unembed_out.weight": "model-00066.safetensors", + "model.layers.64.self_attn.unembed_out.scales": "model-00066.safetensors", + "model.layers.64.self_attn.unembed_out.biases": "model-00066.safetensors", + "model.layers.65.input_layernorm.weight": "model-00067.safetensors", + "model.layers.65.mlp.gate.e_score_correction_bias": "model-00067.safetensors", + "model.layers.65.mlp.gate.weight": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.down_proj.weight": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.down_proj.scales": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.down_proj.biases": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.gate_proj.weight": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.gate_proj.scales": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.gate_proj.biases": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.up_proj.weight": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.up_proj.scales": "model-00067.safetensors", + "model.layers.65.mlp.shared_experts.up_proj.biases": "model-00067.safetensors", + "model.layers.65.post_attention_layernorm.weight": "model-00067.safetensors", + "model.layers.65.self_attn.kv_a_layernorm.weight": "model-00067.safetensors", + "model.layers.65.self_attn.kv_a_proj_with_mqa.weight": "model-00067.safetensors", + "model.layers.65.self_attn.kv_a_proj_with_mqa.scales": "model-00067.safetensors", + "model.layers.65.self_attn.kv_a_proj_with_mqa.biases": "model-00067.safetensors", + "model.layers.65.self_attn.o_proj.weight": "model-00067.safetensors", + "model.layers.65.self_attn.o_proj.scales": "model-00067.safetensors", + "model.layers.65.self_attn.o_proj.biases": "model-00067.safetensors", + "model.layers.65.self_attn.q_a_layernorm.weight": "model-00067.safetensors", + "model.layers.65.self_attn.q_a_proj.weight": "model-00067.safetensors", + "model.layers.65.self_attn.q_a_proj.scales": "model-00067.safetensors", + "model.layers.65.self_attn.q_a_proj.biases": "model-00067.safetensors", + "model.layers.65.self_attn.q_b_proj.weight": "model-00067.safetensors", + "model.layers.65.self_attn.q_b_proj.scales": "model-00067.safetensors", + "model.layers.65.self_attn.q_b_proj.biases": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.gate_proj.weight": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.gate_proj.scales": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.gate_proj.biases": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.down_proj.weight": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.down_proj.scales": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.down_proj.biases": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.up_proj.weight": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.up_proj.scales": "model-00067.safetensors", + "model.layers.65.mlp.switch_mlp.up_proj.biases": "model-00067.safetensors", + "model.layers.65.self_attn.embed_q.weight": "model-00067.safetensors", + "model.layers.65.self_attn.embed_q.scales": "model-00067.safetensors", + "model.layers.65.self_attn.embed_q.biases": "model-00067.safetensors", + "model.layers.65.self_attn.unembed_out.weight": "model-00067.safetensors", + "model.layers.65.self_attn.unembed_out.scales": "model-00067.safetensors", + "model.layers.65.self_attn.unembed_out.biases": "model-00067.safetensors", + "model.layers.66.input_layernorm.weight": "model-00068.safetensors", + "model.layers.66.mlp.gate.e_score_correction_bias": "model-00068.safetensors", + "model.layers.66.mlp.gate.weight": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.down_proj.weight": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.down_proj.scales": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.down_proj.biases": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.gate_proj.weight": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.gate_proj.scales": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.gate_proj.biases": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.up_proj.weight": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.up_proj.scales": "model-00068.safetensors", + "model.layers.66.mlp.shared_experts.up_proj.biases": "model-00068.safetensors", + "model.layers.66.post_attention_layernorm.weight": "model-00068.safetensors", + "model.layers.66.self_attn.indexer.k_norm.bias": "model-00068.safetensors", + "model.layers.66.self_attn.indexer.k_norm.weight": "model-00068.safetensors", + "model.layers.66.self_attn.indexer.weights_proj.weight": "model-00068.safetensors", + "model.layers.66.self_attn.indexer.wk.weight": "model-00068.safetensors", + "model.layers.66.self_attn.indexer.wq_b.weight": "model-00068.safetensors", + "model.layers.66.self_attn.kv_a_layernorm.weight": "model-00068.safetensors", + "model.layers.66.self_attn.kv_a_proj_with_mqa.weight": "model-00068.safetensors", + "model.layers.66.self_attn.kv_a_proj_with_mqa.scales": "model-00068.safetensors", + "model.layers.66.self_attn.kv_a_proj_with_mqa.biases": "model-00068.safetensors", + "model.layers.66.self_attn.o_proj.weight": "model-00068.safetensors", + "model.layers.66.self_attn.o_proj.scales": "model-00068.safetensors", + "model.layers.66.self_attn.o_proj.biases": "model-00068.safetensors", + "model.layers.66.self_attn.q_a_layernorm.weight": "model-00068.safetensors", + "model.layers.66.self_attn.q_a_proj.weight": "model-00068.safetensors", + "model.layers.66.self_attn.q_a_proj.scales": "model-00068.safetensors", + "model.layers.66.self_attn.q_a_proj.biases": "model-00068.safetensors", + "model.layers.66.self_attn.q_b_proj.weight": "model-00068.safetensors", + "model.layers.66.self_attn.q_b_proj.scales": "model-00068.safetensors", + "model.layers.66.self_attn.q_b_proj.biases": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.gate_proj.weight": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.gate_proj.scales": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.gate_proj.biases": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.down_proj.weight": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.down_proj.scales": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.down_proj.biases": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.up_proj.weight": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.up_proj.scales": "model-00068.safetensors", + "model.layers.66.mlp.switch_mlp.up_proj.biases": "model-00068.safetensors", + "model.layers.66.self_attn.embed_q.weight": "model-00068.safetensors", + "model.layers.66.self_attn.embed_q.scales": "model-00068.safetensors", + "model.layers.66.self_attn.embed_q.biases": "model-00068.safetensors", + "model.layers.66.self_attn.unembed_out.weight": "model-00068.safetensors", + "model.layers.66.self_attn.unembed_out.scales": "model-00068.safetensors", + "model.layers.66.self_attn.unembed_out.biases": "model-00068.safetensors", + "model.layers.67.input_layernorm.weight": "model-00069.safetensors", + "model.layers.67.mlp.gate.e_score_correction_bias": "model-00069.safetensors", + "model.layers.67.mlp.gate.weight": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.down_proj.weight": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.down_proj.scales": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.down_proj.biases": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.gate_proj.weight": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.gate_proj.scales": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.gate_proj.biases": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.up_proj.weight": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.up_proj.scales": "model-00069.safetensors", + "model.layers.67.mlp.shared_experts.up_proj.biases": "model-00069.safetensors", + "model.layers.67.post_attention_layernorm.weight": "model-00069.safetensors", + "model.layers.67.self_attn.kv_a_layernorm.weight": "model-00069.safetensors", + "model.layers.67.self_attn.kv_a_proj_with_mqa.weight": "model-00069.safetensors", + "model.layers.67.self_attn.kv_a_proj_with_mqa.scales": "model-00069.safetensors", + "model.layers.67.self_attn.kv_a_proj_with_mqa.biases": "model-00069.safetensors", + "model.layers.67.self_attn.o_proj.weight": "model-00069.safetensors", + "model.layers.67.self_attn.o_proj.scales": "model-00069.safetensors", + "model.layers.67.self_attn.o_proj.biases": "model-00069.safetensors", + "model.layers.67.self_attn.q_a_layernorm.weight": "model-00069.safetensors", + "model.layers.67.self_attn.q_a_proj.weight": "model-00069.safetensors", + "model.layers.67.self_attn.q_a_proj.scales": "model-00069.safetensors", + "model.layers.67.self_attn.q_a_proj.biases": "model-00069.safetensors", + "model.layers.67.self_attn.q_b_proj.weight": "model-00069.safetensors", + "model.layers.67.self_attn.q_b_proj.scales": "model-00069.safetensors", + "model.layers.67.self_attn.q_b_proj.biases": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.gate_proj.weight": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.gate_proj.scales": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.gate_proj.biases": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.down_proj.weight": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.down_proj.scales": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.down_proj.biases": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.up_proj.weight": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.up_proj.scales": "model-00069.safetensors", + "model.layers.67.mlp.switch_mlp.up_proj.biases": "model-00069.safetensors", + "model.layers.67.self_attn.embed_q.weight": "model-00069.safetensors", + "model.layers.67.self_attn.embed_q.scales": "model-00069.safetensors", + "model.layers.67.self_attn.embed_q.biases": "model-00069.safetensors", + "model.layers.67.self_attn.unembed_out.weight": "model-00069.safetensors", + "model.layers.67.self_attn.unembed_out.scales": "model-00069.safetensors", + "model.layers.67.self_attn.unembed_out.biases": "model-00069.safetensors", + "model.layers.68.input_layernorm.weight": "model-00070.safetensors", + "model.layers.68.mlp.gate.e_score_correction_bias": "model-00070.safetensors", + "model.layers.68.mlp.gate.weight": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.down_proj.weight": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.down_proj.scales": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.down_proj.biases": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.gate_proj.weight": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.gate_proj.scales": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.gate_proj.biases": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.up_proj.weight": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.up_proj.scales": "model-00070.safetensors", + "model.layers.68.mlp.shared_experts.up_proj.biases": "model-00070.safetensors", + "model.layers.68.post_attention_layernorm.weight": "model-00070.safetensors", + "model.layers.68.self_attn.kv_a_layernorm.weight": "model-00070.safetensors", + "model.layers.68.self_attn.kv_a_proj_with_mqa.weight": "model-00070.safetensors", + "model.layers.68.self_attn.kv_a_proj_with_mqa.scales": "model-00070.safetensors", + "model.layers.68.self_attn.kv_a_proj_with_mqa.biases": "model-00070.safetensors", + "model.layers.68.self_attn.o_proj.weight": "model-00070.safetensors", + "model.layers.68.self_attn.o_proj.scales": "model-00070.safetensors", + "model.layers.68.self_attn.o_proj.biases": "model-00070.safetensors", + "model.layers.68.self_attn.q_a_layernorm.weight": "model-00070.safetensors", + "model.layers.68.self_attn.q_a_proj.weight": "model-00070.safetensors", + "model.layers.68.self_attn.q_a_proj.scales": "model-00070.safetensors", + "model.layers.68.self_attn.q_a_proj.biases": "model-00070.safetensors", + "model.layers.68.self_attn.q_b_proj.weight": "model-00070.safetensors", + "model.layers.68.self_attn.q_b_proj.scales": "model-00070.safetensors", + "model.layers.68.self_attn.q_b_proj.biases": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.gate_proj.weight": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.gate_proj.scales": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.gate_proj.biases": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.down_proj.weight": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.down_proj.scales": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.down_proj.biases": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.up_proj.weight": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.up_proj.scales": "model-00070.safetensors", + "model.layers.68.mlp.switch_mlp.up_proj.biases": "model-00070.safetensors", + "model.layers.68.self_attn.embed_q.weight": "model-00070.safetensors", + "model.layers.68.self_attn.embed_q.scales": "model-00070.safetensors", + "model.layers.68.self_attn.embed_q.biases": "model-00070.safetensors", + "model.layers.68.self_attn.unembed_out.weight": "model-00070.safetensors", + "model.layers.68.self_attn.unembed_out.scales": "model-00070.safetensors", + "model.layers.68.self_attn.unembed_out.biases": "model-00070.safetensors", + "model.layers.69.input_layernorm.weight": "model-00071.safetensors", + "model.layers.69.mlp.gate.e_score_correction_bias": "model-00071.safetensors", + "model.layers.69.mlp.gate.weight": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.down_proj.weight": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.down_proj.scales": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.down_proj.biases": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.gate_proj.weight": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.gate_proj.scales": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.gate_proj.biases": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.up_proj.weight": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.up_proj.scales": "model-00071.safetensors", + "model.layers.69.mlp.shared_experts.up_proj.biases": "model-00071.safetensors", + "model.layers.69.post_attention_layernorm.weight": "model-00071.safetensors", + "model.layers.69.self_attn.kv_a_layernorm.weight": "model-00071.safetensors", + "model.layers.69.self_attn.kv_a_proj_with_mqa.weight": "model-00071.safetensors", + "model.layers.69.self_attn.kv_a_proj_with_mqa.scales": "model-00071.safetensors", + "model.layers.69.self_attn.kv_a_proj_with_mqa.biases": "model-00071.safetensors", + "model.layers.69.self_attn.o_proj.weight": "model-00071.safetensors", + "model.layers.69.self_attn.o_proj.scales": "model-00071.safetensors", + "model.layers.69.self_attn.o_proj.biases": "model-00071.safetensors", + "model.layers.69.self_attn.q_a_layernorm.weight": "model-00071.safetensors", + "model.layers.69.self_attn.q_a_proj.weight": "model-00071.safetensors", + "model.layers.69.self_attn.q_a_proj.scales": "model-00071.safetensors", + "model.layers.69.self_attn.q_a_proj.biases": "model-00071.safetensors", + "model.layers.69.self_attn.q_b_proj.weight": "model-00071.safetensors", + "model.layers.69.self_attn.q_b_proj.scales": "model-00071.safetensors", + "model.layers.69.self_attn.q_b_proj.biases": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.gate_proj.weight": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.gate_proj.scales": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.gate_proj.biases": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.down_proj.weight": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.down_proj.scales": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.down_proj.biases": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.up_proj.weight": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.up_proj.scales": "model-00071.safetensors", + "model.layers.69.mlp.switch_mlp.up_proj.biases": "model-00071.safetensors", + "model.layers.69.self_attn.embed_q.weight": "model-00071.safetensors", + "model.layers.69.self_attn.embed_q.scales": "model-00071.safetensors", + "model.layers.69.self_attn.embed_q.biases": "model-00071.safetensors", + "model.layers.69.self_attn.unembed_out.weight": "model-00071.safetensors", + "model.layers.69.self_attn.unembed_out.scales": "model-00071.safetensors", + "model.layers.69.self_attn.unembed_out.biases": "model-00071.safetensors", + "model.layers.70.input_layernorm.weight": "model-00072.safetensors", + "model.layers.70.mlp.gate.e_score_correction_bias": "model-00072.safetensors", + "model.layers.70.mlp.gate.weight": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.down_proj.weight": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.down_proj.scales": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.down_proj.biases": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.gate_proj.weight": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.gate_proj.scales": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.gate_proj.biases": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.up_proj.weight": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.up_proj.scales": "model-00072.safetensors", + "model.layers.70.mlp.shared_experts.up_proj.biases": "model-00072.safetensors", + "model.layers.70.post_attention_layernorm.weight": "model-00072.safetensors", + "model.layers.70.self_attn.indexer.k_norm.bias": "model-00072.safetensors", + "model.layers.70.self_attn.indexer.k_norm.weight": "model-00072.safetensors", + "model.layers.70.self_attn.indexer.weights_proj.weight": "model-00072.safetensors", + "model.layers.70.self_attn.indexer.wk.weight": "model-00072.safetensors", + "model.layers.70.self_attn.indexer.wq_b.weight": "model-00072.safetensors", + "model.layers.70.self_attn.kv_a_layernorm.weight": "model-00072.safetensors", + "model.layers.70.self_attn.kv_a_proj_with_mqa.weight": "model-00072.safetensors", + "model.layers.70.self_attn.kv_a_proj_with_mqa.scales": "model-00072.safetensors", + "model.layers.70.self_attn.kv_a_proj_with_mqa.biases": "model-00072.safetensors", + "model.layers.70.self_attn.o_proj.weight": "model-00072.safetensors", + "model.layers.70.self_attn.o_proj.scales": "model-00072.safetensors", + "model.layers.70.self_attn.o_proj.biases": "model-00072.safetensors", + "model.layers.70.self_attn.q_a_layernorm.weight": "model-00072.safetensors", + "model.layers.70.self_attn.q_a_proj.weight": "model-00072.safetensors", + "model.layers.70.self_attn.q_a_proj.scales": "model-00072.safetensors", + "model.layers.70.self_attn.q_a_proj.biases": "model-00072.safetensors", + "model.layers.70.self_attn.q_b_proj.weight": "model-00072.safetensors", + "model.layers.70.self_attn.q_b_proj.scales": "model-00072.safetensors", + "model.layers.70.self_attn.q_b_proj.biases": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.gate_proj.weight": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.gate_proj.scales": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.gate_proj.biases": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.down_proj.weight": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.down_proj.scales": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.down_proj.biases": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.up_proj.weight": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.up_proj.scales": "model-00072.safetensors", + "model.layers.70.mlp.switch_mlp.up_proj.biases": "model-00072.safetensors", + "model.layers.70.self_attn.embed_q.weight": "model-00072.safetensors", + "model.layers.70.self_attn.embed_q.scales": "model-00072.safetensors", + "model.layers.70.self_attn.embed_q.biases": "model-00072.safetensors", + "model.layers.70.self_attn.unembed_out.weight": "model-00072.safetensors", + "model.layers.70.self_attn.unembed_out.scales": "model-00072.safetensors", + "model.layers.70.self_attn.unembed_out.biases": "model-00072.safetensors", + "model.layers.71.input_layernorm.weight": "model-00073.safetensors", + "model.layers.71.mlp.gate.e_score_correction_bias": "model-00073.safetensors", + "model.layers.71.mlp.gate.weight": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.down_proj.weight": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.down_proj.scales": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.down_proj.biases": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.gate_proj.weight": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.gate_proj.scales": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.gate_proj.biases": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.up_proj.weight": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.up_proj.scales": "model-00073.safetensors", + "model.layers.71.mlp.shared_experts.up_proj.biases": "model-00073.safetensors", + "model.layers.71.post_attention_layernorm.weight": "model-00073.safetensors", + "model.layers.71.self_attn.kv_a_layernorm.weight": "model-00073.safetensors", + "model.layers.71.self_attn.kv_a_proj_with_mqa.weight": "model-00073.safetensors", + "model.layers.71.self_attn.kv_a_proj_with_mqa.scales": "model-00073.safetensors", + "model.layers.71.self_attn.kv_a_proj_with_mqa.biases": "model-00073.safetensors", + "model.layers.71.self_attn.o_proj.weight": "model-00073.safetensors", + "model.layers.71.self_attn.o_proj.scales": "model-00073.safetensors", + "model.layers.71.self_attn.o_proj.biases": "model-00073.safetensors", + "model.layers.71.self_attn.q_a_layernorm.weight": "model-00073.safetensors", + "model.layers.71.self_attn.q_a_proj.weight": "model-00073.safetensors", + "model.layers.71.self_attn.q_a_proj.scales": "model-00073.safetensors", + "model.layers.71.self_attn.q_a_proj.biases": "model-00073.safetensors", + "model.layers.71.self_attn.q_b_proj.weight": "model-00073.safetensors", + "model.layers.71.self_attn.q_b_proj.scales": "model-00073.safetensors", + "model.layers.71.self_attn.q_b_proj.biases": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.gate_proj.weight": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.gate_proj.scales": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.gate_proj.biases": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.down_proj.weight": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.down_proj.scales": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.down_proj.biases": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.up_proj.weight": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.up_proj.scales": "model-00073.safetensors", + "model.layers.71.mlp.switch_mlp.up_proj.biases": "model-00073.safetensors", + "model.layers.71.self_attn.embed_q.weight": "model-00073.safetensors", + "model.layers.71.self_attn.embed_q.scales": "model-00073.safetensors", + "model.layers.71.self_attn.embed_q.biases": "model-00073.safetensors", + "model.layers.71.self_attn.unembed_out.weight": "model-00073.safetensors", + "model.layers.71.self_attn.unembed_out.scales": "model-00073.safetensors", + "model.layers.71.self_attn.unembed_out.biases": "model-00073.safetensors", + "model.layers.72.input_layernorm.weight": "model-00074.safetensors", + "model.layers.72.mlp.gate.e_score_correction_bias": "model-00074.safetensors", + "model.layers.72.mlp.gate.weight": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.down_proj.weight": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.down_proj.scales": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.down_proj.biases": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.gate_proj.weight": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.gate_proj.scales": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.gate_proj.biases": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.up_proj.weight": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.up_proj.scales": "model-00074.safetensors", + "model.layers.72.mlp.shared_experts.up_proj.biases": "model-00074.safetensors", + "model.layers.72.post_attention_layernorm.weight": "model-00074.safetensors", + "model.layers.72.self_attn.kv_a_layernorm.weight": "model-00074.safetensors", + "model.layers.72.self_attn.kv_a_proj_with_mqa.weight": "model-00074.safetensors", + "model.layers.72.self_attn.kv_a_proj_with_mqa.scales": "model-00074.safetensors", + "model.layers.72.self_attn.kv_a_proj_with_mqa.biases": "model-00074.safetensors", + "model.layers.72.self_attn.o_proj.weight": "model-00074.safetensors", + "model.layers.72.self_attn.o_proj.scales": "model-00074.safetensors", + "model.layers.72.self_attn.o_proj.biases": "model-00074.safetensors", + "model.layers.72.self_attn.q_a_layernorm.weight": "model-00074.safetensors", + "model.layers.72.self_attn.q_a_proj.weight": "model-00074.safetensors", + "model.layers.72.self_attn.q_a_proj.scales": "model-00074.safetensors", + "model.layers.72.self_attn.q_a_proj.biases": "model-00074.safetensors", + "model.layers.72.self_attn.q_b_proj.weight": "model-00074.safetensors", + "model.layers.72.self_attn.q_b_proj.scales": "model-00074.safetensors", + "model.layers.72.self_attn.q_b_proj.biases": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.gate_proj.weight": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.gate_proj.scales": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.gate_proj.biases": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.down_proj.weight": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.down_proj.scales": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.down_proj.biases": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.up_proj.weight": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.up_proj.scales": "model-00074.safetensors", + "model.layers.72.mlp.switch_mlp.up_proj.biases": "model-00074.safetensors", + "model.layers.72.self_attn.embed_q.weight": "model-00074.safetensors", + "model.layers.72.self_attn.embed_q.scales": "model-00074.safetensors", + "model.layers.72.self_attn.embed_q.biases": "model-00074.safetensors", + "model.layers.72.self_attn.unembed_out.weight": "model-00074.safetensors", + "model.layers.72.self_attn.unembed_out.scales": "model-00074.safetensors", + "model.layers.72.self_attn.unembed_out.biases": "model-00074.safetensors", + "model.layers.73.input_layernorm.weight": "model-00075.safetensors", + "model.layers.73.mlp.gate.e_score_correction_bias": "model-00075.safetensors", + "model.layers.73.mlp.gate.weight": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.down_proj.weight": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.down_proj.scales": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.down_proj.biases": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.gate_proj.weight": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.gate_proj.scales": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.gate_proj.biases": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.up_proj.weight": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.up_proj.scales": "model-00075.safetensors", + "model.layers.73.mlp.shared_experts.up_proj.biases": "model-00075.safetensors", + "model.layers.73.post_attention_layernorm.weight": "model-00075.safetensors", + "model.layers.73.self_attn.kv_a_layernorm.weight": "model-00075.safetensors", + "model.layers.73.self_attn.kv_a_proj_with_mqa.weight": "model-00075.safetensors", + "model.layers.73.self_attn.kv_a_proj_with_mqa.scales": "model-00075.safetensors", + "model.layers.73.self_attn.kv_a_proj_with_mqa.biases": "model-00075.safetensors", + "model.layers.73.self_attn.o_proj.weight": "model-00075.safetensors", + "model.layers.73.self_attn.o_proj.scales": "model-00075.safetensors", + "model.layers.73.self_attn.o_proj.biases": "model-00075.safetensors", + "model.layers.73.self_attn.q_a_layernorm.weight": "model-00075.safetensors", + "model.layers.73.self_attn.q_a_proj.weight": "model-00075.safetensors", + "model.layers.73.self_attn.q_a_proj.scales": "model-00075.safetensors", + "model.layers.73.self_attn.q_a_proj.biases": "model-00075.safetensors", + "model.layers.73.self_attn.q_b_proj.weight": "model-00075.safetensors", + "model.layers.73.self_attn.q_b_proj.scales": "model-00075.safetensors", + "model.layers.73.self_attn.q_b_proj.biases": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.gate_proj.weight": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.gate_proj.scales": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.gate_proj.biases": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.down_proj.weight": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.down_proj.scales": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.down_proj.biases": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.up_proj.weight": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.up_proj.scales": "model-00075.safetensors", + "model.layers.73.mlp.switch_mlp.up_proj.biases": "model-00075.safetensors", + "model.layers.73.self_attn.embed_q.weight": "model-00075.safetensors", + "model.layers.73.self_attn.embed_q.scales": "model-00075.safetensors", + "model.layers.73.self_attn.embed_q.biases": "model-00075.safetensors", + "model.layers.73.self_attn.unembed_out.weight": "model-00075.safetensors", + "model.layers.73.self_attn.unembed_out.scales": "model-00075.safetensors", + "model.layers.73.self_attn.unembed_out.biases": "model-00075.safetensors", + "model.layers.74.input_layernorm.weight": "model-00076.safetensors", + "model.layers.74.mlp.gate.e_score_correction_bias": "model-00076.safetensors", + "model.layers.74.mlp.gate.weight": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.down_proj.weight": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.down_proj.scales": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.down_proj.biases": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.gate_proj.weight": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.gate_proj.scales": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.gate_proj.biases": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.up_proj.weight": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.up_proj.scales": "model-00076.safetensors", + "model.layers.74.mlp.shared_experts.up_proj.biases": "model-00076.safetensors", + "model.layers.74.post_attention_layernorm.weight": "model-00076.safetensors", + "model.layers.74.self_attn.indexer.k_norm.bias": "model-00076.safetensors", + "model.layers.74.self_attn.indexer.k_norm.weight": "model-00076.safetensors", + "model.layers.74.self_attn.indexer.weights_proj.weight": "model-00076.safetensors", + "model.layers.74.self_attn.indexer.wk.weight": "model-00076.safetensors", + "model.layers.74.self_attn.indexer.wq_b.weight": "model-00076.safetensors", + "model.layers.74.self_attn.kv_a_layernorm.weight": "model-00076.safetensors", + "model.layers.74.self_attn.kv_a_proj_with_mqa.weight": "model-00076.safetensors", + "model.layers.74.self_attn.kv_a_proj_with_mqa.scales": "model-00076.safetensors", + "model.layers.74.self_attn.kv_a_proj_with_mqa.biases": "model-00076.safetensors", + "model.layers.74.self_attn.o_proj.weight": "model-00076.safetensors", + "model.layers.74.self_attn.o_proj.scales": "model-00076.safetensors", + "model.layers.74.self_attn.o_proj.biases": "model-00076.safetensors", + "model.layers.74.self_attn.q_a_layernorm.weight": "model-00076.safetensors", + "model.layers.74.self_attn.q_a_proj.weight": "model-00076.safetensors", + "model.layers.74.self_attn.q_a_proj.scales": "model-00076.safetensors", + "model.layers.74.self_attn.q_a_proj.biases": "model-00076.safetensors", + "model.layers.74.self_attn.q_b_proj.weight": "model-00076.safetensors", + "model.layers.74.self_attn.q_b_proj.scales": "model-00076.safetensors", + "model.layers.74.self_attn.q_b_proj.biases": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.gate_proj.weight": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.gate_proj.scales": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.gate_proj.biases": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.down_proj.weight": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.down_proj.scales": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.down_proj.biases": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.up_proj.weight": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.up_proj.scales": "model-00076.safetensors", + "model.layers.74.mlp.switch_mlp.up_proj.biases": "model-00076.safetensors", + "model.layers.74.self_attn.embed_q.weight": "model-00076.safetensors", + "model.layers.74.self_attn.embed_q.scales": "model-00076.safetensors", + "model.layers.74.self_attn.embed_q.biases": "model-00076.safetensors", + "model.layers.74.self_attn.unembed_out.weight": "model-00076.safetensors", + "model.layers.74.self_attn.unembed_out.scales": "model-00076.safetensors", + "model.layers.74.self_attn.unembed_out.biases": "model-00076.safetensors", + "model.layers.75.input_layernorm.weight": "model-00077.safetensors", + "model.layers.75.mlp.gate.e_score_correction_bias": "model-00077.safetensors", + "model.layers.75.mlp.gate.weight": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.down_proj.weight": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.down_proj.scales": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.down_proj.biases": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.gate_proj.weight": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.gate_proj.scales": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.gate_proj.biases": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.up_proj.weight": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.up_proj.scales": "model-00077.safetensors", + "model.layers.75.mlp.shared_experts.up_proj.biases": "model-00077.safetensors", + "model.layers.75.post_attention_layernorm.weight": "model-00077.safetensors", + "model.layers.75.self_attn.kv_a_layernorm.weight": "model-00077.safetensors", + "model.layers.75.self_attn.kv_a_proj_with_mqa.weight": "model-00077.safetensors", + "model.layers.75.self_attn.kv_a_proj_with_mqa.scales": "model-00077.safetensors", + "model.layers.75.self_attn.kv_a_proj_with_mqa.biases": "model-00077.safetensors", + "model.layers.75.self_attn.o_proj.weight": "model-00077.safetensors", + "model.layers.75.self_attn.o_proj.scales": "model-00077.safetensors", + "model.layers.75.self_attn.o_proj.biases": "model-00077.safetensors", + "model.layers.75.self_attn.q_a_layernorm.weight": "model-00077.safetensors", + "model.layers.75.self_attn.q_a_proj.weight": "model-00077.safetensors", + "model.layers.75.self_attn.q_a_proj.scales": "model-00077.safetensors", + "model.layers.75.self_attn.q_a_proj.biases": "model-00077.safetensors", + "model.layers.75.self_attn.q_b_proj.weight": "model-00077.safetensors", + "model.layers.75.self_attn.q_b_proj.scales": "model-00077.safetensors", + "model.layers.75.self_attn.q_b_proj.biases": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.gate_proj.weight": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.gate_proj.scales": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.gate_proj.biases": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.down_proj.weight": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.down_proj.scales": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.down_proj.biases": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.up_proj.weight": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.up_proj.scales": "model-00077.safetensors", + "model.layers.75.mlp.switch_mlp.up_proj.biases": "model-00077.safetensors", + "model.layers.75.self_attn.embed_q.weight": "model-00077.safetensors", + "model.layers.75.self_attn.embed_q.scales": "model-00077.safetensors", + "model.layers.75.self_attn.embed_q.biases": "model-00077.safetensors", + "model.layers.75.self_attn.unembed_out.weight": "model-00077.safetensors", + "model.layers.75.self_attn.unembed_out.scales": "model-00077.safetensors", + "model.layers.75.self_attn.unembed_out.biases": "model-00077.safetensors", + "model.layers.76.input_layernorm.weight": "model-00078.safetensors", + "model.layers.76.mlp.gate.e_score_correction_bias": "model-00078.safetensors", + "model.layers.76.mlp.gate.weight": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.down_proj.weight": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.down_proj.scales": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.down_proj.biases": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.gate_proj.weight": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.gate_proj.scales": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.gate_proj.biases": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.up_proj.weight": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.up_proj.scales": "model-00078.safetensors", + "model.layers.76.mlp.shared_experts.up_proj.biases": "model-00078.safetensors", + "model.layers.76.post_attention_layernorm.weight": "model-00078.safetensors", + "model.layers.76.self_attn.kv_a_layernorm.weight": "model-00078.safetensors", + "model.layers.76.self_attn.kv_a_proj_with_mqa.weight": "model-00078.safetensors", + "model.layers.76.self_attn.kv_a_proj_with_mqa.scales": "model-00078.safetensors", + "model.layers.76.self_attn.kv_a_proj_with_mqa.biases": "model-00078.safetensors", + "model.layers.76.self_attn.o_proj.weight": "model-00078.safetensors", + "model.layers.76.self_attn.o_proj.scales": "model-00078.safetensors", + "model.layers.76.self_attn.o_proj.biases": "model-00078.safetensors", + "model.layers.76.self_attn.q_a_layernorm.weight": "model-00078.safetensors", + "model.layers.76.self_attn.q_a_proj.weight": "model-00078.safetensors", + "model.layers.76.self_attn.q_a_proj.scales": "model-00078.safetensors", + "model.layers.76.self_attn.q_a_proj.biases": "model-00078.safetensors", + "model.layers.76.self_attn.q_b_proj.weight": "model-00078.safetensors", + "model.layers.76.self_attn.q_b_proj.scales": "model-00078.safetensors", + "model.layers.76.self_attn.q_b_proj.biases": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.gate_proj.weight": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.gate_proj.scales": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.gate_proj.biases": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.down_proj.weight": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.down_proj.scales": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.down_proj.biases": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.up_proj.weight": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.up_proj.scales": "model-00078.safetensors", + "model.layers.76.mlp.switch_mlp.up_proj.biases": "model-00078.safetensors", + "model.layers.76.self_attn.embed_q.weight": "model-00078.safetensors", + "model.layers.76.self_attn.embed_q.scales": "model-00078.safetensors", + "model.layers.76.self_attn.embed_q.biases": "model-00078.safetensors", + "model.layers.76.self_attn.unembed_out.weight": "model-00078.safetensors", + "model.layers.76.self_attn.unembed_out.scales": "model-00078.safetensors", + "model.layers.76.self_attn.unembed_out.biases": "model-00078.safetensors", + "model.layers.77.input_layernorm.weight": "model-00079.safetensors", + "model.layers.77.mlp.gate.e_score_correction_bias": "model-00079.safetensors", + "model.layers.77.mlp.gate.weight": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.down_proj.weight": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.down_proj.scales": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.down_proj.biases": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.gate_proj.weight": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.gate_proj.scales": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.gate_proj.biases": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.up_proj.weight": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.up_proj.scales": "model-00079.safetensors", + "model.layers.77.mlp.shared_experts.up_proj.biases": "model-00079.safetensors", + "model.layers.77.post_attention_layernorm.weight": "model-00079.safetensors", + "model.layers.77.self_attn.kv_a_layernorm.weight": "model-00079.safetensors", + "model.layers.77.self_attn.kv_a_proj_with_mqa.weight": "model-00079.safetensors", + "model.layers.77.self_attn.kv_a_proj_with_mqa.scales": "model-00079.safetensors", + "model.layers.77.self_attn.kv_a_proj_with_mqa.biases": "model-00079.safetensors", + "model.layers.77.self_attn.o_proj.weight": "model-00079.safetensors", + "model.layers.77.self_attn.o_proj.scales": "model-00079.safetensors", + "model.layers.77.self_attn.o_proj.biases": "model-00079.safetensors", + "model.layers.77.self_attn.q_a_layernorm.weight": "model-00079.safetensors", + "model.layers.77.self_attn.q_a_proj.weight": "model-00079.safetensors", + "model.layers.77.self_attn.q_a_proj.scales": "model-00079.safetensors", + "model.layers.77.self_attn.q_a_proj.biases": "model-00079.safetensors", + "model.layers.77.self_attn.q_b_proj.weight": "model-00079.safetensors", + "model.layers.77.self_attn.q_b_proj.scales": "model-00079.safetensors", + "model.layers.77.self_attn.q_b_proj.biases": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.gate_proj.weight": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.gate_proj.scales": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.gate_proj.biases": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.down_proj.weight": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.down_proj.scales": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.down_proj.biases": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.up_proj.weight": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.up_proj.scales": "model-00079.safetensors", + "model.layers.77.mlp.switch_mlp.up_proj.biases": "model-00079.safetensors", + "model.layers.77.self_attn.embed_q.weight": "model-00079.safetensors", + "model.layers.77.self_attn.embed_q.scales": "model-00079.safetensors", + "model.layers.77.self_attn.embed_q.biases": "model-00079.safetensors", + "model.layers.77.self_attn.unembed_out.weight": "model-00079.safetensors", + "model.layers.77.self_attn.unembed_out.scales": "model-00079.safetensors", + "model.layers.77.self_attn.unembed_out.biases": "model-00079.safetensors" + } +} \ No newline at end of file diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..aba40197a4cdb5607f4ab7a05fb0a4ee8054fd6d --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:19e773648cb4e65de8660ea6365e10acca112d42a854923df93db4a6f333a82d +size 20217442 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..e375fa0a4e16660ce0e2026e39374d35dad4c079 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,33 @@ +{ + "backend": "tokenizers", + "clean_up_tokenization_spaces": false, + "do_lower_case": false, + "eos_token": "<|endoftext|>", + "extra_special_tokens": [ + "<|endoftext|>", + "[MASK]", + "[gMASK]", + "[sMASK]", + "", + "", + "<|system|>", + "<|user|>", + "<|assistant|>", + "<|observation|>", + "<|begin_of_image|>", + "<|end_of_image|>", + "<|begin_of_video|>", + "<|end_of_video|>", + "<|begin_of_audio|>", + "<|end_of_audio|>", + "<|begin_of_transcription|>", + "<|end_of_transcription|>" + ], + "is_local": true, + "model_max_length": 1048576, + "model_specific_special_tokens": {}, + "pad_token": "<|endoftext|>", + "padding_side": "left", + "remove_space": false, + "tokenizer_class": "TokenizersBackend" +}