Instructions to use EigenLabs/Qwen3.8-27B-4bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use EigenLabs/Qwen3.8-27B-4bit with MLX:
# Make sure mlx-vlm is installed # pip install --upgrade mlx-vlm from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template from mlx_vlm.utils import load_config # Load the model model, processor = load("EigenLabs/Qwen3.8-27B-4bit") config = load_config("EigenLabs/Qwen3.8-27B-4bit") # Prepare input image = ["http://images.cocodataset.org/val2017/000000039769.jpg"] prompt = "Describe this image." # Apply chat template formatted_prompt = apply_chat_template( processor, config, prompt, num_images=1 ) # Generate output output = generate(model, processor, formatted_prompt, image) print(output) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use EigenLabs/Qwen3.8-27B-4bit with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "EigenLabs/Qwen3.8-27B-4bit"
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "EigenLabs/Qwen3.8-27B-4bit" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent
How to use EigenLabs/Qwen3.8-27B-4bit with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "EigenLabs/Qwen3.8-27B-4bit"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default EigenLabs/Qwen3.8-27B-4bit
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use EigenLabs/Qwen3.8-27B-4bit with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "EigenLabs/Qwen3.8-27B-4bit"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "EigenLabs/Qwen3.8-27B-4bit" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Add complete Qwen3.8 VLM with pinned EigenLabs language weights
Browse filesAdds 333 vision_tower tensors and multimodal processor assets from mlx-community/Qwen3.8-27B-4bit@3e6447f082e89cc7f0bc6e5441afd38dfce760ff (official Qwen/Qwen3.8-27B@1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0), while preserving all 1,847 language_model tensors bitwise from EigenLabs/Qwen3.8-27B-4bit@eda45ab47f465d08d6558f0353a2346e2eb9d5b3. MTP remains separate.
- README.md +28 -32
- config.json +32 -0
- model-00001-of-00003.safetensors +2 -2
- model-00002-of-00003.safetensors +1 -1
- model-00003-of-00003.safetensors +2 -2
- model.safetensors.index.json +571 -239
- preprocessor_config.json +21 -0
- processor_config.json +50 -0
- tokenizer_config.json +1 -1
- video_preprocessor_config.json +21 -0
- vocab.json +0 -0
README.md
CHANGED
|
@@ -1,51 +1,47 @@
|
|
| 1 |
---
|
| 2 |
-
language: en
|
| 3 |
library_name: mlx
|
| 4 |
-
pipeline_tag: text-generation
|
| 5 |
license: apache-2.0
|
| 6 |
-
|
|
|
|
|
|
|
|
|
|
| 7 |
tags:
|
| 8 |
- mlx
|
| 9 |
-
-
|
| 10 |
-
-
|
| 11 |
---
|
| 12 |
|
| 13 |
-
# Qwen3.8-27B-4bit
|
| 14 |
|
| 15 |
-
This is a 4-bit
|
| 16 |
|
| 17 |
-
|
| 18 |
-
We used `mlx_lm.convert` with mlx 0.32.0.
|
| 19 |
-
The quantization is affine, 4 bits, group size 64.
|
| 20 |
|
| 21 |
-
|
| 22 |
|
| 23 |
-
|
| 24 |
-
- Each group of 4 layers has 3 linear-attention layers and 1 full-attention layer.
|
| 25 |
-
- The hidden size is 5120.
|
| 26 |
-
- The model has 24 attention heads and 4 KV heads. The head dimension is 256.
|
| 27 |
-
- The vocabulary has 248,320 tokens.
|
| 28 |
-
- The model type is `qwen3_5`.
|
| 29 |
|
| 30 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 31 |
|
| 32 |
-
|
| 33 |
-
The head has 15 tensors.
|
| 34 |
-
This repository does not contain these tensors.
|
| 35 |
-
They are in [EigenLabs/Qwen3.8-27B-MTP-bf16](https://huggingface.co/EigenLabs/Qwen3.8-27B-MTP-bf16).
|
| 36 |
-
That repository keeps them in bfloat16.
|
| 37 |
|
| 38 |
-
##
|
| 39 |
|
| 40 |
-
|
| 41 |
-
The track is `qwen3.8-27b-mtp-v1`.
|
| 42 |
-
The challenge repository is [Layr-Labs/qwen-3.8-mtp-challenge](https://github.com/Layr-Labs/qwen-3.8-mtp-challenge).
|
| 43 |
-
The challenge points to one fixed revision of this repository.
|
| 44 |
-
The challenge compares its files against this revision, byte for byte.
|
| 45 |
|
| 46 |
-
|
| 47 |
|
| 48 |
```bash
|
| 49 |
-
|
| 50 |
-
|
|
|
|
| 51 |
```
|
|
|
|
|
|
|
|
|
| 1 |
---
|
|
|
|
| 2 |
library_name: mlx
|
|
|
|
| 3 |
license: apache-2.0
|
| 4 |
+
pipeline_tag: image-text-to-text
|
| 5 |
+
base_model:
|
| 6 |
+
- Qwen/Qwen3.8-27B
|
| 7 |
+
- EigenLabs/Qwen3.8-27B-4bit
|
| 8 |
tags:
|
| 9 |
- mlx
|
| 10 |
+
- mlx-vlm
|
| 11 |
+
- vision
|
| 12 |
---
|
| 13 |
|
| 14 |
+
# EigenLabs/Qwen3.8-27B-4bit
|
| 15 |
|
| 16 |
+
This revision is a complete MLX 4-bit Qwen3.8 vision-language model for image, video, and text generation.
|
| 17 |
|
| 18 |
+
The **1,847 `language_model.*` tensors are bit-for-bit identical** to [`EigenLabs/Qwen3.8-27B-4bit@eda45ab47f465d08d6558f0353a2346e2eb9d5b3`](https://huggingface.co/EigenLabs/Qwen3.8-27B-4bit/tree/eda45ab47f465d08d6558f0353a2346e2eb9d5b3). The 333 `vision_tower.*` tensors and multimodal processor assets come from [`mlx-community/Qwen3.8-27B-4bit@3e6447f082e89cc7f0bc6e5441afd38dfce760ff`](https://huggingface.co/mlx-community/Qwen3.8-27B-4bit/tree/3e6447f082e89cc7f0bc6e5441afd38dfce760ff), converted from the official [`Qwen/Qwen3.8-27B@1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0`](https://huggingface.co/Qwen/Qwen3.8-27B/tree/1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0) source. Tensor dtype, shape, and raw bytes were checked before publication.
|
|
|
|
|
|
|
| 19 |
|
| 20 |
+
The immutable challenge revision [`eda45ab47f465d08d6558f0353a2346e2eb9d5b3`](https://huggingface.co/EigenLabs/Qwen3.8-27B-4bit/tree/eda45ab47f465d08d6558f0353a2346e2eb9d5b3) remains available and is text-only because it has no vision tower or processor assets. Multi-token prediction (MTP) is intentionally **not embedded** in this repository; the MTP artifact remains separate.
|
| 21 |
|
| 22 |
+
## mlx-vlm
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 23 |
|
| 24 |
+
```bash
|
| 25 |
+
pip install -U mlx-vlm
|
| 26 |
+
python -m mlx_vlm.generate \
|
| 27 |
+
--model EigenLabs/Qwen3.8-27B-4bit \
|
| 28 |
+
--image /path/to/image.jpg \
|
| 29 |
+
--prompt "Describe this image." \
|
| 30 |
+
--max-tokens 256
|
| 31 |
+
```
|
| 32 |
|
| 33 |
+
Pin the immutable Hub commit shown in this model's history for reproducible deployment.
|
|
|
|
|
|
|
|
|
|
|
|
|
| 34 |
|
| 35 |
+
## Darkbloom
|
| 36 |
|
| 37 |
+
This is the Hugging Face source artifact consumed by Darkbloom's in-process MLX VLM runtime. Darkbloom providers deploy only catalog-approved, immutable model revisions and verify their manifests before loading. Updating this repository alone does not register the model in the Darkbloom catalog or activate provider traffic.
|
|
|
|
|
|
|
|
|
|
|
|
|
| 38 |
|
| 39 |
+
After a Darkbloom catalog release pins the immutable Hub commit and publishes its verified manifest, a provider can discover and download that release:
|
| 40 |
|
| 41 |
```bash
|
| 42 |
+
darkbloom models catalog
|
| 43 |
+
darkbloom models download <catalog-model-id>
|
| 44 |
+
darkbloom start --foreground
|
| 45 |
```
|
| 46 |
+
|
| 47 |
+
`<catalog-model-id>` is assigned by the Darkbloom catalog; it is not the Hugging Face repository name.
|
config.json
CHANGED
|
@@ -2,10 +2,23 @@
|
|
| 2 |
"architectures": [
|
| 3 |
"Qwen3_5ForConditionalGeneration"
|
| 4 |
],
|
|
|
|
| 5 |
"eos_token_id": [
|
| 6 |
248046,
|
| 7 |
248044
|
| 8 |
],
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 9 |
"image_token_id": 248056,
|
| 10 |
"language_model_only": false,
|
| 11 |
"model_type": "qwen3_5",
|
|
@@ -19,6 +32,7 @@
|
|
| 19 |
"bits": 4,
|
| 20 |
"mode": "affine"
|
| 21 |
},
|
|
|
|
| 22 |
"text_config": {
|
| 23 |
"attention_bias": false,
|
| 24 |
"attention_dropout": 0.0,
|
|
@@ -131,8 +145,26 @@
|
|
| 131 |
"vocab_size": 248320
|
| 132 |
},
|
| 133 |
"tie_word_embeddings": false,
|
|
|
|
|
|
|
| 134 |
"transformers_version": "5.8.0.dev0",
|
| 135 |
"video_token_id": 248057,
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 136 |
"vision_end_token_id": 248054,
|
| 137 |
"vision_start_token_id": 248053
|
| 138 |
}
|
|
|
|
| 2 |
"architectures": [
|
| 3 |
"Qwen3_5ForConditionalGeneration"
|
| 4 |
],
|
| 5 |
+
"do_sample": true,
|
| 6 |
"eos_token_id": [
|
| 7 |
248046,
|
| 8 |
248044
|
| 9 |
],
|
| 10 |
+
"generation_config": {
|
| 11 |
+
"bos_token_id": 248044,
|
| 12 |
+
"do_sample": true,
|
| 13 |
+
"eos_token_id": [
|
| 14 |
+
248046,
|
| 15 |
+
248044
|
| 16 |
+
],
|
| 17 |
+
"pad_token_id": 248044,
|
| 18 |
+
"temperature": 1.0,
|
| 19 |
+
"top_k": 20,
|
| 20 |
+
"top_p": 0.95
|
| 21 |
+
},
|
| 22 |
"image_token_id": 248056,
|
| 23 |
"language_model_only": false,
|
| 24 |
"model_type": "qwen3_5",
|
|
|
|
| 32 |
"bits": 4,
|
| 33 |
"mode": "affine"
|
| 34 |
},
|
| 35 |
+
"temperature": 1.0,
|
| 36 |
"text_config": {
|
| 37 |
"attention_bias": false,
|
| 38 |
"attention_dropout": 0.0,
|
|
|
|
| 145 |
"vocab_size": 248320
|
| 146 |
},
|
| 147 |
"tie_word_embeddings": false,
|
| 148 |
+
"top_k": 20,
|
| 149 |
+
"top_p": 0.95,
|
| 150 |
"transformers_version": "5.8.0.dev0",
|
| 151 |
"video_token_id": 248057,
|
| 152 |
+
"vision_config": {
|
| 153 |
+
"deepstack_visual_indexes": [],
|
| 154 |
+
"depth": 27,
|
| 155 |
+
"hidden_act": "gelu_pytorch_tanh",
|
| 156 |
+
"hidden_size": 1152,
|
| 157 |
+
"in_channels": 3,
|
| 158 |
+
"initializer_range": 0.02,
|
| 159 |
+
"intermediate_size": 4304,
|
| 160 |
+
"model_type": "qwen3_5",
|
| 161 |
+
"num_heads": 16,
|
| 162 |
+
"num_position_embeddings": 2304,
|
| 163 |
+
"out_hidden_size": 5120,
|
| 164 |
+
"patch_size": 16,
|
| 165 |
+
"spatial_merge_size": 2,
|
| 166 |
+
"temporal_patch_size": 2
|
| 167 |
+
},
|
| 168 |
"vision_end_token_id": 248054,
|
| 169 |
"vision_start_token_id": 248053
|
| 170 |
}
|
model-00001-of-00003.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6cc1508e96fb5d0865dfd5753a79f4ec60651bf3e2a82844a7e8ae9c60528c0d
|
| 3 |
+
size 5343268662
|
model-00002-of-00003.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 5354185130
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:83f2a20ca8058f486a3634a27faf99587f4cd3c156a83dee34fb99e6ac178670
|
| 3 |
size 5354185130
|
model-00003-of-00003.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:31b8c91ef899f79efaaa69e3d2c096f6e2ebeb2ff20e29222abbd9ebc79e560a
|
| 3 |
+
size 5357087557
|
model.safetensors.index.json
CHANGED
|
@@ -1,7 +1,6 @@
|
|
| 1 |
{
|
| 2 |
"metadata": {
|
| 3 |
-
"total_size":
|
| 4 |
-
"total_parameters": 26895993856
|
| 5 |
},
|
| 6 |
"weight_map": {
|
| 7 |
"language_model.lm_head.biases": "model-00003-of-00003.safetensors",
|
|
@@ -290,71 +289,71 @@
|
|
| 290 |
"language_model.model.layers.17.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
|
| 291 |
"language_model.model.layers.17.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
|
| 292 |
"language_model.model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
|
| 293 |
-
"language_model.model.layers.17.mlp.down_proj.biases": "model-
|
| 294 |
-
"language_model.model.layers.17.mlp.down_proj.scales": "model-
|
| 295 |
-
"language_model.model.layers.17.mlp.down_proj.weight": "model-
|
| 296 |
-
"language_model.model.layers.17.mlp.gate_proj.biases": "model-
|
| 297 |
-
"language_model.model.layers.17.mlp.gate_proj.scales": "model-
|
| 298 |
-
"language_model.model.layers.17.mlp.gate_proj.weight": "model-
|
| 299 |
-
"language_model.model.layers.17.mlp.up_proj.biases": "model-
|
| 300 |
-
"language_model.model.layers.17.mlp.up_proj.scales": "model-
|
| 301 |
-
"language_model.model.layers.17.mlp.up_proj.weight": "model-
|
| 302 |
"language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 303 |
-
"language_model.model.layers.18.input_layernorm.weight": "model-
|
| 304 |
-
"language_model.model.layers.18.linear_attn.A_log": "model-
|
| 305 |
-
"language_model.model.layers.18.linear_attn.conv1d.weight": "model-
|
| 306 |
-
"language_model.model.layers.18.linear_attn.dt_bias": "model-
|
| 307 |
-
"language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-
|
| 308 |
-
"language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-
|
| 309 |
-
"language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-
|
| 310 |
-
"language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-
|
| 311 |
-
"language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-
|
| 312 |
-
"language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-
|
| 313 |
-
"language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-
|
| 314 |
-
"language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-
|
| 315 |
-
"language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-
|
| 316 |
-
"language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-
|
| 317 |
-
"language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-
|
| 318 |
-
"language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-
|
| 319 |
-
"language_model.model.layers.18.linear_attn.norm.weight": "model-
|
| 320 |
-
"language_model.model.layers.18.linear_attn.out_proj.biases": "model-
|
| 321 |
-
"language_model.model.layers.18.linear_attn.out_proj.scales": "model-
|
| 322 |
-
"language_model.model.layers.18.linear_attn.out_proj.weight": "model-
|
| 323 |
-
"language_model.model.layers.18.mlp.down_proj.biases": "model-
|
| 324 |
-
"language_model.model.layers.18.mlp.down_proj.scales": "model-
|
| 325 |
-
"language_model.model.layers.18.mlp.down_proj.weight": "model-
|
| 326 |
-
"language_model.model.layers.18.mlp.gate_proj.biases": "model-
|
| 327 |
-
"language_model.model.layers.18.mlp.gate_proj.scales": "model-
|
| 328 |
-
"language_model.model.layers.18.mlp.gate_proj.weight": "model-
|
| 329 |
-
"language_model.model.layers.18.mlp.up_proj.biases": "model-
|
| 330 |
-
"language_model.model.layers.18.mlp.up_proj.scales": "model-
|
| 331 |
-
"language_model.model.layers.18.mlp.up_proj.weight": "model-
|
| 332 |
-
"language_model.model.layers.18.post_attention_layernorm.weight": "model-
|
| 333 |
-
"language_model.model.layers.19.input_layernorm.weight": "model-
|
| 334 |
-
"language_model.model.layers.19.mlp.down_proj.biases": "model-
|
| 335 |
-
"language_model.model.layers.19.mlp.down_proj.scales": "model-
|
| 336 |
-
"language_model.model.layers.19.mlp.down_proj.weight": "model-
|
| 337 |
-
"language_model.model.layers.19.mlp.gate_proj.biases": "model-
|
| 338 |
-
"language_model.model.layers.19.mlp.gate_proj.scales": "model-
|
| 339 |
-
"language_model.model.layers.19.mlp.gate_proj.weight": "model-
|
| 340 |
-
"language_model.model.layers.19.mlp.up_proj.biases": "model-
|
| 341 |
-
"language_model.model.layers.19.mlp.up_proj.scales": "model-
|
| 342 |
-
"language_model.model.layers.19.mlp.up_proj.weight": "model-
|
| 343 |
-
"language_model.model.layers.19.post_attention_layernorm.weight": "model-
|
| 344 |
-
"language_model.model.layers.19.self_attn.k_norm.weight": "model-
|
| 345 |
-
"language_model.model.layers.19.self_attn.k_proj.biases": "model-
|
| 346 |
-
"language_model.model.layers.19.self_attn.k_proj.scales": "model-
|
| 347 |
-
"language_model.model.layers.19.self_attn.k_proj.weight": "model-
|
| 348 |
-
"language_model.model.layers.19.self_attn.o_proj.biases": "model-
|
| 349 |
-
"language_model.model.layers.19.self_attn.o_proj.scales": "model-
|
| 350 |
-
"language_model.model.layers.19.self_attn.o_proj.weight": "model-
|
| 351 |
-
"language_model.model.layers.19.self_attn.q_norm.weight": "model-
|
| 352 |
-
"language_model.model.layers.19.self_attn.q_proj.biases": "model-
|
| 353 |
-
"language_model.model.layers.19.self_attn.q_proj.scales": "model-
|
| 354 |
-
"language_model.model.layers.19.self_attn.q_proj.weight": "model-
|
| 355 |
-
"language_model.model.layers.19.self_attn.v_proj.biases": "model-
|
| 356 |
-
"language_model.model.layers.19.self_attn.v_proj.scales": "model-
|
| 357 |
-
"language_model.model.layers.19.self_attn.v_proj.weight": "model-
|
| 358 |
"language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 359 |
"language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00003.safetensors",
|
| 360 |
"language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
|
|
@@ -385,66 +384,66 @@
|
|
| 385 |
"language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
|
| 386 |
"language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
| 387 |
"language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 388 |
-
"language_model.model.layers.20.input_layernorm.weight": "model-
|
| 389 |
-
"language_model.model.layers.20.linear_attn.A_log": "model-
|
| 390 |
-
"language_model.model.layers.20.linear_attn.conv1d.weight": "model-
|
| 391 |
-
"language_model.model.layers.20.linear_attn.dt_bias": "model-
|
| 392 |
-
"language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-
|
| 393 |
-
"language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-
|
| 394 |
-
"language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-
|
| 395 |
-
"language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-
|
| 396 |
-
"language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-
|
| 397 |
-
"language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-
|
| 398 |
-
"language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-
|
| 399 |
-
"language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-
|
| 400 |
-
"language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-
|
| 401 |
-
"language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-
|
| 402 |
-
"language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-
|
| 403 |
-
"language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-
|
| 404 |
-
"language_model.model.layers.20.linear_attn.norm.weight": "model-
|
| 405 |
-
"language_model.model.layers.20.linear_attn.out_proj.biases": "model-
|
| 406 |
-
"language_model.model.layers.20.linear_attn.out_proj.scales": "model-
|
| 407 |
-
"language_model.model.layers.20.linear_attn.out_proj.weight": "model-
|
| 408 |
-
"language_model.model.layers.20.mlp.down_proj.biases": "model-
|
| 409 |
-
"language_model.model.layers.20.mlp.down_proj.scales": "model-
|
| 410 |
-
"language_model.model.layers.20.mlp.down_proj.weight": "model-
|
| 411 |
-
"language_model.model.layers.20.mlp.gate_proj.biases": "model-
|
| 412 |
-
"language_model.model.layers.20.mlp.gate_proj.scales": "model-
|
| 413 |
-
"language_model.model.layers.20.mlp.gate_proj.weight": "model-
|
| 414 |
-
"language_model.model.layers.20.mlp.up_proj.biases": "model-
|
| 415 |
-
"language_model.model.layers.20.mlp.up_proj.scales": "model-
|
| 416 |
-
"language_model.model.layers.20.mlp.up_proj.weight": "model-
|
| 417 |
-
"language_model.model.layers.20.post_attention_layernorm.weight": "model-
|
| 418 |
-
"language_model.model.layers.21.input_layernorm.weight": "model-
|
| 419 |
-
"language_model.model.layers.21.linear_attn.A_log": "model-
|
| 420 |
-
"language_model.model.layers.21.linear_attn.conv1d.weight": "model-
|
| 421 |
-
"language_model.model.layers.21.linear_attn.dt_bias": "model-
|
| 422 |
-
"language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-
|
| 423 |
-
"language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-
|
| 424 |
-
"language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-
|
| 425 |
-
"language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-
|
| 426 |
-
"language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-
|
| 427 |
-
"language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-
|
| 428 |
-
"language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-
|
| 429 |
-
"language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-
|
| 430 |
-
"language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-
|
| 431 |
-
"language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-
|
| 432 |
-
"language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-
|
| 433 |
-
"language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-
|
| 434 |
-
"language_model.model.layers.21.linear_attn.norm.weight": "model-
|
| 435 |
-
"language_model.model.layers.21.linear_attn.out_proj.biases": "model-
|
| 436 |
-
"language_model.model.layers.21.linear_attn.out_proj.scales": "model-
|
| 437 |
-
"language_model.model.layers.21.linear_attn.out_proj.weight": "model-
|
| 438 |
"language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
|
| 439 |
"language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
|
| 440 |
"language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
| 441 |
-
"language_model.model.layers.21.mlp.gate_proj.biases": "model-
|
| 442 |
-
"language_model.model.layers.21.mlp.gate_proj.scales": "model-
|
| 443 |
-
"language_model.model.layers.21.mlp.gate_proj.weight": "model-
|
| 444 |
"language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
|
| 445 |
"language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
|
| 446 |
"language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
| 447 |
-
"language_model.model.layers.21.post_attention_layernorm.weight": "model-
|
| 448 |
"language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 449 |
"language_model.model.layers.22.linear_attn.A_log": "model-00002-of-00003.safetensors",
|
| 450 |
"language_model.model.layers.22.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
|
|
@@ -1095,131 +1094,131 @@
|
|
| 1095 |
"language_model.model.layers.42.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
|
| 1096 |
"language_model.model.layers.42.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
|
| 1097 |
"language_model.model.layers.42.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
|
| 1098 |
-
"language_model.model.layers.42.mlp.down_proj.biases": "model-
|
| 1099 |
-
"language_model.model.layers.42.mlp.down_proj.scales": "model-
|
| 1100 |
-
"language_model.model.layers.42.mlp.down_proj.weight": "model-
|
| 1101 |
-
"language_model.model.layers.42.mlp.gate_proj.biases": "model-
|
| 1102 |
-
"language_model.model.layers.42.mlp.gate_proj.scales": "model-
|
| 1103 |
-
"language_model.model.layers.42.mlp.gate_proj.weight": "model-
|
| 1104 |
-
"language_model.model.layers.42.mlp.up_proj.biases": "model-
|
| 1105 |
-
"language_model.model.layers.42.mlp.up_proj.scales": "model-
|
| 1106 |
-
"language_model.model.layers.42.mlp.up_proj.weight": "model-
|
| 1107 |
"language_model.model.layers.42.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 1108 |
-
"language_model.model.layers.43.input_layernorm.weight": "model-
|
| 1109 |
-
"language_model.model.layers.43.mlp.down_proj.biases": "model-
|
| 1110 |
-
"language_model.model.layers.43.mlp.down_proj.scales": "model-
|
| 1111 |
-
"language_model.model.layers.43.mlp.down_proj.weight": "model-
|
| 1112 |
-
"language_model.model.layers.43.mlp.gate_proj.biases": "model-
|
| 1113 |
-
"language_model.model.layers.43.mlp.gate_proj.scales": "model-
|
| 1114 |
-
"language_model.model.layers.43.mlp.gate_proj.weight": "model-
|
| 1115 |
-
"language_model.model.layers.43.mlp.up_proj.biases": "model-
|
| 1116 |
-
"language_model.model.layers.43.mlp.up_proj.scales": "model-
|
| 1117 |
-
"language_model.model.layers.43.mlp.up_proj.weight": "model-
|
| 1118 |
-
"language_model.model.layers.43.post_attention_layernorm.weight": "model-
|
| 1119 |
-
"language_model.model.layers.43.self_attn.k_norm.weight": "model-
|
| 1120 |
-
"language_model.model.layers.43.self_attn.k_proj.biases": "model-
|
| 1121 |
-
"language_model.model.layers.43.self_attn.k_proj.scales": "model-
|
| 1122 |
-
"language_model.model.layers.43.self_attn.k_proj.weight": "model-
|
| 1123 |
-
"language_model.model.layers.43.self_attn.o_proj.biases": "model-
|
| 1124 |
-
"language_model.model.layers.43.self_attn.o_proj.scales": "model-
|
| 1125 |
-
"language_model.model.layers.43.self_attn.o_proj.weight": "model-
|
| 1126 |
-
"language_model.model.layers.43.self_attn.q_norm.weight": "model-
|
| 1127 |
-
"language_model.model.layers.43.self_attn.q_proj.biases": "model-
|
| 1128 |
-
"language_model.model.layers.43.self_attn.q_proj.scales": "model-
|
| 1129 |
-
"language_model.model.layers.43.self_attn.q_proj.weight": "model-
|
| 1130 |
-
"language_model.model.layers.43.self_attn.v_proj.biases": "model-
|
| 1131 |
-
"language_model.model.layers.43.self_attn.v_proj.scales": "model-
|
| 1132 |
-
"language_model.model.layers.43.self_attn.v_proj.weight": "model-
|
| 1133 |
-
"language_model.model.layers.44.input_layernorm.weight": "model-
|
| 1134 |
-
"language_model.model.layers.44.linear_attn.A_log": "model-
|
| 1135 |
-
"language_model.model.layers.44.linear_attn.conv1d.weight": "model-
|
| 1136 |
-
"language_model.model.layers.44.linear_attn.dt_bias": "model-
|
| 1137 |
-
"language_model.model.layers.44.linear_attn.in_proj_a.biases": "model-
|
| 1138 |
-
"language_model.model.layers.44.linear_attn.in_proj_a.scales": "model-
|
| 1139 |
-
"language_model.model.layers.44.linear_attn.in_proj_a.weight": "model-
|
| 1140 |
-
"language_model.model.layers.44.linear_attn.in_proj_b.biases": "model-
|
| 1141 |
-
"language_model.model.layers.44.linear_attn.in_proj_b.scales": "model-
|
| 1142 |
-
"language_model.model.layers.44.linear_attn.in_proj_b.weight": "model-
|
| 1143 |
-
"language_model.model.layers.44.linear_attn.in_proj_qkv.biases": "model-
|
| 1144 |
-
"language_model.model.layers.44.linear_attn.in_proj_qkv.scales": "model-
|
| 1145 |
-
"language_model.model.layers.44.linear_attn.in_proj_qkv.weight": "model-
|
| 1146 |
-
"language_model.model.layers.44.linear_attn.in_proj_z.biases": "model-
|
| 1147 |
-
"language_model.model.layers.44.linear_attn.in_proj_z.scales": "model-
|
| 1148 |
-
"language_model.model.layers.44.linear_attn.in_proj_z.weight": "model-
|
| 1149 |
-
"language_model.model.layers.44.linear_attn.norm.weight": "model-
|
| 1150 |
-
"language_model.model.layers.44.linear_attn.out_proj.biases": "model-
|
| 1151 |
-
"language_model.model.layers.44.linear_attn.out_proj.scales": "model-
|
| 1152 |
-
"language_model.model.layers.44.linear_attn.out_proj.weight": "model-
|
| 1153 |
-
"language_model.model.layers.44.mlp.down_proj.biases": "model-
|
| 1154 |
-
"language_model.model.layers.44.mlp.down_proj.scales": "model-
|
| 1155 |
-
"language_model.model.layers.44.mlp.down_proj.weight": "model-
|
| 1156 |
-
"language_model.model.layers.44.mlp.gate_proj.biases": "model-
|
| 1157 |
-
"language_model.model.layers.44.mlp.gate_proj.scales": "model-
|
| 1158 |
-
"language_model.model.layers.44.mlp.gate_proj.weight": "model-
|
| 1159 |
-
"language_model.model.layers.44.mlp.up_proj.biases": "model-
|
| 1160 |
-
"language_model.model.layers.44.mlp.up_proj.scales": "model-
|
| 1161 |
-
"language_model.model.layers.44.mlp.up_proj.weight": "model-
|
| 1162 |
-
"language_model.model.layers.44.post_attention_layernorm.weight": "model-
|
| 1163 |
-
"language_model.model.layers.45.input_layernorm.weight": "model-
|
| 1164 |
-
"language_model.model.layers.45.linear_attn.A_log": "model-
|
| 1165 |
-
"language_model.model.layers.45.linear_attn.conv1d.weight": "model-
|
| 1166 |
-
"language_model.model.layers.45.linear_attn.dt_bias": "model-
|
| 1167 |
-
"language_model.model.layers.45.linear_attn.in_proj_a.biases": "model-
|
| 1168 |
-
"language_model.model.layers.45.linear_attn.in_proj_a.scales": "model-
|
| 1169 |
-
"language_model.model.layers.45.linear_attn.in_proj_a.weight": "model-
|
| 1170 |
-
"language_model.model.layers.45.linear_attn.in_proj_b.biases": "model-
|
| 1171 |
-
"language_model.model.layers.45.linear_attn.in_proj_b.scales": "model-
|
| 1172 |
-
"language_model.model.layers.45.linear_attn.in_proj_b.weight": "model-
|
| 1173 |
-
"language_model.model.layers.45.linear_attn.in_proj_qkv.biases": "model-
|
| 1174 |
-
"language_model.model.layers.45.linear_attn.in_proj_qkv.scales": "model-
|
| 1175 |
-
"language_model.model.layers.45.linear_attn.in_proj_qkv.weight": "model-
|
| 1176 |
-
"language_model.model.layers.45.linear_attn.in_proj_z.biases": "model-
|
| 1177 |
-
"language_model.model.layers.45.linear_attn.in_proj_z.scales": "model-
|
| 1178 |
-
"language_model.model.layers.45.linear_attn.in_proj_z.weight": "model-
|
| 1179 |
-
"language_model.model.layers.45.linear_attn.norm.weight": "model-
|
| 1180 |
-
"language_model.model.layers.45.linear_attn.out_proj.biases": "model-
|
| 1181 |
-
"language_model.model.layers.45.linear_attn.out_proj.scales": "model-
|
| 1182 |
-
"language_model.model.layers.45.linear_attn.out_proj.weight": "model-
|
| 1183 |
-
"language_model.model.layers.45.mlp.down_proj.biases": "model-
|
| 1184 |
-
"language_model.model.layers.45.mlp.down_proj.scales": "model-
|
| 1185 |
-
"language_model.model.layers.45.mlp.down_proj.weight": "model-
|
| 1186 |
-
"language_model.model.layers.45.mlp.gate_proj.biases": "model-
|
| 1187 |
-
"language_model.model.layers.45.mlp.gate_proj.scales": "model-
|
| 1188 |
-
"language_model.model.layers.45.mlp.gate_proj.weight": "model-
|
| 1189 |
-
"language_model.model.layers.45.mlp.up_proj.biases": "model-
|
| 1190 |
-
"language_model.model.layers.45.mlp.up_proj.scales": "model-
|
| 1191 |
-
"language_model.model.layers.45.mlp.up_proj.weight": "model-
|
| 1192 |
-
"language_model.model.layers.45.post_attention_layernorm.weight": "model-
|
| 1193 |
-
"language_model.model.layers.46.input_layernorm.weight": "model-
|
| 1194 |
-
"language_model.model.layers.46.linear_attn.A_log": "model-
|
| 1195 |
-
"language_model.model.layers.46.linear_attn.conv1d.weight": "model-
|
| 1196 |
-
"language_model.model.layers.46.linear_attn.dt_bias": "model-
|
| 1197 |
-
"language_model.model.layers.46.linear_attn.in_proj_a.biases": "model-
|
| 1198 |
-
"language_model.model.layers.46.linear_attn.in_proj_a.scales": "model-
|
| 1199 |
-
"language_model.model.layers.46.linear_attn.in_proj_a.weight": "model-
|
| 1200 |
-
"language_model.model.layers.46.linear_attn.in_proj_b.biases": "model-
|
| 1201 |
-
"language_model.model.layers.46.linear_attn.in_proj_b.scales": "model-
|
| 1202 |
-
"language_model.model.layers.46.linear_attn.in_proj_b.weight": "model-
|
| 1203 |
-
"language_model.model.layers.46.linear_attn.in_proj_qkv.biases": "model-
|
| 1204 |
-
"language_model.model.layers.46.linear_attn.in_proj_qkv.scales": "model-
|
| 1205 |
-
"language_model.model.layers.46.linear_attn.in_proj_qkv.weight": "model-
|
| 1206 |
-
"language_model.model.layers.46.linear_attn.in_proj_z.biases": "model-
|
| 1207 |
-
"language_model.model.layers.46.linear_attn.in_proj_z.scales": "model-
|
| 1208 |
-
"language_model.model.layers.46.linear_attn.in_proj_z.weight": "model-
|
| 1209 |
-
"language_model.model.layers.46.linear_attn.norm.weight": "model-
|
| 1210 |
-
"language_model.model.layers.46.linear_attn.out_proj.biases": "model-
|
| 1211 |
-
"language_model.model.layers.46.linear_attn.out_proj.scales": "model-
|
| 1212 |
-
"language_model.model.layers.46.linear_attn.out_proj.weight": "model-
|
| 1213 |
"language_model.model.layers.46.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1214 |
"language_model.model.layers.46.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
| 1215 |
"language_model.model.layers.46.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
| 1216 |
-
"language_model.model.layers.46.mlp.gate_proj.biases": "model-
|
| 1217 |
-
"language_model.model.layers.46.mlp.gate_proj.scales": "model-
|
| 1218 |
-
"language_model.model.layers.46.mlp.gate_proj.weight": "model-
|
| 1219 |
"language_model.model.layers.46.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
|
| 1220 |
"language_model.model.layers.46.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
|
| 1221 |
"language_model.model.layers.46.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
| 1222 |
-
"language_model.model.layers.46.post_attention_layernorm.weight": "model-
|
| 1223 |
"language_model.model.layers.47.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1224 |
"language_model.model.layers.47.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1225 |
"language_model.model.layers.47.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
|
@@ -1850,6 +1849,339 @@
|
|
| 1850 |
"language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
|
| 1851 |
"language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
| 1852 |
"language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 1853 |
-
"language_model.model.norm.weight": "model-00003-of-00003.safetensors"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1854 |
}
|
| 1855 |
}
|
|
|
|
| 1 |
{
|
| 2 |
"metadata": {
|
| 3 |
+
"total_size": 16054262240
|
|
|
|
| 4 |
},
|
| 5 |
"weight_map": {
|
| 6 |
"language_model.lm_head.biases": "model-00003-of-00003.safetensors",
|
|
|
|
| 289 |
"language_model.model.layers.17.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
|
| 290 |
"language_model.model.layers.17.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
|
| 291 |
"language_model.model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
|
| 292 |
+
"language_model.model.layers.17.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
|
| 293 |
+
"language_model.model.layers.17.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
|
| 294 |
+
"language_model.model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
| 295 |
+
"language_model.model.layers.17.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
|
| 296 |
+
"language_model.model.layers.17.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
|
| 297 |
+
"language_model.model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
| 298 |
+
"language_model.model.layers.17.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
|
| 299 |
+
"language_model.model.layers.17.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
|
| 300 |
+
"language_model.model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
| 301 |
"language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 302 |
+
"language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 303 |
+
"language_model.model.layers.18.linear_attn.A_log": "model-00002-of-00003.safetensors",
|
| 304 |
+
"language_model.model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
|
| 305 |
+
"language_model.model.layers.18.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
|
| 306 |
+
"language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
|
| 307 |
+
"language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
|
| 308 |
+
"language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
|
| 309 |
+
"language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
|
| 310 |
+
"language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
|
| 311 |
+
"language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
|
| 312 |
+
"language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
|
| 313 |
+
"language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
|
| 314 |
+
"language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
|
| 315 |
+
"language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
|
| 316 |
+
"language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
|
| 317 |
+
"language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
|
| 318 |
+
"language_model.model.layers.18.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
|
| 319 |
+
"language_model.model.layers.18.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
|
| 320 |
+
"language_model.model.layers.18.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
|
| 321 |
+
"language_model.model.layers.18.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
|
| 322 |
+
"language_model.model.layers.18.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
|
| 323 |
+
"language_model.model.layers.18.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
|
| 324 |
+
"language_model.model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
| 325 |
+
"language_model.model.layers.18.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
|
| 326 |
+
"language_model.model.layers.18.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
|
| 327 |
+
"language_model.model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
| 328 |
+
"language_model.model.layers.18.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
|
| 329 |
+
"language_model.model.layers.18.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
|
| 330 |
+
"language_model.model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
| 331 |
+
"language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 332 |
+
"language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 333 |
+
"language_model.model.layers.19.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
|
| 334 |
+
"language_model.model.layers.19.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
|
| 335 |
+
"language_model.model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
| 336 |
+
"language_model.model.layers.19.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
|
| 337 |
+
"language_model.model.layers.19.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
|
| 338 |
+
"language_model.model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
| 339 |
+
"language_model.model.layers.19.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
|
| 340 |
+
"language_model.model.layers.19.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
|
| 341 |
+
"language_model.model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
| 342 |
+
"language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 343 |
+
"language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
|
| 344 |
+
"language_model.model.layers.19.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
|
| 345 |
+
"language_model.model.layers.19.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
|
| 346 |
+
"language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
|
| 347 |
+
"language_model.model.layers.19.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
|
| 348 |
+
"language_model.model.layers.19.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
|
| 349 |
+
"language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
|
| 350 |
+
"language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
|
| 351 |
+
"language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
|
| 352 |
+
"language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
|
| 353 |
+
"language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
|
| 354 |
+
"language_model.model.layers.19.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
|
| 355 |
+
"language_model.model.layers.19.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
|
| 356 |
+
"language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
|
| 357 |
"language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 358 |
"language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00003.safetensors",
|
| 359 |
"language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
|
|
|
|
| 384 |
"language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
|
| 385 |
"language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
| 386 |
"language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 387 |
+
"language_model.model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 388 |
+
"language_model.model.layers.20.linear_attn.A_log": "model-00002-of-00003.safetensors",
|
| 389 |
+
"language_model.model.layers.20.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
|
| 390 |
+
"language_model.model.layers.20.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
|
| 391 |
+
"language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
|
| 392 |
+
"language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
|
| 393 |
+
"language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
|
| 394 |
+
"language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
|
| 395 |
+
"language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
|
| 396 |
+
"language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
|
| 397 |
+
"language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
|
| 398 |
+
"language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
|
| 399 |
+
"language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
|
| 400 |
+
"language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
|
| 401 |
+
"language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
|
| 402 |
+
"language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
|
| 403 |
+
"language_model.model.layers.20.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
|
| 404 |
+
"language_model.model.layers.20.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
|
| 405 |
+
"language_model.model.layers.20.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
|
| 406 |
+
"language_model.model.layers.20.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
|
| 407 |
+
"language_model.model.layers.20.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
|
| 408 |
+
"language_model.model.layers.20.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
|
| 409 |
+
"language_model.model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
| 410 |
+
"language_model.model.layers.20.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
|
| 411 |
+
"language_model.model.layers.20.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
|
| 412 |
+
"language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
| 413 |
+
"language_model.model.layers.20.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
|
| 414 |
+
"language_model.model.layers.20.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
|
| 415 |
+
"language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
| 416 |
+
"language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 417 |
+
"language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 418 |
+
"language_model.model.layers.21.linear_attn.A_log": "model-00002-of-00003.safetensors",
|
| 419 |
+
"language_model.model.layers.21.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
|
| 420 |
+
"language_model.model.layers.21.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
|
| 421 |
+
"language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
|
| 422 |
+
"language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
|
| 423 |
+
"language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
|
| 424 |
+
"language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
|
| 425 |
+
"language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
|
| 426 |
+
"language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
|
| 427 |
+
"language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
|
| 428 |
+
"language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
|
| 429 |
+
"language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
|
| 430 |
+
"language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
|
| 431 |
+
"language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
|
| 432 |
+
"language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
|
| 433 |
+
"language_model.model.layers.21.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
|
| 434 |
+
"language_model.model.layers.21.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
|
| 435 |
+
"language_model.model.layers.21.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
|
| 436 |
+
"language_model.model.layers.21.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
|
| 437 |
"language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
|
| 438 |
"language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
|
| 439 |
"language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
|
| 440 |
+
"language_model.model.layers.21.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
|
| 441 |
+
"language_model.model.layers.21.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
|
| 442 |
+
"language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
|
| 443 |
"language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
|
| 444 |
"language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
|
| 445 |
"language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
|
| 446 |
+
"language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 447 |
"language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 448 |
"language_model.model.layers.22.linear_attn.A_log": "model-00002-of-00003.safetensors",
|
| 449 |
"language_model.model.layers.22.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
|
|
|
|
| 1094 |
"language_model.model.layers.42.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
|
| 1095 |
"language_model.model.layers.42.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
|
| 1096 |
"language_model.model.layers.42.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
|
| 1097 |
+
"language_model.model.layers.42.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1098 |
+
"language_model.model.layers.42.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
| 1099 |
+
"language_model.model.layers.42.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
| 1100 |
+
"language_model.model.layers.42.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
|
| 1101 |
+
"language_model.model.layers.42.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
|
| 1102 |
+
"language_model.model.layers.42.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
| 1103 |
+
"language_model.model.layers.42.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
|
| 1104 |
+
"language_model.model.layers.42.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
|
| 1105 |
+
"language_model.model.layers.42.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
| 1106 |
"language_model.model.layers.42.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
|
| 1107 |
+
"language_model.model.layers.43.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1108 |
+
"language_model.model.layers.43.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1109 |
+
"language_model.model.layers.43.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
| 1110 |
+
"language_model.model.layers.43.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
| 1111 |
+
"language_model.model.layers.43.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
|
| 1112 |
+
"language_model.model.layers.43.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
|
| 1113 |
+
"language_model.model.layers.43.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
| 1114 |
+
"language_model.model.layers.43.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
|
| 1115 |
+
"language_model.model.layers.43.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
|
| 1116 |
+
"language_model.model.layers.43.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
| 1117 |
+
"language_model.model.layers.43.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1118 |
+
"language_model.model.layers.43.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
|
| 1119 |
+
"language_model.model.layers.43.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
|
| 1120 |
+
"language_model.model.layers.43.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
|
| 1121 |
+
"language_model.model.layers.43.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
|
| 1122 |
+
"language_model.model.layers.43.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
|
| 1123 |
+
"language_model.model.layers.43.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
|
| 1124 |
+
"language_model.model.layers.43.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
|
| 1125 |
+
"language_model.model.layers.43.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
|
| 1126 |
+
"language_model.model.layers.43.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
|
| 1127 |
+
"language_model.model.layers.43.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
|
| 1128 |
+
"language_model.model.layers.43.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
|
| 1129 |
+
"language_model.model.layers.43.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
|
| 1130 |
+
"language_model.model.layers.43.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
|
| 1131 |
+
"language_model.model.layers.43.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
|
| 1132 |
+
"language_model.model.layers.44.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1133 |
+
"language_model.model.layers.44.linear_attn.A_log": "model-00003-of-00003.safetensors",
|
| 1134 |
+
"language_model.model.layers.44.linear_attn.conv1d.weight": "model-00003-of-00003.safetensors",
|
| 1135 |
+
"language_model.model.layers.44.linear_attn.dt_bias": "model-00003-of-00003.safetensors",
|
| 1136 |
+
"language_model.model.layers.44.linear_attn.in_proj_a.biases": "model-00003-of-00003.safetensors",
|
| 1137 |
+
"language_model.model.layers.44.linear_attn.in_proj_a.scales": "model-00003-of-00003.safetensors",
|
| 1138 |
+
"language_model.model.layers.44.linear_attn.in_proj_a.weight": "model-00003-of-00003.safetensors",
|
| 1139 |
+
"language_model.model.layers.44.linear_attn.in_proj_b.biases": "model-00003-of-00003.safetensors",
|
| 1140 |
+
"language_model.model.layers.44.linear_attn.in_proj_b.scales": "model-00003-of-00003.safetensors",
|
| 1141 |
+
"language_model.model.layers.44.linear_attn.in_proj_b.weight": "model-00003-of-00003.safetensors",
|
| 1142 |
+
"language_model.model.layers.44.linear_attn.in_proj_qkv.biases": "model-00003-of-00003.safetensors",
|
| 1143 |
+
"language_model.model.layers.44.linear_attn.in_proj_qkv.scales": "model-00003-of-00003.safetensors",
|
| 1144 |
+
"language_model.model.layers.44.linear_attn.in_proj_qkv.weight": "model-00003-of-00003.safetensors",
|
| 1145 |
+
"language_model.model.layers.44.linear_attn.in_proj_z.biases": "model-00003-of-00003.safetensors",
|
| 1146 |
+
"language_model.model.layers.44.linear_attn.in_proj_z.scales": "model-00003-of-00003.safetensors",
|
| 1147 |
+
"language_model.model.layers.44.linear_attn.in_proj_z.weight": "model-00003-of-00003.safetensors",
|
| 1148 |
+
"language_model.model.layers.44.linear_attn.norm.weight": "model-00003-of-00003.safetensors",
|
| 1149 |
+
"language_model.model.layers.44.linear_attn.out_proj.biases": "model-00003-of-00003.safetensors",
|
| 1150 |
+
"language_model.model.layers.44.linear_attn.out_proj.scales": "model-00003-of-00003.safetensors",
|
| 1151 |
+
"language_model.model.layers.44.linear_attn.out_proj.weight": "model-00003-of-00003.safetensors",
|
| 1152 |
+
"language_model.model.layers.44.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1153 |
+
"language_model.model.layers.44.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
| 1154 |
+
"language_model.model.layers.44.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
| 1155 |
+
"language_model.model.layers.44.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
|
| 1156 |
+
"language_model.model.layers.44.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
|
| 1157 |
+
"language_model.model.layers.44.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
| 1158 |
+
"language_model.model.layers.44.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
|
| 1159 |
+
"language_model.model.layers.44.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
|
| 1160 |
+
"language_model.model.layers.44.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
| 1161 |
+
"language_model.model.layers.44.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1162 |
+
"language_model.model.layers.45.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1163 |
+
"language_model.model.layers.45.linear_attn.A_log": "model-00003-of-00003.safetensors",
|
| 1164 |
+
"language_model.model.layers.45.linear_attn.conv1d.weight": "model-00003-of-00003.safetensors",
|
| 1165 |
+
"language_model.model.layers.45.linear_attn.dt_bias": "model-00003-of-00003.safetensors",
|
| 1166 |
+
"language_model.model.layers.45.linear_attn.in_proj_a.biases": "model-00003-of-00003.safetensors",
|
| 1167 |
+
"language_model.model.layers.45.linear_attn.in_proj_a.scales": "model-00003-of-00003.safetensors",
|
| 1168 |
+
"language_model.model.layers.45.linear_attn.in_proj_a.weight": "model-00003-of-00003.safetensors",
|
| 1169 |
+
"language_model.model.layers.45.linear_attn.in_proj_b.biases": "model-00003-of-00003.safetensors",
|
| 1170 |
+
"language_model.model.layers.45.linear_attn.in_proj_b.scales": "model-00003-of-00003.safetensors",
|
| 1171 |
+
"language_model.model.layers.45.linear_attn.in_proj_b.weight": "model-00003-of-00003.safetensors",
|
| 1172 |
+
"language_model.model.layers.45.linear_attn.in_proj_qkv.biases": "model-00003-of-00003.safetensors",
|
| 1173 |
+
"language_model.model.layers.45.linear_attn.in_proj_qkv.scales": "model-00003-of-00003.safetensors",
|
| 1174 |
+
"language_model.model.layers.45.linear_attn.in_proj_qkv.weight": "model-00003-of-00003.safetensors",
|
| 1175 |
+
"language_model.model.layers.45.linear_attn.in_proj_z.biases": "model-00003-of-00003.safetensors",
|
| 1176 |
+
"language_model.model.layers.45.linear_attn.in_proj_z.scales": "model-00003-of-00003.safetensors",
|
| 1177 |
+
"language_model.model.layers.45.linear_attn.in_proj_z.weight": "model-00003-of-00003.safetensors",
|
| 1178 |
+
"language_model.model.layers.45.linear_attn.norm.weight": "model-00003-of-00003.safetensors",
|
| 1179 |
+
"language_model.model.layers.45.linear_attn.out_proj.biases": "model-00003-of-00003.safetensors",
|
| 1180 |
+
"language_model.model.layers.45.linear_attn.out_proj.scales": "model-00003-of-00003.safetensors",
|
| 1181 |
+
"language_model.model.layers.45.linear_attn.out_proj.weight": "model-00003-of-00003.safetensors",
|
| 1182 |
+
"language_model.model.layers.45.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1183 |
+
"language_model.model.layers.45.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
| 1184 |
+
"language_model.model.layers.45.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
| 1185 |
+
"language_model.model.layers.45.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
|
| 1186 |
+
"language_model.model.layers.45.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
|
| 1187 |
+
"language_model.model.layers.45.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
| 1188 |
+
"language_model.model.layers.45.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
|
| 1189 |
+
"language_model.model.layers.45.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
|
| 1190 |
+
"language_model.model.layers.45.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
| 1191 |
+
"language_model.model.layers.45.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1192 |
+
"language_model.model.layers.46.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1193 |
+
"language_model.model.layers.46.linear_attn.A_log": "model-00003-of-00003.safetensors",
|
| 1194 |
+
"language_model.model.layers.46.linear_attn.conv1d.weight": "model-00003-of-00003.safetensors",
|
| 1195 |
+
"language_model.model.layers.46.linear_attn.dt_bias": "model-00003-of-00003.safetensors",
|
| 1196 |
+
"language_model.model.layers.46.linear_attn.in_proj_a.biases": "model-00003-of-00003.safetensors",
|
| 1197 |
+
"language_model.model.layers.46.linear_attn.in_proj_a.scales": "model-00003-of-00003.safetensors",
|
| 1198 |
+
"language_model.model.layers.46.linear_attn.in_proj_a.weight": "model-00003-of-00003.safetensors",
|
| 1199 |
+
"language_model.model.layers.46.linear_attn.in_proj_b.biases": "model-00003-of-00003.safetensors",
|
| 1200 |
+
"language_model.model.layers.46.linear_attn.in_proj_b.scales": "model-00003-of-00003.safetensors",
|
| 1201 |
+
"language_model.model.layers.46.linear_attn.in_proj_b.weight": "model-00003-of-00003.safetensors",
|
| 1202 |
+
"language_model.model.layers.46.linear_attn.in_proj_qkv.biases": "model-00003-of-00003.safetensors",
|
| 1203 |
+
"language_model.model.layers.46.linear_attn.in_proj_qkv.scales": "model-00003-of-00003.safetensors",
|
| 1204 |
+
"language_model.model.layers.46.linear_attn.in_proj_qkv.weight": "model-00003-of-00003.safetensors",
|
| 1205 |
+
"language_model.model.layers.46.linear_attn.in_proj_z.biases": "model-00003-of-00003.safetensors",
|
| 1206 |
+
"language_model.model.layers.46.linear_attn.in_proj_z.scales": "model-00003-of-00003.safetensors",
|
| 1207 |
+
"language_model.model.layers.46.linear_attn.in_proj_z.weight": "model-00003-of-00003.safetensors",
|
| 1208 |
+
"language_model.model.layers.46.linear_attn.norm.weight": "model-00003-of-00003.safetensors",
|
| 1209 |
+
"language_model.model.layers.46.linear_attn.out_proj.biases": "model-00003-of-00003.safetensors",
|
| 1210 |
+
"language_model.model.layers.46.linear_attn.out_proj.scales": "model-00003-of-00003.safetensors",
|
| 1211 |
+
"language_model.model.layers.46.linear_attn.out_proj.weight": "model-00003-of-00003.safetensors",
|
| 1212 |
"language_model.model.layers.46.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1213 |
"language_model.model.layers.46.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
| 1214 |
"language_model.model.layers.46.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
|
| 1215 |
+
"language_model.model.layers.46.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
|
| 1216 |
+
"language_model.model.layers.46.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
|
| 1217 |
+
"language_model.model.layers.46.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
|
| 1218 |
"language_model.model.layers.46.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
|
| 1219 |
"language_model.model.layers.46.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
|
| 1220 |
"language_model.model.layers.46.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
|
| 1221 |
+
"language_model.model.layers.46.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1222 |
"language_model.model.layers.47.input_layernorm.weight": "model-00003-of-00003.safetensors",
|
| 1223 |
"language_model.model.layers.47.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
|
| 1224 |
"language_model.model.layers.47.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
|
|
|
|
| 1849 |
"language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
|
| 1850 |
"language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
|
| 1851 |
"language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
|
| 1852 |
+
"language_model.model.norm.weight": "model-00003-of-00003.safetensors",
|
| 1853 |
+
"vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1854 |
+
"vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1855 |
+
"vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1856 |
+
"vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1857 |
+
"vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1858 |
+
"vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1859 |
+
"vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1860 |
+
"vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1861 |
+
"vision_tower.blocks.0.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1862 |
+
"vision_tower.blocks.0.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1863 |
+
"vision_tower.blocks.0.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1864 |
+
"vision_tower.blocks.0.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1865 |
+
"vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1866 |
+
"vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1867 |
+
"vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1868 |
+
"vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1869 |
+
"vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1870 |
+
"vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1871 |
+
"vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1872 |
+
"vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1873 |
+
"vision_tower.blocks.1.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1874 |
+
"vision_tower.blocks.1.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1875 |
+
"vision_tower.blocks.1.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1876 |
+
"vision_tower.blocks.1.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1877 |
+
"vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1878 |
+
"vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1879 |
+
"vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1880 |
+
"vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1881 |
+
"vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1882 |
+
"vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1883 |
+
"vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1884 |
+
"vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1885 |
+
"vision_tower.blocks.10.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1886 |
+
"vision_tower.blocks.10.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1887 |
+
"vision_tower.blocks.10.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1888 |
+
"vision_tower.blocks.10.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1889 |
+
"vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1890 |
+
"vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1891 |
+
"vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1892 |
+
"vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1893 |
+
"vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1894 |
+
"vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1895 |
+
"vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1896 |
+
"vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1897 |
+
"vision_tower.blocks.11.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1898 |
+
"vision_tower.blocks.11.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1899 |
+
"vision_tower.blocks.11.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1900 |
+
"vision_tower.blocks.11.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1901 |
+
"vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1902 |
+
"vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1903 |
+
"vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1904 |
+
"vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1905 |
+
"vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1906 |
+
"vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1907 |
+
"vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1908 |
+
"vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1909 |
+
"vision_tower.blocks.12.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1910 |
+
"vision_tower.blocks.12.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1911 |
+
"vision_tower.blocks.12.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1912 |
+
"vision_tower.blocks.12.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1913 |
+
"vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1914 |
+
"vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1915 |
+
"vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1916 |
+
"vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1917 |
+
"vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1918 |
+
"vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1919 |
+
"vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1920 |
+
"vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1921 |
+
"vision_tower.blocks.13.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1922 |
+
"vision_tower.blocks.13.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1923 |
+
"vision_tower.blocks.13.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1924 |
+
"vision_tower.blocks.13.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1925 |
+
"vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1926 |
+
"vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1927 |
+
"vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1928 |
+
"vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1929 |
+
"vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1930 |
+
"vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1931 |
+
"vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1932 |
+
"vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1933 |
+
"vision_tower.blocks.14.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1934 |
+
"vision_tower.blocks.14.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1935 |
+
"vision_tower.blocks.14.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1936 |
+
"vision_tower.blocks.14.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1937 |
+
"vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1938 |
+
"vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1939 |
+
"vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1940 |
+
"vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1941 |
+
"vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1942 |
+
"vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1943 |
+
"vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1944 |
+
"vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1945 |
+
"vision_tower.blocks.15.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1946 |
+
"vision_tower.blocks.15.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1947 |
+
"vision_tower.blocks.15.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1948 |
+
"vision_tower.blocks.15.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1949 |
+
"vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1950 |
+
"vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1951 |
+
"vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1952 |
+
"vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1953 |
+
"vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1954 |
+
"vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1955 |
+
"vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1956 |
+
"vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1957 |
+
"vision_tower.blocks.16.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1958 |
+
"vision_tower.blocks.16.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1959 |
+
"vision_tower.blocks.16.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1960 |
+
"vision_tower.blocks.16.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1961 |
+
"vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1962 |
+
"vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1963 |
+
"vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1964 |
+
"vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1965 |
+
"vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1966 |
+
"vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1967 |
+
"vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1968 |
+
"vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1969 |
+
"vision_tower.blocks.17.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1970 |
+
"vision_tower.blocks.17.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1971 |
+
"vision_tower.blocks.17.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1972 |
+
"vision_tower.blocks.17.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1973 |
+
"vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1974 |
+
"vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1975 |
+
"vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1976 |
+
"vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1977 |
+
"vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1978 |
+
"vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1979 |
+
"vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1980 |
+
"vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1981 |
+
"vision_tower.blocks.18.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1982 |
+
"vision_tower.blocks.18.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1983 |
+
"vision_tower.blocks.18.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1984 |
+
"vision_tower.blocks.18.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1985 |
+
"vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1986 |
+
"vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1987 |
+
"vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 1988 |
+
"vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 1989 |
+
"vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 1990 |
+
"vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 1991 |
+
"vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 1992 |
+
"vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 1993 |
+
"vision_tower.blocks.19.norm1.bias": "model-00001-of-00003.safetensors",
|
| 1994 |
+
"vision_tower.blocks.19.norm1.weight": "model-00001-of-00003.safetensors",
|
| 1995 |
+
"vision_tower.blocks.19.norm2.bias": "model-00001-of-00003.safetensors",
|
| 1996 |
+
"vision_tower.blocks.19.norm2.weight": "model-00001-of-00003.safetensors",
|
| 1997 |
+
"vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 1998 |
+
"vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 1999 |
+
"vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2000 |
+
"vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2001 |
+
"vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2002 |
+
"vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2003 |
+
"vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2004 |
+
"vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2005 |
+
"vision_tower.blocks.2.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2006 |
+
"vision_tower.blocks.2.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2007 |
+
"vision_tower.blocks.2.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2008 |
+
"vision_tower.blocks.2.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2009 |
+
"vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2010 |
+
"vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2011 |
+
"vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2012 |
+
"vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2013 |
+
"vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2014 |
+
"vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2015 |
+
"vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2016 |
+
"vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2017 |
+
"vision_tower.blocks.20.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2018 |
+
"vision_tower.blocks.20.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2019 |
+
"vision_tower.blocks.20.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2020 |
+
"vision_tower.blocks.20.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2021 |
+
"vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2022 |
+
"vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2023 |
+
"vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2024 |
+
"vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2025 |
+
"vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2026 |
+
"vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2027 |
+
"vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2028 |
+
"vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2029 |
+
"vision_tower.blocks.21.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2030 |
+
"vision_tower.blocks.21.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2031 |
+
"vision_tower.blocks.21.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2032 |
+
"vision_tower.blocks.21.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2033 |
+
"vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2034 |
+
"vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2035 |
+
"vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2036 |
+
"vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2037 |
+
"vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2038 |
+
"vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2039 |
+
"vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2040 |
+
"vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2041 |
+
"vision_tower.blocks.22.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2042 |
+
"vision_tower.blocks.22.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2043 |
+
"vision_tower.blocks.22.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2044 |
+
"vision_tower.blocks.22.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2045 |
+
"vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2046 |
+
"vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2047 |
+
"vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2048 |
+
"vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2049 |
+
"vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2050 |
+
"vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2051 |
+
"vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2052 |
+
"vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2053 |
+
"vision_tower.blocks.23.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2054 |
+
"vision_tower.blocks.23.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2055 |
+
"vision_tower.blocks.23.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2056 |
+
"vision_tower.blocks.23.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2057 |
+
"vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2058 |
+
"vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2059 |
+
"vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2060 |
+
"vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2061 |
+
"vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2062 |
+
"vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2063 |
+
"vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2064 |
+
"vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2065 |
+
"vision_tower.blocks.24.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2066 |
+
"vision_tower.blocks.24.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2067 |
+
"vision_tower.blocks.24.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2068 |
+
"vision_tower.blocks.24.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2069 |
+
"vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2070 |
+
"vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2071 |
+
"vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2072 |
+
"vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2073 |
+
"vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2074 |
+
"vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2075 |
+
"vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2076 |
+
"vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2077 |
+
"vision_tower.blocks.25.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2078 |
+
"vision_tower.blocks.25.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2079 |
+
"vision_tower.blocks.25.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2080 |
+
"vision_tower.blocks.25.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2081 |
+
"vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2082 |
+
"vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2083 |
+
"vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2084 |
+
"vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2085 |
+
"vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2086 |
+
"vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2087 |
+
"vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2088 |
+
"vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2089 |
+
"vision_tower.blocks.26.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2090 |
+
"vision_tower.blocks.26.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2091 |
+
"vision_tower.blocks.26.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2092 |
+
"vision_tower.blocks.26.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2093 |
+
"vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2094 |
+
"vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2095 |
+
"vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2096 |
+
"vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2097 |
+
"vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2098 |
+
"vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2099 |
+
"vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2100 |
+
"vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2101 |
+
"vision_tower.blocks.3.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2102 |
+
"vision_tower.blocks.3.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2103 |
+
"vision_tower.blocks.3.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2104 |
+
"vision_tower.blocks.3.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2105 |
+
"vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2106 |
+
"vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2107 |
+
"vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2108 |
+
"vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2109 |
+
"vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2110 |
+
"vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2111 |
+
"vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2112 |
+
"vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2113 |
+
"vision_tower.blocks.4.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2114 |
+
"vision_tower.blocks.4.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2115 |
+
"vision_tower.blocks.4.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2116 |
+
"vision_tower.blocks.4.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2117 |
+
"vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2118 |
+
"vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2119 |
+
"vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2120 |
+
"vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2121 |
+
"vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2122 |
+
"vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2123 |
+
"vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2124 |
+
"vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2125 |
+
"vision_tower.blocks.5.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2126 |
+
"vision_tower.blocks.5.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2127 |
+
"vision_tower.blocks.5.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2128 |
+
"vision_tower.blocks.5.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2129 |
+
"vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2130 |
+
"vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2131 |
+
"vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2132 |
+
"vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2133 |
+
"vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2134 |
+
"vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2135 |
+
"vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2136 |
+
"vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2137 |
+
"vision_tower.blocks.6.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2138 |
+
"vision_tower.blocks.6.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2139 |
+
"vision_tower.blocks.6.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2140 |
+
"vision_tower.blocks.6.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2141 |
+
"vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2142 |
+
"vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2143 |
+
"vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2144 |
+
"vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2145 |
+
"vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2146 |
+
"vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2147 |
+
"vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2148 |
+
"vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2149 |
+
"vision_tower.blocks.7.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2150 |
+
"vision_tower.blocks.7.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2151 |
+
"vision_tower.blocks.7.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2152 |
+
"vision_tower.blocks.7.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2153 |
+
"vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2154 |
+
"vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2155 |
+
"vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2156 |
+
"vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2157 |
+
"vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2158 |
+
"vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2159 |
+
"vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2160 |
+
"vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2161 |
+
"vision_tower.blocks.8.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2162 |
+
"vision_tower.blocks.8.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2163 |
+
"vision_tower.blocks.8.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2164 |
+
"vision_tower.blocks.8.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2165 |
+
"vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00003.safetensors",
|
| 2166 |
+
"vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00003.safetensors",
|
| 2167 |
+
"vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00003.safetensors",
|
| 2168 |
+
"vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00003.safetensors",
|
| 2169 |
+
"vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2170 |
+
"vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2171 |
+
"vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2172 |
+
"vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2173 |
+
"vision_tower.blocks.9.norm1.bias": "model-00001-of-00003.safetensors",
|
| 2174 |
+
"vision_tower.blocks.9.norm1.weight": "model-00001-of-00003.safetensors",
|
| 2175 |
+
"vision_tower.blocks.9.norm2.bias": "model-00001-of-00003.safetensors",
|
| 2176 |
+
"vision_tower.blocks.9.norm2.weight": "model-00001-of-00003.safetensors",
|
| 2177 |
+
"vision_tower.merger.linear_fc1.bias": "model-00001-of-00003.safetensors",
|
| 2178 |
+
"vision_tower.merger.linear_fc1.weight": "model-00001-of-00003.safetensors",
|
| 2179 |
+
"vision_tower.merger.linear_fc2.bias": "model-00001-of-00003.safetensors",
|
| 2180 |
+
"vision_tower.merger.linear_fc2.weight": "model-00001-of-00003.safetensors",
|
| 2181 |
+
"vision_tower.merger.norm.bias": "model-00001-of-00003.safetensors",
|
| 2182 |
+
"vision_tower.merger.norm.weight": "model-00001-of-00003.safetensors",
|
| 2183 |
+
"vision_tower.patch_embed.proj.bias": "model-00001-of-00003.safetensors",
|
| 2184 |
+
"vision_tower.patch_embed.proj.weight": "model-00001-of-00003.safetensors",
|
| 2185 |
+
"vision_tower.pos_embed.weight": "model-00001-of-00003.safetensors"
|
| 2186 |
}
|
| 2187 |
}
|
preprocessor_config.json
ADDED
|
@@ -0,0 +1,21 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"size": {
|
| 3 |
+
"longest_edge": 16777216,
|
| 4 |
+
"shortest_edge": 65536
|
| 5 |
+
},
|
| 6 |
+
"patch_size": 16,
|
| 7 |
+
"temporal_patch_size": 2,
|
| 8 |
+
"merge_size": 2,
|
| 9 |
+
"image_mean": [
|
| 10 |
+
0.5,
|
| 11 |
+
0.5,
|
| 12 |
+
0.5
|
| 13 |
+
],
|
| 14 |
+
"image_std": [
|
| 15 |
+
0.5,
|
| 16 |
+
0.5,
|
| 17 |
+
0.5
|
| 18 |
+
],
|
| 19 |
+
"processor_class": "Qwen3VLProcessor",
|
| 20 |
+
"image_processor_type": "Qwen2VLImageProcessorFast"
|
| 21 |
+
}
|
processor_config.json
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"image_processor": {
|
| 3 |
+
"do_convert_rgb": true,
|
| 4 |
+
"do_normalize": true,
|
| 5 |
+
"do_rescale": true,
|
| 6 |
+
"image_mean": [
|
| 7 |
+
0.5,
|
| 8 |
+
0.5,
|
| 9 |
+
0.5
|
| 10 |
+
],
|
| 11 |
+
"image_processor_type": "Qwen3VLImageProcessor",
|
| 12 |
+
"image_std": [
|
| 13 |
+
0.5,
|
| 14 |
+
0.5,
|
| 15 |
+
0.5
|
| 16 |
+
],
|
| 17 |
+
"max_pixels": 16777216,
|
| 18 |
+
"merge_size": 2,
|
| 19 |
+
"min_pixels": 65536,
|
| 20 |
+
"patch_size": 16,
|
| 21 |
+
"rescale_factor": 0.00392156862745098,
|
| 22 |
+
"temporal_patch_size": 2
|
| 23 |
+
},
|
| 24 |
+
"processor_class": "Qwen3VLProcessor",
|
| 25 |
+
"video_processor": {
|
| 26 |
+
"do_convert_rgb": true,
|
| 27 |
+
"do_normalize": true,
|
| 28 |
+
"do_rescale": true,
|
| 29 |
+
"fps": 2.0,
|
| 30 |
+
"image_mean": [
|
| 31 |
+
0.5,
|
| 32 |
+
0.5,
|
| 33 |
+
0.5
|
| 34 |
+
],
|
| 35 |
+
"image_std": [
|
| 36 |
+
0.5,
|
| 37 |
+
0.5,
|
| 38 |
+
0.5
|
| 39 |
+
],
|
| 40 |
+
"max_frames": 768,
|
| 41 |
+
"max_pixels": 25165824,
|
| 42 |
+
"merge_size": 2,
|
| 43 |
+
"min_frames": 4,
|
| 44 |
+
"min_pixels": 4096,
|
| 45 |
+
"patch_size": 16,
|
| 46 |
+
"rescale_factor": 0.00392156862745098,
|
| 47 |
+
"temporal_patch_size": 2,
|
| 48 |
+
"video_processor_type": "Qwen3VLVideoProcessor"
|
| 49 |
+
}
|
| 50 |
+
}
|
tokenizer_config.json
CHANGED
|
@@ -23,9 +23,9 @@
|
|
| 23 |
},
|
| 24 |
"pad_token": "<|endoftext|>",
|
| 25 |
"pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
|
|
|
|
| 26 |
"split_special_tokens": false,
|
| 27 |
"tokenizer_class": "Qwen2Tokenizer",
|
| 28 |
-
"tool_parser_type": "qwen3_coder",
|
| 29 |
"unk_token": null,
|
| 30 |
"video_token": "<|video_pad|>",
|
| 31 |
"vision_bos_token": "<|vision_start|>",
|
|
|
|
| 23 |
},
|
| 24 |
"pad_token": "<|endoftext|>",
|
| 25 |
"pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
|
| 26 |
+
"processor_class": "Qwen3VLProcessor",
|
| 27 |
"split_special_tokens": false,
|
| 28 |
"tokenizer_class": "Qwen2Tokenizer",
|
|
|
|
| 29 |
"unk_token": null,
|
| 30 |
"video_token": "<|video_pad|>",
|
| 31 |
"vision_bos_token": "<|vision_start|>",
|
video_preprocessor_config.json
ADDED
|
@@ -0,0 +1,21 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"size": {
|
| 3 |
+
"longest_edge": 25165824,
|
| 4 |
+
"shortest_edge": 4096
|
| 5 |
+
},
|
| 6 |
+
"patch_size": 16,
|
| 7 |
+
"temporal_patch_size": 2,
|
| 8 |
+
"merge_size": 2,
|
| 9 |
+
"image_mean": [
|
| 10 |
+
0.5,
|
| 11 |
+
0.5,
|
| 12 |
+
0.5
|
| 13 |
+
],
|
| 14 |
+
"image_std": [
|
| 15 |
+
0.5,
|
| 16 |
+
0.5,
|
| 17 |
+
0.5
|
| 18 |
+
],
|
| 19 |
+
"processor_class": "Qwen3VLProcessor",
|
| 20 |
+
"video_processor_type": "Qwen3VLVideoProcessor"
|
| 21 |
+
}
|
vocab.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|