gajesh commited on
Commit
2f330b9
·
verified ·
1 Parent(s): efd4e8c

Add complete Qwen3.8 VLM with pinned EigenLabs language weights

Browse files

Adds 333 vision_tower tensors and multimodal processor assets from mlx-community/Qwen3.8-27B-4bit@3e6447f082e89cc7f0bc6e5441afd38dfce760ff (official Qwen/Qwen3.8-27B@1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0), while preserving all 1,847 language_model tensors bitwise from EigenLabs/Qwen3.8-27B-4bit@eda45ab47f465d08d6558f0353a2346e2eb9d5b3. MTP remains separate.

README.md CHANGED
@@ -1,51 +1,47 @@
1
  ---
2
- language: en
3
  library_name: mlx
4
- pipeline_tag: text-generation
5
  license: apache-2.0
6
- base_model: Qwen/Qwen3.8-27B
 
 
 
7
  tags:
8
  - mlx
9
- - 4-bit
10
- - qwen3_5
11
  ---
12
 
13
- # Qwen3.8-27B-4bit
14
 
15
- This is a 4-bit MLX version of [Qwen/Qwen3.8-27B](https://huggingface.co/Qwen/Qwen3.8-27B).
16
 
17
- We made it from revision `1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0` of the official model.
18
- We used `mlx_lm.convert` with mlx 0.32.0.
19
- The quantization is affine, 4 bits, group size 64.
20
 
21
- ## Architecture
22
 
23
- - The model has 64 layers.
24
- - Each group of 4 layers has 3 linear-attention layers and 1 full-attention layer.
25
- - The hidden size is 5120.
26
- - The model has 24 attention heads and 4 KV heads. The head dimension is 256.
27
- - The vocabulary has 248,320 tokens.
28
- - The model type is `qwen3_5`.
29
 
30
- ## MTP head
 
 
 
 
 
 
 
31
 
32
- The official model has an MTP (multi-token-prediction) head.
33
- The head has 15 tensors.
34
- This repository does not contain these tensors.
35
- They are in [EigenLabs/Qwen3.8-27B-MTP-bf16](https://huggingface.co/EigenLabs/Qwen3.8-27B-MTP-bf16).
36
- That repository keeps them in bfloat16.
37
 
38
- ## Role
39
 
40
- The Qwen 3.8 MTP challenge uses this model as its reference.
41
- The track is `qwen3.8-27b-mtp-v1`.
42
- The challenge repository is [Layr-Labs/qwen-3.8-mtp-challenge](https://github.com/Layr-Labs/qwen-3.8-mtp-challenge).
43
- The challenge points to one fixed revision of this repository.
44
- The challenge compares its files against this revision, byte for byte.
45
 
46
- ## Usage
47
 
48
  ```bash
49
- pip install mlx-lm
50
- mlx_lm.generate --model EigenLabs/Qwen3.8-27B-4bit --prompt "Hello"
 
51
  ```
 
 
 
1
  ---
 
2
  library_name: mlx
 
3
  license: apache-2.0
4
+ pipeline_tag: image-text-to-text
5
+ base_model:
6
+ - Qwen/Qwen3.8-27B
7
+ - EigenLabs/Qwen3.8-27B-4bit
8
  tags:
9
  - mlx
10
+ - mlx-vlm
11
+ - vision
12
  ---
13
 
14
+ # EigenLabs/Qwen3.8-27B-4bit
15
 
16
+ This revision is a complete MLX 4-bit Qwen3.8 vision-language model for image, video, and text generation.
17
 
18
+ The **1,847 `language_model.*` tensors are bit-for-bit identical** to [`EigenLabs/Qwen3.8-27B-4bit@eda45ab47f465d08d6558f0353a2346e2eb9d5b3`](https://huggingface.co/EigenLabs/Qwen3.8-27B-4bit/tree/eda45ab47f465d08d6558f0353a2346e2eb9d5b3). The 333 `vision_tower.*` tensors and multimodal processor assets come from [`mlx-community/Qwen3.8-27B-4bit@3e6447f082e89cc7f0bc6e5441afd38dfce760ff`](https://huggingface.co/mlx-community/Qwen3.8-27B-4bit/tree/3e6447f082e89cc7f0bc6e5441afd38dfce760ff), converted from the official [`Qwen/Qwen3.8-27B@1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0`](https://huggingface.co/Qwen/Qwen3.8-27B/tree/1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0) source. Tensor dtype, shape, and raw bytes were checked before publication.
 
 
19
 
20
+ The immutable challenge revision [`eda45ab47f465d08d6558f0353a2346e2eb9d5b3`](https://huggingface.co/EigenLabs/Qwen3.8-27B-4bit/tree/eda45ab47f465d08d6558f0353a2346e2eb9d5b3) remains available and is text-only because it has no vision tower or processor assets. Multi-token prediction (MTP) is intentionally **not embedded** in this repository; the MTP artifact remains separate.
21
 
22
+ ## mlx-vlm
 
 
 
 
 
23
 
24
+ ```bash
25
+ pip install -U mlx-vlm
26
+ python -m mlx_vlm.generate \
27
+ --model EigenLabs/Qwen3.8-27B-4bit \
28
+ --image /path/to/image.jpg \
29
+ --prompt "Describe this image." \
30
+ --max-tokens 256
31
+ ```
32
 
33
+ Pin the immutable Hub commit shown in this model's history for reproducible deployment.
 
 
 
 
34
 
35
+ ## Darkbloom
36
 
37
+ This is the Hugging Face source artifact consumed by Darkbloom's in-process MLX VLM runtime. Darkbloom providers deploy only catalog-approved, immutable model revisions and verify their manifests before loading. Updating this repository alone does not register the model in the Darkbloom catalog or activate provider traffic.
 
 
 
 
38
 
39
+ After a Darkbloom catalog release pins the immutable Hub commit and publishes its verified manifest, a provider can discover and download that release:
40
 
41
  ```bash
42
+ darkbloom models catalog
43
+ darkbloom models download <catalog-model-id>
44
+ darkbloom start --foreground
45
  ```
46
+
47
+ `<catalog-model-id>` is assigned by the Darkbloom catalog; it is not the Hugging Face repository name.
config.json CHANGED
@@ -2,10 +2,23 @@
2
  "architectures": [
3
  "Qwen3_5ForConditionalGeneration"
4
  ],
 
5
  "eos_token_id": [
6
  248046,
7
  248044
8
  ],
 
 
 
 
 
 
 
 
 
 
 
 
9
  "image_token_id": 248056,
10
  "language_model_only": false,
11
  "model_type": "qwen3_5",
@@ -19,6 +32,7 @@
19
  "bits": 4,
20
  "mode": "affine"
21
  },
 
22
  "text_config": {
23
  "attention_bias": false,
24
  "attention_dropout": 0.0,
@@ -131,8 +145,26 @@
131
  "vocab_size": 248320
132
  },
133
  "tie_word_embeddings": false,
 
 
134
  "transformers_version": "5.8.0.dev0",
135
  "video_token_id": 248057,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
136
  "vision_end_token_id": 248054,
137
  "vision_start_token_id": 248053
138
  }
 
2
  "architectures": [
3
  "Qwen3_5ForConditionalGeneration"
4
  ],
5
+ "do_sample": true,
6
  "eos_token_id": [
7
  248046,
8
  248044
9
  ],
10
+ "generation_config": {
11
+ "bos_token_id": 248044,
12
+ "do_sample": true,
13
+ "eos_token_id": [
14
+ 248046,
15
+ 248044
16
+ ],
17
+ "pad_token_id": 248044,
18
+ "temperature": 1.0,
19
+ "top_k": 20,
20
+ "top_p": 0.95
21
+ },
22
  "image_token_id": 248056,
23
  "language_model_only": false,
24
  "model_type": "qwen3_5",
 
32
  "bits": 4,
33
  "mode": "affine"
34
  },
35
+ "temperature": 1.0,
36
  "text_config": {
37
  "attention_bias": false,
38
  "attention_dropout": 0.0,
 
145
  "vocab_size": 248320
146
  },
147
  "tie_word_embeddings": false,
148
+ "top_k": 20,
149
+ "top_p": 0.95,
150
  "transformers_version": "5.8.0.dev0",
151
  "video_token_id": 248057,
152
+ "vision_config": {
153
+ "deepstack_visual_indexes": [],
154
+ "depth": 27,
155
+ "hidden_act": "gelu_pytorch_tanh",
156
+ "hidden_size": 1152,
157
+ "in_channels": 3,
158
+ "initializer_range": 0.02,
159
+ "intermediate_size": 4304,
160
+ "model_type": "qwen3_5",
161
+ "num_heads": 16,
162
+ "num_position_embeddings": 2304,
163
+ "out_hidden_size": 5120,
164
+ "patch_size": 16,
165
+ "spatial_merge_size": 2,
166
+ "temporal_patch_size": 2
167
+ },
168
  "vision_end_token_id": 248054,
169
  "vision_start_token_id": 248053
170
  }
model-00001-of-00003.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:075eac5fbba3951bc4870c1ac65d684c32e0abb24284201bd27f49df56735963
3
- size 5328325648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6cc1508e96fb5d0865dfd5753a79f4ec60651bf3e2a82844a7e8ae9c60528c0d
3
+ size 5343268662
model-00002-of-00003.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6c99c446987a432beb1f6ef7d6fde6db02682f1ebe1a913760953140e0fa4e47
3
  size 5354185130
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:83f2a20ca8058f486a3634a27faf99587f4cd3c156a83dee34fb99e6ac178670
3
  size 5354185130
model-00003-of-00003.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0e267246064a1e635077dd05e22181f5eda44a1fa8a67dcf46c903f858bbe35b
3
- size 4450532735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:31b8c91ef899f79efaaa69e3d2c096f6e2ebeb2ff20e29222abbd9ebc79e560a
3
+ size 5357087557
model.safetensors.index.json CHANGED
@@ -1,7 +1,6 @@
1
  {
2
  "metadata": {
3
- "total_size": 15132802048,
4
- "total_parameters": 26895993856
5
  },
6
  "weight_map": {
7
  "language_model.lm_head.biases": "model-00003-of-00003.safetensors",
@@ -290,71 +289,71 @@
290
  "language_model.model.layers.17.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
291
  "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
292
  "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
293
- "language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
294
- "language_model.model.layers.17.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
295
- "language_model.model.layers.17.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
296
- "language_model.model.layers.17.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
297
- "language_model.model.layers.17.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
298
- "language_model.model.layers.17.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
299
- "language_model.model.layers.17.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
300
- "language_model.model.layers.17.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
301
- "language_model.model.layers.17.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
302
  "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
303
- "language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00003.safetensors",
304
- "language_model.model.layers.18.linear_attn.A_log": "model-00001-of-00003.safetensors",
305
- "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
306
- "language_model.model.layers.18.linear_attn.dt_bias": "model-00001-of-00003.safetensors",
307
- "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00001-of-00003.safetensors",
308
- "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00001-of-00003.safetensors",
309
- "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors",
310
- "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00001-of-00003.safetensors",
311
- "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00001-of-00003.safetensors",
312
- "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors",
313
- "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00001-of-00003.safetensors",
314
- "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00001-of-00003.safetensors",
315
- "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors",
316
- "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00001-of-00003.safetensors",
317
- "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00001-of-00003.safetensors",
318
- "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors",
319
- "language_model.model.layers.18.linear_attn.norm.weight": "model-00001-of-00003.safetensors",
320
- "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
321
- "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
322
- "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
323
- "language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
324
- "language_model.model.layers.18.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
325
- "language_model.model.layers.18.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
326
- "language_model.model.layers.18.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
327
- "language_model.model.layers.18.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
328
- "language_model.model.layers.18.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
329
- "language_model.model.layers.18.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
330
- "language_model.model.layers.18.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
331
- "language_model.model.layers.18.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
332
- "language_model.model.layers.18.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
333
- "language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00003.safetensors",
334
- "language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
335
- "language_model.model.layers.19.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
336
- "language_model.model.layers.19.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
337
- "language_model.model.layers.19.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
338
- "language_model.model.layers.19.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
339
- "language_model.model.layers.19.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
340
- "language_model.model.layers.19.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
341
- "language_model.model.layers.19.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
342
- "language_model.model.layers.19.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
343
- "language_model.model.layers.19.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
344
- "language_model.model.layers.19.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
345
- "language_model.model.layers.19.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
346
- "language_model.model.layers.19.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
347
- "language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
348
- "language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
349
- "language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
350
- "language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
351
- "language_model.model.layers.19.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
352
- "language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
353
- "language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
354
- "language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
355
- "language_model.model.layers.19.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
356
- "language_model.model.layers.19.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
357
- "language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
358
  "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
359
  "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00003.safetensors",
360
  "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
@@ -385,66 +384,66 @@
385
  "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
386
  "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
387
  "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
388
- "language_model.model.layers.20.input_layernorm.weight": "model-00001-of-00003.safetensors",
389
- "language_model.model.layers.20.linear_attn.A_log": "model-00001-of-00003.safetensors",
390
- "language_model.model.layers.20.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
391
- "language_model.model.layers.20.linear_attn.dt_bias": "model-00001-of-00003.safetensors",
392
- "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00001-of-00003.safetensors",
393
- "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00001-of-00003.safetensors",
394
- "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors",
395
- "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00001-of-00003.safetensors",
396
- "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00001-of-00003.safetensors",
397
- "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors",
398
- "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00001-of-00003.safetensors",
399
- "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00001-of-00003.safetensors",
400
- "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors",
401
- "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00001-of-00003.safetensors",
402
- "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00001-of-00003.safetensors",
403
- "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors",
404
- "language_model.model.layers.20.linear_attn.norm.weight": "model-00001-of-00003.safetensors",
405
- "language_model.model.layers.20.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
406
- "language_model.model.layers.20.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
407
- "language_model.model.layers.20.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
408
- "language_model.model.layers.20.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
409
- "language_model.model.layers.20.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
410
- "language_model.model.layers.20.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
411
- "language_model.model.layers.20.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
412
- "language_model.model.layers.20.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
413
- "language_model.model.layers.20.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
414
- "language_model.model.layers.20.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
415
- "language_model.model.layers.20.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
416
- "language_model.model.layers.20.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
417
- "language_model.model.layers.20.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
418
- "language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00003.safetensors",
419
- "language_model.model.layers.21.linear_attn.A_log": "model-00001-of-00003.safetensors",
420
- "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
421
- "language_model.model.layers.21.linear_attn.dt_bias": "model-00001-of-00003.safetensors",
422
- "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00001-of-00003.safetensors",
423
- "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00001-of-00003.safetensors",
424
- "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors",
425
- "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00001-of-00003.safetensors",
426
- "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00001-of-00003.safetensors",
427
- "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors",
428
- "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00001-of-00003.safetensors",
429
- "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00001-of-00003.safetensors",
430
- "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors",
431
- "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00001-of-00003.safetensors",
432
- "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00001-of-00003.safetensors",
433
- "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors",
434
- "language_model.model.layers.21.linear_attn.norm.weight": "model-00001-of-00003.safetensors",
435
- "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
436
- "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
437
- "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
438
  "language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
439
  "language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
440
  "language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
441
- "language_model.model.layers.21.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
442
- "language_model.model.layers.21.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
443
- "language_model.model.layers.21.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
444
  "language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
445
  "language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
446
  "language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
447
- "language_model.model.layers.21.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
448
  "language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
449
  "language_model.model.layers.22.linear_attn.A_log": "model-00002-of-00003.safetensors",
450
  "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
@@ -1095,131 +1094,131 @@
1095
  "language_model.model.layers.42.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
1096
  "language_model.model.layers.42.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
1097
  "language_model.model.layers.42.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
1098
- "language_model.model.layers.42.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
1099
- "language_model.model.layers.42.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
1100
- "language_model.model.layers.42.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
1101
- "language_model.model.layers.42.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
1102
- "language_model.model.layers.42.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
1103
- "language_model.model.layers.42.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
1104
- "language_model.model.layers.42.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
1105
- "language_model.model.layers.42.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
1106
- "language_model.model.layers.42.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
1107
  "language_model.model.layers.42.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
1108
- "language_model.model.layers.43.input_layernorm.weight": "model-00002-of-00003.safetensors",
1109
- "language_model.model.layers.43.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
1110
- "language_model.model.layers.43.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
1111
- "language_model.model.layers.43.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
1112
- "language_model.model.layers.43.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
1113
- "language_model.model.layers.43.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
1114
- "language_model.model.layers.43.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
1115
- "language_model.model.layers.43.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
1116
- "language_model.model.layers.43.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
1117
- "language_model.model.layers.43.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
1118
- "language_model.model.layers.43.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
1119
- "language_model.model.layers.43.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
1120
- "language_model.model.layers.43.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
1121
- "language_model.model.layers.43.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
1122
- "language_model.model.layers.43.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
1123
- "language_model.model.layers.43.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
1124
- "language_model.model.layers.43.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
1125
- "language_model.model.layers.43.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
1126
- "language_model.model.layers.43.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
1127
- "language_model.model.layers.43.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
1128
- "language_model.model.layers.43.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
1129
- "language_model.model.layers.43.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
1130
- "language_model.model.layers.43.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
1131
- "language_model.model.layers.43.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
1132
- "language_model.model.layers.43.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
1133
- "language_model.model.layers.44.input_layernorm.weight": "model-00002-of-00003.safetensors",
1134
- "language_model.model.layers.44.linear_attn.A_log": "model-00002-of-00003.safetensors",
1135
- "language_model.model.layers.44.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
1136
- "language_model.model.layers.44.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
1137
- "language_model.model.layers.44.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
1138
- "language_model.model.layers.44.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
1139
- "language_model.model.layers.44.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
1140
- "language_model.model.layers.44.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
1141
- "language_model.model.layers.44.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
1142
- "language_model.model.layers.44.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
1143
- "language_model.model.layers.44.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
1144
- "language_model.model.layers.44.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
1145
- "language_model.model.layers.44.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
1146
- "language_model.model.layers.44.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
1147
- "language_model.model.layers.44.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
1148
- "language_model.model.layers.44.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
1149
- "language_model.model.layers.44.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
1150
- "language_model.model.layers.44.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
1151
- "language_model.model.layers.44.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
1152
- "language_model.model.layers.44.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
1153
- "language_model.model.layers.44.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
1154
- "language_model.model.layers.44.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
1155
- "language_model.model.layers.44.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
1156
- "language_model.model.layers.44.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
1157
- "language_model.model.layers.44.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
1158
- "language_model.model.layers.44.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
1159
- "language_model.model.layers.44.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
1160
- "language_model.model.layers.44.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
1161
- "language_model.model.layers.44.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
1162
- "language_model.model.layers.44.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
1163
- "language_model.model.layers.45.input_layernorm.weight": "model-00002-of-00003.safetensors",
1164
- "language_model.model.layers.45.linear_attn.A_log": "model-00002-of-00003.safetensors",
1165
- "language_model.model.layers.45.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
1166
- "language_model.model.layers.45.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
1167
- "language_model.model.layers.45.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
1168
- "language_model.model.layers.45.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
1169
- "language_model.model.layers.45.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
1170
- "language_model.model.layers.45.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
1171
- "language_model.model.layers.45.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
1172
- "language_model.model.layers.45.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
1173
- "language_model.model.layers.45.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
1174
- "language_model.model.layers.45.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
1175
- "language_model.model.layers.45.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
1176
- "language_model.model.layers.45.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
1177
- "language_model.model.layers.45.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
1178
- "language_model.model.layers.45.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
1179
- "language_model.model.layers.45.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
1180
- "language_model.model.layers.45.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
1181
- "language_model.model.layers.45.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
1182
- "language_model.model.layers.45.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
1183
- "language_model.model.layers.45.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
1184
- "language_model.model.layers.45.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
1185
- "language_model.model.layers.45.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
1186
- "language_model.model.layers.45.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
1187
- "language_model.model.layers.45.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
1188
- "language_model.model.layers.45.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
1189
- "language_model.model.layers.45.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
1190
- "language_model.model.layers.45.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
1191
- "language_model.model.layers.45.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
1192
- "language_model.model.layers.45.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
1193
- "language_model.model.layers.46.input_layernorm.weight": "model-00002-of-00003.safetensors",
1194
- "language_model.model.layers.46.linear_attn.A_log": "model-00002-of-00003.safetensors",
1195
- "language_model.model.layers.46.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
1196
- "language_model.model.layers.46.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
1197
- "language_model.model.layers.46.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
1198
- "language_model.model.layers.46.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
1199
- "language_model.model.layers.46.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
1200
- "language_model.model.layers.46.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
1201
- "language_model.model.layers.46.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
1202
- "language_model.model.layers.46.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
1203
- "language_model.model.layers.46.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
1204
- "language_model.model.layers.46.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
1205
- "language_model.model.layers.46.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
1206
- "language_model.model.layers.46.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
1207
- "language_model.model.layers.46.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
1208
- "language_model.model.layers.46.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
1209
- "language_model.model.layers.46.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
1210
- "language_model.model.layers.46.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
1211
- "language_model.model.layers.46.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
1212
- "language_model.model.layers.46.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
1213
  "language_model.model.layers.46.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1214
  "language_model.model.layers.46.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
1215
  "language_model.model.layers.46.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
1216
- "language_model.model.layers.46.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
1217
- "language_model.model.layers.46.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
1218
- "language_model.model.layers.46.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
1219
  "language_model.model.layers.46.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
1220
  "language_model.model.layers.46.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
1221
  "language_model.model.layers.46.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
1222
- "language_model.model.layers.46.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
1223
  "language_model.model.layers.47.input_layernorm.weight": "model-00003-of-00003.safetensors",
1224
  "language_model.model.layers.47.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1225
  "language_model.model.layers.47.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
@@ -1850,6 +1849,339 @@
1850
  "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
1851
  "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
1852
  "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
1853
- "language_model.model.norm.weight": "model-00003-of-00003.safetensors"
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1854
  }
1855
  }
 
1
  {
2
  "metadata": {
3
+ "total_size": 16054262240
 
4
  },
5
  "weight_map": {
6
  "language_model.lm_head.biases": "model-00003-of-00003.safetensors",
 
289
  "language_model.model.layers.17.linear_attn.out_proj.biases": "model-00001-of-00003.safetensors",
290
  "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00001-of-00003.safetensors",
291
  "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors",
292
+ "language_model.model.layers.17.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
293
+ "language_model.model.layers.17.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
294
+ "language_model.model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
295
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
296
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
297
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
298
+ "language_model.model.layers.17.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
299
+ "language_model.model.layers.17.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
300
+ "language_model.model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
301
  "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
302
+ "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
303
+ "language_model.model.layers.18.linear_attn.A_log": "model-00002-of-00003.safetensors",
304
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
305
+ "language_model.model.layers.18.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
306
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
307
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
308
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
309
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
310
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
311
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
312
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
313
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
314
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
315
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
316
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
317
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
318
+ "language_model.model.layers.18.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
319
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
320
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
321
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
322
+ "language_model.model.layers.18.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
323
+ "language_model.model.layers.18.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
324
+ "language_model.model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
325
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
326
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
327
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
328
+ "language_model.model.layers.18.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
329
+ "language_model.model.layers.18.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
330
+ "language_model.model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
331
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
332
+ "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
333
+ "language_model.model.layers.19.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
334
+ "language_model.model.layers.19.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
335
+ "language_model.model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
336
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
337
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
338
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
339
+ "language_model.model.layers.19.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
340
+ "language_model.model.layers.19.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
341
+ "language_model.model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
342
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
343
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
344
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
345
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
346
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
347
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
348
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
349
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
350
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
351
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
352
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
353
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
354
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
355
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
356
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
357
  "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
358
  "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00003.safetensors",
359
  "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors",
 
384
  "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
385
  "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
386
  "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
387
+ "language_model.model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
388
+ "language_model.model.layers.20.linear_attn.A_log": "model-00002-of-00003.safetensors",
389
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
390
+ "language_model.model.layers.20.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
391
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
392
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
393
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
394
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
395
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
396
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
397
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
398
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
399
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
400
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
401
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
402
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
403
+ "language_model.model.layers.20.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
404
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
405
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
406
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
407
+ "language_model.model.layers.20.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
408
+ "language_model.model.layers.20.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
409
+ "language_model.model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
410
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
411
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
412
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
413
+ "language_model.model.layers.20.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
414
+ "language_model.model.layers.20.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
415
+ "language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
416
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
417
+ "language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
418
+ "language_model.model.layers.21.linear_attn.A_log": "model-00002-of-00003.safetensors",
419
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
420
+ "language_model.model.layers.21.linear_attn.dt_bias": "model-00002-of-00003.safetensors",
421
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00002-of-00003.safetensors",
422
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00002-of-00003.safetensors",
423
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors",
424
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00002-of-00003.safetensors",
425
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00002-of-00003.safetensors",
426
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors",
427
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00002-of-00003.safetensors",
428
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00002-of-00003.safetensors",
429
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors",
430
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00002-of-00003.safetensors",
431
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00002-of-00003.safetensors",
432
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors",
433
+ "language_model.model.layers.21.linear_attn.norm.weight": "model-00002-of-00003.safetensors",
434
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
435
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
436
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
437
  "language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
438
  "language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
439
  "language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
440
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
441
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
442
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
443
  "language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
444
  "language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
445
  "language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
446
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
447
  "language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
448
  "language_model.model.layers.22.linear_attn.A_log": "model-00002-of-00003.safetensors",
449
  "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors",
 
1094
  "language_model.model.layers.42.linear_attn.out_proj.biases": "model-00002-of-00003.safetensors",
1095
  "language_model.model.layers.42.linear_attn.out_proj.scales": "model-00002-of-00003.safetensors",
1096
  "language_model.model.layers.42.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors",
1097
+ "language_model.model.layers.42.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1098
+ "language_model.model.layers.42.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
1099
+ "language_model.model.layers.42.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
1100
+ "language_model.model.layers.42.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
1101
+ "language_model.model.layers.42.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
1102
+ "language_model.model.layers.42.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
1103
+ "language_model.model.layers.42.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
1104
+ "language_model.model.layers.42.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
1105
+ "language_model.model.layers.42.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
1106
  "language_model.model.layers.42.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
1107
+ "language_model.model.layers.43.input_layernorm.weight": "model-00003-of-00003.safetensors",
1108
+ "language_model.model.layers.43.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1109
+ "language_model.model.layers.43.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
1110
+ "language_model.model.layers.43.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
1111
+ "language_model.model.layers.43.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
1112
+ "language_model.model.layers.43.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
1113
+ "language_model.model.layers.43.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
1114
+ "language_model.model.layers.43.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
1115
+ "language_model.model.layers.43.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
1116
+ "language_model.model.layers.43.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
1117
+ "language_model.model.layers.43.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
1118
+ "language_model.model.layers.43.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
1119
+ "language_model.model.layers.43.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
1120
+ "language_model.model.layers.43.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
1121
+ "language_model.model.layers.43.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
1122
+ "language_model.model.layers.43.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
1123
+ "language_model.model.layers.43.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
1124
+ "language_model.model.layers.43.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
1125
+ "language_model.model.layers.43.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
1126
+ "language_model.model.layers.43.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
1127
+ "language_model.model.layers.43.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
1128
+ "language_model.model.layers.43.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
1129
+ "language_model.model.layers.43.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
1130
+ "language_model.model.layers.43.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
1131
+ "language_model.model.layers.43.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
1132
+ "language_model.model.layers.44.input_layernorm.weight": "model-00003-of-00003.safetensors",
1133
+ "language_model.model.layers.44.linear_attn.A_log": "model-00003-of-00003.safetensors",
1134
+ "language_model.model.layers.44.linear_attn.conv1d.weight": "model-00003-of-00003.safetensors",
1135
+ "language_model.model.layers.44.linear_attn.dt_bias": "model-00003-of-00003.safetensors",
1136
+ "language_model.model.layers.44.linear_attn.in_proj_a.biases": "model-00003-of-00003.safetensors",
1137
+ "language_model.model.layers.44.linear_attn.in_proj_a.scales": "model-00003-of-00003.safetensors",
1138
+ "language_model.model.layers.44.linear_attn.in_proj_a.weight": "model-00003-of-00003.safetensors",
1139
+ "language_model.model.layers.44.linear_attn.in_proj_b.biases": "model-00003-of-00003.safetensors",
1140
+ "language_model.model.layers.44.linear_attn.in_proj_b.scales": "model-00003-of-00003.safetensors",
1141
+ "language_model.model.layers.44.linear_attn.in_proj_b.weight": "model-00003-of-00003.safetensors",
1142
+ "language_model.model.layers.44.linear_attn.in_proj_qkv.biases": "model-00003-of-00003.safetensors",
1143
+ "language_model.model.layers.44.linear_attn.in_proj_qkv.scales": "model-00003-of-00003.safetensors",
1144
+ "language_model.model.layers.44.linear_attn.in_proj_qkv.weight": "model-00003-of-00003.safetensors",
1145
+ "language_model.model.layers.44.linear_attn.in_proj_z.biases": "model-00003-of-00003.safetensors",
1146
+ "language_model.model.layers.44.linear_attn.in_proj_z.scales": "model-00003-of-00003.safetensors",
1147
+ "language_model.model.layers.44.linear_attn.in_proj_z.weight": "model-00003-of-00003.safetensors",
1148
+ "language_model.model.layers.44.linear_attn.norm.weight": "model-00003-of-00003.safetensors",
1149
+ "language_model.model.layers.44.linear_attn.out_proj.biases": "model-00003-of-00003.safetensors",
1150
+ "language_model.model.layers.44.linear_attn.out_proj.scales": "model-00003-of-00003.safetensors",
1151
+ "language_model.model.layers.44.linear_attn.out_proj.weight": "model-00003-of-00003.safetensors",
1152
+ "language_model.model.layers.44.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1153
+ "language_model.model.layers.44.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
1154
+ "language_model.model.layers.44.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
1155
+ "language_model.model.layers.44.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
1156
+ "language_model.model.layers.44.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
1157
+ "language_model.model.layers.44.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
1158
+ "language_model.model.layers.44.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
1159
+ "language_model.model.layers.44.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
1160
+ "language_model.model.layers.44.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
1161
+ "language_model.model.layers.44.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
1162
+ "language_model.model.layers.45.input_layernorm.weight": "model-00003-of-00003.safetensors",
1163
+ "language_model.model.layers.45.linear_attn.A_log": "model-00003-of-00003.safetensors",
1164
+ "language_model.model.layers.45.linear_attn.conv1d.weight": "model-00003-of-00003.safetensors",
1165
+ "language_model.model.layers.45.linear_attn.dt_bias": "model-00003-of-00003.safetensors",
1166
+ "language_model.model.layers.45.linear_attn.in_proj_a.biases": "model-00003-of-00003.safetensors",
1167
+ "language_model.model.layers.45.linear_attn.in_proj_a.scales": "model-00003-of-00003.safetensors",
1168
+ "language_model.model.layers.45.linear_attn.in_proj_a.weight": "model-00003-of-00003.safetensors",
1169
+ "language_model.model.layers.45.linear_attn.in_proj_b.biases": "model-00003-of-00003.safetensors",
1170
+ "language_model.model.layers.45.linear_attn.in_proj_b.scales": "model-00003-of-00003.safetensors",
1171
+ "language_model.model.layers.45.linear_attn.in_proj_b.weight": "model-00003-of-00003.safetensors",
1172
+ "language_model.model.layers.45.linear_attn.in_proj_qkv.biases": "model-00003-of-00003.safetensors",
1173
+ "language_model.model.layers.45.linear_attn.in_proj_qkv.scales": "model-00003-of-00003.safetensors",
1174
+ "language_model.model.layers.45.linear_attn.in_proj_qkv.weight": "model-00003-of-00003.safetensors",
1175
+ "language_model.model.layers.45.linear_attn.in_proj_z.biases": "model-00003-of-00003.safetensors",
1176
+ "language_model.model.layers.45.linear_attn.in_proj_z.scales": "model-00003-of-00003.safetensors",
1177
+ "language_model.model.layers.45.linear_attn.in_proj_z.weight": "model-00003-of-00003.safetensors",
1178
+ "language_model.model.layers.45.linear_attn.norm.weight": "model-00003-of-00003.safetensors",
1179
+ "language_model.model.layers.45.linear_attn.out_proj.biases": "model-00003-of-00003.safetensors",
1180
+ "language_model.model.layers.45.linear_attn.out_proj.scales": "model-00003-of-00003.safetensors",
1181
+ "language_model.model.layers.45.linear_attn.out_proj.weight": "model-00003-of-00003.safetensors",
1182
+ "language_model.model.layers.45.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1183
+ "language_model.model.layers.45.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
1184
+ "language_model.model.layers.45.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
1185
+ "language_model.model.layers.45.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
1186
+ "language_model.model.layers.45.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
1187
+ "language_model.model.layers.45.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
1188
+ "language_model.model.layers.45.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
1189
+ "language_model.model.layers.45.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
1190
+ "language_model.model.layers.45.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
1191
+ "language_model.model.layers.45.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
1192
+ "language_model.model.layers.46.input_layernorm.weight": "model-00003-of-00003.safetensors",
1193
+ "language_model.model.layers.46.linear_attn.A_log": "model-00003-of-00003.safetensors",
1194
+ "language_model.model.layers.46.linear_attn.conv1d.weight": "model-00003-of-00003.safetensors",
1195
+ "language_model.model.layers.46.linear_attn.dt_bias": "model-00003-of-00003.safetensors",
1196
+ "language_model.model.layers.46.linear_attn.in_proj_a.biases": "model-00003-of-00003.safetensors",
1197
+ "language_model.model.layers.46.linear_attn.in_proj_a.scales": "model-00003-of-00003.safetensors",
1198
+ "language_model.model.layers.46.linear_attn.in_proj_a.weight": "model-00003-of-00003.safetensors",
1199
+ "language_model.model.layers.46.linear_attn.in_proj_b.biases": "model-00003-of-00003.safetensors",
1200
+ "language_model.model.layers.46.linear_attn.in_proj_b.scales": "model-00003-of-00003.safetensors",
1201
+ "language_model.model.layers.46.linear_attn.in_proj_b.weight": "model-00003-of-00003.safetensors",
1202
+ "language_model.model.layers.46.linear_attn.in_proj_qkv.biases": "model-00003-of-00003.safetensors",
1203
+ "language_model.model.layers.46.linear_attn.in_proj_qkv.scales": "model-00003-of-00003.safetensors",
1204
+ "language_model.model.layers.46.linear_attn.in_proj_qkv.weight": "model-00003-of-00003.safetensors",
1205
+ "language_model.model.layers.46.linear_attn.in_proj_z.biases": "model-00003-of-00003.safetensors",
1206
+ "language_model.model.layers.46.linear_attn.in_proj_z.scales": "model-00003-of-00003.safetensors",
1207
+ "language_model.model.layers.46.linear_attn.in_proj_z.weight": "model-00003-of-00003.safetensors",
1208
+ "language_model.model.layers.46.linear_attn.norm.weight": "model-00003-of-00003.safetensors",
1209
+ "language_model.model.layers.46.linear_attn.out_proj.biases": "model-00003-of-00003.safetensors",
1210
+ "language_model.model.layers.46.linear_attn.out_proj.scales": "model-00003-of-00003.safetensors",
1211
+ "language_model.model.layers.46.linear_attn.out_proj.weight": "model-00003-of-00003.safetensors",
1212
  "language_model.model.layers.46.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1213
  "language_model.model.layers.46.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
1214
  "language_model.model.layers.46.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
1215
+ "language_model.model.layers.46.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
1216
+ "language_model.model.layers.46.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
1217
+ "language_model.model.layers.46.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
1218
  "language_model.model.layers.46.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
1219
  "language_model.model.layers.46.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
1220
  "language_model.model.layers.46.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
1221
+ "language_model.model.layers.46.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
1222
  "language_model.model.layers.47.input_layernorm.weight": "model-00003-of-00003.safetensors",
1223
  "language_model.model.layers.47.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
1224
  "language_model.model.layers.47.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
 
1849
  "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
1850
  "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
1851
  "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
1852
+ "language_model.model.norm.weight": "model-00003-of-00003.safetensors",
1853
+ "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00003.safetensors",
1854
+ "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00003.safetensors",
1855
+ "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00003.safetensors",
1856
+ "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00003.safetensors",
1857
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1858
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1859
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1860
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1861
+ "vision_tower.blocks.0.norm1.bias": "model-00001-of-00003.safetensors",
1862
+ "vision_tower.blocks.0.norm1.weight": "model-00001-of-00003.safetensors",
1863
+ "vision_tower.blocks.0.norm2.bias": "model-00001-of-00003.safetensors",
1864
+ "vision_tower.blocks.0.norm2.weight": "model-00001-of-00003.safetensors",
1865
+ "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00003.safetensors",
1866
+ "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00003.safetensors",
1867
+ "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00003.safetensors",
1868
+ "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00003.safetensors",
1869
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1870
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1871
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1872
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1873
+ "vision_tower.blocks.1.norm1.bias": "model-00001-of-00003.safetensors",
1874
+ "vision_tower.blocks.1.norm1.weight": "model-00001-of-00003.safetensors",
1875
+ "vision_tower.blocks.1.norm2.bias": "model-00001-of-00003.safetensors",
1876
+ "vision_tower.blocks.1.norm2.weight": "model-00001-of-00003.safetensors",
1877
+ "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00003.safetensors",
1878
+ "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00003.safetensors",
1879
+ "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00003.safetensors",
1880
+ "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00003.safetensors",
1881
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1882
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1883
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1884
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1885
+ "vision_tower.blocks.10.norm1.bias": "model-00001-of-00003.safetensors",
1886
+ "vision_tower.blocks.10.norm1.weight": "model-00001-of-00003.safetensors",
1887
+ "vision_tower.blocks.10.norm2.bias": "model-00001-of-00003.safetensors",
1888
+ "vision_tower.blocks.10.norm2.weight": "model-00001-of-00003.safetensors",
1889
+ "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00003.safetensors",
1890
+ "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00003.safetensors",
1891
+ "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00003.safetensors",
1892
+ "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00003.safetensors",
1893
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1894
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1895
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1896
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1897
+ "vision_tower.blocks.11.norm1.bias": "model-00001-of-00003.safetensors",
1898
+ "vision_tower.blocks.11.norm1.weight": "model-00001-of-00003.safetensors",
1899
+ "vision_tower.blocks.11.norm2.bias": "model-00001-of-00003.safetensors",
1900
+ "vision_tower.blocks.11.norm2.weight": "model-00001-of-00003.safetensors",
1901
+ "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00003.safetensors",
1902
+ "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00003.safetensors",
1903
+ "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00003.safetensors",
1904
+ "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00003.safetensors",
1905
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1906
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1907
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1908
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1909
+ "vision_tower.blocks.12.norm1.bias": "model-00001-of-00003.safetensors",
1910
+ "vision_tower.blocks.12.norm1.weight": "model-00001-of-00003.safetensors",
1911
+ "vision_tower.blocks.12.norm2.bias": "model-00001-of-00003.safetensors",
1912
+ "vision_tower.blocks.12.norm2.weight": "model-00001-of-00003.safetensors",
1913
+ "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00003.safetensors",
1914
+ "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00003.safetensors",
1915
+ "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00003.safetensors",
1916
+ "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00003.safetensors",
1917
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1918
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1919
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1920
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1921
+ "vision_tower.blocks.13.norm1.bias": "model-00001-of-00003.safetensors",
1922
+ "vision_tower.blocks.13.norm1.weight": "model-00001-of-00003.safetensors",
1923
+ "vision_tower.blocks.13.norm2.bias": "model-00001-of-00003.safetensors",
1924
+ "vision_tower.blocks.13.norm2.weight": "model-00001-of-00003.safetensors",
1925
+ "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00003.safetensors",
1926
+ "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00003.safetensors",
1927
+ "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00003.safetensors",
1928
+ "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00003.safetensors",
1929
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1930
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1931
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1932
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1933
+ "vision_tower.blocks.14.norm1.bias": "model-00001-of-00003.safetensors",
1934
+ "vision_tower.blocks.14.norm1.weight": "model-00001-of-00003.safetensors",
1935
+ "vision_tower.blocks.14.norm2.bias": "model-00001-of-00003.safetensors",
1936
+ "vision_tower.blocks.14.norm2.weight": "model-00001-of-00003.safetensors",
1937
+ "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00003.safetensors",
1938
+ "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00003.safetensors",
1939
+ "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00003.safetensors",
1940
+ "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00003.safetensors",
1941
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1942
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1943
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1944
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1945
+ "vision_tower.blocks.15.norm1.bias": "model-00001-of-00003.safetensors",
1946
+ "vision_tower.blocks.15.norm1.weight": "model-00001-of-00003.safetensors",
1947
+ "vision_tower.blocks.15.norm2.bias": "model-00001-of-00003.safetensors",
1948
+ "vision_tower.blocks.15.norm2.weight": "model-00001-of-00003.safetensors",
1949
+ "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00003.safetensors",
1950
+ "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00003.safetensors",
1951
+ "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00003.safetensors",
1952
+ "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00003.safetensors",
1953
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1954
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1955
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1956
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1957
+ "vision_tower.blocks.16.norm1.bias": "model-00001-of-00003.safetensors",
1958
+ "vision_tower.blocks.16.norm1.weight": "model-00001-of-00003.safetensors",
1959
+ "vision_tower.blocks.16.norm2.bias": "model-00001-of-00003.safetensors",
1960
+ "vision_tower.blocks.16.norm2.weight": "model-00001-of-00003.safetensors",
1961
+ "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00003.safetensors",
1962
+ "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00003.safetensors",
1963
+ "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00003.safetensors",
1964
+ "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00003.safetensors",
1965
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1966
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1967
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1968
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1969
+ "vision_tower.blocks.17.norm1.bias": "model-00001-of-00003.safetensors",
1970
+ "vision_tower.blocks.17.norm1.weight": "model-00001-of-00003.safetensors",
1971
+ "vision_tower.blocks.17.norm2.bias": "model-00001-of-00003.safetensors",
1972
+ "vision_tower.blocks.17.norm2.weight": "model-00001-of-00003.safetensors",
1973
+ "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00003.safetensors",
1974
+ "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00003.safetensors",
1975
+ "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00003.safetensors",
1976
+ "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00003.safetensors",
1977
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1978
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1979
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1980
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1981
+ "vision_tower.blocks.18.norm1.bias": "model-00001-of-00003.safetensors",
1982
+ "vision_tower.blocks.18.norm1.weight": "model-00001-of-00003.safetensors",
1983
+ "vision_tower.blocks.18.norm2.bias": "model-00001-of-00003.safetensors",
1984
+ "vision_tower.blocks.18.norm2.weight": "model-00001-of-00003.safetensors",
1985
+ "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00003.safetensors",
1986
+ "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00003.safetensors",
1987
+ "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00003.safetensors",
1988
+ "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00003.safetensors",
1989
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
1990
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
1991
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
1992
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
1993
+ "vision_tower.blocks.19.norm1.bias": "model-00001-of-00003.safetensors",
1994
+ "vision_tower.blocks.19.norm1.weight": "model-00001-of-00003.safetensors",
1995
+ "vision_tower.blocks.19.norm2.bias": "model-00001-of-00003.safetensors",
1996
+ "vision_tower.blocks.19.norm2.weight": "model-00001-of-00003.safetensors",
1997
+ "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00003.safetensors",
1998
+ "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00003.safetensors",
1999
+ "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00003.safetensors",
2000
+ "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00003.safetensors",
2001
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2002
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2003
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2004
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2005
+ "vision_tower.blocks.2.norm1.bias": "model-00001-of-00003.safetensors",
2006
+ "vision_tower.blocks.2.norm1.weight": "model-00001-of-00003.safetensors",
2007
+ "vision_tower.blocks.2.norm2.bias": "model-00001-of-00003.safetensors",
2008
+ "vision_tower.blocks.2.norm2.weight": "model-00001-of-00003.safetensors",
2009
+ "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00003.safetensors",
2010
+ "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00003.safetensors",
2011
+ "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00003.safetensors",
2012
+ "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00003.safetensors",
2013
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2014
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2015
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2016
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2017
+ "vision_tower.blocks.20.norm1.bias": "model-00001-of-00003.safetensors",
2018
+ "vision_tower.blocks.20.norm1.weight": "model-00001-of-00003.safetensors",
2019
+ "vision_tower.blocks.20.norm2.bias": "model-00001-of-00003.safetensors",
2020
+ "vision_tower.blocks.20.norm2.weight": "model-00001-of-00003.safetensors",
2021
+ "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00003.safetensors",
2022
+ "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00003.safetensors",
2023
+ "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00003.safetensors",
2024
+ "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00003.safetensors",
2025
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2026
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2027
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2028
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2029
+ "vision_tower.blocks.21.norm1.bias": "model-00001-of-00003.safetensors",
2030
+ "vision_tower.blocks.21.norm1.weight": "model-00001-of-00003.safetensors",
2031
+ "vision_tower.blocks.21.norm2.bias": "model-00001-of-00003.safetensors",
2032
+ "vision_tower.blocks.21.norm2.weight": "model-00001-of-00003.safetensors",
2033
+ "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00003.safetensors",
2034
+ "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00003.safetensors",
2035
+ "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00003.safetensors",
2036
+ "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00003.safetensors",
2037
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2038
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2039
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2040
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2041
+ "vision_tower.blocks.22.norm1.bias": "model-00001-of-00003.safetensors",
2042
+ "vision_tower.blocks.22.norm1.weight": "model-00001-of-00003.safetensors",
2043
+ "vision_tower.blocks.22.norm2.bias": "model-00001-of-00003.safetensors",
2044
+ "vision_tower.blocks.22.norm2.weight": "model-00001-of-00003.safetensors",
2045
+ "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00003.safetensors",
2046
+ "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00003.safetensors",
2047
+ "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00003.safetensors",
2048
+ "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00003.safetensors",
2049
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2050
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2051
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2052
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2053
+ "vision_tower.blocks.23.norm1.bias": "model-00001-of-00003.safetensors",
2054
+ "vision_tower.blocks.23.norm1.weight": "model-00001-of-00003.safetensors",
2055
+ "vision_tower.blocks.23.norm2.bias": "model-00001-of-00003.safetensors",
2056
+ "vision_tower.blocks.23.norm2.weight": "model-00001-of-00003.safetensors",
2057
+ "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00003.safetensors",
2058
+ "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00003.safetensors",
2059
+ "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00003.safetensors",
2060
+ "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00003.safetensors",
2061
+ "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2062
+ "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2063
+ "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2064
+ "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2065
+ "vision_tower.blocks.24.norm1.bias": "model-00001-of-00003.safetensors",
2066
+ "vision_tower.blocks.24.norm1.weight": "model-00001-of-00003.safetensors",
2067
+ "vision_tower.blocks.24.norm2.bias": "model-00001-of-00003.safetensors",
2068
+ "vision_tower.blocks.24.norm2.weight": "model-00001-of-00003.safetensors",
2069
+ "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00003.safetensors",
2070
+ "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00003.safetensors",
2071
+ "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00003.safetensors",
2072
+ "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00003.safetensors",
2073
+ "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2074
+ "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2075
+ "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2076
+ "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2077
+ "vision_tower.blocks.25.norm1.bias": "model-00001-of-00003.safetensors",
2078
+ "vision_tower.blocks.25.norm1.weight": "model-00001-of-00003.safetensors",
2079
+ "vision_tower.blocks.25.norm2.bias": "model-00001-of-00003.safetensors",
2080
+ "vision_tower.blocks.25.norm2.weight": "model-00001-of-00003.safetensors",
2081
+ "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00003.safetensors",
2082
+ "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00003.safetensors",
2083
+ "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00003.safetensors",
2084
+ "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00003.safetensors",
2085
+ "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2086
+ "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2087
+ "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2088
+ "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2089
+ "vision_tower.blocks.26.norm1.bias": "model-00001-of-00003.safetensors",
2090
+ "vision_tower.blocks.26.norm1.weight": "model-00001-of-00003.safetensors",
2091
+ "vision_tower.blocks.26.norm2.bias": "model-00001-of-00003.safetensors",
2092
+ "vision_tower.blocks.26.norm2.weight": "model-00001-of-00003.safetensors",
2093
+ "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00003.safetensors",
2094
+ "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00003.safetensors",
2095
+ "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00003.safetensors",
2096
+ "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00003.safetensors",
2097
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2098
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2099
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2100
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2101
+ "vision_tower.blocks.3.norm1.bias": "model-00001-of-00003.safetensors",
2102
+ "vision_tower.blocks.3.norm1.weight": "model-00001-of-00003.safetensors",
2103
+ "vision_tower.blocks.3.norm2.bias": "model-00001-of-00003.safetensors",
2104
+ "vision_tower.blocks.3.norm2.weight": "model-00001-of-00003.safetensors",
2105
+ "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00003.safetensors",
2106
+ "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00003.safetensors",
2107
+ "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00003.safetensors",
2108
+ "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00003.safetensors",
2109
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2110
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2111
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2112
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2113
+ "vision_tower.blocks.4.norm1.bias": "model-00001-of-00003.safetensors",
2114
+ "vision_tower.blocks.4.norm1.weight": "model-00001-of-00003.safetensors",
2115
+ "vision_tower.blocks.4.norm2.bias": "model-00001-of-00003.safetensors",
2116
+ "vision_tower.blocks.4.norm2.weight": "model-00001-of-00003.safetensors",
2117
+ "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00003.safetensors",
2118
+ "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00003.safetensors",
2119
+ "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00003.safetensors",
2120
+ "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00003.safetensors",
2121
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2122
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2123
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2124
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2125
+ "vision_tower.blocks.5.norm1.bias": "model-00001-of-00003.safetensors",
2126
+ "vision_tower.blocks.5.norm1.weight": "model-00001-of-00003.safetensors",
2127
+ "vision_tower.blocks.5.norm2.bias": "model-00001-of-00003.safetensors",
2128
+ "vision_tower.blocks.5.norm2.weight": "model-00001-of-00003.safetensors",
2129
+ "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00003.safetensors",
2130
+ "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00003.safetensors",
2131
+ "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00003.safetensors",
2132
+ "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00003.safetensors",
2133
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2134
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2135
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2136
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2137
+ "vision_tower.blocks.6.norm1.bias": "model-00001-of-00003.safetensors",
2138
+ "vision_tower.blocks.6.norm1.weight": "model-00001-of-00003.safetensors",
2139
+ "vision_tower.blocks.6.norm2.bias": "model-00001-of-00003.safetensors",
2140
+ "vision_tower.blocks.6.norm2.weight": "model-00001-of-00003.safetensors",
2141
+ "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00003.safetensors",
2142
+ "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00003.safetensors",
2143
+ "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00003.safetensors",
2144
+ "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00003.safetensors",
2145
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2146
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2147
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2148
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2149
+ "vision_tower.blocks.7.norm1.bias": "model-00001-of-00003.safetensors",
2150
+ "vision_tower.blocks.7.norm1.weight": "model-00001-of-00003.safetensors",
2151
+ "vision_tower.blocks.7.norm2.bias": "model-00001-of-00003.safetensors",
2152
+ "vision_tower.blocks.7.norm2.weight": "model-00001-of-00003.safetensors",
2153
+ "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00003.safetensors",
2154
+ "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00003.safetensors",
2155
+ "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00003.safetensors",
2156
+ "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00003.safetensors",
2157
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2158
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2159
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2160
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2161
+ "vision_tower.blocks.8.norm1.bias": "model-00001-of-00003.safetensors",
2162
+ "vision_tower.blocks.8.norm1.weight": "model-00001-of-00003.safetensors",
2163
+ "vision_tower.blocks.8.norm2.bias": "model-00001-of-00003.safetensors",
2164
+ "vision_tower.blocks.8.norm2.weight": "model-00001-of-00003.safetensors",
2165
+ "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00003.safetensors",
2166
+ "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00003.safetensors",
2167
+ "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00003.safetensors",
2168
+ "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00003.safetensors",
2169
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00003.safetensors",
2170
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00003.safetensors",
2171
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00003.safetensors",
2172
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00003.safetensors",
2173
+ "vision_tower.blocks.9.norm1.bias": "model-00001-of-00003.safetensors",
2174
+ "vision_tower.blocks.9.norm1.weight": "model-00001-of-00003.safetensors",
2175
+ "vision_tower.blocks.9.norm2.bias": "model-00001-of-00003.safetensors",
2176
+ "vision_tower.blocks.9.norm2.weight": "model-00001-of-00003.safetensors",
2177
+ "vision_tower.merger.linear_fc1.bias": "model-00001-of-00003.safetensors",
2178
+ "vision_tower.merger.linear_fc1.weight": "model-00001-of-00003.safetensors",
2179
+ "vision_tower.merger.linear_fc2.bias": "model-00001-of-00003.safetensors",
2180
+ "vision_tower.merger.linear_fc2.weight": "model-00001-of-00003.safetensors",
2181
+ "vision_tower.merger.norm.bias": "model-00001-of-00003.safetensors",
2182
+ "vision_tower.merger.norm.weight": "model-00001-of-00003.safetensors",
2183
+ "vision_tower.patch_embed.proj.bias": "model-00001-of-00003.safetensors",
2184
+ "vision_tower.patch_embed.proj.weight": "model-00001-of-00003.safetensors",
2185
+ "vision_tower.pos_embed.weight": "model-00001-of-00003.safetensors"
2186
  }
2187
  }
preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 16777216,
4
+ "shortest_edge": 65536
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "image_processor_type": "Qwen2VLImageProcessorFast"
21
+ }
processor_config.json ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": true,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "image_mean": [
7
+ 0.5,
8
+ 0.5,
9
+ 0.5
10
+ ],
11
+ "image_processor_type": "Qwen3VLImageProcessor",
12
+ "image_std": [
13
+ 0.5,
14
+ 0.5,
15
+ 0.5
16
+ ],
17
+ "max_pixels": 16777216,
18
+ "merge_size": 2,
19
+ "min_pixels": 65536,
20
+ "patch_size": 16,
21
+ "rescale_factor": 0.00392156862745098,
22
+ "temporal_patch_size": 2
23
+ },
24
+ "processor_class": "Qwen3VLProcessor",
25
+ "video_processor": {
26
+ "do_convert_rgb": true,
27
+ "do_normalize": true,
28
+ "do_rescale": true,
29
+ "fps": 2.0,
30
+ "image_mean": [
31
+ 0.5,
32
+ 0.5,
33
+ 0.5
34
+ ],
35
+ "image_std": [
36
+ 0.5,
37
+ 0.5,
38
+ 0.5
39
+ ],
40
+ "max_frames": 768,
41
+ "max_pixels": 25165824,
42
+ "merge_size": 2,
43
+ "min_frames": 4,
44
+ "min_pixels": 4096,
45
+ "patch_size": 16,
46
+ "rescale_factor": 0.00392156862745098,
47
+ "temporal_patch_size": 2,
48
+ "video_processor_type": "Qwen3VLVideoProcessor"
49
+ }
50
+ }
tokenizer_config.json CHANGED
@@ -23,9 +23,9 @@
23
  },
24
  "pad_token": "<|endoftext|>",
25
  "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
 
26
  "split_special_tokens": false,
27
  "tokenizer_class": "Qwen2Tokenizer",
28
- "tool_parser_type": "qwen3_coder",
29
  "unk_token": null,
30
  "video_token": "<|video_pad|>",
31
  "vision_bos_token": "<|vision_start|>",
 
23
  },
24
  "pad_token": "<|endoftext|>",
25
  "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
26
+ "processor_class": "Qwen3VLProcessor",
27
  "split_special_tokens": false,
28
  "tokenizer_class": "Qwen2Tokenizer",
 
29
  "unk_token": null,
30
  "video_token": "<|video_pad|>",
31
  "vision_bos_token": "<|vision_start|>",
video_preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 25165824,
4
+ "shortest_edge": 4096
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "video_processor_type": "Qwen3VLVideoProcessor"
21
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff