avlp12 commited on
Commit
1a80ca5
·
verified ·
1 Parent(s): 657cda2

Upload folder using huggingface_hub

Browse files
README.md CHANGED
@@ -7,7 +7,7 @@ license: apache-2.0
7
  base_model: Qwen/Qwen3.6-35B-A3B
8
  base_model_relation: quantized
9
  library_name: mlx
10
- pipeline_tag: text-generation
11
  tags:
12
  - mlx
13
  - qwen3_5_moe
@@ -46,15 +46,15 @@ Everything below is **measured, not projected** — KL / top-1 flip on a fixed 4
46
 
47
  With int8 KV that leaves ~1.5 GiB of cache ≈ **150 K tokens** of context (KV here is tiny — see below). 111 tok/s decode makes this the best speed-per-GB option for 16 GB machines; prefer it over the dense 27B 16 GB build when throughput matters more than per-token quality.
48
 
49
- ## Multimodal (`vision` branch)
50
 
51
- The base checkpoint ships the full vision tower; `main` (mlx-lm path) is text-only, the
52
- `vision` branch restores it identical 4.0bpw text weights + the vision tower at 8-bit.
53
- Verified with EN/KO OCR tests.
54
 
55
  ```bash
56
  pip install mlx-vlm
57
- python -m mlx_vlm generate --model avlp12/Qwen3.6-35B-A3B-Alis-MLX-Dynamic --revision vision \
58
  --image photo.jpg --prompt "이미지의 텍스트를 읽어줘." --max-tokens 300
59
  ```
60
 
 
7
  base_model: Qwen/Qwen3.6-35B-A3B
8
  base_model_relation: quantized
9
  library_name: mlx
10
+ pipeline_tag: image-text-to-text
11
  tags:
12
  - mlx
13
  - qwen3_5_moe
 
46
 
47
  With int8 KV that leaves ~1.5 GiB of cache ≈ **150 K tokens** of context (KV here is tiny — see below). 111 tok/s decode makes this the best speed-per-GB option for 16 GB machines; prefer it over the dense 27B 16 GB build when throughput matters more than per-token quality.
48
 
49
+ ## Multimodal (default)
50
 
51
+ `main` carries the full multimodal stack 4.0bpw text weights + the vision tower at
52
+ 8-bit (verified with EN/KO OCR tests). Plain mlx-lm loads `main` fine for text-only use;
53
+ the `text` branch saves 0.60 GB if you never need images.
54
 
55
  ```bash
56
  pip install mlx-vlm
57
+ python -m mlx_vlm generate --model avlp12/Qwen3.6-35B-A3B-Alis-MLX-Dynamic \
58
  --image photo.jpg --prompt "이미지의 텍스트를 읽어줘." --max-tokens 300
59
  ```
60
 
config.json CHANGED
@@ -2,16 +2,365 @@
2
  "architectures": [
3
  "Qwen3_5MoeForConditionalGeneration"
4
  ],
 
5
  "eos_token_id": [
6
  248046,
7
  248044
8
  ],
 
 
 
 
 
 
 
 
 
 
 
 
9
  "image_token_id": 248056,
10
  "model_type": "qwen3_5_moe",
11
  "quantization": {
12
  "group_size": 64,
13
  "bits": 4,
14
  "mode": "affine",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
15
  "language_model.model.embed_tokens": {
16
  "bits": 4,
17
  "group_size": 16,
@@ -2577,6 +2926,342 @@
2577
  "group_size": 64,
2578
  "bits": 4,
2579
  "mode": "affine",
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2580
  "language_model.model.embed_tokens": {
2581
  "bits": 4,
2582
  "group_size": 16,
@@ -5138,6 +5823,7 @@
5138
  "mode": "nvfp4"
5139
  }
5140
  },
 
5141
  "text_config": {
5142
  "attention_bias": false,
5143
  "attention_dropout": 0.0,
@@ -5221,7 +5907,7 @@
5221
  ],
5222
  "partial_rotary_factor": 0.25,
5223
  "rope_theta": 10000000,
5224
- "type": "default"
5225
  },
5226
  "router_aux_loss_coef": 0.001,
5227
  "shared_expert_intermediate_size": 512,
@@ -5230,8 +5916,26 @@
5230
  "vocab_size": 248320
5231
  },
5232
  "tie_word_embeddings": false,
 
 
5233
  "transformers_version": "4.57.1",
5234
  "video_token_id": 248057,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
5235
  "vision_end_token_id": 248054,
5236
  "vision_start_token_id": 248053
5237
  }
 
2
  "architectures": [
3
  "Qwen3_5MoeForConditionalGeneration"
4
  ],
5
+ "do_sample": true,
6
  "eos_token_id": [
7
  248046,
8
  248044
9
  ],
10
+ "generation_config": {
11
+ "bos_token_id": 248044,
12
+ "do_sample": true,
13
+ "eos_token_id": [
14
+ 248046,
15
+ 248044
16
+ ],
17
+ "pad_token_id": 248044,
18
+ "temperature": 1.0,
19
+ "top_k": 20,
20
+ "top_p": 0.95
21
+ },
22
  "image_token_id": 248056,
23
  "model_type": "qwen3_5_moe",
24
  "quantization": {
25
  "group_size": 64,
26
  "bits": 4,
27
  "mode": "affine",
28
+ "vision_tower.pos_embed": {
29
+ "group_size": 64,
30
+ "bits": 8
31
+ },
32
+ "vision_tower.blocks.0.attn.qkv": {
33
+ "group_size": 64,
34
+ "bits": 8
35
+ },
36
+ "vision_tower.blocks.0.attn.proj": {
37
+ "group_size": 64,
38
+ "bits": 8
39
+ },
40
+ "vision_tower.blocks.0.mlp.linear_fc1": {
41
+ "group_size": 64,
42
+ "bits": 8
43
+ },
44
+ "vision_tower.blocks.1.attn.qkv": {
45
+ "group_size": 64,
46
+ "bits": 8
47
+ },
48
+ "vision_tower.blocks.1.attn.proj": {
49
+ "group_size": 64,
50
+ "bits": 8
51
+ },
52
+ "vision_tower.blocks.1.mlp.linear_fc1": {
53
+ "group_size": 64,
54
+ "bits": 8
55
+ },
56
+ "vision_tower.blocks.2.attn.qkv": {
57
+ "group_size": 64,
58
+ "bits": 8
59
+ },
60
+ "vision_tower.blocks.2.attn.proj": {
61
+ "group_size": 64,
62
+ "bits": 8
63
+ },
64
+ "vision_tower.blocks.2.mlp.linear_fc1": {
65
+ "group_size": 64,
66
+ "bits": 8
67
+ },
68
+ "vision_tower.blocks.3.attn.qkv": {
69
+ "group_size": 64,
70
+ "bits": 8
71
+ },
72
+ "vision_tower.blocks.3.attn.proj": {
73
+ "group_size": 64,
74
+ "bits": 8
75
+ },
76
+ "vision_tower.blocks.3.mlp.linear_fc1": {
77
+ "group_size": 64,
78
+ "bits": 8
79
+ },
80
+ "vision_tower.blocks.4.attn.qkv": {
81
+ "group_size": 64,
82
+ "bits": 8
83
+ },
84
+ "vision_tower.blocks.4.attn.proj": {
85
+ "group_size": 64,
86
+ "bits": 8
87
+ },
88
+ "vision_tower.blocks.4.mlp.linear_fc1": {
89
+ "group_size": 64,
90
+ "bits": 8
91
+ },
92
+ "vision_tower.blocks.5.attn.qkv": {
93
+ "group_size": 64,
94
+ "bits": 8
95
+ },
96
+ "vision_tower.blocks.5.attn.proj": {
97
+ "group_size": 64,
98
+ "bits": 8
99
+ },
100
+ "vision_tower.blocks.5.mlp.linear_fc1": {
101
+ "group_size": 64,
102
+ "bits": 8
103
+ },
104
+ "vision_tower.blocks.6.attn.qkv": {
105
+ "group_size": 64,
106
+ "bits": 8
107
+ },
108
+ "vision_tower.blocks.6.attn.proj": {
109
+ "group_size": 64,
110
+ "bits": 8
111
+ },
112
+ "vision_tower.blocks.6.mlp.linear_fc1": {
113
+ "group_size": 64,
114
+ "bits": 8
115
+ },
116
+ "vision_tower.blocks.7.attn.qkv": {
117
+ "group_size": 64,
118
+ "bits": 8
119
+ },
120
+ "vision_tower.blocks.7.attn.proj": {
121
+ "group_size": 64,
122
+ "bits": 8
123
+ },
124
+ "vision_tower.blocks.7.mlp.linear_fc1": {
125
+ "group_size": 64,
126
+ "bits": 8
127
+ },
128
+ "vision_tower.blocks.8.attn.qkv": {
129
+ "group_size": 64,
130
+ "bits": 8
131
+ },
132
+ "vision_tower.blocks.8.attn.proj": {
133
+ "group_size": 64,
134
+ "bits": 8
135
+ },
136
+ "vision_tower.blocks.8.mlp.linear_fc1": {
137
+ "group_size": 64,
138
+ "bits": 8
139
+ },
140
+ "vision_tower.blocks.9.attn.qkv": {
141
+ "group_size": 64,
142
+ "bits": 8
143
+ },
144
+ "vision_tower.blocks.9.attn.proj": {
145
+ "group_size": 64,
146
+ "bits": 8
147
+ },
148
+ "vision_tower.blocks.9.mlp.linear_fc1": {
149
+ "group_size": 64,
150
+ "bits": 8
151
+ },
152
+ "vision_tower.blocks.10.attn.qkv": {
153
+ "group_size": 64,
154
+ "bits": 8
155
+ },
156
+ "vision_tower.blocks.10.attn.proj": {
157
+ "group_size": 64,
158
+ "bits": 8
159
+ },
160
+ "vision_tower.blocks.10.mlp.linear_fc1": {
161
+ "group_size": 64,
162
+ "bits": 8
163
+ },
164
+ "vision_tower.blocks.11.attn.qkv": {
165
+ "group_size": 64,
166
+ "bits": 8
167
+ },
168
+ "vision_tower.blocks.11.attn.proj": {
169
+ "group_size": 64,
170
+ "bits": 8
171
+ },
172
+ "vision_tower.blocks.11.mlp.linear_fc1": {
173
+ "group_size": 64,
174
+ "bits": 8
175
+ },
176
+ "vision_tower.blocks.12.attn.qkv": {
177
+ "group_size": 64,
178
+ "bits": 8
179
+ },
180
+ "vision_tower.blocks.12.attn.proj": {
181
+ "group_size": 64,
182
+ "bits": 8
183
+ },
184
+ "vision_tower.blocks.12.mlp.linear_fc1": {
185
+ "group_size": 64,
186
+ "bits": 8
187
+ },
188
+ "vision_tower.blocks.13.attn.qkv": {
189
+ "group_size": 64,
190
+ "bits": 8
191
+ },
192
+ "vision_tower.blocks.13.attn.proj": {
193
+ "group_size": 64,
194
+ "bits": 8
195
+ },
196
+ "vision_tower.blocks.13.mlp.linear_fc1": {
197
+ "group_size": 64,
198
+ "bits": 8
199
+ },
200
+ "vision_tower.blocks.14.attn.qkv": {
201
+ "group_size": 64,
202
+ "bits": 8
203
+ },
204
+ "vision_tower.blocks.14.attn.proj": {
205
+ "group_size": 64,
206
+ "bits": 8
207
+ },
208
+ "vision_tower.blocks.14.mlp.linear_fc1": {
209
+ "group_size": 64,
210
+ "bits": 8
211
+ },
212
+ "vision_tower.blocks.15.attn.qkv": {
213
+ "group_size": 64,
214
+ "bits": 8
215
+ },
216
+ "vision_tower.blocks.15.attn.proj": {
217
+ "group_size": 64,
218
+ "bits": 8
219
+ },
220
+ "vision_tower.blocks.15.mlp.linear_fc1": {
221
+ "group_size": 64,
222
+ "bits": 8
223
+ },
224
+ "vision_tower.blocks.16.attn.qkv": {
225
+ "group_size": 64,
226
+ "bits": 8
227
+ },
228
+ "vision_tower.blocks.16.attn.proj": {
229
+ "group_size": 64,
230
+ "bits": 8
231
+ },
232
+ "vision_tower.blocks.16.mlp.linear_fc1": {
233
+ "group_size": 64,
234
+ "bits": 8
235
+ },
236
+ "vision_tower.blocks.17.attn.qkv": {
237
+ "group_size": 64,
238
+ "bits": 8
239
+ },
240
+ "vision_tower.blocks.17.attn.proj": {
241
+ "group_size": 64,
242
+ "bits": 8
243
+ },
244
+ "vision_tower.blocks.17.mlp.linear_fc1": {
245
+ "group_size": 64,
246
+ "bits": 8
247
+ },
248
+ "vision_tower.blocks.18.attn.qkv": {
249
+ "group_size": 64,
250
+ "bits": 8
251
+ },
252
+ "vision_tower.blocks.18.attn.proj": {
253
+ "group_size": 64,
254
+ "bits": 8
255
+ },
256
+ "vision_tower.blocks.18.mlp.linear_fc1": {
257
+ "group_size": 64,
258
+ "bits": 8
259
+ },
260
+ "vision_tower.blocks.19.attn.qkv": {
261
+ "group_size": 64,
262
+ "bits": 8
263
+ },
264
+ "vision_tower.blocks.19.attn.proj": {
265
+ "group_size": 64,
266
+ "bits": 8
267
+ },
268
+ "vision_tower.blocks.19.mlp.linear_fc1": {
269
+ "group_size": 64,
270
+ "bits": 8
271
+ },
272
+ "vision_tower.blocks.20.attn.qkv": {
273
+ "group_size": 64,
274
+ "bits": 8
275
+ },
276
+ "vision_tower.blocks.20.attn.proj": {
277
+ "group_size": 64,
278
+ "bits": 8
279
+ },
280
+ "vision_tower.blocks.20.mlp.linear_fc1": {
281
+ "group_size": 64,
282
+ "bits": 8
283
+ },
284
+ "vision_tower.blocks.21.attn.qkv": {
285
+ "group_size": 64,
286
+ "bits": 8
287
+ },
288
+ "vision_tower.blocks.21.attn.proj": {
289
+ "group_size": 64,
290
+ "bits": 8
291
+ },
292
+ "vision_tower.blocks.21.mlp.linear_fc1": {
293
+ "group_size": 64,
294
+ "bits": 8
295
+ },
296
+ "vision_tower.blocks.22.attn.qkv": {
297
+ "group_size": 64,
298
+ "bits": 8
299
+ },
300
+ "vision_tower.blocks.22.attn.proj": {
301
+ "group_size": 64,
302
+ "bits": 8
303
+ },
304
+ "vision_tower.blocks.22.mlp.linear_fc1": {
305
+ "group_size": 64,
306
+ "bits": 8
307
+ },
308
+ "vision_tower.blocks.23.attn.qkv": {
309
+ "group_size": 64,
310
+ "bits": 8
311
+ },
312
+ "vision_tower.blocks.23.attn.proj": {
313
+ "group_size": 64,
314
+ "bits": 8
315
+ },
316
+ "vision_tower.blocks.23.mlp.linear_fc1": {
317
+ "group_size": 64,
318
+ "bits": 8
319
+ },
320
+ "vision_tower.blocks.24.attn.qkv": {
321
+ "group_size": 64,
322
+ "bits": 8
323
+ },
324
+ "vision_tower.blocks.24.attn.proj": {
325
+ "group_size": 64,
326
+ "bits": 8
327
+ },
328
+ "vision_tower.blocks.24.mlp.linear_fc1": {
329
+ "group_size": 64,
330
+ "bits": 8
331
+ },
332
+ "vision_tower.blocks.25.attn.qkv": {
333
+ "group_size": 64,
334
+ "bits": 8
335
+ },
336
+ "vision_tower.blocks.25.attn.proj": {
337
+ "group_size": 64,
338
+ "bits": 8
339
+ },
340
+ "vision_tower.blocks.25.mlp.linear_fc1": {
341
+ "group_size": 64,
342
+ "bits": 8
343
+ },
344
+ "vision_tower.blocks.26.attn.qkv": {
345
+ "group_size": 64,
346
+ "bits": 8
347
+ },
348
+ "vision_tower.blocks.26.attn.proj": {
349
+ "group_size": 64,
350
+ "bits": 8
351
+ },
352
+ "vision_tower.blocks.26.mlp.linear_fc1": {
353
+ "group_size": 64,
354
+ "bits": 8
355
+ },
356
+ "vision_tower.merger.linear_fc1": {
357
+ "group_size": 64,
358
+ "bits": 8
359
+ },
360
+ "vision_tower.merger.linear_fc2": {
361
+ "group_size": 64,
362
+ "bits": 8
363
+ },
364
  "language_model.model.embed_tokens": {
365
  "bits": 4,
366
  "group_size": 16,
 
2926
  "group_size": 64,
2927
  "bits": 4,
2928
  "mode": "affine",
2929
+ "vision_tower.pos_embed": {
2930
+ "group_size": 64,
2931
+ "bits": 8
2932
+ },
2933
+ "vision_tower.blocks.0.attn.qkv": {
2934
+ "group_size": 64,
2935
+ "bits": 8
2936
+ },
2937
+ "vision_tower.blocks.0.attn.proj": {
2938
+ "group_size": 64,
2939
+ "bits": 8
2940
+ },
2941
+ "vision_tower.blocks.0.mlp.linear_fc1": {
2942
+ "group_size": 64,
2943
+ "bits": 8
2944
+ },
2945
+ "vision_tower.blocks.1.attn.qkv": {
2946
+ "group_size": 64,
2947
+ "bits": 8
2948
+ },
2949
+ "vision_tower.blocks.1.attn.proj": {
2950
+ "group_size": 64,
2951
+ "bits": 8
2952
+ },
2953
+ "vision_tower.blocks.1.mlp.linear_fc1": {
2954
+ "group_size": 64,
2955
+ "bits": 8
2956
+ },
2957
+ "vision_tower.blocks.2.attn.qkv": {
2958
+ "group_size": 64,
2959
+ "bits": 8
2960
+ },
2961
+ "vision_tower.blocks.2.attn.proj": {
2962
+ "group_size": 64,
2963
+ "bits": 8
2964
+ },
2965
+ "vision_tower.blocks.2.mlp.linear_fc1": {
2966
+ "group_size": 64,
2967
+ "bits": 8
2968
+ },
2969
+ "vision_tower.blocks.3.attn.qkv": {
2970
+ "group_size": 64,
2971
+ "bits": 8
2972
+ },
2973
+ "vision_tower.blocks.3.attn.proj": {
2974
+ "group_size": 64,
2975
+ "bits": 8
2976
+ },
2977
+ "vision_tower.blocks.3.mlp.linear_fc1": {
2978
+ "group_size": 64,
2979
+ "bits": 8
2980
+ },
2981
+ "vision_tower.blocks.4.attn.qkv": {
2982
+ "group_size": 64,
2983
+ "bits": 8
2984
+ },
2985
+ "vision_tower.blocks.4.attn.proj": {
2986
+ "group_size": 64,
2987
+ "bits": 8
2988
+ },
2989
+ "vision_tower.blocks.4.mlp.linear_fc1": {
2990
+ "group_size": 64,
2991
+ "bits": 8
2992
+ },
2993
+ "vision_tower.blocks.5.attn.qkv": {
2994
+ "group_size": 64,
2995
+ "bits": 8
2996
+ },
2997
+ "vision_tower.blocks.5.attn.proj": {
2998
+ "group_size": 64,
2999
+ "bits": 8
3000
+ },
3001
+ "vision_tower.blocks.5.mlp.linear_fc1": {
3002
+ "group_size": 64,
3003
+ "bits": 8
3004
+ },
3005
+ "vision_tower.blocks.6.attn.qkv": {
3006
+ "group_size": 64,
3007
+ "bits": 8
3008
+ },
3009
+ "vision_tower.blocks.6.attn.proj": {
3010
+ "group_size": 64,
3011
+ "bits": 8
3012
+ },
3013
+ "vision_tower.blocks.6.mlp.linear_fc1": {
3014
+ "group_size": 64,
3015
+ "bits": 8
3016
+ },
3017
+ "vision_tower.blocks.7.attn.qkv": {
3018
+ "group_size": 64,
3019
+ "bits": 8
3020
+ },
3021
+ "vision_tower.blocks.7.attn.proj": {
3022
+ "group_size": 64,
3023
+ "bits": 8
3024
+ },
3025
+ "vision_tower.blocks.7.mlp.linear_fc1": {
3026
+ "group_size": 64,
3027
+ "bits": 8
3028
+ },
3029
+ "vision_tower.blocks.8.attn.qkv": {
3030
+ "group_size": 64,
3031
+ "bits": 8
3032
+ },
3033
+ "vision_tower.blocks.8.attn.proj": {
3034
+ "group_size": 64,
3035
+ "bits": 8
3036
+ },
3037
+ "vision_tower.blocks.8.mlp.linear_fc1": {
3038
+ "group_size": 64,
3039
+ "bits": 8
3040
+ },
3041
+ "vision_tower.blocks.9.attn.qkv": {
3042
+ "group_size": 64,
3043
+ "bits": 8
3044
+ },
3045
+ "vision_tower.blocks.9.attn.proj": {
3046
+ "group_size": 64,
3047
+ "bits": 8
3048
+ },
3049
+ "vision_tower.blocks.9.mlp.linear_fc1": {
3050
+ "group_size": 64,
3051
+ "bits": 8
3052
+ },
3053
+ "vision_tower.blocks.10.attn.qkv": {
3054
+ "group_size": 64,
3055
+ "bits": 8
3056
+ },
3057
+ "vision_tower.blocks.10.attn.proj": {
3058
+ "group_size": 64,
3059
+ "bits": 8
3060
+ },
3061
+ "vision_tower.blocks.10.mlp.linear_fc1": {
3062
+ "group_size": 64,
3063
+ "bits": 8
3064
+ },
3065
+ "vision_tower.blocks.11.attn.qkv": {
3066
+ "group_size": 64,
3067
+ "bits": 8
3068
+ },
3069
+ "vision_tower.blocks.11.attn.proj": {
3070
+ "group_size": 64,
3071
+ "bits": 8
3072
+ },
3073
+ "vision_tower.blocks.11.mlp.linear_fc1": {
3074
+ "group_size": 64,
3075
+ "bits": 8
3076
+ },
3077
+ "vision_tower.blocks.12.attn.qkv": {
3078
+ "group_size": 64,
3079
+ "bits": 8
3080
+ },
3081
+ "vision_tower.blocks.12.attn.proj": {
3082
+ "group_size": 64,
3083
+ "bits": 8
3084
+ },
3085
+ "vision_tower.blocks.12.mlp.linear_fc1": {
3086
+ "group_size": 64,
3087
+ "bits": 8
3088
+ },
3089
+ "vision_tower.blocks.13.attn.qkv": {
3090
+ "group_size": 64,
3091
+ "bits": 8
3092
+ },
3093
+ "vision_tower.blocks.13.attn.proj": {
3094
+ "group_size": 64,
3095
+ "bits": 8
3096
+ },
3097
+ "vision_tower.blocks.13.mlp.linear_fc1": {
3098
+ "group_size": 64,
3099
+ "bits": 8
3100
+ },
3101
+ "vision_tower.blocks.14.attn.qkv": {
3102
+ "group_size": 64,
3103
+ "bits": 8
3104
+ },
3105
+ "vision_tower.blocks.14.attn.proj": {
3106
+ "group_size": 64,
3107
+ "bits": 8
3108
+ },
3109
+ "vision_tower.blocks.14.mlp.linear_fc1": {
3110
+ "group_size": 64,
3111
+ "bits": 8
3112
+ },
3113
+ "vision_tower.blocks.15.attn.qkv": {
3114
+ "group_size": 64,
3115
+ "bits": 8
3116
+ },
3117
+ "vision_tower.blocks.15.attn.proj": {
3118
+ "group_size": 64,
3119
+ "bits": 8
3120
+ },
3121
+ "vision_tower.blocks.15.mlp.linear_fc1": {
3122
+ "group_size": 64,
3123
+ "bits": 8
3124
+ },
3125
+ "vision_tower.blocks.16.attn.qkv": {
3126
+ "group_size": 64,
3127
+ "bits": 8
3128
+ },
3129
+ "vision_tower.blocks.16.attn.proj": {
3130
+ "group_size": 64,
3131
+ "bits": 8
3132
+ },
3133
+ "vision_tower.blocks.16.mlp.linear_fc1": {
3134
+ "group_size": 64,
3135
+ "bits": 8
3136
+ },
3137
+ "vision_tower.blocks.17.attn.qkv": {
3138
+ "group_size": 64,
3139
+ "bits": 8
3140
+ },
3141
+ "vision_tower.blocks.17.attn.proj": {
3142
+ "group_size": 64,
3143
+ "bits": 8
3144
+ },
3145
+ "vision_tower.blocks.17.mlp.linear_fc1": {
3146
+ "group_size": 64,
3147
+ "bits": 8
3148
+ },
3149
+ "vision_tower.blocks.18.attn.qkv": {
3150
+ "group_size": 64,
3151
+ "bits": 8
3152
+ },
3153
+ "vision_tower.blocks.18.attn.proj": {
3154
+ "group_size": 64,
3155
+ "bits": 8
3156
+ },
3157
+ "vision_tower.blocks.18.mlp.linear_fc1": {
3158
+ "group_size": 64,
3159
+ "bits": 8
3160
+ },
3161
+ "vision_tower.blocks.19.attn.qkv": {
3162
+ "group_size": 64,
3163
+ "bits": 8
3164
+ },
3165
+ "vision_tower.blocks.19.attn.proj": {
3166
+ "group_size": 64,
3167
+ "bits": 8
3168
+ },
3169
+ "vision_tower.blocks.19.mlp.linear_fc1": {
3170
+ "group_size": 64,
3171
+ "bits": 8
3172
+ },
3173
+ "vision_tower.blocks.20.attn.qkv": {
3174
+ "group_size": 64,
3175
+ "bits": 8
3176
+ },
3177
+ "vision_tower.blocks.20.attn.proj": {
3178
+ "group_size": 64,
3179
+ "bits": 8
3180
+ },
3181
+ "vision_tower.blocks.20.mlp.linear_fc1": {
3182
+ "group_size": 64,
3183
+ "bits": 8
3184
+ },
3185
+ "vision_tower.blocks.21.attn.qkv": {
3186
+ "group_size": 64,
3187
+ "bits": 8
3188
+ },
3189
+ "vision_tower.blocks.21.attn.proj": {
3190
+ "group_size": 64,
3191
+ "bits": 8
3192
+ },
3193
+ "vision_tower.blocks.21.mlp.linear_fc1": {
3194
+ "group_size": 64,
3195
+ "bits": 8
3196
+ },
3197
+ "vision_tower.blocks.22.attn.qkv": {
3198
+ "group_size": 64,
3199
+ "bits": 8
3200
+ },
3201
+ "vision_tower.blocks.22.attn.proj": {
3202
+ "group_size": 64,
3203
+ "bits": 8
3204
+ },
3205
+ "vision_tower.blocks.22.mlp.linear_fc1": {
3206
+ "group_size": 64,
3207
+ "bits": 8
3208
+ },
3209
+ "vision_tower.blocks.23.attn.qkv": {
3210
+ "group_size": 64,
3211
+ "bits": 8
3212
+ },
3213
+ "vision_tower.blocks.23.attn.proj": {
3214
+ "group_size": 64,
3215
+ "bits": 8
3216
+ },
3217
+ "vision_tower.blocks.23.mlp.linear_fc1": {
3218
+ "group_size": 64,
3219
+ "bits": 8
3220
+ },
3221
+ "vision_tower.blocks.24.attn.qkv": {
3222
+ "group_size": 64,
3223
+ "bits": 8
3224
+ },
3225
+ "vision_tower.blocks.24.attn.proj": {
3226
+ "group_size": 64,
3227
+ "bits": 8
3228
+ },
3229
+ "vision_tower.blocks.24.mlp.linear_fc1": {
3230
+ "group_size": 64,
3231
+ "bits": 8
3232
+ },
3233
+ "vision_tower.blocks.25.attn.qkv": {
3234
+ "group_size": 64,
3235
+ "bits": 8
3236
+ },
3237
+ "vision_tower.blocks.25.attn.proj": {
3238
+ "group_size": 64,
3239
+ "bits": 8
3240
+ },
3241
+ "vision_tower.blocks.25.mlp.linear_fc1": {
3242
+ "group_size": 64,
3243
+ "bits": 8
3244
+ },
3245
+ "vision_tower.blocks.26.attn.qkv": {
3246
+ "group_size": 64,
3247
+ "bits": 8
3248
+ },
3249
+ "vision_tower.blocks.26.attn.proj": {
3250
+ "group_size": 64,
3251
+ "bits": 8
3252
+ },
3253
+ "vision_tower.blocks.26.mlp.linear_fc1": {
3254
+ "group_size": 64,
3255
+ "bits": 8
3256
+ },
3257
+ "vision_tower.merger.linear_fc1": {
3258
+ "group_size": 64,
3259
+ "bits": 8
3260
+ },
3261
+ "vision_tower.merger.linear_fc2": {
3262
+ "group_size": 64,
3263
+ "bits": 8
3264
+ },
3265
  "language_model.model.embed_tokens": {
3266
  "bits": 4,
3267
  "group_size": 16,
 
5823
  "mode": "nvfp4"
5824
  }
5825
  },
5826
+ "temperature": 1.0,
5827
  "text_config": {
5828
  "attention_bias": false,
5829
  "attention_dropout": 0.0,
 
5907
  ],
5908
  "partial_rotary_factor": 0.25,
5909
  "rope_theta": 10000000,
5910
+ "rope_type": "default"
5911
  },
5912
  "router_aux_loss_coef": 0.001,
5913
  "shared_expert_intermediate_size": 512,
 
5916
  "vocab_size": 248320
5917
  },
5918
  "tie_word_embeddings": false,
5919
+ "top_k": 20,
5920
+ "top_p": 0.95,
5921
  "transformers_version": "4.57.1",
5922
  "video_token_id": 248057,
5923
+ "vision_config": {
5924
+ "deepstack_visual_indexes": [],
5925
+ "depth": 27,
5926
+ "hidden_act": "gelu_pytorch_tanh",
5927
+ "hidden_size": 1152,
5928
+ "in_channels": 3,
5929
+ "initializer_range": 0.02,
5930
+ "intermediate_size": 4304,
5931
+ "model_type": "qwen3_5_moe",
5932
+ "num_heads": 16,
5933
+ "num_position_embeddings": 2304,
5934
+ "out_hidden_size": 2048,
5935
+ "patch_size": 16,
5936
+ "spatial_merge_size": 2,
5937
+ "temporal_patch_size": 2
5938
+ },
5939
  "vision_end_token_id": 248054,
5940
  "vision_start_token_id": 248053
5941
  }
configuration.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"framework":"Pytorch","task":"visual-question-answering"}
model-00001-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:602a6256133a96c3a64a5095472d45762b8092519766b6e54dfa5ea99fc3beec
3
- size 5353052688
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:68f508c37420e3550e8dc1bdc334ac2238c9cb650278e789f0aed51b17b8ac5f
3
+ size 5325419428
model-00002-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:777e25388fd10c48c2517ba12a10243c5253d91cf375075c48e8206311ddbb0f
3
- size 5363101728
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3545ebe3e79898ab324d062284886a2ca379932042bfa9ef2aa6760b2eb3d5a6
3
+ size 5266917803
model-00003-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1b446de8aead134986a7f9fd754dbc1d79c9bf1a7c2c473c7c2c0f92e9990004
3
- size 5365854799
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ca8cf2ff0bc89f809d792e92fb003f1bb29200ffc2b5a4767d80d82c260de0aa
3
+ size 5281968265
model-00004-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d8d9dc31ee52347cd2cef4f4f28fbf71efe6b76d10e2b69d54cdc7f5ee1ce407
3
- size 1250178036
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:902a7c7b184238ed3e6adbc8d85e946d0718a8ef0da836e9ca25f26f005c3984
3
+ size 2059965085
model.safetensors.index.json CHANGED
@@ -1,7 +1,6 @@
1
  {
2
  "metadata": {
3
- "total_size": 17331988736,
4
- "total_parameters": 34660608768
5
  },
6
  "weight_map": {
7
  "language_model.lm_head.scales": "model-00004-of-00004.safetensors",
@@ -128,24 +127,24 @@
128
  "language_model.model.layers.11.mlp.gate.biases": "model-00001-of-00004.safetensors",
129
  "language_model.model.layers.11.mlp.gate.scales": "model-00001-of-00004.safetensors",
130
  "language_model.model.layers.11.mlp.gate.weight": "model-00001-of-00004.safetensors",
131
- "language_model.model.layers.11.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
132
- "language_model.model.layers.11.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
133
- "language_model.model.layers.11.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
134
- "language_model.model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
135
- "language_model.model.layers.11.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
136
- "language_model.model.layers.11.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
137
- "language_model.model.layers.11.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
138
- "language_model.model.layers.11.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
139
- "language_model.model.layers.11.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
140
- "language_model.model.layers.11.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
141
- "language_model.model.layers.11.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
142
- "language_model.model.layers.11.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
143
  "language_model.model.layers.11.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
144
  "language_model.model.layers.11.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
145
  "language_model.model.layers.11.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
146
- "language_model.model.layers.11.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
147
- "language_model.model.layers.11.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
148
- "language_model.model.layers.11.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
149
  "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
150
  "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
151
  "language_model.model.layers.11.self_attn.k_proj.biases": "model-00001-of-00004.safetensors",
@@ -158,65 +157,65 @@
158
  "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
159
  "language_model.model.layers.11.self_attn.v_proj.scales": "model-00001-of-00004.safetensors",
160
  "language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
161
- "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00004.safetensors",
162
- "language_model.model.layers.12.linear_attn.A_log": "model-00001-of-00004.safetensors",
163
- "language_model.model.layers.12.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
164
- "language_model.model.layers.12.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
165
- "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
166
- "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
167
- "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
168
- "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
169
- "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
170
- "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
171
- "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
172
- "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
173
- "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
174
- "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
175
- "language_model.model.layers.12.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
176
- "language_model.model.layers.12.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
177
- "language_model.model.layers.12.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
178
- "language_model.model.layers.12.mlp.gate.biases": "model-00001-of-00004.safetensors",
179
- "language_model.model.layers.12.mlp.gate.scales": "model-00001-of-00004.safetensors",
180
- "language_model.model.layers.12.mlp.gate.weight": "model-00001-of-00004.safetensors",
181
- "language_model.model.layers.12.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
182
- "language_model.model.layers.12.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
183
- "language_model.model.layers.12.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
184
- "language_model.model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
185
- "language_model.model.layers.12.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
186
- "language_model.model.layers.12.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
187
- "language_model.model.layers.12.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
188
- "language_model.model.layers.12.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
189
- "language_model.model.layers.12.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
190
- "language_model.model.layers.12.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
191
- "language_model.model.layers.12.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
192
- "language_model.model.layers.12.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
193
- "language_model.model.layers.12.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
194
- "language_model.model.layers.12.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
195
- "language_model.model.layers.12.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
196
- "language_model.model.layers.12.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
197
- "language_model.model.layers.12.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
198
- "language_model.model.layers.12.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
199
- "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
200
- "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00004.safetensors",
201
- "language_model.model.layers.13.linear_attn.A_log": "model-00001-of-00004.safetensors",
202
- "language_model.model.layers.13.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
203
- "language_model.model.layers.13.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
204
- "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
205
- "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
206
- "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
207
- "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
208
- "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
209
- "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
210
- "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
211
- "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
212
- "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
213
- "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
214
- "language_model.model.layers.13.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
215
- "language_model.model.layers.13.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
216
- "language_model.model.layers.13.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
217
- "language_model.model.layers.13.mlp.gate.biases": "model-00001-of-00004.safetensors",
218
- "language_model.model.layers.13.mlp.gate.scales": "model-00001-of-00004.safetensors",
219
- "language_model.model.layers.13.mlp.gate.weight": "model-00001-of-00004.safetensors",
220
  "language_model.model.layers.13.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
221
  "language_model.model.layers.13.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
222
  "language_model.model.layers.13.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
@@ -233,7 +232,7 @@
233
  "language_model.model.layers.13.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
234
  "language_model.model.layers.13.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
235
  "language_model.model.layers.13.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
236
- "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
237
  "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
238
  "language_model.model.layers.14.linear_attn.A_log": "model-00002-of-00004.safetensors",
239
  "language_model.model.layers.14.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
@@ -659,43 +658,43 @@
659
  "language_model.model.layers.24.mlp.gate.biases": "model-00002-of-00004.safetensors",
660
  "language_model.model.layers.24.mlp.gate.scales": "model-00002-of-00004.safetensors",
661
  "language_model.model.layers.24.mlp.gate.weight": "model-00002-of-00004.safetensors",
662
- "language_model.model.layers.24.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
663
- "language_model.model.layers.24.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
664
- "language_model.model.layers.24.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
665
- "language_model.model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
666
- "language_model.model.layers.24.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
667
- "language_model.model.layers.24.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
668
- "language_model.model.layers.24.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
669
- "language_model.model.layers.24.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
670
- "language_model.model.layers.24.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
671
- "language_model.model.layers.24.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
672
- "language_model.model.layers.24.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
673
- "language_model.model.layers.24.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
674
- "language_model.model.layers.24.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
675
- "language_model.model.layers.24.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
676
- "language_model.model.layers.24.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
677
- "language_model.model.layers.24.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
678
  "language_model.model.layers.24.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
679
- "language_model.model.layers.25.input_layernorm.weight": "model-00002-of-00004.safetensors",
680
- "language_model.model.layers.25.linear_attn.A_log": "model-00002-of-00004.safetensors",
681
- "language_model.model.layers.25.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
682
- "language_model.model.layers.25.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
683
- "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
684
- "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
685
- "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
686
- "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
687
- "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
688
- "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
689
- "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
690
- "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
691
- "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
692
- "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
693
- "language_model.model.layers.25.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
694
- "language_model.model.layers.25.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
695
- "language_model.model.layers.25.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
696
- "language_model.model.layers.25.mlp.gate.biases": "model-00002-of-00004.safetensors",
697
- "language_model.model.layers.25.mlp.gate.scales": "model-00002-of-00004.safetensors",
698
- "language_model.model.layers.25.mlp.gate.weight": "model-00002-of-00004.safetensors",
699
  "language_model.model.layers.25.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
700
  "language_model.model.layers.25.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
701
  "language_model.model.layers.25.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
@@ -709,11 +708,11 @@
709
  "language_model.model.layers.25.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
710
  "language_model.model.layers.25.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
711
  "language_model.model.layers.25.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
712
- "language_model.model.layers.25.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
713
- "language_model.model.layers.25.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
714
  "language_model.model.layers.25.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
715
- "language_model.model.layers.25.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
716
- "language_model.model.layers.25.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
717
  "language_model.model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
718
  "language_model.model.layers.26.linear_attn.A_log": "model-00003-of-00004.safetensors",
719
  "language_model.model.layers.26.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
@@ -1138,42 +1137,42 @@
1138
  "language_model.model.layers.36.mlp.gate.biases": "model-00003-of-00004.safetensors",
1139
  "language_model.model.layers.36.mlp.gate.scales": "model-00003-of-00004.safetensors",
1140
  "language_model.model.layers.36.mlp.gate.weight": "model-00003-of-00004.safetensors",
1141
- "language_model.model.layers.36.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
1142
- "language_model.model.layers.36.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
1143
- "language_model.model.layers.36.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
1144
- "language_model.model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
1145
- "language_model.model.layers.36.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
1146
- "language_model.model.layers.36.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
1147
- "language_model.model.layers.36.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
1148
- "language_model.model.layers.36.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
1149
- "language_model.model.layers.36.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
1150
- "language_model.model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
1151
- "language_model.model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
1152
- "language_model.model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
1153
- "language_model.model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
1154
- "language_model.model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
1155
- "language_model.model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
1156
  "language_model.model.layers.36.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
1157
- "language_model.model.layers.37.input_layernorm.weight": "model-00003-of-00004.safetensors",
1158
- "language_model.model.layers.37.linear_attn.A_log": "model-00003-of-00004.safetensors",
1159
- "language_model.model.layers.37.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
1160
- "language_model.model.layers.37.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
1161
- "language_model.model.layers.37.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
1162
- "language_model.model.layers.37.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
1163
- "language_model.model.layers.37.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
1164
- "language_model.model.layers.37.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
1165
- "language_model.model.layers.37.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
1166
- "language_model.model.layers.37.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
1167
- "language_model.model.layers.37.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
1168
- "language_model.model.layers.37.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
1169
- "language_model.model.layers.37.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
1170
- "language_model.model.layers.37.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
1171
- "language_model.model.layers.37.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
1172
- "language_model.model.layers.37.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
1173
- "language_model.model.layers.37.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
1174
- "language_model.model.layers.37.mlp.gate.biases": "model-00003-of-00004.safetensors",
1175
- "language_model.model.layers.37.mlp.gate.scales": "model-00003-of-00004.safetensors",
1176
- "language_model.model.layers.37.mlp.gate.weight": "model-00003-of-00004.safetensors",
1177
  "language_model.model.layers.37.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
1178
  "language_model.model.layers.37.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
1179
  "language_model.model.layers.37.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
@@ -1185,14 +1184,14 @@
1185
  "language_model.model.layers.37.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
1186
  "language_model.model.layers.37.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
1187
  "language_model.model.layers.37.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
1188
- "language_model.model.layers.37.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
1189
- "language_model.model.layers.37.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
1190
- "language_model.model.layers.37.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
1191
- "language_model.model.layers.37.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
1192
- "language_model.model.layers.37.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
1193
- "language_model.model.layers.37.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
1194
- "language_model.model.layers.37.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
1195
- "language_model.model.layers.37.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
1196
  "language_model.model.layers.38.input_layernorm.weight": "model-00004-of-00004.safetensors",
1197
  "language_model.model.layers.38.linear_attn.A_log": "model-00004-of-00004.safetensors",
1198
  "language_model.model.layers.38.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
@@ -1486,6 +1485,507 @@
1486
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
1487
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
1488
  "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
1489
- "language_model.model.norm.weight": "model-00004-of-00004.safetensors"
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1490
  }
1491
  }
 
1
  {
2
  "metadata": {
3
+ "total_size": 17934015072
 
4
  },
5
  "weight_map": {
6
  "language_model.lm_head.scales": "model-00004-of-00004.safetensors",
 
127
  "language_model.model.layers.11.mlp.gate.biases": "model-00001-of-00004.safetensors",
128
  "language_model.model.layers.11.mlp.gate.scales": "model-00001-of-00004.safetensors",
129
  "language_model.model.layers.11.mlp.gate.weight": "model-00001-of-00004.safetensors",
130
+ "language_model.model.layers.11.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
131
+ "language_model.model.layers.11.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
132
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
133
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
134
+ "language_model.model.layers.11.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
135
+ "language_model.model.layers.11.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
136
+ "language_model.model.layers.11.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
137
+ "language_model.model.layers.11.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
138
+ "language_model.model.layers.11.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
139
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
140
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
141
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
142
  "language_model.model.layers.11.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
143
  "language_model.model.layers.11.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
144
  "language_model.model.layers.11.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
145
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
146
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
147
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
148
  "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
149
  "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
150
  "language_model.model.layers.11.self_attn.k_proj.biases": "model-00001-of-00004.safetensors",
 
157
  "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
158
  "language_model.model.layers.11.self_attn.v_proj.scales": "model-00001-of-00004.safetensors",
159
  "language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
160
+ "language_model.model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
161
+ "language_model.model.layers.12.linear_attn.A_log": "model-00002-of-00004.safetensors",
162
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
163
+ "language_model.model.layers.12.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
164
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
165
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
166
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
167
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
168
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
169
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
170
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
171
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
172
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
173
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
174
+ "language_model.model.layers.12.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
175
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
176
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
177
+ "language_model.model.layers.12.mlp.gate.biases": "model-00002-of-00004.safetensors",
178
+ "language_model.model.layers.12.mlp.gate.scales": "model-00002-of-00004.safetensors",
179
+ "language_model.model.layers.12.mlp.gate.weight": "model-00002-of-00004.safetensors",
180
+ "language_model.model.layers.12.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
181
+ "language_model.model.layers.12.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
182
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
183
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
184
+ "language_model.model.layers.12.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
185
+ "language_model.model.layers.12.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
186
+ "language_model.model.layers.12.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
187
+ "language_model.model.layers.12.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
188
+ "language_model.model.layers.12.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
189
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
190
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
191
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
192
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
193
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
194
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
195
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
196
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
197
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
198
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
199
+ "language_model.model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
200
+ "language_model.model.layers.13.linear_attn.A_log": "model-00002-of-00004.safetensors",
201
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
202
+ "language_model.model.layers.13.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
203
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
204
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
205
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
206
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
207
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
208
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
209
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
210
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
211
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
212
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
213
+ "language_model.model.layers.13.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
214
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
215
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
216
+ "language_model.model.layers.13.mlp.gate.biases": "model-00002-of-00004.safetensors",
217
+ "language_model.model.layers.13.mlp.gate.scales": "model-00002-of-00004.safetensors",
218
+ "language_model.model.layers.13.mlp.gate.weight": "model-00002-of-00004.safetensors",
219
  "language_model.model.layers.13.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
220
  "language_model.model.layers.13.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
221
  "language_model.model.layers.13.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
 
232
  "language_model.model.layers.13.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
233
  "language_model.model.layers.13.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
234
  "language_model.model.layers.13.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
235
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
236
  "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
237
  "language_model.model.layers.14.linear_attn.A_log": "model-00002-of-00004.safetensors",
238
  "language_model.model.layers.14.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
 
658
  "language_model.model.layers.24.mlp.gate.biases": "model-00002-of-00004.safetensors",
659
  "language_model.model.layers.24.mlp.gate.scales": "model-00002-of-00004.safetensors",
660
  "language_model.model.layers.24.mlp.gate.weight": "model-00002-of-00004.safetensors",
661
+ "language_model.model.layers.24.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
662
+ "language_model.model.layers.24.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
663
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
664
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
665
+ "language_model.model.layers.24.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
666
+ "language_model.model.layers.24.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
667
+ "language_model.model.layers.24.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
668
+ "language_model.model.layers.24.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
669
+ "language_model.model.layers.24.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
670
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
671
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
672
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
673
+ "language_model.model.layers.24.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
674
+ "language_model.model.layers.24.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
675
+ "language_model.model.layers.24.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
676
+ "language_model.model.layers.24.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
677
  "language_model.model.layers.24.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
678
+ "language_model.model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
679
+ "language_model.model.layers.25.linear_attn.A_log": "model-00003-of-00004.safetensors",
680
+ "language_model.model.layers.25.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
681
+ "language_model.model.layers.25.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
682
+ "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
683
+ "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
684
+ "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
685
+ "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
686
+ "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
687
+ "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
688
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
689
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
690
+ "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
691
+ "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
692
+ "language_model.model.layers.25.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
693
+ "language_model.model.layers.25.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
694
+ "language_model.model.layers.25.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
695
+ "language_model.model.layers.25.mlp.gate.biases": "model-00003-of-00004.safetensors",
696
+ "language_model.model.layers.25.mlp.gate.scales": "model-00003-of-00004.safetensors",
697
+ "language_model.model.layers.25.mlp.gate.weight": "model-00003-of-00004.safetensors",
698
  "language_model.model.layers.25.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
699
  "language_model.model.layers.25.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
700
  "language_model.model.layers.25.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
 
708
  "language_model.model.layers.25.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
709
  "language_model.model.layers.25.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
710
  "language_model.model.layers.25.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
711
+ "language_model.model.layers.25.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
712
+ "language_model.model.layers.25.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
713
  "language_model.model.layers.25.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
714
+ "language_model.model.layers.25.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
715
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
716
  "language_model.model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
717
  "language_model.model.layers.26.linear_attn.A_log": "model-00003-of-00004.safetensors",
718
  "language_model.model.layers.26.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
 
1137
  "language_model.model.layers.36.mlp.gate.biases": "model-00003-of-00004.safetensors",
1138
  "language_model.model.layers.36.mlp.gate.scales": "model-00003-of-00004.safetensors",
1139
  "language_model.model.layers.36.mlp.gate.weight": "model-00003-of-00004.safetensors",
1140
+ "language_model.model.layers.36.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
1141
+ "language_model.model.layers.36.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
1142
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
1143
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
1144
+ "language_model.model.layers.36.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
1145
+ "language_model.model.layers.36.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
1146
+ "language_model.model.layers.36.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
1147
+ "language_model.model.layers.36.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
1148
+ "language_model.model.layers.36.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
1149
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
1150
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
1151
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
1152
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
1153
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
1154
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
1155
  "language_model.model.layers.36.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
1156
+ "language_model.model.layers.37.input_layernorm.weight": "model-00004-of-00004.safetensors",
1157
+ "language_model.model.layers.37.linear_attn.A_log": "model-00004-of-00004.safetensors",
1158
+ "language_model.model.layers.37.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
1159
+ "language_model.model.layers.37.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
1160
+ "language_model.model.layers.37.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
1161
+ "language_model.model.layers.37.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
1162
+ "language_model.model.layers.37.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
1163
+ "language_model.model.layers.37.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
1164
+ "language_model.model.layers.37.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
1165
+ "language_model.model.layers.37.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
1166
+ "language_model.model.layers.37.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
1167
+ "language_model.model.layers.37.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
1168
+ "language_model.model.layers.37.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
1169
+ "language_model.model.layers.37.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
1170
+ "language_model.model.layers.37.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
1171
+ "language_model.model.layers.37.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
1172
+ "language_model.model.layers.37.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
1173
+ "language_model.model.layers.37.mlp.gate.biases": "model-00004-of-00004.safetensors",
1174
+ "language_model.model.layers.37.mlp.gate.scales": "model-00004-of-00004.safetensors",
1175
+ "language_model.model.layers.37.mlp.gate.weight": "model-00004-of-00004.safetensors",
1176
  "language_model.model.layers.37.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
1177
  "language_model.model.layers.37.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
1178
  "language_model.model.layers.37.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
 
1184
  "language_model.model.layers.37.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
1185
  "language_model.model.layers.37.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
1186
  "language_model.model.layers.37.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
1187
+ "language_model.model.layers.37.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
1188
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
1189
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
1190
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
1191
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
1192
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
1193
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
1194
+ "language_model.model.layers.37.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
1195
  "language_model.model.layers.38.input_layernorm.weight": "model-00004-of-00004.safetensors",
1196
  "language_model.model.layers.38.linear_attn.A_log": "model-00004-of-00004.safetensors",
1197
  "language_model.model.layers.38.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
1485
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
1486
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
1487
  "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
1488
+ "language_model.model.norm.weight": "model-00004-of-00004.safetensors",
1489
+ "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00004.safetensors",
1490
+ "vision_tower.blocks.0.attn.proj.biases": "model-00001-of-00004.safetensors",
1491
+ "vision_tower.blocks.0.attn.proj.scales": "model-00001-of-00004.safetensors",
1492
+ "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00004.safetensors",
1493
+ "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00004.safetensors",
1494
+ "vision_tower.blocks.0.attn.qkv.biases": "model-00001-of-00004.safetensors",
1495
+ "vision_tower.blocks.0.attn.qkv.scales": "model-00001-of-00004.safetensors",
1496
+ "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00004.safetensors",
1497
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1498
+ "vision_tower.blocks.0.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1499
+ "vision_tower.blocks.0.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1500
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1501
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1502
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1503
+ "vision_tower.blocks.0.norm1.bias": "model-00001-of-00004.safetensors",
1504
+ "vision_tower.blocks.0.norm1.weight": "model-00001-of-00004.safetensors",
1505
+ "vision_tower.blocks.0.norm2.bias": "model-00001-of-00004.safetensors",
1506
+ "vision_tower.blocks.0.norm2.weight": "model-00001-of-00004.safetensors",
1507
+ "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00004.safetensors",
1508
+ "vision_tower.blocks.1.attn.proj.biases": "model-00001-of-00004.safetensors",
1509
+ "vision_tower.blocks.1.attn.proj.scales": "model-00001-of-00004.safetensors",
1510
+ "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00004.safetensors",
1511
+ "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00004.safetensors",
1512
+ "vision_tower.blocks.1.attn.qkv.biases": "model-00001-of-00004.safetensors",
1513
+ "vision_tower.blocks.1.attn.qkv.scales": "model-00001-of-00004.safetensors",
1514
+ "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00004.safetensors",
1515
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1516
+ "vision_tower.blocks.1.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1517
+ "vision_tower.blocks.1.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1518
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1519
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1520
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1521
+ "vision_tower.blocks.1.norm1.bias": "model-00001-of-00004.safetensors",
1522
+ "vision_tower.blocks.1.norm1.weight": "model-00001-of-00004.safetensors",
1523
+ "vision_tower.blocks.1.norm2.bias": "model-00001-of-00004.safetensors",
1524
+ "vision_tower.blocks.1.norm2.weight": "model-00001-of-00004.safetensors",
1525
+ "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00004.safetensors",
1526
+ "vision_tower.blocks.10.attn.proj.biases": "model-00001-of-00004.safetensors",
1527
+ "vision_tower.blocks.10.attn.proj.scales": "model-00001-of-00004.safetensors",
1528
+ "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00004.safetensors",
1529
+ "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00004.safetensors",
1530
+ "vision_tower.blocks.10.attn.qkv.biases": "model-00001-of-00004.safetensors",
1531
+ "vision_tower.blocks.10.attn.qkv.scales": "model-00001-of-00004.safetensors",
1532
+ "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00004.safetensors",
1533
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1534
+ "vision_tower.blocks.10.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1535
+ "vision_tower.blocks.10.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1536
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1537
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1538
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1539
+ "vision_tower.blocks.10.norm1.bias": "model-00001-of-00004.safetensors",
1540
+ "vision_tower.blocks.10.norm1.weight": "model-00001-of-00004.safetensors",
1541
+ "vision_tower.blocks.10.norm2.bias": "model-00001-of-00004.safetensors",
1542
+ "vision_tower.blocks.10.norm2.weight": "model-00001-of-00004.safetensors",
1543
+ "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00004.safetensors",
1544
+ "vision_tower.blocks.11.attn.proj.biases": "model-00001-of-00004.safetensors",
1545
+ "vision_tower.blocks.11.attn.proj.scales": "model-00001-of-00004.safetensors",
1546
+ "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00004.safetensors",
1547
+ "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00004.safetensors",
1548
+ "vision_tower.blocks.11.attn.qkv.biases": "model-00001-of-00004.safetensors",
1549
+ "vision_tower.blocks.11.attn.qkv.scales": "model-00001-of-00004.safetensors",
1550
+ "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00004.safetensors",
1551
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1552
+ "vision_tower.blocks.11.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1553
+ "vision_tower.blocks.11.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1554
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1555
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1556
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1557
+ "vision_tower.blocks.11.norm1.bias": "model-00001-of-00004.safetensors",
1558
+ "vision_tower.blocks.11.norm1.weight": "model-00001-of-00004.safetensors",
1559
+ "vision_tower.blocks.11.norm2.bias": "model-00001-of-00004.safetensors",
1560
+ "vision_tower.blocks.11.norm2.weight": "model-00001-of-00004.safetensors",
1561
+ "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00004.safetensors",
1562
+ "vision_tower.blocks.12.attn.proj.biases": "model-00001-of-00004.safetensors",
1563
+ "vision_tower.blocks.12.attn.proj.scales": "model-00001-of-00004.safetensors",
1564
+ "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00004.safetensors",
1565
+ "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00004.safetensors",
1566
+ "vision_tower.blocks.12.attn.qkv.biases": "model-00001-of-00004.safetensors",
1567
+ "vision_tower.blocks.12.attn.qkv.scales": "model-00001-of-00004.safetensors",
1568
+ "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00004.safetensors",
1569
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1570
+ "vision_tower.blocks.12.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1571
+ "vision_tower.blocks.12.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1572
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1573
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1574
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1575
+ "vision_tower.blocks.12.norm1.bias": "model-00001-of-00004.safetensors",
1576
+ "vision_tower.blocks.12.norm1.weight": "model-00001-of-00004.safetensors",
1577
+ "vision_tower.blocks.12.norm2.bias": "model-00001-of-00004.safetensors",
1578
+ "vision_tower.blocks.12.norm2.weight": "model-00001-of-00004.safetensors",
1579
+ "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00004.safetensors",
1580
+ "vision_tower.blocks.13.attn.proj.biases": "model-00001-of-00004.safetensors",
1581
+ "vision_tower.blocks.13.attn.proj.scales": "model-00001-of-00004.safetensors",
1582
+ "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00004.safetensors",
1583
+ "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00004.safetensors",
1584
+ "vision_tower.blocks.13.attn.qkv.biases": "model-00001-of-00004.safetensors",
1585
+ "vision_tower.blocks.13.attn.qkv.scales": "model-00001-of-00004.safetensors",
1586
+ "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00004.safetensors",
1587
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1588
+ "vision_tower.blocks.13.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1589
+ "vision_tower.blocks.13.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1590
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1591
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1592
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1593
+ "vision_tower.blocks.13.norm1.bias": "model-00001-of-00004.safetensors",
1594
+ "vision_tower.blocks.13.norm1.weight": "model-00001-of-00004.safetensors",
1595
+ "vision_tower.blocks.13.norm2.bias": "model-00001-of-00004.safetensors",
1596
+ "vision_tower.blocks.13.norm2.weight": "model-00001-of-00004.safetensors",
1597
+ "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00004.safetensors",
1598
+ "vision_tower.blocks.14.attn.proj.biases": "model-00001-of-00004.safetensors",
1599
+ "vision_tower.blocks.14.attn.proj.scales": "model-00001-of-00004.safetensors",
1600
+ "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00004.safetensors",
1601
+ "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00004.safetensors",
1602
+ "vision_tower.blocks.14.attn.qkv.biases": "model-00001-of-00004.safetensors",
1603
+ "vision_tower.blocks.14.attn.qkv.scales": "model-00001-of-00004.safetensors",
1604
+ "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00004.safetensors",
1605
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1606
+ "vision_tower.blocks.14.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1607
+ "vision_tower.blocks.14.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1608
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1609
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1610
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1611
+ "vision_tower.blocks.14.norm1.bias": "model-00001-of-00004.safetensors",
1612
+ "vision_tower.blocks.14.norm1.weight": "model-00001-of-00004.safetensors",
1613
+ "vision_tower.blocks.14.norm2.bias": "model-00001-of-00004.safetensors",
1614
+ "vision_tower.blocks.14.norm2.weight": "model-00001-of-00004.safetensors",
1615
+ "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00004.safetensors",
1616
+ "vision_tower.blocks.15.attn.proj.biases": "model-00001-of-00004.safetensors",
1617
+ "vision_tower.blocks.15.attn.proj.scales": "model-00001-of-00004.safetensors",
1618
+ "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00004.safetensors",
1619
+ "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00004.safetensors",
1620
+ "vision_tower.blocks.15.attn.qkv.biases": "model-00001-of-00004.safetensors",
1621
+ "vision_tower.blocks.15.attn.qkv.scales": "model-00001-of-00004.safetensors",
1622
+ "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00004.safetensors",
1623
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1624
+ "vision_tower.blocks.15.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1625
+ "vision_tower.blocks.15.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1626
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1627
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1628
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1629
+ "vision_tower.blocks.15.norm1.bias": "model-00001-of-00004.safetensors",
1630
+ "vision_tower.blocks.15.norm1.weight": "model-00001-of-00004.safetensors",
1631
+ "vision_tower.blocks.15.norm2.bias": "model-00001-of-00004.safetensors",
1632
+ "vision_tower.blocks.15.norm2.weight": "model-00001-of-00004.safetensors",
1633
+ "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00004.safetensors",
1634
+ "vision_tower.blocks.16.attn.proj.biases": "model-00001-of-00004.safetensors",
1635
+ "vision_tower.blocks.16.attn.proj.scales": "model-00001-of-00004.safetensors",
1636
+ "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00004.safetensors",
1637
+ "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00004.safetensors",
1638
+ "vision_tower.blocks.16.attn.qkv.biases": "model-00001-of-00004.safetensors",
1639
+ "vision_tower.blocks.16.attn.qkv.scales": "model-00001-of-00004.safetensors",
1640
+ "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00004.safetensors",
1641
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1642
+ "vision_tower.blocks.16.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1643
+ "vision_tower.blocks.16.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1644
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1645
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1646
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1647
+ "vision_tower.blocks.16.norm1.bias": "model-00001-of-00004.safetensors",
1648
+ "vision_tower.blocks.16.norm1.weight": "model-00001-of-00004.safetensors",
1649
+ "vision_tower.blocks.16.norm2.bias": "model-00001-of-00004.safetensors",
1650
+ "vision_tower.blocks.16.norm2.weight": "model-00001-of-00004.safetensors",
1651
+ "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00004.safetensors",
1652
+ "vision_tower.blocks.17.attn.proj.biases": "model-00001-of-00004.safetensors",
1653
+ "vision_tower.blocks.17.attn.proj.scales": "model-00001-of-00004.safetensors",
1654
+ "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00004.safetensors",
1655
+ "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00004.safetensors",
1656
+ "vision_tower.blocks.17.attn.qkv.biases": "model-00001-of-00004.safetensors",
1657
+ "vision_tower.blocks.17.attn.qkv.scales": "model-00001-of-00004.safetensors",
1658
+ "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00004.safetensors",
1659
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1660
+ "vision_tower.blocks.17.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1661
+ "vision_tower.blocks.17.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1662
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1663
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1664
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1665
+ "vision_tower.blocks.17.norm1.bias": "model-00001-of-00004.safetensors",
1666
+ "vision_tower.blocks.17.norm1.weight": "model-00001-of-00004.safetensors",
1667
+ "vision_tower.blocks.17.norm2.bias": "model-00001-of-00004.safetensors",
1668
+ "vision_tower.blocks.17.norm2.weight": "model-00001-of-00004.safetensors",
1669
+ "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00004.safetensors",
1670
+ "vision_tower.blocks.18.attn.proj.biases": "model-00001-of-00004.safetensors",
1671
+ "vision_tower.blocks.18.attn.proj.scales": "model-00001-of-00004.safetensors",
1672
+ "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00004.safetensors",
1673
+ "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00004.safetensors",
1674
+ "vision_tower.blocks.18.attn.qkv.biases": "model-00001-of-00004.safetensors",
1675
+ "vision_tower.blocks.18.attn.qkv.scales": "model-00001-of-00004.safetensors",
1676
+ "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00004.safetensors",
1677
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1678
+ "vision_tower.blocks.18.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1679
+ "vision_tower.blocks.18.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1680
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1681
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1682
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1683
+ "vision_tower.blocks.18.norm1.bias": "model-00001-of-00004.safetensors",
1684
+ "vision_tower.blocks.18.norm1.weight": "model-00001-of-00004.safetensors",
1685
+ "vision_tower.blocks.18.norm2.bias": "model-00001-of-00004.safetensors",
1686
+ "vision_tower.blocks.18.norm2.weight": "model-00001-of-00004.safetensors",
1687
+ "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00004.safetensors",
1688
+ "vision_tower.blocks.19.attn.proj.biases": "model-00001-of-00004.safetensors",
1689
+ "vision_tower.blocks.19.attn.proj.scales": "model-00001-of-00004.safetensors",
1690
+ "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00004.safetensors",
1691
+ "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00004.safetensors",
1692
+ "vision_tower.blocks.19.attn.qkv.biases": "model-00001-of-00004.safetensors",
1693
+ "vision_tower.blocks.19.attn.qkv.scales": "model-00001-of-00004.safetensors",
1694
+ "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00004.safetensors",
1695
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1696
+ "vision_tower.blocks.19.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1697
+ "vision_tower.blocks.19.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1698
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1699
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1700
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1701
+ "vision_tower.blocks.19.norm1.bias": "model-00001-of-00004.safetensors",
1702
+ "vision_tower.blocks.19.norm1.weight": "model-00001-of-00004.safetensors",
1703
+ "vision_tower.blocks.19.norm2.bias": "model-00001-of-00004.safetensors",
1704
+ "vision_tower.blocks.19.norm2.weight": "model-00001-of-00004.safetensors",
1705
+ "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00004.safetensors",
1706
+ "vision_tower.blocks.2.attn.proj.biases": "model-00001-of-00004.safetensors",
1707
+ "vision_tower.blocks.2.attn.proj.scales": "model-00001-of-00004.safetensors",
1708
+ "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00004.safetensors",
1709
+ "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00004.safetensors",
1710
+ "vision_tower.blocks.2.attn.qkv.biases": "model-00001-of-00004.safetensors",
1711
+ "vision_tower.blocks.2.attn.qkv.scales": "model-00001-of-00004.safetensors",
1712
+ "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00004.safetensors",
1713
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1714
+ "vision_tower.blocks.2.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1715
+ "vision_tower.blocks.2.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1716
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1717
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1718
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1719
+ "vision_tower.blocks.2.norm1.bias": "model-00001-of-00004.safetensors",
1720
+ "vision_tower.blocks.2.norm1.weight": "model-00001-of-00004.safetensors",
1721
+ "vision_tower.blocks.2.norm2.bias": "model-00001-of-00004.safetensors",
1722
+ "vision_tower.blocks.2.norm2.weight": "model-00001-of-00004.safetensors",
1723
+ "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00004.safetensors",
1724
+ "vision_tower.blocks.20.attn.proj.biases": "model-00001-of-00004.safetensors",
1725
+ "vision_tower.blocks.20.attn.proj.scales": "model-00001-of-00004.safetensors",
1726
+ "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00004.safetensors",
1727
+ "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00004.safetensors",
1728
+ "vision_tower.blocks.20.attn.qkv.biases": "model-00001-of-00004.safetensors",
1729
+ "vision_tower.blocks.20.attn.qkv.scales": "model-00001-of-00004.safetensors",
1730
+ "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00004.safetensors",
1731
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1732
+ "vision_tower.blocks.20.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1733
+ "vision_tower.blocks.20.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1734
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1735
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1736
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1737
+ "vision_tower.blocks.20.norm1.bias": "model-00001-of-00004.safetensors",
1738
+ "vision_tower.blocks.20.norm1.weight": "model-00001-of-00004.safetensors",
1739
+ "vision_tower.blocks.20.norm2.bias": "model-00001-of-00004.safetensors",
1740
+ "vision_tower.blocks.20.norm2.weight": "model-00001-of-00004.safetensors",
1741
+ "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00004.safetensors",
1742
+ "vision_tower.blocks.21.attn.proj.biases": "model-00001-of-00004.safetensors",
1743
+ "vision_tower.blocks.21.attn.proj.scales": "model-00001-of-00004.safetensors",
1744
+ "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00004.safetensors",
1745
+ "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00004.safetensors",
1746
+ "vision_tower.blocks.21.attn.qkv.biases": "model-00001-of-00004.safetensors",
1747
+ "vision_tower.blocks.21.attn.qkv.scales": "model-00001-of-00004.safetensors",
1748
+ "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00004.safetensors",
1749
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1750
+ "vision_tower.blocks.21.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1751
+ "vision_tower.blocks.21.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1752
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1753
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1754
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1755
+ "vision_tower.blocks.21.norm1.bias": "model-00001-of-00004.safetensors",
1756
+ "vision_tower.blocks.21.norm1.weight": "model-00001-of-00004.safetensors",
1757
+ "vision_tower.blocks.21.norm2.bias": "model-00001-of-00004.safetensors",
1758
+ "vision_tower.blocks.21.norm2.weight": "model-00001-of-00004.safetensors",
1759
+ "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00004.safetensors",
1760
+ "vision_tower.blocks.22.attn.proj.biases": "model-00001-of-00004.safetensors",
1761
+ "vision_tower.blocks.22.attn.proj.scales": "model-00001-of-00004.safetensors",
1762
+ "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00004.safetensors",
1763
+ "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00004.safetensors",
1764
+ "vision_tower.blocks.22.attn.qkv.biases": "model-00001-of-00004.safetensors",
1765
+ "vision_tower.blocks.22.attn.qkv.scales": "model-00001-of-00004.safetensors",
1766
+ "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00004.safetensors",
1767
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1768
+ "vision_tower.blocks.22.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1769
+ "vision_tower.blocks.22.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1770
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1771
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1772
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1773
+ "vision_tower.blocks.22.norm1.bias": "model-00001-of-00004.safetensors",
1774
+ "vision_tower.blocks.22.norm1.weight": "model-00001-of-00004.safetensors",
1775
+ "vision_tower.blocks.22.norm2.bias": "model-00001-of-00004.safetensors",
1776
+ "vision_tower.blocks.22.norm2.weight": "model-00001-of-00004.safetensors",
1777
+ "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00004.safetensors",
1778
+ "vision_tower.blocks.23.attn.proj.biases": "model-00001-of-00004.safetensors",
1779
+ "vision_tower.blocks.23.attn.proj.scales": "model-00001-of-00004.safetensors",
1780
+ "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00004.safetensors",
1781
+ "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00004.safetensors",
1782
+ "vision_tower.blocks.23.attn.qkv.biases": "model-00001-of-00004.safetensors",
1783
+ "vision_tower.blocks.23.attn.qkv.scales": "model-00001-of-00004.safetensors",
1784
+ "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00004.safetensors",
1785
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1786
+ "vision_tower.blocks.23.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1787
+ "vision_tower.blocks.23.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1788
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1789
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1790
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1791
+ "vision_tower.blocks.23.norm1.bias": "model-00001-of-00004.safetensors",
1792
+ "vision_tower.blocks.23.norm1.weight": "model-00001-of-00004.safetensors",
1793
+ "vision_tower.blocks.23.norm2.bias": "model-00001-of-00004.safetensors",
1794
+ "vision_tower.blocks.23.norm2.weight": "model-00001-of-00004.safetensors",
1795
+ "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00004.safetensors",
1796
+ "vision_tower.blocks.24.attn.proj.biases": "model-00001-of-00004.safetensors",
1797
+ "vision_tower.blocks.24.attn.proj.scales": "model-00001-of-00004.safetensors",
1798
+ "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00004.safetensors",
1799
+ "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00004.safetensors",
1800
+ "vision_tower.blocks.24.attn.qkv.biases": "model-00001-of-00004.safetensors",
1801
+ "vision_tower.blocks.24.attn.qkv.scales": "model-00001-of-00004.safetensors",
1802
+ "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00004.safetensors",
1803
+ "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1804
+ "vision_tower.blocks.24.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1805
+ "vision_tower.blocks.24.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1806
+ "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1807
+ "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1808
+ "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1809
+ "vision_tower.blocks.24.norm1.bias": "model-00001-of-00004.safetensors",
1810
+ "vision_tower.blocks.24.norm1.weight": "model-00001-of-00004.safetensors",
1811
+ "vision_tower.blocks.24.norm2.bias": "model-00001-of-00004.safetensors",
1812
+ "vision_tower.blocks.24.norm2.weight": "model-00001-of-00004.safetensors",
1813
+ "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00004.safetensors",
1814
+ "vision_tower.blocks.25.attn.proj.biases": "model-00001-of-00004.safetensors",
1815
+ "vision_tower.blocks.25.attn.proj.scales": "model-00001-of-00004.safetensors",
1816
+ "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00004.safetensors",
1817
+ "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00004.safetensors",
1818
+ "vision_tower.blocks.25.attn.qkv.biases": "model-00001-of-00004.safetensors",
1819
+ "vision_tower.blocks.25.attn.qkv.scales": "model-00001-of-00004.safetensors",
1820
+ "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00004.safetensors",
1821
+ "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1822
+ "vision_tower.blocks.25.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1823
+ "vision_tower.blocks.25.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1824
+ "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1825
+ "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1826
+ "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1827
+ "vision_tower.blocks.25.norm1.bias": "model-00001-of-00004.safetensors",
1828
+ "vision_tower.blocks.25.norm1.weight": "model-00001-of-00004.safetensors",
1829
+ "vision_tower.blocks.25.norm2.bias": "model-00001-of-00004.safetensors",
1830
+ "vision_tower.blocks.25.norm2.weight": "model-00001-of-00004.safetensors",
1831
+ "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00004.safetensors",
1832
+ "vision_tower.blocks.26.attn.proj.biases": "model-00001-of-00004.safetensors",
1833
+ "vision_tower.blocks.26.attn.proj.scales": "model-00001-of-00004.safetensors",
1834
+ "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00004.safetensors",
1835
+ "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00004.safetensors",
1836
+ "vision_tower.blocks.26.attn.qkv.biases": "model-00001-of-00004.safetensors",
1837
+ "vision_tower.blocks.26.attn.qkv.scales": "model-00001-of-00004.safetensors",
1838
+ "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00004.safetensors",
1839
+ "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1840
+ "vision_tower.blocks.26.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1841
+ "vision_tower.blocks.26.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1842
+ "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1843
+ "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1844
+ "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1845
+ "vision_tower.blocks.26.norm1.bias": "model-00001-of-00004.safetensors",
1846
+ "vision_tower.blocks.26.norm1.weight": "model-00001-of-00004.safetensors",
1847
+ "vision_tower.blocks.26.norm2.bias": "model-00001-of-00004.safetensors",
1848
+ "vision_tower.blocks.26.norm2.weight": "model-00001-of-00004.safetensors",
1849
+ "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00004.safetensors",
1850
+ "vision_tower.blocks.3.attn.proj.biases": "model-00001-of-00004.safetensors",
1851
+ "vision_tower.blocks.3.attn.proj.scales": "model-00001-of-00004.safetensors",
1852
+ "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00004.safetensors",
1853
+ "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00004.safetensors",
1854
+ "vision_tower.blocks.3.attn.qkv.biases": "model-00001-of-00004.safetensors",
1855
+ "vision_tower.blocks.3.attn.qkv.scales": "model-00001-of-00004.safetensors",
1856
+ "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00004.safetensors",
1857
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1858
+ "vision_tower.blocks.3.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1859
+ "vision_tower.blocks.3.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1860
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1861
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1862
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1863
+ "vision_tower.blocks.3.norm1.bias": "model-00001-of-00004.safetensors",
1864
+ "vision_tower.blocks.3.norm1.weight": "model-00001-of-00004.safetensors",
1865
+ "vision_tower.blocks.3.norm2.bias": "model-00001-of-00004.safetensors",
1866
+ "vision_tower.blocks.3.norm2.weight": "model-00001-of-00004.safetensors",
1867
+ "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00004.safetensors",
1868
+ "vision_tower.blocks.4.attn.proj.biases": "model-00001-of-00004.safetensors",
1869
+ "vision_tower.blocks.4.attn.proj.scales": "model-00001-of-00004.safetensors",
1870
+ "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00004.safetensors",
1871
+ "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00004.safetensors",
1872
+ "vision_tower.blocks.4.attn.qkv.biases": "model-00001-of-00004.safetensors",
1873
+ "vision_tower.blocks.4.attn.qkv.scales": "model-00001-of-00004.safetensors",
1874
+ "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00004.safetensors",
1875
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1876
+ "vision_tower.blocks.4.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1877
+ "vision_tower.blocks.4.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1878
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1879
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1880
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1881
+ "vision_tower.blocks.4.norm1.bias": "model-00001-of-00004.safetensors",
1882
+ "vision_tower.blocks.4.norm1.weight": "model-00001-of-00004.safetensors",
1883
+ "vision_tower.blocks.4.norm2.bias": "model-00001-of-00004.safetensors",
1884
+ "vision_tower.blocks.4.norm2.weight": "model-00001-of-00004.safetensors",
1885
+ "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00004.safetensors",
1886
+ "vision_tower.blocks.5.attn.proj.biases": "model-00001-of-00004.safetensors",
1887
+ "vision_tower.blocks.5.attn.proj.scales": "model-00001-of-00004.safetensors",
1888
+ "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00004.safetensors",
1889
+ "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00004.safetensors",
1890
+ "vision_tower.blocks.5.attn.qkv.biases": "model-00001-of-00004.safetensors",
1891
+ "vision_tower.blocks.5.attn.qkv.scales": "model-00001-of-00004.safetensors",
1892
+ "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00004.safetensors",
1893
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1894
+ "vision_tower.blocks.5.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1895
+ "vision_tower.blocks.5.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1896
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1897
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1898
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1899
+ "vision_tower.blocks.5.norm1.bias": "model-00001-of-00004.safetensors",
1900
+ "vision_tower.blocks.5.norm1.weight": "model-00001-of-00004.safetensors",
1901
+ "vision_tower.blocks.5.norm2.bias": "model-00001-of-00004.safetensors",
1902
+ "vision_tower.blocks.5.norm2.weight": "model-00001-of-00004.safetensors",
1903
+ "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00004.safetensors",
1904
+ "vision_tower.blocks.6.attn.proj.biases": "model-00001-of-00004.safetensors",
1905
+ "vision_tower.blocks.6.attn.proj.scales": "model-00001-of-00004.safetensors",
1906
+ "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00004.safetensors",
1907
+ "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00004.safetensors",
1908
+ "vision_tower.blocks.6.attn.qkv.biases": "model-00001-of-00004.safetensors",
1909
+ "vision_tower.blocks.6.attn.qkv.scales": "model-00001-of-00004.safetensors",
1910
+ "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00004.safetensors",
1911
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1912
+ "vision_tower.blocks.6.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1913
+ "vision_tower.blocks.6.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1914
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1915
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1916
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1917
+ "vision_tower.blocks.6.norm1.bias": "model-00001-of-00004.safetensors",
1918
+ "vision_tower.blocks.6.norm1.weight": "model-00001-of-00004.safetensors",
1919
+ "vision_tower.blocks.6.norm2.bias": "model-00001-of-00004.safetensors",
1920
+ "vision_tower.blocks.6.norm2.weight": "model-00001-of-00004.safetensors",
1921
+ "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00004.safetensors",
1922
+ "vision_tower.blocks.7.attn.proj.biases": "model-00001-of-00004.safetensors",
1923
+ "vision_tower.blocks.7.attn.proj.scales": "model-00001-of-00004.safetensors",
1924
+ "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00004.safetensors",
1925
+ "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00004.safetensors",
1926
+ "vision_tower.blocks.7.attn.qkv.biases": "model-00001-of-00004.safetensors",
1927
+ "vision_tower.blocks.7.attn.qkv.scales": "model-00001-of-00004.safetensors",
1928
+ "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00004.safetensors",
1929
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1930
+ "vision_tower.blocks.7.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1931
+ "vision_tower.blocks.7.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1932
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1933
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1934
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1935
+ "vision_tower.blocks.7.norm1.bias": "model-00001-of-00004.safetensors",
1936
+ "vision_tower.blocks.7.norm1.weight": "model-00001-of-00004.safetensors",
1937
+ "vision_tower.blocks.7.norm2.bias": "model-00001-of-00004.safetensors",
1938
+ "vision_tower.blocks.7.norm2.weight": "model-00001-of-00004.safetensors",
1939
+ "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00004.safetensors",
1940
+ "vision_tower.blocks.8.attn.proj.biases": "model-00001-of-00004.safetensors",
1941
+ "vision_tower.blocks.8.attn.proj.scales": "model-00001-of-00004.safetensors",
1942
+ "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00004.safetensors",
1943
+ "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00004.safetensors",
1944
+ "vision_tower.blocks.8.attn.qkv.biases": "model-00001-of-00004.safetensors",
1945
+ "vision_tower.blocks.8.attn.qkv.scales": "model-00001-of-00004.safetensors",
1946
+ "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00004.safetensors",
1947
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1948
+ "vision_tower.blocks.8.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1949
+ "vision_tower.blocks.8.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1950
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1951
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1952
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1953
+ "vision_tower.blocks.8.norm1.bias": "model-00001-of-00004.safetensors",
1954
+ "vision_tower.blocks.8.norm1.weight": "model-00001-of-00004.safetensors",
1955
+ "vision_tower.blocks.8.norm2.bias": "model-00001-of-00004.safetensors",
1956
+ "vision_tower.blocks.8.norm2.weight": "model-00001-of-00004.safetensors",
1957
+ "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00004.safetensors",
1958
+ "vision_tower.blocks.9.attn.proj.biases": "model-00001-of-00004.safetensors",
1959
+ "vision_tower.blocks.9.attn.proj.scales": "model-00001-of-00004.safetensors",
1960
+ "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00004.safetensors",
1961
+ "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00004.safetensors",
1962
+ "vision_tower.blocks.9.attn.qkv.biases": "model-00001-of-00004.safetensors",
1963
+ "vision_tower.blocks.9.attn.qkv.scales": "model-00001-of-00004.safetensors",
1964
+ "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00004.safetensors",
1965
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
1966
+ "vision_tower.blocks.9.mlp.linear_fc1.biases": "model-00001-of-00004.safetensors",
1967
+ "vision_tower.blocks.9.mlp.linear_fc1.scales": "model-00001-of-00004.safetensors",
1968
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
1969
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
1970
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
1971
+ "vision_tower.blocks.9.norm1.bias": "model-00001-of-00004.safetensors",
1972
+ "vision_tower.blocks.9.norm1.weight": "model-00001-of-00004.safetensors",
1973
+ "vision_tower.blocks.9.norm2.bias": "model-00001-of-00004.safetensors",
1974
+ "vision_tower.blocks.9.norm2.weight": "model-00001-of-00004.safetensors",
1975
+ "vision_tower.merger.linear_fc1.bias": "model-00001-of-00004.safetensors",
1976
+ "vision_tower.merger.linear_fc1.biases": "model-00001-of-00004.safetensors",
1977
+ "vision_tower.merger.linear_fc1.scales": "model-00001-of-00004.safetensors",
1978
+ "vision_tower.merger.linear_fc1.weight": "model-00001-of-00004.safetensors",
1979
+ "vision_tower.merger.linear_fc2.bias": "model-00001-of-00004.safetensors",
1980
+ "vision_tower.merger.linear_fc2.biases": "model-00001-of-00004.safetensors",
1981
+ "vision_tower.merger.linear_fc2.scales": "model-00001-of-00004.safetensors",
1982
+ "vision_tower.merger.linear_fc2.weight": "model-00001-of-00004.safetensors",
1983
+ "vision_tower.merger.norm.bias": "model-00001-of-00004.safetensors",
1984
+ "vision_tower.merger.norm.weight": "model-00001-of-00004.safetensors",
1985
+ "vision_tower.patch_embed.proj.bias": "model-00001-of-00004.safetensors",
1986
+ "vision_tower.patch_embed.proj.weight": "model-00001-of-00004.safetensors",
1987
+ "vision_tower.pos_embed.biases": "model-00001-of-00004.safetensors",
1988
+ "vision_tower.pos_embed.scales": "model-00001-of-00004.safetensors",
1989
+ "vision_tower.pos_embed.weight": "model-00001-of-00004.safetensors"
1990
  }
1991
  }
preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 16777216,
4
+ "shortest_edge": 65536
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "image_processor_type": "Qwen2VLImageProcessorFast"
21
+ }
processor_config.json ADDED
@@ -0,0 +1,50 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": true,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "image_mean": [
7
+ 0.5,
8
+ 0.5,
9
+ 0.5
10
+ ],
11
+ "image_processor_type": "Qwen3VLImageProcessor",
12
+ "image_std": [
13
+ 0.5,
14
+ 0.5,
15
+ 0.5
16
+ ],
17
+ "max_pixels": 16777216,
18
+ "merge_size": 2,
19
+ "min_pixels": 65536,
20
+ "patch_size": 16,
21
+ "rescale_factor": 0.00392156862745098,
22
+ "temporal_patch_size": 2
23
+ },
24
+ "processor_class": "Qwen3VLProcessor",
25
+ "video_processor": {
26
+ "do_convert_rgb": true,
27
+ "do_normalize": true,
28
+ "do_rescale": true,
29
+ "fps": 2.0,
30
+ "image_mean": [
31
+ 0.5,
32
+ 0.5,
33
+ 0.5
34
+ ],
35
+ "image_std": [
36
+ 0.5,
37
+ 0.5,
38
+ 0.5
39
+ ],
40
+ "max_frames": 768,
41
+ "max_pixels": 25165824,
42
+ "merge_size": 2,
43
+ "min_frames": 4,
44
+ "min_pixels": 4096,
45
+ "patch_size": 16,
46
+ "rescale_factor": 0.00392156862745098,
47
+ "temporal_patch_size": 2,
48
+ "video_processor_type": "Qwen3VLVideoProcessor"
49
+ }
50
+ }
tokenizer_config.json CHANGED
@@ -23,9 +23,9 @@
23
  },
24
  "pad_token": "<|endoftext|>",
25
  "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
 
26
  "split_special_tokens": false,
27
  "tokenizer_class": "Qwen2Tokenizer",
28
- "tool_parser_type": "qwen3_coder",
29
  "unk_token": null,
30
  "video_token": "<|video_pad|>",
31
  "vision_bos_token": "<|vision_start|>",
 
23
  },
24
  "pad_token": "<|endoftext|>",
25
  "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
26
+ "processor_class": "Qwen3VLProcessor",
27
  "split_special_tokens": false,
28
  "tokenizer_class": "Qwen2Tokenizer",
 
29
  "unk_token": null,
30
  "video_token": "<|video_pad|>",
31
  "vision_bos_token": "<|vision_start|>",
video_preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 25165824,
4
+ "shortest_edge": 4096
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "video_processor_type": "Qwen3VLVideoProcessor"
21
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff