INC4AI commited on
Commit
790ad0c
·
verified ·
1 Parent(s): b713ce1

Upload quantized model Qwen3.5-9B-AutoRound-MXFP8

Browse files
README.md CHANGED
@@ -25,9 +25,9 @@ This is a **MXFP8** quantization of [Qwen/Qwen3.5-9B](https://huggingface.co/Qwe
25
 
26
  | Benchmark | Score |
27
  |---|---|
28
- | gsm8k | 0.9393 |
29
- | hellaswag | 0.7796 |
30
- | mmlu | 0.7848 |
31
- | piqa | 0.7971 |
32
 
33
  _Produced with [autoquant-agent](https://github.com/) — agent-driven quantize + evaluate + self-heal._
 
25
 
26
  | Benchmark | Score |
27
  |---|---|
28
+ | gsm8k | 0.9416 |
29
+ | hellaswag | 0.7792 |
30
+ | mmlu | 0.7827 |
31
+ | piqa | 0.7949 |
32
 
33
  _Produced with [autoquant-agent](https://github.com/) — agent-driven quantize + evaluate + self-heal._
model-00004-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fee3a86de3472780518cbf03dc44abdd72b801177ecc6e7f2a07fa43748e6579
3
- size 2163921200
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ed81c8641bf094ef26cec03489febc558bf534133a61aadbdac17dac4356366b
3
+ size 2163921232
model.safetensors.index.json CHANGED
@@ -1,6 +1,6 @@
1
  {
2
  "metadata": {
3
- "total_size": 0
4
  },
5
  "weight_map": {
6
  "model.language_model.layers.14.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
@@ -264,6 +264,8 @@
264
  "model.language_model.layers.0.input_layernorm.weight": "model-00004-of-00004.safetensors",
265
  "model.language_model.layers.0.linear_attn.A_log": "model-00004-of-00004.safetensors",
266
  "model.language_model.layers.0.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
267
  "model.language_model.layers.0.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
268
  "model.language_model.layers.0.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
269
  "model.language_model.layers.0.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -273,6 +275,8 @@
273
  "model.language_model.layers.1.input_layernorm.weight": "model-00004-of-00004.safetensors",
274
  "model.language_model.layers.1.linear_attn.A_log": "model-00004-of-00004.safetensors",
275
  "model.language_model.layers.1.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
276
  "model.language_model.layers.1.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
277
  "model.language_model.layers.1.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
278
  "model.language_model.layers.1.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -282,6 +286,8 @@
282
  "model.language_model.layers.10.input_layernorm.weight": "model-00004-of-00004.safetensors",
283
  "model.language_model.layers.10.linear_attn.A_log": "model-00004-of-00004.safetensors",
284
  "model.language_model.layers.10.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
285
  "model.language_model.layers.10.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
286
  "model.language_model.layers.10.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
287
  "model.language_model.layers.10.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -301,6 +307,8 @@
301
  "model.language_model.layers.12.input_layernorm.weight": "model-00004-of-00004.safetensors",
302
  "model.language_model.layers.12.linear_attn.A_log": "model-00004-of-00004.safetensors",
303
  "model.language_model.layers.12.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
304
  "model.language_model.layers.12.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
305
  "model.language_model.layers.12.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
306
  "model.language_model.layers.12.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
@@ -312,6 +320,8 @@
312
  "model.language_model.layers.13.input_layernorm.weight": "model-00004-of-00004.safetensors",
313
  "model.language_model.layers.13.linear_attn.A_log": "model-00004-of-00004.safetensors",
314
  "model.language_model.layers.13.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
315
  "model.language_model.layers.13.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
316
  "model.language_model.layers.13.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
317
  "model.language_model.layers.13.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
@@ -323,6 +333,8 @@
323
  "model.language_model.layers.14.input_layernorm.weight": "model-00004-of-00004.safetensors",
324
  "model.language_model.layers.14.linear_attn.A_log": "model-00004-of-00004.safetensors",
325
  "model.language_model.layers.14.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
326
  "model.language_model.layers.14.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
327
  "model.language_model.layers.14.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
328
  "model.language_model.layers.14.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -342,6 +354,8 @@
342
  "model.language_model.layers.16.input_layernorm.weight": "model-00004-of-00004.safetensors",
343
  "model.language_model.layers.16.linear_attn.A_log": "model-00004-of-00004.safetensors",
344
  "model.language_model.layers.16.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
345
  "model.language_model.layers.16.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
346
  "model.language_model.layers.16.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
347
  "model.language_model.layers.16.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -351,6 +365,8 @@
351
  "model.language_model.layers.17.input_layernorm.weight": "model-00004-of-00004.safetensors",
352
  "model.language_model.layers.17.linear_attn.A_log": "model-00004-of-00004.safetensors",
353
  "model.language_model.layers.17.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
354
  "model.language_model.layers.17.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
355
  "model.language_model.layers.17.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
356
  "model.language_model.layers.17.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -360,6 +376,8 @@
360
  "model.language_model.layers.18.input_layernorm.weight": "model-00004-of-00004.safetensors",
361
  "model.language_model.layers.18.linear_attn.A_log": "model-00004-of-00004.safetensors",
362
  "model.language_model.layers.18.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
363
  "model.language_model.layers.18.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
364
  "model.language_model.layers.18.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
365
  "model.language_model.layers.18.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -379,6 +397,8 @@
379
  "model.language_model.layers.2.input_layernorm.weight": "model-00004-of-00004.safetensors",
380
  "model.language_model.layers.2.linear_attn.A_log": "model-00004-of-00004.safetensors",
381
  "model.language_model.layers.2.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
382
  "model.language_model.layers.2.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
383
  "model.language_model.layers.2.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
384
  "model.language_model.layers.2.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -388,6 +408,8 @@
388
  "model.language_model.layers.20.input_layernorm.weight": "model-00004-of-00004.safetensors",
389
  "model.language_model.layers.20.linear_attn.A_log": "model-00004-of-00004.safetensors",
390
  "model.language_model.layers.20.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
391
  "model.language_model.layers.20.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
392
  "model.language_model.layers.20.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
393
  "model.language_model.layers.20.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -397,6 +419,8 @@
397
  "model.language_model.layers.21.input_layernorm.weight": "model-00004-of-00004.safetensors",
398
  "model.language_model.layers.21.linear_attn.A_log": "model-00004-of-00004.safetensors",
399
  "model.language_model.layers.21.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
400
  "model.language_model.layers.21.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
401
  "model.language_model.layers.21.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
402
  "model.language_model.layers.21.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
@@ -408,6 +432,8 @@
408
  "model.language_model.layers.22.input_layernorm.weight": "model-00004-of-00004.safetensors",
409
  "model.language_model.layers.22.linear_attn.A_log": "model-00004-of-00004.safetensors",
410
  "model.language_model.layers.22.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
411
  "model.language_model.layers.22.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
412
  "model.language_model.layers.22.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
413
  "model.language_model.layers.22.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -427,6 +453,8 @@
427
  "model.language_model.layers.24.input_layernorm.weight": "model-00004-of-00004.safetensors",
428
  "model.language_model.layers.24.linear_attn.A_log": "model-00004-of-00004.safetensors",
429
  "model.language_model.layers.24.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
430
  "model.language_model.layers.24.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
431
  "model.language_model.layers.24.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
432
  "model.language_model.layers.24.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -436,6 +464,8 @@
436
  "model.language_model.layers.25.input_layernorm.weight": "model-00004-of-00004.safetensors",
437
  "model.language_model.layers.25.linear_attn.A_log": "model-00004-of-00004.safetensors",
438
  "model.language_model.layers.25.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
439
  "model.language_model.layers.25.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
440
  "model.language_model.layers.25.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
441
  "model.language_model.layers.25.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -445,6 +475,8 @@
445
  "model.language_model.layers.26.input_layernorm.weight": "model-00004-of-00004.safetensors",
446
  "model.language_model.layers.26.linear_attn.A_log": "model-00004-of-00004.safetensors",
447
  "model.language_model.layers.26.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
448
  "model.language_model.layers.26.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
449
  "model.language_model.layers.26.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
450
  "model.language_model.layers.26.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -464,6 +496,8 @@
464
  "model.language_model.layers.28.input_layernorm.weight": "model-00004-of-00004.safetensors",
465
  "model.language_model.layers.28.linear_attn.A_log": "model-00004-of-00004.safetensors",
466
  "model.language_model.layers.28.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
467
  "model.language_model.layers.28.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
468
  "model.language_model.layers.28.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
469
  "model.language_model.layers.28.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
@@ -475,6 +509,8 @@
475
  "model.language_model.layers.29.input_layernorm.weight": "model-00004-of-00004.safetensors",
476
  "model.language_model.layers.29.linear_attn.A_log": "model-00004-of-00004.safetensors",
477
  "model.language_model.layers.29.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
478
  "model.language_model.layers.29.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
479
  "model.language_model.layers.29.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
480
  "model.language_model.layers.29.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
@@ -496,6 +532,8 @@
496
  "model.language_model.layers.30.input_layernorm.weight": "model-00004-of-00004.safetensors",
497
  "model.language_model.layers.30.linear_attn.A_log": "model-00004-of-00004.safetensors",
498
  "model.language_model.layers.30.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
499
  "model.language_model.layers.30.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
500
  "model.language_model.layers.30.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
501
  "model.language_model.layers.30.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -515,6 +553,8 @@
515
  "model.language_model.layers.4.input_layernorm.weight": "model-00004-of-00004.safetensors",
516
  "model.language_model.layers.4.linear_attn.A_log": "model-00004-of-00004.safetensors",
517
  "model.language_model.layers.4.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
518
  "model.language_model.layers.4.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
519
  "model.language_model.layers.4.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
520
  "model.language_model.layers.4.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -524,6 +564,8 @@
524
  "model.language_model.layers.5.input_layernorm.weight": "model-00004-of-00004.safetensors",
525
  "model.language_model.layers.5.linear_attn.A_log": "model-00004-of-00004.safetensors",
526
  "model.language_model.layers.5.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
527
  "model.language_model.layers.5.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
528
  "model.language_model.layers.5.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
529
  "model.language_model.layers.5.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -533,6 +575,8 @@
533
  "model.language_model.layers.6.input_layernorm.weight": "model-00004-of-00004.safetensors",
534
  "model.language_model.layers.6.linear_attn.A_log": "model-00004-of-00004.safetensors",
535
  "model.language_model.layers.6.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
536
  "model.language_model.layers.6.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
537
  "model.language_model.layers.6.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
538
  "model.language_model.layers.6.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -552,6 +596,8 @@
552
  "model.language_model.layers.8.input_layernorm.weight": "model-00004-of-00004.safetensors",
553
  "model.language_model.layers.8.linear_attn.A_log": "model-00004-of-00004.safetensors",
554
  "model.language_model.layers.8.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
555
  "model.language_model.layers.8.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
556
  "model.language_model.layers.8.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
557
  "model.language_model.layers.8.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -561,6 +607,8 @@
561
  "model.language_model.layers.9.input_layernorm.weight": "model-00004-of-00004.safetensors",
562
  "model.language_model.layers.9.linear_attn.A_log": "model-00004-of-00004.safetensors",
563
  "model.language_model.layers.9.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
 
 
564
  "model.language_model.layers.9.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
565
  "model.language_model.layers.9.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
566
  "model.language_model.layers.9.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
@@ -581,77 +629,29 @@
581
  "mtp.norm.weight": "model-00004-of-00004.safetensors",
582
  "mtp.pre_fc_norm_hidden.weight": "model-00004-of-00004.safetensors",
583
  "model.language_model.layers.0.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
584
- "model.language_model.layers.0.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
585
- "model.language_model.layers.0.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
586
  "model.language_model.layers.1.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
587
- "model.language_model.layers.1.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
588
- "model.language_model.layers.1.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
589
  "model.language_model.layers.10.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
590
- "model.language_model.layers.10.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
591
- "model.language_model.layers.10.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
592
  "model.language_model.layers.12.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
593
- "model.language_model.layers.12.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
594
- "model.language_model.layers.12.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
595
  "model.language_model.layers.13.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
596
- "model.language_model.layers.13.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
597
- "model.language_model.layers.13.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
598
  "model.language_model.layers.14.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
599
- "model.language_model.layers.14.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
600
- "model.language_model.layers.14.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
601
  "model.language_model.layers.16.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
602
- "model.language_model.layers.16.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
603
- "model.language_model.layers.16.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
604
  "model.language_model.layers.17.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
605
- "model.language_model.layers.17.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
606
- "model.language_model.layers.17.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
607
  "model.language_model.layers.18.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
608
- "model.language_model.layers.18.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
609
- "model.language_model.layers.18.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
610
  "model.language_model.layers.2.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
611
- "model.language_model.layers.2.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
612
- "model.language_model.layers.2.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
613
  "model.language_model.layers.20.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
614
- "model.language_model.layers.20.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
615
- "model.language_model.layers.20.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
616
  "model.language_model.layers.21.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
617
- "model.language_model.layers.21.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
618
- "model.language_model.layers.21.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
619
  "model.language_model.layers.22.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
620
- "model.language_model.layers.22.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
621
- "model.language_model.layers.22.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
622
  "model.language_model.layers.24.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
623
- "model.language_model.layers.24.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
624
- "model.language_model.layers.24.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
625
  "model.language_model.layers.25.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
626
- "model.language_model.layers.25.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
627
- "model.language_model.layers.25.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
628
  "model.language_model.layers.26.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
629
- "model.language_model.layers.26.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
630
- "model.language_model.layers.26.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
631
  "model.language_model.layers.28.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
632
- "model.language_model.layers.28.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
633
- "model.language_model.layers.28.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
634
  "model.language_model.layers.29.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
635
- "model.language_model.layers.29.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
636
- "model.language_model.layers.29.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
637
  "model.language_model.layers.30.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
638
- "model.language_model.layers.30.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
639
- "model.language_model.layers.30.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
640
  "model.language_model.layers.4.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
641
- "model.language_model.layers.4.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
642
- "model.language_model.layers.4.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
643
  "model.language_model.layers.5.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
644
- "model.language_model.layers.5.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
645
- "model.language_model.layers.5.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
646
  "model.language_model.layers.6.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
647
- "model.language_model.layers.6.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
648
- "model.language_model.layers.6.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
649
  "model.language_model.layers.8.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
650
- "model.language_model.layers.8.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
651
- "model.language_model.layers.8.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
652
  "model.language_model.layers.9.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
653
- "model.language_model.layers.9.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
654
- "model.language_model.layers.9.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
655
  "model.visual.blocks.0.attn.proj.bias": "model-00004-of-00004.safetensors",
656
  "model.visual.blocks.0.attn.proj.weight": "model-00004-of-00004.safetensors",
657
  "model.visual.blocks.0.attn.qkv.bias": "model-00004-of-00004.safetensors",
 
1
  {
2
  "metadata": {
3
+ "total_size": 12374342624
4
  },
5
  "weight_map": {
6
  "model.language_model.layers.14.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
 
264
  "model.language_model.layers.0.input_layernorm.weight": "model-00004-of-00004.safetensors",
265
  "model.language_model.layers.0.linear_attn.A_log": "model-00004-of-00004.safetensors",
266
  "model.language_model.layers.0.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
267
+ "model.language_model.layers.0.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
268
+ "model.language_model.layers.0.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
269
  "model.language_model.layers.0.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
270
  "model.language_model.layers.0.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
271
  "model.language_model.layers.0.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
275
  "model.language_model.layers.1.input_layernorm.weight": "model-00004-of-00004.safetensors",
276
  "model.language_model.layers.1.linear_attn.A_log": "model-00004-of-00004.safetensors",
277
  "model.language_model.layers.1.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
278
+ "model.language_model.layers.1.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
279
+ "model.language_model.layers.1.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
280
  "model.language_model.layers.1.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
281
  "model.language_model.layers.1.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
282
  "model.language_model.layers.1.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
286
  "model.language_model.layers.10.input_layernorm.weight": "model-00004-of-00004.safetensors",
287
  "model.language_model.layers.10.linear_attn.A_log": "model-00004-of-00004.safetensors",
288
  "model.language_model.layers.10.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
289
+ "model.language_model.layers.10.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
290
+ "model.language_model.layers.10.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
291
  "model.language_model.layers.10.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
292
  "model.language_model.layers.10.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
293
  "model.language_model.layers.10.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
307
  "model.language_model.layers.12.input_layernorm.weight": "model-00004-of-00004.safetensors",
308
  "model.language_model.layers.12.linear_attn.A_log": "model-00004-of-00004.safetensors",
309
  "model.language_model.layers.12.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
310
+ "model.language_model.layers.12.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
311
+ "model.language_model.layers.12.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
312
  "model.language_model.layers.12.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
313
  "model.language_model.layers.12.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
314
  "model.language_model.layers.12.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
 
320
  "model.language_model.layers.13.input_layernorm.weight": "model-00004-of-00004.safetensors",
321
  "model.language_model.layers.13.linear_attn.A_log": "model-00004-of-00004.safetensors",
322
  "model.language_model.layers.13.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
323
+ "model.language_model.layers.13.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
324
+ "model.language_model.layers.13.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
325
  "model.language_model.layers.13.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
326
  "model.language_model.layers.13.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
327
  "model.language_model.layers.13.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
 
333
  "model.language_model.layers.14.input_layernorm.weight": "model-00004-of-00004.safetensors",
334
  "model.language_model.layers.14.linear_attn.A_log": "model-00004-of-00004.safetensors",
335
  "model.language_model.layers.14.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
336
+ "model.language_model.layers.14.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
337
+ "model.language_model.layers.14.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
338
  "model.language_model.layers.14.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
339
  "model.language_model.layers.14.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
340
  "model.language_model.layers.14.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
354
  "model.language_model.layers.16.input_layernorm.weight": "model-00004-of-00004.safetensors",
355
  "model.language_model.layers.16.linear_attn.A_log": "model-00004-of-00004.safetensors",
356
  "model.language_model.layers.16.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
357
+ "model.language_model.layers.16.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
358
+ "model.language_model.layers.16.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
359
  "model.language_model.layers.16.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
360
  "model.language_model.layers.16.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
361
  "model.language_model.layers.16.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
365
  "model.language_model.layers.17.input_layernorm.weight": "model-00004-of-00004.safetensors",
366
  "model.language_model.layers.17.linear_attn.A_log": "model-00004-of-00004.safetensors",
367
  "model.language_model.layers.17.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
368
+ "model.language_model.layers.17.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
369
+ "model.language_model.layers.17.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
370
  "model.language_model.layers.17.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
371
  "model.language_model.layers.17.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
372
  "model.language_model.layers.17.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
376
  "model.language_model.layers.18.input_layernorm.weight": "model-00004-of-00004.safetensors",
377
  "model.language_model.layers.18.linear_attn.A_log": "model-00004-of-00004.safetensors",
378
  "model.language_model.layers.18.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
379
+ "model.language_model.layers.18.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
380
+ "model.language_model.layers.18.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
381
  "model.language_model.layers.18.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
382
  "model.language_model.layers.18.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
383
  "model.language_model.layers.18.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
397
  "model.language_model.layers.2.input_layernorm.weight": "model-00004-of-00004.safetensors",
398
  "model.language_model.layers.2.linear_attn.A_log": "model-00004-of-00004.safetensors",
399
  "model.language_model.layers.2.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
400
+ "model.language_model.layers.2.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
401
+ "model.language_model.layers.2.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
402
  "model.language_model.layers.2.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
403
  "model.language_model.layers.2.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
404
  "model.language_model.layers.2.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
408
  "model.language_model.layers.20.input_layernorm.weight": "model-00004-of-00004.safetensors",
409
  "model.language_model.layers.20.linear_attn.A_log": "model-00004-of-00004.safetensors",
410
  "model.language_model.layers.20.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
411
+ "model.language_model.layers.20.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
412
+ "model.language_model.layers.20.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
413
  "model.language_model.layers.20.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
414
  "model.language_model.layers.20.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
415
  "model.language_model.layers.20.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
419
  "model.language_model.layers.21.input_layernorm.weight": "model-00004-of-00004.safetensors",
420
  "model.language_model.layers.21.linear_attn.A_log": "model-00004-of-00004.safetensors",
421
  "model.language_model.layers.21.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
422
+ "model.language_model.layers.21.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
423
+ "model.language_model.layers.21.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
424
  "model.language_model.layers.21.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
425
  "model.language_model.layers.21.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
426
  "model.language_model.layers.21.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
 
432
  "model.language_model.layers.22.input_layernorm.weight": "model-00004-of-00004.safetensors",
433
  "model.language_model.layers.22.linear_attn.A_log": "model-00004-of-00004.safetensors",
434
  "model.language_model.layers.22.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
435
+ "model.language_model.layers.22.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
436
+ "model.language_model.layers.22.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
437
  "model.language_model.layers.22.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
438
  "model.language_model.layers.22.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
439
  "model.language_model.layers.22.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
453
  "model.language_model.layers.24.input_layernorm.weight": "model-00004-of-00004.safetensors",
454
  "model.language_model.layers.24.linear_attn.A_log": "model-00004-of-00004.safetensors",
455
  "model.language_model.layers.24.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
456
+ "model.language_model.layers.24.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
457
+ "model.language_model.layers.24.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
458
  "model.language_model.layers.24.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
459
  "model.language_model.layers.24.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
460
  "model.language_model.layers.24.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
464
  "model.language_model.layers.25.input_layernorm.weight": "model-00004-of-00004.safetensors",
465
  "model.language_model.layers.25.linear_attn.A_log": "model-00004-of-00004.safetensors",
466
  "model.language_model.layers.25.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
467
+ "model.language_model.layers.25.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
468
+ "model.language_model.layers.25.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
469
  "model.language_model.layers.25.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
470
  "model.language_model.layers.25.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
471
  "model.language_model.layers.25.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
475
  "model.language_model.layers.26.input_layernorm.weight": "model-00004-of-00004.safetensors",
476
  "model.language_model.layers.26.linear_attn.A_log": "model-00004-of-00004.safetensors",
477
  "model.language_model.layers.26.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
478
+ "model.language_model.layers.26.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
479
+ "model.language_model.layers.26.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
480
  "model.language_model.layers.26.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
481
  "model.language_model.layers.26.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
482
  "model.language_model.layers.26.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
496
  "model.language_model.layers.28.input_layernorm.weight": "model-00004-of-00004.safetensors",
497
  "model.language_model.layers.28.linear_attn.A_log": "model-00004-of-00004.safetensors",
498
  "model.language_model.layers.28.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
499
+ "model.language_model.layers.28.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
500
+ "model.language_model.layers.28.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
501
  "model.language_model.layers.28.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
502
  "model.language_model.layers.28.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
503
  "model.language_model.layers.28.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
 
509
  "model.language_model.layers.29.input_layernorm.weight": "model-00004-of-00004.safetensors",
510
  "model.language_model.layers.29.linear_attn.A_log": "model-00004-of-00004.safetensors",
511
  "model.language_model.layers.29.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
512
+ "model.language_model.layers.29.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
513
+ "model.language_model.layers.29.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
514
  "model.language_model.layers.29.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
515
  "model.language_model.layers.29.linear_attn.in_proj_qkv.weight_scale": "model-00004-of-00004.safetensors",
516
  "model.language_model.layers.29.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
 
532
  "model.language_model.layers.30.input_layernorm.weight": "model-00004-of-00004.safetensors",
533
  "model.language_model.layers.30.linear_attn.A_log": "model-00004-of-00004.safetensors",
534
  "model.language_model.layers.30.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
535
+ "model.language_model.layers.30.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
536
+ "model.language_model.layers.30.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
537
  "model.language_model.layers.30.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
538
  "model.language_model.layers.30.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
539
  "model.language_model.layers.30.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
553
  "model.language_model.layers.4.input_layernorm.weight": "model-00004-of-00004.safetensors",
554
  "model.language_model.layers.4.linear_attn.A_log": "model-00004-of-00004.safetensors",
555
  "model.language_model.layers.4.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
556
+ "model.language_model.layers.4.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
557
+ "model.language_model.layers.4.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
558
  "model.language_model.layers.4.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
559
  "model.language_model.layers.4.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
560
  "model.language_model.layers.4.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
564
  "model.language_model.layers.5.input_layernorm.weight": "model-00004-of-00004.safetensors",
565
  "model.language_model.layers.5.linear_attn.A_log": "model-00004-of-00004.safetensors",
566
  "model.language_model.layers.5.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
567
+ "model.language_model.layers.5.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
568
+ "model.language_model.layers.5.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
569
  "model.language_model.layers.5.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
570
  "model.language_model.layers.5.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
571
  "model.language_model.layers.5.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
575
  "model.language_model.layers.6.input_layernorm.weight": "model-00004-of-00004.safetensors",
576
  "model.language_model.layers.6.linear_attn.A_log": "model-00004-of-00004.safetensors",
577
  "model.language_model.layers.6.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
578
+ "model.language_model.layers.6.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
579
+ "model.language_model.layers.6.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
580
  "model.language_model.layers.6.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
581
  "model.language_model.layers.6.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
582
  "model.language_model.layers.6.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
596
  "model.language_model.layers.8.input_layernorm.weight": "model-00004-of-00004.safetensors",
597
  "model.language_model.layers.8.linear_attn.A_log": "model-00004-of-00004.safetensors",
598
  "model.language_model.layers.8.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
599
+ "model.language_model.layers.8.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
600
+ "model.language_model.layers.8.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
601
  "model.language_model.layers.8.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
602
  "model.language_model.layers.8.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
603
  "model.language_model.layers.8.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
607
  "model.language_model.layers.9.input_layernorm.weight": "model-00004-of-00004.safetensors",
608
  "model.language_model.layers.9.linear_attn.A_log": "model-00004-of-00004.safetensors",
609
  "model.language_model.layers.9.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
610
+ "model.language_model.layers.9.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
611
+ "model.language_model.layers.9.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
612
  "model.language_model.layers.9.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
613
  "model.language_model.layers.9.linear_attn.in_proj_z.weight_scale": "model-00004-of-00004.safetensors",
614
  "model.language_model.layers.9.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
 
629
  "mtp.norm.weight": "model-00004-of-00004.safetensors",
630
  "mtp.pre_fc_norm_hidden.weight": "model-00004-of-00004.safetensors",
631
  "model.language_model.layers.0.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
632
  "model.language_model.layers.1.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
633
  "model.language_model.layers.10.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
634
  "model.language_model.layers.12.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
635
  "model.language_model.layers.13.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
636
  "model.language_model.layers.14.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
637
  "model.language_model.layers.16.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
638
  "model.language_model.layers.17.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
639
  "model.language_model.layers.18.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
640
  "model.language_model.layers.2.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
641
  "model.language_model.layers.20.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
642
  "model.language_model.layers.21.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
643
  "model.language_model.layers.22.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
644
  "model.language_model.layers.24.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
645
  "model.language_model.layers.25.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
646
  "model.language_model.layers.26.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
647
  "model.language_model.layers.28.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
648
  "model.language_model.layers.29.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
649
  "model.language_model.layers.30.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
650
  "model.language_model.layers.4.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
651
  "model.language_model.layers.5.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
652
  "model.language_model.layers.6.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
653
  "model.language_model.layers.8.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
654
  "model.language_model.layers.9.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
 
 
655
  "model.visual.blocks.0.attn.proj.bias": "model-00004-of-00004.safetensors",
656
  "model.visual.blocks.0.attn.proj.weight": "model-00004-of-00004.safetensors",
657
  "model.visual.blocks.0.attn.qkv.bias": "model-00004-of-00004.safetensors",