dsikka commited on
Commit
bee1cbd
·
verified ·
1 Parent(s): 9eaeada

Add FP8-block MTP layer (layer 45): weights + index + mixed-precision quant config

Browse files
config.json CHANGED
@@ -27,7 +27,7 @@
27
  },
28
  "output_activations": null,
29
  "targets": [
30
- "re:.*mlp\\.experts\\..*(gate|up|down)_proj$"
31
  ],
32
  "weights": {
33
  "actorder": null,
@@ -43,9 +43,47 @@
43
  "type": "float",
44
  "zp_dtype": null
45
  }
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
46
  }
47
  },
48
- "format": "nvfp4-pack-quantized",
49
  "global_compression_ratio": null,
50
  "ignore": [
51
  "model.visual.blocks.0.attn.qkv",
@@ -811,6 +849,19 @@
811
  "model.language_model.layers.44.mlp.shared_experts.gate_proj",
812
  "model.language_model.layers.44.mlp.shared_experts.up_proj",
813
  "model.language_model.layers.44.mlp.shared_experts.down_proj",
 
 
 
 
 
 
 
 
 
 
 
 
 
814
  "lm_head"
815
  ],
816
  "kv_cache_scheme": null,
 
27
  },
28
  "output_activations": null,
29
  "targets": [
30
+ "re:.*\\.layers\\.(?:[3-9]|[1-3][0-9]|4[0-4])\\.mlp\\.experts\\..*(gate|up|down)_proj$"
31
  ],
32
  "weights": {
33
  "actorder": null,
 
43
  "type": "float",
44
  "zp_dtype": null
45
  }
46
+ },
47
+ "group_1": {
48
+ "format": "float-quantized",
49
+ "input_activations": {
50
+ "actorder": null,
51
+ "block_structure": null,
52
+ "dynamic": true,
53
+ "group_size": 128,
54
+ "num_bits": 8,
55
+ "observer": null,
56
+ "observer_kwargs": {},
57
+ "scale_dtype": null,
58
+ "strategy": "group",
59
+ "symmetric": true,
60
+ "type": "float",
61
+ "zp_dtype": null
62
+ },
63
+ "output_activations": null,
64
+ "targets": [
65
+ "re:.*\\.layers\\.45\\.mlp\\.experts\\.\\d+\\.(gate_proj|up_proj|down_proj)$"
66
+ ],
67
+ "weights": {
68
+ "actorder": null,
69
+ "block_structure": [
70
+ 128,
71
+ 128
72
+ ],
73
+ "dynamic": false,
74
+ "group_size": null,
75
+ "num_bits": 8,
76
+ "observer": "memoryless_minmax",
77
+ "observer_kwargs": {},
78
+ "scale_dtype": null,
79
+ "strategy": "block",
80
+ "symmetric": true,
81
+ "type": "float",
82
+ "zp_dtype": null
83
+ }
84
  }
85
  },
86
+ "format": "mixed-precision",
87
  "global_compression_ratio": null,
88
  "ignore": [
89
  "model.visual.blocks.0.attn.qkv",
 
849
  "model.language_model.layers.44.mlp.shared_experts.gate_proj",
850
  "model.language_model.layers.44.mlp.shared_experts.up_proj",
851
  "model.language_model.layers.44.mlp.shared_experts.down_proj",
852
+ "model.language_model.layers.45.eh_proj",
853
+ "model.language_model.layers.45.self_attn.q_a_proj",
854
+ "model.language_model.layers.45.self_attn.q_b_proj",
855
+ "model.language_model.layers.45.self_attn.kv_a_proj_with_mqa",
856
+ "model.language_model.layers.45.self_attn.kv_b_proj",
857
+ "model.language_model.layers.45.self_attn.o_proj",
858
+ "model.language_model.layers.45.self_attn.indexer.wq_b",
859
+ "model.language_model.layers.45.self_attn.indexer.wk",
860
+ "model.language_model.layers.45.self_attn.indexer.weights_proj",
861
+ "model.language_model.layers.45.mlp.gate",
862
+ "model.language_model.layers.45.mlp.shared_experts.gate_proj",
863
+ "model.language_model.layers.45.mlp.shared_experts.up_proj",
864
+ "model.language_model.layers.45.mlp.shared_experts.down_proj",
865
  "lm_head"
866
  ],
867
  "kv_cache_scheme": null,
model.safetensors.index.json CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b42e3ccb127abb24a914eeed0fcd51ccb80eecaabb7d3e5550bfb1f3cdfd2027
3
- size 16884180
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:015faae91e8189c7553f1d48ec3d0694b8c02b282d7f58af2d7b4064a81ce4c0
3
+ size 17055736
model_mtp.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0cf8dfdc936f1cbc33b9e88d0289ff3b5b4a3d0f7381158a8ccbebb9c8adc035
3
+ size 7618560424