Sehyo commited on
Commit
74675b1
·
verified ·
1 Parent(s): f40a9c7

fix: add MTP ignore patterns to quantization config for speculative decoding

Browse files
Files changed (1) hide show
  1. config.json +6 -2
config.json CHANGED
@@ -432,7 +432,11 @@
432
  "model.language_model.layers.44.mlp.gate",
433
  "model.language_model.layers.45.mlp.gate",
434
  "model.language_model.layers.46.mlp.gate",
435
- "model.language_model.layers.47.mlp.gate"
 
 
 
 
436
  ],
437
  "kv_cache_scheme": null,
438
  "quant_method": "compressed-tensors",
@@ -563,4 +567,4 @@
563
  },
564
  "vision_end_token_id": 248054,
565
  "vision_start_token_id": 248053
566
- }
 
432
  "model.language_model.layers.44.mlp.gate",
433
  "model.language_model.layers.45.mlp.gate",
434
  "model.language_model.layers.46.mlp.gate",
435
+ "model.language_model.layers.47.mlp.gate",
436
+ "re:model\\.layers\\.\\d+\\.",
437
+ "model.fc",
438
+ "re:mtp\\.layers\\.\\d+\\.",
439
+ "mtp.fc"
440
  ],
441
  "kv_cache_scheme": null,
442
  "quant_method": "compressed-tensors",
 
567
  },
568
  "vision_end_token_id": 248054,
569
  "vision_start_token_id": 248053
570
+ }