techwithsergiu commited on
Commit
153b287
·
verified ·
1 Parent(s): 52c9d72

Fixed quantization_config.llm_int8_skip_modules, to avoid re-quantizes embed_tokens layers on load

Browse files
Files changed (1) hide show
  1. config.json +2 -1
config.json CHANGED
@@ -89,7 +89,8 @@
89
  "bnb_4bit_quant_storage": "uint8",
90
  "llm_int8_enable_fp32_cpu_offload": false,
91
  "llm_int8_skip_modules": [
92
- "lm_head"
 
93
  ]
94
  },
95
  "transformers_version": "5.3.0.dev0"
 
89
  "bnb_4bit_quant_storage": "uint8",
90
  "llm_int8_enable_fp32_cpu_offload": false,
91
  "llm_int8_skip_modules": [
92
+ "lm_head",
93
+ "model.language_model.embed_tokens"
94
  ]
95
  },
96
  "transformers_version": "5.3.0.dev0"