IQ3_S ^blk\.\d+\.ffn_down\.weight$=IQ3_S ^blk\.\d+\.ffn_gate\.weight$=IQ3_S # FFN up: edge layers promoted, rest IQ4_XS ^blk\.(?:0|1|2|3|60|61|62|63)\.ffn_up\.weight$=IQ4_NL ^blk\.(?:[4-9]|[1-5][0-9])\.ffn_up\.weight$=IQ4_XS # SSM layers (non-attention blocks) keep IQ4_XS ^blk\.(?:0|1|2|4|5|6|8|9|10|12|13|14|16|17|18|20|21|22|24|25|26|28|29|30|32|33|34|36|37|38|40|41|42|44|45|46|48|49|50|52|53|54|56|57|58|60|61|62)\.attn_qkv\.weight$=IQ4_XS ^blk\.(?:0|1|2|4|5|6|8|9|10|12|13|14|16|17|18|20|21|22|24|25|26|28|29|30|32|33|34|36|37|38|40|41|42|44|45|46|48|49|50|52|53|54|56|57|58|60|61|62)\.attn_gate\.weight$=IQ4_XS ^blk\.(?:0|1|2|4|5|6|8|9|10|12|13|14|16|17|18|20|21|22|24|25|26|28|29|30|32|33|34|36|37|38|40|41|42|44|45|46|48|49|50|52|53|54|56|57|58|60|61|62)\.ssm_out\.weight$=IQ4_XS # Full-attention layers every 4th: # selective upgrade for edge layers, mid layers stay IQ4_XS ^blk\.(?:3|7|11|59|63)\.attn_q\.weight$=IQ4_NL ^blk\.(?:15|19|23|27|31|35|39|43|47|51|55)\.attn_q\.weight$=IQ4_XS ^blk\.(?:3|7|11|15|19|23|27|31|35|39|43|47|51|55|59|63)\.attn_k\.weight$=bf16 ^blk\.(?:3|7|11|15|19|23|27|31|35|39|43|47|51|55|59|63)\.attn_v\.weight$=bf16 # Attention output: protect edges ^blk\.(?:3|63)\.attn_output\.weight$=Q6_K ^blk\.(?:7|11|15|19|23|27|31|35|39|43|47|51|55|59)\.attn_output\.weight$=Q5_K # Norms and SSM params in bf16 ^blk\.\d+\.attn_norm\.weight$=bf16 ^blk\.\d+\.post_attention_norm\.weight$=bf16 ^blk\.\d+\.ssm_norm\.weight$=bf16 ^blk\.\d+\.attn_k_norm\.weight$=bf16 ^blk\.\d+\.attn_q_norm\.weight$=bf16 ^blk\.\d+\.ssm_a$=bf16 ^blk\.\d+\.ssm_conv1d\.weight$=bf16 ^blk\.\d+\.ssm_dt\.bias$=bf16 ^blk\.\d+\.ssm_alpha\.weight$=bf16 ^blk\.\d+\.ssm_beta\.weight$=bf16 ]]>