Fredred89's picture
Upload recipe.txt with huggingface_hub
bd45698 verified
Raw History Blame Contribute Delete
1.9 kB
<![CDATA[
# MoQ-4.0-AttnQSelectiveEdgeNL recipe (regex anchored)
# embeddings / logits
^token_embd\.weight$=Q4_K
^output\.weight$=bf16
^output_norm\.weight$=bf16
# FFN: down/gate are high elasticity -> IQ3_S
^blk\.\d+\.ffn_down\.weight$=IQ3_S
^blk\.\d+\.ffn_gate\.weight$=IQ3_S
# FFN up: edge layers promoted, rest IQ4_XS
^blk\.(?:0|1|2|3|60|61|62|63)\.ffn_up\.weight$=IQ4_NL
^blk\.(?:[4-9]|[1-5][0-9])\.ffn_up\.weight$=IQ4_XS
# SSM layers (non-attention blocks) keep IQ4_XS
^blk\.(?:0|1|2|4|5|6|8|9|10|12|13|14|16|17|18|20|21|22|24|25|26|28|29|30|32|33|34|36|37|38|40|41|42|44|45|46|48|49|50|52|53|54|56|57|58|60|61|62)\.attn_qkv\.weight$=IQ4_XS
^blk\.(?:0|1|2|4|5|6|8|9|10|12|13|14|16|17|18|20|21|22|24|25|26|28|29|30|32|33|34|36|37|38|40|41|42|44|45|46|48|49|50|52|53|54|56|57|58|60|61|62)\.attn_gate\.weight$=IQ4_XS
^blk\.(?:0|1|2|4|5|6|8|9|10|12|13|14|16|17|18|20|21|22|24|25|26|28|29|30|32|33|34|36|37|38|40|41|42|44|45|46|48|49|50|52|53|54|56|57|58|60|61|62)\.ssm_out\.weight$=IQ4_XS
# Full-attention layers every 4th:
# selective upgrade for edge layers, mid layers stay IQ4_XS
^blk\.(?:3|7|11|59|63)\.attn_q\.weight$=IQ4_NL
^blk\.(?:15|19|23|27|31|35|39|43|47|51|55)\.attn_q\.weight$=IQ4_XS
^blk\.(?:3|7|11|15|19|23|27|31|35|39|43|47|51|55|59|63)\.attn_k\.weight$=bf16
^blk\.(?:3|7|11|15|19|23|27|31|35|39|43|47|51|55|59|63)\.attn_v\.weight$=bf16
# Attention output: protect edges
^blk\.(?:3|63)\.attn_output\.weight$=Q6_K
^blk\.(?:7|11|15|19|23|27|31|35|39|43|47|51|55|59)\.attn_output\.weight$=Q5_K
# Norms and SSM params in bf16
^blk\.\d+\.attn_norm\.weight$=bf16
^blk\.\d+\.post_attention_norm\.weight$=bf16
^blk\.\d+\.ssm_norm\.weight$=bf16
^blk\.\d+\.attn_k_norm\.weight$=bf16
^blk\.\d+\.attn_q_norm\.weight$=bf16
^blk\.\d+\.ssm_a$=bf16
^blk\.\d+\.ssm_conv1d\.weight$=bf16
^blk\.\d+\.ssm_dt\.bias$=bf16
^blk\.\d+\.ssm_alpha\.weight$=bf16
^blk\.\d+\.ssm_beta\.weight$=bf16
]]>