YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3

两阶段合成。第一阶段用 DELLA 把三个不同渊源的模型融成一个“通用智能复合体 G”, 第二阶段把 Qwopus3.6-27B-Fusion 相对祖先的增量原封不动地线性叠加到 G 上。 两阶段的 base_model 均为真祖先 Qwen/Qwen3.6-27B(不是任何一个子代),因此所有 任务向量 Δ 都在同一个参考系里,叠加才有意义。

配方(可直接交给 mergekit)

# ===== stage 1:造“通用智能复合体” G =====
merge_method: della_linear
base_model: Qwen/Qwen3.6-27B
models:
  - model: DavidAU/Qwen3.6-27B-V1.1-FF711-Darker-Hero-GAIN-H2.0
    parameters: { weight: 0.90, density: 0.85 }
  - model: YFC-112358/Qwen3.6-27B-Della-Deckard-Isometry-Geodesic-v2
    parameters: { weight: 0.80, density: 0.85 }
  - model: nightmedia/Qwen3.6-27B-Seven
    parameters: { weight: 0.25, density: 0.55 }
parameters:
  epsilon: 0.30
  lambda: 1.0
  normalize: false
  int8_mask: true
dtype: float32
out_dtype: bfloat16
tokenizer: { source: "Qwen/Qwen3.6-27B" }
# ===== stage 2:G 对 #4,#4 主导 =====
merge_method: task_arithmetic
base_model: Qwen/Qwen3.6-27B
models:
  - model: KyleHessling1/Qwopus3.6-27B-Fusion-BF16
    parameters: { weight: 1.00, density: 1.00 }
  - model: ./stage1-G
    parameters:
      weight: [1.0, 1.0, 1.0, 1.0]
      density: 1.00
parameters:
  epsilon: 0.30
  lambda: 1.0
  normalize: false
  int8_mask: true
dtype: float32
out_dtype: bfloat16
tokenizer: { source: "Qwen/Qwen3.6-27B" }

实现上的诚实声明

  1. 没有落盘 stage1-G。两阶段在同一个行块里连着算:先得到 G = base + Σ Δ̃ᵢ, 立即用它算出 Δ_G = G − base 进入第二阶段。数学上与先落盘再读完全等价 (fp32 全程),但省了 ≈54 GB 的上传+下载。
  2. ε 自动收窄。mergekit 要求 density ± epsilon ∈ (0,1);第一阶段的 0.85+0.30 越界会直接抛错。本模型逐源把 ε 收窄到合法上限(保留 0.02 余量),期望密度仍精确 等于各自的 density(fable 与 v2 的 density 都是 0.85 ⇒ ε 都被收窄到 0.13)。第二阶段两个源的 density 都是 1.00、不做剪枝, ε 自动归零 —— 那一段没有任何随机性。

融合健康读数(构造时实测)

指标 含义 中位值
amp ‖总增量‖ / ‖祖先权重‖ 0.0202
share G 对 Qwopus 的质量比 26.002
kill₂ 第二阶段符号选举抹掉的非零占比 0.0%
cold_amp ‖Qwen3.8·ColdFusion − Qwen3.6‖ / ‖Qwen3.6‖ 0.1217

share = ‖w_G·Δ_G‖ / ‖Δ_qwopus‖。本配方不追求它小于 1:Qwopus 相对祖先的增量本就极小 (注意力/词表/输出头与祖先逐位相同,仅 MLP 相差 0.2~0.8%),所以 share 天然很大。 它在这里的作用只是诚实地给出两个来源的真实体量对比。

使用

from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", dtype="bfloat16", device_map="auto")
t = AutoTokenizer.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3")

采样建议从 temperature=0.7, top_p=0.8, top_k=20 起手。config/tokenizer 取自祖先仓。

与原始配方的偏离(补充声明)

  1. 第二阶段是纯线性叠加,不是 DELLA。 density: 1.00 让 MagPrune 退化成恒等映射(不排名、不伯努利采样、不 1/p 回缩),所以第二阶段严格等于 out = G + 1.00·(Qwopus − Qwen/Qwen3.6-27B),即 mergekit 的 task_arithmetic。这样做是因为逐源审计显示 Qwopus 相对祖先的增量集中在 MLP、幅度只有 0.2~0.8%:对这么小的增量再做 40% 剪枝,剪掉的是信号,留下的是噪声。

  2. 没有做 TIES 符号选举(等价于 della_linear)。v2 与 Fable 的任务向量近乎正交(cos ≈ 0.01),选举会以 Fable 为多数方向,抹掉 v2 保留元素中的约一半(实测 kill 约 13%,量级正好是 v2 的一半),等于把 v2 的正交特征投影掉。为完整保留它,本次关闭选举。

Downloads last month
479
Safetensors
Model size
28B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3