Instructions to use YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3") model = AutoModelForMultimodalLM.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3
- SGLang
How to use YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3 with Docker Model Runner:
docker model run hf.co/YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3
YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3
两阶段合成。第一阶段用 DELLA 把三个不同渊源的模型融成一个“通用智能复合体 G”,
第二阶段把 Qwopus3.6-27B-Fusion 相对祖先的增量原封不动地线性叠加到 G 上。
两阶段的 base_model 均为真祖先 Qwen/Qwen3.6-27B(不是任何一个子代),因此所有
任务向量 Δ 都在同一个参考系里,叠加才有意义。
配方(可直接交给 mergekit)
# ===== stage 1:造“通用智能复合体” G =====
merge_method: della_linear
base_model: Qwen/Qwen3.6-27B
models:
- model: DavidAU/Qwen3.6-27B-V1.1-FF711-Darker-Hero-GAIN-H2.0
parameters: { weight: 0.90, density: 0.85 }
- model: YFC-112358/Qwen3.6-27B-Della-Deckard-Isometry-Geodesic-v2
parameters: { weight: 0.80, density: 0.85 }
- model: nightmedia/Qwen3.6-27B-Seven
parameters: { weight: 0.25, density: 0.55 }
parameters:
epsilon: 0.30
lambda: 1.0
normalize: false
int8_mask: true
dtype: float32
out_dtype: bfloat16
tokenizer: { source: "Qwen/Qwen3.6-27B" }
# ===== stage 2:G 对 #4,#4 主导 =====
merge_method: task_arithmetic
base_model: Qwen/Qwen3.6-27B
models:
- model: KyleHessling1/Qwopus3.6-27B-Fusion-BF16
parameters: { weight: 1.00, density: 1.00 }
- model: ./stage1-G
parameters:
weight: [1.0, 1.0, 1.0, 1.0]
density: 1.00
parameters:
epsilon: 0.30
lambda: 1.0
normalize: false
int8_mask: true
dtype: float32
out_dtype: bfloat16
tokenizer: { source: "Qwen/Qwen3.6-27B" }
实现上的诚实声明
- 没有落盘 stage1-G。两阶段在同一个行块里连着算:先得到
G = base + Σ Δ̃ᵢ, 立即用它算出Δ_G = G − base进入第二阶段。数学上与先落盘再读完全等价 (fp32 全程),但省了 ≈54 GB 的上传+下载。 - ε 自动收窄。mergekit 要求
density ± epsilon ∈ (0,1);第一阶段的0.85+0.30越界会直接抛错。本模型逐源把 ε 收窄到合法上限(保留 0.02 余量),期望密度仍精确 等于各自的 density(fable 与 v2 的 density 都是 0.85 ⇒ ε 都被收窄到 0.13)。第二阶段两个源的 density 都是 1.00、不做剪枝, ε 自动归零 —— 那一段没有任何随机性。
融合健康读数(构造时实测)
| 指标 | 含义 | 中位值 |
|---|---|---|
| amp | ‖总增量‖ / ‖祖先权重‖ | 0.0202 |
| share | G 对 Qwopus 的质量比 | 26.002 |
| kill₂ | 第二阶段符号选举抹掉的非零占比 | 0.0% |
| cold_amp | ‖Qwen3.8·ColdFusion − Qwen3.6‖ / ‖Qwen3.6‖ | 0.1217 |
share = ‖w_G·Δ_G‖ / ‖Δ_qwopus‖。本配方不追求它小于 1:Qwopus 相对祖先的增量本就极小
(注意力/词表/输出头与祖先逐位相同,仅 MLP 相差 0.2~0.8%),所以 share 天然很大。
它在这里的作用只是诚实地给出两个来源的真实体量对比。
使用
from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3", dtype="bfloat16", device_map="auto")
t = AutoTokenizer.from_pretrained("YFC-112358/Qwen3.6-27B-Della-Deckard-Fable-Qwopus-v3")
采样建议从 temperature=0.7, top_p=0.8, top_k=20 起手。config/tokenizer 取自祖先仓。
与原始配方的偏离(补充声明)
第二阶段是纯线性叠加,不是 DELLA。
density: 1.00让 MagPrune 退化成恒等映射(不排名、不伯努利采样、不 1/p 回缩),所以第二阶段严格等于out = G + 1.00·(Qwopus − Qwen/Qwen3.6-27B),即 mergekit 的task_arithmetic。这样做是因为逐源审计显示 Qwopus 相对祖先的增量集中在 MLP、幅度只有 0.2~0.8%:对这么小的增量再做 40% 剪枝,剪掉的是信号,留下的是噪声。没有做 TIES 符号选举(等价于
della_linear)。v2 与 Fable 的任务向量近乎正交(cos ≈ 0.01),选举会以 Fable 为多数方向,抹掉 v2 保留元素中的约一半(实测 kill 约 13%,量级正好是 v2 的一半),等于把 v2 的正交特征投影掉。为完整保留它,本次关闭选举。
- Downloads last month
- 479