Qwen3-0.6B 微调 · 安全 + 数学 + 通用

Qwen/Qwen3-0.6B 为基座微调,同步提升安全对齐数学推理,同时保持通用能力。

成果(自建代理评测,0-shot)

维度 基座 本模型
安全(有害拒答率) 15.1% 82.2%
数学(GSM8K) 64.2% 65.7%
通用(MMLU) 35.0% 46.6%

使用

⚠️ 权重在 final_model_v10-4b/ 子目录,加载需带 subfolder

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

repo = "fengkai-zhu/qwen3-0.6b-lora"
sub  = "final_model_v10-4b"
model = AutoModelForCausalLM.from_pretrained(repo, subfolder=sub, dtype=torch.bfloat16)
tok   = AutoTokenizer.from_pretrained(repo, subfolder=sub)

msgs = [{"role": "user", "content": "What is 12 + 7 times 3?"}]
text = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True, enable_thinking=False)
out  = model.generate(**tok(text, return_tensors="pt"), max_new_tokens=256)
print(tok.decode(out[0], skip_special_tokens=True))

怎么来的

混合 SFT(安全 Aegis 拒答 + 数学 + 通用 Tulu3) → 数学数据用 Qwen3-4B 蒸馏的高质量 CoT(突破 0.6B 自蒸馏上限)。LoRA 微调后合并进基座。

完整实验(12 版 + 混合SFT/蒸馏/合并/GRPO 四路线对比)见 GitHub:kfzshere/qwen3-0.6b-lora

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for fengkai-zhu/qwen3-0.6b-lora

Finetuned
Qwen/Qwen3-0.6B
Adapter
(466)
this model