You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
本模型限非商業使用,亦不得公開發佈修改版。取用後請標註第一署名單位「粵語語料庫建設與大模型評測重點實驗室」及資助編號 25ZD03。
Log in or Sign Up to review the conditions and access this model content.
Cantonese QA 30B-A3B — 粵語問答模型(MoE)
⚠️ 2026-09-21:本卡評測數字有更正,對照模型有多行作廢,本模型自身數字不變。見下方「更正」一節。
喺 Qwen/Qwen3-30B-A3B(MoE,總參 30.5B/激活 3.3B)上面做嘅粵語問答 LoRA 微調。
| 位置 | 大細 | 說明 | |
|---|---|---|---|
| LoRA adapter | adapter/ |
102 MB | ✅ 現已發佈。掛喺公開基座上面就可以復現本倉庫嘅評測對象(見「復現合併」) |
| 合併後 bf16 全權重 | weights-bf16/ |
57 GiB | ✅ 現已發佈。開箱即用,唔需要自行合併;同本卡片所有評測數字對應嘅就係呢一份(24/24 個文件 sha256 與訓練集群上嗰份逐位一致) |
本模型並非 8B 版本嘅替代品。 兩者各有強項,見下表同「已知取捨」一節。
8B 版本喺 Zeteng/qwen_yue_qa_finetuned_int4。
訓練配置
| 基座 | Qwen/Qwen3-30B-A3B(48 層 × 128 專家,topk 8,hidden 2048) |
| LoRA | r=32,alpha=64,dropout 0.05 |
| 掛載模組 | q_proj,k_proj,v_proj,o_proj(只有注意力) |
| 可訓練參數 | 26.7M / 30.56B = 0.087% |
| 超參 | lr 1e-4,2 epochs,bs 2,max_len 1024,warmup 3%,seed 42 |
| 訓練 | 8×H100 80GB,8,526 步,3 小時 0 分 |
| 最優 checkpoint | step 8400(epoch 1.97),eval_loss 1.2441 |
| 合併 | 18,867 個張量之中改動 192 個,max ‖ΔW‖/‖W‖ = 0.15516 |
為何只掛注意力:MoE 嘅 gate_proj/up_proj/down_proj 合共 48×128×3 = 18,432 個專家線性層,
放入 target_modules 會令 LoRA 掛載點數量失控,所以限定為注意力四投影(48×4 = 192 個)。
同一取捨喺 8B 上面做過對照實驗:只有注意力 vs 七模組,HKMMLU 差 +0.22pp(p=0.417,不顯著),
而 adapter 體積細 2.8 倍。
⚠️ 2026-09-21 更正:下面兩張表有多行作廢
原因:一次 serialization–runtime compatibility mismatch。transformers 5.x 將
rope_theta 由 config 頂層遷入 rope_parameters(對 transformers 5.x 完全合法),
而我哋評測時用嘅 vLLM 只讀頂層欄位,讀唔到就回落到 θ=10000(模型真實值 1000000),
RoPE 頻率整個錯晒。因果已用雙向干預 + 欄位級隔離 + 回落值實測確認:
只改 config.json 一個檔(權重用軟連結,一個 byte 都冇動),分數就相差 5–6 分;
顯式設 rope_theta=10000 同「頂層欄位缺失」逐位相同。
本模型(30B-A3B)唔受影響——佢嘅 config 頂層有 rope_theta,
所以 0.6467、0.9007、57.30、44.51 全部不變。受影響嘅係表入面幾個對照模型。
更正後 HKMMLU(全量 26,368 題,官方口徑)
| 排名 | 模型 | 準確率 | 解析失敗 | 平均輸出tok | |
|---|---|---|---|---|---|
| 1 | 本模型(30B-A3B + 只有注意力 LoRA) | 0.6467 | 0.0003 | 5.4 | 不受影響 |
| 2 | 8B 版本(完整語料,七模組) | 0.6030 | 0.0141 | 13.7 | |
| 3 | 8B 版本 消融版(只用公開數據) | 0.5996 | 0.0000 | 10.2 | |
| 4 | hon9kon9ize/CantoneseLLMChat-v1.0-7B |
0.5897 | 0.0000 | 11.7 | 不受影響 |
| 5 | lordjia/Qwen2-Cantonese-7B-Instruct |
0.5883 | 0.0000 | 8.8 | 不受影響 |
| 6 | 8B 版本(同配方,只有注意力) | 0.5811 | 0.0359 | 12.7 | |
| 7 | hon9kon9ize/CantoneseLLM-v2.0-8B-Thinking |
0.5566 | 0.0327 | 341.0 | |
| 8 | lordjia/Llama-3-Cantonese-8B-Instruct |
0.5240 | 0.0005 | 4.4 | 不受影響 |
| 9 | Qwen/Qwen3-8B(8B 基座) |
0.4697 | 0.0281 | 471.0 | 不受影響 |
| 10 | hon9kon9ize/CantoneseLLM-v2.0-30B-A3B-Thinking |
0.4492 | 0.0262 | 466.7 | |
| 11 | Qwen/Qwen3-30B-A3B(本模型基座) |
0.4487 | 0.0394 | 495.2 | 不受影響 |
「領先次位 +5.69pp(p = 2.5e-63)」作廢。 更正後次位係 8B 版本嘅 0.6030, 點估計為 +4.37pp;所有 95%CI 同 p 值一律作廢——配對檢驗未重算, 只換點估計係唔夠嘅。
更正後 純度同翻譯
| 書面粵語純度 | 粵→普 chrF_t2s | 普→粵 chrF_t2s | ||
|---|---|---|---|---|
| 本模型(30B-A3B) | 0.9007 | 57.30 | 44.51 | 不受影響 |
| 8B 版本(七模組) | 0.9272 | 54.48 | 45.66 | |
| 8B 版本 消融版 | 0.9230 | 54.42 | 44.72 | 已更正 |
| 8B 版本(只有注意力) | 0.8984 | 55.49 | 44.33 | |
CantoneseLLMChat-v1.0-7B |
0.5376 | 60.09 | 46.71 | 不受影響 |
Qwen/Qwen3-30B-A3B(基座) |
0.0296 | 3.63 | 9.29 | 不受影響 |
「已知取捨」一節要重寫
原文寫「本模型喺普→粵 弱於 8B 版本,44.51 對 52.36」。更正後係 44.51 對 45.66,
只差 1.15;而且本模型高過 8B 只有注意力版本嘅 44.33。
所以「更大嘅基座將粵語講得出做得更差」呢個講法大幅減弱,唔再係一個明顯嘅取捨。
本模型仍然低於 CantoneseLLMChat-v1.0-7B 嘅 46.71。
「粵→普 係本組最高」仍然成立(57.30;8B 更正後係 54.48,與首位 60.09 嘅差距由 5.61 收窄到 2.79)。
另外兩點必須講清楚
- 兩個
*-Thinking對照模型嘅分數係被我哋測低咗,唔係我哋測高咗自己。 佢哋 config 同樣帶 5.6.2 schema。所以本卡原先報嘅領先幅度係虛高嘅。 佢哋嘅翻譯分更加係下界:平均輸出 341 / 467 個 token,頂住max_tokens上限被截斷。 - 方向唔係一律嘅。 六個受影響模型入面五個更正後選擇題分數上升,
但
v2.0-30B-A3B-Thinking反而跌 2.02pp。唔可以由「方向一致」去推斷任何未重測嘅模型。
完整因果證據、逐項更正清單同復現方法見倉庫 results/moe_30b.md 第五節。
評測
8 個模型加本模型,同一套評測腳本、同一批硬件(昇騰 910C)、貪心解碼、逐題配對檢驗。 HKMMLU 選擇題採用官方口徑(zero-shot prompting,生成式,全量 26,368 題)。
HKMMLU 選擇題
| 排名 | 模型 | 準確率 | 95%CI | 解析失敗 | 平均輸出tok |
|---|---|---|---|---|---|
| 1 | 本模型(30B-A3B + 只有注意力 LoRA) | 0.6467 | ±0.58pp | 0.0003 | 5.4 |
| 2 | hon9kon9ize/CantoneseLLMChat-v1.0-7B |
0.5897 | ±0.59pp | 0.0000 | 11.7 |
| 3 | lordjia/Qwen2-Cantonese-7B-Instruct |
0.5883 | ±0.59pp | 0.0000 | 8.8 |
| 4 | 8B 版本 消融版(只用公開數據) | 0.5560 | ±0.60pp | 0.0000 | 9.1 |
| 5 | 8B 版本(同配方,只有注意力) | 0.5416 | ±0.60pp | 0.0543 | 16.7 |
| 6 | 8B 版本(完整語料,七模組) | 0.5394 | ±0.60pp | 0.0442 | 13.0 |
| 7 | lordjia/Llama-3-Cantonese-8B-Instruct |
0.5240 | ±0.60pp | 0.0005 | 4.4 |
| 8 | Qwen/Qwen3-8B(8B 基座) |
0.4697 | ±0.60pp | 0.0281 | 471.0 |
| 9 | hon9kon9ize/CantoneseLLM-v2.0-30B-A3B-Thinking |
0.4694 | ±0.60pp | 0.0374 | 428.0 |
| 10 | Qwen/Qwen3-30B-A3B(本模型基座) |
0.4487 | ±0.60pp | 0.0394 | 495.2 |
| 11 | hon9kon9ize/CantoneseLLM-v2.0-8B-Thinking |
0.3993 | ±0.59pp | 0.0825 | 451.0 |
配對檢驗:本模型領先次位 +5.69pp(95% CI [+5.07, +6.38],p = 2.5e-63)。
解析失敗率 0.03%(7/26,368),屬全表最低之一,平均輸出 5.4 個 token。 8B 版本同一項係 4.42%,基座係 3.94%(平均輸出 495 個 token,即係答完唔停)。 格式遵從此前被判定為 8B 版本嘅主要短板,換用本基座之後該項基本消除。
增益歸因:換基座 vs 換配方
兩項都係全量逐題配對:
| 比較 | 變量 | Δ準確率 | 95%CI | p |
|---|---|---|---|---|
| 30B-A3B vs 8B(同為只有注意力) | 基座 | +10.50pp | [+9.88, +11.15] | 5.1e-221 |
| 8B 只有注意力 vs 8B 七模組 | 配方 | +0.22pp | — | 0.417(不顯著) |
基座容量主導;LoRA 掛載模組嘅選擇喺本任務上量唔出差別。
增益歸因:扣除格式分量
主表口徑(strict,末尾只給「答案:」)對未經指令微調嘅基座天然不利。 為咗將「學會按格式作答」同「知識增加」分開,另以 scaffold 口徑(末尾附一句格式要求) 全量重測本模型同其基座:
| strict | scaffold | 口徑帶來嘅增益 | |
|---|---|---|---|
Qwen/Qwen3-30B-A3B(基座) |
0.4487 | 0.5252 | +7.65pp |
| 本模型 | 0.6467 | 0.6660 | +1.93pp |
| 同口徑差距 | +19.79pp | +14.07pp | — |
- 同口徑(scaffold,即對基座最有利嘅一檔)之下微調仍然帶來 +14.07pp (95% CI [+13.43, +14.72])。
- 基座即使獲得格式幫助(0.5252),仍然低於次位模型
CantoneseLLMChat-v1.0-7B(0.5897)。 - ⚠️ 主表一律採用 strict 口徑,scaffold 一列只用於本節嘅分量拆解,不用於排名。
書面粵語純度同官方翻譯任務
| 書面粵語純度 | 退化率 | 粵→普 chrF_t2s | 普→粵 chrF_t2s | |
|---|---|---|---|---|
| 本模型 | 0.9007 | 0.0342 | 57.30 | 44.51 |
| 8B 版本(七模組) | 0.8791 | 0.0256 | 52.81 | 52.36 |
| 8B 版本(只有注意力) | 0.8788 | 0.0256 | 54.06 | 50.79 |
CantoneseLLMChat-v1.0-7B |
0.5376 | 0.0085 | 60.09 | 46.71 |
Qwen/Qwen3-30B-A3B(基座) |
0.0296 | 0.0000 | 3.63 | 9.29 |
純度係 117 條日常粵語提問嘅平均粵語字詞佔比。翻譯任務各 2,000 條,seed=42。
chrF_t2s 係繁簡歸一之後嘅 chrF。chrF 屬字符級指標,而官方 粵→普 嘅參考譯文係簡體,
本模型繁體輸出率 0.995,未歸一嘅原始 chrF 會將已經轉對語域嘅句子判為接近零分
(本模型原始值 25.22,歸一後 57.30)。
已知取捨
本模型喺「普→粵」一項上弱於 8B 版本——而該項係本組指標之中唯一直接量度
「能否產出粵語」嘅一項。44.51 對 52.36,亦低於 CantoneseLLMChat-v1.0-7B 嘅 46.71。
與此同時「粵→普」係本組最高(57.30,與首位嘅差距由 8B 版本嘅 7.28 點收窄至 2.79 點)。
讀法:更大嘅基座將粵語「聽得明」做得更好,將粵語「講得出」做得更差。
一項與之相符但未經消融驗證嘅解釋:只有注意力嘅 LoRA 喺本 MoE 上只改動 192/18,867 ≈ 1% 嘅張量,而同樣 192 個模組喺 8B 稠密模型之中所佔比例遠高於此。
因此: 若任務以粵語知識問答、指令同格式遵從為主,用本模型; 若以生成地道書面粵語為主,8B 版本仍然係首選。
復現合併
adapter 需要掛喺公開基座上面使用。本倉庫嘅評測對象即係以下步驟嘅產物,而且可以逐位核對:
# 1. 取基座(公開權重)
huggingface-cli download Qwen/Qwen3-30B-A3B --local-dir ./Qwen3-30B-A3B
# 2. 取本倉庫 adapter
huggingface-cli download Zeteng/yue-qa-qwen3-30b-a3b --include "adapter/*" --local-dir .
# 3. 合併(需要 peft 0.20.0;adapter_config.json 內嘅 peft_version 才係權威版本)
python merge_lora.py --base ./Qwen3-30B-A3B --adapter ./adapter --out ./merged
merge_lora.py 見 技術報告倉庫 嘅 train/。
核對判據(合併腳本會寫出 merge_check.json):
n_compared = 18867
n_changed = 192
max_rel_delta = 0.15516 (r=32/alpha=64 之下嘅正常量級)
三項全部吻合,即說明合併操作與本倉庫嘅評測對象一致。本項目已經喺兩台唔同集群、 兩個唔同 transformers 大版本(5.6.2 同 4.57.1)之下各做一次合併,三項數值一致。
本倉庫 adapter/ 只含 adapter_model.safetensors、adapter_config.json、chat_template.jinja 三個文件。LoRA 權重逐位未改動(107,006,424 字節);adapter_config.json 嘅 base_model_name_or_path 由訓練機嘅本地路徑改為公開基座 ID Qwen/Qwen3-30B-A3B,該字段唔參與合併運算。訓練腳本順帶產出嘅分詞器同 training_args.bin 並未發佈。
分詞器請自基座覆蓋(tokenizer_config.json 應為 9,732 字節、內嵌 4,168 字符嘅
chat template)。經 save_pretrained 順帶產出嘅分詞器曾經出現缺字段同缺詞表嘅情況。
使用限制
- 訓練數據以問答/指令為主,未針對長文生成、代碼、數學優化。
- 未做安全對齊評測。不要用於醫療、法律、金融等高風險場景。
- 基座 chat template 含思維鏈模式;全部評測均關閉思維鏈。
- 上表「退化率」一欄只有 117 條提問,一至兩條之差即為約 ±0.01,不宜以此欄比較優劣。
數據與授權
訓練集與 8B 版本同一份:71,202 條(train 68,202 / dev 1,000 / test 2,000,seed=42,
先切分後訓練),合併四個公開粵語來源。其中授權允許再分發嘅 27,207 條已發佈喺
Zeteng/cantonese-llm-data
嘅 v2-clean/;另外兩個來源一個無授權聲明、一個係 AGPL-3.0,因此不再分發,
構建腳本公開可復現。
授權 cc-by-nc-nd-4.0:基座 Qwen3-30B-A3B 雖然係 Apache-2.0,但訓練數據含 CC-BY-NC
成分,取所有輸入之中最嚴格嘅一項,再加 ND。本模型限非商業使用,亦不得公開發佈修改版
——自行微調使用不受限制,公開發佈衍生版本之前請先與我們聯繫。
取用方式:需要申請
本倉庫已開啟門禁(gated),逐個人工審批。喺 HF 頁面上點「申請取用」填表, 審核通過之後即可下載。之後所有調用都要帶 token:
from huggingface_hub import login
login() # 或者設 HF_TOKEN 環境變量
取用後請標註第一署名單位「粵語語料庫建設與大模型評測重點實驗室」及資助編號 25ZD03。
署名與資助
第一署名單位:粵語語料庫建設與大模型評測重點實驗室 (Key Laboratory for Cantonese Corpus Construction and Large Language Model Evaluation)
資助: 該實驗室 2025 年度研究課題,課題編號 25ZD03。
完整技術覆盤與可複用評測腳本:https://github.com/Lam810/cantonese-llm-lab
引用
@misc{yuelab2026cantoneseqa30b,
author = {Zeteng Lin and Jing Tang},
title = {Cantonese QA 30B-A3B: an attention-only LoRA fine-tune of Qwen3-30B-A3B
for Cantonese question answering},
year = {2026},
howpublished = {\url{https://huggingface.co/Zeteng/yue-qa-qwen3-30b-a3b}},
note = {Key Laboratory for Cantonese Corpus Construction and Large Language Model
Evaluation. Grant No. 25ZD03}
}