--- language: - zh - mn - ug - bo tags: - ancient-languages - grpo - rl - qwen3 license: apache-2.0 base_model: zisuh/round2-10lang-passk-15k-sft-0608 --- # Ancient Language GRPO — Pilot 2 Step 100 **注释与断句任务最强 checkpoint:tibetan_annotation +2.69pp。** ## 模型信息 - **基座模型**: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged) - **训练方法**: GRPO + LoRA rank=64 - **Reward**: BLEU-2 + BERTScore (batched) - **训练步数**: 100 / 200 - **超参数**: gen=16, temp=1.0, **β=0.02**, lr=2e-6 ## 训练 Bucket (6 个) | Bucket | 任务 | 训练样本数 | test_final_new Δ | |---|---|---|---| | tibetan\_\_annotation | 注释 | 5,273 | **+2.69pp** ✅ | | traditional\_mongolian\_\_annotation | 注释 | 2,403 | +0.36pp | | xishuangbanna\_dai\_\_annotation | 注释 | 1,823 | -1.33pp | | tangut\_\_segmentation | 断句 | 3,305 | +0.25pp | | zhuang\_\_segmentation | 断句 | 222 | **+1.24pp** ✅ | | uyghur\_\_restoration | 修复 | 4,335 | **+0.98pp** ✅ | **总训练数据**: 30,113 samples ## 评测结果 (sacrebleu sentence-BLEU-2, 0-100) | Bucket | Baseline | This Model | Δ | |---|---|---|---| | **tibetan / annotation** | 61.09 | **63.78** | **+2.69pp** ✅ | | zhuang / segmentation | 66.67 | **67.91** | **+1.24pp** ✅ | | uyghur / restoration | 89.04 | **90.02** | **+0.98pp** ✅ | | uyghur / translation | 31.88 | **32.22** | +0.34pp | | traditional\_mongolian / annotation | 59.65 | 60.01 | +0.36pp | | tangut / segmentation | 84.72 | 84.97 | +0.25pp | **最佳用途**: 注释和断句任务(尤其是藏文注释) ## 与 Pilot 3 的区别 | 参数 | Pilot 2 (本模型) | Pilot 3 | |---|---|---| | β (KL penalty) | **0.02** (更保守) | 0.01 (更探索) | | Bucket 数 | 6 | 10 | | 翻译 bucket | 无 | 4 个 | | 最大单 bucket 提升 | **+2.69pp** | +1.54pp | | 特点 | annotation/segmentation 专精 | 覆盖广、translation 涨点 | β=0.02 对注释/断句/修复类任务更有效(这些任务需要保守探索),而翻译任务需要 β=0.01 的更激进探索。 ## 使用方式 ```python from transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot2-step100", torch_dtype="bfloat16", device_map="auto") tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot2-step100") ```