lapa-instruct-uk-en-grpo

Ukrainian-to-English translation LoRA adapter for lapa-v0.1.2-instruct (Gemma-3 12B).

Trained with GRPO using Condition A: chrF + BLEU lexical rewards only.

Results

Benchmark BLEU chrF CometKiwi xCOMET Mistral Judge Aya Judge
FLoRes+ devtest 43.15 67.85 0.7658 0.9473 88.62 94.33
WMT24 35.75 60.70 0.7053 0.8212 84.74 91.84

Baseline (lapa-v0.1.2-instruct): 42.02 FLoRes BLEU / 34.60 WMT24 BLEU.

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

base_model = AutoModelForCausalLM.from_pretrained("lapa-llm/lapa-v0.1.2-instruct", device_map="auto", dtype="bfloat16")
model = PeftModel.from_pretrained(base_model, "iamthewalrus67/lapa-instruct-uk-en-grpo")
tokenizer = AutoTokenizer.from_pretrained("lapa-llm/lapa-v0.1.2-instruct")

Training Details

  • LoRA: r=128, alpha=256, targets=q/k/v/o projections
  • Rewards: chrF (0.55), BLEU (0.45)
  • Data: WikiMatrix uk-en (132K pairs), 300 steps
  • Infrastructure: DeepSpeed ZeRO-2, 4x RTX 6000 Ada

See reward-driven-translation for full reproduction code.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for iamthewalrus67/lapa-instruct-uk-en-grpo

Adapter
(5)
this model