PhoWhisper-medium VI telephony — CTranslate2 (int8_float16)
Deployable, fast CTranslate2 build of the telephony-robust PhoWhisper-medium (PhoWhisper-medium + encoder-LoRA, LoRA merged then converted). For Vietnamese call-center / telephony ASR.
- WER (FLEURS vi test, beam-5): telephony 0.406 (per-SNR 0/5/10/15 dB = 0.71/0.38/0.30/0.26), clean 0.081.
- ~2.34× faster than HF
generate(RTF 0.31→0.13), 769 MB (int8_float16) vs ~3 GB fp32. Long-form batched (faster-whisperBatchedInferencePipeline) ≈ 48× realtime.
Usage (faster-whisper)
from faster_whisper import WhisperModel
m = WhisperModel("banhchungtuongot/phowhisper-medium-vi-telephony-ct2",
device="cuda", compute_type="int8_float16", num_workers=4)
segs, info = m.transcribe(audio_16k, language="vi", beam_size=5)
print(" ".join(s.text for s in segs))
LoRA adapter (pre-merge): banhchungtuongot/phowhisper-medium-vi-telephony-lora.
Code/analysis: https://github.com/NguyenDucAnforwork/asr-h100-noise-robust
(reports/inference_infra_results.md, reports/telephony_lora_finetune.md).
- Downloads last month
- 9