PhoWhisper-medium VI telephony — CTranslate2 (int8_float16)

Deployable, fast CTranslate2 build of the telephony-robust PhoWhisper-medium (PhoWhisper-medium + encoder-LoRA, LoRA merged then converted). For Vietnamese call-center / telephony ASR.

  • WER (FLEURS vi test, beam-5): telephony 0.406 (per-SNR 0/5/10/15 dB = 0.71/0.38/0.30/0.26), clean 0.081.
  • ~2.34× faster than HF generate (RTF 0.31→0.13), 769 MB (int8_float16) vs ~3 GB fp32. Long-form batched (faster-whisper BatchedInferencePipeline) ≈ 48× realtime.

Usage (faster-whisper)

from faster_whisper import WhisperModel
m = WhisperModel("banhchungtuongot/phowhisper-medium-vi-telephony-ct2",
                 device="cuda", compute_type="int8_float16", num_workers=4)
segs, info = m.transcribe(audio_16k, language="vi", beam_size=5)
print(" ".join(s.text for s in segs))

LoRA adapter (pre-merge): banhchungtuongot/phowhisper-medium-vi-telephony-lora. Code/analysis: https://github.com/NguyenDucAnforwork/asr-h100-noise-robust (reports/inference_infra_results.md, reports/telephony_lora_finetune.md).

Downloads last month
9
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support