vaghawan's picture
Add multi-speaker 3-speaker epoch-10 inference bundle
5827d9c verified
|
Raw History Blame Contribute Delete
1.94 kB
metadata
license: other
language:
  - ha
tags:
  - text-to-speech
  - xtts
  - hausa
  - coqui
library_name: coqui-tts

XTTS-v2 Hausa — multi-speaker (3 speakers, 10 epochs)

Fine-tuned Coqui XTTS-v2 for Hausa (ha), trained on vaghawan/hausa-tts-24khz-waxalnlp-3-clean, vaghawan/hausa-tts-24khz-waxalnlp-5-clean, vaghawan/hausa-tts-24khz-naijavoices-O0456.

Files

File Purpose
best_model.pth Fine-tuned GPT checkpoint (epoch 10)
config.json Model config (includes Hausa language)
vocab.json Extended Hausa BPE vocabulary
references/hausa_fe_waxal_nlp_3.wav Speaker reference for hausa_fe_waxal_nlp_3
references/hausa_fe_waxal_nlp_5.wav Speaker reference for hausa_fe_waxal_nlp_5
references/hausa_fe_naijavoices_O0456.wav Speaker reference for hausa_fe_naijavoices_O0456
infer.py Inference script
xtts_hausa_patch.py Required Hausa runtime patches
env_config.py Config loader
config.env.example Example settings (copy to config.env)
samples.txt Default eval sentences
requirements.txt Python dependencies

Quick start

pip install -r requirements.txt
cp config.env.example config.env

python infer.py --model-dir . --speaker-wav references/hausa_fe_waxal_nlp_3.wav

# Single line:
python infer.py --model-dir . --text "Ina kwana." --speaker-wav references/hausa_fe_waxal_nlp_3.wav --out outputs/out.wav

All speakers (one WAV per reference):

python infer.py --model-dir . --all-speakers --out-dir outputs/samples

Training details

  • Base model: Coqui XTTS-v2
  • Epochs: 10
  • Language: Hausa (ha)
  • Speakers: hausa_fe_waxal_nlp_3, hausa_fe_waxal_nlp_5, hausa_fe_naijavoices_O0456

License

XTTS-v2 uses the Coqui Public Model License. Check each dataset license before redistribution.