vaghawan's picture
Add multi-speaker 3-speaker epoch-10 inference bundle
5827d9c verified
|
Raw History Blame Contribute Delete
1.94 kB
---
license: other
language:
- ha
tags:
- text-to-speech
- xtts
- hausa
- coqui
library_name: coqui-tts
---
# XTTS-v2 Hausa — multi-speaker (3 speakers, 10 epochs)
Fine-tuned [Coqui XTTS-v2](https://huggingface.co/coqui/XTTS-v2) for Hausa (`ha`), trained on
`vaghawan/hausa-tts-24khz-waxalnlp-3-clean`, `vaghawan/hausa-tts-24khz-waxalnlp-5-clean`, `vaghawan/hausa-tts-24khz-naijavoices-O0456`.
## Files
| File | Purpose |
|------|---------|
| `best_model.pth` | Fine-tuned GPT checkpoint (epoch 10) |
| `config.json` | Model config (includes Hausa language) |
| `vocab.json` | Extended Hausa BPE vocabulary |
| `references/hausa_fe_waxal_nlp_3.wav` | Speaker reference for `hausa_fe_waxal_nlp_3` |
| `references/hausa_fe_waxal_nlp_5.wav` | Speaker reference for `hausa_fe_waxal_nlp_5` |
| `references/hausa_fe_naijavoices_O0456.wav` | Speaker reference for `hausa_fe_naijavoices_O0456` |
| `infer.py` | Inference script |
| `xtts_hausa_patch.py` | Required Hausa runtime patches |
| `env_config.py` | Config loader |
| `config.env.example` | Example settings (copy to `config.env`) |
| `samples.txt` | Default eval sentences |
| `requirements.txt` | Python dependencies |
## Quick start
```bash
pip install -r requirements.txt
cp config.env.example config.env
python infer.py --model-dir . --speaker-wav references/hausa_fe_waxal_nlp_3.wav
# Single line:
python infer.py --model-dir . --text "Ina kwana." --speaker-wav references/hausa_fe_waxal_nlp_3.wav --out outputs/out.wav
```
# All speakers (one WAV per reference):
python infer.py --model-dir . --all-speakers --out-dir outputs/samples
## Training details
- Base model: Coqui XTTS-v2
- Epochs: 10
- Language: Hausa (`ha`)
- Speakers: `hausa_fe_waxal_nlp_3`, `hausa_fe_waxal_nlp_5`, `hausa_fe_naijavoices_O0456`
## License
XTTS-v2 uses the [Coqui Public Model License](https://huggingface.co/coqui/XTTS-v2).
Check each dataset license before redistribution.