|
Download README.md from vaghawan/xtts-v2-en-pidgin-lr-5e-5-epoch10-35mins: direct link, hf CLI and curl.
- Browser
- Download file 1.97 kB
-
https://huggingface.co/vaghawan/xtts-v2-en-pidgin-lr-5e-5-epoch10-35mins/resolve/main/README.md
- Command line
-
hf download hf://vaghawan/xtts-v2-en-pidgin-lr-5e-5-epoch10-35mins/README.md
-
curl -L -o README.md https://huggingface.co/vaghawan/xtts-v2-en-pidgin-lr-5e-5-epoch10-35mins/resolve/main/README.md
1.97 kB
metadata
license: other
language:
- en
tags:
- text-to-speech
- xtts
- english
- nigerian-pidgin
- pidgin
- coqui
library_name: coqui-tts
XTTS-v2 — English + Nigerian Pidgin (lr=5e-5, 10 epochs, ~35 min data)
Fine-tuned Coqui XTTS-v2 for English and Nigerian Pidgin
(both synthesized with language id en), trained on vaghawan/en-pidgin-high-similarity-11-35mins (speaker en_pidgin_voice).
Pidgin has no native XTTS language code — train and infer Pidgin text as en.
Files
| File | Purpose |
|---|---|
best_model.pth |
Fine-tuned GPT checkpoint (epoch 10, lr=5e-5) |
config.json |
Model config |
vocab.json |
Stock XTTS English BPE vocabulary (no extend) |
references/en_pidgin_voice.wav |
Speaker reference |
infer_english_and_pidgin.py |
English + Pidgin sample inference |
infer.py |
Shared inference helpers |
xtts_hausa_patch.py |
Runtime language helpers (also used for en) |
env_config.py |
Config loader |
config.env.example |
Example settings (copy to config.env) |
requirements.txt |
Python dependencies |
Quick start
pip install -r requirements.txt
cp config.env.example config.env
python infer_english_and_pidgin.py \
--model-dir . \
--speaker-wav references/en_pidgin_voice.wav \
--out-dir outputs/samples_en_pidgin
# Single line (via infer.py):
python infer.py --model-dir . --language en \
--text "How far? I dey fine." \
--speaker-wav references/en_pidgin_voice.wav \
--out outputs/out.wav
Training details
- Base model: Coqui XTTS-v2 (stock English vocab — no
extend_vocab.py) - Epochs: 10
- Learning rate: 5e-5
- Language id:
en(English and Pidgin) - Speakers:
en_pidgin_voice - Data: ~35 minutes high-similarity English/Pidgin
License
XTTS-v2 uses the Coqui Public Model License. Check each dataset license before redistribution.