Qwen3-TTS Fine-Tuned โ€” Baraq Obama Voice

Fine-tuned version of Qwen3-TTS-12Hz-1.7B-Base on a custom speaker voice using SFT training.

Training Details

  • Base model: Qwen/Qwen3-TTS-12Hz-1.7B-Base
  • Epochs: 5 (checkpoint-epoch-4 used)
  • Batch size: 4
  • Learning rate: 2e-6
  • Language: English

Usage

from qwen_tts import Qwen3TTSModel
import torch

model = Qwen3TTSModel.from_pretrained("kgptalkie/qwen3-tts-finetuned-baraq-obama", device_map="cuda:0", dtype=torch.bfloat16)

wavs, sr = model.generate_custom_voice(
    text="Your text here.",
    language="English",
    speaker="laxmikant",
)
Downloads last month
9
Safetensors
Model size
2B params
Tensor type
BF16
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for kgptalkie/qwen3-tts-finetuned-baraq-obama

Finetuned
(39)
this model