manassehzw/sna-dataset-annotated
Viewer • Updated • 15.2k • 365 • 1
How to use manassehzw/sna-parakeet-tdt-0.6b-v3 with NeMo:
import nemo.collections.asr as nemo_asr
asr_model = nemo_asr.models.ASRModel.from_pretrained("manassehzw/sna-parakeet-tdt-0.6b-v3")
transcriptions = asr_model.transcribe(["file.wav"])Shona Parakeet-TDT ASR is a Shona (sna) automatic speech recognition model fine-tuned from
nvidia/parakeet-tdt-0.6b-v3 using the annotated dataset
manassehzw/sna-dataset-annotated.
This is a first-pass Shona fine-tune of NVIDIA Parakeet-TDT with especially promising qualitative behavior on Shona-English code-switched speech. While the aggregate WER is not yet state of the art for this dataset, the model produced strong real-world transcriptions and preserved useful English recognition ability after Shona adaptation.
nvidia/parakeet-tdt-0.6b-v3manassehzw/sna-dataset-annotatedsna-parakeet-v1sna-parakeet-v1.nemoThis repository contains:
sna-parakeet-v1.nemotraining/summary.jsontraining/preprocess_summary.jsoneval/validation_results.jsoneval/test_results.jsoneval/last_inference.json qualitative sample outputimport nemo.collections.asr as nemo_asr
repo_id = "manassehzw/sna-parakeet-tdt-0.6b-v3"
model = nemo_asr.models.ASRModel.from_pretrained(repo_id)
texts = model.transcribe(["sample.wav"])
print(texts[0].text if hasattr(texts[0], "text") else texts[0])
Base model
nvidia/parakeet-tdt-0.6b-v3