Automatic Speech Recognition
NeMo
Safetensors
Transformers
PyTorch
nemotron3_5_asr
feature-extraction
speech-recognition
cache-aware ASR
streaming-asr
multilingual
speech
audio
FastConformer
RNNT
Parakeet
ASR
NeMo
Eval Results (legacy)
Eval Results
Instructions to use nvidia/nemotron-3.5-asr-streaming-0.6b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- NeMo
How to use nvidia/nemotron-3.5-asr-streaming-0.6b with NeMo:
import nemo.collections.asr as nemo_asr asr_model = nemo_asr.models.ASRModel.from_pretrained("nvidia/nemotron-3.5-asr-streaming-0.6b") transcriptions = asr_model.transcribe(["file.wav"]) - Transformers
How to use nvidia/nemotron-3.5-asr-streaming-0.6b with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="nvidia/nemotron-3.5-asr-streaming-0.6b")# Load model directly from transformers import AutoProcessor, AutoModel processor = AutoProcessor.from_pretrained("nvidia/nemotron-3.5-asr-streaming-0.6b") model = AutoModel.from_pretrained("nvidia/nemotron-3.5-asr-streaming-0.6b", device_map="auto") - Inference
- Notebooks
- Google Colab
- Kaggle
Drop revision pin from Transformers snippets (not needed post-merge)
Browse files
README.md
CHANGED
|
@@ -430,9 +430,8 @@ from transformers import AutoModelForRNNT, AutoProcessor
|
|
| 430 |
from transformers.audio_utils import load_audio
|
| 431 |
|
| 432 |
model_id = "nvidia/nemotron-3.5-asr-streaming-0.6b"
|
| 433 |
-
|
| 434 |
-
|
| 435 |
-
model = AutoModelForRNNT.from_pretrained(model_id, revision=revision, device_map="auto")
|
| 436 |
|
| 437 |
audio = load_audio(
|
| 438 |
"https://huggingface.co/datasets/hf-internal-testing/dummy-audio-samples/resolve/main/bcn_weather.mp3",
|
|
@@ -462,9 +461,8 @@ from transformers import AutoModelForRNNT, AutoProcessor, TextIteratorStreamer
|
|
| 462 |
from transformers.audio_utils import load_audio
|
| 463 |
|
| 464 |
model_id = "nvidia/nemotron-3.5-asr-streaming-0.6b"
|
| 465 |
-
|
| 466 |
-
|
| 467 |
-
model = AutoModelForRNNT.from_pretrained(model_id, revision=revision, device_map="auto")
|
| 468 |
|
| 469 |
processor.set_num_lookahead_tokens(6)
|
| 470 |
print(f"Streaming latency: {processor.streaming_latency_ms} ms")
|
|
|
|
| 430 |
from transformers.audio_utils import load_audio
|
| 431 |
|
| 432 |
model_id = "nvidia/nemotron-3.5-asr-streaming-0.6b"
|
| 433 |
+
processor = AutoProcessor.from_pretrained(model_id)
|
| 434 |
+
model = AutoModelForRNNT.from_pretrained(model_id, device_map="auto")
|
|
|
|
| 435 |
|
| 436 |
audio = load_audio(
|
| 437 |
"https://huggingface.co/datasets/hf-internal-testing/dummy-audio-samples/resolve/main/bcn_weather.mp3",
|
|
|
|
| 461 |
from transformers.audio_utils import load_audio
|
| 462 |
|
| 463 |
model_id = "nvidia/nemotron-3.5-asr-streaming-0.6b"
|
| 464 |
+
processor = AutoProcessor.from_pretrained(model_id)
|
| 465 |
+
model = AutoModelForRNNT.from_pretrained(model_id, device_map="auto")
|
|
|
|
| 466 |
|
| 467 |
processor.set_num_lookahead_tokens(6)
|
| 468 |
print(f"Streaming latency: {processor.streaming_latency_ms} ms")
|