openslr/librispeech_asr
Viewer • Updated • 585k • 65.5k • 233
Speech-LLM checkpoint for ASR alignment, trained on LibriSpeech 960h with CTC auxiliary loss and SortFormer-based speaker kernel.
| Component | Model | Parameters |
|---|---|---|
| Encoder | nvidia/parakeet-ctc-0.6b (FastConformer CTC) |
600M |
| Projector | Conv1d + Transformer (1024 → 896, stride=2) | trainable |
| LLM | Qwen/Qwen2.5-0.5B |
500M |
projector_and_encoder_top — projector fully trainable,
top-4 encoder layers unfrozen| Dataset | Samples | Description |
|---|---|---|
| LibriSpeech 960h | ~276k | Read English speech (standard ASR benchmark) |
import torch
checkpoint = torch.load("final.pt", map_location="cpu")
# Load into SpeechLLM model — see the parakeet-turntaking repository for details
final.pt — Full model checkpoint (encoder + projector + LLM state dicts)config.yaml — Training configuration