Automatic Speech Recognition
Transformers
Safetensors
phi4mm
text-generation
nlp
code
audio
speech-summarization
speech-translation
visual-question-answering
phi-4-multimodal
phi
phi-4-mini
custom_code
Eval Results
Instructions to use microsoft/Phi-4-multimodal-instruct with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use microsoft/Phi-4-multimodal-instruct with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="microsoft/Phi-4-multimodal-instruct", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("microsoft/Phi-4-multimodal-instruct", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: mean_wer | |
| value: 6.02 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: rtfx | |
| value: 151.1 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: ami_wer | |
| value: 11.09 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: earnings22_wer | |
| value: 10.16 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: gigaspeech_wer | |
| value: 9.33 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: librispeech_clean_wer | |
| value: 1.69 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: librispeech_other_wer | |
| value: 3.82 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: spgispeech_wer | |
| value: 3.06 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: tedlium_wer | |
| value: 2.94 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |
| - dataset: | |
| id: hf-audio/open-asr-leaderboard | |
| task_id: voxpopuli_wer | |
| value: 6.04 | |
| date: '2025-02-24' | |
| source: | |
| url: https://huggingface.co/hf-audio | |
| name: open-asr-leaderboard | |
| user: hf-audio | |