nvidia/nemotron-3.5-asr-streaming-0.6b
Modelo de reconhecimento de fala · 600 M de parâmetros — 541.2 mil downloads e 887 curtidas no Hugging Face.
Hugging Face · Modelos
·nvidia
·
·↓ 541157
·♥ 887
O modelo nvidia/nemotron-3.5-asr-streaming-0.6b aparece entre os mais comentados do Hugging Face — um termômetro do que a comunidade está realmente usando agora na tarefa de reconhecimento de fala.
Ficha técnica
- Tarefa: reconhecimento de fala
- Parâmetros: 600 M
- Biblioteca:
nemo - Formatos: safetensors
- Licença: proprietária / outra
- Downloads: 541.2 mil · Curtidas: 887
Hardware recomendado
Estimativa de VRAM só para carregar os pesos (com ~20% de folga para ativações). Contextos longos consomem memória adicional para o cache de atenção (KV cache).
- Precisão original (16-bit): ~1.4 GB de VRAM — roda em CPU ou GPU de notebook
- Quantizado 8-bit: ~0.7 GB de VRAM — roda em CPU ou GPU de notebook
- Quantizado 4-bit: ~0.4 GB de VRAM — roda em CPU ou GPU de notebook
Como rodar localmente
Transcreva áudio com o pipeline da transformers:
pip install -U transformers torch
from transformers import pipeline
asr = pipeline("automatic-speech-recognition", model="nvidia/nemotron-3.5-asr-streaming-0.6b", device=0)
print(asr("audio.mp3")["text"])Tags
nemo safetensors nemotron3_5_asr feature-extraction transformers speech-recognition cache-aware ASR automatic-speech-recognition
// relacionados
Leia também
Blog
As Reddit stock falls, CEO questions value of Google's AI Overviews
Blog
Smallest.ai raises $13M to build ultra-fast voice AI that sounds genuinely human
Modelo
Audio8/Audio8-TTS-Preview-0.6b
Blog