nvidia/nemotron-3.5-asr-streaming-0.6b

Modelo de reconhecimento de fala · 600 M de parâmetros — 541.2 mil downloads e 887 curtidas no Hugging Face.

Hugging Face · Modelos ·nvidia · ·↓ 541157 ·♥ 887

O modelo nvidia/nemotron-3.5-asr-streaming-0.6b aparece entre os mais comentados do Hugging Face — um termômetro do que a comunidade está realmente usando agora na tarefa de reconhecimento de fala.

Ficha técnica

  • Tarefa: reconhecimento de fala
  • Parâmetros: 600 M
  • Biblioteca: nemo
  • Formatos: safetensors
  • Licença: proprietária / outra
  • Downloads: 541.2 mil · Curtidas: 887

Hardware recomendado

Estimativa de VRAM só para carregar os pesos (com ~20% de folga para ativações). Contextos longos consomem memória adicional para o cache de atenção (KV cache).

  • Precisão original (16-bit): ~1.4 GB de VRAM — roda em CPU ou GPU de notebook
  • Quantizado 8-bit: ~0.7 GB de VRAM — roda em CPU ou GPU de notebook
  • Quantizado 4-bit: ~0.4 GB de VRAM — roda em CPU ou GPU de notebook

Como rodar localmente

Transcreva áudio com o pipeline da transformers:

pip install -U transformers torch

from transformers import pipeline

asr = pipeline("automatic-speech-recognition", model="nvidia/nemotron-3.5-asr-streaming-0.6b", device=0)
print(asr("audio.mp3")["text"])

Tags

nemo safetensors nemotron3_5_asr feature-extraction transformers speech-recognition cache-aware ASR automatic-speech-recognition

Abrir o modelo no Hugging Face →

compartilhar: