Audio8/Audio8-TTS-Preview-0.6b
Modelo de síntese de voz · 600 M de parâmetros — 2.5 mil downloads e 151 curtidas no Hugging Face.
Hugging Face · Modelos
·Audio8
·
·↓ 2481
·♥ 151
O modelo Audio8/Audio8-TTS-Preview-0.6b aparece entre os mais comentados do Hugging Face — um termômetro do que a comunidade está realmente usando agora na tarefa de síntese de voz.
Ficha técnica
- Tarefa: síntese de voz
- Parâmetros: 600 M
- Biblioteca:
transformers - Formatos: safetensors
- Licença: Apache 2.0
- Downloads: 2.5 mil · Curtidas: 151
Hardware recomendado
Estimativa de VRAM só para carregar os pesos (com ~20% de folga para ativações). Contextos longos consomem memória adicional para o cache de atenção (KV cache).
- Precisão original (16-bit): ~1.4 GB de VRAM — roda em CPU ou GPU de notebook
- Quantizado 8-bit: ~0.7 GB de VRAM — roda em CPU ou GPU de notebook
- Quantizado 4-bit: ~0.4 GB de VRAM — roda em CPU ou GPU de notebook
Como rodar localmente
Sintetize voz/áudio com a transformers (alguns modelos exigem o código do autor — confira o card):
pip install -U transformers torch
from transformers import pipeline
tts = pipeline("text-to-speech", model="Audio8/Audio8-TTS-Preview-0.6b", device=0)
out = tts("Olá! Esta é uma voz sintética.")
# out["audio"], out["sampling_rate"]Tags
transformers safetensors arktts feature-extraction audio text-to-speech tts voice-cloning
// relacionados
Leia também
Blog
Smallest.ai raises $13M to build ultra-fast voice AI that sounds genuinely human
Blog
PolyAI Releases Dialog-RSN-1: An Audio-Native Dialog Model That Fuses Turn-Taking, Speech Recognition, Function Calling, And Response
Blog
Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm
Blog