Audio8/Audio8-TTS-Preview-0.6b

Modelo de síntese de voz · 600 M de parâmetros — 2.5 mil downloads e 151 curtidas no Hugging Face.

Hugging Face · Modelos ·Audio8 · ·↓ 2481 ·♥ 151

O modelo Audio8/Audio8-TTS-Preview-0.6b aparece entre os mais comentados do Hugging Face — um termômetro do que a comunidade está realmente usando agora na tarefa de síntese de voz.

Ficha técnica

  • Tarefa: síntese de voz
  • Parâmetros: 600 M
  • Biblioteca: transformers
  • Formatos: safetensors
  • Licença: Apache 2.0
  • Downloads: 2.5 mil · Curtidas: 151

Hardware recomendado

Estimativa de VRAM só para carregar os pesos (com ~20% de folga para ativações). Contextos longos consomem memória adicional para o cache de atenção (KV cache).

  • Precisão original (16-bit): ~1.4 GB de VRAM — roda em CPU ou GPU de notebook
  • Quantizado 8-bit: ~0.7 GB de VRAM — roda em CPU ou GPU de notebook
  • Quantizado 4-bit: ~0.4 GB de VRAM — roda em CPU ou GPU de notebook

Como rodar localmente

Sintetize voz/áudio com a transformers (alguns modelos exigem o código do autor — confira o card):

pip install -U transformers torch

from transformers import pipeline

tts = pipeline("text-to-speech", model="Audio8/Audio8-TTS-Preview-0.6b", device=0)
out = tts("Olá! Esta é uma voz sintética.")
# out["audio"], out["sampling_rate"]

Tags

transformers safetensors arktts feature-extraction audio text-to-speech tts voice-cloning

Abrir o modelo no Hugging Face →

compartilhar: