Blog
Áudio & Voz
A avaliação Best-of-$N$ de TTS é distorcida pelo alinhamento de família do ASR
arXiv:2607.08256v1 Tipo de anúncio: novo Resumo: A inferência Best-of-$N$ (BoN) melhora a consistência de conteúdo em text-to-speech zero-shot ao selecionar entre $N$ candidatos com um verificador de reconhecimento automático de fala (ASR). Identificamos um fator de confusão pouco explorado na avaliação: a qualidade aparente de um verificador depende fortemente de qual família de ASR o julga. No LibriSpeech-PC test-clean~\citep{librispeechpc} com o F5-TTS~\citep{f5tts}, as classificações dos verificadores se invertem entre os avaliadores Whisper, wav2vec~2.0 e HuBERT...
arXiv cs.CL
·Taehyung Yu, Seongjae Kang
·
// relacionados
Leia também
Blog
Meta ran ads for an app promising to nudify female politicians
Editorial
MiniMax Music 3: uma canção inteira de cinco minutos, com pesos abertos
Blog
Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models
Blog