VSRo-200: Um Conjunto de Dados de Reconhecimento Visual de Fala em Romeno para Estudar Supervisão e Robustez Multimodal
arXiv:2607.08112v1 Tipo de Anúncio: novo Resumo: Apresentamos o VSRo-200, o primeiro conjunto de dados em larga escala para reconhecimento visual de fala (leitura labial) em romeno, composto por 200 horas de vídeos reais de podcasts. Todas as amostras são anotadas com pseudorrótulos gerados por um modelo de ASR romeno ajustado, enquanto um subconjunto de 100 horas é adicionalmente transcrito por humanos, possibilitando uma análise controlada da qualidade da supervisão sob uma estrutura unificada. Com base nesse conjunto de dados, estabelecemos um benchmark para...
arXiv cs.CV
·Iulia-Maria Udrea, Alexandra Diaconu, Bogdan Alexe
·
// relacionados
Leia também
Blog
Meta ran ads for an app promising to nudify female politicians
Editorial
MiniMax Music 3: uma canção inteira de cinco minutos, com pesos abertos
Blog
Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models
Blog