VTaMo: Modelo de Alinhamento Vídeo-Texto para Tradução de Língua de Sinais
arXiv:2607.09126v1 Tipo de anúncio: cross Resumo: A tradução de língua de sinais (SLT) converte vídeos contínuos de sinais em texto de língua falada. Abordagens sem glosas (gloss-free) aproveitam codificadores visuais e modelos de linguagem pré-treinados, mas dependem de um alinhamento intermodal implícito obtido apenas por meio da supervisão de tradução. Apresentamos o VTaMo, um framework que introduz alinhamento explícito em múltiplas granularidades em três níveis: (1) alinhamento local por meio de transporte ótimo regularizado por entropia com um token nulo aprendível para fina-gr...