Jako Tako ou Fluente? Apresentando o PoVisLE: Uma Avaliação de Visão e Linguagem em Polonês

arXiv:2608.07763v1 Tipo de anúncio: novo Resumo: Os modelos de visão e linguagem (VLMs) alcançaram um desempenho forte em tarefas como legendagem de imagens, resposta a perguntas visuais e geração de imagem para texto. No entanto, eles são predominantemente treinados com dados centrados no inglês, o que limita sua capacidade de lidar com a compreensão visual culturalmente enraizada e leva a falhas na interpretação de significados específicos de cada região, conteúdo simbólico e pistas visuais dependentes de contexto. Os benchmarks existentes para comp...

arXiv cs.CL ·Anna Ko{\l}os, Grzegorz Statkiewicz, Karolina Seweryn, Katarzyna Kowol, Karolina Piosek, Wojciech Kusa ·
compartilhar: