Jako Tako ou Fluente? Apresentando o PoVisLE: Uma Avaliação de Visão e Linguagem em Polonês
arXiv:2608.07763v1 Tipo de anúncio: novo Resumo: Os modelos de visão e linguagem (VLMs) alcançaram um desempenho forte em tarefas como legendagem de imagens, resposta a perguntas visuais e geração de imagem para texto. No entanto, eles são predominantemente treinados com dados centrados no inglês, o que limita sua capacidade de lidar com a compreensão visual culturalmente enraizada e leva a falhas na interpretação de significados específicos de cada região, conteúdo simbólico e pistas visuais dependentes de contexto. Os benchmarks existentes para comp...
arXiv cs.CL
·Anna Ko{\l}os, Grzegorz Statkiewicz, Karolina Seweryn, Katarzyna Kowol, Karolina Piosek, Wojciech Kusa
·
// relacionados
Leia também
Editorial
Muse Glimmer: a Meta volta ao código aberto com um agente de 30B que cabe numa GPU
Blog
NeuPAT: Ajuste de Alocação de Plasticidade Ciente de Neurônios para MLLMs que Preservam a Linguagem
Blog
Classificação Multimodal de Lesões de Pele com Swin Transformer e Fusão de Metadados Clínicos
Blog