ComplexityWorld: Avaliando Modelos de Visão-Linguagem em Tomada de Decisão Visual Verificável

arXiv:2608.07584v1 Tipo de Anúncio: novo Resumo: Os modelos de visão-linguagem (VLMs) fizeram progressos rápidos na percepção visual e cada vez mais dão suporte a tarefas do mundo real que dependem de imagens. Muitas dessas tarefas, no entanto, exigem mais do que reconhecer o que uma imagem contém: um modelo precisa usar evidências visuais para tomar uma decisão completa cujas partes satisfaçam conjuntamente restrições globais. Apresentamos o COMPLEXITYWORLD, um benchmark de 390 tarefas em 39 mundos visuais inspirados em domínios e 29 categorias de decisão...

arXiv cs.CV ·Ningxin Pan, Hanyu Li, Yehui Tang ·
compartilhar: