ComplexityWorld: Avaliando Modelos de Visão-Linguagem em Tomada de Decisão Visual Verificável
arXiv:2608.07584v1 Tipo de Anúncio: novo Resumo: Os modelos de visão-linguagem (VLMs) fizeram progressos rápidos na percepção visual e cada vez mais dão suporte a tarefas do mundo real que dependem de imagens. Muitas dessas tarefas, no entanto, exigem mais do que reconhecer o que uma imagem contém: um modelo precisa usar evidências visuais para tomar uma decisão completa cujas partes satisfaçam conjuntamente restrições globais. Apresentamos o COMPLEXITYWORLD, um benchmark de 390 tarefas em 39 mundos visuais inspirados em domínios e 29 categorias de decisão...
arXiv cs.CV
·Ningxin Pan, Hanyu Li, Yehui Tang
·
// relacionados
Leia também
Editorial
Muse Glimmer: a Meta volta ao código aberto com um agente de 30B que cabe numa GPU
Blog
NeuPAT: Ajuste de Alocação de Plasticidade Ciente de Neurônios para MLLMs que Preservam a Linguagem
Blog
Classificação Multimodal de Lesões de Pele com Swin Transformer e Fusão de Metadados Clínicos
Blog