RRS-10K: um benchmark de modelo de visão e linguagem multitarefa para interpretação de imagens raras de sensoriamento remoto

arXiv:2607.24810v1 Tipo de anúncio: novo Resumo: Os modelos de visão e linguagem (VLMs) alcançaram forte desempenho em tarefas gerais de sensoriamento remoto. No entanto, sua capacidade para cenas raras permanece insuficientemente compreendida, porque os benchmarks existentes são dominados por imagens urbanas e rurais comuns. Para preencher essa lacuna, apresentamos o RRS-10K, um benchmark para interpretação de imagens raras de sensoriamento remoto. O RRS-10K contém 10.738 imagens de sensoriamento remoto de cunho militar e questões correspondentes em múltiplos formatos...

arXiv cs.AI ·Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei ·
compartilhar: