RRS-10K: um benchmark de modelo de visão e linguagem multitarefa para interpretação de imagens raras de sensoriamento remoto
arXiv:2607.24810v1 Tipo de anúncio: novo Resumo: Os modelos de visão e linguagem (VLMs) alcançaram forte desempenho em tarefas gerais de sensoriamento remoto. No entanto, sua capacidade para cenas raras permanece insuficientemente compreendida, porque os benchmarks existentes são dominados por imagens urbanas e rurais comuns. Para preencher essa lacuna, apresentamos o RRS-10K, um benchmark para interpretação de imagens raras de sensoriamento remoto. O RRS-10K contém 10.738 imagens de sensoriamento remoto de cunho militar e questões correspondentes em múltiplos formatos...
arXiv cs.AI
·Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei
·