RRS-10K: um benchmark de modelo de visão e linguagem multitarefa para interpretação de imagens raras de sensoriamento remoto
arXiv:2607.24810v1 Tipo de anúncio: novo Resumo: Os modelos de visão e linguagem (VLMs) alcançaram forte desempenho em tarefas gerais de sensoriamento remoto. No entanto, sua capacidade para cenas raras permanece insuficientemente compreendida, porque os benchmarks existentes são dominados por imagens urbanas e rurais comuns. Para preencher essa lacuna, apresentamos o RRS-10K, um benchmark para interpretação de imagens raras de sensoriamento remoto. O RRS-10K contém 10.738 imagens de sensoriamento remoto de cunho militar e questões correspondentes em múltiplos formatos...
arXiv cs.AI
·Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei
·
// relacionados
Leia também
Modelo
ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
Editorial
MiniMax H3: um modelo só para texto, imagem, vídeo e áudio — por um terço do preço
Modelo
sensenova/SenseNova-U1.5-8B-MoT-Preview
Blog