GWM-VLA: Modelagem Latente de Mundo com Consciência Geométrica para Aprendizado de Visão-Linguagem-Ação

arXiv:2608.07619v1 Tipo de anúncio: novo Resumo: Modelos de Visão-Linguagem-Ação (VLA) alcançam forte desempenho em manipulação robótica, mas frequentemente se degradam sob mudanças visuais e ambientais. A modelagem latente de mundo oferece uma abordagem promissora para melhorar a robustez, porém os métodos existentes costumam codificar as visões de câmera de forma independente e prever a dinâmica holística da cena sem modelar explicitamente suas relações geométricas. Propomos o GWM-VLA, um framework de modelagem latente de mundo com consciência geométrica para VLA ...

arXiv cs.RO ·Yanping Zhao, Hang Yu, Yiwei Wang, Chen Ye, Siyu Tian, Di Zhang, Qingjun Wang, Qian Chen, Junqiao Zhao, Chen Ye, Guang Chen ·
compartilhar: