GWM-VLA: Modelagem Latente de Mundo com Consciência Geométrica para Aprendizado de Visão-Linguagem-Ação
arXiv:2608.07619v1 Tipo de anúncio: novo Resumo: Modelos de Visão-Linguagem-Ação (VLA) alcançam forte desempenho em manipulação robótica, mas frequentemente se degradam sob mudanças visuais e ambientais. A modelagem latente de mundo oferece uma abordagem promissora para melhorar a robustez, porém os métodos existentes costumam codificar as visões de câmera de forma independente e prever a dinâmica holística da cena sem modelar explicitamente suas relações geométricas. Propomos o GWM-VLA, um framework de modelagem latente de mundo com consciência geométrica para VLA ...
arXiv cs.RO
·Yanping Zhao, Hang Yu, Yiwei Wang, Chen Ye, Siyu Tian, Di Zhang, Qingjun Wang, Qian Chen, Junqiao Zhao, Chen Ye, Guang Chen
·
// relacionados
Leia também
Editorial
RynnValue: o relógio do vídeo como recompensa para robôs
Blog
Anthropic aplica marca d'água a todas as saídas do Claude globalmente, com marcas que "podem persistir mesmo após alguma edição"
Blog
webAI lança TwIL-LM: uma família de modelos de lógica formal de 1,7B e 3B para autoformalização em hardware local
Blog