LIRA: Roteamento Local de Informação Entre Camadas para Decodificação Visão-Linguagem-Ação

arXiv:2608.07596v1 Tipo de anúncio: novo Resumo: Modelos de Visão-Linguagem-Ação (VLA) transformam representações de modelos de visão-linguagem (VLMs) pré-treinados em ações de robôs, mas a interface que roteia as características intermediárias dos VLMs para os decodificadores de ação permanece pouco explorada. Os projetos existentes ou expõem apenas uma parte estreita da hierarquia de representação ou associam rigidamente cada bloco decodificador a uma camada do VLM, restringindo o acesso a evidências de tarefas complementares ao longo das profundidades. Nós apresentamos o LIRA, um lo...

arXiv cs.RO ·Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng ·
compartilhar: