LIRA: Roteamento Local de Informação Entre Camadas para Decodificação Visão-Linguagem-Ação
arXiv:2608.07596v1 Tipo de anúncio: novo Resumo: Modelos de Visão-Linguagem-Ação (VLA) transformam representações de modelos de visão-linguagem (VLMs) pré-treinados em ações de robôs, mas a interface que roteia as características intermediárias dos VLMs para os decodificadores de ação permanece pouco explorada. Os projetos existentes ou expõem apenas uma parte estreita da hierarquia de representação ou associam rigidamente cada bloco decodificador a uma camada do VLM, restringindo o acesso a evidências de tarefas complementares ao longo das profundidades. Nós apresentamos o LIRA, um lo...
arXiv cs.RO
·Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng
·
// relacionados
Leia também
Editorial
Muse Glimmer: a Meta volta ao código aberto com um agente de 30B que cabe numa GPU
Blog
NeuPAT: Ajuste de Alocação de Plasticidade Ciente de Neurônios para MLLMs que Preservam a Linguagem
Blog
Classificação Multimodal de Lesões de Pele com Swin Transformer e Fusão de Metadados Clínicos
Blog