Blog
Robótica & RL
Entendendo e Mitigando a Lacuna de Generalização Vídeo-Ação por Meio da Razão Temporal
arXiv:2607.08127v1 Tipo de anúncio: novo Resumo: Modelos de fundação generativos de vídeo exibem fortes vieses composicionais, no entanto, os modelos mundo-ação (WAMs) e os modelos vídeo-ação (VAMs) frequentemente perdem esses vieses após o ajuste fino em dados de ação robótica. Chamamos essa discrepância de lacuna de generalização vídeo-ação. Neste artigo, investigamos sistematicamente essa lacuna avaliando um espaço de design abrangente de VAMs, demonstrando que escolhas de design padrão não produzem nenhum padrão de explicação emergente...
arXiv cs.CV
·Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao
·
// relacionados
Leia também
Blog
Flight attendants freaked out that Google is buying tons of Spirit employee data
Blog
Attackers are using AI to build exploits for industrial control systems, U.S. agencies warn
Blog
AI labs are failing to keep their own systems in check
Editorial