LAVE: Planejamento Aprimorado por Evidência Visual Latente para Agentes de Uso de Ferramentas em Vídeo

arXiv:2608.07585v1 Tipo de Anúncio: novo Resumo: A compreensão de vídeos longos exige que os modelos adquiram e reutilizem de forma eficiente evidências visuais esparsas a partir de fluxos de vídeo longos e redundantes. Agentes recentes de uso de ferramentas em vídeo enfrentam esse desafio invocando iterativamente ferramentas visuais em diferentes escalas temporais, mas sua comunicação entre Ferramenta e Planejador geralmente depende de observações textuais. Essas interfaces baseadas apenas em texto fornecem resumos com perdas das computações das ferramentas, fazendo com que evidências visuais previamente computadas não...

arXiv cs.CV ·Zijian Wang, Junnan Zhu, Rongzhen Li, Xiao Liu, Guohui Xiang, Quan Lu, Lijia Liu, Yining Wang, Jiang Zhong, Kaiwen Wei ·
compartilhar: