LAVE: Planejamento Aprimorado por Evidência Visual Latente para Agentes de Uso de Ferramentas em Vídeo
arXiv:2608.07585v1 Tipo de Anúncio: novo Resumo: A compreensão de vídeos longos exige que os modelos adquiram e reutilizem de forma eficiente evidências visuais esparsas a partir de fluxos de vídeo longos e redundantes. Agentes recentes de uso de ferramentas em vídeo enfrentam esse desafio invocando iterativamente ferramentas visuais em diferentes escalas temporais, mas sua comunicação entre Ferramenta e Planejador geralmente depende de observações textuais. Essas interfaces baseadas apenas em texto fornecem resumos com perdas das computações das ferramentas, fazendo com que evidências visuais previamente computadas não...
arXiv cs.CV
·Zijian Wang, Junnan Zhu, Rongzhen Li, Xiao Liu, Guohui Xiang, Quan Lu, Lijia Liu, Yining Wang, Jiang Zhong, Kaiwen Wei
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo