Raciocinando com Memória: Uma Estrutura Adaptativa à Granularidade Temporal para Compreensão de Vídeos Longos Sem Treinamento
arXiv:2607.24794v1 Tipo de Anúncio: novo Resumo: Embora os Modelos de Linguagem de Grande Escala Multimodais (MLLMs) demonstrem generalização superior em tarefas fundamentais de vídeo, janelas de contexto restritas limitam sua compreensão de vídeos longos. Para acomodar essa restrição, os modelos normalmente recorrem à seleção de quadros-chave. No entanto, a amostragem uniforme ou a seleção estática guiada por consulta frequentemente ignora o contexto temporal crítico, falhando em se adaptar às diferentes granularidades temporais das consultas. Neste artigo, propomos o ReMem, ...
arXiv cs.AI
·Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo