Raciocinando com Memória: Uma Estrutura Adaptativa à Granularidade Temporal para Compreensão de Vídeos Longos Sem Treinamento
arXiv:2607.24794v1 Tipo de Anúncio: novo Resumo: Embora os Modelos de Linguagem de Grande Escala Multimodais (MLLMs) demonstrem generalização superior em tarefas fundamentais de vídeo, janelas de contexto restritas limitam sua compreensão de vídeos longos. Para acomodar essa restrição, os modelos normalmente recorrem à seleção de quadros-chave. No entanto, a amostragem uniforme ou a seleção estática guiada por consulta frequentemente ignora o contexto temporal crítico, falhando em se adaptar às diferentes granularidades temporais das consultas. Neste artigo, propomos o ReMem, ...
arXiv cs.AI
·Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin
·