Blog
LLMs & Texto
CommitKV: Compressão de cache KV consciente do ciclo de vida por meio de transições de commit para agentes multiturno
arXiv:2608.07855v1 Tipo de anúncio: novo Resumo: Agentes de Raciocínio-e-Ação (ReAct) multiturno acumulam trajetórias crescentes de raciocínio, chamadas de ferramentas e observações. Seus caches chave-valor (KV) crescem na mesma medida, aumentando o uso de memória e o custo de atenção durante a inferência do modelo. Os métodos existentes de compressão de cache KV reduzem esses custos descartando estados com baixas pontuações de atenção. No entanto, baixa atenção no turno atual não implica irrelevância futura, já que informações temporariamente inativas p...
arXiv cs.LG
·Weizhong Huang, Jinchao Zhang, Xiawu Zheng
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo