Blog
LLMs & Texto
SPECTRA: Levando o Cache KV Além do Limiar de 2 Bits por Meio de Codificação por Transformada Espectral
arXiv:2608.07915v1 Tipo de Anúncio: novo Resumo: Os grandes modelos de linguagem (LLMs) leem cada vez mais entradas longas na era dos agentes, desde documentos e bases de código inteiras até conversas que se estendem por muitos turnos. A memória de inferência desses modelos passa então a ser dominada pelo cache de chave-valor (KV), que armazena as chaves e os valores de atenção de cada token que o modelo leu e gerou. Como o cache cresce com o comprimento do contexto e é relido por completo a cada token gerado, um contexto mais longo significa mais memória de GPU. Para reduzir iss...
arXiv cs.LG
·Jiamu Zhang, Liang Wu, Kelly Wan, Hanjie Chen, Liangjie Hong
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo