SPECTRA: Levando o Cache KV Além do Limiar de 2 Bits por Meio de Codificação por Transformada Espectral

arXiv:2608.07915v1 Tipo de Anúncio: novo Resumo: Os grandes modelos de linguagem (LLMs) leem cada vez mais entradas longas na era dos agentes, desde documentos e bases de código inteiras até conversas que se estendem por muitos turnos. A memória de inferência desses modelos passa então a ser dominada pelo cache de chave-valor (KV), que armazena as chaves e os valores de atenção de cada token que o modelo leu e gerou. Como o cache cresce com o comprimento do contexto e é relido por completo a cada token gerado, um contexto mais longo significa mais memória de GPU. Para reduzir iss...

arXiv cs.LG ·Jiamu Zhang, Liang Wu, Kelly Wan, Hanjie Chen, Liangjie Hong ·
compartilhar: