Blog
LLMs & Texto
O risco da compressão de cache KV
arXiv:2607.01520v1 Tipo de anúncio: novo Resumo: A inferência de Transformers em sequências longas é cara porque a atenção softmax lê repetidamente de um grande cache KV. A abordagem predominante para esse gargalo é a compressão do cache KV, que substitui o cache completo por um resumo compacto. Apesar de sua importância prática, o projeto desses resumos é em grande parte guiado por experimentação empírica. No lado teórico, resultados existentes mostram que a compressão do cache KV pode ser impossível no pior...
arXiv cs.LG
·Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno, Sebastian Trimpe, Marco Pavone
·
// relacionados
Leia também
Editorial
Kimi K3: a China lança o maior modelo aberto do mundo — e ele não é o maior por acaso
Blog
Modelos de peso aberto agora igualam o desempenho cibernético de ponta de apenas quatro meses atrás por uma fração do custo
Blog
O novo manual de IA do Pentágono trata a adoção lenta como um risco maior do que o alinhamento imperfeito
Blog