GLIDE: Atenção Híbrida Guiada por Camada para Inferência Eficiente de LLM

arXiv:2607.24788v1 Tipo de anúncio: novo Resumo: À medida que os Large Language Models escalam para contextos cada vez mais longos, o overhead de I/O de memória e de computação do cache de Chave-Valor (KV) durante a decodificação surge como o principal gargalo de throughput. Para resolver isso, propomos o GLIDE, uma Atenção Híbrida Guiada por Camada que integra estrategicamente a atenção softmax de janela deslizante com a agregação recorrente linear. O GLIDE é motivado pela heterogeneidade entre camadas: as camadas iniciais exibem alta sensibilidade a ...

arXiv cs.AI ·Vimal William, Ravi Tandon, Jyotikrishna Dass ·
compartilhar: