GLIDE: Atenção Híbrida Guiada por Camada para Inferência Eficiente de LLM
arXiv:2607.24788v1 Tipo de anúncio: novo Resumo: À medida que os Large Language Models escalam para contextos cada vez mais longos, o overhead de I/O de memória e de computação do cache de Chave-Valor (KV) durante a decodificação surge como o principal gargalo de throughput. Para resolver isso, propomos o GLIDE, uma Atenção Híbrida Guiada por Camada que integra estrategicamente a atenção softmax de janela deslizante com a agregação recorrente linear. O GLIDE é motivado pela heterogeneidade entre camadas: as camadas iniciais exibem alta sensibilidade a ...
arXiv cs.AI
·Vimal William, Ravi Tandon, Jyotikrishna Dass
·