Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
Sparse Delta Memory extends gated linear RNNs with sparse addressing to dramatically increase hidden state capacity for improved long-context learning and retrieval while maintaini…
Hugging Face · Daily Papers
·Loïc Cabannes, Pierre-Emmanuel Mazaré
·
·▲ 10 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina
- 10 upvotes da comunidade
- Temas: linear attention models, softmax-attention, transformer architectures, gated linear RNNs, sparse addressing scheme, Gated DeltaNet
Resumo
Resumo original (em inglês), extraído do paper:
Sparse Delta Memory extends gated linear RNNs with sparse addressing to dramatically increase hidden state capacity for improved long-context learning and retrieval while maintaining computational efficiency.Onde ler
// relacionados
Leia também
Blog
As alegações mais escandalosas no processo da Apple contra a OpenAI por segredos comerciais
Blog
O que a mais recente descoberta em IA da Anthropic mostra — e o que não mostra
Blog
Novo guia de prompts da OpenAI diz aos usuários para parar de complicar e começar pelo resultado
Blog