Blog
LLMs & Texto
Depth-Staggered Fibonacci Spacing for Sparse Attention: Static Schedules Beat Learned Dilation and Extrapolate Where Dense Attention Fails
arXiv:2606.28560v1 Announce Type: new Abstract: We study sparse self-attention in which each query attends to a dense local window plus a set of Fibonacci-spaced offsets, with a per-layer scalar alpha that compresses or expands the spacing. Across 21 language models trained under one matched recipe (60M parameters, 512 hidden, 16 layers, 426M tokens), we compare four ways of setting alpha across depth: fixed, per-layer learned, a static linear stagger, and a coprime (anti-gridding) reassignment ...
arXiv cs.CL
·Chad A. Capps
·
// relacionados
Leia também
Blog
As alegações mais escandalosas no processo da Apple contra a OpenAI por segredos comerciais
Blog
O que a mais recente descoberta em IA da Anthropic mostra — e o que não mostra
Blog
Novo guia de prompts da OpenAI diz aos usuários para parar de complicar e começar pelo resultado
Blog