HSMLA: Atenção Linear Multiescala com Softmax Hierárquico para Vision Transformers Eficientes

arXiv:2608.07616v1 Tipo de anúncio: novo Resumo: Os vision transformers enfrentam sobrecargas computacionais significativas na predição densa em alta resolução devido à complexidade quadrática da autoatenção. A atenção linear oferece eficiência, mas sacrifica a modelagem de contexto local. Propomos o \textbf{HSMLA (Atenção Linear Multiescala com Softmax Hierárquico)}, que combina atenção linear baseada em ReLU para contexto global, refinamento seletivo por softmax para características locais críticas e represen... de tokens multiescala

arXiv cs.CV ·Dong Liu, Yanxuan Yu, Renata Borovica-Gajic, Ying Nian Wu ·
compartilhar: