Blog
LLMs & Texto
Outliers espectrais revelam a estrutura aprendida dominante na atenção de Transformers
arXiv:2608.07921v1 Tipo de anúncio: novo Resumo: Aplicamos a teoria de matrizes aleatórias de Marchenko-Pastur (MP) a pesos de atenção pré-treinados a fim de separar cada matriz de projeção em um bulk de aparência aleatória e um conjunto de outliers espectrais. Validamos essa decomposição de forma causal: zerar os outliers identificados por MP (sinal) no Mistral-7B faz o desempenho no HellaSwag, MMLU e PIQA cair para próximo do acaso, enquanto zerar um subconjunto de valores singulares do bulk com contagem equivalente causa uma de...
arXiv cs.LG
·Kasun Dewage, Marianna Pensky, Suranadi De Silva, T. H. Bandara
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo