A Sensibilidade do Roteador Sob Ajuste Fino Leve Identifica Especialistas Podáveis em Modelos Mixture-of-Experts
arXiv:2608.07890v1 Tipo de Anúncio: novo Resumo: Modelos Mixture-of-Experts (MoE) desacoplam o total de parâmetros do cálculo por token, mas a implantação ainda exige armazenar cada especialista. Teorias recentes mostram que podar os especialistas com as menores mudanças na norma do roteador durante o ajuste fino pode preservar a acurácia, mas isso pressupõe ajuste fino completo. Nós testamos se a adaptação leve consegue recuperar esse sinal. Fazemos um breve ajuste fino com um adaptador eficiente em parâmetros, classificamos os especialistas pela mudança $\ell_2$ induzida no roteador...
arXiv cs.LG
·Ali Janati, Kaoutar El Maghraoui, Xinyi Luo, Wenyuan Shen, Owen Zou, Yankai Mao
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo