A Sensibilidade do Roteador Sob Ajuste Fino Leve Identifica Especialistas Podáveis em Modelos Mixture-of-Experts

arXiv:2608.07890v1 Tipo de Anúncio: novo Resumo: Modelos Mixture-of-Experts (MoE) desacoplam o total de parâmetros do cálculo por token, mas a implantação ainda exige armazenar cada especialista. Teorias recentes mostram que podar os especialistas com as menores mudanças na norma do roteador durante o ajuste fino pode preservar a acurácia, mas isso pressupõe ajuste fino completo. Nós testamos se a adaptação leve consegue recuperar esse sinal. Fazemos um breve ajuste fino com um adaptador eficiente em parâmetros, classificamos os especialistas pela mudança $\ell_2$ induzida no roteador...

arXiv cs.LG ·Ali Janati, Kaoutar El Maghraoui, Xinyi Luo, Wenyuan Shen, Owen Zou, Yankai Mao ·
compartilhar: