Compressão de Especialistas com Mutação de Forma: LorExperts e BTExperts

arXiv:2608.07814v1 Tipo de anúncio: novo Resumo: Modelos de linguagem do tipo Mixture-of-Experts (MoE) oferecem alta capacidade com baixo custo computacional por token, mas implantá-los de forma barata exige comprimir suas muitas matrizes de pesos dos especialistas. A poda de especialistas (por exemplo, REAP) e a fusão reduzem o custo, mas sacrificam a precisão e exigem retreinar o roteador; a decomposição delta de baixo posto dos especialistas (por exemplo, D^2-MoE) preserva todos os especialistas e o roteador, mas se degrada acentuadamente à medida que o número de especialistas cresce, porque um único componente compartilhado...

arXiv cs.LG ·Inesh Chakrabarti, Sourjya Roy, Bowen Bao, Thiago Crepaldi, Spandan Tiwari, Ashish Sirasao ·
compartilhar: