Blog
LLMs & Texto
Compressão de Especialistas com Mutação de Forma: LorExperts e BTExperts
arXiv:2608.07814v1 Tipo de anúncio: novo Resumo: Modelos de linguagem do tipo Mixture-of-Experts (MoE) oferecem alta capacidade com baixo custo computacional por token, mas implantá-los de forma barata exige comprimir suas muitas matrizes de pesos dos especialistas. A poda de especialistas (por exemplo, REAP) e a fusão reduzem o custo, mas sacrificam a precisão e exigem retreinar o roteador; a decomposição delta de baixo posto dos especialistas (por exemplo, D^2-MoE) preserva todos os especialistas e o roteador, mas se degrada acentuadamente à medida que o número de especialistas cresce, porque um único componente compartilhado...
arXiv cs.LG
·Inesh Chakrabarti, Sourjya Roy, Bowen Bao, Thiago Crepaldi, Spandan Tiwari, Ashish Sirasao
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo