SpecPrefetch: Pré-carregamento de Especialistas com Eficiência de Parâmetros para Modelos Fundacionais MoE Esparsos

arXiv:2607.24787v1 Tipo de Anúncio: novo Resumo: Os modelos esparsos de Mistura de Especialistas (MoE) ampliam a capacidade dos modelos fundacionais por meio da ativação condicional de especialistas, mas seus conjuntos completos de especialistas continuam difíceis de implantar sob memória de acelerador limitada. Embora o descarregamento de especialistas alivie a pressão sobre a memória ao transferir os especialistas inativos para a memória do host ou para o armazenamento, ele introduz um gargalo de transferência dependente do roteamento: os especialistas necessários só são conhecidos após o roteamento nativo top-\(K\), o que serializa o roteamento,...

arXiv cs.AI ·Jinwei Kong, Runqi Meng, Fanyi Wang, Wentao Qiu, Haotian Hu, Yongjian Zhou, Zhenhua Ge ·
compartilhar: