Treinando Sequências Longas Variáveis com Paralelismo Centrado em Dados

arXiv:2608.07524v1 Tipo de anúncio: novo Resumo: Treinar modelos de deep learning em sequências longas variáveis impõe desafios computacionais significativos. Os métodos existentes forçam uma difícil escolha entre eficiência e facilidade de uso. Abordagens simples usam configurações estáticas que causam desbalanceamento de carga de trabalho e baixa eficiência, enquanto métodos complexos introduzem complexidade significativa e mudanças de código para novos modelos. Para romper esse dilema, apresentamos o Paralelismo Centrado em Dados (DCP). Seu princípio central é ...

arXiv cs.AI ·Geng Zhang, Xuanlei Zhao, Kai Wang, Yang You ·
compartilhar: