Roteamento de informação através de fronteiras de lote: compensações entre memória e lote em bandidos de Lipschitz

arXiv:2608.07922v1 Tipo de anúncio: novo Resumo: O aprendizado adaptativo precisa tanto de um estado que preserve o que as observações implicam quanto de oportunidades para agir sobre esse estado. Estudamos essa compensação entre largura e profundidade em bandidos de Lipschitz estocásticos. Após cada puxada, o aprendiz retém no máximo $W$ bits de estado ativo dependente de recompensa e organiza suas puxadas em no máximo $B$ lotes comprometidos. Para $W\gtrsim_d\log(eT)$, caracterizamos o pseudo-arrependimento esperado minimax até fatores logarítmicos; os limites inferiores valem ...

arXiv cs.LG ·Zicheng Lyu, Zengfeng Huang ·
compartilhar: