Blog
Robótica & RL
AlphaZero em Jogos com Recompensas Esparsas: Limites e Supervisão Auxiliar
arXiv:2607.08984v1 Tipo de Anúncio: novo Resumo: O AlphaZero demonstrou que uma Busca em Árvore Monte Carlo guiada por rede neural pode alcançar desempenho sobre-humano, mas jogar bem não implica necessariamente jogar de forma perfeita. Estudamos essa lacuna em dois domínios avaliáveis por oráculo com estruturas contrastantes: Connect Four, um jogo partidário resolvido com valores exatos da teoria dos jogos, e Chomp, um jogo imparcial cujo jogo ótimo é regido pela estrutura do número de Grundy. Sob um pipeline unificado de auto-jogo $+$ MCTS, co...
arXiv cs.LG
·Brent Kong, Tejas Ram, Tony Yue Yu
·
// relacionados
Leia também
Blog
Flight attendants freaked out that Google is buying tons of Spirit employee data
Blog
Attackers are using AI to build exploits for industrial control systems, U.S. agencies warn
Blog
AI labs are failing to keep their own systems in check
Editorial