V-Simba: Liberando o potencial arquitetural do RL no controle contínuo visual

arXiv:2608.07870v1 Tipo de anúncio: novo Resumo: Melhorar a eficiência amostral continua sendo um desafio central no aprendizado por reforço (RL), especialmente em cenários do mundo real como a robótica, onde a coleta de dados é custosa. Esse desafio é acentuado no RL visual, onde entradas de alta dimensionalidade frequentemente obscurecem os sinais de aprendizado. Enquanto trabalhos anteriores em RL visual se concentraram em soluções algorítmicas, como melhores modelos de dinâmica ou estratégias de exploração, avanços recentes no RL baseado em estados mostram que arquitetu...

arXiv cs.LG ·Donghu Kim, Youngdo Lee, Hojoon Lee, Johan Obando-Ceron, Byungkun Lee, Aaron Courville, Pablo Samuel Castro, Jaegul Choo, Clare Lyle ·
compartilhar: