CODS: Seleção Iterativa de Dados por Resíduo de Bellman para Aprendizado por Reforço Offline Reutilizável

arXiv:2608.07719v1 Tipo de Anúncio: novo Resumo: O aprendizado por reforço offline treina políticas repetidamente a partir de um conjunto fixo de transições, o que torna os dados redundantes custosos ao longo de diferentes seeds e hiperparâmetros, enquanto a subamostragem ingênua pode remover transições raras necessárias para a atribuição de crédito de longo horizonte. Apresentamos o CODS, um seletor guiado por crítico que alterna entre ajustar um crítico compatível com o algoritmo e adquirir transições de alto resíduo antes de congelar um subconjunto reutilizável. Diferentemente do replay priorizado, ...

arXiv cs.LG ·Ibne Farabi Shihab, Sanjeda Akter, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb, Anuj Sharma ·
compartilhar: