CODS: Seleção Iterativa de Dados por Resíduo de Bellman para Aprendizado por Reforço Offline Reutilizável
arXiv:2608.07719v1 Tipo de Anúncio: novo Resumo: O aprendizado por reforço offline treina políticas repetidamente a partir de um conjunto fixo de transições, o que torna os dados redundantes custosos ao longo de diferentes seeds e hiperparâmetros, enquanto a subamostragem ingênua pode remover transições raras necessárias para a atribuição de crédito de longo horizonte. Apresentamos o CODS, um seletor guiado por crítico que alterna entre ajustar um crítico compatível com o algoritmo e adquirir transições de alto resíduo antes de congelar um subconjunto reutilizável. Diferentemente do replay priorizado, ...
arXiv cs.LG
·Ibne Farabi Shihab, Sanjeda Akter, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb, Anuj Sharma
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo