CoRe: Recompensas Combinadas com Feedback de Modelo de Visão-Linguagem para Aprendizado por Reforço Alinhado a Preferências
arXiv:2607.01721v1 Tipo de anúncio: novo Resumo: O design de recompensas continua sendo um desafio central no aprendizado por reforço (RL). Recompensas feitas manualmente costumam ser difíceis de especificar e podem levar a políticas subótimas, enquanto recompensas aprendidas a partir de preferências podem sofrer com ineficiência e treinamento instável. Inspirados pela natureza dual do aprendizado humano explorada na ciência cognitiva, nós decompomos as recompensas em dois componentes complementares: Recompensas Formais (FR), projetadas explicitamente com base no conhecimento da tarefa,...
arXiv cs.RO
·Hexian Ni, Tao Lu, Yinghao Cai
·
// relacionados
Leia também
Blog
A nova Organização Mundial de Cooperação em Inteligência Artificial da China é a jogada mais clara do presidente Xi até agora por uma ordem paralela de IA
Editorial
A Mistral entra em robótica apostando que uma câmera basta
Blog
Como Construir uma Bancada de Engenharia de Plasmídeos com Mapeamento Circular, Análise de Restrição, Géis Virtuais e Desenho de Primers
Blog