CoRe: Recompensas Combinadas com Feedback de Modelo de Visão-Linguagem para Aprendizado por Reforço Alinhado a Preferências
arXiv:2607.01721v1 Tipo de anúncio: novo Resumo: O design de recompensas continua sendo um desafio central no aprendizado por reforço (RL). Recompensas feitas manualmente costumam ser difíceis de especificar e podem levar a políticas subótimas, enquanto recompensas aprendidas a partir de preferências podem sofrer com ineficiência e treinamento instável. Inspirados pela natureza dual do aprendizado humano explorada na ciência cognitiva, nós decompomos as recompensas em dois componentes complementares: Recompensas Formais (FR), projetadas explicitamente com base no conhecimento da tarefa,...
arXiv cs.RO
·Hexian Ni, Tao Lu, Yinghao Cai
·
// relacionados
Leia também
Editorial
RynnValue: o relógio do vídeo como recompensa para robôs
Blog
Anthropic aplica marca d'água a todas as saídas do Claude globalmente, com marcas que "podem persistir mesmo após alguma edição"
Blog
webAI lança TwIL-LM: uma família de modelos de lógica formal de 1,7B e 3B para autoformalização em hardware local
Blog