Blog
Robótica & RL
SPLC: Aprendizado de Preferências Sociais para Navegação de Robôs em Multidões
arXiv:2607.01925v1 Tipo de Anúncio: novo Resumo: O aprendizado por reforço (RL) offline tem um potencial significativo para a navegação de robôs em multidões em aplicações de coexistência entre humanos e robôs. No entanto, a complexidade inerente do movimento dos pedestres torna o projeto de funções de recompensa eficazes para promover comportamentos robóticos socialmente adequados um desafio persistente. Este artigo propõe um algoritmo de Aprendizado de Preferências Sociais para Navegação de Robôs em Multidões (SPLC) para eliminar a necessidade de um projeto detalhado de recompensas. I...
arXiv cs.RO
·Zixuan Chen (Wuhan University of Science,Technology, Wuhan, China), Hao Fu (Wuhan University of Science,Technology, Wuhan, China), Haiwen Hu (Wuhan University of Science,Technology, Wuhan, China), Shiquan Zheng (Wuhan University of Science,Technology, Wuhan, China)
·
// relacionados
Leia também
Editorial
RynnValue: o relógio do vídeo como recompensa para robôs
Blog
Anthropic aplica marca d'água a todas as saídas do Claude globalmente, com marcas que "podem persistir mesmo após alguma edição"
Blog
webAI lança TwIL-LM: uma família de modelos de lógica formal de 1,7B e 3B para autoformalização em hardware local
Blog