AdaKP: Seleção Adaptativa Online de Pontos de Conhecimento para Aprendizado por Reforço Orientado a Raciocínio

arXiv:2607.24833v1 Tipo de anúncio: novo Resumo: O aprendizado por reforço com recompensas verificáveis é um paradigma poderoso para induzir raciocínio em grandes modelos de linguagem, mas sofre com uma escassez severa de recompensas em problemas de matemática de nível competitivo. Uma solução comum injeta pontos de conhecimento (KPs) atômicos — dicas curtas em linguagem natural destiladas a partir de soluções de referência — no prompt. Os métodos existentes, no entanto, ou fixam essa seleção uma única vez de forma offline ou apenas escalam a quantidade monolítica de tex...

arXiv cs.AI ·Zibin Meng, Zhenyu Zhao, Chunqiang Run ·
compartilhar: