Ancoragem Supervisionada Adaptativa para Autodestilação On-Policy
arXiv:2608.07935v1 Tipo de anúncio: novo Resumo: A autodestilação on-policy (OPSD) adapta um modelo de linguagem destilando a orientação de um professor congelado sobre trajetórias amostradas a partir do aluno. Sua eficácia, no entanto, depende de forma crítica da qualidade dessas trajetórias. Mostramos que, quando os rollouts do aluno se desviam das trajetórias-alvo, condicionar o professor a prefixos fora do alvo enfraquece substancialmente sua supervisão relevante para a tarefa. Experimentos controlados de corrupção de prefixos expõem este ...
arXiv cs.LG
·Meilin Yang (Renmin University of China, Beijing, China), Zixuan Ding (Renmin University of China, Beijing, China), Jianhao Nie (Renmin University of China, Beijing, China), Weite Zhang (Renmin University of China, Beijing, China), Yuxin Zhang (Renmin University of China, Beijing, China), Zhiming Shao (Renmin University of China, Beijing, China), Li Yu (Renmin University of China, Beijing, China), Zhe Fu (Renmin University of China, Beijing, China)
·
// relacionados
Leia também
Editorial
RynnValue: o relógio do vídeo como recompensa para robôs
Blog
Anthropic aplica marca d'água a todas as saídas do Claude globalmente, com marcas que "podem persistir mesmo após alguma edição"
Blog
webAI lança TwIL-LM: uma família de modelos de lógica formal de 1,7B e 3B para autoformalização em hardware local
Blog