TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
Turn-level budgeting strategy for efficient on-policy distillation in long-horizon agent training addresses inefficiencies in full-horizon rollouts and shallow token concentration.
Hugging Face · Daily Papers
·Yuhang Zhou, Kai Zheng
·
·▲ 12 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
- 12 upvotes da comunidade
- Temas: on-policy distillation, teacher-student framework, trajectory-level KL objectives, turn-level budgeting, adaptive rollout-depth budgeting, progressive turn-normalized loss budgeting
Resumo
Resumo original (em inglês), extraído do paper:
Turn-level budgeting strategy for efficient on-policy distillation in long-horizon agent training addresses inefficiencies in full-horizon rollouts and shallow token concentration.Onde ler
// relacionados
Leia também
Blog
O Thinking Machines Lab, de Mira Murati, apresenta os argumentos técnicos para uma IA centrada no ser humano e construída sobre pesos de modelo personalizáveis
Blog
Grupos terroristas estão usando todos os principais chatbots de IA para planejamento de ataques e desenvolvimento de armas
Blog
O modelo de mundo Orca, da China, se equipara a sistemas robóticos especializados sem nunca ter visto um único rótulo de ação
Blog