SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

SPOT improves on-policy distillation by selectively probing uncertain positions and calibrating targets to downstream outcomes, boosting reasoning quality and coverage.

Hugging Face · Daily Papers ·Zikun Qu, Min Zhang · ·▲ 15 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu

  • 15 upvotes da comunidade
  • Temas: on-policy distillation, reverse-KL, teacher entropy, sparse probing, outcome-calibrated targets, acquisition-exploration-exploitation

Resumo

Resumo original (em inglês), extraído do paper:

SPOT improves on-policy distillation by selectively probing uncertain positions and calibrating targets to downstream outcomes, boosting reasoning quality and coverage.

Onde ler

compartilhar: