论文
SEAD:通过熵引导监督实现能力感知 同策略 蒸馏
SEAD: Competence-Aware On-Policy Distillation via Entropy-Guided Supervision
摘要
同策略 蒸馏(OPD)具有离线蒸馏和RL所没有的属性:教师监督质量取决于学生能力。不连贯的采样轨迹会产生嘈杂的梯度;已经掌握的词元会产生多余的词元。这在三个层面(词元、训练阶段和提示)造成了浪费,但现有方法进行统一监督。我们引入 SEAD,它使用熵作为在三个尺度上这种能力依赖性退化的统一探针:(1)师生联合熵将标记划分为接收定制分歧或零梯度(约跳过 50%)的区域; (2) 随着能力的增长,余弦时间表从正向 KL 退火到反向 KL; (3)以能力为门控的课程引入由易到难的提示。这些组件是共生必要的:词元选择需要连贯的采样轨迹(课程),退火需要单调改进(也是课程)。在 OLMo-3(7B 到 32B)上,SEAD 在六个数学基准中比普通 OPD 实现了 +4.8 的平均准确度,并通过消融确认了超加性相互作用。