论文

重温 同策略 蒸馏:经验故障模式和简单修复

Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes

摘要

同策略 蒸馏 (OPD) 在 LLM 后训练 中的使用越来越多,因为它可以利用教师模型对学生的采样轨迹提供密集的监督。然而,标准实现通常会将分布匹配减少到采样词元对数比,这可能会使学习信号在长轨迹采样时变得脆弱,而其前缀偏离了教师的典型支持。我们从理论和实施的角度重新审视这个表述。理论上,词元级 OPD 相对于序列级反向 KL 最小化是有偏差的,但承认更严格的最坏情况方差界限;一项受控综合研究进一步表明,更强的未来奖励耦合会增加梯度方差并破坏训练的稳定性。根据经验,我们确定了采样词元 OPD 的三种失败模式:不平衡的 词元级 监督、教师对学生生成的前缀的指导不可靠以及词元生成器或特殊词元不匹配。这些发现激发了教师 top-K 本地支持匹配,这是一种截断的反向 KL 目标,用于比较教师和学生在每个前缀支持的词元集上的分布,以及 top-p 轨迹采样和特殊词元屏蔽。在跨越代理和推理设置的单任务推理和多任务基准测试中,该目标提高了优化稳定性,并比标准采样词元 OPD 基线提高了 19.8% 的性能增益,为更稳定的 同策略 蒸馏 提供了实用的方案。