论文
LastOPD:克服潜在的按策略蒸馏中的崩溃
LastOPD: Taming Collapse in Latent On-Policy Distillation
摘要
同策略蒸馏(OPD)会纠正学生所写的答案,但它的信号是老师的下一个词元分布:它告诉学生老师说什么,但错过了老师的想法。潜在监督通过将学生的潜在状态与教师的潜在状态对齐来弥补缺失的部分。最近的方法(例如 OPRD)将这一信号带入了同策略蒸馏中。然而,当将 Qwen3-4B 和 Qwen3-8B 蒸馏成 Qwen3-1.7B-Base 时,我们观察到该配方的两次失败。早期增益,晚期崩溃:仅潜在监督就可以在 10 个步骤中将 MATH-500 准确率从 25 提高到 46,但后续训练将性能降低到 11,并且没有恢复。更好的对齐,更差的行为:尽管对齐指标在整个崩溃过程中稳步提高,但最对齐的模型却表现最差。进一步的分析表明,潜在信号的应用方式不匹配:按深度配对的层在两个模型中扮演着不同的角色,因此持续对齐可能会将学生拉向其无法理解的教师状态。为了解决这个问题,我们提出了 LastOPD,它仅在最后一层状态(两个 LM 头读取的公共接口)应用潜在信号,并且仅在 10 步交叉淡入淡出到词元级 OPD 期间应用。这保留了潜在信号的有用部分,并在崩溃开始之前将学生交给词元级监督。大量实验表明,LastOPD 在 4B 和 8B 教师中将 MATH-500 比仅词元 OPD 提高了 5.55 和 4.02 分,领先于大多数保留的数据集,并以大约一半的步骤达到仅词元 OPD 的最终分数。代码可从此 https URL 获取。