论文
在线蒸馏的增益与坍缩:强化学习视角
Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective
摘要
在线蒸馏(OPD)已成为语言模型后训练的重要方法。但尽管有性能增益,OPD也会坍缩为过长重复的生成,其分歧结果的机制仍不清楚。我们以强化学习视角解释这些结果:教师隐式奖励学生行为——即使是它自身很少表现的行为。该视角下实验显示OPD在不扩展学生能力的情况下改善性能:当隐奖励模型可靠时,OPD使正确响应更易采样;当偏好与质量错位时发生奖励黑客——隐奖励模型放大过长重复的学生rollout,尽管其自身很少生成这类文本。在此诊断指导下,我们发现训练中屏蔽不健康响应与使用SFT初始化都能有效缓解坍缩。合起来,这些发现表明OPD放大教师隐式反馈所偏好的学生行为,把焦点从教师生成得多好转向其评估学生rollout有多可靠。代码/项目页:https://github.com/HancCui/opd_hacking。