论文
奖励门控 同策略 蒸馏
Reward-Gated On-Policy Distillation
摘要
同策略 蒸馏 是将推理能力从强大的教师转移到较小的学生的强大方法:学生从自己的策略中采样轨迹,教师对学生实际访问的状态提供密集的 词元级 监督。然而,这种监督并不总是可靠的:教师可以将高可能性分配给看似合理但不正确的解决方案,或者将低可能性分配给遵循不同推理路径的学生解决方案。因此,无条件提炼教师可能会强化不良模式或消除有用的学生行为。为了解决这些限制,我们引入了 RG-OPD:奖励门控 同策略 蒸馏,它使用验证者反馈来决定何时应该信任教师 logits。 RG-OPD 连接了稀疏验证者奖励和密集教师 logits,保留了 词元级 监督,同时过滤了误导性的教师信号。在推理和编码基准测试中,RG-OPD 培养出更优秀的学生,其表现优于普通反向-KL 蒸馏 和最近的 TSD-KD 基准。在 1K 代长度下,RG-OPD 比反向 KL 提高了 2.9 个点,比 TSD-KD 提高了 4.9 个点;在长代设置中,它比未调整的学生提高了 8.2 个点。我们的代码可在 https://github.com/UoC-tail/RG-OPD 获取。