论文

H$^2$SD:混合后见之明自我 蒸馏

H$^2$SD: Hybrid Hindsight Self-Distillation

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 为语言模型推理提供了可靠的结果监督,但标量轨迹奖励提供了有限的 词元级 指导。现有的自我 蒸馏 方法添加了一位特权教师,但通常为其分配固定角色:直接分布匹配可能会破坏成功行为的稳定性,而仅幅度调制在失败后几乎无法提供纠正指导。我们观察到,成功和失败的轨迹需要不同形式的事后监督。成功的回答已经包含了学生生成的有效推理路径,因此可以作为特权上下文,而不是被外部理由取代。然而,失败的响应需要纠正参考信息。我们引入了 Hybrid Hindsight Self-蒸馏 ($\mathrm{H}^{2}\mathrm{SD}$),它联合调整教师上下文和更新策略以实现轨迹正确性。对于成功的轨迹,我们根据经过验证的响应和改写指令构建教师上下文,并仅使用教师来重新评估原始响应标记。由此产生的概率可以在不改变奖励确定的方向的情况下完善词元信用分配。对于失败的轨迹,经过验证的参考提示通过反向 KL 蒸馏 提供纠正指导。在具有挑战性的推理基准上进行的实验表明,H$^2$SD 在代表性 RLVR 和 self-蒸馏 基线中实现了最强的整体性能,具有稳定的优化和有利的准确性-效率权衡。