论文

自蒸馏RLVR

Self-Distilled RLVR

模型训练强化学习

摘要

同策略 蒸馏 (OPD) 已成为 LLM 社区中流行的训练范例。该范式选择一个更大的模型作为教师,为每个采样轨迹提供密集、细粒度的信号,这与具有可验证奖励的强化学习(RLVR)形成鲜明对比,后者仅从环境中的可验证结果中获取稀疏信号。最近,社区探索了同策略 self-蒸馏(OPSD),其中相同的模型既充当教师又充当学生,教师接收参考答案等额外特权信息以实现自我进化。本文证明,仅来自特权教师的学习信号会导致严重的信息泄漏和不稳定的长期训练。因此,我们确定了 self-蒸馏 的最佳利基并提出 \textbf{RLSD} (\textbf{RL}VR 与 \textbf{S}elf-\textbf{D}istilation)。具体来说,我们利用 self-蒸馏 来获取 词元级 策略差异来确定细粒度的更新幅度,同时继续使用 RLVR 从环境反馈(例如响应正确性)中得出可靠的更新方向。这使得 RLSD 能够同时利用 RLVR 和 OPSD 的优势,实现更高的收敛上限和卓越的训练稳定性。