论文

结果导向的 在策略自蒸馏

Outcome-Guided On-Policy Self-Distillation

摘要

在策略自蒸馏 (OPSD) 比具有可验证奖励的强化学习 (RLVR) 提供更密集的token级监督和更好的计算效率。然而,这种更密集的监督可能会带来大量的噪音和训练的不稳定性。现有的改进通常依赖于高方差的 per-token统计数据,并引入额外的超参数和权衡。基于 RLVR 中的优势表述,我们从相同的角度分析 OPSD 目标,并结合结果正确性信号。我们发现普通 OPSD 对不正确的轨迹施加了不足的惩罚和过多的奖励,因为它应用固定的发散目标,而不管结果的正确性。此外,教师模型监督的可靠性与轨迹结果和沿执行轨迹的累积平均教师模型熵相关。基于这些观察,我们提出了结果引导的 在策略自蒸馏(OG-OPSD),它根据二元结果奖励和累积平均教师模型熵动态调整分歧目标和蒸馏位置。大量实验表明,OG-OPSD 在 1.7B、4B 和 8B 尺度的 Qwen3 模型以及 Qwen3-VL-2B 的数学推理、多模态推理和分布外任务中持续提高普通 OPSD 和多个强基线的性能。

结果导向的 在策略自蒸馏的原论文方法或结果图
(a) 以结果为导向的分歧选择