论文
超越模仿:用于模型推理的反思式同策略自蒸馏
Beyond Imitation: Reflective On-Policy Self-Distillation for LLM Reasoning
摘要
同策略 self-蒸馏 (OPSD) 通过为 同策略 轨迹采样提供密集的 词元级 监督,提高了 大语言模型 (LLM) 的推理能力。然而,现有的 OPSD 方法在复杂推理任务上的收益通常有限,并且存在严重的训练不稳定问题。我们确定了两个关键原因:以完整的验证解决方案为条件的自学教师鼓励模仿完整的参考轨迹,而不是提取可转移的推理见解,而不加区别的全面响应 蒸馏 对已经有效的推理前缀施加了多余的监督。这些问题共同抑制了推理多样性并导致后期模式崩溃。我们提出了 Reflective 同策略 Self-蒸馏 (ROSD),它提炼出可转移的推理见解,而不是完整的参考轨迹。对于每个错误的轨迹采样,自我反思器将其与同一组中的正确轨迹采样进行对比,以得出纠正想法并识别包含第一个推理错误的句子。纠正思想为自学者提供了有针对性的指导,而诊断的错误边界允许ROSD掩盖有效前缀上的蒸馏损失,并仅从第一个错误句子开始应用词元级 蒸馏。跨多个推理基准和模型主干的实验表明,ROSD 始终优于标准 OPSD 和强化学习基线,更好地保留推理多样性、稳定训练并减轻后期模式崩溃。代码可在 https://github.com/ZiqiZhao1/ROSD 获取。