论文

用于推理语言模型的自监督 同策略 蒸馏

Self-Supervised On-Policy Distillation for Reasoning Language Models

模型训练强化学习

摘要

GRPO 式 RLVR 根据每个提示的多次 同策略 尝试来训练推理模型,但通常仅通过终端奖励来使用这些尝试。我们表明,混合组包含更丰富的过程信号:正确的完成是当前策略如何解决问题的自生成见证,而错误的完成则在策略需要纠正的地方提供 同策略 前缀。我们引入 \emph{自监督 同策略 蒸馏} (SSOPD),它将以最短正确完成为条件的教师分布提炼为最长错误完成的前缀。这将组内正确与错误的对比转化为密集的过程监督,而无需外部解决方案跟踪。停止时间视图激发最短正确/最长错误规则作为有限组近似,以将持续失败编辑为快速成功的操作,并且提示级前沿权重将辅助损失集中在正确和错误分支共存的地方。在 AIME 2024、AIME 2025 和 HMMT 2025 中,SSOPD 在所有九个模型基准设置中均优于 GRPO。在 Qwen3-8B 上,它的宏观 Avg@12 达到 65.6,比 GRPO 好 1.6 个点,比溶液调节的 OPSD 基线好 0.8 个点。代码将在 https://github.com/tzq1999/SSOPD 发布。