论文

同策略 自助 蒸馏 无需任何监督

On-Policy Self-Distillation without Any Supervision

摘要

同策略(自)蒸馏(OPD / OPSD)已显示出后训练 大语言模型(LLM)的强大潜力。然而,现有的方法仍然严重依赖外部监督,包括真值信号、环境反馈或更大模型的指导,因此达不到真正的“自我”-蒸馏。在这项研究中,我们证明了 同策略 自 蒸馏 可以通过内部一致性仅使用模型自己的代来实现。我们提出无监督 同策略 自 蒸馏 (U-OPSD)。 U-OPSD 首先对多条采样轨迹进行采样,并在自我一致性阈值下通过多数投票构建伪解决方案。然后,它根据伪解来调节模型的分布,并根据不一致的完成情况进行自我提炼,从而使模型能够在确信错误的地方精确地进行自我纠正。在不同的基准、基础模型和训练设置中,U-OPSD 持续改进基础模型,并匹配或超越 真值 (GT) 的监督方法,例如 OPSD 和 GRPO。在 AIME24、AIME25、HMMT25、MATH500 和 AMC23 五个数学推理基准上,U-OPSD 在 4B 和 8B 尺度上在 Qwen3 非思维模式上比基础模型提高了 8.5% 和 10.7%,平均分别比 OPSD 提高了 3.2% 和 2.3%。在思维模式方面,U-OPSD与OPSD持平,在4B和8B水平上领先0.9%,并分别超过GRPO 0.7%和1.1%。代码可在 [https://github.com/williamium3000/u-opsd](https://github.com/williamium3000/u-opsd) 获取。