论文
恢复最佳点:LLM 推理的通过率加权自我 蒸馏
Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
摘要
Self-蒸馏 策略优化 (SDPO) 通过利用模型自身的反馈条件预测作为自教师,为 大语言模型 的强化学习提供密集的 词元级 学分分配。然而,与 GRPO 不同的是,GRPO 的群体相对优势自然地将学习集中在中等难度问题的最佳位置,而 SDPO 基于 KL 的优势缺乏隐含的难度意识概念。我们通过 GRPO 优势标准化的视角来分析这一差距。将可学习性框架扩展到标准化奖励,我们表明标准化吸收了方差项 $p(1-p)$,均衡了问题之间的前导可学习性,并将 $\sqrt{p(1-p)}$ 作为每个问题梯度中唯一的剩余比例因子。此分析得出一个简单的处方:通过 $[\hat{p}(1-\hat{p})]^{1/2}$ 对每个问题的 SDPO 损失进行加权,得到 SC-SDPO,这是 SDPO 的尺度一致变体。所提出的权重是作为 同策略 轨迹采样的零成本副产品和批量自适应归一化而获得的,从而引入了动态跟踪模型不断发展的能力的隐式课程。科学推理和工具使用基准的实验表明,SC-SDPO 持续优于 SDPO,在 Qwen3-8B 上获得 +3.2/+4.3 (mean@16/maj@16),在 OLMo-3-7B 上获得 +1.8/+3.0,同时在整个优化过程中保持稳定的训练动态。