论文
同策略 蒸馏 真的蒸馏吗?从吵闹的老师到自我完善
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
摘要
同策略 蒸馏 (OPD) 提供密集的 词元级 监督,作为具有可验证奖励 (RLVR) 的强化学习的稀疏结果级优势的替代方案。然而,教师对学生生成的轨迹进行评分,这些轨迹本质上是 离策略,因此其监督的可靠性以及学生进步的来源仍不清楚。我们定量分析了 OPD 训练期间教师的监督,发现存在大量噪音,其普遍程度随着教师规模的增加而增加。令人惊讶的是,学生政策对这种噪音不敏感,无论是否保留或取消噪音监督,都会收敛到可比较的表现。 OPD 会蒸馏吗?通过分析推动其收益的因素,我们发现学习集中于低对数概率标记,并且使用单个固定的负面优势与教师提供的表现相匹配。这表明 OPD 主要通过抑制低对数概率标记来发挥作用,这不需要老师。这些发现激发了 同策略 自适应(OPSA),这是一种利用熵自适应负优势的无监督方法。它将更强的学习信号分配给高熵位置,抑制尾部标记,并在头部标记之间均匀地重新分配概率质量。与基础 \texttt{Qwen3-1.7B} 相比,OPSA 在 AIME24 上将 Avg@32 提高了 35.41 点,相当于 263% 的相对增益,并且在所有三个基准测试中将 Pass@32 提高了一倍多。在 AIME24 上的 Avg@32 中,它的表现也比 OPD 高出 16.77 点。跨模型系列和任务的广泛实验和分析进一步证明了其有效性和普遍性。