论文

特权似然并非自动等于价值:在线策略自蒸馏中token信用分配的三项检验

Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

模型评测模型行为与机制分析

摘要

在线策略自蒸馏旨在通过提供源自特权信息(如参考解答或 critic 反馈)的 token 级分数来改进可验证奖励强化学习(RLVR)。这些分数被当作 token 级动作价值的估计,但它们回答的是一个根本不同的问题:当输入上下文被丰富时模型的预测如何变化,而非当一个 token 被改变时期望结果如何变化。我们从三个维度检验这一鸿沟:(i) token 级分数是否追踪任务成功;(ii) 由同一 rollout 生成的反馈是否使分数反映与其自身描述的一致性,以及使用组内其他 rollout 的反馈能否缓解这种自指效应;(iii) 由此得到的训练目标实际强化了什么行为。在 AIME 2025 上的实验中,所实现的分数区分正确与错误 rollout 的水平接近随机(AUC=0.505);使用来自不同 rollout 的反馈并不能持续改善这种判别力;所有训练配置仅达到 24.2-33.9% 的 Avg@4,而仅用结果的 GRPO 为 64.2%。此外,最高熵的 token 十分位占总绝对 token 优势质量的 57-71%,尽管该分数在此区间对推理质量最不具信息量。相比之下,在 SciKnowEval Biology 上的类似实验将留出 Avg@8 提升 28.0%,其对应的轨迹分数 AUC 达到 0.81-0.92。这些结果共同表明,当蒸馏所用的基于似然的分数经实证验证为与结果相关的信用的有效代理时,密集信用分配可以奏效;当这种对齐不成立时,由此得到的监督可能无法泛化,并可能大幅逊色于基于结果的 RL。