论文

寻找证据:为自策略推理蒸馏发现决策支撑token

Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation

摘要

自策略蒸馏经密集token级监督迁移推理能力——但可迁移信号的性质仍不清楚。我们发现推理链包含两类需要不同发现机制的知识:决策(在哪里分支)——经学生不确定性浮现;证据(支撑决策的中间步骤)——藏在学生自信却错误的位置。现有方法只捕获决策——证据token中的实质知识未被迁移。我们提出DEAR(决策-证据感知推理蒸馏):先经学生熵识别决策——再经与决策锚点的隐藏态余弦相似度发现其支撑证据——并以师生散度增强以优先最大知识缺口。在数学与代码基准上的三个师生配置中——DEAR持续超越标准OPD——竞赛数学最高+2.5pp、代码生成最高+5.7pp。

寻找证据:为自策略推理蒸馏发现决策支撑token:论文配图
图 1:DEAR 概述。 ❶ 学生生成rollout;学生熵 ℋtS\mathcal{H}_{t}^{S} 和师生对数概率散度 δt\delta_{t} 都是按标记计算的。 ❷ 决策识别:前 pp% 的熵标记形成决策集𝒟\mathcal{D}。 ❸ 证据发现:非决策标记通过与决策的余弦相似度进行评分,并通过分歧来提升; top-qq% 形成证据集 ℰ\mathcal{E}。 ❹ 仅在 𝒮=𝒟∪ℰ\mathcal{S}=\mathcal{D}\cup\mathcal{E} 上计算 OPD 损失,以更新学生模型的策略。