论文
寻找证据:为自策略推理蒸馏发现决策支撑token
Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation
摘要
自策略蒸馏经密集token级监督迁移推理能力——但可迁移信号的性质仍不清楚。我们发现推理链包含两类需要不同发现机制的知识:决策(在哪里分支)——经学生不确定性浮现;证据(支撑决策的中间步骤)——藏在学生自信却错误的位置。现有方法只捕获决策——证据token中的实质知识未被迁移。我们提出DEAR(决策-证据感知推理蒸馏):先经学生熵识别决策——再经与决策锚点的隐藏态余弦相似度发现其支撑证据——并以师生散度增强以优先最大知识缺口。在数学与代码基准上的三个师生配置中——DEAR持续超越标准OPD——竞赛数学最高+2.5pp、代码生成最高+5.7pp。
