论文

更多特权信息是否更好?自蒸馏推理中从解题轨迹转向问题求解结构

Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

摘要

基于策略的自我蒸馏(OPSD)通过使用模型的特权视图,该视图基于参考解决方案来监督学生视图,该学生视图仅观察问题。然而,教师提供的令牌级目标可能依赖于在推理时间不可用的参考特定信息。我们提出Problem-Space-Guided OPSD(PS-OPSD),该方法将完整的解决方案替换为描述初始状态、目标条件、约束和选定状态转移路径的轨迹引导。学生的滚动和OPSD目标保持不变。在三个数学推理基准和模型规模从1.7B到8B的范围内,PS-OPSD在比较方法中以最高的总问题唯一准确性。进一步的控制实验进一步表明,指导的相关性以及路径的一致性对这些改进有贡献,强调了特权信息的表示作为OPS中的重要设计选择。

更多特权信息是否更好?自蒸馏推理中从解题轨迹转向问题求解结构:论文配图
图1:PS-OPSD 用明确、扎根于轨迹的问题空间引导,取代教师模型所见的完整解答上下文。OPSD 让特权教师以完整参考解为条件;PS-OPSD 则提取初始状态、目标条件、约束以及选定的状态转移路径,路径每步指定操作、前置条件、变换和结果状态。两种设定中,仅看到问题的学生模型生成在策略前缀,并接受相同的 token 级 OPSD 分布匹配目标。推理时,训练后的学生只看到问题,参考解、引导、教师和提取器均不参与。