论文
AOPSD:按学生能力调整数学推理自蒸馏指导
Learning from a Thoughtful Teacher: Adaptive On-Policy Self-Distillation for Mathematical Reasoning
摘要
按策略自我蒸馏 (OPSD) 通过教师提供的仅训练特权信息 (PI) 的象征性反馈来训练仅提问的学生。因此,OPSD 提供了密集的、on-policy监督,并且不需要更大的外部教师,但其有效性取决于 PI 的设计和使用方式。我们的初步诊断表明,教师效用和学生可学习性之间存在显着差距,其中一小部分高分歧标记主导了蒸馏信号,并且教师在这些位置上的短暂延续进一步暴露了比可转移校正线索更明确的 PI 泄漏,这表明注入 PI 条件捷径的强烈意图。我们提出自适应策略自蒸馏(AOPSD),它可以调整教师接收的信息及其反馈对学习的影响程度。 AOPSD 将每个解决方案编码为推理 DAG,根据学生的进化能力对问题进行排序,并仅显示可负担的子图及其下一个前沿作为 PI。对于高度分歧的标记,AOPSD 利用短暂的教师延续作为探针来鼓励有用的指导,同时减轻教师监督中 PI 条件的捷径。在 HMMT25、AIME24、AIME25 和 BRUMo25 上,AOPSD 达到了 72.5% Pass@8,比 OPSD 高出 6.7 个百分点,比最强竞争基线高出 4.2 个百分点,同时以更低的成本减少了 15 个百分点的训练时间。