论文
通过近期指导桥接 同策略 蒸馏 中的推理轨迹
Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance
摘要
同策略 蒸馏 (OPD) 通过在教师监督下根据从其自身策略采样的轨迹训练学生模型来改进 大语言模型 推理。尽管 OPD 在轨迹上运行,但其学习信号仍然是 词元级:它通过高损失标记识别偏差,并通过局部反向 KL 校正来修复偏差。我们表明,这种“轨迹采样但词元学习”机制无法可靠地将学生轨迹与教师轨迹联系起来。大约 30% 的高损失词元属于低发散状态,这表明许多词元是表面形式的不匹配,而不是真正的推理分叉。此外,即使是真正发散的词元也很难通过孤立的 词元级 监督来修复,因为推理失败通常会表现为短期分布漂移。我们提出轨迹感知 OPD(TOPD),它使用近期轨迹信息来识别真正的不同状态并在多个未来词元之间分配指导。实验表明,抑制非发散的高损失词元将标准 OPD 的平均准确率从 47.8% 提高到 48.2%,而 TOPD 进一步将性能提高到 52.2%,AIME24 的提升从 60.0% 到 63.3%,AIME25 的提升从 46.7% 到 53.3%。