论文
从自己的错误中学习:为自我构建可学习的微反射轨迹蒸馏
Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation
摘要
Self-蒸馏 通过使用模型自己的采样轨迹作为训练信号来改进 大语言模型 中的推理,通常通过隐式 logits 级别对齐来最小化 KL 散度到特权目标分布。然而,由于这种监督是通过不受控制的采样生成的,因此它无法提供对模型特定错误的诊断洞察或对其各个故障模式的纠正指导。因此,模型学习模仿特权分布,而不是接受细粒度的修正来查明其推理失败的位置和原因。在本文中,我们提出了轨迹增强策略优化(TAPO),它将自蒸馏从隐式分布对齐推进到显式轨迹构建。在强化学习训练期间,模型对同一查询产生正确和错误的采样轨迹,TAPO 利用这种对比结构来构建简短反思修正,新的训练轨迹将模型的错误推理保留到失败点,然后插入自然语言诊断和由同一采样组的正确参考引导的校正推理。由于每个轨迹都锚定在学习器自己的前缀和解决方案中,因此与基于 KL 的方法强加的位置对齐相比,校正信号在更大程度上保留了模型的 同策略 分布。为了整合这些轨迹,TAPO 在模型的能力边界引入了困难感知候选选择,并引入了解耦优势估计以防止梯度污染。在 AIME 2024、AIME 2025 和 HMMT 2025 上的实验表明,在相同数量的训练步骤下,TAPO 相对于 GRPO 取得了一致的改进。进一步分析表明,TAPO 增强了首次推理和纠错有效性。