论文
有效性校准推理 蒸馏
Validity-Calibrated Reasoning Distillation
摘要
推理 蒸馏 旨在将 大语言模型 的多步推理能力转移到更小、更高效的推理能力。虽然最近的方法已经显示出有希望的成果,但它们通常依赖于静态的师生层次结构并将 蒸馏 框架为轨迹模仿。这与推理结构不一致,其中中间步骤通常在局部未指定:全局正确性限制了最终答案,但不能唯一地确定每个中间步骤。我们提出了有效性校准推理 蒸馏,一个将推理 蒸馏 视为局部学习信号分配问题而不是路径对齐问题的框架。我们没有强制执行 词元级 模仿,而是比较学生和教师在相同前缀下提出的下一步操作,并使用它们的相对局部有效性来调节 蒸馏 更新的强度。这产生了一种动态的、依赖于上下文的监督机制,可以保留教师的结构指导,同时使更新强度适应局部推理质量。在数学推理、代码生成和指令跟踪基准方面,我们的方法始终优于强大的 蒸馏 基准。这些结果表明,有效的 LLM 推理 蒸馏 不是由严格的轨迹模拟控制,而是由学习信号的有原则的、局部校准的分配控制。