论文

偏离时回溯:减轻 LLM 推理中的双重曝光偏差 蒸馏

Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation

摘要

大语言模型(LLM)通过长思想链(CoT)在复杂推理任务中取得了显着的成功,但其巨大的计算开销阻碍了现实世界的部署。 LLM 推理 蒸馏 通过将推理能力从强大的教师模型转移到紧凑的学生模型来解决这个问题。然而,现有的 蒸馏 范式面临着一个根本性的困境。典型的 离策略 蒸馏 严格使用教师生成的黄金轨迹,由于训练分布和学生生成的推理上下文之间的不匹配而遭受暴露偏差,从而导致长 CoT 推理中的错误级联。为了解决这个问题,同策略 蒸馏 允许学生探索自己的轨迹,但我们证明它本质上引入了相互的反向暴露偏差:当以学生生成的次优上下文为条件时,教师模型也很难提供积极的指导。为了解决这种双重曝光偏差问题,我们提出了偏离时监控轨迹和回溯(MOTAB),这是一种新的 LLM 推理 蒸馏 管道。具体来说,MOTAB 根据自适应安全边界动态监控学生的 同策略 生成。当一代人偏离并超过这个阈值时,MOTAB 会回溯到最后的安全状态,并利用教师干预来纠正路线。这种方法本质上可以容忍较小的学生错误,以减轻暴露偏差,同时防止次优环境以避免反向暴露偏差。对 LIMO-v2 和 AceReason 数据集的大量实验表明,MOTAB 有效缓解了双重曝光偏差,在推理任务中平均性能提高了约 3%。