论文

超越绝对模仿:特权的锚定残留指导 同策略 蒸馏

Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 通过将学生模型与教师对学生自身轨迹的预测分布进行调整,在增强 LLM 中的复杂推理方面展示了强大的经验收益。一种新兴的变体,特权 OPD,通过采用增强了特权信息(例如预言机痕迹)的自学模型,进一步强化了这种范式,以缩小师生能力差距,同时提供密集的、以答案为导向的监督。然而,当前的方法将特权信息视为整体模仿目标,无法将本地可达的推理步骤与未来条件的预言信号分开。因此,鼓励学生匹配往往不符合其本地预测支持的事后偏见分布。这种可达性不匹配会激励学生模型跳过有效的中间推理,转而采用本地不支持的快捷方式。为了解决这个问题,我们引入了 Anchored Residual 同策略 蒸馏 (AR-OPD),这是一个可以解开特权监督的双视图框架。 AR-OPD 没有强制执行严格的全视图模仿,而是使用部分特权的教师建立本地兼容的锚点,将预言机前视作为受控残差进行隔离和注入,以提供目的地导向的指导。在不同的推理任务中,AR-OPD 的性能优于完全特权 OPD 2.3 分,比 SFT 好 7.9 分。至关重要的是,这种锚定残差机制将事后泄漏减少了 21.7%,并减轻了后期漂移,在挑战超过 768 个词元的长期轨迹时产生高达 7.2 点的优势。