论文
Purified OPSD:不丢失思考方式的自策略自蒸馏
Purified OPSD: On-Policy Self-Distillation Without Losing How to Think
摘要
自策略自蒸馏(OPSD)已成为改进LLM推理的有前景范式——可访问参考解答的特权教师在学生自己生成的轨迹上提供token级监督。但我们发现OPSD在长思维链(long-CoT)推理模型上持续失败——至多产生边际增益同时破坏这些模型依赖的反思推理能力的稳定性。通过对教师监督信号的新颖分解,我们识别根本原因:教师的监督被参考诱导成分主导——该成分驱动对参考特定捷径的死记硬背——而问题条件化、推理可迁移的成分被忽略或被主动对抗。基于该诊断,我们提出两步解法。第一,我们构造仅参考教师(同一模型以参考为条件但无问题)以分离监督信号的不可迁移成分;减去该成分后的残差捕获问题条件化、推理可迁移的修正。第二,我们使用逐点互信息(PMI)作为机制——将该残差变换为良构的PMI目标分布供学生直接蒸馏——过滤参考诱导的捷径。在两个数据集上四个long-CoT模型的实验展示相对基座模型与标准OPSD的一致改进——同时在整个训练过程中保持模型的自然认知行为。