论文
同策略 中结果混杂的地方监督 蒸馏
Outcome-Confounded Local Supervision in On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 根据学生自己的轨迹训练学生,而教师则在学生访问过的前缀处提供密集的 词元级 可能性。这些可能性通常是在本地解读的:一致的意见似乎可以安全地模仿,而不一致的意见似乎会识别出错误。我们表明,这两个读数都被完整轨迹的结果所混淆。我们引入了一种结果解决的诊断,它跨越了点状师生分歧与最终答案的正确性,分离了安全模仿、有效分歧、有害分歧和失败共识。在一项针对 Qwen3-8B 学生和 Qwen3-32B 教师的八种子数学推理研究中,失败协议占汇总响应词元质量的 67.84%;对于 Qwen2.5-7B/32B 对,它仍然是 67.68%。结果在阈值、序列级别、格式和截断审核中持续存在。即使根据 Qwen3 老师在所有四次独立尝试中解决的提示,学生的准确率仍升至 86.91%,但失败时的一致率仍为 14.76%。然后,我们运行三个匹配的训练探针,使用可用的信号来模仿、掩盖或对比整个轨迹;没有一个能够持续减少失败时的一致性。结果指出了本地化限制:局部分歧与轨迹级结果配对并不能识别失败轨迹在何处变得不可恢复。解决此限制需要额外的位置信息,例如流程标签、学生前缀的教师延续或跨采样轨迹的 词元级 对齐。因此,我们的贡献是诊断性的,而不是新的训练方法。