论文

重新思考 同策略 Self-蒸馏 中的特权信息

Rethinking Privileged Information in On-Policy Self-Distillation

模型评测模型行为与机制分析

摘要

同策略 self-蒸馏 (OPSD) 使用来自同一模型的 词元级 监督以特权参考信息为条件,训练学生自己的反应。我们调查 OPSD 的表现提升是否表明学生学习了参考文献中的信息,或者反映了基础模型中已有推理行为的恢复。我们使用 1.7B 到 8B 范围内的 Qwen3 模型对科学和数学数据集进行 OPSD 实验。我们的分析框架将参考引起的监督与教师在没有参考的情况下提供的监督分开,并衡量每个监督如何与学生预测的变化保持一致。正确的参考并不能在教师生成模式、模型大小和训练数据集之间提供一致的性能优势。学生可以在没有正确参考的情况下提高,并且另一个问题的解决方案可以在几个数学推理基准上优于正确的解决方案。学生的预测与基本模型的思维行为的一致性比与参考引起的监督的一致性更强,但从其他问题构建的控制在很大程度上再现了这两种一致性。此外,归因于正确参考的更强对准并不可靠地与来自参考的更大性能优势相一致。因此,仅凭成绩提升和分布一致性无法确定特权参考信息如何有助于学生在 OPSD 中的学习。