论文
特权解决方案还是情境诱发的教师行为?剖析 同策略 自我 蒸馏
Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation
摘要
同策略 自蒸馏(OPSD)通常被解释为特权信息的传递:教师观察目标问题的经过验证的解决方案并监督学生的轨迹。然而,这种解释混淆了两种效应。参考解不仅揭示了当前实例的答案,而且还改变了教师提供 词元级 监督的上下文。我们使用 $\mathrm{OP}^{2}\mathrm{SD}$ (来自其他问题的 同策略 Self-蒸馏)研究特定于目标的特权的作用,它将配对参考替换为来自不同示例的问题和解决方案,同时保留学生展示、教师和 蒸馏 目标。在三个模型和三个数学基准中,$\mathrm{OP}^{2}\mathrm{SD}$ 比基本模型有所改进,与 OPSD 相比仍然具有竞争力。 $\mathrm{OP}^{2}\mathrm{SD}$ 的成功意味着 OPSD 的收益不一定来自于参考解的获取,教师的情境诱导行为是一个重要因素。