论文

当教师误导学生:识别虚假信号的同策略蒸馏

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

摘要

基于策略的逆向迁移(OPD)通过监督学生采样轨迹中的密集标记级教师信号,使教师能力得以转移。最近的研究方法改进了这一过程,优先处理那些自信、有用或可学习的信号。然而,这些假设忽略了语言模型的一个基本失败模式:它们的标记级判断可能受到输入无关的语言先验、格式规范或刻板思维模板的影响,而不是任务相关的证据。我们称这种优化相关的但弱地基于输入的监督为误导性信号,在OPD中可能会产生大量梯度而贡献很少的任务改进方向。为了缓解这一问题,我们提出了SA-OPD(Spurious-Signal-Aware On-Policy Distillation),一种基于输入地面性和优化影响的逆向迁移框架。SA-OPD引入了一个轻量级的输入地面性代理,用于估计标记级逆向迁移信号是否真正依赖于输入。然后只过滤那些同时表现出低输入地面性和极端逆向迁移差异的词元,从而消除高影响的误导性更新,并实现精细的OPD优化。在大规模语言模型(LLM)和视觉-语言模型(VLM)设置上的广泛实验结果表明,SA-OPD始终优于传统的无监督方法和竞争性的选择性方法。这些结果确立了输入地面性作为OPD监督选择的关键维度,并提供了一个简单而有效的策略来缓解误导性更新。

当教师误导学生:识别虚假信号的在策略蒸馏:论文配图
图 1:OPD 中的杂散信号图示。面板 (a) 和 (b) 提供了一个具体示例:(a) 显示输入图像和问题,而 (b) 可视化沿相应学生推出的标记级师生分歧。一些标记在迅速删除后表现出几乎没有变化的师生分歧,这表明它们的密集监督是由通用实体搭配或先前模板驱动的,而不是由输入特定的视觉证据驱动的。图 (c) 提供了梯度解释:这种弱锚定信号会引起低 SNR OPD 更新,具有较大的先验驱动梯度分量,但与理想的任务改进方向的对齐较弱。