论文
当教师误导学生:识别虚假信号的同策略蒸馏
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
摘要
基于策略的逆向迁移(OPD)通过监督学生采样轨迹中的密集标记级教师信号,使教师能力得以转移。最近的研究方法改进了这一过程,优先处理那些自信、有用或可学习的信号。然而,这些假设忽略了语言模型的一个基本失败模式:它们的标记级判断可能受到输入无关的语言先验、格式规范或刻板思维模板的影响,而不是任务相关的证据。我们称这种优化相关的但弱地基于输入的监督为误导性信号,在OPD中可能会产生大量梯度而贡献很少的任务改进方向。为了缓解这一问题,我们提出了SA-OPD(Spurious-Signal-Aware On-Policy Distillation),一种基于输入地面性和优化影响的逆向迁移框架。SA-OPD引入了一个轻量级的输入地面性代理,用于估计标记级逆向迁移信号是否真正依赖于输入。然后只过滤那些同时表现出低输入地面性和极端逆向迁移差异的词元,从而消除高影响的误导性更新,并实现精细的OPD优化。在大规模语言模型(LLM)和视觉-语言模型(VLM)设置上的广泛实验结果表明,SA-OPD始终优于传统的无监督方法和竞争性的选择性方法。这些结果确立了输入地面性作为OPD监督选择的关键维度,并提供了一个简单而有效的策略来缓解误导性更新。
