论文
前缀教导,后缀淡出:从强到弱的局部可教导性崩溃 同策略 蒸馏
Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 使用更强教师的密集反馈自行训练学生模型。先前的文献表明,只要有教师反馈,监督响应标记的完整序列应该单调地提高表现。然而,我们证明这种假设有时在强到弱 OPD 设置中不成立。虽然生成轨迹的后续部分可能仍表现出非零的师生优势,但它们经常缺乏局部对比度,而局部对比度无法使密集反馈有效地优先考虑学生的学习。我们将这种故障模式称为局部可教性崩溃。由此产生的原则很简单:监督应集中在教师反馈仍然具有判别式的轨迹区域,而不是统一覆盖整个响应。我们通过特定于轨迹的发布规则来实施这一原则。该规则衡量教师相对于学生的 top-$K$ 候选集的余量,汇总 NLTK 标记化句子段的余量,并在检测到 BIC 式的向下变化点时截断密集的 OPD 监督。使用 Qwen3 模型系列进行从强到弱的 蒸馏 任务的实验结果表明,在不同学生规模的五个域内基准测试中,此发布规则始终优于标准全轨迹 OPD。此外,与基线 蒸馏 方法相比,我们的方法更好地保留了域外任务的模型能力。这些结果表明,有效的从强到弱的 OPD 不仅需要评估教师指导的可用性,还需要评估其在当地的效用,以确保生成的反馈仍然可教学。