论文
当上下文返回时:同策略 蒸馏 中的稳健内化
When Context Returns: Toward Robust Internalization in On-Policy Distillation
摘要
最近的工作表明,同策略 蒸馏 可以将特权上下文(例如系统提示或任务提示)内化到学生模型中,以便在推理时不再需要上下文。然而,我们发现了一个违反直觉且之前未研究过的现象:将原始的特权上下文重新引入给经过提炼的学生通常会降低其表现,即使在它已经在没有上下文的情况下正确解决的情况下也是如此。我们将这种现象称为情境诱发的退化,并认为强大的内化不仅需要匹配教师的情境条件行为,而且还需要在重新引入特权情境时保持稳定,这是我们称之为情境不变性的理想属性。为了促进这一特性,我们提出了一种新颖的视图鲁棒内化风险,并提出了无上下文锚定(NCA),这是一种轻量级但有效的一致性正则化器,它使用学生的停止梯度无上下文输出作为锚点,并通过前向 KL 散度来对齐其上下文条件输出。在跨越不同领域和模型系列的 14 种配置中,NCA 提高了大多数设置中的上下文条件准确性,并减少了 14 种设置中 12 种的上下文损害,同时保留或改进了无上下文性能,展示了对上下文重新引入的更强鲁棒性。