论文
同策略自蒸馏中特权上下文引发的漂移
Privileged Context as Drift in On-Policy Self-Distillation
摘要
同策略自蒸馏 (OPSD) 训练语言模型以匹配以特权上下文为条件的自身副本。现有的工作改变了特权上下文包含的内容及其生成方式,同时还更改了模型、数据和训练设置,使得特权上下文设计的影响难以隔离。在持续学习以减少灾难性遗忘的努力的推动下,我们研究了特权上下文的选择如何影响策略漂移。具体来说,我们改变两个轴:内容(演示、反馈或改写)和来源(外部、由验证者自行生成或无需验证者自行生成)。我们在这九种组合和三个数据集上使用 OPSD 训练 Qwen2.5-7B,测量目标任务准确性、先前任务保留、从基础策略反向 KL 和参数更新几何。保持源固定,改变内容比保持内容固定和改变源的KL中值范围更宽。这些范围之间的比率对于每个 token KL 是 $5.1\times$,对于每个序列 KL 是 $2.2\times$。 参数更新几何显示相同的模式:来自共享内容的适配器的更新比来自共享源 ($0.255$) 的适配器的更新更紧密地对齐(平均余弦 $0.571$)。对于持续学习,这些发现表明应将特权上下文视为 OPSD 稳定性设计的一部分,因为它与策略移动的距离和方向相关。
