论文

潜意识学习作为特质方向漂移:SFT 下的机制和定向控制 蒸馏

Subliminal Learning as Trait-Direction Drift: A Mechanism and Targeted Control under SFT Distillation

模型训练监督微调与指令调优

摘要

除了预期功能之外,模型 蒸馏 还可以传递教师的隐藏特征。受到系统提示偏见的教师可以生成语义上干净的训练数据,例如数字序列,这仍然会导致下游学生继承隐藏的偏好,这种现象称为潜意识学习。先前的工作已经确定了该过程的几个部分。信号在训练过程中如何建立并产生行为转移仍不清楚,这使得有针对性的缓解变得困难。我们提出并验证了特质方向漂移作为潜意识学习的机制:有偏见的生成在教师数据中产生了可测量的偏好差距,而学生可识别的差距在监督 微调 期间引发了特质对齐更新,这些更新累积成行为迁移。在这种机制的指导下,我们提出了探测空间走廊正则化,这是一种有针对性的防御,可以在 蒸馏 期间限制沿着校准特征方向的漂移。该方法大大减少了隐藏特征转移,保持了任务性能:例如,它以较低的主任务准确度成本将恶意响应转移从 29.55% 降低到 6.45%,并持续抑制整个 Qwen 设置中的动物偏好转移。偏好差距、训练轨迹和干预证据将潜意识学习与特质方向漂移联系起来,并激励走廊正则化作为 蒸馏 期间的目标控制。