论文
潜意识引导:隐藏信号的更强编码
Subliminal Steering: Stronger Encoding of Hidden Signals
摘要
潜意识学习描述了一种学生语言模型,该模型继承了 微调 对由有偏见的教师模型生成的看似无害的数据的行为偏见。之前的工作已经开始描述这种现象的特征,但对于它可以传输的信号范围、解释它的机制以及偏差编码的精度留下了悬而未决的问题。我们通过引入潜意识引导来解决这些问题,潜意识引导是潜意识学习的一种变体,其中教师的偏见不是像之前的工作那样通过系统提示来实现,而是通过经过训练的引导向量来最大化一组目标样本的可能性。首先,我们表明,潜意识转向会传递复杂的多词偏差,而之前的工作主要集中在单词偏好上,展示了大范围的潜意识可传递信号。此外,这种迁移足够可靠,可以出现在以前认为不会表现出潜意识学习的环境中,包括普通 SGD(不仅仅是 Adam)、完整的 微调(不仅仅是 LoRA)以及 Llama 和 Phi 等模型。其次,我们提供了机械证据,表明潜意识学习不仅转移了目标行为偏差,而且还转移了引导向量本身,定位于教师被引导的层。最后,我们证明了偏差的编码精度如此之高,以至于在潜意识负载数据集上训练的新转向向量与原始向量获得了很高的余弦相似度。