论文
潜意识学习是非语义蒸馏
Subliminal Learning is Non-Semantic Distillation
摘要
潜意识学习(SL)是一种现代语言模型表现出的意外泛化类型。它允许教师模型中的偏见或行为通过从看似无关或随机的合成数据中提炼来转移到学生模型。这在确保AI系统保持可预测性并安全训练方面提出了挑战,因为标准审计输入数据无法检测到隐藏的潜意识信号。在这里,我们研究了SL的一些开放问题,以了解其实现机制和驱动因素。首先,我们探讨了数据中的偏见是如何编码的。通过向教师模型和学生模型的权重中添加高斯噪声,潜意识转移的程度在Gemma(1.9倍)和Llama(1.3倍)中增加,表明非语义权重结构起着关键作用。我们还展示了可以通过引导向教师模型施加偏见来生成潜意识数据,除了之前的研究中使用的提示和微调。训练后激活的学生模型的分析显示,学生不仅继承了教师偏见的语义意义,而且也继承了用于应用它的方式:引导的学生模仿引导向量,而提示的学生则没有。此外,引导向量的梯度与教师的引导向量呈线性相关,为数据审计提供了希望。更广泛地说,在合成数据成为前沿训练管道中的核心部分时,能够看到隐藏在训练数据中的潜意识信号变得至关重要。
