论文

潜意识学习是非语义蒸馏

Subliminal Learning is Non-Semantic Distillation

模型评测模型行为与机制分析

摘要

潜意识学习(SL)是一种现代语言模型表现出的意外泛化类型。它允许教师模型中的偏见或行为通过从看似无关或随机的合成数据中提炼来转移到学生模型。这在确保AI系统保持可预测性并安全训练方面提出了挑战,因为标准审计输入数据无法检测到隐藏的潜意识信号。在这里,我们研究了SL的一些开放问题,以了解其实现机制和驱动因素。首先,我们探讨了数据中的偏见是如何编码的。通过向教师模型和学生模型的权重中添加高斯噪声,潜意识转移的程度在Gemma(1.9倍)和Llama(1.3倍)中增加,表明非语义权重结构起着关键作用。我们还展示了可以通过引导向教师模型施加偏见来生成潜意识数据,除了之前的研究中使用的提示和微调。训练后激活的学生模型的分析显示,学生不仅继承了教师偏见的语义意义,而且也继承了用于应用它的方式:引导的学生模仿引导向量,而提示的学生则没有。此外,引导向量的梯度与教师的引导向量呈线性相关,为数据审计提供了希望。更广泛地说,在合成数据成为前沿训练管道中的核心部分时,能够看到隐藏在训练数据中的潜意识信号变得至关重要。

潜意识学习是非语义蒸馏:论文配图
图 1:我们提出的潜意识数据生成模型。当我们向模型询问随机数列表时,我们发现它会根据是否没有系统提示、猫头鹰的系统提示、狮子的系统提示等产生略有不同的响应。尽管与动物相关的系统提示应该对此类完成没有影响,但我们观察到了这一点。我们提出这样的假设:这种分布变化是由教师模型中的随机噪声介导的,而不是动物受试者和产生的数字之间的任何有意义的联系。这意味着系统提示和结果数据集之间不会保留语义结构。因此,使用类似的系统提示(老虎/狮子、猫头鹰/鹰)生成的数据不能保证彼此相似。通过这种方式,SL 可以被认为是从本身无意义的数据中提取出来的,但仍然向学生提供有关教师的信息,因为教师和学生共享相同的无意义的连接,从而导致分布转移。