论文

语言模型能够识别施加于其激活上的dropout与高斯噪声

Language models recognize dropout and Gaussian noise applied to their activations

模型评测模型行为与机制分析

摘要

我们提供的证据表明,语言模型可以检测、定位,并在一定程度上用语言表达应用于其激活的扰动之间的差异。更准确地说,我们要么(a)\emph{mask}激活,模拟\emph{dropout},或者(b)在目标句子中向它们添加\emph{高斯噪声}。然后我们提出一个多项选择题,例如“\emph{前面的句子中哪一个被扰动了?}”或“\emph{应用了两个扰动中的哪一个?}”。我们测试了 Llama、Olmo 和 Qwen 系列的模型,尺寸在 8B 到 32B 之间,所有这些模型都可以轻松检测和定位扰动,而且通常具有完美的精度。当在上下文中进行教学时,这些模型还可以学习区分丢失和高斯噪声。值得注意的是,InSPOwenb 在识别应用哪种扰动方面的 \emph{zero-shot} 准确性随着扰动强度的函数而提高,而且,如果翻转上下文标签,则准确性会降低,这表明正确标签的先验——甚至是模控制。由于 dropout 已被用作训练正则化技术,而在推理过程中有时会添加高斯噪声,因此我们讨论了与数据无关的“训练意识”信号的可能性以及对人工智能安全的影响。代码和数据分别位于 \href{https://github.com/saifh-github/llm-dropout-noise-recognition}{link 1} 和 \href{https://drive.google.com/file/d/1es-Sfw_AH9GficeXgeqpy87rocrZZ_PQ/view}{link 2}。