论文
LLM自我识别:转向与检索激活签名
LLM Self-Recognition: Steering and Retrieving Activation Signatures
摘要
可解释性方面的最新进展表明,大型语言模型 (LLM) 在生成的文本中隐式编码信号,从而能够对其输出进行自我识别。我们证明,即使在低熵场景下,这种能力也是可靠的,并且可以通过有针对性的干预来放大。通过在生成过程中使用随机稀疏向量控制内部残差流,我们创建了一个可检测的指纹,可以将给定文本归因于特定的 LLM。该信号可通过用作检测器的 LLM 的激活来恢复,在多个检测设置中实现超过 98% 的准确度,同时保持生成文本的质量。随着人工智能生成的内容激增,这种方法通过利用模型的自然表示结构进行归因而不是从外部嵌入信号,为传统检测器提供了一种实用的替代方案。我们的贡献包括:(i)在大语言模型中建立可靠的自我识别能力,(ii)一种简单的引导机制,可以在不降低质量的情况下进行多大语言模型识别,(iii)证明激活空间包含可利用的结构,用于编码信号而不会产生语义干扰。