论文

LLM 取证:后门隐藏在哪里?使用稀疏自动编码器定位和控制触发机制

LLM Forensics: Where Do Backdoors Hide? Localizing and Controlling Trigger Mechanisms with Sparse Autoencoders

模型评测模型行为与机制分析

摘要

尽管 LLM 中的后门越来越受到关注,但它们的内部运作仍然受到严格审查。基于触发器的后门很容易在行为上定义,这是一种罕见的输入,可以使模型切换到选定的响应模式,但触发器及其响应之间的机制不太清楚。我们在受控的、无害的语言切换环境中研究这种机制,其中固定的触发序列使 1B 和 8B 语言模型继续用法语或德语进行英语提示。为此,我们跨层和 Transformer 组件训练稀疏自动编码器 (SAE),然后将触发的提示与翻译和预训练控件进行比较,以识别与触发相关的特征方向。我们展示了 SAE 功能如何将触发提示与近乎完美的 F1 控件分开,但检测触发器的功能不一定控制行为。在干预测试中,注意力和 MLP 特征通常会在触发提示时可靠地触发,使它们成为良好的检测器,但消除它们很少会抑制语言转换,而激活它们也很少会引发语言转换。相反,残余流特征可以在消融时抑制触发生成,并且某些选定的特征可以在没有触发的情况下诱导目标语言延续。简而言之,这些词元触发机制分解为不同的 SAE 特征方向,具有用于触发检测、残余流传播和后续语言跟踪的单独特征。这种角色级分解是最有可能转移到其他基于触发器的后门的部分,即使有效负载、层或电路位置不同。