论文

共享潜结构使LLM后门检测与缓解统一

Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 中的后门攻击通常被视为孤立的触发响应失败,从而激发针对特定触发或行为的防御。我们证明这个观点是不完整的。在不同的后门行为中,我们确定了一个可以被检测、因果控制和抑制的共享潜在机制。在残差流激活上使用稀疏自动编码器(SAE),我们发现一小部分潜在特征在越狱、拒绝操纵、密码锁定、偏见诱导、情绪错误分类和国家条件的有害建议中始终被激活。这些功能概括了从 4B 到 32B 参数的 Qwen3、Gemma~3 和 Llama~3.1 模型,以及微调和权重编辑攻击。通过双向激活控制,我们证明这些特征是因果关系:抑制它们会降低攻击成功率,而放大它们会在干净的提示下诱发目标行为。我们进一步训练轻量级 SAE 特征分类器,将零样本推广到看不见的后门,并优于残差流和权重差异基线。最后,我们引入了概念消融微调(CAFT),它通过在训练期间消融共享的潜在子空间来抑制后门的形成。总之,我们的结果表明,许多后门依赖于可转移的潜在机制,从而实现统一的检测和缓解。

共享潜结构使LLM后门检测与缓解统一:论文配图
图 1:我们的框架概述。我们比较干净的 LLM 激活和后门 LLM 激活,并将它们分解为稀疏的 SAE 特征。在攻击和模型中,我们识别出与后门相关的共享特征。特征级干预因果性地控制激活和缓解,支持不同后门背后的共同潜在子空间。