论文
共享潜结构使LLM后门检测与缓解统一
Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs
摘要
大型语言模型 (LLM) 中的后门攻击通常被视为孤立的触发响应失败,从而激发针对特定触发或行为的防御。我们证明这个观点是不完整的。在不同的后门行为中,我们确定了一个可以被检测、因果控制和抑制的共享潜在机制。在残差流激活上使用稀疏自动编码器(SAE),我们发现一小部分潜在特征在越狱、拒绝操纵、密码锁定、偏见诱导、情绪错误分类和国家条件的有害建议中始终被激活。这些功能概括了从 4B 到 32B 参数的 Qwen3、Gemma~3 和 Llama~3.1 模型,以及微调和权重编辑攻击。通过双向激活控制,我们证明这些特征是因果关系:抑制它们会降低攻击成功率,而放大它们会在干净的提示下诱发目标行为。我们进一步训练轻量级 SAE 特征分类器,将零样本推广到看不见的后门,并优于残差流和权重差异基线。最后,我们引入了概念消融微调(CAFT),它通过在训练期间消融共享的潜在子空间来抑制后门的形成。总之,我们的结果表明,许多后门依赖于可转移的潜在机制,从而实现统一的检测和缓解。
