论文

激活差异揭示后门:SAE 架构的比较

Activation Differences Reveal Backdoors: A Comparison of SAE Architectures

模型评测安全与风险评测

摘要

对语言模型的后门攻击对人工智能安全构成了重大威胁,模型在大多数输入上表现正常,但在被特定模式触发时表现出有害行为。通过机械解释来检测此类后门仍然是一个开放的挑战。我们研究了两种稀疏自动编码器架构——交叉编码器和差分 SAE (Diff-SAE)——用于隔离微调模型中与后门相关的特征。使用由基于年份的上下文触发的受控 SQL 注入后门(“2024”触发易受攻击的代码,“2023”触发安全代码),我们在 SmolLM2-360M 上评估 LoR​​A 和全等级 微调 制度的两种方法。我们发现 Diff-SAE 在后门隔离方面始终明显优于 Crosscoder。 Diff-SAE 在大多数实验条件下实现了 0.40 的后门隔离评分 (BIS),具有完美的精度 (1.0) 和零误报率,而 Crosscoder 在大多数情况下几乎完全失败,BIS 低于 0.02。这种性能差距在多个 Transformer 层(14、18、22、26)和两个 微调 机制中都存在,全秩 微调 会产生特别干净的后门信号。我们的结果表明,后门表现为方向激活变化而不是稀疏特征激活,这使得基于差异的表示从根本上更有效地进行检测。这些发现对于人工智能安全监控和用于检测模型操纵的可解释性工具的开发具有重要意义。