论文

SAE 干预措施不可靠:干预后抑制行为的恢复

SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior

模型评测安全与风险评测

摘要

稀疏自动编码器 (SAE) 将残余流激活分解为可解释的特征。最近的潜在空间防御越来越依赖于这些分解,假设已识别的“不安全”SAE 特征可作为监控和干预的可行手柄。在这种范式中,限制特定的有害特征有望可靠地防止模型的不当行为。然而,我们表明,这种成功可能隐藏了可恢复的故障模式:钳位可能会阻塞行为的一条可见路径,而不会消除行为本身。我们将此漏洞表述为干预后恢复,这是一个受限剩余空间优化问题。从干预后的残余状态开始,我们优化残余扰动以恢复干预前的行为,同时保留目标 SAE 特征的干预后值。即使在强威胁模型下,干预在整个优化和生成过程中保持活跃,恢复仍然是可能的。为了排除恢复简单地撤消干预的情况,我们对单层干预使用编码器正交更新,并在跨层设置中使用相应的特征图雅可比行列式。在 TPP、遗忘、IOI 和拒绝转向实验中,该压力测试揭示了尽管成功进行特征级干预,但仍可恢复的行为。特别是在安全关键的拒绝转向设置中,我们在有效样本上实现了 95.8% 的恢复率,同时将防御功能相对漂移保持在 0.131,大大低于基于后缀的基线。恢复路径归因分析进一步将这种恢复定位于 SAE 重建残差,即 SAE 无法解释的部分。这些结果暴露了特征级控制和行为完整性之间的差距:SAE 特征可以支持因果干预,但控制它们并不能保证对底层行为的控制。