论文
稀疏特征干预何时真正局部化:SAE安全控制的匹配评估
When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control
摘要
我们评估稀疏自编码器(SAE)特征何时能作为安全相关行为的局部化控制把手。这个问题困难在于:表面成功可能来自弱干预、错配基线、模型鲁棒性、或退化输出——自动化安全裁判把后者标为不安全,却不代表有意义的有害顺从。我们为运行时安全干预引入匹配的连贯性门控评估协议:各方法在匹配的目标效应点比较,主目标指标只在输出既被判不安全又连贯时计入有害顺从。把该协议应用于Gemma-2-9B-it的三个提示划分(Gemma Scope第20层残差SAE):SAE特征消融有一个狭窄的有用区间。SAE top800以更低总扰动与有竞争力的效 用达到中低目标效应;SAE top1600相对匹配的稠密拒绝方向基线损失效用;SAE top3200主要诱发连贯性坍缩。人工审计确认连贯性门控去除了“仅不安全”的伪影;特征诊断显示有用区间由一撮稳定的拒绝对齐特征驱动,其激活分离随秩迅速衰减。结果主张:基于SAE的安全干预应作为区间依赖的控制机制评估,而非默认均匀局部化。
