论文

稀疏特征干预何时真正局部化:SAE安全控制的匹配评估

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control

模型评测评测方法与指标

摘要

我们评估稀疏自编码器(SAE)特征何时能作为安全相关行为的局部化控制把手。这个问题困难在于:表面成功可能来自弱干预、错配基线、模型鲁棒性、或退化输出——自动化安全裁判把后者标为不安全,却不代表有意义的有害顺从。我们为运行时安全干预引入匹配的连贯性门控评估协议:各方法在匹配的目标效应点比较,主目标指标只在输出既被判不安全又连贯时计入有害顺从。把该协议应用于Gemma-2-9B-it的三个提示划分(Gemma Scope第20层残差SAE):SAE特征消融有一个狭窄的有用区间。SAE top800以更低总扰动与有竞争力的效 用达到中低目标效应;SAE top1600相对匹配的稠密拒绝方向基线损失效用;SAE top3200主要诱发连贯性坍缩。人工审计确认连贯性门控去除了“仅不安全”的伪影;特征诊断显示有用区间由一撮稳定的拒绝对齐特征驱动,其激活分离随秩迅速衰减。结果主张:基于SAE的安全干预应作为区间依赖的控制机制评估,而非默认均匀局部化。

稀疏特征干预何时真正局部化:SAE安全控制的匹配评估:论文配图
图 3:跨模型规模的匹配扰动范数摘要 (Gemma-2 2B/9B/27B)。 (A) 真实越狱率:SAE top1600 对比密集和随机 SAE 控制。 (B) 相干性保持:SAE 保持相干性,同时密集的塌陷随着其被推动而增加,在 27B 处越来越明显。 (C) SAE 相对于密集 β=0.15\beta=0.15 的相干性优势:在 2B 和 9B 处接近零,在 27B 处大且为正。清洁度从9B向上加强到27B; 2B处的小规模能力失效单独显示于表9中。