论文

SteerCheck:激活引导审核中的归因特异性和对齐泄漏

SteerCheck: Attribution Specificity and Alignment Leakage in Activation-Steering Audits

模型评测评测方法与指标

摘要

激活引导可以改变行为,而无需确定效果是否特定于预期概念。我们引入了 SteerCheck,这是一种预先注册的归因审核,可匹配脱靶 KL 并分离均值、受保护尾部、极性、转移和语义声明。 960 个 Qwen3-14B 干预的精确重播揭示了常见控制的互补限制:各向同性方向占据狭窄的近正交区域,而符号随机化的相同结构方向通常保留大量目标对齐。效应与符号随机族中的符号余弦密切相关 ($ρ=.94$); $25.3\%$ 的抽奖超过余弦 $.5$,并且每次超过观察到的平均效果的抽奖都有高于 $.80$ 的余弦。这种比对泄漏本身并不会使条件随机化测试失效;它限制了比较器可以区分的内容,并促使报告可交换性假设、构造诊断 $A$ 和经验余弦分布。主要的 Qwen 完整门仍然为负,因为受保护的尾部使所有家族失败。在独立数据上,仅在 Qwen 中进行连续保证金转移,而在没有选定的单元格中进行准确性转移。前瞻性注册的语言控制通过了 Qwen 和 DeepSeek 中的完整门,而通过的 DeepSeek 排毒比较器则排除了分类分离;所有名义通行证都对$ Γ = 1.10 $敏感。冻结的三人开放生成评估支持 DeepSeek 中的事实纠正,但不支持 Qwen;自动判断失败校准(宏 F1 $.562$),因此 null 范围的语义结果仍然具有描述性。 SteerCheck 使这些条件和混合结论变得可审计。