论文
稀疏自动编码器特征的引导网格:当顶部上下文标签命名激活机制而不是因果轴时
Steering grids for sparse-autoencoder features: when a top-context label names an activation regime rather than a causal axis
摘要
用于解释稀疏自动编码器 (SAE) 特征的标准协议从其顶部激活上下文中标记每个特征,并通过以典型量级引导该单个特征来验证标签。我们认为,这检查了较大转向网格的一个单元格,转向条件(单个特征,联合特征集,匹配的随机方向)与转向系数交叉,并表明其他单元格携带改变标签的信息。在 Qwen3-1.7B-Instruct 和 Gemma-2-2B-it 上,匹配几何控制扩展到 Llama-3.1-8B-Instruct:(1)标记为 AI 自我免责的特征从其顶部上下文切换到转向下的第二个表面形式,Qwen 上的沉思声音,Gemma 上的集体我们的声音,因此标签命名了激活机制,而不是因果轴;两个锚点功能将真正的模式开关与单调响应和故障分开。 (2) 三个可单独替换的近正交特征对于有依据的组合生成来说是共同必需的:联合抑制将不相关的控制任务折叠成占位符文本,而相同系数的单特征抑制则保持完整。 (3) 匹配几何随机方向控制显示崩溃是方向模式相关的,而不是幅度相关的:在相同的残差流失真下,特征方向会损害不相关的任务,而幅度匹配的随机方向则不会,所有三个模型(包括在其所应用的模型上训练的一个 SAE)具有不重叠的 95% 置信区间。