论文
转向之前先看一下:几何形状预测 SAE 功能的转向能力
Look Before You Steer: Geometry Predicts SAE Feature Steerability
摘要
使用 SAE 功能进行转向需要按功能进行系数调整,目前需要进行干预扫描。我们询问 SAE 本身的属性(在任何前向传递之前可计算)是否可以预测哪些特征的引导成本较低或昂贵。我们表明,SAE 特征可操纵性的变化部分是由解码器空间几何预测的:邻居密度和与附近解码器方向的最大余弦相似度,两者都可以在任何干预之前从 SAE 权重矩阵计算,根据固定行为效果所需的转向程度对特征进行排名($\rho$ 高达 $-0.546$,$p < 10^{-6}$,跨条件的 AUROC 0.610-0.822;信号基于排名,一致具有网格离散性)。这种几何-可操纵性关系在两个 Gemma-2 模型尺度(2B 和 9B)、两个 SAE 宽度(16K 和 65K)上复制,并且可以在 Llama-3.1-8B-Instruct 上跨架构检测($\rho = -0.266$,$n = 300$)。在具有 BatchTopK SAE 的 Qwen3-8B 上,几何预测某个特征是否完全可操纵,但不能预测响应特征之间的连续排序,从而揭示与 SAE 训练机制相关的边界条件。在两个模型中,信号在深比例层深度处减弱,其中转向成本超出了我们的干预预算(一致的深度边界)。这些结果提供了初步证据,表明预转向几何形状可以部分影响系数选择,为在部署之前筛选特征的可控性提供了途径。