激活转向在推理时向残差流添加方向,提供无需微调的轻量行为控制。稀疏自编码器(SAE)把稠密激活分解为近似单语义的特征基底,使此类干预可审计。我们提出SAE-StatSteer,一个透明、免优化的管线:先经六项可靠性条件过滤特征,再以三个统计量——F检验、KSG互信息与Cohen's d——的无权重Borda共识对幸存者排序,最后以Cohen's d权重组合所选SAE解码器行。我们在四个行为域上评估三个Gemma家族模型,对比七个稠密或基于SAE的基线。质量条件化协议要求属性移动的同时保持相关性、丰富度与连贯性:原始成功率系统性高估可用控制——强烈偏移常损害生成质量;且有效转向不由通用层或强度决定。SAE-StatSteer与基于优化的方法保持竞争力,同时暴露每个选择与加权决定供审计。这些结果促使在原始行为偏移之外报告质量条件化成功率。代码与数据见https://github.com/Oshayer-Siddique/LLM-Steering-Using-SAE。
图 2:图 1 中展示的端到端管道的详细视图。第 1 阶段(SAE 特征提取):对于每个域,800800 个主题锚定的对比对通过冻结模型;所选层 ℓ\ell 处的后 MLP 残差激活由 JumpReLU SAE (DSAE=16,384D_{\mathrm{SAE}}{=}16{,}384) 编码,并通过令牌最大池化到稀疏特征矩阵中ZD(ℓ)εℝ1600×16384Z_{D}^{(\ell)}\in\mathbb{R}^{1600\times 16384},标签为 yDy_{D}。第2阶段(共识排序特征选择):每个特征都通过三个互补统计数据进行评分——FF-test、KSG互信息和Cohen’s dd——通过六条件可靠性门过滤,并通过未加权的两层Borda共识进行排序; top-K∈{16,24,32}K\in\{16,24,32\} 的特征是产量指数 𝐟\mathbf{f} 和权重 𝐝\mathbf{d}。第 3 阶段(转向 ++ 推理):单位特征空间方向 𝐯init=𝐝/∥𝐝∥\mathbf{v}_{\mathrm{init}}{=}\mathbf{d}/\lVert\mathbf{d}\rVert 被提升到残差流,如下所示δ𝐡=𝐯init⊤Wdec[𝐟,:]\delta\mathbf{h}{=}\mathbf{v}_{\mathrm{init}}^{\top}W_{\mathrm{dec}}[\mathbf{f},:] 并在最后一个令牌位置注入激活比例缩放, h:,−1,:(ℓ)←h:,−1,:(ℓ)+α∥h:,−1,:(ℓ)∥2δ𝐡^h^{(\ell)}_{:,-1,:}\leftarrow h^{(\ell)}_{:,-1,:}+\alpha\,\lVert h^{(\ell)}_{:,-1,:}\rVert_{2}\,\widehat{\delta\mathbf{h}},扫过α∈{0,0.1,0.2,0.3,0.5,0.7,1.0,1.5,2.0}\alpha\in\{0,0.1,0.2,0.3,0.5,0.7,1.0,1.5,2.0\} 相对于 α=0\alpha{=}0 基线。