论文
转向矢量的反向检测和控制
Inverted Detection and Control in Steering Vectors
摘要
引导向量 (SV) 广泛用于影响 大语言模型 输出中概念的表达(例如真实性)。支持 SV 的一个关键假设是它们对概念具有线性区分性:展示该概念的文本表示比那些不展示该概念的文本更符合 SV,从而激发沿着正或负 SV 方向的转变,以分别促进或抑制该概念。在这项工作中,我们发现了一种反向检测控制现象,其中一些与正向表征一致的高度辨别性 SV 可以持续促进相反的行为。我们将此类矢量称为反向转向矢量 (ISV)。我们提供了 ISV 效应的几何特征,发现沿着这些方向的转向系统地推动了有区别的下游头中的表示,就好像概念不存在一样,甚至在解码之前也是如此。受此分析的启发,我们提出了一种无需生成或相关响应评分即可区分 ISV 的方法。这使得有针对性的符号翻转成为可能,我们用它来通过推理时间干预(ITI)来改进基于检测的基础转向管道。我们的方法改善了 27/30 实验的结果,范围从 +0.9% 到 +138%。我们评估了 Gemma 3 12B、Qwen 2.5 14B 和 Olmo 3 7B 的 5 个概念的研究结果。