论文
FishBack:Transformer 中的回拉 Fisher 几何形状可实现最佳激活转向
FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers
摘要
激活引导已成为一种无需更新参数即可修改语言模型行为的轻量级方法,但现有方法仍然很脆弱:跨层不稳定,并且容易出现与目标概念无关的干扰行为。我们将这些失败追溯到 CAA、ActAdd 和 ITI 等广泛使用的方法所共有的一个隐藏假设:中间激活空间是欧几里德空间。我们证明这个假设从根本上来说是有缺陷的。实际上控制隐藏状态扰动如何改变输出的度量是 softmax 层的 Fisher 信息度量,通过中间层的雅可比行列式拉回到中间层。由此我们得出一个封闭形式的转向方向,应用于中间层的隐藏状态,以最小的非目标失真达到目标概念变化。该框架在早期和中期的中间层中最为清晰,其中度量是强烈的非欧几里得,并且几何校正最重要。我们根据标准的反事实概念评估,根据三个动词形态概念对其进行评估:第三人称单数、进行时和过去时态变化。在 GPT-2 Small 上,这种非欧几里得几何学得到了经验证明,并且我们的方法相对于各个转向基线将偏离目标 KL 散度降低了 1.4--6.5 倍的中值因子。在 Llama-3-8B 和 Qwen3-8B 上,与早期和中间层的各个基线相比,它使脱靶 KL 降低了 1.8--3.6 倍的中位数。这些结果表明,几何校正在具有更复杂内部结构的较大模型上保留了其优势。