论文

注意力流形:通过编辑学习的 B 样条曲面来引导或阻止语言模型

Attention Manifolds: Steering or Blocking Language Models by Editing Learned B-Spline Surfaces

模型架构Transformer

摘要

在标准 Transformer Attention 中,源词元向每个接收者发送相同的值向量。该查询确定 应给予多大注意力,但不确定 应提取什么。这项工作介绍了 注意力流形:学习了 2D B 样条曲面 $S_d(q_d, k_d)$,它根据查询键交互来调制每个值维度。每个表面都是初始化为零的张量积三次 B 样条,保留预训练的行为。应用于 LLaMA 3.2-1B-Instruct 和 3B-Instruct,注意力流形将 WikiText-2 验证困惑度降低了 2--2.5 个点,参数开销为 0.3\%。在 112 个不同的提示中,表面会更改 69\% (1B) 到 83\% (3B) 情况下的贪婪解码输出,其中对模糊和多义输入的影响最强(94--100\% 更改率)。这些表面提高了输出质量:纠正事实错误 (``CAP定理包含三个主要组成部分'' $\to$ ``无法同时保证全部三个性质'')、提高精度 (``无法同时知道某些性质'' $\to$ ``无法同时知道位置和动量'') 以及添加特异性(一般引用 $\to$ 是圣奥古斯丁引文,在两个尺度上一致)。学习的表面也可以机械编辑:反转层的系数会改变 9/10 提示(KL~0.010)的贪婪输出,为模型转向提供几何机制。将表面系数设置为 $-1$ 会创建“注意力墙”,阻止价值流过特定维度。在初步实验中,一层宽的墙将爆炸装置提示从具体指令重定向到一般教育内容,提出了一条通往安全导向的歧管成形的道路。