论文

decoder-only Transformer中绝对位置从何而来?

Where does Absolute Position come from in decoder-only Transformers?

模型评测模型行为与机制分析

摘要

经过 RoPE 训练的 Transformer 可以区分其注意力模式中的绝对位置,即使 RoPE 仅在内积中编码相对偏移量。我们将这种泄漏追溯到两个架构组件,因果掩码负责第一个组件:其每个查询的 softmax 分母取决于构造的绝对查询位置。剩余流提供第二个。在因果注意力下,$0$ 位置处的激活仅关注其自身,并通过在该位置嵌入词元作为一个封闭的动态系统运行;下游注意力通过接收器读取头读取该轨迹。这两个组件都出现在我们研究的所有三种架构中,在架构上具有特定的平衡:NTK 缩放抑制了残余流组件,滑动窗口注意力允许其随着深度累积,而标准 RoPE 位于两者之间。在前向传递之前替换​​ \texttt{BOS} 嵌入会在早期查询中删除 $40\%$ 的残余流组件。注意力接收器是标记锚定的稳定器,它在位置 $0$ 处传递标记的确定性指纹,当该标记是自动前置的 \texttt{BOS} 时,该指纹在输入中保持不变,否则会随之变化。

decoder-only Transformer中绝对位置从何而来?:论文配图
图 1:三种架构在因果(基线)和双向注意力下按查询位置 bin 计算的平均 Δ​R2\Delta R^{2}。查询位置箱中点绘制在对数刻度上。