论文
通过高斯内核注意的无投影 Transformer
Projection-Free Transformers via Gaussian Kernel Attention
摘要
Transformer 中的自注意力通常实现为 $\mathrm{softmax}(QK^\top/\sqrt{d})V$,其中 $Q=XW_Q$、$K=XW_K$ 和 $V=XW_V$ 是输入 $X$ 的学习线性投影。我们询问这些学习到的投影是否必要,或者是否可以用更简单的基于相似性的扩散算子代替。我们引入了 \textbf{Gaussian Kernel Attention} (GKA),它是点积注意力的直接替代品,它直接使用应用于每个头标记特征的高斯径向基函数 (RBF) 内核来计算标记亲和力。每个头仅学习带宽参数 $σ_h$,而单个输出投影 $W_O$ 保留与标准 Transformer 接口的兼容性。 GKA 可以解释为词元上的归一化内核回归,将现代 Transformer 架构与经典的非局部过滤和内核平滑方法联系起来。我们在视觉和语言建模设置中评估 GKA。对于 \texttt{nanochat} 框架内的自回归语言建模,我们通过屏蔽和重新规范化高斯核来实现因果屏蔽和滑动窗口约束。在深度 20 处,参数为 $0.42\times$ 且标准注意力基线的总训练 FLOP 为 $0.49\times$ 的 GKA 模型可以稳定地训练,表现出接近于零的训练验证差距,并在标准基准测试中表现出竞争行为,尽管在此计算规模下具有更高的每字节位数 (BPB)。总体而言,GKA 提供了一种最小的、可解释的注意力机制,具有明确的局部性尺度,为 Transformer 设计提供了准确性与效率权衡的维度。