论文
Transformer 注意的位置无关预投影:Q/K/V 之前的非线性特征构造和内容跳过
Position-Agnostic Pre-Projection for Transformer Attention: Nonlinear Feature Construction and Content Skip Before Q/K/V
摘要
我们提出对 Transformer 注意力块的两个补充修改。首先,在层范数和 Q/K/V 投影之间插入非线性预投影 MLP,在应用任何位置编码之前以位置无关的方式构造更丰富的特征。其次,内容跳过连接围绕注意力机制路由预投影的特征,允许内容信息在有益的情况下绕过位置感知注意力。在 Pythia-160M 和 410M 上的冷冻探针实验中,组合方法在所有方法中取得了最强的结果:在 160M 规模下 +40.6% LAMBADA 准确度和 -39% 困惑度。学习到的跳过连接权重揭示了跨模型大小的一致模式:后面的 Transformer 层比前面的层更强烈地激活内容旁路,这表明更深的层受益于不通过位置注意的内容信息。所有修改都不会增加 K/V 缓存开销。