论文

注意力的路由和过滤结构

The Routing and Filtering Structure of Attention

模型架构Transformer

摘要

注意交互矩阵 $QK^{\top}$ 包含两个纠缠计算:一个倾斜对称组件,用于在位置之间重新分配信息(路由)和一个对称组件,用于缩放相互相关性(过滤)。我们在五个预训练的 Transformer 上分解 1776 个头,发现路由运行在低秩,远低于权重内核分配的路由容量。我们引入 $S$-$D$ 注意力作为一种诊断参数化,通过保证稳定性的构造($\mathrm{Re}(λ) \le 0$)将路由与过滤分开,并且无需层归一化即可稳定训练。当解开和非标准化时,路由自组织成频谱级联,第一层的有效等级为 2$,深度扩展为从 7M 到 355M 参数的六个尺度。级联预测注意力可以在哪里被简化:线性化 1.25 亿 $S$-$D$ 注意力的前七层会花费 ${<}5\%$ 困惑,而标准注意力在相同的干预下会崩溃。线性化区域随着深度而变宽。用 ELU+1 线性注意力替换前四层可以达到全头尺寸基线的 $1.4\%$ 以内。级联分配的架构用注意力参数换取困惑(注意力参数在 $+3.9\%$ 到 $+8.4\%$ PPL 上减少了 $47\%-65\%$)。路由过滤分解使频谱预算清晰可见;级联使其具有可操作性。