论文

分层内核 Transformer:采用信息论近似分析的多尺度注意力

Hierarchical Kernel Transformer: Multi-Scale Attention with an Information-Theoretic Approximation Analysis

模型架构Transformer

摘要

分层内核 Transformer (HKT) 是一种多尺度注意力机制,通过可训练的因果下采样处理 L 分辨率级别的序列,通过学习的凸权重组合特定级别的得分矩阵。总计算成本为标准注意力计算成本的 4/3 倍,L = 3 时达到 1.3125x。建立了四个理论结果。 (i) 分层得分矩阵在对称双线性形式的充分条件下定义了正半定核(命题 3.1)。 (ii) 非对称得分矩阵唯一地分解为控制相互注意力的对称部分和控制方向注意力的反对称部分; HKT 在不同尺度上提供 L 个独立的此类对,每个分辨率级别一个(命题 3.5-3.6)。 (iii) 近似误差分解为三个可解释的分量,具有显式的非高斯校正和 L 中的几何衰减界限(定理 4.3,命题 4.4)。 (iv) HKT 严格包含单头标准注意力和因果卷积(命题 3.4)。超过 3 个随机种子的实验显示,与重新训练的标准注意力基线相比,获得了一致的增益:合成 ListOps 上 +4.77pp(55.10+-0.29% vs 50.33+-0.12%,T = 512),顺序 CIFAR-10 上 +1.44pp(35.45+-0.09% vs 34.01+-0.19%,T = 1,024),IMDB 字符级情绪为 +7.47pp(70.19+-0.57% vs 62.72+-0.40%,T = 1,024),所有开销均为 1.31 倍。