论文

三元线性注意力:长上下文序列建模的三维循环状态

Triadic Linear Attention: Three-Dimensional Recurrent States for Long-Context Sequence Modeling

模型架构Transformer

摘要

循环神经网络 (RNN) 将历史上下文压缩为固定大小的内存状态,从而允许恒定时间推理。记忆状态大小是其性能的关键因素,线性注意力的强大性能和复兴就是例证,它将普通 RNN 的向量值隐藏状态扩展到矩阵值隐藏状态。至关重要的是,线性注意力以参数有效的方式实现这一点,特别是通过使用键和值向量的外积写入矩阵值隐藏状态。我们概括了这种结构并提出了三元线性注意力,它将一个键、第二个键和一个值的三元外积写入三阶(即 3D)张量状态,并通过用两个查询收缩两个关键轴来从中读取。因此,$E$ 维的第二个密钥会在仅添加两个投影的情况下使状态大小增加 $E$ 倍。三元线性注意力与数据相关的遗忘、增量规则和分块并行训练兼容。应用于门控 DeltaNet 和标量门控线性注意力时,三元线性注意力极大地改善了长上下文语言建模和召回,优于扩大状态的替代方案。