论文

RunningTensor:将线性注意力推广到高阶循环状态

RunningTensor: Generalizing Linear Attention to Higher-Order Recurrent States

模型架构递归架构

摘要

线性注意力和状态空间模型提供线性时间序列建模,但它们的循环记忆仍然是二阶张量(矩阵),限制了状态中可以表示的交互的顺序。我们引入了 RunningTensor,它将内存概括为 $o$ 阶张量,由 1 级外积更新,并通过针对 $o-1$ 向量查询进行收缩来读取。订单$2$恢复线性注意力;我们研究顺序 $3$ 作为概念证明,保留循环和并行形式,同时在序列长度 $T$ 上保持线性,并将工作记忆容量从 $\mathcal{O}(W^2)$ 提高到 $\mathcal{O}(W^o)$。在综合多查询关联召回方面,RunningTensor 优于线性注意力和 SSM 基线。经过预训练后,它还提高了语言理解和非合成检索任务的性能,这表明高阶循环状态可以提供超出矩阵值状态的有用的额外记忆容量。