论文
预处理 DeltaNet:线性递归的曲率感知序列建模
Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences
摘要
为了解决 softmax 注意力日益增长的长上下文计算限制,开发了几种次二次循环算子。这项工作包括 Mamba-2、DeltaNet、Gated DeltaNet (GDN) 和 Kimi Delta Attention (KDA) 等模型。随着重复空间的增长,出现了对它们进行分类的并行工作。一种引人注目的观点是测试时回归(TTR)框架,它将递归解释为执行在线最小二乘更新,学习从键到值的线性映射。现有的增量规则递归可以被视为该目标的一阶近似,但值得注意的是优化过程中忽略了最小二乘损失的曲率。在这项工作中,我们通过对这些循环引入预处理来解决这个问题。从在线最小二乘理论出发,我们在精确前提条件下推导了线性注意力和增量规则之间的等价关系。接下来,我们通过提出对角线近似来在实践中实现这一理论:这使我们能够引入 DeltaNet、GDN 和 KDA 的预处理变体以及用于计算它们的高效分块并行算法。根据经验,我们发现我们的预处理 delta 规则递归在 340M 和 1B 规模的综合召回基准和语言建模中产生了一致的性能改进。