论文

MDN:Delta 线性注意力的并行化逐步动​​量

MDN: Parallelizing Stepwise Momentum for Delta Linear Attention

摘要

线性注意力(LA)通过避免自注意力的二次复杂度,为将 大语言模型(LLM)扩展到长序列提供了一种有前途的范例。最近的 LA 模型(例如 Mamba2 和 GDN)将线性递推解释为封闭式在线随机梯度下降 (SGD),但朴素的 SGD 更新会遭受快速信息衰减和优化中的次优收敛。虽然基于动量的优化器提供了一种自然的补救措施,但它们在同时实现训练效率和有效性方面提出了挑战。为了解决这个问题,我们通过对更新系数进行几何重新排序,开发了一种具有逐步动量规则的 LA 块并行算法。此外,从动力系统的角度来看,我们将基于动量的递推分析为引入复共轭特征值的二阶系统。该分析指导稳定选通约束的设计。由此产生的模型 Momentum DeltaNet (MDN) 利用 Triton 内核实现与 Mamba2 和 KDA 等竞争性线性模型相当的训练吞吐量。对 400M 和 1.3B 参数模型进行的大量实验表明,在不同的下游评估基准中,与 Transformer、Mamba2 和 GDN 等强基线相比,性能得到了一致的改进。代码:https://github.com/HuuYuLong/MomentumDeltaNet。