论文
Gated DeltaNet-2:解耦擦除与写入的线性注意力
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
摘要
线性注意力用固定大小的循环状态取代softmax注意力无界的缓存,将序列混合降至线性时间、将解码降至常数内存。难点不仅在于遗忘什么,更在于如何编辑这段压缩记忆而不打乱既有关联。Delta规则模型在写入新值前减去当前读取,而Kimi Delta Attention(KDA)通过逐通道衰减强化遗忘。但主动编辑仍然用单一标量门控同时控制两件不同的事:键侧要擦除多少旧内容,值侧要写入多少新内容。我们提出Gated DeltaNet-2,它继承自适应遗忘与逐通道衰减,同时解决二者的共同局限——擦除与写入之间的标量耦合,从而将Gated DeltaNet与KDA统一起来。Gated Delta Rule-2用逐通道擦除门b_t与逐通道写入门w_t分离这两种角色:当两个门退化为同一标量时还原为KDA,当衰减也随之退化时还原为Gated DeltaNet。我们推导了快速权重更新视角、将逐通道衰减吸收进非对称擦除因子的分块WY算法,以及保持高效并行训练的门控感知反向传播。在100B FineWeb-Edu词元上训练的1.3B参数规模下,Gated DeltaNet-2在语言建模、常识推理与检索任务上取得Mamba-2、Gated DeltaNet、KDA与Mamba-3变体中最强的整体结果。其优势在长上下文RULER大海捞针基准上最为显著,在所评估的多键检索设置中表现提升,并在纯循环与混合架构设置中均保持强势。代码已发布于 https://github.com/NVlabs/GatedDeltaNet-2。