论文

FG$^2$-GDN:通过双重细粒度控制增强长上下文门控 Delta 网络

FG$^2$-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control

模型架构Transformer

摘要

线性注意力机制已成为 Softmax 注意力的有前途的替代方案,在推理过程中提供线性时间复杂度。门控 DeltaNet (GDN) 和 Kimi Delta Attention (KDA) 等最新进展表明,与简单的加性更新相比,Delta 规则(一种在线梯度下降更新)能够实现卓越的联想召回。虽然 KDA 将粗略的头向衰减门细化为通道向衰减,但增量更新中的学习率 $β_t$ 仍然是标量,限制了模型针对特定维度的适应能力。我们引入了 FG$^2$-GDN,它将标量 $β_t$ 替换为通道向量,类似于从 SGD 到每坐标自适应优化器(例如 AdaGrad 和 Adam)的过渡。我们进一步提出FG$^2$-GDN+,它将键和值的缩放解耦,从而能够独立控制擦除强度和写入强度。合成和现实世界基准的实验表明,FG$^2$-GDN 及其变体比 GDN 和 KDA 提高了联想回忆和长上下文理解,并且计算效率相当。