论文

Kaczmarz 线性注意力

Kaczmarz Linear Attention

摘要

长上下文语言建模仍然是现代序列建模的核心,但 Transformer 注意力的二次成本使得计算扩展变得令人望而却步。线性循环模型通过将上下文压缩为固定大小的状态来解决这个瓶颈,使忘记、写入和编辑信息的规则成为中心设计问题。为了解决状态维护问题,门控 DeltaNet (GDN) 将门控状态衰减与 delta 规则残差写入相结合,使用可学习系数来平衡遗忘和更新幅度。然而,该系数是根据经验学习的,而不是从基本目标中得出的,这可能导致更新幅度不理想。我们重新审视 GDN 背后的在线回归目标,并受 Kaczmarz 投影方法的启发,推导出残差更新的关键范数归一化动态步长 $β_t = η_t / (\|k_t\|_2^2 + ε)$。我们提出了 Kaczmarz 线性注意力(KLA),一种 GDN 的单标量修改,保留了状态形状、门、线性递归和分块并行算法。在 1B-词元预算 的 0.4B 规模上,KLA 在评估的线性时间基线中实现了最低的验证困惑度,KLA 为8.09,GDN 为8.50,并且在高达 65K 词元的情况下保持稳定。在受控任务上,KLA 的大海捞针检索达到 100%,将多查询关联召回率提高 8 倍,比 GDN 提高 7.03 个百分点,并在 32K 上下文中提供 2.1 倍的解码吞吐量。这些结果表明,关键范数归一化 Kaczmarz 系数是 delta 规则序列模型的一阶设计轴:它在不改变循环状态或硬件内核的情况下提高了准确性、外推和解码效率。