论文

OSDN:通过线性注意力中可证明的在线预处理改进 Delta 规则

OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention

模型架构Transformer

摘要

线性注意力和状态空间模型提供了 Softmax 注意力的恒定记忆替代方案,但常常难以应对上下文中的联想回忆。 Delta 规则通过在线梯度下降的一步写入每个词元来缓解这一问题。然而,它的步长依赖于单个标量门,忽略了内部目标的特征曲率。我们提出了在线缩放 DeltaNet (OSDN),它通过超梯度反馈在线更新的对角预处理器来增强标量门。至关重要的是,这种右预处理在代数上相当于写入侧密钥的每个特征缩放。这种等价性允许 OSDN 严格保留 DeltaNet 的硬件友好的分块并行管道,而不会产生高维状态开销。理论上,通过利用内部回归损失的精确二次结构,我们建立了针对右牛顿比较器的超几何收敛,并证明了算法对齐的词元局部残差收缩界限。为了处理非平稳上下文,我们进一步引入自适应预处理器遗忘(APF)来动态刷新过时的校准。根据经验,OSDN 在各个尺度上都表现出了强大的性能。在 340M 参数规模上,OSDN 比 DeltaNet 将 JRT 式的上下文召回率提高了 32%。扩展到 1.3B 参数时,它实现了召回残差率降低了 39%,同时在一般下游任务(例如困惑度和 LongBench)上保持了同等水平,这表明我们的在线预处理机制可以在十亿参数规模上有效地传输和放大。