论文

Q-Delta:超越键值联想的状态演化

Q-Delta: Beyond Key-Value Associative State Evolution

摘要

线性注意力把序列建模重构为循环状态演化——实现高效线性时间推理。在键值联想范式下——既有方法把查询的角色局限于读出操作——使其与状态演化解耦。我们表明:查询条件化的状态读出会在累积记忆上诱导结构化的价值预测——补充基于键的检索。基于该洞见——我们提出Q-Delta——查询感知的delta规则——把混合键-查询预测误差整合进状态演化——实现联合纠正动力学——同时保持delta规则的效率。我们为所得动力学建立稳定性保证——并导出硬件高效的分块并行形式及自定义Triton实现。实证结果表明稳定的优化、有竞争力的吞吐——以及语言建模与长上下文检索任务上对强基线的一致改进。

Q-Delta:超越键值联想的状态演化:论文配图
图 3:Q-Delta 动力学的经验稳定性分析。 (a): βt​at\beta_{t}a_{t} 的分布,(b): ‖Δt​v‖\|\Delta_{t}v\|, ‖Δt​p‖\|\Delta_{t}p\|, ‖rt‖\|r_{t}\| 的散点图