论文
快手汇总关注技术报告
Kwai Summary Attention Technical Report
摘要
长上下文能力,已经成为下一代大语言模型最重要的迭代方向之一,特别是在语义理解/推理、代码代理智能和推荐系统方面。然而,标准的 softmax 注意力相对于序列长度表现出二次时间复杂度。随着序列长度的增加,这在长上下文设置中会产生大量开销,导致极长序列的训练和推理成本迅速恶化。现有的解决方案通过两种技术路线来缓解这个问题:i) 减少每层的 KV 缓存,例如从头级压缩 GQA 和嵌入维度级压缩 MLA,但 KV 缓存仍然以 1:1 的比例线性依赖于序列长度。 ii)与KV Cache友好架构交错,例如本地注意力SWA、线性内核GDN,但往往涉及KV Cache和长上下文建模有效性之间的权衡。除了这两种技术路线之外,我们认为还存在一条尚未充分探索的中间路径:{保持KV缓存和序列长度之间的线性关系,但通过特定比率$k$进行语义级压缩}。这个 $O(n/k)$ 路径并不追求“最小 KV 缓存”,而是以可接受的内存成本来换取完整的、可引用的和可解释的长距离依赖的保留。受此启发,我们提出了快手摘要注意力(KSA),这是一种新颖的注意力机制,通过将历史上下文压缩为可学习的摘要标记来降低序列建模成本。