论文

Logo:词元级 动态局部全局注意力

LoGo: Token-Level Dynamic Local-Global Attention

模型架构Transformer

摘要

随着上下文长度的扩展,注意力逐渐成为 大语言模型 中的主要计算瓶颈。标准 Transformer 仍然强大,但计算效率低下,因为它们为每个词元分配相同的注意力预算,而不管其上下文需求如何。现有的局部-全局混合通过混合受限和全上下文注意力提供了更有效的替代方案,但它们通常跨层或头静态分配跨度。为了解决这些限制,我们提出了 LoGo,一种 词元级 动态局部全局注意力机制,它使用注意力跨度作为注意力预算分配的直接代理。每个Logo层都包含耦合的本地和全局分支:所有词元在受限的上下文窗口上接收有效的本地注意力,而学习门仅针对需要远程信息的词元激活全局注意力,并提供全上下文访问。基于阈值的预算控制器在没有辅助损失的情况下维持目标全局比率,并且渐进屏蔽计划在稀疏路由生效之前稳定训练。我们进一步实现查询稀疏 Triton 内核,将减少的全局注意力计算转化为实际的加速。大量实验验证了 LoGo 的有效性,表明它保留了全注意力 Transformer 跨模型大小的缩放行为。在受控比较中,LoGo 比全注意力 Transformer 和匹配预算静态局部全局混合模型有所改进,在远程检索方面有明显的进步。分析进一步表明,Logo 学习可解释的跨度分配模式。这些结果表明,学习的 词元级 跨度分配是改善长上下文性能计算权衡的有效且可扩展的方法。