论文
正确处理分层稀疏注意力:走向无限上下文建模
Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
摘要
将现代 大语言模型 (LLM) 扩展到长上下文受到二次计算成本和密集注意力的较差长度外推的限制。块式稀疏注意力提供了一种有前途的替代方案,但所有现有方法都由于块选择不准确而无法充分注意。我们提出了分层地标稀疏(HiLS)注意力,这是一种块式稀疏注意力机制,可以在语言建模(LM)损失下端到端地学习块选择。 HiLS 分层分解注意力:每个查询对每个检索到的块独立执行注意力,以提取特定于块的信息,并且根据块检索分数融合所得输出。通过将检索分数合并到前向注意力计算中,HiLS 直接使用 LM 损失对其进行优化,从而实现端到端检索学习和本机稀疏训练。实验结果表明,HiLS-Attention 的性能与域内上下文长度上的完全注意力相当,在某些情况下甚至更好。与此同时,HiLS-Attention 推断训练上下文长度超过 64 倍,检索准确率达到 90%,远远超出完全注意力。此外,现有的全注意力模型可以通过轻量级持续预训练转换为 HiLS-Attention,在保持域内性能的同时获得超长上下文外推。连同其稀疏的 KV 访问和计算,HiLS-Attention 打破了通常的效率与性能权衡,使得长上下文 LLM 在一般长上下文任务上比全注意力任务更高效、更有效。