论文
MATCH:通过长上下文的上下文检索调节注意力 Transformer
MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers
摘要
传统注意力机制的二次计算成本对 大语言模型 (LLM) 的可扩展性和实际部署构成了主要瓶颈,特别是在长上下文场景中。为了提高效率,现有方法通常会强制执行严格的结构约束,例如局部注意窗口。然而,这些策略通常会导致需要精确远程回忆的任务的性能大幅下降。在这项工作中,我们提出了 MATCH,这是一个可扩展且高效的框架,它通过高效的检索系统动态集成上下文信息来增强稀疏注意力机制。实证结果表明,MATCH 显着提高了稀疏注意力模型在合成和现实世界自然语言任务上的性能。这些发现凸显了 MATCH 作为增强上下文检索能力的通用方法的多功能性,同时保持稀疏注意力架构的效率优势。