论文

LazyAttention:具有延迟位置编码的高效检索增强生成

LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

模型推理KV Cache

摘要

键值 (KV) 缓存通过重用生成词元的过去计算来加速 大语言模型 (LLM) 的推理。它的重要性在长上下文应用中变得更加重要,例如检索增强生成(RAG)和上下文学习(ICL)。然而,传统的KV缓存将位置信息直接嵌入到缓存中,限制了其可重用性。现有的解决方案要么限制对前缀的重用,要么需要昂贵的内存实现来进行位置重新编码。我们引入了 LazyAttention,这是一种新颖的注意力机制,它将延迟位置编码进行内核化,以实现零拷贝、位置无关的 KV 重用。通过动态调整注意力内核中的位置编码,LazyAttention 解决了物化瓶颈,允许单个物理 KV 副本在任意位置服务多个逻辑请求。利用专为预填充和解码而定制的注意力内核,我们的系统实现了显着的效率提升:在倾斜的文档分布下,与最先进的块注意力相比,它将首次标记时间(TTFT)减少了 1.37$\times$,并将推理吞吐量提高了 1.40$\times$,同时保持了相当的输出质量。