论文

KVDrive:用于长上下文 LLM 推理的整体多层 KV 缓存管理系统

KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference

模型推理KV Cache

摘要

由于键值 (KV) 缓存的大量内存需求,支持长上下文 LLM 具有挑战性。现有的卸载系统将完整的缓存存储在主机内存中,并在解码期间选择性地获取关键条目,但这种策略很快就达到了上限:在不降低准确性的情况下无法进一步推动稀疏性。因此,当上下文长度和批量大小增加时,KV 传输量急剧增加,成为解码延迟的主要来源。我们推出 KVDrive,这是一个涵盖 GPU 内存、主机 DRAM 和 SSD 的整体多层 KV 缓存管理系统。与之前通过算法改进追求更大稀疏性的工作不同,KVDrive 从系统角度解决了这个问题——联合编排缓存放置、管道调度和跨层协调,以在紧张的 GPU 预算下维持高吞吐量推理。 KVDrive 提升了三个基本功能:它使缓存管理适应注意力行为,以最大限度地重用并最大限度地减少冗余数据移动;它重组解码管道以重叠 I/O 和 CPU/GPU 计算限制阶段,消除异构资源之间的停顿;它协调跨内存层的数据移动,以解锁远远超出 GPU 和 DRAM 限制的可扩展长上下文推理。我们已经实现了 KVDrive 的全功能原型,并使用流行的 LLM 在长上下文基准上对其进行了评估。与最先进的工作相比,该系统的吞吐量提高了 1.74 倍,同时保持了准确性。