论文
MosaicKV:通过动态二维 KV 缓存压缩服务长上下文 LLM
MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression
摘要
长上下文 LLM 服务现在支持数十万到数百万个词元的提示,使键值 (KV) 缓存成为一阶服务成本。由于缓存随上下文长度线性增长,因此可能会耗尽 GPU 内存、强制使用较小的批次并降低服务吞吐量。现有的 KV 缓存压缩技术通常仅针对序列维度或仅针对通道维度,这在上下文窗口缩放时留下了有限的空间。压缩两个维度可以减少更多的内存,但是应用这两种形式的压缩会直接导致显着的准确性损失。本文介绍了 MosaicKV,一种用于超长上下文服务的动态二维(维度)KV 缓存压缩系统。 MosaicKV 使用动态二维压缩来解决准确性挑战,利用 KV 缓存内元素的非均匀重要性分布。 MosaicKV 不是全局应用一种压缩模式,而是识别每个 KV 向量的重要元素,并以 KV 缓存段的粒度选择压缩策略。为了解决性能挑战(细粒度稀疏性和压缩管理开销可以抵消压缩带来的收益),MosaicKV 引入了压缩 KV 缓存管理。该机制使用未充分利用的 GPU 和 CPU 资源来维护压缩的 KV 缓存并加速注意力计算。对具有多个 LLM 的 H800 GPU 的评估表明,MosaicKV 与未压缩基准相比,注意力加速速度提高了 16 倍,解码延迟降低了 4.8 倍,吞吐量提高了 7.3 倍。同时,它使内存使用量减少了 3 倍,并且在 LongBench 和 RULER 上仅造成 1.76% 的平均准确度损失。