论文

C$^2$KV:压缩且可组合的 KV 缓存重用,实现高效 LLM 推理

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

模型推理KV Cache

摘要

长上下文推理是现代 大语言模型 (LLM) 应用程序的核心,例如检索增强生成和多文档推理。为了减轻不断增长的推理成本,最近的工作探索了键值 (KV) 缓存重用,以减少冗余的预填充计算。然而,现有的重用方法主要关注计算节省,而忽略了长上下文 LLM 服务中的一个关键瓶颈:存储和访问大型 KV 缓存的成本。虽然 KV 压缩似乎是一种自然的补充,但天真地将压缩与非前缀 KV 重用结合起来通常会导致严重的准确性下降。在这项工作中,我们提出了 C$^2$KV,一个用于非前缀 KV 重用的统一框架,可联合优化 KV 提取和推理时间串联。 C$^2$KV 学习一个可组合且压缩的 KV 缓存流形,该流形被明确设计为与位置无关。我们的方法引入了一个轻量级的 sidecar 提取器,具有可学习的压缩词元和结构化的注意力流,从而实现了可以灵活地重用和连接的模块化 KV 表示,而无需修改冻结的基础模型。我们进一步采用压缩串联协同训练策略,使提取时间表示与其下游重用行为保持一致。跨多个长上下文基准和模型系列的大量实验表明,C$^2$KV 显着降低了 KV 缓存存储和传输成本,在长上下文下实现高达 17$\times$ 的推理加速,同时保持生成质量。