论文

MetaKV:用于约束 LLM 推理的自适应 KV 缓存压缩

MetaKV: Adaptive KV Cache Compression for Constrained LLM Inference

模型推理KV Cache

摘要

键值 (KV) 缓存压缩是减少 大语言模型 (LLM) 推理的内存开销的有效方法,特别是对于长上下文工作负载。然而,现有的压缩方法在准确性、推理延迟和峰值 KV 缓存利用率之间进行了不同的权衡,使得单个固定配置不适合跨越不同的提示和资源限制。我们引入了 MetaKV,这是一个自适应框架,它根据用户指定的延迟和峰值内存预算为每个输入提示选择 KV 缓存压缩配置。 MetaKV 使用轻量级预测模型来估计每个候选配置的端到端延迟、峰值内存和正确响应的概率,并选择最能满足延迟内存约束同时保持准确性的配置。我们在涵盖数学、科学、常识推理和阅读理解的四个数据集上评估了来自三种代表性 KV 缓存压缩方法(KVQuant、H$_2$O 和 RocketKV)的十种配置以及未压缩的 FP16 配置的 MetaKV。在各种延迟和峰值内存约束下,MetaKV 始终优于最佳静态配置,提高了约束成功率 (CSR),即在满足这两个约束的情况下正确回答的提示比例,平均提高约 0.07,最高可达 0.135。这些结果证明了根据单独的提示和延迟内存限制调整 KV 缓存压缩的好处。代码可在 https://github.com/MichaelWang0505/MetaKV.git 获取