论文

对长上下文服务的任务质量和系统性能的 KV 缓存优化进行基准测试

Benchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Serving

模型评测评测方法与指标

摘要

大语言模型 服务越来越受到长上下文工作负载下 KV 缓存增长的限制,但现有的 KV 缓存压缩技术很难比较,因为它们是在不同的模型、任务、预算和服务堆栈上进行评估的。本文提出了跨量化、修剪和合并的代表性 KV 缓存优化机制的工作负载感知基准,包括 KIVI、TurboQuant、SnapKV 和 CaM,并使用 Llama-3.1-8B-Instruct 和 Mistral-7B-Instruct-v0.3 在 LongBench 风格的多文档 QA、单文档 QA、少样本学习和摘要工作负载上进行评估。该基准测试衡量任务质量、平均输出吞吐量、平均首次词元时间以及跨上下文长度桶实现的压缩比。结果表明,压缩比本身并不能很好地预测端到端性能。 KIVI4 提供了跨模型最稳定的质量,SnapKV 提供了最强的长上下文吞吐量,CaM 在选定的 QA 工作负载上产生了巨大的收益,但在质量和实现的压缩比方面表现出了巨大的工作负载敏感性。这些发现促进了 KV 缓存机制的工作负载感知选择,而不是一刀切的压缩,并为长上下文服务系统提供了部署指导。