论文

用于上下文密集型任务的 KV 缓存卸载

KV Cache Offloading for Context-Intensive Tasks

模型推理KV Cache

摘要

随着各种应用程序对长上下文 LLM 的需求不断增长,键值 (KV) 缓存已成为延迟和内存使用的关键瓶颈。最近,KV 缓存卸载已成为一种有前途的方法,可以在保持准确性的同时减少内存占用和推理延迟。之前的评估主要集中在不需要从上下文中提取大量信息的任务。在这项工作中,我们研究了上下文密集型任务的 KV 缓存卸载:解决方案需要从输入提示中查找大量信息的问题。我们创建并发布了 Text2JSON 基准测试,这是一项高度上下文密集的任务,需要从原始文本中提取结构化知识。我们评估了 Text2JSON 和其他上下文密集型任务上的现代 KV 卸载,发现 Llama 3 和 Qwen 3 模型的性能显着下降。我们的分析确定了准确性差的两个关键原因:键的低秩投影和不可靠的地标,并提出了一种更简单的替代策略,可以显着提高多个 LLM 系列和基准的准确性。这些发现强调需要对长上下文压缩技术进行全面而严格的评估。