论文

KVShareArena:跨上下文和模型检查点的 KV 缓存重用

KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints

模型评测基准与评测资源

摘要

LLM 服务系统已经重用了 KV 缓存,但前提是重用的文本位于提示的最开头。两个不断增长的工作负载打破了这种情况:检索增强生成服务器为每个查询组装一组不同的检索块,并且多代理协调器读取其他代理编写的报告。在新的提示中重用,缓存携带错误的位置并且从未关注其他源。缓存也可能由同一模型系列的不同检查点写入,这会更改存储的值。此类缓存的修复方法已经出现在三个不同的社区中,每个社区都根据自己的条件进行衡量,并且现有的基准测试仅测试精确的前缀重用,不会丢失任何内容。 KVShareArena 对检索块和代理报告上的提示上下文和模型检查点的 KV 缓存重用进行基准测试。它根据没有缓存和完全重新计算之间恢复的差距来对每种方法进行评分,并根据现有缓存对计算、内存和每个请求延迟进行收费,并报告单独构建缓存的一次性成本。我们发现,在一个问题同时需要多个来源之前,不需要重新计算的纠正位置就足够了。在那里,只有通过重新编码部分缓存或通过训练才能恢复一半到三分之二的差距的方法;未修复的缓存可能比没有缓存更糟糕。对单个提示无害的缓存压缩方法明显落后于新编写的代理报告的位置校正。这些模式适用于三个模型板。当不同的检查点写入缓存时,无需训练 方法几乎不受影响,而在一个检查点的缓存上训练的适配器会降低质量。利用、冻结查询集和成本核算作为 pip 包提供,具有自动提交工作流程和公共排行榜。