论文
能买你的KV缓存吗?
Can I Buy Your KV Cache?
摘要
目前,世界各地的人工智能代理正在重复同样的荒谬行为:为了阅读一份文档,他们各自从头开始重新计算。每个代理都会重新运行预填充,这是大型模型在相同文本上执行的计算最密集的步骤,只是为了重建与代理刚刚构建的缓存相同的键值 (KV) 缓存。同样的答案,计算了一百万次。我们提出了一个几乎令人反感的简单提议:计算一次。让发布者预先计算文档的 KV 缓存,并让其他所有代理购买加载该文档并跳过预填充的权利。它有效,并且是词元精确的:加载预先计算的 KV 并继续从头开始匹配预填充(24/24 贪婪词元,并且在 logits 级别),没有准确性成本。在 Qwen3-4B 上,重用的计算成本比预填充便宜 9-50 倍,并且差距随着长度的增加而扩大(预填充的注意力随 L^2 缩放),因此单次重用已经得到了回报。然后是重要的部分:KV 所在的位置。运输失败,因为 KV 几乎不可压缩,因此每个负载的出口成本高于其节省的预填充成本。将其托管在提供商端,就像生产提示缓存的工作原理一样,完全消除了出口。奖励的大小是根据我们测量的计算节省来确定的:向 8000 万代理提供一份热的 3774 词元文档的重新预填充成本约为 150 万美元,但重用计算仅需约 3 万美元(减少 49.7 倍)。 0.1 倍的缓存读取费率 API 收费为用户提供了 10 倍的折扣,同时位于这个测量范围内,因此 10 倍是测量到的约 50 倍计算节省所清除的下限,而与物理约 50 倍的差距是提供商利润:每个流行文档数百万美元。我们构建了最终的代理原生预填充 CDN,并将无损 KV 压缩和跨方支付层作为开放问题。
