论文
PolyKV:用于多代理 LLM 推理的共享非对称压缩 KV 缓存池
PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference
摘要
我们提出了 PolyKV,这是一个系统,其中多个并发推理代理共享单个非对称压缩的 KV 缓存池。 PolyKV 不是为每个代理分配单独的 KV 缓存(标准范例),而是编写一次压缩缓存,然后通过 HuggingFace DynamicCache 对象将其注入到 N 个独立的代理上下文中。压缩是不对称的:密钥在 int8 (q8_0) 处进行量化,以保持 softmax 稳定性,而值则使用 TurboQuant MSE 进行压缩——快速 Walsh-Hadamard 变换 (FWHT) 旋转,然后进行 3 位 Lloyd-Max 量化,质心调整为 N(0,1)。我们评估了两个模型规模(SmolLM2-1.7B-Instruct 和 Llama-3-8B-Instruct)、三个上下文长度(600-7,194 个词元)以及最多 15 个并发代理。 PolyKV 在所有配置中均实现了稳定的 2.91 倍压缩比。在 Llama-3-8B 上,有 15 个代理共享 4K 词元上下文,PolyKV 将 KV 缓存从 19.8 GB 减少到 0.45 GB,减少了 97.7%,同时仅保持 +0.57% 的困惑度下降,平均 BERTScore F1 为 0.928。 PPL 增量不会随着代理数量的增加而增加,并且会随着上下文长度的增加而增加,在 1,851 个连贯标记处反转至 -0.26%。据我们所知,之前的工作还没有将单个共享、有损压缩的 KV 池与多读取器并发代理访问相结合。