论文

SpectrumKV:用于预填充解码分解 LLM 服务的每词元混合精度 KV 缓存传输

SpectrumKV: Per-Token Mixed-Precision KV Cache Transfer for Prefill-Decode Disaggregated LLM Serving

模型推理KV Cache

摘要

预填充解码 (PD) 分解将提示处理与词元生成解耦,但它也将键值 (KV) 缓存转变为网络负载。现有的PD侧KV降低方法大多是二进制的:选定的词元以全精度传输,其余的不传输。本文认为,二元选择留下了未使用的有用设计空间。 SpectrumKV 为每个词元分配一个精度级别:注意力池和其他高重要性词元在 FP16 受到保护,中等重要性词元在 INT8 发送,低重要性词元在模型可以容忍时在 INT4 发送。主要的实际问题是 INT4 容差取决于模型。 Qwen2.5-7B 在 INT4 KV 量化下发生灾难性失败,而 Mistral-7B 和 Gemma-2-9B 保持稳定。因此,SpectrumKV 运行轻量级部署时间探测:在 3 层策略下进行三个积极的 NIAH 试验。通过的型号使用FP16+INT8+INT4;失败的型号会回退到 FP16+INT8。在 Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 和 Gemma-2-9B-it 中,SpectrumKV 在相同的传输预算下提高了质量。在 WikiText-2 上标准化 KV 预算为 50% 的情况下,SpectrumKV 的困惑度变化分别为 +1.97%、-0.06% 和 -0.44%,而 PDTrim 的困惑度为 +25.85%、+22.07% 和 +35.63%。在 4096 个词元的 NIAH 检索中,自适应策略在激进的 b=0.3 预算下在 Qwen 上达到 52.6%,而 PDTrim 为 26.3%,并在 b=0.5 时达到 100%; Mistral 和 Gemma 在三层策略下保留检索。传输路径的端到端 GPU 时序显示,b=0.5 时 TTFT 减少了 50-62%。这些结果表明,PD KV 转移应该被视为精确分配问题,而不仅仅是词元修剪。