HERALD:通过 CPU-GPU 协作 KV 缓存检索提供高吞吐量块扩散 LLM 服务
HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval
摘要
KV 缓存在长上下文 LLM 服务中主导 GPU 内存,挤出批处理容量并使 GPU 计算闲置。将缓存卸载到 CPU DRAM 可以恢复容量,但有限的 PCIe 带宽迫使最先进的卸载系统将其与稀疏注意力配对,仅将缓存的一小部分关键子集获取到 GPU。然而,这些系统遵循自回归解码的 KV 访问模式,其中关键集在每个词元时都会发生变化:在每个解码步骤中都会重复选择和获取,并且吞吐量仍然受到 PCIe 带宽而不是任一处理器的限制。块扩散 LLM(块 dLLM)通过 T 个去噪步骤解码 B 词元块,表现出不同的 KV 访问模式,为卸载开辟了新的机会。最近的稀疏块 dLLM 方法表明,稀疏推理分为每个块扫描一次完整 KV 缓存的选择阶段和重用所选小子集 T 次的去噪阶段。这种不对称性与 CPU-GPU 系统的计算和内存不对称性相一致,从而有利于在 CPU 上运行选择并在 GPU 上运行去噪:关键的 KV 缓存每个块仅跨越 PCIe 一次,从而消除了互连作为瓶颈。据我们所知,我们推出了 HERALD 第一个专为块 dLLM 设计的 KV 卸载系统。 HERALD 解决了此映射的两个障碍,即阶段之间的序列化依赖关系和 CPU 上计算限制的 B 查询选择,方法是将阶段与草案块重叠,通过单个 [MASK] 查询降低选择成本,并在双缓冲稀疏 KV 池上作为双流管道执行。在两个生产块 dLLM 上,HERALD 在 5% KV 预算下保持近乎无损的精度,并达到仅 GPU 服务的解码吞吐量的 2.28 倍,增益随着上下文长度的增加而扩大。