论文
为扩散语言模型启用共享前缀的 KV 缓存
Enabling KV Caching of Shared Prefix for Diffusion Language Models
摘要
共享前缀的键值 (KV) 缓存对于高吞吐量 大语言模型 (LLM) 服务至关重要,但它在新兴的扩散语言模型 (DLM) 中面临着严峻的挑战。在 DLM 中,双向注意力意味着更新任何 token 都会动态改变整个上下文及其相应的 KV。因此,为 LLM 开发的现有缓存技术假设 KV 一旦计算就保持不变,从而破坏了共享前缀 KV。我们的实验表明,将这些技术应用于 DLM 会导致模型精度下降到接近于零。为了解锁高吞吐量的 DLM 服务,我们提出了双向前缀缓存 BiCache,这是第一个用于 DLM 中共享前缀的 KV 缓存技术。 BiCache 的设计基于我们综合分析的关键观察结果:共享前缀 KV 在浅层中保持稳定且可重用,而浅层的深度取决于每个请求中共享前缀词元的比例。因此,BiCache动态识别安全层深度以重用共享前缀KV并消除冗余计算。评估表明,与现有技术相比,BiCache 显着提高了服务吞吐量 36.3%-98.3%,且精度没有下降(仅相差 0-1.8%)。