论文
用于扩散的附加缓存 大语言模型
Affix Cache for Diffusion Large Language Models
摘要
扩散 大语言模型 (DLLM) 支持非自回归解码,但有效的推理支持仍然不成熟:与请求重用共享前缀键值 (KV) 缓存的自回归模型不同,DLLM 使用双向注意力,因此共享上下文的 KV 状态取决于仍在解码的词元,导致直接重用的缓存过时且需要完全重新计算。我们提出了 ACache,一种跨请求缓存重用机制,用于在任何位置(前缀、中缀或后缀)共享跨度或词缀。 ACache 测量附加标记对屏蔽生成区域的影响,以将特定于请求的小子集识别为锚标记,并仅重新计算它们的 KV 状态,同时重用剩余的附加缓存。 ACache 基于最先进的请求内缓存机制构建,在重新计算大约 20% 的附加标记时,平均可以恢复直接附加缓存重用所损失的大部分准确性,并且在该预算下,比从以前的跨请求缓存重用系统改编的选择标准保持更高的准确性。我们与现代推理引擎共同设计 ACache,该引擎的注意力会读取每个请求重新计算的 Anchor KV 状态以及在并发请求之间共享的一个词缀缓存。与仅使用请求内缓存的同一系统相比,ACache 将重新计算延迟减少了高达 56.7%,相当于端到端吞吐量高达 1.71$\times$,同时将峰值 KV 缓存内存减少了高达 45.8%。