论文

Flash-dLLM:IO 感知 KV 缓存和并行解码,用于快速、内存高效的扩散 LLM

Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs

模型推理KV Cache

摘要

扩散大型语言模型(dLLM)最近通过支持非自回归文本生成而成为自回归 LLM 的有前途的替代方案。然而,它们的实际部署仍然受到低效推理的限制,这很大程度上是由于缺乏有效的键值(KV)缓存和可扩展的并行解码机制。现有的加速方法通常孤立地研究KV缓存和并行解码,而忽略了缓存重用和并行词元验证联合应用时出现的I/O瓶颈。在这项工作中,我们介绍了 $\textbf{Flash-dLLM}$,这是一种无需训练的推理加速框架,适用于快速且内存高效的 dLLM。 Flash-dLLM 首先将 GPU 内存 I/O 识别为支持 KV 缓存的 dLLM 推理中的主要瓶颈,并通过 I/O 感知融合 KV 缓存内核来解决该问题,从而减少冗余内存移动。基于这种优化的缓存机制,Flash-dLLM 进一步提出了一种高效的 KV 缓存驱动的起草和验证解码策略,其中 dLLM 本身既充当起草者又充当验证者,而不需要辅助模型。这种统一的设计可以实现更快的解码,同时保持生成质量并提高对更长序列和更大批量的可扩展性。关于数学推理和代码生成基准的大量实验表明,Flash-dLLM 在推理速度和内存效率方面始终优于现有最先进的 dLLM 加速方法。特别是,与 GSM8K 和 HumanEval 上之前最强的基线 Elastic-Cache 相比,它分别实现了 5.1\times$ 和 $11.0\times$ 加速。