论文

Dynamic-dLLM:无需训练 的动态缓存预算和自适应并行解码加速扩散 LLM

Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM

模型推理KV Cache

摘要

Diffusion 大语言模型 (dLLM) 为自回归模型提供了一种有前途的替代方案,由于其双向注意机制,在文本生成任务中表现出色。然而,它们的计算复杂度按序列长度 L 的 L 立方计算。这对长序列和实时应用程序提出了重大挑战,主要是由于缺乏与键值缓存的兼容性以及去噪步骤的非自回归性质。现有的加速方法依赖于静态缓存或并行解码策略,无法考虑跨层和解码步骤的词元属性的动态行为。我们提出了 Dynamic-dLLM,这是一个 无需训练 框架,它通过两个组件来增强 dLLM 推理效率:动态缓存更新(DCU),它基于逐层词元动态自适应地分配缓存更新预算;以及自适应并行解码(APD),它动态校准解码阈值以平衡生成质量和效率。在 LLaDA-8B-Instruct、LLaDA-1.5 和 Dream-v0-7B-Instruct 等模型上跨 MMLU、GSM8K 和 HumanEval 等基准进行的广泛实验表明,Dynamic-dLLM 显着提高了推理速度。它在保持性能的同时实现了超过 3 倍的平均加速。 Dynamic-dLLM 的性能优于最先进的加速方法,并提供即插即用的解决方案,可在不影响性能的情况下实现高效的 dLLM 部署。代码可在 https://github.com/TianyiWu233/DYNAMIC-DLLM 获取。