论文
$R^2$-dLLM:通过时空冗余减少加速扩散 大语言模型
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
摘要
通过启用并行词元预测,扩散 大语言模型 (dLLM) 已成为自回归生成的有前途的替代方案。然而,实际的 dLLM 解码仍然面临高推理延迟的问题,这限制了部署。在这项工作中,我们观察到这种低效率的很大一部分来自于解码过程中反复出现的冗余,包括由置信簇和位置模糊引起的空间冗余,以及由重复重新屏蔽已经稳定的预测引起的时间冗余。受这些模式的启发,我们提出了 $R^{2}$-dLLM,这是一个从推理和训练角度减少解码冗余的统一框架。在推理时,我们引入了 无需训练 解码规则,该规则聚合本地置信度和词元预测,并最终确定时间稳定的词元以避免冗余解码步骤。我们进一步提出了一种冗余感知的监督 微调 管道,该管道使模型与高效的解码轨迹保持一致,并减少对手动调整阈值的依赖。实验表明,与现有解码策略相比,$R^{2}$-dLLM 持续减少了高达 88\% 的解码步骤数,同时在不同模型和任务中保持有竞争力的生成质量。这些结果验证了解码冗余是 dLLM 的中心瓶颈,并且明确减少冗余可以产生显着的实际效率增益。我们的代码和模型可在 https://github.com/GATECH-EIC/R2-dLLM 上获取。