论文

CAI-DLLM:面向扩散语言模型的收敛感知推理

CAI-DLLM: Convergence Aware Inference for Diffusion Language Models

模型推理推理加速

摘要

扩散语言模型可以并行生成多个词元,但在推理时仍需反复的去噪步骤。这使得生成成本高昂,尤其是当模型继续重算已经稳定的词元时。为解决这些局限,我们提出CAI-DLLM,一种免训练的推理方法,利用首步置信度引导去噪并缩短推理时间。具体而言,CAI-DLLM更早提交容易的词元,把更多去噪步分配给更难的词元,并跨输出块调整解码调度。由于它仅依赖首步置信度信号,因此不需要重训练、额外预测器或权重更新。我们在LLaDA-8B-Instruct与Dream-7B-Instruct上跨数学、代码、推理、常识与长上下文任务评估CAI-DLLM。CAI-DLLM在LLaDA的GSM8K上实现最高18.2倍墙钟推理加速,同时把准确率从76.27%提升到77.41%;在Dream的HumanEval上实现最高13.1倍加速,同时pass@1高于无缓存推理,为48.17%对46.95%。在更难的推理任务上,加速可达44.8倍,准确率最多下降4.4点,而能耗最多降低95.3%。

CAI-DLLM:面向扩散语言模型的收敛感知推理:论文配图
图1:去噪工作量在层、块与 token 之间分布不均。(a) 隐状态漂移随 transformer 各层而变化。(b) 随着更早的上下文变得可用,靠后的块中保存的步数增加。(c) 首步置信度将 c_i^(0)>0.50 的简单 token、0.25≤c_i^(0)≤0.50 的中等 token 与 c_i^(0)<0.25 的困难 token 区分开。