论文
CAI-DLLM:面向扩散语言模型的收敛感知推理
CAI-DLLM: Convergence Aware Inference for Diffusion Language Models
摘要
扩散语言模型可以并行生成多个词元,但在推理时仍需反复的去噪步骤。这使得生成成本高昂,尤其是当模型继续重算已经稳定的词元时。为解决这些局限,我们提出CAI-DLLM,一种免训练的推理方法,利用首步置信度引导去噪并缩短推理时间。具体而言,CAI-DLLM更早提交容易的词元,把更多去噪步分配给更难的词元,并跨输出块调整解码调度。由于它仅依赖首步置信度信号,因此不需要重训练、额外预测器或权重更新。我们在LLaDA-8B-Instruct与Dream-7B-Instruct上跨数学、代码、推理、常识与长上下文任务评估CAI-DLLM。CAI-DLLM在LLaDA的GSM8K上实现最高18.2倍墙钟推理加速,同时把准确率从76.27%提升到77.41%;在Dream的HumanEval上实现最高13.1倍加速,同时pass@1高于无缓存推理,为48.17%对46.95%。在更难的推理任务上,加速可达44.8倍,准确率最多下降4.4点,而能耗最多降低95.3%。
