论文

用于高效扩散的依赖感知可撤销解码 大语言模型 推理

Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference

模型推理解码与生成控制

摘要

扩散 大语言模型 (dLLM) 通过迭代去噪并行解码多个标记,为自回归生成提供了一种有前途的替代方案。然而,增加解码并行度通常会降低生成质量,因为早期错误可能会污染后来的上下文。可撤销解码通过重新评估解码的词元并重新屏蔽不可靠的词元来缓解此问题,但现有方法忽略了不可靠的词元也可能破坏验证上下文本身。我们识别了这种故障模式,并提出了依赖感知可撤销解码(DARD),这是一个 无需训练 框架,可将词元分为屏蔽状态、候选状态和未屏蔽状态。 DARD 使用选择性上下文来验证候选词元,该上下文排除不太可靠的词元,并自适应地调节它们对后续解码的影响。在 3 个开源 dLLM 上进行的 12 个文本和多模态基准测试表明,与最近的可撤销解码方法相比,DARD 持续改进了速度质量 Pareto 前沿,在 Flickr30K 上比 Saber 实现了 2.71$\times$ 加速和 4.35 点 CIDEr 分数增益。