论文

推出和回滚:扩散 LLM 是他们自己的效率老师

Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers

模型推理解码与生成控制

摘要

Diffusion 大语言模型 (DLLM) 承诺快速并行生成,但开源 DLLM 仍然面临严重的质量与速度权衡:通过显示多个词元来加速解码通常会导致质量大幅下降。我们将这种困境归因于不可逆解码放大的训练推理不匹配。虽然训练从随机损坏的状态重建词元,但有效的推理需要自适应去噪顺序,其中更容易的词元会更早地显示出来,而依赖于上下文的词元则被推迟。这种观点激发了两种互补的方法:一种使并行解码可撤销的推理时间方法,以及一种提取该可撤销过程所暴露的可靠顺序的训练时间扩展。因此,我们首先提出了宽入窄出(WINO),一种 无需训练 解码算法,可以实现可撤销的并行生成。 WINO 积极起草多个词元,使用丰富的全局上下文验证生成的词元,并重新屏蔽不可靠的词元以供以后细化。基于这个发现的顺序,我们进一步引入了 WINO+,它将 WINO 生成的经过验证的去噪轨迹注入到模型参数中,使训练与高效推理保持一致。 LLaDA 和 MMaDA 的实验表明,WINO 提高了质量和效率,而 WINO+ 进一步加强了这一进步。在 GSM8K 上,WINO 将准确率从 73.24% 提高到 75.82%,步长减少了 6.10 倍,WINO+ 进一步实现了 76.58%,步长减少了 6.83 倍。在 Flickr30K 上,WINO+ 通过改进的 CIDEr 将步数减少了 16.22 倍。这些结果表明,DLLM 可以充当自己的效率老师,首先通过可撤销的解码发现可靠的降噪顺序,然后学习遵循它们以更快地生成。代码可在 https://github.com/Feng-Hong/WINO-DLLM/tree/WINO-plus 获取。