论文

SAID:通过支架感知迭代解码加速基于扩散的语言模型

SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative Decoding

模型推理推理加速

摘要

扩散 大语言模型 (DLLM) 通过使用双向上下文迭代对损坏的标记序列进行去噪,从而实现非自回归生成。尽管它们能够并行更新多个位置,但由于高质量生成需要许多去噪步骤,推理成本仍然很高。我们提出 SAID,一种脚手架感知迭代解码框架,它通过跨词元重新分配计算来加速 DLLM。 SAID首先对脚手架标记进行去噪计算,建立粗略的语义结构,然后以较少的步骤完成可预测的细节标记。我们进一步将 SAID 应用于逐块扩散解码,并引入置信度分层生成(CHLG),它仅向低置信度词元分配额外的步骤。在 LLaDA-8B 和 LLaDA 1.5 上跨数学、编码和知识基准的实验表明,SAID 显着加速了 DLLM 推理,最大加速可达 9.1 倍,同时保持竞争性能。我们的代码是公开的:https://github.com/TH-AI-Lab-PKU/SAID。