论文

扩散语言模型的轨迹级 推测解码

Trajectory-Level Speculative Decoding for Diffusion Language Models

模型推理投机采样

摘要

基于扩散的语言模型 (dLLM) 通过迭代去噪实现并行词元生成,但现有的解码策略在低置信度下崩溃为单个词元生成,严重限制了吞吐量。与 推测解码 以固定的从左到右顺序对词元序列进行操作的自回归模型不同,dLLM 需要推测去噪轨迹 - 具有显式位置和揭露顺序的多词元更新序列。我们开发了一个轨迹级推测框架,该框架通过置信分层树探索构建草案去噪轨迹,并通过带有双向注意掩蔽的块式并行评估来验证它们。我们的方法进一步引入了块间推测,利用扩散模型的双向结构来执行跨块前瞻。我们正式描述了这种方法何时准确,并将轨迹漂移确定为增加并行性的基本成本。基于 Fast-dLLM 的双缓存基础设施,我们的框架将去噪迭代减少了 30-40%,并将每步标记从 2.6 增加到 4.3,与普通 dLLM 相比,速度提高了 7-14 倍,与 Fast-dLLM 相比,速度提高了 1.3 倍,推理和代码基准测试的准确度变化不到 1%。