论文
S2D2:通过 无需训练 自推测进行扩散 LLM 的快速解码
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation
摘要
块扩散语言模型通过将块方式自回归解码与块内并行去噪相结合,提供了一条比自回归生成速度更快的有希望的途径。然而,在实际加速所需的几步机制中,标准置信阈值解码通常很脆弱:激进的阈值会损害质量,而保守的阈值则需要不必要的去噪步骤。解决此问题的现有方法要么需要额外的训练,要么需要额外的测试时计算。我们提出了 S2D2,一个用于块扩散语言模型的 无需训练 自 推测解码 框架。我们的主要观察结果是,当块大小减小到 1 时,块扩散模型就会变得自回归,从而允许相同的预训练模型充当起草者和验证者。 S2D2 将推测性验证步骤插入到标准块扩散解码中,并使用轻量级路由策略来决定验证何时值得其成本。这产生了一种混合解码轨迹,其中扩散并行提出标记,而自回归模式充当局部序列级验证器。在三个主流的块扩散系列中,S2D2 持续改进了强置信阈值基线的准确性与速度权衡。在 SDAR 上,我们观察到比自回归解码速度提高了 4.7 倍,比调整后的动态解码基线速度提高了 1.57 倍,同时精度提高了 4.5 点。在 LLaDA2.1-Mini 上,S2D2 仍然是对内置自校正的补充,包括保守的设置,比静态基线快 4.4 \倍$,且精度稍高。