论文
通过结构化后缀建模加速扩散语言模型
Accelerating Diffusion Language Models via Structured Suffix Modeling
摘要
扩散语言模型 (DLM) 通过在单个生成步骤中对多个标记进行去噪,展现出强大的并行解码能力。然而,这种并行性会带来大量的计算开销,因为每个步骤都需要与所有后缀标记进行交互。现有方法通常通过仅保留本地后缀窗口作为完整后缀的替代来降低此成本。尽管它们很有效,但这些方法忽略了后缀区域之间的结构异质性,并在每个时间步以相同的表示重新初始化后缀标记。为此,我们提出了一种用于高效 DLM 推理的结构化后缀建模方法。具体来说,我们将后缀分为三个区域,即局部区域、中间区域和尾部区域,并根据其结构角色在每个区域中保留不同数量的后缀标记。此外,我们将上一步的解码结果合并到当前步骤的后缀标记表示中,使它们能够在生成步骤中携带不断变化的去噪信息。值得注意的是,我们的方法是 无需训练 并且与几种现有的加速技术正交,例如并行解码策略和 KV 缓存。三个 DLM 的多个基准的实证结果表明,我们的方法可以进一步加速 DLM 推理并在大多数情况下提高性能。特别是,在长序列推理中,当与其他加速技术结合时,我们的方法可实现高达 \(72.81\times\) 的加速。我们的代码可在 https://github.com/zifeng Cheng/SSM 获取。