论文

AsyncLane:从扩散语言模型解码的进步中解耦细化

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

模型推理推理加速

摘要

分块半自回归解码是扩散 大语言模型 (DLM) 的标准推理范例,但它在块之间强加了严格的依赖性:在当前块完全解码或其去噪预算耗尽之前,下一个块无法开始。我们观察到,一旦一个块暴露了可靠的分隔符边界或稳定的语义前缀,连续生成就不需要等待每个剩余标记被解析。我们提出了 AsyncLane,一种 无需训练 解码调度器,可将改进与改进分离。 AsyncLane 在观察到的分隔符边界处将生成通道分叉为细化通道和延续生成通道:前缀保持可编辑,而延续在前缀细化完成之前前进。生成的通道树记录解码依赖性和输出顺序,同时在活动通道集上继续执行。为了使这种异步调度在双向注意力下高效,AsyncLane 将共享前缀通道批处理、前瞻草稿重用、级联终止和紧凑缓存刷新与刷新 logits 重用相结合,防止模型调用成本直接随通道数量扩展。 AsyncLane 是块式 DLM 采样器的直接替代品,无需重新训练。数学推理和代码生成实验表明,AsyncLane 持续提高吞吐量,同时保持有竞争力的质量。在 LLaDA 和 Dream 主干网中,AsyncLane 在所有评估的基准长度设置中实现了最高的 TPS;相对于最快的竞争基准,它在 LLaDA 上达到了 2.95 倍的峰值加速,在 Dream 上达到了 3.04 倍的峰值加速,在较长的一代预算下,收益尤其大。