论文

FlowBlock:面向自纠错扩散语言模型的波前并行解码

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models

模型推理批处理与并行

摘要

分块扩散大语言模型(dLLM)按块顺序解码:可在块间高效复用KV缓存,但块间解码严格串行。既往工作尝试以后训练方法解锁块间并行,但加速有限且常损害准确率。我们观察到自纠错dLLM提供了免训练的替代路径:token到token(T2T)编辑能修复用略微过期的上游上下文起草的token,因此下游块只需一个有信息量的草稿而非定稿的前驱——这把块定稿从硬依赖转变为调度资源。我们提出FlowBlock,一个建立在两个机制上的免训练并行解码框架:(i)门控波前解码——仅当就绪门满足时才把块放入有界波前,经T2T编辑联合精炼活动块,并在保持精确冻结前缀KV缓存复用的窗口化块因果掩码下按序提交块;(ii)异构波前打包——为每个请求分配独立波前,把异步窗口打包进稠密、形状稳定的批量前向。跨不同基准,FlowBlock相对两个串行分块dLLM(LLaDA-2.1与LLaDA-2.0)把每秒token数最多提升2.95倍与4.01倍,延迟分别最多降低53.6%与77.1%,平均准确率还提高1.3分。与基于训练的块间并行基线D2F相比,FlowBlock取得更高准确率与最高16倍的批量服务吞吐。

FlowBlock:面向自纠错扩散语言模型的波前并行解码:论文配图
图 1:门控波前解码。 (a) 滑动活动窗口 [L,R)[L,R) 在尾部对齐缓存上保持不同去噪阶段的 WW 相邻块。每一步: ❶ 一次前向解码整个窗口; ❷ 每个活动块应用方程的联合 M2T ∪\cup T2T 更新。 (1); ❸ 一旦本地完成,最左边的块就会退出,将其 KV 冻结到已提交的前缀中; ❹ 只有当边界准备度超过 θspawn\theta_{\mathrm{spawn}}(等式(3))时,大门才允许下一个区块。 KV 缓存仅在窗口内可变,并且所有提交的前缀都被冻结并准确重用。 (b) W 形块因果掩码:每个窗口查询都会看到完整提交的前缀和较早的窗口内块,但不会看到未来的块。