论文
FlowBlock:面向自纠错扩散语言模型的波前并行解码
FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models
摘要
分块扩散大语言模型(dLLM)按块顺序解码:可在块间高效复用KV缓存,但块间解码严格串行。既往工作尝试以后训练方法解锁块间并行,但加速有限且常损害准确率。我们观察到自纠错dLLM提供了免训练的替代路径:token到token(T2T)编辑能修复用略微过期的上游上下文起草的token,因此下游块只需一个有信息量的草稿而非定稿的前驱——这把块定稿从硬依赖转变为调度资源。我们提出FlowBlock,一个建立在两个机制上的免训练并行解码框架:(i)门控波前解码——仅当就绪门满足时才把块放入有界波前,经T2T编辑联合精炼活动块,并在保持精确冻结前缀KV缓存复用的窗口化块因果掩码下按序提交块;(ii)异构波前打包——为每个请求分配独立波前,把异步窗口打包进稠密、形状稳定的批量前向。跨不同基准,FlowBlock相对两个串行分块dLLM(LLaDA-2.1与LLaDA-2.0)把每秒token数最多提升2.95倍与4.01倍,延迟分别最多降低53.6%与77.1%,平均准确率还提高1.3分。与基于训练的块间并行基线D2F相比,FlowBlock取得更高准确率与最高16倍的批量服务吞吐。
