论文

BlockBatch:用于高效扩散语言模型推理的多尺度共识解码

BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference

模型推理批处理与并行

摘要

扩散语言模型 (dLLM) 通过并行迭代地对多个标记位置进行去噪来生成文本,为严格自回归解码提供了一种有吸引力的替代方案。然而,在实践中,逐块 dLLM 推理暴露了一个困难的粒度权衡:小块保留局部调节,但需要许多去噪步骤,而大块暴露更多并行性,但可能做出过早的承诺并累积缓存错误。现有的加速方法通常为每个请求选择单个块大小,而未使用块大小之间的互补性。我们证明块大小本身是一个有用的分支维度。不同的块大小会导致相关但不相同的 KV 缓存轨迹:分支通常共享初始前缀,在语义上决定性的位置分叉,然后在语法上的轻量级标记上达成一致。受此结构的启发,我们提出了 BlockBatch,这是一个 无需训练 在线推理框架,它在批量前向传递中为同一请求执行多个块大小的分支。 BlockBatch 通过置信门控词元合并、基于领导者的同步以及定期全序列刷新来协调这些分支,这些刷新将本地块更新重新锚定为全局一致的 KV 状态。在 3 个代表性 dLLM 和 4 个数据集上,BlockBatch 平均将去噪 NFE 降低了 26.6%,并在保持准确性的同时实现了比 Fast-dLLM 平均 1.33$\times$ 的端到端加速。这些结果将块大小多样性确定为分支并行 dLLM 推理的实用且先前未充分探索的轴。