论文
BlockServe:用于高通量扩散的块粒度连续批处理 LLM 服务
BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving
摘要
扩散 大语言模型 (dLLM) 的高效服务受到收敛异质性的阻碍:当批处理多个请求时,不同的序列以不同的速率收敛,导致较快的请求落后于较慢的落后者,并引入计算泡沫和尾部延迟。我们提出了 BlockServe,一个连续批处理框架,它集成了块粒度调度(立即驱逐块边界处已完成的请求)和混合状态执行,通过聚集-分散索引将双缓存和并行解码扩展到异构批次。此外,计算感知准入控制器通过词元预算补充来扩展有效批量容量。在 Dream 和 LLaDA 的五个基准测试中,BlockServe 的吞吐量比 Fast-dLLM 提高了 1.9--10.6$\times$,且生成质量相当,从而建立了块粒度调度作为高吞吐量离线 dLLM 推理的基础。