服务掩码扩散LLM:来自真实硬件的刻画与设计原则
Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware
摘要
掩码扩散语言模型(dLLM)原则上可以比自回归(AR)模型更快地生成文本,因为它们同时去噪多个token。近期系统已开始为dLLM构建服务基础设施,但没有一个首先测量这些模型在真实并发服务负载下的行为。缺乏这一基础而构建的服务系统,有可能沿用对dLLM未必成立的AR服务假设。我们对dLLM服务进行刻画以填补这一空白,使用LLaDA-8B-Instruct配D2F(Discrete Diffusion Forcing)LoRA适配器,在单块NVIDIA H200 GPU上,在GSM8K和HumanEval上评测。我们报告三个发现。第一,请求难度——一个请求所需的去噪步数——是离散而非连续的:请求落入11个固定的步数档(178 + 29k),且我们测试的所有信号都无法在生成开始前预测该档位(最佳R²=0.150)。第二,生成预算低于320 token的基准会低估服务方差,因为请求在延迟分布显现之前就被截断了。第三,单请求墙钟时间中只有24%是GPU计算,其余是CPU侧分发开销。批处理主要通过摊销这一开销起作用:每去噪步共享一次前向传播,在批大小16下吞吐量比按请求分发基线提高16.0倍。我们还从结构上论证输出质量不应随批大小而退化,并给出该论断所依据的三个假设;我们在单请求规模下测得74%至76%的GSM8K准确率。最后,我们为泊松到达下固定填充同步批处理推导了一条批超时规则。综合来看,这些结果表明服务扩散语言模型需要在每个去噪步层面的并行性;其准入与驱逐如何同已经共享的前向传播相互作用,这一点与AR服务不同。