论文

面向大语言模型推理的基于阈值的独占批处理

Threshold-Based Exclusive Batching for LLM Inference

AI 基础设施推理服务

摘要

混合批处理(MB)——在单个批次中交错执行prefill与decode——由于能够高效最大化算力与内存利用率,已成为大语言模型(LLM)推理的标准调度策略。然而,通过受控实验我们发现,prefill与decode的相互干扰使MB的单步边际成本高于纯decode。在高带宽的H200(4.8 TB/s)上,仅当decode token超过批次的80%时才会出现这种情况;而在带宽受限的RTX PRO 6000(1.792 TB/s)上,该阈值骤降至仅20%。因此,MB与独占批处理(EB)之间的最优选择从根本上取决于GPU内存带宽、模型规模与工作负载构成。我们推导出EB-MB性能交叉点的闭式条件,以及渐近最优的相位切换阈值和EB的内存安全批规模。优化后的EB在带宽受限GPU上吞吐量最高提升41.9%,而MB在配备较大模型的高带宽硬件上保持优势。我们的混合调度器EB+在线应用该条件,无需人工干预即可在EB与MB之间动态切换。在存在分布或并发变化的非平稳流量下,EB+在每种设定中都取得最高或接近最高的吞吐量,最高超出MB达36.4%。

面向大语言模型推理的基于阈值的独占批处理:论文配图
图 7:RTX PRO 6000 Blackwell 上七个模型的线性模型验证。 (左)测量的预填充迭代时间与上下文长度 LL(最多 128K 个令牌);阴影带标记了典型的每次迭代token预算(≤8​K\leq 8\text{K})。 (右)线性拟合 R2R^{2} 作为拟合范围上限的函数。在实际预算内(≤16​K\leq 16\text{K}),所有模型均保留 R2>0.97R^{2}>0.97;即使拉伸到 128K,近似值也会优雅地降低,保持 R2≥0.94R^{2}\geq 0.94。