论文
面向大语言模型推理的基于阈值的独占批处理
Threshold-Based Exclusive Batching for LLM Inference
摘要
混合批处理(MB)——在单个批次中交错执行prefill与decode——由于能够高效最大化算力与内存利用率,已成为大语言模型(LLM)推理的标准调度策略。然而,通过受控实验我们发现,prefill与decode的相互干扰使MB的单步边际成本高于纯decode。在高带宽的H200(4.8 TB/s)上,仅当decode token超过批次的80%时才会出现这种情况;而在带宽受限的RTX PRO 6000(1.792 TB/s)上,该阈值骤降至仅20%。因此,MB与独占批处理(EB)之间的最优选择从根本上取决于GPU内存带宽、模型规模与工作负载构成。我们推导出EB-MB性能交叉点的闭式条件,以及渐近最优的相位切换阈值和EB的内存安全批规模。优化后的EB在带宽受限GPU上吞吐量最高提升41.9%,而MB在配备较大模型的高带宽硬件上保持优势。我们的混合调度器EB+在线应用该条件,无需人工干预即可在EB与MB之间动态切换。在存在分布或并发变化的非平稳流量下,EB+在每种设定中都取得最高或接近最高的吞吐量,最高超出MB达36.4%。
