论文

LLM服务的几何感知在线调度:从理论界到系统实践

Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice

AI 基础设施推理服务

摘要

对交互式大型语言模型服务的爆炸性需求凸显了键值缓存动态内存占用的管理作为推理引擎性能优化的关键领域。现代推理系统绝大多数依赖于以时间为中心的调度启发法,例如最短作业优先。然而,它们的理论最优性植根于传统的进度建模,未能捕捉到 LLM 推理机制特有的高度动态、二维时空几何增长。为了解决这个问题,我们通过引入最小体积优先(SVF)算法及其高效变体 1 位 SVF 来提出几何感知在线调度。从理论上讲,我们为我们的方法提供了严格的数学基础。通过一种新颖的卷证书证明,我们在 LLM 服务的高并发机制中将 SVF 最坏情况下的竞争比从之前最好的 48 提高到 \textbf{3}。在此核心突破的基础上,我们完成了全面的理论分类,分析了不同流量场景和信息可用性的算法。实际上,我们将我们的方法无缝集成为 vLLM 中的即插即用层。对 Llama-3.1 模型的广泛评估展示了全面的性能提升:SVF 显着降低了平均延迟和尾部延迟,而 1 位 SVF 仅包含一位信息,实现了有竞争力的吞吐量和延迟。这项工作建立了一种理论上合理且经过经验验证的方法,用于解决现代 LLM 部署中的内存受限调度问题。为了方便未来的研究,我们的代码可在 https://github.com/Aurora-Kl/Geometry-Aware-Online-Scheduling.git 获取。

LLM服务的几何感知在线调度:从理论界到系统实践:论文配图
图 1:LLM 推理过程和体积计算。