论文

异构 GPU 云中 SLO 约束 LLM 推理的可扩展联合资源分配

Scalable Joint Resource Allocation for SLO-Constrained LLM Inference in Heterogeneous GPU Clouds

AI 基础设施推理服务

摘要

在云环境中提供 大语言模型 (LLM) 推理需要在延迟、准确性、内存和预算限制下联合优化模型选择、GPU 配置、并行配置和工作负载路由。虽然混合整数线性规划 (MILP) 可以对这个问题进行建模,但其计算成本限制了需求变化下的频繁重新优化。现有的启发式方法通常单独优化各个组件,并且在强制执行系统范围的约束时可能变得不可行。本文提出了一个用于受 SLO 约束的 LLM 推理的可扩展框架。我们将问题表述为具有两阶段延迟模型的 MILP,该模型在张量和管道并行性下捕获预填充和自回归解码。为了有效地解决这个问题,我们开发了两种约束感知启发式算法:贪婪启发式算法(GH)和自适应贪婪启发式算法(AGH)。 AGH 通过多起点构建、本地搜索和 GPU 整合扩展了 GH。这两种方法都通过并行感知过滤、基于成本的排名和自适应并行扩展来保持可行性。基于 Azure LLM 推理跟踪的实验表明,GH 在一秒内生成可行的解决方案,而 AGH 在三秒内实现接近最佳的性能,并可扩展到精确求解器无法收敛的大型实例。在样本外压力以及高达 1.5 倍的延迟和精度膨胀的情况下,AGH 通过预配置的余量优雅地降级,与成本最低的 MILP 解决方案相比,成本和 SLO 违规大大降低。在合成和真实的 Azure 工作负载中,AGH 保持 SLO 合规性的成本比精确的 MILP 解决方案低得多。这些结果表明,高质量的分配对需求变化具有很强的鲁棒性,同时能够快速适应工作负载的变化。