论文

从过载到有保障:LoRA 辅助的本地LLM部署的高吞吐量多 SLO 实施

From Overloaded to Guaranteed: High-Throughput Multi-SLO Enforcement for LoRA-Assisted On-Premise LLM Deployment

AI 基础设施推理服务

摘要

随着大语言模型 (LLM) 在医院和政府机构等隐私敏感行业中变得至关重要,本地LLM服务器为公共云服务提供了一种经济高效且安全的替代方案。然而,这些资源受限的服务器在同时提供多个 LoRA 适配服务时很难保证异构服务级别目标 (SLO)。由于 LoRA 层的计算开销和批量调度的严格性质,现有的服务框架严重违反 SLO。为了解决这个问题,我们提出了 HALO,一种专为 LoRA 辅助的本地LLM部署而定制的调度方法。 HALO 引入了两项关键创新:通过划分 GPU 流多处理器 (SM) 来重叠 Base 和 LoRA 计算的空间复用策略,以及基于“请求级松弛”解耦请求执行的 SLO 感知调度程序。通过优先处理紧急任务并利用闲置预算进行流量整形,HALO 显着缓解了资源争用。我们的评估表明,与最先进的基线相比,HALO 最大限度地减少了 SLO 违规,同时提高了吞吐量。

从过载到有保障:LoRA 辅助的本地LLM部署的高吞吐量多 SLO 实施的原论文方法或结果图
图 7. 不同 SM 分配的绝对性能增益(毫秒)。