论文

PALS:面向混合专家模型的功耗感知 LLM 服务

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

AI 基础设施推理服务

摘要

大语言模型(LLM)推理已成为现代数据中心的主导工作负载,带来可观的 GPU 利用率与能耗。以往系统通过批处理、调度与并行来优化吞吐与时延,但在很大程度上将 GPU 功耗视为静态约束而非可控资源。本文提出面向 LLM 服务的功耗感知运行时 PALS,它将 GPU 功耗上限视为一等控制旋钮,并与批大小等软件参数联合优化。该系统将轻量的离线功耗-性能模型与反馈驱动的控制器相结合,选择在满足吞吐目标的同时最大化能效的配置。我们在现有 LLM 服务框架 vLLM 中实现 PALS,表明其无须重新训练模型或更改 API。在多 GPU 系统以及稠密与混合专家(MoE)模型上,PALS 将能效提升最高 26.3%,在功耗约束下将 QoS 违规减少 4 到 7 倍,并能跟踪动态功耗预算。这些结果凸显了将功耗控制直接集成到 LLM 推理运行时的潜力,有助于实现能耗比例化与电网互动的 AI 系统。

PALS:面向混合专家模型的功耗感知 LLM 服务:论文配图
图 3. 三个 MoE 模型的 Pareto 前沿扩展(单节点,4×\timesA100)。显示了四个前沿:仅 SW(批量扫描,固定上限)、仅 HW(上限扫描、固定批次)、HW+SW(联合上限×\timesbatch)和全联合(HW+SW+TP)。完整的边界主导任何单旋钮方法;增益取决于模型并遵循计算/通信比率。