论文
PALS:面向混合专家模型的功耗感知 LLM 服务
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
摘要
大语言模型(LLM)推理已成为现代数据中心的主导工作负载,带来可观的 GPU 利用率与能耗。以往系统通过批处理、调度与并行来优化吞吐与时延,但在很大程度上将 GPU 功耗视为静态约束而非可控资源。本文提出面向 LLM 服务的功耗感知运行时 PALS,它将 GPU 功耗上限视为一等控制旋钮,并与批大小等软件参数联合优化。该系统将轻量的离线功耗-性能模型与反馈驱动的控制器相结合,选择在满足吞吐目标的同时最大化能效的配置。我们在现有 LLM 服务框架 vLLM 中实现 PALS,表明其无须重新训练模型或更改 API。在多 GPU 系统以及稠密与混合专家(MoE)模型上,PALS 将能效提升最高 26.3%,在功耗约束下将 QoS 违规减少 4 到 7 倍,并能跟踪动态功耗预算。这些结果凸显了将功耗控制直接集成到 LLM 推理运行时的潜力,有助于实现能耗比例化与电网互动的 AI 系统。
