论文

用于分解 LLM 服务的相位解耦、模型校准功率控制

Phase-Decoupled, Model-Calibrated Power Control for Disaggregated LLM Serving

AI 基础设施推理服务

摘要

数据中心 GPU 功率是 LLM 服务容量的约束约束,生产服务已转向预填充/解码 (PD) 分解。在分解的 B200 系统上部署 NVIDIA 的 Max-Q 推理配置文件时,我们发现其实现的增益适中(+8.6% 词元/J),且与模型相关,并且具有平均端到端延迟成本(+5.2%),而仅吞吐量评估并未显现出来;该配置文件还应用一种设置来预填充和解码在相反硬件机制下运行的 GPU。我们假设最佳功率设置是已部署(模型、量化、引擎、硬件)组合的属性,而不是 GPU 类的属性,每个通道都保证其自己的配置文件,并且将 SLO 余量安全地转换为能量需要在运行时 SLO 保护下进行延迟门控校准,而不是固定配方。我们提出了一种相位解耦、模型校准的控制器:预填充通道在 SM 时钟窗口下运行,其下限是通过构造保证延迟的,而解码通道则在通过自动校准放置在测得的吞吐量/延迟悬崖之上的功率上限下运行。由于分解的解码通道会消耗平坦的、受内存限制的功率,因此上限会持续绑定,导致 POLCA 拒绝上限的反应性超调弱点不存在,并且 GPU 自己的电源管理器将吞吐量保留在上限之下。在代理负载下为 Qwen3-Coder-480B (FP8) 提供服务的 8x B200 节点上,我们的平衡模式在平均 e2e 为 +3.5% 时提供了 +20.4% 的词元/J,而 Max-Q 在 +5.2% 时提供了 +8.6%,这在两个轴上都是帕累托改进。在 Qwen3-235B-A22B (NVFP4) 上,每种操作模式在每次重复中都满足 ITL-p99 SLO;两个供应商资料都错过了它。解码执行器 A/B 显示校准上限优于静态时钟锁,三天的持续运行可节省车道对 32.3% 的电力。两种型号均为 MoE;密集模型的恢复速度大约要低 5 倍,因此我们将我们的主张范围限定为 MoE 服务。