论文

EnergyLens:多 GPU LLM 推理优化的预测能源感知探索

EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization

AI 基础设施推理服务

摘要

我们推出 EnergyLens,这是一种用于能量感知 大语言模型 (LLM) 推理优化的端到端框架。随着 LLM 规模的扩大,预测和减少能源足迹对于可持续发展和数据中心运营至关重要,但现有方法要么需要生产级代码和昂贵的分析,要么无法准确捕获多 GPU 能源行为。因此,从业者缺乏工具来决定优先考虑哪些优化,以及在无法进行详尽的分析时在现有部署配置中进行选择。 EnergyLens 通过基于 einsum 的直观界面弥补了这一差距,该界面捕获 LLM 规范,包括融合、并行性和计算通信重叠,并结合负载不平衡感知的 MoE 建模和针对多 GPU 设置的经验驱动的通信能量模型。我们在 Llama3 和 Qwen3-MoE 上跨张量并行和专家并行配置验证 EnergyLens,多 GPU 预填充和解码能量的平均绝对百分比误差 (MAPE) 达到 9.25% 到 13.19% 之间,威震天式重叠的 SM 分配达到 12.97%。我们的能源驱动探索揭示了预填充和解码效率配置之间高达 1.47 倍和 52.9 倍的能源变化,并激发了分布式服务。我们进一步表明,仅凭直觉很难优化计算通信重叠,但 EnergyLens 正确识别了帕累托最优重叠配置。