论文

刻画训练任务功率弹性:支持灵活用电的AI训练

Characterizing Job Power Elasticity for Power-Flexible AI Training

AI 基础设施AI 服务器

摘要

大语言模型 (LLM) 训练是现代数据中心电力需求增长最快的来源之一,而电力可用性是人工智能基础设施持续增长的主要瓶颈。灵活地调整这些任务负载的功耗可以为人工智能的增长释放额外的动力,限制电价的上涨,并提高现有电网基础设施的利用率。然而,为了实现这种灵活性,我们必须首先了解当 GPU 功率降低时训练任务负载的性能如何变化。本文首次系统地描述了大语言模型训练中的任务功率弹性(吞吐量对功率降低的敏感性)。为了量化弹性,我们引入了电源灵活性指数(PFI),这是一种标准化指标,可量化功耗降低的性能成本,并为 SLA 感知的电源灵活性提供控制原语。我们从 H200 上的 131 次 LLM 训练运行(加上 24 次 H200 验证运行和 34 次匹配的 H100 运行)中收集数据,包括密集模型和专家混合模型、预训练和微调任务以及最多 32 个 GPU。我们发现 LLM 训练任务表现出巨大但可变的功率弹性,并且我们识别了在运行时预测 PFI 的遥测信号。最后,我们证明了 PFI 感知功率分配在功率限制下最大化了总Token/秒吞吐量。在功率降低 30% 的情况下,PFI 感知功率分配可恢复每个作业约 1.5k Token/秒,相当于等权重分配和具有完美信息的预言机之间性能差距的 63%。我们的结果将功率弹性确立为训练作业的可测量属性,并为功率感知、电网响应式人工智能基础设施奠定了基础。