论文

用强化学习削减AI数据中心能耗:从单GPU到机群的LLM训练实测功率控制

Cutting AI Datacenter Energy with Reinforcement Learning: Measured Power Control of LLM Training from One GPU to the Fleet

AI 基础设施分布式训练基础设施

摘要

强化学习后训练主导着现代语言模型开发,但其功率行为在GPU硬件上尚未被刻画,而数据中心以工作负载无感的机制——静态上限与被动节流——管理GPU功率,无差别地降低硬件速度。我们在7B、14B与72B规模、一至四块A100上,以半秒级功率遥测对GRPO训练进行测量(超过38万个样本),并训练一个PPO元控制器,使其根据实测功率调整工作负载自身的生成参数。对照完整的500步7B轨迹,该控制器将功率上限违规减少89.8%,同时token产出增加18.1%、能效(每兆瓦时token数)提升26.2%。在72B上实时部署时,同一控制器家族得到可重复的无效结果,诊断为组大小执行器在模型分片下失去作用力。一项执行器作用力扫描显示,同样的参数以生成并发的形式施加可保留17-22%的功率作用力,由此分离出一个占位对吞吐量的原则;基于该执行器重建的控制器在三次重复中控制了实时的72B rollout生成工作负载:相对静态安全基线输出多35.7%,预算违规为2.27 ± 1.08%,比无控制运行少87.2%的违规,并在受约束控制器中取得最佳平均吞吐量与每token能耗,且一个自适应阈值规则在三种运行条件之一中与之持平。在现实的测量窗口下,原72B瞬态从半秒分辨率的23.6%降至30秒的1.6%、5分钟为零;一个16-GPU组合机群在30秒及更长窗口下零违规,峰值需求为铭牌功率的50-56%。对该机群配置而言,约2倍的铭牌超额订阅似乎是可行的,但需经运维方验证。我们量化了经济与碳影响,并给出一个低成本运维试点方案。