论文
每次成功目标能耗:面向智能体AI系统的目标级能耗核算
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
摘要
当前的AI能耗基准以单次模型调用或单次训练运行的粒度测量能耗。对经典单轮工作负载而言,这一单位仍然自洽。而对智能体系统——单个用户目标可能触发多步编排、工具调用、重试与故障恢复循环——调用次数是实现产物而非任务属性,推理级归一化会歪曲目标完成的能耗成本。我们提出A-LEMS(Agentic LLM Energy Measurement System),一个跨层测量框架,将AI能耗核算的单位从每次推理能耗重新定义为每次成功目标能耗(Energy per Successful Goal, EpG)。EpG汇总所有执行尝试(包括失败与重试)的总工作流能耗,并以成功完成的目标数归一化。A-LEMS通过时间边界模型、将RAPL信号映射到工作流级能耗的五层观测流水线,以及将每次测量绑定到硬件与运行时配置的可复现性协议,对能耗归因进行形式化。在EpG基础上,我们定义编排开销指数(Orchestration Overhead Index, OOI),在相同任务标准下分离编排相对于线性执行的能耗成本。在五个推理任务族与三个工具增强任务族上,智能体工作流的每次成功目标平均能耗比线性基线高4.33倍(888.1 J对比205.3 J)。这一开销由编排结构而非推理计算驱动。对工具增强任务,OOI反转为低于1.0倍:智能体执行比线性执行更省能,证实该度量捕捉的是编排结构而非固有的向上偏置。这些发现表明,每次推理能耗不足以刻画智能体AI。EpG与OOI为准确基准测试提供了测量基础——在这种测试中,编排结构是能耗成本的首要决定因素。
