论文
JouleShare:为批量LLM服务分配请求级能耗
Request-Level Energy Attribution for Batched LLM Serving
摘要
批量LLM服务提高了吞吐量,但复杂了能源计量。GPU功率遥测是汇总的,而可持续性报告、计费和工作负载分析通常需要请求级别的能源费用。现有的推理-能源基准报告模型、阶段或令牌级别的能源,而最近的碳核算工作促使Shapley公平性概念化。两者都没有提供实际的请求级别基准,因此实践中使用的能源分配规则与公平分配之间的差距仍然未知。我们提出了JouleShare,这是一种基于两个组件的归因框架。一个离线Harness通过在vLLM上重复播放请求子集并使用可重复协议来建立基准,集成GPU功率遥测,并为每个请求计算精确的Shapley能源。然后轻量级的校准模型JCalib学习从廉价的请求特征预测Shapley份额,用于服务时间。在16个模型/工作负载运行中,平均静态批量下的令牌比例归因与精确Shapley的差异为0.440个标准化L1,而连续批量下的差异为0.458,差距在三个数据中心GPU上重复。JCalib在静态批量下将误差降低到0.116,而在连续批量下降低到0.177,甚至低于在线不可用的单独测量基准,同时保留精确的批量能源效率。样本Shapley扩展了测量的参考基准,其中差距持续存在,而单个离线校准仍然是最准确的部署规则。结果表明,令牌归因在批量执行下不是边际能源的可靠代理,而测量的Shapley基准可以将低成本请求特征调校到更公平的归因。
