论文
从词元到瓦时:现代 GPU 上 LLM 推理的分析能量估算
From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
摘要
大语言模型 (LLM) 推理的运行能耗正在成为已部署的人工智能系统环境足迹中越来越重要的组成部分。然而,推理能量的直接测量通常需要硬件遥测、电力仪器或特定于基础设施的监控,限制了其在比较研究、早期系统设计和可持续性报告中的适用性。本报告提出了一种分析结构、经验校准的 GPU 级方法,用于估计 NVIDIA H100 级加速器上的 LLM 推理能量,而无需直接测量运行时间。所提出的估计器结合了参数缩放的 Transformer FLOP 计算、校准的内存流量因子和硬件特定的能量系数,用于 FP16/BF16 张量核心计算和高带宽内存移动。它明确地将提示预填充与自回归解码分开,从而实现输入标记、输出标记和完整推理请求的能量估计。该方法进一步将总能量分解为计算、参数访问、键值缓存写入和注意力读取组件,从而允许分析模型大小、上下文长度和生成词元计数的扩展行为。由此产生的估计并不旨在取代物理功率测量;相反,它们提供了透明、可重复且假设明确的近似值,适用于模型比较、绿色编码分析和 LLM 推理工作负载的设计时评估。