论文

确定生产中的能源效率最佳点 LLM Inference

Determining Energy Efficiency Sweet Spots in Production LLM Inference

模型评测评测方法与指标

摘要

大语言模型 (LLM) 推理是现代人工智能应用的核心,因此了解其能源足迹至关重要。现有方法通常通过输入和输出序列长度的简单线性函数来估计能耗,但我们的观察揭示了清晰的能源效率制度:峰值效率出现在短至中等长度的输入和中等长度的输出时,而长输入或非常短的输出时效率急剧下降,表明非线性依赖性。在这项工作中,我们提出了一种源自 Transformer 架构的计算和内存访问复杂性的分析模型,能够准确地将效率曲线描述为输入和输出长度的函数。为了评估其准确性,我们在 NVIDIA H100 GPU 上使用 TensorRT-LLM 评估了从 1B 到 9B 参数的不同 LLM 集(包括 OPT、LLaMA、Gemma、Falcon、Qwen2 和 Granite)的能耗,并在 64 到 4096 个token的输入和输出长度上进行了测试,平均 MAPE 为 1.79%。我们的结果表明,将序列长度与这些效率“最佳点”对齐可以大大减少能源使用,支持生产系统中的知情截断、摘要和自适应生成策略。

SweetSpot:预测LLM推理能效的分析模型
图3。汇总的能效热力图。展示模型能量效率聚合平均值的热力图。