论文

了解 大语言模型 推理在上下文长度和注意力架构上的能量缩放

Understanding the Energy Scaling of Large Language Model Inference Across Context Lengths and Attention Architectures

模型评测模型能力评测

摘要

大语言模型 (LLM) 的日益普及引起了人们对推理的能源消耗和环境影响的日益关注。本文采用多头注意力(MHA)、分组查询注意力(GQA)和带有滑动窗口注意力(SWA)的分组查询注意力,对代表性开源 LLM 的解码阶段能耗进行了系统的实证研究,以描述注意力架构如何在不同的推理工作负载下影响解码阶段的能耗。我们评估了不同上下文长度、批量大小和生成工作负载的四种模型,同时使用 NVIDIA 硬件计数器测量 GPU 能量。我们研究了上下文长度、注意力机制、键值 (KV) 缓存增长和批处理对解码阶段能耗的影响。结果表明,注意力机制是控制解码能量如何随上下文长度变化的主要因素。 MHA 模型表现出比 GQA 模型更陡峭的能量增长,而带有 SWA 的 GQA 保持几乎恒定的能量消耗。我们进一步表明,模型大小主要决定绝对能耗,而批处理可减少每个生成词元的能耗​​和请求延迟高达 87%。这些发现为选择节能 LLM 架构和推理配置提供了实用指导。