论文
本地LLM能效:消费级GPU上的初步功耗基准
Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware
摘要
本地部署大规模语言模型(LLMs)受到隐私担忧和对本地推理需求的推动。然而,消费者硬件上的能耗成本尚未充分研究,因为大多数基准测试仅关注准确度。本文报告了对九个开源LLMs(1B到7B参数)在单个消费者GPU(RTX 4060Ti 16GB)上的硬件级能耗基准测试。使用Ollama推理引擎,通过nvidia-smi在固定提示集上采样GPU功耗。我们评估平均/峰值功耗、每提示能耗(J/prompt)、每输出令牌能耗(J/token)和吞吐量(tok/s)。我们的发现表明,除了原始参数数量之外,模型架构和量化策略等因素也影响能耗效率。具体而言,gemma3:1B和llama3.2:1B在能耗(0.56 J/token和0.65 J/token)和吞吐量(>170 tok/s)方面表现出最低能耗和最高吞吐量。相比之下,7B-Mistral模型消耗比最高效模型多4.4倍的能耗。值得注意的是,qwen3.5:2B由于延长的内部推理而表现出异常高的每提示能耗,突显了在效率指标中区分令牌生成模式的必要性。