论文

语言与能量鸿沟:测量多语言 LLM 推理的能量成本

The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地部署在多语言环境中,但跨不同语言服务这些模型的能源成本仍然知之甚少。我们利用 ML.Energy 框架对跨语言的推理能耗进行了系统研究(Chung 等人,2026)。我们发现了惊人的差异:不同语言中每个输出词元的能耗​​差异高达 8.3 倍,而一组固定请求的总能量在最便宜(英语,17.6 kJ)和最昂贵(普什图语,3,147 kJ)语言之间差异高达 179 倍。我们的分析表明,这种差异是由两个复合因素驱动的:(1)使用复杂或罕见脚本的语言的每个词元能源成本更高,以及(2)为低资源语言生成更多词元。此外,我们发现了双重成本+性能损失:具有最高能量足迹的语言也往往实现最低的任务准确性。我们发现,模型、硬件和任务之间仍然存在能源鸿沟,这表明多语言 LLM 部署中存在系统性能源不平等。最后,我们建议社区将能源视为一流的评估轴,扩展报告清单和模型卡以将其纳入其中,并采取部署方缓解措施以提高能源效率。