论文
GreenBench:Apple Silicon 上开源 LLM 推理的能源效率和碳足迹基准测试
GreenBench: Benchmarking Energy Efficiency and Carbon Footprint of Open-Source LLM Inference on Apple Silicon
摘要
大语言模型 (LLM) 的快速扩散引起了人们对其推理过程中环境影响的担忧。虽然绿色人工智能研究主要集中在数据中心 GPU 和嵌入式平台上,但 Apple Silicon 上的 LLM 推理及其统一内存架构的能源概况仍未得到研究。本文介绍了 GreenBench,这是一个基准测试框架,用于评估五个开源 LLM(3-9B 参数)在具有 48 GB 统一内存的 Apple M4 Pro 上执行三个 NLP 任务的能源效率、吞吐量和碳足迹。使用 macOS powermetrics 进行直接功耗测量和 Ollama 的纳秒精度计时,我们发现 M4 Pro 在持续推理过程中仅消耗 0.47 W 的 CPU+GPU 封装功耗,系统总功耗为 8-12 W,在单用户部署中,每个词元的能效比数据中心 GPU 高 30-40 倍。与较大型号 (7-9B) 相比,较小型号 (3-3.8B) 的吞吐量提高了 2.6-4.2 倍,并且每个词元的能耗降低了 62%。 Pareto 分析将 Qwen 2.5 (7B) 确定为 57% MMLU 和 59 个词元/秒的最佳准确率-效率权衡,而 Llama 3.2 (3B) 适合 175 个词元/秒的延迟关键型应用程序。我们提供包和系统级别的每个词元能源以及印度和美国电网的二氧化碳排放估算。