论文

EnerInfer:能源感知设备上 LLM 推理

EnerInfer: Energy-Aware On-Device LLM Inference

AI 基础设施推理服务

摘要

设备上的 LLM 推理对于隐私保护、可靠且经济高效的部署越来越有吸引力,但其能源和热成本仍然是一个关键瓶颈。现有系统主要针对解码速度进行优化,隐含地假设更快的执行总是更可取的。相反,我们表明,设备上的 LLM 推理通常具有可利用的配置余量:适度降低 NPU 和内存频率可以保持体验质量 (QoE),同时大幅提高能源效率并减少热量。在生产中实现这一机会具有挑战性。最节能的 NPU/DDR 设置随模型、推理引擎、平台和运行时条件的不同而变化,不同配置之间没有稳定的排名。商业设备还缺乏组件级功率传感,并且外壳温度随着请求到达、响应长度和热历史而变化。为了应对这些挑战,我们提出了 EnerInfer,这是第一个设备上 LLM 推理框架,可共同管理 LLM 工作负载的能源效率、吞吐量和热舒适度。 EnerInfer 用分类的、模型结构感知的预测和排名驱动的在线反馈取代了每个模型的分析和传感器密集型控制。它可以预测 NPU/DDR 频率设置中未见的 LLM 的吞吐量和功率,在运行时干扰下选择满足 QoE 的高效配置,并使用轻量级有限范围热预测在能量优化和热约束推理之间动态切换。对现实世界 LLM 的评估表明,EnerInfer 将手机、笔记本电脑和开发板的能源效率分别提高了 65%、12% 和 24%,且不违反 QoE。