论文
EnergyLens:用于多模态 LLM 推理服务的可解释的封闭式能量模型
EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving
摘要
随着 大语言模型 跨越密集、专家混合和状态空间架构,并在日益多样化的多模式工作负载下部署在异构加速器上,优化推理能量已变得与优化延迟和吞吐量一样重要。现有方法要么将延迟视为能量代理,要么依赖需要大量数据的黑盒代理。两者都在不同的并行策略下失败:在我们测试的超过 20% 的配置中,延迟和能量最优存在差异,并且黑盒代理需要数百个分析样本才能跨模型系列和硬件进行概括。我们提出了 EnergyLens,它使用符号回归作为分析数据的结构发现工具,以导出以系统属性(例如并行度、批量大小和序列长度)表示的单个十二参数封闭式能量模型。与黑盒代理不同,EnergyLens 将张量和管道并行性贡献解耦,并将预填充与解码能量分开,使其预测在物理上可解释且可操作。 EnergyLens 通过少至 50 个分析测量进行拟合,在许多评估场景中实现了 88.2% 的 Top-1 配置选择准确度,而最接近的先前分析基线的准确度为 60.9%,与集成 ML 方法的预测准确度相匹配,分析样本数量减少了 10 倍,并可靠地推断出未见的批量大小和硬件平台,无需结构修改,使其成为能源优化 LLM 部署的实用、可解释的工具。