论文

跨部署堆栈优化 AI 推理

Optimizing AI Inference Across the Deployment Stack

模型评测评测方法与指标

摘要

AI 部署性能不仅仅取决于模型架构,还取决于压缩、编译器转换和服务策略之间的交互。已发布的基准测试通常会报告无与伦比的条件下的延迟和吞吐量,从而限制了它们在部署决策中的使用。本文提出了跨部署堆栈的推理优化的统一分析处理。我们引入了三层分类法,涵盖模型级技术,例如量化、剪枝和 蒸馏;编译器转换,例如图融合、布局优化和内核自动调整;以及动态批处理、准入控制和内存分层等系统策略。我们将部署制定为关于准确性、延迟、吞吐量、内存占用和能量的约束多目标优化问题,并分析具有帕累托单调性和规模不变性的部署排名函数。 Roofline 模型显示了内存带宽层次结构如何在精度范围内限制性能,而排队模型则解释了服务时间变化如何放大负载下的响应时间。为了提高可比性,我们提出了一个证据协议,将测量的、导出的和分析的主张分开;限制与论文内结果的数值比较;并需要报告硬件、软件版本、批处理语义和热状态。我们综合了来自边缘平台的证据,包括 Jetson AGX Orin 和五个推理框架;数据中心 GPU,包括带有三个 LLM 服务引擎的 A100 和 H100; Llama-3.1 系列的量化研究。综合表明,部署结果受到跨层交互的控制,单层分析无法预测这一点。我们以约束感知选择过程和编译器服务协同优化、跨硬件性能预测和标准化能源报告中的开放问题作为结论。