论文

大规模机器学习模型服务系统的负载测试

Load Testing for Machine Learning Model Serving Systems at Scale

AI 基础设施推理服务

摘要

机器学习 (ML) 模型服务已成为 GPU 基础设施的主要消费者,但这些系统中的容量规划在很大程度上仍然是临时的。供应不足会导致服务级别目标 (SLO) 违规和生产事故,而供应过多会导致大量资源浪费。本文提出了 \sys,这是一种用于机器学习服务系统的工业负载测试框架,它通过自适应、反馈驱动的搜索策略系统地估计服务容量。该方法利用实时性能信号,结合阻尼、尖峰容限和收敛检测来有效识别 SLO 约束下的最大可持续吞吐量。我们通过对涵盖四个 ML 架构类别的 14 个工业案例研究的纵向分析来评估 \sys:推荐、排名、视觉和 NLP。这项研究表明,系统负载测试可以显着提高 GPU 资源效率和运行可靠性。在采用 \sys 之前,很大一部分模型启动配置不足,导致事件反复发生;部署后这些问题大大减少。我们的结果表明,特定于 ML 的设计决策对于准确的容量估计至关重要:使用记录的流量进行工作负载校准可将估计误差从大约 30% 减少到 2--6%,而适当的预热处理可将准确性提高 22.2%。进一步分析揭示了影响预测误差的关键因素,包括模型大小和共址效应。本文总结了六个经验教训,并得出了 ML 负载测试的架构指南,为构建可靠且高效的 ML 服务系统提供了可操作的见解。