论文
可扩展的人工智能推理:人工智能模型服务的性能分析和优化
Scalable AI Inference: Performance Analysis and Optimization of AI Model Serving
摘要
人工智能研究通常强调模型设计和算法性能,而部署和推理尽管对于现实世界的使用至关重要,但仍相对未得到充分探索。本研究通过调查与 graphworks.ai 合作开发的用于可扩展模型服务的基于 BentoML 的 AI 推理系统的性能和优化来解决这一差距。评估首先在三种实际工作负载场景下建立基准性能。为了确保评估的公平性和可重复性,在整个实验过程中使用了预先训练的 RoBERTa 情感分析模型。该系统遵循伽马和指数分布的流量模式,以模拟真实世界的使用条件,包括稳定、突发和高强度的工作负载。收集并分析延迟百分位数和吞吐量等关键性能指标,以识别推理管道中的瓶颈。根据基线结果,在服务堆栈的多个级别引入优化策略,以提高效率和可扩展性。然后在相同的工作负载条件下重新评估优化后的系统,并使用统计分析将结果与基线进行比较,以量化所应用的改进的影响。研究结果展示了使用 BentoML 实现高效且可扩展的 AI 推理的实用策略。该研究研究了不同工作负载下的延迟和吞吐量如何扩展,运行时、服务和部署级别的优化如何影响响应时间,以及单节点 K3s 集群中的部署如何影响中断期间的恢复能力。