论文
破冰:分析 vLLM 中的冷启动延迟
Breaking the Ice: Analyzing Cold Start Latency in vLLM
摘要
随着可扩展的推理服务变得流行,推理引擎的冷启动延迟变得非常重要。如今,vLLM 已发展成为许多推理工作负载事实上的首选推理引擎。虽然很受欢迎,但由于其复杂性和快速演进,目前还没有对其引擎的启动延迟进行系统的研究。凭借其下的主要架构创新(例如,V1 API、torch.compile 的引入),在本文中,我们首次展示了 vLLM 启动延迟的详细性能特征。我们将启动过程分解为六个基本步骤,并证明该过程主要受 CPU 限制。每个步骤都在模型和系统级参数方面表现出一致且可解释的扩展趋势,从而实现延迟源的细粒度归因。基于这些见解,我们开发了一个轻量级分析模型,可以准确预测给定硬件配置下 vLLM 的启动延迟,为大规模推理环境中的资源规划提供可行的指导。我们所有的基准测试数据集、分析工具和预测脚本均开源于 https://github.com/upb-cn/vllm-startup-profiler