开源项目

vLLM:0.14.0起默认启用异步调度

vllm-project/vllm

模型推理批处理与并行

概述

vLLM是开源的大模型推理与服务引擎,供团队高吞吐地部署语言模型。0.14.0正式版默认启用异步调度,0.15.0进一步支持异步调度结合流水线并行,调度执行机制发生实质变化,高并发场景下的请求处理方式随之调整。项目采用Apache-2.0许可,提供安装与运行入口,升级版本后可沿用既有部署配置,建议对吞吐与延迟做对比验证。