开源项目
vLLM v0.29.0将Model Runner V2设为默认
vllm-project/vllm
概述
vLLM 是大模型推理服务引擎,Model Runner 负责模型执行和相关缓存、采样流程。 vLLM默认启用Model Runner V2,增加KV缓存自动定容的CUDA图内存分析及分片采样;部分ROCm模型和功能仍使用旧执行器。 Model Runner V2现成为所有模型的默认执行器,完成从池化模型开始的推广。新增用于KV缓存自动定容的CUDA图内存分析、将每步logits内存降为1/TP的分片采样、提示嵌入、隐藏状态提取推测、推测解码下统一解码的填充完整CUDA图调度,以及EAGLE/MTP草稿预填充前跳过DP同步。少数ROCm模型及V2尚不支持的功能仍使用V1。