开源项目

vLLM 0.31.0:DeepSeek-V4.1-Flash默认路径与快速重启

v0.31.0

AI 基础设施推理服务

概述

vLLM 0.31.0包含307位贡献者的717项提交。DeepSeek-V4.1-Flash性能:FlashMLA巨型注意力配合V4.1 NVFP4压缩KV缓存成为SM100默认;索引器采用DeepGEMM稀疏MQA logits,Mega-Gate把门控GEMM与专家选择融合;解码边界融合TP all-reduce、mHC输入准备与MoE finalize;SM100/SM103上小批量WO-A与逆RoPE、MXFP8量化融合;Engram wkv按TP分片,主机表在共置DP副本间默认共享;视觉塔启用编码器CUDA图;SWA有界重放使滑动窗口KV不进入前缀缓存。快速重启:新vllm preload CLI启动权重缓存守护进程,把后量化权重常驻显存跨引擎重启,支持数据并行、MTP草稿模型、/health端点与就绪等待;实验性vllm snapshot create/restore用CRIU恢复完全初始化的TP1引擎。Model Runner V2与推测解码:草稿模型推测解码与自定义logits处理器;新LiLiCorr起草器;DFlash异步调度;DSpark自适应验证;WideEP部署的MoE内存计入剖析。大规模服务:MoonEP均衡EP all2all、预填充上下文并行、DeepEPv2序列并行、RL用NCCL M2N权重传输后端、KV卸载背压检测。调度控制:--max-num-active-seqs独立限制RUNNING准入、等待队列重排使已持KV块请求优先、修复KV连接器+MTP死锁。HiSparse加固多项。升级者需核对硬件与内核依赖,快照特性为实验性。