开源项目
vLLM v0.28.0:模型适配、推测解码与默认配置更新
vllm-project/vllm v0.28.0
概述
vLLM v0.28.0 的官方发布材料列出 Kimi-K3 Decode Context Parallel、DeepSeek V4 sparse MLA 等适配,以及 DFlash2、DSpark 相关推测解码改进;这些变化分别适用于对应模型或解码路径,不能推定所有模型统一提速。版本还加入分层 KV 磁盘卸载。 升级配置需注意:默认 max_num_batched_tokens 从 8192 调整到 16384,Mamba 前缀缓存改为默认启用;bitsandbytes 迁至树外插件,Transformers 依赖升级至 5.15.0,并移除 calculate_kv_scales、override_attention_dtype 参数。运维团队应按原配置做兼容性检查与负载回归。