开源项目
vLLM v0.30.0:Fast Start 权重缓存与 HiSparse KV 分层
vllm-project/vllm v0.30.0
概述
vLLM 是面向大模型的开源推理与服务引擎。KV 缓存保存已计算的注意力状态,用于减少重复计算。 vLLM v0.30.0 新增 Fast Start:常驻 GPU 的权重缓存可通过 CUDA IPC 被重启后的引擎复用,使用 --load-format ipc_cache 接入。 HiSparse 通过 HiSparseConnector 将稀疏 MLA 的 KV 页分层存放在主机内存与 GPU 热缓冲区。版本还扩展 Model Runner V2 的双批重叠,以及流水线并行下的投机解码和服务缓存共享。