开源项目

vLLM-Kunlun:整合推理服务秒级扩缩容方案

baidu/vLLM-Kunlun

AI 基础设施模型推理推理加速推理服务模型服务框架

概述

vLLM-Kunlun 是面向昆仑芯的大模型推理适配项目,供工程团队在相应硬件上部署和优化服务。 此次材料披露权重传输、编译缓存、Lazy CUDA Graph、守护实例与进程启动优化组合,降低扩容时重复加载和编译开销,并描述对P800、P900及推理引擎的适配。 秒级响应与10到30倍启动改善来自给定集群和权重条件。具体版本支持矩阵应以仓库为准,不能把同一传输结果推广到所有模型、网络或存储配置。