开源项目
vLLM-Kunlun:整合推理服务秒级扩缩容方案
baidu/vLLM-Kunlun
概述
vLLM-Kunlun 是面向昆仑芯的大模型推理适配项目,供工程团队在相应硬件上部署和优化服务。 此次材料披露权重传输、编译缓存、Lazy CUDA Graph、守护实例与进程启动优化组合,降低扩容时重复加载和编译开销,并描述对P800、P900及推理引擎的适配。 秒级响应与10到30倍启动改善来自给定集群和权重条件。具体版本支持矩阵应以仓库为准,不能把同一传输结果推广到所有模型、网络或存储配置。