开源项目
vLLM-Kunlun:增加MiMo Flash V2与SWA算子支持
baidu/vLLM-Kunlun
概述
vLLM-Kunlun Plugin 是将vLLM模型层与昆仑芯XPU后端解耦的硬件插件,供开发者减少侵入式适配。 本次增加MiMo Flash V2模型接口与权重加载调整、SWA+Sink算子及MTP底层准备,并提供精度对齐和性能分析工具。材料同时披露已覆盖多类主流与多模态模型。 覆盖型号不代表所有模型无需修改;具体组网、精度和算子支持需按仓库版本检查。MTP底层准备不能直接写成完整功能已上线。