开源项目

SGLang-FluentLLM:开放LongCat国产卡推理路径

meituan-longcat/SGLang-FluentLLM

AI 基础设施模型推理推理加速AI 芯片推理服务模型服务框架

概述

SGLang-FluentLLM 为LongCat模型提供推理工程实现,面向需要适配GPU或国产NPU部署的团队。 此次配套开放NPU分支,并通过PR向SGLang主干提供GPU侧优化,实现模型与推理系统共同设计的部署路径。 两条路径处于不同仓库与合入状态,应分别核对分支和PR;不能把代码开放或PR提交解释为上游稳定版已包含全部优化。