论文
FluxMoE:为高性能 MoE 服务解耦专家驻地
FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving
摘要
专家混合 (MoE) 模型已成为将语言模型扩展到数千亿个专家参数的主流。尽管专家激活稀疏,但现有的推理引擎使所有专家都驻留在 GPU 上,从而在大批量、长输出离线工作负载中挤出了键值缓存。我们推出了 FluxMoE,它将专家与物理 GPU 驻留分离,并通过新的 \emph{专家分页} 抽象来调整其占用空间以适应可用内存。 FluxMoE 结合了用于透明重新映射的 PagedTensor、跨越无损压缩 GPU 内存和主机 DRAM 的带宽平衡层次结构以及预算感知驻留规划器。与 CPU-GPU 协同推理和全层卸载不同,FluxMoE 按需传输权重,同时在 GPU 上保持专家计算。我们在 vLLM 之上实现 FluxMoE,并在三个 MoE 模型上对其进行评估。对于 8$\times$H20 GPU 上的 GLM-4.5,FluxMoE 可提供高达 7.2$\times$ vLLM 的吞吐量,并将平均每个输出词元时间 (TPOT) 降低 79.0\%,并且使用无损压缩不会造成可测量的模型质量损失。对于 2$\times$L40S GPU 上的 Mixtral-8$\times$7B-Instruct,权重驻留 vLLM 无法适应,FluxMoE 可提供 4.3$\times$ KTransformers 的吞吐量,平均 TPOT 降低 29.1\%。