论文

SpecMoE:经由自辅助投机解码实现快速高效的MoE推理

SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding

摘要

混合专家(MoE)架构通过选择性激活参数,已成为缓解大语言模型(LLM)不断攀升的计算成本的一种有前景的方法。然而,其高内存需求与欠佳的参数效率为高效部署带来重大挑战。尽管文献中已提出CPU卸载的MoE推理系统,但其效率有限,在大批次下尤甚。本工作提出SpecMoE,一个基于我们自辅助投机解码算法的内存高效MoE推理系统。SpecMoE证明了无需额外模型训练或微调即可将投机解码应用于MoE推理的有效性。我们的系统将推理吞吐提升最高达4.30倍,同时在内存受限系统上显著降低内存与互连两方面的带宽需求。

SpecMoE:经由自辅助投机解码实现快速高效的MoE推理:论文配图
图2:CPU卸载式MoE推理:稠密层常驻GPU始终激活,稀疏层卸载至CPU,示例中三个输入token激活Exp #0与Exp #2。