论文
SpecMoE:经由自辅助投机解码实现快速高效的MoE推理
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
摘要
混合专家(MoE)架构通过选择性激活参数,已成为缓解大语言模型(LLM)不断攀升的计算成本的一种有前景的方法。然而,其高内存需求与欠佳的参数效率为高效部署带来重大挑战。尽管文献中已提出CPU卸载的MoE推理系统,但其效率有限,在大批次下尤甚。本工作提出SpecMoE,一个基于我们自辅助投机解码算法的内存高效MoE推理系统。SpecMoE证明了无需额外模型训练或微调即可将投机解码应用于MoE推理的有效性。我们的系统将推理吞吐提升最高达4.30倍,同时在内存受限系统上显著降低内存与互连两方面的带宽需求。
