论文

PCoMoE:将 MoE 推理从整体专家选择转变为细粒度路径组合

PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition

模型推理推理加速

摘要

专家混合 (MoE) 架构通过激活每个词元的稀疏专家子集来有效扩展 大语言模型 (LLM) 容量。然而,现代MoE的推理仍然受到严格的、全专家抽象的严重限制。现有框架将专家作为原子执行单元进行管理、调度或修剪,这过早地修复了优化边界,并导致细粒度的专家内部计算冗余未得到充分探索。在这项工作中,我们提出了 PCoMoE,一种路径组合执行框架,它将 MoE 推理从粗粒度的专家选择转变为细粒度的路径组合。 PCoMoE 结合了专家计算的路径级公式、用于抑制低值路径组合的兼容性感知分层修剪策略,以及用于在严格有限的开销下利用可重用的子专家结构的硬件友好的执行引擎。实验结果表明,PCoMoE 实现了高达 1.31 倍的端到端推理加速,同时模型精度提高了 10%。代码可在 https://github.com/gzyyy0/PCoMoE 获取