论文
BEAM:面向MoE动态路由的二值专家激活掩码
BEAM: Binary Expert Activation Masking for Dynamic Routing in MoE
摘要
混合专家(MoE)架构通过每个token只激活一部分专家来提升大语言模型的效率。然而,标准MoE采用固定的Top-K路由策略,导致冗余计算和欠佳的推理延迟。现有加速方法要么需要在改动架构的情况下进行代价高昂的重新训练,要么因训练—推理不匹配而在高稀疏度下出现严重性能下降。为解决这些局限,我们提出BEAM(二值专家激活掩码),一种通过可训练二值掩码学习token自适应专家选择的新方法。借助直通估计器与辅助正则化损失,BEAM通过端到端训练诱导动态专家稀疏性,同时保持模型能力。我们进一步为BEAM实现了高效的自定义CUDA内核,确保与vLLM推理框架无缝集成。实验表明,BEAM在保持原模型98%以上性能的同时,将MoE层FLOPs最多降低85%,实现最高2.5倍解码加速和1.4倍吞吐提升,证明其作为实用、即插即用的高效MoE推理方案的有效性。
