论文
MAPLE:MoE 自适应即插即用逐层专家分配
MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation
摘要
稀疏激活专家混合 (MoE) Transformer 普遍固定所有层中相同数量的路由专家,这种约定忽略了逐层冗余中记录良好的异质性。我们证明这种均匀性在系统上是次优的,并提出了 MAPLE,这是一种即插即用的框架,可以跨任何预训练的 MoE LLM 的层异构地重新分配路由专家预算,而无需修改权重或需要重新训练。我们的核心贡献是封闭形式的敏感性引导分配:我们探究每一层对专家数量变化的响应,使用三种措施量化敏感性,并得出分析上的最佳预算分配,将容量引导至敏感层并吸收冗余层的减少。这种封闭形式的解决方案通过灵敏度约束的遗传搜索进一步细化,该搜索使用分层灵敏度作为指导探索的先验,从而产生更快的收敛和卓越的分配质量。在跨越不同规模和架构的四个 MoE 模型上,MAPLE 在 75% 的路由专家预算下优于统一和基于修剪的基线。值得注意的是,在 DeepSeek-MoE-16B 上,MAPLE 仅使用了 75% 的专家,但超过了 ARC-E、ARC-C 和 BoolQ 上原来的 100% 专家统一基线,将准确率分别从 65.09 提高到 71.40、48.49 提高到 51.50、以及 80.03 提高到 82.38。这些准确性的提高转化为可测量的部署效率:在 SGLang 中实施 MAPLE 将单 GPU 端到端服务延迟减少了 32.2%,并将吞吐量提高了 47.4%。这些结果表明,精心设计的异构分配比简单地激活更多专家更有效,将其确立为提高教育部效率的原则性和实用性轴。