论文

Alloc-MoE:预算敏感的专家激活分配,以实现高效的专家混合推理

Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference

摘要

由于其稀疏激活机制,专家混合 (MoE) 已成为扩展 大语言模型 的主要架构。然而,大量的专家激活在推理过程中造成了严重的延迟瓶颈,特别是在资源受限的部署场景中。减少专家激活的现有方法可能会导致模型性能严重下降。在这项工作中,我们引入了 \emph{激活预算} 的概念作为专家激活数量的约束,并提出了 Alloc-MoE,这是一个统一的框架,可以在层和词元级别协调优化预算分配,以最大限度地减少性能下降。在层级别,我们引入了 Alloc-L,它利用敏感性分析和动态编程来确定跨层专家激活的最佳分配。在 词元级 中,我们提出了 Alloc-T,它根据路由分数动态重新分配激活,在不增加延迟的情况下优化预算分配。跨多个 MoE 模型的大量实验表明,Alloc-MoE 在激活预算受限的情况下保持了模型性能。特别是,Alloc-MoE 在 DeepSeek-V2-Lite 上以原始预算的一半实现了 1.15\times$ 预填充和 1.34\times$ 解码加速。