论文

揭示专家内部激活稀疏性以实现高效的专家混合模型执行

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

模型推理推理加速

摘要

专家混合 (MoE) 架构已成为最先进的 大语言模型 的标准,因为它通过稀疏专家激活实现了计算效率。然而,由于专家崩溃和负载不平衡等基本训练挑战,通过更精细的专家粒度实现稀疏性变得越来越困难。在这项工作中,我们探索并利用专家内部激活稀疏性作为 MoE 模型中稀疏性的补充和未充分探索的维度。令人惊讶的是,在现有的预训练 MoE 模型中很容易获得大量的专家内部稀疏性,而无需对激活函数或模型参数进行任何修改,从而在每个专家内提供高达 90% 的稀疏性,而不会造成显着的准确性损失。我们探索了从 1B 到 400B 参数的 8 个现成 MoE 模型的专家内激活稀疏性,并扩展了 vLLM 的 MoE 执行管道,通过跳过不活动神经元的计算来利用专家内激活稀疏性,在现有优化的基础上,与原始密集 vLLM 基线相比,在 MoE 层执行中实现高达 2.5 倍的加速和 1.2 倍的端到端加速。