论文

通过预测预取和专家复制进行快速 MoE 推理

Fast MoE Inference via Predictive Prefetching and Expert Replication

模型推理推理加速

摘要

专家混合 (MoE) 架构已成为最先进的 大语言模型 (LLM) 的基本构建块,提高了 LLM 的特定领域专业知识并扩展模型容量,而无需按比例增加计算开销。然而,MoE 推理经常会遇到 GPU 利用率不理想、负载不平衡以及由于专家激活的稀疏性而导致多个词元等待同一专家进行计算而导致的延迟增加。为了应对这些挑战,我们提出了一种动态专家复制策略,该策略可以预测哪些专家可能会超载,并为即将到来的批次词元复制它们。复制的专家跨层同时处理批处理词元,从而提高并行性、缩短 GPU 空闲时间并显着加快推理速度。对大型 MoE 模型(包括 Switch-base-128 和 Switch-base-256)进行的实验评估表明,我们的方法实现了接近完全的 GPU 利用率(约 100%),从而将推理速度提高了 3 倍,同时保留了基准架构约 90-95% 的性能