论文
使用专家激活模式扩展多节点专家混合推理
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
摘要
最新的最先进 (SOTA) 大语言模型 (LLM) 使用专家混合 (MoE) 架构来扩展模型容量,无需按比例按词元计算,从而以可管理的服务成本实现更高质量的输出。然而,大规模 MoE 推理从根本上受到专家负载不平衡和低效词元路由的瓶颈,特别是在多节点部署中,词元不能保证路由到本地专家,从而导致显着的节点间全对所有通信开销。为了系统地描述这些挑战,我们在各种数据集上分析了 SOTA 开源 MoE 模型,包括 Llama 4 Maverick、DeepSeek V3-671B 和 Qwen3-230B-A22B,并收集了超过 10 万条真实的专家激活轨迹。在研究专家激活模式后,我们发现了所有前沿 MoE 模型中的各种持久属性:可变专家负载不平衡、特定领域的专家激活(其中专家受欢迎程度在任务系列(代码、数学、聊天、一般)之间变化)以及预填充和解码专家激活之间的强相关性。受这些发现的启发,我们提出了工作负载感知微批量分组和专家放置策略,以最大限度地提高目标专家的词元局部性,从而减少节点间通信。在模型和数据集中,这些优化有助于将 all2all 通信数据减少多达 20 个,从而降低 MoE 解码延迟并提高加速器利用率。