论文
用于语言建模的异构分组专家的混合
Mixture of Heterogeneous Grouped Experts for Language Modeling
摘要
基于混合专家 (MoE) 的 大语言模型 (LLM) 因其有效扩展性能的能力而在工业应用中至关重要。然而,标准 MoE 强制执行统一的专家规模,造成了僵化,无法将计算成本与不同的 词元级 复杂性保持一致。虽然异构专家架构试图通过多样化专家规模来解决这个问题,但它们经常面临重大的系统级挑战,特别是 GPU 利用率不平衡和参数利用率低效,这阻碍了实际部署。为了弥合理论异构性和强大的工业应用之间的差距,我们提出了异构分组专家混合(MoHGE),它引入了两级路由机制来实现灵活的、资源感知的专家组合。为了优化推理效率,我们提出了 Group-Wise Auxiliary Loss,它根据任务难度动态地将词元引导到参数效率最高的专家组。为了解决 GPU 负载平衡的关键部署挑战,我们引入了全规模组解耦分配策略以及组内专家辅助损失。这些机制共同确保 GPU 之间的计算分布一致。广泛的评估表明,MoHGE 与 MoE 架构的性能相匹配,同时将总参数减少约 20%,并保持平衡的 GPU 利用率。我们的工作为资源高效的 MoE 设计建立了一个可扩展的范例,为优化现实场景中的推理成本提供了实用的解决方案。该代码可在 https://github.com/UnicomAI/MoHGE 上公开获取。