论文
DAG-MoE:专家混合中从简单混合到结构化聚合
DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts
摘要
专家混合(MoE)模型已成为在大语言模型中将参数量与计算成本解耦的主流方法,但有效扩展MoE性能仍是一个挑战。先前工作表明,细粒度专家扩大了专家组合空间并提升灵活性,但也带来可观的路由开销,形成新的可扩展性瓶颈。本文探索另一个互补的扩展轴——专家输出如何被聚合。我们从理论上证明,用结构化聚合替换标准的加权求和聚合,可以在不改动专家和路由器的情况下扩展专家组合空间,并使单个MoE层内实现多步推理成为可能。为此,我们提出DAG-MoE,一个稀疏MoE框架,它采用轻量模块在选中的专家之间自动学习最优聚合结构。在标准语言建模设置下的大量实验表明,DAG-MoE在预训练和微调中均持续提升性能,超越传统MoE基线。
