论文
多层次上下文建模,在专家混合中实现一致的专家选择
Multi-level context Modeling for consistent expert selection in Mixture-of-Experts
摘要
专家混合 (MoE) 通过将词元路由到一小部分专家来实现 Transformer 模型的高效扩展。然而,现有的路由器通常将专家选择限制在浅层或孤立的词元表示上,这通常会产生不稳定且语义不一致的跨层路由决策。在这项工作中,我们从代表性的角度重新审视专家选择,并将上下文不完整性确定为限制有效专家专业化的关键瓶颈。为了解决这个问题,我们提出了多级上下文融合 MOE(MCF-MOE),该框架通过集成跨层语义聚合和本地 词元级 交互的互补信号来构建上下文感知表示,从而实现信息更丰富且一致的专家选择。语言建模和理解基准的实验表明,MCF-MOE 在强大的 MoE 基线上持续提高了路由一致性和下游性能,凸显了专家路由中上下文完整性的重要性。代码可在 https://github.com/shuhan Huang/MCF-MOE 获取。