论文

对混合专家的统计理解

Towards a Statistical Understanding of Mixture-of-Experts

模型评测模型行为与机制分析

摘要

专家混合 (MoE) 架构通过输入相关的路由组合专家预测器集合来提高模型容量,同时通常只为每个输入激活一小部分专家。尽管它们在现代大型模型中越来越重要,但它们的设计选择的统计作用,特别是路由、稀疏激活和共享专家,仍然只有部分被理解,因为现有理论主要集中在参数化或正确指定的 MoE 模型上。在本文中,我们将 MoE 视为局部聚合的一种形式,并展示了这种局部化如何重塑近似-估计-计算权衡。我们推导出用于通过不断发展的专家学习密集和稀疏路由、分离近似、专家学习和路由器估计误差的预言机风险界限,并描述稀疏 Top-K 路由如何在控制每个输入计算的同时保留局部聚合的优势。我们还通过输入空间的几何结构解释门控,将路由性能与本地专家优势区域联系起来,并展示 DeepSeekMoE 等架构中采用的共享专家如何提取共同的预测结构,以便路由专家专注于残余局部变化。总之,这些结果提供了一个统一的统计框架,用于通过依赖于输入的专家聚合来理解 MoE,其中专家专业化和计算权衡由局部预测结构控制。