论文
冗余与协同:通过次模优化为 MoE 进行依赖感知专家选择
Redundancy Meets Synergy: Dependency-aware Expert Selection for MoE via Submodular Optimization
摘要
虽然专家混合 (MoE) 模型通过稀疏激活有效地扩展模型容量,但其部署往往因内存需求过高而受到瓶颈。提取一个紧凑的专家子集提出了一个有前途的解决方案。然而,现有的专家选择启发式主要依赖于 Top-k 排名,这孤立了单个专家的评估,并忽略了 MoE 门控网络引入的复杂的专家间依赖关系。在本文中,我们提出了 DS-MoE,这是一个基于理论的框架,通过次模函数之差(DS)优化重新定义专家选择。通过分析损失退化的二阶泰勒展开,我们揭示了专家组合中的功能二元性:冗余(专家对重叠表示进行编码)和协同(专家提供互补的错误消除)。为了驾驭这种二元性,我们通过将选择目标表示为 DS 函数,在数学上将冗余减少与协同最大化解耦。此外,我们设计了一种定制的上界最小化(MM)算法,具有可证明的单调性保证,可以有效地识别最佳专家子集。大量实验表明,DS-MoE 有效地保留了不可或缺的专家组合,与最先进的基线相比,实现了卓越的性能。