论文
通过在 Transformers 中跨层共享神经专家来提高参数利用率
Improving Parameter Utilization by Sharing Neural Experts Across Layers in Transformers
摘要
基于 Transformer 的大型语言模型通常会受到层间参数冗余的影响,其中功能转换是跨网络深度冗余学习的。我们提出了 CS-MoE,这是一种新颖的 Transformer 架构,具有跨层专家共享的特点,可以解决这种低效率问题。与广泛使用的专家混合 (MoE) 架构(用层隔离的专家终止每个 Transformer 块)不同,CS-MoE 将层独立的专家与对集中式全球共享专家池的并发访问结合起来。这种 \textit{全球专家共享} 机制可以实现对词元级参数激活和计算消耗(FLOP)的弹性控制。实验表明,CS-MoE 比同等规模的密集 Transformer 实现了更低的复杂度,同时仅激活 55% 的参数。此外,其性能随着激活专家数量的增加而单调扩展,并接近通过固定 FLOP 预算扩展共享池来消耗更多 FLOP 的 MoE 同行。 CS-MoE 还在计算成本和模型容量之间建立了灵活的帕累托边界,为计算受限的环境提供了有效的替代方案。