论文

ExFusion:通过多专家融合进行高效 Transformer 训练

ExFusion: Efficient Transformer Training via Multi-Experts Fusion

摘要

专家混合 (MoE) 模型通过增加密集架构的容量来显着提高性能。然而,直接训练 MoE 模型需要大量的计算资源,并在参数存储和部署方面引入额外的开销。因此,开发一种方法,利用教育部的多专家能力来提高性能,同时将额外成本降至最低,这一点至关重要。为此,我们提出了一种新颖的 预训练 方法,称为 ExFusion,它通过多专家融合提高了 Transformer 训练的效率。具体来说,在初始化阶段,ExFusion 将 Transformer 的前馈网络 (FFN) 升级为多专家配置,其中每个专家都被分配一个权重,以供以后的参数融合使用。在训练过程中,这些权重允许多个专家融合成一个相当于原始 FFN 的统一专家,随后用于前向计算。因此,ExFusion 在训练过程中引入了多专家特征,而与标准密集训练相比,仅产生边际计算成本。训练后,学习到的权重用于将多个专家集成为一个统一的专家,从而消除存储和部署方面的额外开销。对各种计算机视觉和自然语言处理任务的大量实验证明了所提出方法的有效性。