论文
稀疏视觉混合专家的教师引导路由
Teacher-Guided Routing for Sparse Vision Mixture-of-Experts
摘要
深度学习的最新进展是由越来越大规模的模型推动的,但由此产生的计算成本已成为关键瓶颈。稀疏专家混合 (MoE) 提供了一种有效的解决方案,通过为每个输入仅激活一小部分专家,在不牺牲推理速度的情况下实现高可扩展性。虽然有效,但稀疏 MoE 训练表现出特征优化困难。由于路由器仅通过前向传递中选择的专家接收信息梯度,因此它会遭受梯度阻塞,并且从未选择的路由中获得的信息很少。这种有限的、高度本地化的反馈使得路由器很难学习适当的专家选择分数,并且常常导致不稳定的路由动态,例如训练期间专家分配的波动。为了解决这个问题,我们提出了 TGR-MoE:Teacher-Guided Routing for Sparse Vision Mixture-of-Experts,这是一种简单而有效的方法,可以使用源自预训练的密集教师模型的监督来稳定路由器学习。 TGR-MoE根据教师的中间表示构建教师路由器,并使用其路由输出作为学生路由器的伪监督,抑制训练期间频繁的路由波动,并在训练的早期阶段实现知识引导的专家选择。在 ImageNet-1K 和 CIFAR-100 上进行的大量实验表明,TGR 持续提高了准确性和路由一致性,同时即使在高度稀疏的配置下也能保持稳定的训练。