论文
专家的特征向量是 无需训练 非折叠路由器
Eigenvectors of Experts are Training-free Non-collapsing Routers
摘要
稀疏专家混合 (SMoE) 架构通过将输入标记路由到选定的专业专家子集来提高 大语言模型 (LLM) 的训练效率。尽管取得了显着的成功,SMoE 模型的训练和推理都遇到了专家崩溃问题(Chi 等人,2022),这降低了模型的性能。之前的研究主要集中在改进路由器;然而,此类方法依赖于从头开始训练或 微调,这需要很高的计算和数据处理成本。此外,我们证明,尽管做出了这些努力,但在推进经过良好训练的 SMoE 模型时,问题仍然存在,理论和实证结果都证明了这一点。为了填补这一空白,我们分析了先进的 SMoE 模型,并观察到专家权重矩阵的特征向量编码了丰富的语义信息,指出了传统路由策略的有效替代方案。基于这一见解,我们提出了奇异值分解 SMoE (SSMoE),这是一种新颖的 无需训练 框架,它利用专家权重的谱特性来解决崩溃问题并增强模型性能。在干净和损坏的数据设置下,跨不同语言和视觉任务的广泛实验证明了 SSMoE 的强大泛化性和鲁棒性。我们的研究结果强调了对模型内部结构的更深入理解如何指导更有效的 SMoE 架构的开发。我们的实现可在 https://github.com/giangdip2410/SSMoE 上公开获取。