论文
基于 MoE 的 LLM 中是否存在特定领域专家?
Do Domain-specific Experts exist in MoE-based LLMs?
摘要
在大语言模型(LLM)时代,专家混合(MoE)架构已成为训练超大型模型并提高计算效率的有效方法。这一成功建立在广泛的先前研究的基础上,旨在增强基于 MoE 的 LLM 的专家专业化。然而,这些专业的本质以及如何系统地解释它们仍然是开放的研究挑战。在这项工作中,我们通过提出一个基本问题来调查这一差距:\textit{基于 MoE 的 LLM 中是否存在特定领域专家?}为了回答这个问题,我们评估了 10 个先进的基于 MoE 的 LLM,参数范围从 3.8B 到 120B,并为特定领域专家的存在提供了经验证据。基于这一发现,我们提出了 \textbf{Domain Steering Mixture of Experts (DSMoE)},这是一种 无需训练 框架,它引入了零额外推理成本,并且优于训练有素的基于 MoE 的 LLM 和强大的基线,包括监督式 微调 (SFT)。在目标和非目标领域对四个基于 MoE 的先进开源 LLM 进行的实验表明,我们的方法在不增加推理成本或需要额外再训练的情况下实现了强大的性能和鲁棒的泛化能力。我们的实现可在 https://github.com/giangdip2410/Domain-specific-Experts 上公开获取。