论文

XPERT:有效训练语言模型的专家知识转移

XPERT: Expert Knowledge Transfer for Effective Training of Language Models

摘要

专家混合 (MoE) 语言模型将知识组织成显式路由的专家模块,使专家级表示可追踪和可分析。通过分析 MoE 大语言模型 (LLM) 中的专家激活模式,我们发现专家子集在不同的知识领域中得到一致激活。这些共同的专家编码与模型泛化密切相关的跨领域、可泛化的知识,自然提出了如何实际重用这些可识别的专家知识的问题。受这一观察的启发,我们提出了 XPERT,这是一个框架,可以从预训练的 MoE LLM 中提取、整合和重用专家知识,以支持跨不同模型规模的语言模型更有效的训练。 XPERT 通过仅推理分析识别跨领域专家,通过张量分解细化其表示,并调整提取的知识以在下游模型中重用。语言理解和对话生成基准的实验表明,与强基线相比,受益于重用专家知识的模型始终能够实现更强的性能和更快的收敛。这些结果凸显了 MoE LLM 作为结构化和可重用的知识源,并证明了专家级知识重用对于改进 模型训练 的价值。