论文
无需训练 专家语言模型的动态升级
Training-Free Dynamic Upcycling of Expert Language Models
摘要
大语言模型(LLM)在广泛的专业任务上取得了卓越的表现,表现出强大的解决问题的能力。然而,训练这些模型的成本极其昂贵,而且它们通常缺乏特定领域的专业知识,因为它们依赖于一般知识数据集。专业知识微调可以解决这个问题;然而,这往往会导致过度专业化,并且由于目标不同,培养一名多领域专家仍然很困难。此外,由于干扰和灾难性遗忘,多任务训练具有挑战性。现有的工作建议将密集模型的专业知识结合到专家混合(MoE)架构中,尽管这种方法仍然需要多任务微调。为了解决这些问题,我们引入了动态升级 MoE (DUME),这是一种新方法,它重用在不同领域接受过训练的密集专家来构建统一的 MoE 模型。我们的方法构建了一个单一的多任务模型,该模型保留了原始密集专家的能力,而无需额外的训练。 DUME 既经济高效又可扩展:通过利用岭回归的封闭式解决方案,它消除了进一步优化的需要,并允许动态添加专家,同时保持模型的原始性能。我们证明 DUME 在因果语言建模和推理设置方面始终优于基线方法。最后,我们还表明可以对 DUME 模型进行微调以进一步提高性能。我们表明,在因果语言建模设置中,DUME 可以保留高达 97.6% 的专门针对某一特定领域的密集专家模型,并且它在推理设置中也可以超越它,在推理设置中它可以实现 102.1% 的密集专家性能。我们的代码位于:github.com/gensyn-ai/dume。