论文
多语言 LLM 的数据高效途径:通过 后训练 PARAM$Δ$ 集成到升级版 MoE 中进行语言扩展
A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE
摘要
将 大语言模型~(LLM) 扩展到新语言是一项成本高昂的工作,需要广泛的持续 预训练~(CPT) 和数据密集型对齐。虽然最近的无数据合并技术试图通过将多语言 CPT 增强模型与其指令模型融合来绕过对齐,但它们受到关键权衡的困扰:减轻参数冲突以保留原始能力不可避免地会削弱新语言的习得,反之亦然。为了解决这个冲突,我们引入了 \method,它将密集模型升级为专家混合(MoE)架构,将不同的专家分配给不同的语言。然后通过将 MoE 扩展的参数 delta~($Δ_{\text{post}}$) 移植到 CPT 增强的基础模型来转移对齐能力,绕过复杂的对齐阶段。实验证明,即使相对于具有相似 FLOP 或参数数量的基线,该方法也具有优越性;它提高了扩展语言的性能,同时有效地保留了原始功能。我们进一步证明我们的方法在不同模型和 后训练 增量中高度适用。