论文
合并与征服:通过添加目标语言权重来指导多语言模型
Merge and Conquer: Instructing Multilingual Models by Adding Target Language Weights
摘要
大语言模型 (LLM) 仍然主要以英语为中心,在资源匮乏的语言中性能有限。现有的适应方法,例如连续的 预训练,需要大量的计算资源。就指令模型而言,还需要高质量的指令数据,而这两者对于资源匮乏的语言社区来说通常是无法访问的。在这些限制下,模型合并提供了一种轻量级的替代方案,但其在资源匮乏的情况下的潜力尚未得到系统地探索。在这项工作中,我们探索是否有可能通过将语言知识与特定于语言的基本模型合并来将语言知识转移到指令调整的 LLM 中,从而消除对特定于语言的指令的需求,并在出现更强的指令变体时重复 微调 过程。通过涵盖四种伊比利亚语言(巴斯克语、加泰罗尼亚语、加利西亚语和西班牙语)和两个模型系列的实验,我们表明合并可以实现新语言中有效的指令遵循行为,甚至通过多个特定于语言的模型的组合来支持多语言能力。我们的结果表明,模型合并是低资源语言传统适应方法的可行且有效的替代方法,在实现有竞争力的性能的同时大大降低了计算成本。