论文
论预训练中多语言模型合并的局限性
On the Limits of Model Merging for Multilinguality in Pre-Training
摘要
赋予模型一致的多语言性能可以通过混合 预训练 数据或 后训练 方法(例如特定于语言的模型合并)来实现。在这项工作中,我们测试合并是否可以应用于单语预训练模型。我们对混合、合并和单语 预训练 设置的功效进行了对照研究。我们发现,虽然单语言 预训练 会产生很强的语言内性能,但合并单语言模型的任何组合都会因干扰而导致性能崩溃。我们的分析表明表征相似性是模型合并的先决条件。因此,我们得出结论,微调 中合并的灵活性不会轻易扩展到特定于语言的 预训练。