论文
一种模型可以翻译所有这些内容?多语言模型合并的末日之旅
One Model to Translate Them All? A Journey to Mount Doom for Multilingual Model Merging
摘要
权重空间模型合并结合了独立微调的检查点,无需访问原始训练数据。虽然合并在多任务环境中显示出前景,但其在多语言生成系统中的行为仍未得到充分探索。我们通过大规模双语语料库上的完整 微调 语言模型系统地研究多语言机器翻译的权重空间合并,并评估跨共享源、共享目标和双向整合设置的代表性合并策略。我们的实验揭示了强烈的方向不对称性。当模型共享目标语言时,合并相对更有效,可以提高基本模型的多语言覆盖率,但它仍然无法保持特定语言检查点的峰值性能。相反,当目标语言不同时,性能会急剧下降,尤其是在共享源和双向设置中。为了解释这种行为,我们分析了内部表示,发现 微调 不会创建不相交的特定于语言的子网络。相反,独立微调的模型会激活大部分重叠的神经元,同时将上层目标生成表示重塑为不兼容的几何形状。这些发现表明,多语言合并失败是由于共享计算单元内目标端几何错位引起的,这挑战了多语言翻译的标准权重空间合并的假设。我们在 https://github.com/babangain/mt-model-merging 上公开提供代码