论文

大语言模型 多语言知识编辑的合并方法:经验之旅

Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey

模型优化模型合并

摘要

多语言知识编辑 (MKE) 仍然具有挑战性,因为特定语言的编辑会相互干扰,即使定位然后编辑方法在单语言环境中运行良好。本文重点讨论三个问题:MKE 向量合并方法的有效性、任务奇异向量合并(TSVM)可以在多大程度上减少多语言干扰,以及权重缩放因子和排名压缩比对性能的影响。我们在大规模批量编辑设置下,在 MzsRE 基准上评估了具有两种流行主干 大语言模型、两种基础知识编辑方法和 12 种语言的 6 种合并变体。我们的结果表明,具有共享协方差的向量求和是最可靠的总体策略,而没有共享协方差的简单求和则表现不佳。 TSVM 在某些设置中提高了性能,但其减轻多语言干扰的能力有限。我们还发现,性能对权重比例和排名比率都很敏感,大于默认比例和相对较低的排名通常会产生更好的结果。这些发现阐明了当前 MKE 向量合并方法的实际优势和局限性,并为未来的多语言知识编辑研究提供了指导。