论文
为什么预训练无法共享跨语言知识
Why Pretraining Fails to Share Cross-Lingual Knowledge
摘要
大型语言模型(LLM)在许多语言的处理和建模方面取得了显着的进步。然而,与人类多语言者不同的是,他们的跨语言知识迁移表现出惊人的有限。虽然这种限制有据可查,但其在多语言训练期间的起源仍不清楚。我们对 360M 和 7B 参数的大语言模型进行了预训练,结果表明,在预训练期间出现了较差的跨语言知识泛化,并且在标准干预下仍然存在。为了隔离其原因,我们采用受控双语预训练设置,使用同一语言的两个副本,共享相同的文本和标记分段,但映射到不相交的标记空间。我们发现,即使在同一语言的相同副本之间,仅不相交的标记就足以引起知识划分,从而建立不相交的标记空间作为跨语言知识泛化的基本障碍。在这种理解的指导下,我们建议通过简单的逐字翻译将语言映射到共享标记空间,并发现它大大提高了跨语言知识泛化,恢复了高达 12.6\% 的母语学习效率 --- 14$\times$ 基线。