论文

语言模型跨语言泛化的体外研究

An In-Vitro Study on Cross-Lingual Generalization in Language Models

模型评测模型行为与机制分析

摘要

语言模型中的跨语言迁移很难在自然语料库中研究,因为词汇重叠、形态、数据不平衡和标记化相互纠缠。我们引入了一个体外框架,其中有两种程序生成的语言,它们共享相同的本体、类型化语法和组合结构,但表面实现不同。这让我们能够独立地改变词汇距离、小语种比例、分词器训练机制和词汇量,同时评估在训练期间从未观察到其词汇形式的掩蔽小语种条件下的迁移。在 700 次受控运行中,我们发现转移更多地受标记化器平衡或原始词汇相似性的影响,而不是受标记化是否保留可重用的跨语言子结构的影响。较小的词汇表通常通过将单词可分解为共享片段来改善掩蔽迁移,而较大的词汇表可以将形式转化为特定于语言的原子。我们进一步表明,迁移是一个分阶段的过程:语法和类型级别的能力先于掩盖的词汇概括。最后,我们尝试通过标记器桥来解释这种机制,并表明桥强度与屏蔽可达性密切相关。