论文

一种形式来转移所有这些:预训练超越本地正字法的多语言语言模型

One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthography

模型训练预训练

摘要

多语言模型通过共享子词词汇跨语言传递知识,当相关语言使用不同的书写系统时,这种机制就会崩溃。先前的工作通过脚本均衡(罗马化或 IPA 转录)解决了这个问题,但直接比较很少见;重点是仅编码器模型,大多数工作都采用现有的预训练模型。我们系统地比较了自回归多语言预训练中的不同输入表示,在四个类型动机对的八种语言的三个尺度(467M、709M 和 1.03B)的受控设置中比较正字法文本、国际音标和罗马化。在涉及可见和未见语言的各种下游任务中,罗马化预训练产生了最强的跨语言迁移,并且相对于文本的优势随着规模的扩大而扩大。 IPA 在大多数设置中都比文本有所改进,但落后于罗马化。令人惊讶的是,在罗马化数据上微调文本预训练模型会损害基本模型已涵盖的语言的性能,而当模型缺乏脚本覆盖率时,只有很小的帮助。我们的结果表明,对于跨越不同类型脚本的多语言模型,为了获得最大的好处,罗马化应该被视为预训练时应用的核心设计选择,而不是事后修复。