论文

BabyLM 语码切换课程促进跨语言表征趋同

Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence

模型训练合成数据

摘要

多语言社区中的儿童经常会进行语码转换,在一次说话中使用多种语言。我们可以通过对语码转换文本进行训练来诱导语言模型中的跨语言对齐吗?我们在两个 100M 单词的多语言语料库上预训练小型解码器Transformer:一个是通过混合英语、荷兰语和中文 BabyBabelLM 数据集形成的基础语料库,以及通过使用 LLM 插入单词和句子级语码切换而生成的语料库。我们发现,对语码切换数据的训练可以对齐并行文本的表示,尤其是在不同书写系统之间,并且这种对齐通过对单语言文档的训练得以持续。在从单词级语码转换到句子级语码转换再到单语文档的学习课程中,在 BabyLM 评估套件上,使用语码切换数据训练的模型优于未使用语码切换数据训练的基线。我们的工作将语码转换课程学习描述为一种有效的多语言预训练数据增强方法。我们在 https://github.com/drooryck/multilingual-macaroni 发布了我们的代码、数据和模型。