论文
将语码转换上下文引入认知启发双语模型训练
Introducing Code-Switched Contexts to Cognitively-Inspired Bilingual Model Training
摘要
在语言习得过程中,双语儿童经常接触语码转换输入,并将其用作认知脚手架,以加速词汇增长和跨语言句法映射。相比之下,计算双语模型通常是在交错单语语料库上进行预训练的。虽然在预训练期间引入合成代码转换已成为增强跨语言对齐和下游性能的一种有前景的策略,但控制成功的结构和发育参数仍然知之甚少。在这项工作中,我们通过控制两个关键变量:语码转换的结构位置和训练阶段的动态切换率,研究了训练在两种类型不同的语言对上使用合成语码转换数据的效率。我们的结果表明,具有代码转换数据的训练改进了类型上相近语言的跨语言对齐。
