论文
养育双语婴儿LM:使用小规模模型研究多语言语言习得
Bringing Up a Bilingual BabyLM: Investigating Multilingual Language Acquisition Using Small-Scale Models
摘要
使用多种语言在世界各地非常普遍,这引发了许多关于儿童如何同时学习多种语言的重要理论和实践问题。例如,多语言习得是否会导致学习延迟?构建多语言输入是否有更好和更差的方法?许多相关研究都解决了这些问题,但要获得明确的答案却出人意料地困难,因为儿童不能被随机分配为多种语言,而且语言之间的数据通常不匹配。我们使用语言 模型训练 作为模拟各种高度控制的暴露条件的方法,并使用合成数据和机器翻译创建匹配的 1 亿字单语和双语数据集。我们在单语和双语数据上训练 GPT-2 模型,这些数据旨在反映一系列暴露状况,并评估其在困惑度、语法性和语义知识方面的表现。在模型规模和测量方面,双语模型的表现与一种语言的单语模型相似,但在第二语言中也表现出强劲的表现。这些结果表明,不同的双语接触制度之间没有显着差异,并且双语输入不会对不可知论的统计学习者构成原则上的挑战。