论文

婴儿量表:研究针对个别儿童语言输入训练的模型

Baby Scale: Investigating Models Trained on Individual Children's Language Input

模型训练预训练

摘要

现代语言模型 (LM) 在开始产生有用的行为之前,必须接受比人类儿童接受的训练数据多多个数量级的训练数据。评估这种“数据差距”的性质和起源需要在人类规模的数据集上对语言模型进行基准测试,以了解语言知识如何从儿童的自然训练数据中产生。使用 BabyView 数据集的记录(来自 6-36 个月儿童的视频),我们研究了 (1) 儿童规模数据体系的扩展性能,(2) 来自不同儿童经历的数据集模型性能的变异性和数据集质量的语言预测因素,以及 (3) 模型与儿童语言学习结果之间的关系。在子数据上训练的语言模型在语法任务上显示出可接受的扩展,但在语义和世界知识任务上的扩展比在合成数据上训练的模型要低;我们还观察到不同儿童的数据存在很大差异。除了数据集大小之外,性能与分布式和交互语言特征的组合最相关,这与儿童语言发展的高质量输入大致一致。最后,单个单词的模型可能性与儿童对这些单词的学习相关,这表明儿童导向输入的属性可能会影响模型学习和人类语言发展。总体而言,了解哪些属性使语言数据能够有效地学习,可以实现更强大的小规模语言模型,同时也为人类语言习得提供线索。