论文
在 BabyLM 中,面向儿童的语音有助于生成,而不是理解
Child-directed speech facilitates production, not comprehension, in BabyLMs
摘要
最近的研究表明,面向儿童的语音不利于 BabyLM 的语言学习。然而,当前的评估主要侧重于理解而不是生成,这是基于使用的语言习得理论的核心,该理论认为 CDS 如何通过结构性“框架”(带有开放槽的频繁词汇模式)促进早期语言使用。我们以框架完成任务的形式引入了一种受此类理论启发的新颖的基于生成的评估,并在理解基准和我们的新颖框架上比较了用 CDS、BabyLM 语料库和网络爬行数据 (FineWeb-edu) 训练的 Llama 模型。我们的结果揭示了模型的理解能力和生成能力之间的明显分离:虽然 FineWeb 训练的模型在最小配对方面表现出色,但 CDS 训练的模型在训练中更早地产生语法补全,并将概率质量集中在适当的槽填充上。这些发现表明,理解基准低估了 CDS 为 BabyLM 提供的功能。