论文

语言模型推广到类似人类的词序偏好

Language Models Generalize to Human-like Word Order Preferences

模型评测模型行为与机制分析

摘要

语言习得的一个核心问题是,在不确定的输入下运行的一般学习机制是否会出现语言偏差。人工语言学习(ALL)研究表明,人类学习者能够可靠地概括超出所提供的证据,包括更喜欢范围同态名词短语修饰语顺序。在这项工作中,我们研究了语言模型在相似条件下是否表现出相同的偏差。我们创建了一个受控学习环境,其中模型在语料库上进行训练,其中包含多个修饰语的所有名词短语已被删除,从而消除了有关修饰语顺序的直接证据,然后对多个修饰语句子进行评估。在三种模型大小中,我们发现他们始终更喜欢范围同态顺序,尽管在训练期间从未观察过它们。这些偏好的强度因改性剂类型而异。为了调查这些偏好的来源,我们使用逐点互信息(PMI)检查名词修饰语关联强度。虽然 PMI 反映了已知的修饰符排序模式,但它并不能解释模型的排序偏好。这些发现表明,语言模型可以从贫乏的输入中恢复类人的语言概括,并为研究此类偏差背后的机制提供一个受控框架。