论文

STRUCTURALCOST:人类句法阅读难度的受控数据

STRUCTURALCOST: A controlled reading time dataset for modeling human sentence processing difficulty

模型评测基准与评测资源

摘要

我们引入了 STRUCTURALCOST,这是一个由 475 名参与者和 40,800 个观察结果组成的自定进度阅读数据集,隔离了长距离主谓依赖解析的处理成本。我们在 NLP 规模上复制了一个低效的心理语言学发现,即人类阅读主要动词的时间随着依存长度的增加而增加,这是由超出线性距离的句法嵌入驱动的。不同的语言模型(涵盖 n-gram 模型、SSM 和 Transformer)部分反映了这种分级难度概况,但低估了人类产生的集成成本,在架构和模型大小之间存在持续的差距。这表明这些模型捕获了人类处理的预测部分,但没有捕获记忆工作所带来的全部集成成本。 STRUCTURALCOST 提供了推动评估语言模型认知合理性所需的数据。

STRUCTURALCOST:人类句法阅读难度的受控数据:论文原图
图 3:模型 惊异度 和阅读时间之间的 Spearman 相关性,按依存长度(0、4、9 个单词)和拟合级别划分:所有单词(左)与仅动词(右)。误差线显示 95% CI。该表参见附录 F。