论文
STRUCTURALCOST:人类句法阅读难度的受控数据
STRUCTURALCOST: A controlled reading time dataset for modeling human sentence processing difficulty
摘要
我们引入了 STRUCTURALCOST,这是一个由 475 名参与者和 40,800 个观察结果组成的自定进度阅读数据集,隔离了长距离主谓依赖解析的处理成本。我们在 NLP 规模上复制了一个低效的心理语言学发现,即人类阅读主要动词的时间随着依存长度的增加而增加,这是由超出线性距离的句法嵌入驱动的。不同的语言模型(涵盖 n-gram 模型、SSM 和 Transformer)部分反映了这种分级难度概况,但低估了人类产生的集成成本,在架构和模型大小之间存在持续的差距。这表明这些模型捕获了人类处理的预测部分,但没有捕获记忆工作所带来的全部集成成本。 STRUCTURALCOST 提供了推动评估语言模型认知合理性所需的数据。
