论文

可以通过惊喜解释花园小径效应的神经语言模型的存在性证明

An Existence Proof for Neural Language Models That Can Explain Garden-Path Effects via Surprisal

模型评测模型行为与机制分析

摘要

惊喜理论假设,人类句子处理的难度随着惊喜(给定上下文的单词的负对数概率)线性增加。计算心理语言学使用语言模型(LM)作为人类预测的代理来测试这一假设。虽然最近的神经语言模型通常捕捉到了人类对主要由简单句子组成的自然主义语料库的处理难度,但它严重低估了需要句法消歧的句子的处理难度(花园路径效应)。这导致了这样的说法:此类句子的处理难度不能降低到令人惊讶的程度,尽管神经语言模型在下一个单词预测方面仍然有可能与人类不同。在本文中,我们研究是否真的不可能构建一个可以通过意外来解释花园小路效应的神经语言模型。具体来说,我们不是评估现成的神经语言模型,而是在花园小路句子上微调这些语言模型,以便更好地将基于惊喜的阅读时间估计与实际的人类阅读时间保持一致。我们的结果表明,经过微调的 LM 不会过度拟合,并且成功捕获了人类在花园小径上放置的物品的阅读速度减慢的情况;它们甚至提高了人类在自然语料库上阅读时间的预测能力,并保留了一般的 LM 功能。这些结果为神经语言模型提供了存在证明,它可以通过惊喜来解释花园小路效应和自然主义阅读时间,但也提出了一个理论问题:什么样的证据可以真正证伪惊喜理论?