论文
语言模型隐藏状态中的轨迹动力学预测人类处理成本出人意料
Trajectory Dynamics in Language Model Hidden States Predict Human Processing Costs Beyond Surprisal
摘要
人类语言理解是按顺序展开的:每个单词都会在之前单词的上下文中进行处理,并且解释会随着时间的推移逐渐建立。令人惊讶的是,一个词在给定上下文的情况下的负对数概率,一直是增量处理成本的主要预测因素。但令人惊讶的是,每个单词的丰富顺序表示都减少为单个标量,从而丢弃了有关解释演变方向的信息。动力系统方法表明,不断演变的解释状态的轨迹,而不仅仅是其在每个时刻的位置,应该塑造处理过程,并且语言本身可能具有局部动量,因为说话者计划一次说出几个单词。我们引入轨迹外推误差:在每个单词处,我们将线性轨迹拟合到 Transformer 语言模型的先前隐藏状态,并测量与外推路径的偏差。在自然故事语料库上,该度量几乎与惊讶正交(r = .044),并独立预测自定进度的阅读时间。这种效果在花园路径句子中尤其明显,随着模型规模(GPT-2 小到大)而增强,并且在具有不同位置编码方案的架构之间复制(GPT-2 与 Pythia/RoPE)。位移控制表明该效应不能简化为代表性变化幅度:位移和外推误差预测方向相反。这些发现揭示了处理成本的两个独立组成部分:字级预测误差(令人惊讶)和对展开解释的局部动量的敏感性(轨迹外推误差)。