论文

语言模型是否可以跟踪状态变化中的实体?

Do Language Models Track Entities Across State Changes?

模型评测模型行为与机制分析

摘要

实体跟踪 (ET) 是跟踪状态的能力,是复杂推理的基础技能。越来越多的工作研究 Transformer 语言模型 (LM) 如何解决实体绑定 $\textit{没有}$ 状态更改。然而,对于非玩具 LM 如何解决用自然语言表达的现实困难的 ET 问题,人们的理解还很有限。为此,我们研究了具有多个状态改变操作的更复杂场景中 ET 的底层机制。我们发现 LM 不会跨词元增量跟踪世界状态或跨层查询相关状态,而只是在查询变得明显时在最后一个词元处并行聚合相关信息。我们进一步研究各个操作的机制($\texttt{PUT}$、$\texttt{REMOVE}$、$\texttt{MOVE}$)来表征这种非增量 ET 机制。令人惊讶的是,LM 使用脆弱的全局抑制标签来实现 $\texttt{REMOVE}$ 操作;这种全局移除机制可以预测我们在行为上确认的各种故障模式。我们提供了一个无效该标签的机械解决方案来部分解决这个问题。总的来说,我们的研究结果表明,语言模型使用非顺序策略解决了基本的顺序任务。更广泛地说,我们的工作说明了行为分析和机械分析如何有效地相互作用。行为结果为机械假设提供信息,机械分析的见解通过预测现有评估中缺失的故障模式,有助于建立更强大的行为评估。