论文

实体跟踪出现在数十亿参数的语言模型中,并在自然叙事中超越了人类的表现

Entity tracking emerges in sub-billion parameter language models and exceeds human performance in naturalistic narratives

模型评测模型能力评测

摘要

理解语言需要跟踪整个话语中的实体——即知道事物在哪里以及它们如何变化,即使没有明确说明。语言模型是否以类似人类的方式执行这种跟踪仍不清楚,部分原因是现有的评估依赖于人工任务,远离自然语言理解,并且缺乏与人类的比较。在这里,我们使用多个复杂级别的自然叙述来评估语言模型和人类 (N = 48) 中的实体跟踪。在人类中,我们发现实体跟踪的性能下降具体取决于叙事复杂性,而不是叙事长度。在语言模型中,我们发现人类级别的实体跟踪已经存在于 4.1 亿个参数中——远低于先前工作确定的数十亿参数、代码专用模型——并且随着规模的扩大而改进,当代模型远远超过了人类的表现。总之,这些结果表明,实体跟踪(语言理解的核心组成部分)的模型规模远小于之前的想象。