论文

语言模型可以组合地解决引用问题,但这不是它们的固有优势:个人关系任务的案例

Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task

模型评测模型能力评测

摘要

像 大语言模型 这样的神经模型是否真正获得了解释自然语言的组合能力?当我们谈论语义解释时,我们可以区分两个互补的方面:建立表达式在世界中所指的内容(我们称为外延任务)并以结构化方式表示其含义(我们称为内涵任务)。我们在个人关系任务(Paperno 2022)的设置中评估 LLM 和人类的两项任务,其中,给定一大群人及其彼此之间的关系,要求人们解释一个名词短语,例如“Amber 的父母的朋友”。在这里,对于内涵任务,答案是公式“朋友(父母(琥珀))”,对于外延任务,答案是人。我们发现人类和 LLM 显示出相反的优势:人类在外延任务上比内涵任务表现更好,LLM 反之亦然。我们的方法为理解现代机器学习模型中的组合能力带来了更细微的差别。我们的结果支持这样一种观点,即 LLM 训练中缺乏参考基础是模仿类人语言理解的一个重要缺失组成部分。