论文

LLM 比黑猩猩更聪明吗?视角采择与知识状态估计评估

Are LLMs Smarter Than Chimpanzees? An Evaluation on Perspective Taking and Knowledge State Estimation

模型评测模型能力评测

摘要

认知人类学认为,人类智力的区别在于推断其他个体的知识状态并理解其意图的能力。相比之下,我们最近的动物亲戚黑猩猩缺乏这样做的能力。通过本文,我们旨在评估大语言模型在知识状态跟踪和估计领域的表现。我们设计了两个任务来测试(1)大语言模型是否可以通过他们的行为检测故事人物何时表现出他们不应该拥有的知识,以及(2)大语言模型是否可以根据他们自己的知识与他们不知道的客观事实来预测故事人物的下一步行动。结果表明,当前最先进的大语言模型在这两项任务上都实现了近乎随机的表现,并且远远低于人类。我们认为未来的大语言模型研究应该更加重视知识估计和意图理解的能力。

LLM 比黑猩猩更聪明吗?视角采择与知识状态估计评估
图1:知识敏感的下一步动作预测(Knowledge-sensitive Next-action Prediction, KNP)任务,其中不合情理的知识被高亮以便于阅读(但对 LLM 与人类受试者并不高亮)。该任务测试 LLM 能否站在故事人物的视角,基于其可获取的知识选择动作。