论文

评估人类与大语言模型的心智化能力

Assessing mentalization in humans and large language models

模型评测模型能力评测

摘要

心智化(mentalization)——推断他人的信念和意图以引导自身选择的能力——是人类社会互动的关键认知功能。大语言模型(LLM)在心理理论任务上表现出与人类一致的行为,但这些模型能否通过心智化引导适应性行为尚不清楚。在这里,我们使用两个经济博弈结合认知计算建模,来揭示LLM心智化背后的潜在策略。我们在四个模型族(DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash,N=2,099)中测试了单独的LLM智能体,让它们对抗复杂度不同的对手,并检验一种旨在引发策略性推理的提示策略能否提升表现。我们将结果与人类被试(N=251)进行对比作为参照度量。在两个博弈中,LLM都表现出明确的心智化行为与计算特征,且因模型提供方和规模而有显著差异。策略性提示总体上通过诱导更复杂的推理提升了表现,但收益幅度在两个任务之间不同。最后,GPT-5智能体能够灵活调整其递归推理深度以应对越来越复杂的对手,表现出优于人类被试的成绩。总之,我们展示了LLM心智化能力的差异,并凸显认知计算建模作为评估人类与机器比较智能的形式化方法的价值。

评估人类与大语言模型的心智化能力:论文配图
图1:针对人类和大语言模型的实验设计。(a) 在检查博弈(inspection game)中,每个试次先向人类被试呈现注视点十字(1 秒),被试最多有 4 秒时间做出选择,随后是选择确认(最多 2 秒),之后根据对手的选择给予反馈(3 秒)。在一个包含 150 个试次的区组中,人类与一个精心设计的算法博弈,该算法旨在实施具有“影响力博弈”(Influence play)特征的推理。(b) 在 RPS 任务中,人类每个试次最多有 3 秒做出选择,随后接收 1 秒反馈。被试与一个自适应算法进行 3 个区组、每区组 40 试次的博弈,该算法的决策体现不同层级的心理化(mentalization)水平,从零阶(k=0)到二阶(k=2)。区组顺序在被试间进行了平衡和随机化。(c) 对于大语言模型(LLM)被试,每个任务被转换为基于文本的提示,尽可能与原始任务保持一致,然后提交给各 LLM 进行 API 推理。(d) 两个任务的提示条件。在普通提示中,呈现任务规则和选择历史,并附上要求智能体做出选择的陈述。在 SCoT 条件中,改为要求智能体预测对手的选择,再用该预测来选择相应的理性选择。图标来自 Flaticons.com。