论文

可读的心智:LLM扑克智能体中涌现的类心智理论行为

Readable Minds: Emergent Theory-of-Mind-Like Behavior in LLM Poker Agents

模型评测上下文与知识记忆模型能力评测Agent记忆

摘要

心智理论(ToM)——建模他人心理状态的能力——是人类社会认知的基础。大型语言模型(LLM)能否发展出ToM,此前仅通过静态情景故事进行过测试,类ToM推理能否通过动态交互涌现仍是开放问题。我们在此报告,自主LLM智能体在长时间德州扑克对局中逐步发展出精细的对手模型,但前提是配备持久记忆。在将记忆(有/无)与领域知识(有/无)交叉的2×2因子设计中,每组五次重复(N = 20次实验,约6000个智能体手牌观测),我们发现记忆对于类ToM行为的涌现既必要又充分(Cliff's delta = 1.0,p = 0.008)。有记忆的智能体达到ToM 3–5级(从预测性到递归建模),而无记忆的智能体在所有重复中始终停留在0级。基于对手模型的策略性欺骗仅出现在有记忆的条件下(Fisher精确检验p < 0.001)。领域专长并不决定类ToM行为能否涌现,但会增强其应用:不具备扑克知识的智能体发展出同等的ToM水平,但欺骗精度较低(p = 0.004)。具备ToM的智能体会偏离博弈论最优打法(67%对79%的TAG依从度,delta = -1.0,p = 0.008),以利用特定对手,这与人类专家的打法一致。所有心智模型都以自然语言表达且可直接阅读,为观察AI社会认知提供了透明窗口。使用GPT-4o的跨模型验证得到加权Cohen's kappa = 0.81(几乎完全一致)。这些发现表明,功能性的类ToM行为可以仅从交互动态中涌现,无需显式训练或提示,这对理解人工智能社会智能和生物社会认知都有意义。

可读的心智:LLM扑克智能体中涌现的类心智理论行为:论文配图
图 1:全条件会话期间的实时观众界面(第 3 手,转牌)。该界面显示每个代理的牌、筹码以及扑克桌上的位置。思维理论面板(左上)显示每个代理的实时 ToM 水平评估。智能体记忆笔记显示为语音气泡,说明了构成“可读思维”的自然语言对手模型。统计面板(左)跟踪整个会话中的 VPIP、PFR、攻击因素和胜率。