论文
基于行为的心理理论测试中 LLM 心理自我建模的选择性缺陷
Selective Deficits in LLM Mental Self-Modeling in a Behavior-Based Test of Theory of Mind
摘要
将自己和他人代表为具有指导其行为的知识、意图和信念状态的主体的能力——心智理论——是人类的普遍特征,使我们能够驾驭和操纵社会世界。它得到了我们形成自己和他人心智模型的能力的支持。它在人类事务中无处不在,这意味着 LLM 在他们的训练数据中看到了无数这样的例子,因此可能学会了模仿它,但他们是否真的学会了可以在任意环境中部署的因果模型还不清楚。因此,我们开发了一种新颖的实验范式,要求受试者形成自己和他人心理状态的表征,并有策略地对其采取行动,而不仅仅是描述它们。我们在此范例上测试了自 2024 年以来发布的各种领先的开源和闭源 LLM 以及人类受试者。我们发现 1) 2025 年中期之前发布的 LLM 在我们的所有任务上都失败了,2) 最近的 LLM 在建模他人的认知状态方面达到了人类水平的表现,3) 即使是前沿的 LLM 在我们的自我建模任务上也失败了——除非以推理轨迹的形式提供暂存器。我们进一步证明了认知负荷对其他建模任务的影响,提供了暗示性证据,表明 LLM 正在使用类似于有限容量工作记忆的东西在单次前向传递期间将这些心理表征牢记在心。最后,我们探讨了推理模型在自我建模和他人建模任务中取得成功的机制,并表明它们很容易进行战略欺骗。