论文

超越对话的心理理论和说服:评估 LLM 通过计划和行动诱导信念状态的能力

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

模型评测模型能力评测

摘要

大语言模型 (LLM) 的心理理论 (ToM) 基准通常依赖于被动问答格式,但以日益代理和自主的形式部署 LLM 需要新的评估。在本文中,我们评估智能体通过采取行动而不是使用对话说服来诱导其他智能体特定信念状态的能力,我们将这种能力称为非对话式规划 ToM (NCP-ToM)。 NCP-ToM 可能对于许多代理用例至关重要,包括在用户助理交互和教学环境中,但也可能存在操纵或错误信息风险。使用新颖的框架 NCP-ExploreToM,我们通过为模型提供一组信念状态目标并要求它们移动物体或引导角色进入房间来实现其目标,从而颠覆了传统的任务结构。我们评估了 6 个前沿模型,包括 GPT-5、Gemini 2.5 Pro 和 Claude 4 系列,以及一组人类参与者的 600 个任务实例。 GPT-5 在代理环境中成功完成了大约 80% 的任务,并且是在我们的任务中优于人类参与者的唯一模型,但在跨环境下仍然不如人类稳健。我们还发现,所有模型(如人类)在诱导真实信念状态的任务上表现得比错误信念状态更好,这是对齐努力的积极信号。这些发现强调了 LLM 中用于完成非会话任务的新兴社会推理能力,并强调了代理评估对于理解自主社会代理的安全性和一致性的必要性。