论文
EnactToM:具身智能体功能性心智理论的演化式基准
EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents
摘要
心智理论(ToM),即追踪他人认知状态的能力,使人类成为高效的协作者。AI智能体在多智能体环境中也需要同样的能力,但现有基准大多通过直接提问信念来测试字面ToM。在具身环境中基于隐含信念最优行动的能力,称为功能性ToM,很大程度上尚未被测试。我们提出EnactToM,一个包含300个具身多智能体任务的演化式基准,场景设定在具有部分可观测、私有信息和受限通信的三维家庭环境中。每个任务都经过形式化验证以确保可解性和所需的认知深度,并且随着模型进步会生成新任务以提升难度。在困难划分上,全部七个受测前沿模型在功能性任务完成上的Pass^3得分为0.0%,而在字面信念探针上平均为45.0%。人工分析将93%的抽样失败归因于认知协调失灵,例如扣留信息、忽视伙伴约束和消息错配,为未来工作提供了具体目标。
