论文
CogToM:受人类认知启发的面向大语言模型的全面心智理论基准
CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models
摘要
大语言模型(LLM)是否真正拥有类人心智理论(ToM)能力日益受到关注。然而,现有基准大多局限于错误信念任务等狭窄范式,未能捕捉人类认知机制的全貌。我们提出 CogToM,一个全面、有理论依据的基准,包含跨 46 个范式的 8000 多个双语实例,经 49 名人类标注者验证。对 22 个代表性模型(包括 GPT-5.1 与 Qwen3-Max 等前沿模型)的系统评估揭示显著的性能异质性,并凸显特定维度上的持续瓶颈。基于人类认知模式的进一步分析提示 LLM 与人类认知结构之间可能存在分歧。CogToM 为研究 LLM 演化中的认知边界提供稳健的工具与视角。
