论文
OmniToM:通过显式信念建模评测LLM的心智理论
OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling
摘要
心智理论(ToM)即推断他人知识、意图与情绪的能力,目前对大语言模型(LLM)的评测通常采用终点式问答,即仅凭社会推理问题的最终答案来判断表现。这一范式掩盖了模型是否真正构建了稳健推理所需的底层心理状态表征,尤其是在信念分歧、演化或出错的场景中。为填补这一研究空白,我们提出OmniToM基准,它要求对叙事中所有相关角色显式建模信念结构,从而直接评估这些表征。这些结构由信念命题组成:即关于某角色认为世界或另一角色心理状态如何为真的最小陈述,使知识、意图、情绪与错误信念得以在统一格式下分析。模型评估分两个阶段:第一阶段为信念抽取,从故事中抽取与其社会动态相关的信念;第二阶段为信念标注,为每条信念赋予一个七维模式标签,涵盖递归阶数、真值状态、知识获取方式、显性程度、内容类型、心理来源与语境。OmniToM基于现有ToMBench故事语料库中的895个故事构建,并增补了22,343条带标注的信念命题,采用经人工校准的LLM辅助标注流水线。在多模型零样本评估中,OmniToM揭示了一种针对角色的信念追踪瓶颈:当前LLM难以完成将叙事事实转化为角色信念与共享心理状态所需的知识获取判断与表征决策。
