论文

OmniToM:通过显式信念建模评测LLM的心智理论

OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

模型评测基准与评测资源

摘要

心智理论(ToM)即推断他人知识、意图与情绪的能力,目前对大语言模型(LLM)的评测通常采用终点式问答,即仅凭社会推理问题的最终答案来判断表现。这一范式掩盖了模型是否真正构建了稳健推理所需的底层心理状态表征,尤其是在信念分歧、演化或出错的场景中。为填补这一研究空白,我们提出OmniToM基准,它要求对叙事中所有相关角色显式建模信念结构,从而直接评估这些表征。这些结构由信念命题组成:即关于某角色认为世界或另一角色心理状态如何为真的最小陈述,使知识、意图、情绪与错误信念得以在统一格式下分析。模型评估分两个阶段:第一阶段为信念抽取,从故事中抽取与其社会动态相关的信念;第二阶段为信念标注,为每条信念赋予一个七维模式标签,涵盖递归阶数、真值状态、知识获取方式、显性程度、内容类型、心理来源与语境。OmniToM基于现有ToMBench故事语料库中的895个故事构建,并增补了22,343条带标注的信念命题,采用经人工校准的LLM辅助标注流水线。在多模型零样本评估中,OmniToM揭示了一种针对角色的信念追踪瓶颈:当前LLM难以完成将叙事事实转化为角色信念与共享心理状态所需的知识获取判断与表征决策。

OmniToM:通过显式信念建模评测LLM的心智理论:论文配图
图 1:错误信念故事的评估范式比较。爱丽丝和鲍勃在一个有盒子和篮子的房间里;爱丽丝将球放入盒子中,鲍勃离开,然后爱丽丝将球移至篮筐。上图:端点问答 (QA) 仅评估“Bob 会看哪里?”的最终答案;模型可能会正确回答(“盒子”),而支持的心理状态表征仍然未被观察到。底部:随着时间的推移,通过信念的心理状态表征代表了与世界事实和演员信念相同的故事,使隐藏的推理过程变得可见。金色痕迹保留了鲍勃在隐藏转移后过时的信念:鲍勃仍然相信球在盒子里。有缺陷的跟踪说明了 QA 可以隐藏的跟踪错误端点,其中模型错误地将 Bob 的信念跟踪为在他没有观察到的事件发生后将其放入篮子中。