论文

MeetingToM:评估多方会议中心理理论推理的多模态 LLM

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

模型评测基准与评测资源

摘要

心智理论 (ToM) 是推断他人信念、意图和知识状态的能力,是社交互动的核心,但对于当前的多模态 大语言模型 (MLLM) 来说仍然具有挑战性,特别是在线索分布在言语和行为中的多方会议中。现有的多模态 ToM 基准主要侧重于通过公开的、外部可验证的信号进行基于视频的问答,并且对潜在的社会状态和群体动态的覆盖范围有限。我们引入了 MeetingToM,这是自然多方会议中复杂社会行为推理的基准。 MeetingToM 针对特定于会议的现象,例如 \textbf{pseudo-consensus},即表面上的一致掩盖了社会压力下的私人异议。该基准按层次结构组织,以不断增加的社会粒度水平评估 ToM,包括 (i) 主体级心理状态预测、(ii) 二元级收件人理解和 (iii) 群体级共识推理。我们提供统一的评估协议并对代表性 MLLM 进行系统分析,揭示在整合非语言线索、推断隐藏态度以及区分真正共识和伪共识方面持续存在的局限性。我们的结果突出了关键挑战,并将 MeetingToM 建立为在多模式模型中推进基于会议的 ToM 的测试平台。