论文
仅视频 ToM:增强多模式中的心理理论 大语言模型
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
摘要
随着 大语言模型 (LLM) 的不断进步,人们对它们推断人类心理状态和展示类人心理理论 (ToM) 的能力越来越感兴趣。然而,大多数现有的 ToM 评估都以基于文本的输入为中心,而仅依赖视觉信息的场景受到的关注要少得多。这留下了一个空白,因为现实世界的人机交互通常需要多模式理解。此外,当前的许多方法将模型视为黑匣子,很少探究其内部注意力在多项选择题回答(QA)中的表现。从可解释性的角度来看,LLM 幻觉对此类任务的影响也尚未得到充分探索。为了解决这些问题,我们引入了 VisionToM,这是一个面向视觉的干预框架,旨在加强任务感知推理。核心思想是计算将视觉表示与正确的语义目标对齐的干预向量,从而通过不同层的视觉特征引导模型的注意力。该指南减少了模型对虚假语言先验的依赖,从而获得更可靠的多模态语言模型 (MLLM) 输出和更好的 QA 性能。 EgoToM 基准测试(一个以自我为中心的现实世界视频数据集,具有三个多项选择 QA 设置)表明我们的方法大大提高了 MLLM 的 ToM 能力。此外,一项额外的开放式生成任务的结果表明,VisionToM 使 MLLM 能够产生自由形式的解释,从而更准确地捕获智能体的心理状态,从而推动机器与人类的协作更加一致。