论文

多模态语言模型中的视觉空间视角

Visuospatial Perspective Taking in Multimodal Language Models

模型评测模型能力评测

摘要

随着多模式语言模型 (MLM) 越来越多地在社交和协作环境中使用,评估其观点采择能力至关重要。现有的基准在很大程度上依赖于基于文本的插图或静态场景理解,而视觉空间透视(VPT)尚未得到充分探索。我们改编了人类研究中的两项评估任务:导演任务(在参考通信范式中评估 VPT)和旋转人物任务(探索跨角度差异的观点采择)。在各种任务中,传销在 2 级 VPT 方面表现出明显的缺陷,这需要抑制自己的观点以采纳他人的观点。这些结果暴露了当前传销机构表达和推理替代观点的能力的严重局限性,并对其在协作环境中的使用产生了影响。