论文

PIVOTSBench:评估多模态中的细粒度人际关系推理 大语言模型

PIVOTSBench: Evaluating Fine-Grained Interpersonal Relationship Reasoning in Multimodal Large Language Models

模型评测基准与评测资源

摘要

人类拥有理解细粒度人际关系的天生能力,这对于日常社交互动至关重要。尽管这种推理本质上是多模态的,但现有的多模态 大语言模型 (MLLM) 在很大程度上仍未对其进行探索。为了解决这一差距,我们引入了 PIVOTS,这是第一个根据 Social-IQ 2.0 和 YouTube 数据构建的基准,用于评估 MLLM 基于现有心理学研究预测双向人际关系维度的能力。此外,PIVOTS 还包括辅助任务,用于评估模型识别和利用此类预测背后的关键视觉线索的能力。我们评估专有和开源 MLLM,并进行详细的消融研究,以分析对话话语中视觉模式和明确的社会角色信息的影响。我们进一步研究联合和成对预测设置如何使 MLLM 在对双向 PIVOTS 维度进行评分时受益。项目页面:https://ciossayin.github.io/pivots-bench/