论文

SocialReasonBench:反事实叙事视频社会推理的视频质量保证基准

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

模型评测基准与评测资源

摘要

大型多模态模型(LMM)的最新进展极大地提高了视频理解,但它们推理以人为中心的社会情境的能力仍然有限。现有的基准通常依赖于具有单一观察轨迹的视频,因此很难确定模型是真正理解社会动态还是仅仅利用重复出现的叙事模式。我们引入了 SocialReasonBench,这是一个视频多项选择 QA 基准,用于评估交互式叙述场景中的社会推理。该基准以《底特律:成为人类》的游戏视频为基础,利用分支故事情节,玩家的决策会导致替代的社会结果,这些结果可以根据游戏自己的脚本、流程图和记录的分支进行检查。我们开发了一个多代理管理管道,可以本地化具有社会意义的剪辑,在游戏状态信号中提供答案标签,并使用诊断干扰项生成理论指导的问题。 SocialReasonBench涵盖七个推理维度,包括意图识别、情感同理心、道德困境、反事实推理和因果前提。对当代 LMM 的实验表明,模型在基本社会理解方面表现相当不错,但在反事实和因果推理方面表现不佳。进一步的消融和诊断错误分析表明,模型通常依赖于不完整的模态线索,并陷入视觉捷径等推理陷阱,凸显了可观察事件识别与对潜在社会状态的更深层次推理之间的差距。