论文
掌握:学习在多人非语言互动中建立社会推理
GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions
摘要
理解社交互动需要对微妙的非语言线索进行推理,但当前的多模态 大语言模型 (MLLM) 通常无法识别多人视频中谁与谁互动。我们引入了 GRASP,这是一个大规模的社交推理数据集,它将高级社交 QA 与细粒度的注视和指示性手势事件连接起来。 GRASP 包含 46K 视频中的 290K 个问答对,总计 749 小时,按照涵盖凝视、手势和联合凝视手势推理的 16 类分类法进行组织,并结合 GRASP-Bench 进行评估。与之前关注孤立线索或高水平社交 QA 的资源不同,GRASP 从身份一致的注视轨迹、指示手势及其联合构成中构建问题,形成社交事件。此外,我们提出了社交基础奖励(SGR),这是一种学习信号,利用这些社交事件来鼓励模型对每次交互中涉及的参与者进行推理。实验表明,SGR 提高了 GRASP-Bench 上的性能,同时在相关社交视频 QA 基准上保持了零样本性能。