论文

Omni-MMSI:迈向身份归因的社交互动理解

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

模型评测基准与评测资源

摘要

我们引入了 Omni-MMSI,这是一项新任务,需要从原始音频、视觉和语音输入中全面理解社交互动。该任务涉及感知身份归因的社交线索(例如,谁在说什么)并推理社交互动(例如,说话者指的是谁)。这项任务对于开发能够感知和响应人类交互的人工智能助手至关重要。与之前基于预言机预处理的社交线索进行的研究不同,Omni-MMSI 反映了人工智能助手必须从原始数据中感知和推理的现实场景。然而,现有的管道和多模态 LLM 在 Omni-MMSI 上表现不佳,因为它们缺乏可靠的身份归因能力,从而导致社交交互理解不准确。为了应对这一挑战,我们提出了 Omni-MMSI-R,这是一种参考引导管道,可使用工具生成身份归因的社交线索并进行思想链社交推理。为了促进这个管道,我们构建了参与者级别的参考对,并在现有数据集的基础上策划推理注释。实验表明,Omni-MMSI-R 的性能优于先进的 LLM 和 Omni-MMSI 上的同类产品。项目页面:https://sampson-lee.github.io/omni-mmsi-project-page。