论文
智能体能理解社交情境吗?多模态仿真中的视觉社交智能评测
Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation
摘要
社交互动取决于语言和可见的社交信号,例如面部表情、姿势、目光和情绪变化。然而,现有的社交代理基准主要基于文本,很少测试多模式代理是否可以使用视觉提示来指导交互。我们引入 \textsc{\benchmarkname{}},这是一个评估多模态社交模拟中视觉社交智能的基准。它包含240个场景、585个角色实例和2,340个角色任务实例,结合了对齐的文本视觉证据、结构化的角色概况和四个角色级任务:表达任务、特征任务、交互调节任务和交互结果任务。在言语视觉和直视下评估最近的七个 MLLM 揭示了本地角色制定和交互管理之间的明显差距:特定角色的表达和冲突处理接近饱和,而交互调节和基于视觉的结果实现仍然更加困难。代码发布于 https://github.com/JunsWan/AgentViSS,数据集可在 https://huggingface.co/datasets/JunsWan/AgentViSS 获取。