论文
STARS:从时空动力学到人机交互中的社会表征
STARS: From Spatiotemporal Dynamics to Social Representations in Human-Robot Interaction
摘要
动态、以人为中心的环境中的机器人导航需要基于强大的场景理解的社会兼容决策。最近的视觉语言模型(VLM)展示了有前途的功能,例如对象识别、常识推理和上下文理解,这些功能符合社交机器人导航的细微要求。然而,目前尚不清楚 VLM 是否能够准确理解复杂的社交导航场景(例如,推断智能体之间的时空关系和人类意图),这对于安全且符合社交要求的机器人导航至关重要。虽然最近的一些工作探索了 VLM 在社交机器人导航中的使用,但现有的工作还没有系统地评估它们满足这些必要条件的能力。在本文中,我们介绍了社交导航场景理解基准 (SocialNav-SUB),这是一个视觉问答 (VQA) 数据集和基准,旨在评估 VLM 在现实社交机器人导航场景中的场景理解。 SocialNav-SUB 提供了一个统一的框架,用于在社交机器人导航中需要空间、时空和社交推理的 VQA 任务中根据人类和基于规则的基线评估 VLM。通过对最先进的 VLM 进行实验,我们发现,虽然性能最好的 VLM 达到了与人类答案一致的令人鼓舞的概率,但它仍然不如更简单的基于规则的方法和人类共识基线,这表明当前 VLM 在社交场景理解方面存在严重差距。我们的基准测试为进一步研究社交机器人导航基础模型奠定了基础,提供了一个框架来探索如何定制 VLM 以满足现实世界的社交机器人导航需求。本文的概述以及代码和数据可以在 https://larg.github.io/stars. 中找到