论文

社会直觉与机器推理:从多种模式预测人机交互

Social Intuition vs. Machine Reasoning: Anticipating Human-Robot Interaction from multiple modalities

模型评测模型能力评测

摘要

对于人类来说,预测一个人是否会从自己的角度进行互动是一项高度直观的任务,它依赖于各种线索的组合。我们研究人类如何使用仅姿势或完整视频输入从服务机器人的角度预测人的交互意图,然后对不同的轻量级基于姿势的模型和最先进的视觉语言模型进行基准测试。我们在 HUI360 数据集上对 100 个测试轨道(25 个正面,75 个负面)的固定试点子集进行了基准测试。我们发现,在仅姿势输入的情况下,人类注释者的表现优于轻量级训练的姿势模型,但差距并不大(F1-Score 为+0.08)。但是,当给出带有目标边界框的完整以自我为中心的视频时,人类注释者的表现要好得多,并且很大程度上优于视觉语言模型(F1 得分+0.2)。我们还比较了不同大小和不同输入条件下的 VLM,发现最佳结果与模型大小无关。我们的结果证实,预测交互对于社交机器人来说是一项具有挑战性的任务,并且具有推理能力的模型是必要的,但仅靠它们的实际推理能力不足以匹配人类的社交直觉。