论文
EgoGapBench:多智能体场景中以自我为中心的动作选择基准测试
EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes
摘要
现有的以自我为中心的基准主要是根据第一人称视角数据构建以自我为中心的设置,这使得很难单独评估以自我为中心的视角本身。然而,理解第一人称视角输入和采取自我中心视角是可分离的能力,特别是当第一人称身体线索不存在或其他代理存在时。为了隔离以自我为中心的视角理解,我们引入了 EgoGapBench,这是一个用于测量多智能体以自我为中心的场景中的动作选择的诊断基准。我们将这个基准衡量的能力定义为以自我为中心的行动选择(EAS):在其他智能体存在的情况下,从智能体的角度选择适当的行动。在 EgoGapBench 上,人类可以可靠地回答,而开源和专有 MLLM 的表现都差得多,并且会系统地选择其他可见代理执行的操作。对现有以自我为中心的数据的 微调 无法缩小这一差距,甚至可能是有害的。相比之下,EgoGapBench 训练数据上的 微调 提高了准确性,但未达到人类表现。这些结果表明,EAS 很难仅从第一人称视角数据中获取,并且 MLLM 不仅应该针对场景理解进行评估和训练,还应该针对以自我为中心的动作选择进行评估和训练。