论文
ESI-Bench:迈向闭合感知-行动循环的具体空间智能
ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop
摘要
空间智能通过感知-行动循环展开:智能体采取行动来获取观察结果,并推理观察结果如何随着行动而变化。他们不是被动地处理所见的东西,而是主动地揭示看不见的东西——仅通过被动传感无法解决的被遮挡的结构、动力学、遏制和功能。通过将观察者重新塑造为行动者,我们超越了先前假设神谕观察的空间智能表述。我们推出 ESI-BENCH,这是一个基于 OmniGibson 构建的体现空间智能的综合基准,涵盖 10 个任务类别和 29 个子类别,以 Spelke 的核心知识系统为基础。特工必须决定部署哪些能力——感知、运动和操纵——以及如何对它们进行排序以积极积累与任务相关的证据。我们对最先进的 MLLM 进行了广泛的实验,发现主动探索大大优于被动探索,智能体在没有明确指令的情况下自发发现紧急空间策略,而随机多视图通常会增加噪声而不是信号,尽管消耗了更多的图像。大多数失败不是源于薄弱的感知,而是源于行动的盲目性:糟糕的行动选择导致糟糕的观察,进而导致级联错误。虽然显式 3D 基础可以稳定深度敏感任务的推理,但事实证明,不完美的 3D 表示会扭曲空间关系,从而比 2D 基线更有害。人类研究进一步表明,与在矛盾下寻求伪造观点和修正信念的人类不同,无论证据质量如何,模型都会过早地以高置信度做出承诺,暴露出元认知差距,而单靠更好的感知和更具体的互动都无法弥补这一差距。