论文

IMBench:直观机器人操作的基准

IMBench: A Benchmark for Intuitive Robotic Manipulation

模型评测基准与评测资源

摘要

人类结合推理和运动控制来解决不同约束下的复杂操作任务。他们建立对物理世界的理解,这有助于他们将推理转化为行动,并快速适应新的场景、任务和规则。我们将此功能称为直观操作。现有的基准测试无法捕获这种集成:它们独立于执行来评估物理推理,或者在不需要显式推理的情况下测量策略性能。我们推出了 IMBENCH,这是一个基准测试,旨在评估直观操作作为涵盖感知、物理推理、动作生成和迭代执行的综合能力。我们的任务需要模型来推断与任务相关的物理结构,并在明确的约束下生成可行的动作序列,包括丰富的接触操作、工具使用和多阶段依赖性。我们引入了 35 个任务的基准、14K 过滤轨迹以及用于生成不同场景的可扩展工具。实验揭示了一致的差距:视觉语言模型显示出部分物理推理能力,但无法产生可执行的计划,而最先进的视觉语言动作模型难以满足任务约束并跨场景进行泛化。这些结果将直观操作确定为当前基础模型和通用机器人策略中缺失的轴,并将 IMBENCH 定位为评估和实现更集成、自适应的物理智能的一步。