论文

RoboWM-Bench:评估机器人操作世界模型的基准

RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation

模型评测基准与评测资源

摘要

大规模视频世界模型的最新进展使得未来预测变得越来越现实,提高了使用生成的视频作为机器人学习的可扩展监督的前景。然而,对于具体操作,仅感知现实主义是不够的:生成的交互还必须在物理上一致并且可由机器人代理执行。现有的基准提供了对视觉质量和物理合理性的有价值的评估,但它们没有系统地评估预测的行为是否可以转化为完成操作任务的可执行动作。我们引入了 RoboWM-Bench,这是一种以操作为中心的基准,用于对视频世界模型进行基于实施例的评估。 RoboWM-Bench 将生成的人手和机器人操作视频转换为具体的动作序列,并通过在符合物理规律的仿真环境中执行来验证它们。 RoboWM-Bench 基于实景到模拟场景重建和多样化的操作任务,能够对物理可执行性进行标准化、可重复和可扩展的评估。使用 RoboWM-Bench,我们评估最先进的视频世界模型,并观察到视觉合理性和具体可执行性并不总是一致。我们的分析强调了影响执行性能的几个反复出现的因素,包括空间推理、接触预测和非物理几何扭曲,特别是在复杂和长视野的交互中。这些发现提供了对当前模型功能的更细粒度的视图,并强调了实施例感知评估对于指导机器人操作中基于物理的世界建模的价值。