LIBERO-RECOVER:超越任务成功,迈向机器人操作模型的故障恢复
LIBERO-RECOVER: Beyond Task Success Towards Failure Recovery in Robotic Manipulation Models
摘要
视觉-语言-动作(VLA)或世界动作(WAM)模型最近在机器人操作方面表现出了卓越的性能。在 LIBERO 上,SOTA 方法取得了近 100% 的成功率,这似乎表明该模型已准备好在现实世界中部署。然而,现有基准上近乎完美的性能可能会产生误导:理想条件下的成功并不意味着现实世界的稳健性。现有的基准主要评估预定义初始状态的任务完成情况,而现实世界的交互不可避免地会涉及失败,例如抓取失败、碰撞和意外的物体移动。因此,机器人不仅必须成功执行任务,还必须能够识别故障并从故障中恢复以继续执行任务。然而,这种能力在很大程度上仍未得到衡量,揭示了基准性能与现实世界可靠性之间的关键差距。为了解决这一差距,我们引入了 LIBERO-Recover Benchmark,这是一个用于机器人操作故障恢复的大规模基准。在 LIBERO 的基础上,我们从 SOTA 体现模型中收集真实的执行失败,并构建了跨四个恢复级别的 1,000 多个场景:(1) 操作重试、(2) 操作适应、(3) 对象状态恢复和 (4) 环境恢复。我们评估四个核心能力:空间理解、对象结构推理、交互理解和拓扑推理。作为第一个针对实体故障恢复的大规模基准,LIBERO-Recover 将评估从 \emph{机器人能否成功?''} 转变为 \emph{机器人在失败后能否恢复?''},从而促进了健壮且可泛化的实体代理。该项目将在 \textcolor{blue}{https://liulin815.github.io/LIBERO-Recovery/} 中提供。