论文
WatchAct:基于行为的机器人操作基准
WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation
摘要
与人类一起工作的机器人必须推理他们所做的事情、顺序以及意图。视频承载着语言未指定的空间布局、对象历史和手势,但当今的操作基准将指令与单个当前图像配对,无法评估对观察到的人类行为的推理。我们引入了 WatchAct,这是一个基于观察到的人类行为的机器人操纵基准。每个实例都将真实世界的人类动作视频和语言指令与对齐的模拟器场景和可执行的 LIBERO 任务配对,从而实现可扩展和可重复的评估。 WatchAct 包含 3,000 个跨 14 个任务的长视野实例,涉及四个能力域,这些任务源自观察另一个智能体的认知需求:解析事件(事件定位)、恢复程序结构(程序推理)、推断未表述的意图(隐式意图推理)以及跟踪场景如何变化(情景推理)。我们进一步提出了一种解开的评估协议,该协议分别测量(i)~通过视觉语言模型进行视频到计划的推理,(ii)~预言机计划下的策略执行,以及(iii)~通过集成规划器-策略管道完成的完整任务。在模拟和 Franka Research 3 机器人上,当前系统距离解决 WatchAct 问题还很远。最好的管道 Gemini-3.1-Pro(具有 $π_{0.5}$)在模拟中仅达到 16.3% 的成功率 (SR),在真实机器人上仅达到 14.0%。 Gemini-3.1-Pro 仅获得 36.8% 的计划 SR(人类为 97.1%),而 $π_{0.5}$ 在预言机计划下仅达到 21.5% 的任务 SR,在域外场景下下降至 10.6%。数据集和代码可在 https://baiqi-li.github.io/watchact_page/ 获取。