论文
RoboQuest:评测物理Agent的搜索、检查与试验能力
RoboQuest: Generalist Physical Agents that Search, Inspect and Test
摘要
多模态基础模型的最新进展使它们能够成为执行一系列操作任务的通用物理Agent。然而,在陌生环境中的成功操作可能需要Agent在观察中不存在时通过交互来寻找与任务相关的信息:它可能需要确定相关对象在哪里,检查未观察到的属性,或发现不熟悉工具的效果。因此,我们引入了 RoboQuest,这是目标导向的具体探索的基准,其中智能体必须通过物理交互主动获取任务相关信息,使用所得证据来调整后续行动,并自主决定何时致力于任务完成。 RoboQuest 包括十项移动操作任务,以三种形式的不确定性为中心:搜索、基于操作的检查和交互式测试。我们通过通用的视觉运动界面以及在我们发布的全集演示中微调的 $π_{0.5}$ 策略来评估五个前沿多模式Agent。最好的Agent只成功了 23% 事件,而微调的策略几乎从未成功。对构建任务的执行技能的独立测试以及所提供的隐藏信息表明,Agent可以执行大多数所需的操作,而我们的故障分析仅将少数故障归因于执行。我们的失败分析进一步发现,在观察任务完成所需的证据之前,智能体往往会过早地停止探索,因为他们做出决策。我们还发现,智能体很少能够预防或修复其探索造成的干扰。此外,对于大多数模型来说,通过反复试验来学习仍然很困难。
