论文

RobotWorld:跨任务与机器人形态的多模态Agent评测

RobotWorld: Benchmarking Multimodal Agents for Robot Use Across Diverse Tasks and Embodiments

智能体系统应用与实践Agent 环境交互Agent任务评测机器人

摘要

通用Agent越来越多地编写代码、使用工具并完成复杂的数字任务,从而提出了这些功能在物理世界中的应用程度如何的问题。为了研究这个问题,我们引入了 RobotWorld,这是一个具有挑战性的机器人使用模拟测试平台:通过机器人接口将指令和观察结果转化为物理任务执行。它的 84 项任务涵盖操纵、移动操纵、运动、驾驶和空中控制,具有明确的交互预算和可执行的成功检查。通过分析任务结果和执行轨迹,我们可以识别转移的能力和妨碍可靠完成的差距。此外,我们发现当前的Agent可以构建复杂的感知和控制工作流程,包括图像分割、相机校准、空间估计和基于动力学的计算。然而,这些能力并不能始终构成成功的行为:尽管达到了命令的姿势,Agent仍会丢失与任务相关的对象状态,无法纠正无效的动作,恢复得太晚,或者 将未完成的任务误认为已完成。这种不均匀的转移在不同模型上也有所不同:Astra 在空间和受限接触目标上更容易取得成功,而 Opus 5.5 在连续平衡和定时交互目标上更容易取得成功。通过将这些结果与执行行为联系起来,RobotWorld 提供了严格的试验场和对剩余能力差距的实证解释,从而为训练和设计更可靠的物理世界Agent建立了具体目标。

RobotWorld:跨任务与机器人形态的多模态Agent评测:论文原图
图 2:RobotWorld 概述。 RobotWorld 评估通用多模式模型是否可以将数字功能转化为可靠的机器人使用。代理解释指令和观察结果,执行辅助计算,并通过跨不同机器人和任务的反馈循环采取行动。轨迹分析检查新兴功能,包括图像分割、几何校准、动力学建模和控制程序生成,以及故障机制和共享任务模型之间的差异。这些发现为培训和代理设计提供了信息。该场景说明了在单独的模拟环境中评估的任务系列。