论文
RoboPlayground:通过结构化物理领域实现机器人评估民主化
RoboPlayground: Democratizing Robotic Evaluation through Structured Physical Domains
摘要
机器人操纵系统的评估在很大程度上依赖于少数专家编写的固定基准,其中任务实例、约束和成功标准是预定义的并且难以扩展。这种范式限制了谁可以制定评估,并模糊了政策如何响应用户编写的任务意图、约束和成功概念方面的变化。我们认为,评估现代操纵政策需要将评估重新定义为结构化物理领域的语言驱动过程。我们提出了 RoboPlayground,这是一个框架,使用户能够在结构化物理域内使用自然语言编写可执行的操作任务。自然语言指令被编译成可重现的任务规范,具有明确的资产定义、初始化分布和成功谓词。每条指令都定义了相关任务的结构化系列,从而实现受控的语义和行为变化,同时保留可执行性和可比性。我们在结构化块操作域中实例化 RoboPlayground 并沿三个轴对其进行评估。用户研究表明,与基于编程和代码辅助的基线相比,语言驱动的界面更易于使用,并且认知工作量更低。评估语言定义任务族的学习策略揭示了在固定基准评估下不明显的泛化失败。最后,我们表明任务多样性随贡献者多样性而变化,而不仅仅是任务数量,从而使评估空间能够通过人群创作的贡献不断增长。项目页面:https://roboplayground.github.io