论文

RoboWits:机器人创造性解决问题的意外挑战

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

模型评测基准与评测资源

摘要

在意想不到的挑战下推理、适应和创造性地解决问题的能力对于在现实环境中运行的机器人至关重要。然而,当前的机器人基准测试主要强调技能水平的执行,并且对这种认知推理能力的洞察力有限。我们推出 RoboWits,这是一种双手动机器人基准测试,旨在系统地评估认知推理、创造性工具的使用以及对意外情况的鲁棒性。为了实现以推理为中心的高质量意外场景的可扩展构建,我们提出了一种自动化任务生成管道,它被制定为多代理协作框架,包括用于种子任务生成和验证、度量生成、场景生成和任务突变的代理。使用该管道,我们策划了 30 个不同的种子任务和 208 个任务,这些任务在几何、材料和基于装配的推理方面具有突变和分级难度。我们对流行的机器人策略、预训练的 VLA 和预言机状态规划器进行基准测试。我们的结果揭示了显着的性能差距:虽然预训练的 VLA 在单任务 微调 后在种子任务上表现出初步成功,但它们在变异任务上表现不佳,这意味着它们在需要推理、策略适应以及对欺骗或受限环境的鲁棒性的操作任务中很脆弱。项目页面位于 https://umass-embodied-agi.github.io/RoboWits。