论文

HumanoidToolBench:从选择到移动执行的人形工具使用基准测试

HumanoidToolBench: Benchmarking Humanoid Tool Use from Selection to Mobile Execution

模型评测基准与评测资源

摘要

随着机器人硬件和学习方法的进步,类人机器人需要工具来执行超越其固有物理限制的任务。成功的工具使用需要选择合适的工具并协调操作,并在需要时协调运动来完成任务。现有的基准测试并没有联合评估人形机器人的这些能力。我们引入了 HumanoidToolBench,这是一个涵盖三种场景、三种执行级别和两种工具集模式的 18 任务基准测试,以及 ToolBook(在模拟和真实 Unitree G1 上收集的 3.1k 演示数据集)。对模拟中的七个策略和真实机器人上的三个策略的评估揭示了选择合适的工具和完成任务之间的巨大差距。聚焦的 GR00T N1.7 探针显示出对看不见的工具的选择精度降低,并且在不相关的指令下继续执行任务。代码和数据可在 https://snu-pi.github.io/HumanoidToolBench/. 获取