论文

超越视觉抓取:从检测到执行的复杂抓取基准测试

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

模型评测基准与评测资源

摘要

强大的机器人抓取仍然是复杂的现实应用的基本挑战。大型模型的最新进展展示了机器人任务推理的有前景的能力。然而,现有的抓取基准主要集中在孤立的、基于视觉的抓取姿势检测上,未能捕捉到执行过程中需要多步骤推理和语义理解的抓取任务的复杂性。为了解决这一差距,我们提出了 GCA-Bench,这是一个具有挑战性的 \textit{掌握复杂动作} 场景的基准,涉及场景级推理和语义约束。 GCA-Bench 能够在相同设置下评估最新的大型基础模型。为了证明我们新基准的有效性,我们实施了一组不同的基准,从传统的抓取检测管道到端到端的学习方法。实证研究在复杂的抓取场景中取得的成功率低于 70%,凸显了关键的局限性。此外,我们提出新的评估指标,分析关键故障模型,并提供见解来指导更强大和更通用的抓取策略的开发。