通过锚定机器人关键点进行顺序规划
Sequential Planning via Anchored Robotic Keypoints
摘要
我们通过锚定机器人关键点 SPARK 提出顺序规划,这是一种 无需训练 神经符号操纵系统,在 6 个 LIBERO-PRO 位置和任务单元上达到 43.7%,是 CaP-Agent0 和视觉-语言-动作 (VLA) 基线的两倍多。 CaP-Agent0 是一种多轮代码生成代理,通过每次重新查询 LLM 实现 18.2%,但事实证明,其从头开始的解决方案对于较小的策略失败来说代价高昂。感知层是在位置和任务变化时最失败的层,因此 SPARK 在那里进行计算。单个 Gemini 调用将计划组成为可组合基元的类型化行为树 (BT),每个基元都已包含底层控制(运动、抓取、深度几何),否则代码生成代理将在每次试验中重新生成。预算的其余部分用于感知:第二个 Gemini 调用为每个对象提出了三个替代文本提示,SAM3 对每个提示进行评估,我们将提示 $\to$label 对保留为最有信心的检测和恢复循环,然后针对新检测到的对象重试失败的原语,没有新的 LLM 调用。替代提示在空间套件上添加 +27.7 点,在对象套件上添加 +10.0 点,恢复循环总体上添加 +5.0 点。 SPARK 在三个机器人系列(UR10e、Franka FR3、双手 Franka)上运行相同的原语,完成九个独特的任务,每个任务进行 20 次试验,平均率为 68%。由于检测器、规划器和控制器模块位于键入的规划后面,因此它们无需训练即可独立交换,并且每个基元的可检查后置条件都会跟踪相应模块或运动学极限的故障。每次试验都会记录经过验证、标记的轨迹,因此已经击败 VLA 的 无需训练 规划器可以提供这些策略所需的数据,而无需远程操作。项目页面:https://cwru-aism.github.io/spark-page/