论文
GTA-2:以物体定位后的任务轴组合机器人操作技能
GTA-2: A Multi-VLM Framework for Synthesizing Robot Manipulation Skills via Grounded Task Axes
摘要
机器人操作任务通常分解为行为或技能。然而,人们通常需要为特定任务预先定义这些行为,或者尝试使用通用技能来涵盖广泛的任务。因此,这些行为可能仍然过于粗糙,无法公开执行所需的几何、控制和场景相关决策。我们推出了 Grounded Task Axes v2 (GTA-2),这是一个模块化的多 VLM 框架,它从可重用的以对象为中心的任务轴组件构建可执行的、任务定制的操作技能。 GTA-2 不是端到端预测动作或组成固定的任务级原语,而是将每项技能表示为语义子任务,其中包括任务相关的关键点和轴、控制器组合以及场景相关参数。四个专门的 VLM 代理分别分解任务、构建抽象任务轴技能、分配控制器参数,并根据 RGB-D 观察结果确定所需的视觉特征。这种从抽象到基础的分解可以实现零样本技能生成,无需特定任务的机器人演示、策略训练或 微调。它还使中间决策保持明确,允许有针对性的人类反馈来完善不正确的阶段,同时保留正确的组件。我们使用任务轴控制器或传统机器人基元,根据 VLA 策略 pi_{0.5} 和两个代码即策略基线,在 14 个真实机器人操作任务上评估 GTA-2。 GTA-2 的平均零射击成功率达到 73.9%,超出最强基线 31.4 个百分点,而针对性的改进将 GTA-2 的平均成功率提高到 90.7%。项目页面:https://gta2-project.github.io/