论文

BIND:将 3D 机器人动作绑定到 2D 图像特征

BIND: Binding 3D Robot Actions to 2D Image Features

智能体系统Agent 环境交互

摘要

我们引入了 BIND,这是一种用于视觉运动机器人策略的新动作表示,它将 3D 机器人动作与其相应的 2D 图像特征绑定在一起,从而产生强大的数据效率增益以及对分布外对象位置和相机视点的鲁棒性。当前机器人策略的动作头通常被制定为来自预训练视觉编码器生成的单个全局特征向量的 MLP 回归。这种全局制定要求策略网络仅通过演示来发现目标机器人动作与其投影到的图像特征之间的关系。结果是,尽管现代图像特征在语义上是描述性的、空间上稳健的,甚至是多视图一致的,但基于它们构建的策略对于相机视点和对象放置的微妙变化来说是脆弱的,而且令人惊讶的是数据效率低下。 BIND 通过相机几何结构而不是学习来提供动作-特征关系,从而缩小了这一差距:它将候选末端执行器位置所在体积离散化为一组候选末端执行器位置,将每个候选者附加到每个相机视图中投影处的预先训练的特征,并通过对每个候选者的位置和图像绑定特征组合进行评分来选择动作。在真实的机器人上,我们研究数据效率和对看不见的物体位置和相机视点的分布外鲁棒性,以及一般的长时程任务执行和灵活性。我们发现 BIND 具有很高的数据效率和鲁棒性:它只需 5 次演示即可在任务上取得近乎完美的成功,并且在陡峭的摄像机视点移动和留出的物体位置(坐标回归基线完全失败)的情况下优雅地降级。