论文
GeoProp:在视觉中对齐机器人状态以进行通用操作
GeoProp: Grounding Robot State in Vision for Generalist Manipulation
摘要
本体感觉是机器人操作的基础,但标准融合方法通常将其视为缺乏与视觉标记明确对齐的孤立向量。如果 3D 运动学和 2D 特征图之间没有直接对应,操纵策略就很难确定机器人在场景中的状态,经常甚至低于仅视觉基线。为了解决这个问题,我们引入了 GeoProp,这是一种轻量级、即插即用的适配器,可通过显式几何对齐和空间特征采样将本体感觉与视觉保持一致。 GeoProp 将机器人状态投影到图像平面上以采样局部视觉特征,构建与视觉位置对齐的状态词元。然后,它通过 FiLM 调制将状态导出的空间先验注入相应的视觉特征。为了捕捉运动意图,GeoProp 进一步在从最近的运动学中得出的短视野预测坐标处对特征进行采样,从而提供前瞻视觉上下文。在 67 个任务中,GeoProp 在 63 个模拟任务上将扩散策略提高了 8.7%,在 RoboTwin 子集上将 pi_0 提高了 4.0%,并在现实世界中的两个策略系列中产生了 10.6% 的平均增益,而参数计数仅增加了 2-3%。这些结果表明,GeoProp 是一种简单但影响深远的通用具身策略的归纳偏差。项目页面:https://alibaba-damo-academy.github.io/GeoProp/。