论文

像机器人一样观察:VLA 模型的以机器人为中心的点图

See like a Robot: Robot-Centric Pointmaps for VLA Models

摘要

视觉-语言-动作 (VLA) 模型需要 3D 空间推理,但 RGB 观测仅隐式编码机器人物体几何形状。使用相机内参提升深度使该几何体明确为密集的、图像对齐的点图,但它们的相机框架坐标取决于相机的位置。我们提出了 SeeR-VLA,它将点图转换为具有末端执行器原点和机器人底座对齐轴的以机器人为中心的框架。从预训练的 RGB 权重初始化的编码器提取点图特征,将其添加到相应的 RGB 标记中,而不增加标记计数。在 24 个 RoboCasa 任务和 4 个现实世界任务中,SeeR-VLA 比仅使用 RGB $π_{0.5}$ 的平均成功率分别提高了 6.4 和 32.5 个百分点。它还比最强的评估 3D 增强基线 PointVLA 分别高出 3.5 和 23.7 个百分点。除了这些收益之外,我们的消融还阐明了坐标选择如何影响 VLA 性能,表明末端执行器居中对于机器人底座对齐的轴最为有效。随着训练观点的多样化,好处也随之增加,凸显了在从不同的相机配置中学习时使用机器人框架点图的重要性。