论文

SAM3D 引导的视觉-语言-动作模型的以对象为中心的表示对齐

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

摘要

视觉-语言-动作 (VLA) 模型在一般机器人操作方面显示出强大的潜力,但大多数现有模型依赖于 2D 视觉语言主干,缺乏对目标对象的细粒度 3D 理解,特别是在遮挡、姿态变化、尺度变化和精确空间交互的情况下。我们提出了一个基于 $π_0$ 的以对象为中心的 3D 表示对齐框架,使用 SAM3D 作为冻结的 3D 教师,在训练期间提供目标​​对象 3D 先验。具体来说,我们使用对象识别模型定位与任务相关的对象,生成相应的对象掩模,并使用 SAM3D 提取密集的对象级 3D 表示,这些表示与 $π_0$ 的中间视觉特征对齐。这使得策略能够内化目标对象 3D 信息,同时保留原始 RGB 语言到动作推理管道,而在测试时无需深度、点云、掩模、SAM3D 或其他 3D 模块。模拟实验显示了一致的改进,在 LIBERO 上实现了 99.1\%,在 CALVIN 上实现了 4.11 的平均长度。现实世界的实验进一步证明,我们的方法在长视距操纵场景中特别有效,在这种场景中,机器人必须跨多个子任务关注不同的目标对象。