论文
3DVLA:通过 3D 空间和实例理解增强视觉-语言-动作模型
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
摘要
视觉-语言-动作模型在机器人操作方面取得了显着的进步,但它们面临着一个严重的限制:缺乏 3D 场景理解。这一缺陷表现为三个相互交织的挑战:在不强制执行多视图一致性的情况下对 3D 空间位置的提取较弱、3D 实例理解不足以及遮挡下的推理脆弱。尽管存在成熟的 3D 感知方法,但它们与 VLA 管道的直接集成受到架构不兼容和对昂贵的实例级注释的严重依赖的阻碍。为了解决上述挑战,我们提出了 3DVLA,这是一种即插即用框架,可以将强大的 3D 推理注入预训练的 VLA 中,而不需要额外的手动标签或丢弃 VLM 先验。具体来说,3DVLA 通过以下方式解决了三个挑战:(1) 具有跨所有模态的显式多视图一致性约束的普遍 3D 特征编码和空间条件几何聚合方法;(2) 具有用于 3D 实例感知的高级实例标记的实例估计模块;(3) 一个掩码自监督 3D 编码分支,保留其视觉标记完成的预测器以处理遮挡。我们将 3DVLA 与多个 VLA 基线集成,并在 LIBERO-Plus 和 RoboTwin 2.0 上进行评估。结果显示操作性能得到了一致且显着的提升,验证了我们方法的有效性和即插即用兼容性。