论文
SpatialPoint:用于具身定位的空间感知点预测
SpatialPoint: Spatial-aware Point Prediction for Embodied Localization
摘要
具身智能从根本上需要能够确定在 3D 空间中的行动位置。我们将这一要求形式化为体现本地化——根据视觉观察和语言指令预测可执行 3D 点的问题。我们用两种互补的目标类型来实例化具身定位:可触摸点、支持直接物理交互的表面定位 3D 点,以及空中点、指定放置和导航目标、方向约束或几何关系的自由空间 3D 点。具身定位本质上是具身三维 空间推理的问题 - 然而大多数现有视觉语言系统主要依赖于 RGB 输入,需要隐式几何重建,这限制了跨场景泛化,尽管 RGB-D 传感器在机器人技术中广泛采用。为了解决这一差距,我们提出了 SpatialPoint,这是一种经过精心设计的空间感知视觉语言框架,它将结构化深度集成到视觉语言模型 (VLM) 中并生成相机帧 3D 坐标。我们构建了一个 260 万样本的 RGB-D 数据集,涵盖可触摸点和空气点 QA 对,用于训练和评估。大量实验表明,将深度融入 VLM 可以显着提高具身定位性能。我们通过三个代表性任务的真实机器人部署进一步验证 SpatialPoint:语言引导的机械臂在指定位置抓取、物体放置到目标目的地以及移动机器人导航到目标位置。