论文
Pointing-VLA:用于视觉-语言-动作操作的类型化空间空间定位接口
Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation
摘要
视觉-语言-动作(VLA)模型通常通过自回归文本坐标或不透明的动作标记来暴露空间基础,从而在多模式推理和机器人执行之间创建脆弱的接口。我们提出了 Pointing-VLA,一种基于 Embodied-R1 构建的类型化隐藏状态空间读数。几何特定头可以预测标准化点、对象功能基础 (OFG) 热图和视觉轨迹,而无需将几何序列序列化为文本。对于评估的 Bridge/WidowX 和物理拾取部署,显式执行合同将 PICK 分配给源条件 OFG,将 PLACE 分配给指向,从而提供直接的阶段对齐空间目标。 Pointing-VLA 在 Bridge/WidowX 上实现了 SOTA 性能,在启用碰撞的 CuRobo 执行下,在没有特定于 Bridge 的微调的情况下,在评估的四任务集中平均达到 72.9%。 Pointing 和 OFG 在本机和跨数据集评估中显示出互补的优势。 OFG/接触读数转移到 NORA-1.5,保留或提高成功率,同时将记录的控制器时间减少 20$\times$ 以上;打字头也比共享外部套件上的 Embodied-R1 文本解码快 6.68--6.90$\times$。当集成为 $π_{0.5}$ 动作策略的空间指导时,Pointing-VLA 将三个视觉环境中自主真实机器人的成功率从 52.7\% 提高到 80.7\%。这些结果将类型化的空间读数建立为体现推理和机器人执行之间的高效、可检查的接口。