论文

VistaVLA:用于机器人操作的几何和语义感知 3D高斯空间表征增强 VLA

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

上下文与知识上下文工程

摘要

视觉-语言-动作 (VLA) 模型通过将语言指令和 2D 视觉输入直接映射到动作,已成为机器人操作的强大端到端范例。然而,这些模型缺乏明确的场景级 3D 表示,限制了它们推理空间布局和几何约束的能力。虽然最近的努力结合了明确的 3D 线索(例如深度图或点云)来提高几何意识,但它们主要捕获底层结构,缺乏 3D 空间中的高层语义与空间位置的对应。在人类认知中,与物理世界的交互依赖于 3D 语义认知图 - 一种内部心理模型,它将空间布局与语义上下文相结合,以实现持久的、视点不变的推理。有鉴于此,我们提出了 VistaVLA,这是一种新颖的两阶段框架,它根据 3D 高斯原语构建几何和语义感知的 3D 认知表示,并将其作为 VLA 策略学习的紧凑上下文标记。具体来说,VistaVLA 将多视图视觉语言特征提升为 3D 高斯基元,形成几何锚定的语义标记,将视图一致的空间定位与 2D 视觉特征空间对齐。为了使这种 3D 表示在计算上易于处理,以实现有效的 VLA 控制,我们引入了 Merge-then-Query (MtQ),一种词元汇总机制。 MtQ 将密集的高斯基元压缩为一组高度紧凑的空间信息标记,实现了 99% 的标记减少,同时保留了与动作相关的 3D 布局和语义上下文。在模拟和现实环境中的广泛评估证明了 VistaVLA 的有效性。值得注意的是,在现实场景中,VistaVLA 在七个现实任务中的成功率提高了 22.8%,在具有挑战性的分布外任务上比 VLA-Adapter 基准提高了 30.0%。