论文
PointACT:具有多尺度点动作交互的视觉-语言-动作模型
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
摘要
视觉-语言-动作 (VLA) 模型通过利用大型预训练视觉语言主干,显示出通用机器人操作的强大潜力。然而,大多数现有的 VLA 主要依赖于 2D 视觉表示,这限制了它们推理细粒度几何和空间基础的能力,而这些能力对于 3D 环境中的精确和鲁棒操作至关重要。在本文中,我们提出了 PointACT,这是一种双系统 3D 感知 VLA 策略,它将分层 3D 点云表示直接集成到动作解码过程中。 PointACT 采用具有高效瓶颈窗口自注意力的多尺度点动作交互机制,使不断发展的动作词元能够密集地关注局部几何细节和全局场景结构。我们在 LIBERO 和 RLBench 基准上评估 PointACT,并将其与单片和双系统 VLA 基线进行系统比较,包括使用点云输入增强的变体。 PointACT 在两个基准测试中都取得了一致的改进,在具有挑战性的 RLBench-10Tasks 套件上,与最先进的预训练 VLA 相比,成功率提高了 10%,当视觉语言骨干被冻结并且动作专家从头开始训练时,效果会更大。广泛的消融研究表明,将分层 3D 几何与预训练的 2D 语义表示紧密耦合对于鲁棒且空间空间定位的机器人控制至关重要。我们的结果还强调了预训练 3D 表示对于 3D 感知 VLA 策略的前景。