论文

ConsisVLA-4D:提高机器人操作高效 3D 感知和 4D 推理的时空一致性

ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation

摘要

当前的视觉-语言-动作(VLA)模型主要侧重于将二维观察映射到动作,但在时空感知和推理方面表现出明显的局限性:1)空间表示通常依赖于额外的传感器,引入大量的计算开销; 2)视觉推理通常仅限于未来帧预测,缺乏与基于指令的场景的一致性,从而损害了时空一致性。为了应对这些挑战,我们提出了 ConsisVLA-4D,这是一个统一高效的框架,可以增强 3D 感知和 4D 推理的时空一致性。具体来说,我们设计:1)CV-Aligner,通过过滤指令相关区域并跨多个视点对齐对象身份来确保跨视图对象语义一致性; 2)CO-Fuser,它通过使用紧凑的潜在表示消除跨视图的对象之间的空间关系模糊性来保证跨对象的空间几何一致性。在此基础上,我们引入了 3) CS-Thinker,以在行动展开时实现跨场景时空一致性。它从 CV-Aligner 的对象语义标记中学习局部动态的隐式知识,从 CO-Fuser 的几何标记中学习全局深度,从而增强场景变化下的高效视觉推理。大量实验表明,受益于高效的时空一致性设计,ConsisVLA-4D 在 LIBERO 基准和实际平台上与 OpenVLA 相比,性能分别提高了 21.6% 和 41.5%,推理速度分别提高了 2.3 倍和 2.4 倍。ConsisVLA-4D 是开源的,可在以下网址公开获取: