BridgeVLA++:用于 3D 操作的数据高效、可泛化和内存增强的视觉-语言-动作框架
BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
摘要
利用预先训练的视觉语言模型 (VLM) 构建视觉语言动作 (VLA) 模型已成为 3D 机器人操作的一个有前景的范例。然而,现有的 3D VLA 方法仍然需要大量数据,在分布变化下表现出有限的泛化能力,并且缺乏对过去观察结果的明确记忆。这些限制阻碍了它们在数据稀缺、开放世界和依赖内存的操作场景中的应用。我们之前的工作 BridgeVLA 通过在 3D 动作学习期间保留预训练 VLM 的输入输出对齐来提高数据效率和泛化性:原始点云被投影到多视图图像中,并在生成机器人动作之前预测中间热图。在这项工作中,我们通过为 BridgeVLA 配备统一的时空内存架构来开发 BridgeVLA++,该架构可以模拟持久的空间上下文和时间交互历史。由此产生的内存增强框架可以对观察历史进行推理,同时保留 BridgeVLA 的数据效率和泛化能力。大量的实验表明,我们的框架在空间操作任务上实现了强大的性能,同时表现出强大的泛化能力。 BridgeVLA++ 在两个具有挑战性的内存相关操作基准上进一步实现了最先进的性能,而无需牺牲原始 BridgeVLA 的数据效率和泛化能力。此外,BridgeVLA++ 在双手操作设置中表现出色,并在其他真实机器人平台上进行了验证,展示了其跨任务、环境和机器人平台的可扩展性。这些结果将 BridgeVLA++ 确立为统一的 3D 视觉-语言-动作框架,同时支持数据高效学习、稳健泛化和有效的记忆感知机器人操作。项目网站:https://bridgevla-plus.github.io/。