Bridge-WA:学习机器人操作的与动作相关的世界动力学
Bridge-WA: Learning Action-Relevant World Dynamics for Robotic Manipulation
摘要
通用 VLA 模型利用大规模视觉语言先验来理解场景和指令,但主要是直接根据当前观察生成动作。 WAM 进一步模拟未来的场景状态,为环境如何演变提供更广阔的视野。然而,对于机器人操纵来说,预测整个未来场景可能会引入超出动作生成所需的信息;更重要的是,有效的行动不仅需要了解场景可能会变成什么,还需要了解相关变化在何处以及如何发生。为了将行动生成与世界的这些与行动相关的方面联系起来,我们提出了 Bridge-WA,这是一个通用的世界行动框架,可以学习未来状态、空间变化和局部运动的互补表示。具体来说,Bridge-WA 由潜在世界动态模块 (LWDM) 和 WorldBridge 组成。 LWDM 根据 VLM 输出预测未来状态、空间变化和局部运动,并受到相应的世界目标的监督。 WorldBridge 嵌入到动作 Transformer 中,并通过多源注意力、时空偏差和可靠性门控特征调制注入这些世界先验的特定层组合。这种设计将动作生成基于与动作相关的未来动态,同时自适应地调节世界指导,从而能够对视觉干扰和观点转变进行稳健的泛化。我们在四个模拟基准和真实机器人上对 Bridge-WA 进行了评估,其最大成功率分别提高了 11.1%、42.0%、3.7%、23.4% 和 11.1%,并且在 LIBERO-Dynamic、RoboTwin 2.0 和现实世界中实现了最先进的平均成功率。特别是,Bridge-WA 展示了对模拟和现实环境中的视觉变化和视点转换的强大泛化能力。代码和可视化可在以下位置获取:https://hcplab-sysu.github.io/BRIDGE-WA。