论文

SG-WAM:世界动作模型的基于文本和空间感知的语义指导

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

智能体系统Agent 规划

摘要

世界动作模型(WAM)已成为机器人操纵的一个有前途的范例。然而,大多数现有的 WAM 主要依靠视觉提示而不是语言指令来生成未来的视频和动作,因为现成的文本编码器嵌入独立于视觉观察的指令。因此,这些 WAM 预测的视频在语义上通常与相应的语言指令不一致,从而降低了预测动作的准确性。为了克服这一限制,我们提出了 SG-WAM,一种用于世界动作模型的语义指导方法,它利用视觉语言模型(VLM)作为语义规划器来增强世界动作模型的指令基础能力。具体来说,我们训练基于 VLM 的规划器来预测基于文本和空间感知的语义预见。基于文本的语义预见通过识别正确的目标对象来为指令提供基础,而空间感知的语义预见则提供用于精确操作的场景几何形状。然后,我们将这种远见作为高级语义指导注入到世界动作模型中,确保未来视频生成和动作预测忠实地遵循语言指令。模拟和现实世界中的大量实验证明了我们的语义引导方法的优越性,展示了精确的操作和强大的指令跟踪能力。