论文

MaskWAM:统一世界动作模型的掩模提示和预测

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

摘要

世界动作模型(WAM)为通过视频预测进行机器人控制提供了一种有前途的范例。然而,当前的 WAM 面临着基本的空间瓶颈:标准文本输入在杂乱的场景中引入了引用模糊性,而非结构化 RGB 预测缺乏语义基础,并且仍然受到与任务无关的背景的影响。为了克服这些限制,我们引入了 MaskWAM,一种以对象为中心的世界动作模型。通过 Transformer (MoT) 的统一混合将掩码联合集成为显式输入和预测,MaskWAM 解锁了强大的策略泛化能力。这种设计提供了两个主要好处:(1) 预测未来的掩模产生以对象为中心的语义监督,抑制视觉噪声,甚至显着增强标准文本条件的 WAM; (2) 将这种预测监督与第一帧视觉提示(例如目标对象蒙版)结合起来,建立精确的空间锚点,从而大大减少语言歧义。至关重要的是,由于 WAM 本质上是视觉驱动的架构,因此直接掩模调节比单独的文本产生更强的指导,从而为操纵看不见的物体建立了精确而强大的范例。对 LIBERO、RoboTwin 和现实世界任务的评估表明,MaskWAM 在语言清晰和语言模糊的任务中都显着优于基线。