论文
OA-WAM:用于鲁棒机器人操作的对象可寻址世界动作模型
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
摘要
世界动作模型(WAM)通过联合预测场景演化和机器人动作来增强视觉-语言-动作策略,但现有方法通常将预测的世界表示为整体图像、视频标记或全局潜在变量。当指令引用特定对象时,尤其是在对象身份与上下文纠缠在一起的场景转换下,动作解码器很难处理这些表示。我们提出了 OA-WAM,一种用于稳健机器人操作的对象可寻址世界动作模型。 OA-WAM 将每一帧分解为 N+1 个槽状态,其中有一个机器人槽和 N 个对象槽。每个槽都包含一个持久地址向量和一个时变内容向量,并以块因果序列与文本、图像、本体感受和过去动作标记融合。世界头预测下一帧时隙状态,而流匹配动作头在同一前向传递中解码 16 步连续动作块。可寻址性是通过仅地址键路由跨时隙注意力并在每个 Transformer 层重置地址片来强制执行的,从而将要操作的对象与当前对象分开,而无需添加额外的词元。 OA-WAM 在 LIBERO (97.8%) 和 SimplerEnv (79.3%) 上与强大的 VLA 和 WAM 基线相匹配,在最相关的 LIBERO-Plus 几何轴上达到最先进的性能,并在七轴聚合上保持竞争力。因果时隙干预测试产生的交换绑定余弦为 0.87,而整体基线最多为 0.09。这些结果表明,可寻址对象状态为场景扰动下的鲁棒世界动作建模提供了有效的接口。