论文
StageWAM:机器人操作中世界动作模型的联合嵌入阶段预测
StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation
摘要
通用机器人策略旨在将多模式观察和语言任务指令映射到跨不同任务的操作。然而,现有的方法通常将未来表示为固定的短视频动作块。这个短期未来捕获了动作执行的局部场景演变,但它没有明确描述阶段级未来,以指定任务应如何从当前阶段进展到下一个阶段。因此,我们区分了机器人操作的两个互补的未来:捕捉局部场景演化的短期物理未来和代表任务进度的阶段级语义未来。我们引入了 StageWAM,它通过 Stage-JEPA(目标条件联合嵌入预测架构 (JEPA) 预测器)增强了基于 Motus 的世界行动模型 (WAM)。给定当前观察和任务指令,Stage-JEPA 使用冻结的 V-JEPA2 编码器来提取当前状态表示并预测下一个推断阶段的潜在目标。在干净和随机环境中的 50 个 RoboTwin 2.0 任务中,StageWAM 取得了 90.25% 的总体成功率,并且相对于最强基线,成功执行轨迹的平均执行步骤数减少了 5.97%。