论文
WorldScape 政策 2.0:通过推理增强记忆和情境学习增强可操纵的世界行动建模
WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory and In-Context Learning
摘要
世界动作模型(WAM)通过联合建模视觉状态转换和机器人动作,为机器人操作提供了一个有前途的范例。然而,现有的 WAM 受到有限的时间上下文、粗略的情节级语言监督和主要的纯文本调节的限制,这阻碍了任务进度跟踪和细粒度的语言视频动作基础,同时限制了视觉上下文推理和跨实体传输。在本文中,我们介绍了 WorldScape Policy 2.0,这是一种具有推理增强长短期记忆的可控 WAM。它的因果短期视觉记忆提供最近的观察结果作为 DiT 预填充,以保留局部交互动态,而其长期短期事件记忆将历史 VLM 输出组织成全局历史、局部活动和事件边界表示,以进行进度感知检索。检索到的历史增强了感知和自回归生成的规划标记,从而产生自主规划的隐式子目标条件;语义强制进一步将事件级指令语义转移到这个潜在的规划路径中。为了建立细粒度的多模态可控性,我们构建了 ManipEvent-5M,这是一个基于事件的具体预训练数据集,包含近 500 万个事件片段,这些事件片段具有对齐的动作轨迹、情节级任务指令、片段级子任务描述、目标图像和视频演示。这些设计提供了一个统一的界面,用于根据高级指令进行自主规划,并根据细粒度文本、目标图像或视频上下文提示进行可控执行。模拟和现实世界平台上的实验证明了其在长期自主规划、细粒度指令跟踪和上下文适应方面的卓越能力。