论文
SG-WAM:几何感知政策空间中的自引导世界建模
SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
摘要
世界行动模型 (WAM) 将行动生成与未来状态预测结合起来。它们的有效性取决于未来的动态是否在一个既与动作生成一致又具有足够的几何感知能力的空间中建模,以捕获动作在何处以及如何改变场景。现有的 WAM 通常仅满足此要求的一部分,依赖于感知上较重的观察空间目标或辅助潜在空间,而这些空间并未针对动作相关性和几何结构进行联合构建。我们提出了 SG-WAM,这是一个自引导框架,可以直接在策略派生的表示空间中学习几何感知的动作条件动力学。 SG-WAM 引入了可学习的动态标记和自我引导的世界预测器,可以根据机器人的干预动作来预测其未来的潜在状态。预测目标由同一策略主干的指数移动平均副本生成,在行动专家使用的表示系列内提供稳定的监督。几何监督进一步构建了策略图像词元表示,为动态词元提供了空间基础上下文,并产生了既与动作相关又具有几何感知的未来对齐空间。潜在未来预测、几何基础和流匹配动作生成在统一框架中进行端到端联合优化。 SG-WAM 基于 0.9B 模型构建,没有进行大规模的具体预训练,在 LIBERO 上实现了 98.5% 的平均成功率,在 LIBERO-Plus 上实现了 73% 的平均成功率,同时在分布内和分布外现实世界评估中均优于强大的基线。