论文

MV-WAM:具有价值增强的流形感知世界行动模型

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

模型架构新型架构

摘要

在不同的环境中实现稳健和通用的操作仍然是实体机器人技术的一个基本挑战。最近的世界行动模型实现了强大的域内性能,但它们的收益并没有按比例扩展到分布外场景。我们将此归因于视觉和动作模态之间的结构不匹配,其本质上的异构流形导致联合优化在分布偏移下不成比例地降低动作鲁棒性。为了解决这个问题,我们提出了 MV-WAM,这是一种新颖的端到端框架,它联合建模视觉预测、动作生成和价值估计,旨在在训练和推理过程中有效利用视频先验来增强动作泛化。这种统一的关键是跨模态因果掩码,它分层地为预测视频帧中的动作和两种模态中的价值函数标记奠定了基础。为了进一步缩小泛化差距,MV-WAM 采用了流形感知优化方案,该方案明确考虑了跨模态的结构异质性。最后,MV-WAM引入了进度值调节机制,可以估计任务完成情况并检测预测帧和生成动作之间的不一致,使策略能够自主识别执行偏差并通过值引导的回滚进行恢复。在 RoboTwin 模拟中,MV-WAM 在没有任何随机动作监督的随机场景下实现了 55.7% 的平均成功率,比最强基线高出 29.3%。 MV-WAM 在双臂机器人上完成四项不同难度的现实任务时实现了 77.5% 的平均成功率。我们的结果表明,流形感知的跨模式对齐对于稳健的政策泛化至关重要,为可部署的机器人操作提供了一条途径。