论文

DC-WAM:以动态为中心的视觉监督和世界动作模型的推理

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models

模型训练预训练

摘要

世界动作模型(WAM)通过未来视觉预测增强机器人策略,但仍不清楚视觉模态应该学习什么来进行控制。虽然逼真的未来预测提供了密集的监督,但它也需要大量的计算,并且可以将容量分配给与动作选择仅微弱相关的纹理、照明和背景变化。最近有效的 WAM 变体表明,视频分支的主要好处可能不在于渲染的未来本身,而在于训练期间引发的与控制相关的视觉表示。在这项工作中,我们从以动态为中心的角度重新审视未来的视频预测,并询问是否可以将现有的基于 RGB 的 WAM 从外观主导的重建重定向到交互引起的视觉动态,而无需在部署时引入额外的特定于模态的预测或在线输入。我们提出了 DC-WAM,这是一种以动态为中心的 WAM 框架,可以在 RGB 视频分支中重新分配监督和计算。在监督层面,DC-WAM 将时差流匹配与轨迹引导加权相结合,强调密集的时间变化以及夹具、被操纵物体和接触区域移动的局部区域。在推理层面,DynaRoute 预测 token-wise 的动态相关性,并将其转换为注意力偏差,引导模型转向与控制相关的未来 token。模拟和现实世界操作任务中的实验表明,DC-WAM 持续提高策略性能,特别是在照明、对象外观和背景纹理的分布外扰动下。