论文
CtrlWAM:具有一致意图和远见的可控世界行动模型
CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
摘要
世界行动模型(WAM)联合预测行动(意图)和视觉未来(远见)。标准训练同时向记录的动作和视频添加噪声,但这种训练范例引入了不匹配:扰动的动作意味着反事实的未来视觉,而带噪声的视频仍然与 GT 记录相关。在低噪声情况下,尽管增加了噪声,但场景几何形状甚至动态行为从嘈杂的未来帧中仍然清晰可见。我们提出了 CtrlWAM,它在模拟器中执行扰动动作,并将它们与联合 WAM 学习的噪声视觉结果配对。为了适应视频和动作的不同降噪要求,我们引入了扭曲的视频动作噪声计划,旨在随着动作预测的发展保持视觉布局响应。我们进一步将动作接口从仅自我控制扩展到可变数量的Agent流,从而允许统一的模型来表示多个Agent的预测或命令的未来。驾驶实验显示出更准确的动作预测、生成的视频和动作之间更接近的一致性以及更好地遵循所提供的命令;机器人实验显示出更强的运动保真度和可控性。匹配的控件支持偏离路径渲染的优势,以实现命令跟踪和操作保真度。总之,这些发现有助于建立一个更加可控的世界行动模式。项目页面:https://ctrl-wam.github.io/