论文

持久机器人世界模型:通过强化学习稳定多步滚动预测

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

模型训练强化学习

摘要

动作调节的机器人世界模型在给定机器人动作序列的情况下生成被操纵场景的未来视频帧,为模拟难以用传统物理引擎建模的任务提供了一种有前景的替代方案。然而,这些模型针对短期预测进行了优化,并且在自回归滚动预测时会崩溃:每个预测剪辑都会作为下一个剪辑的上下文反馈,从而导致错误加剧和视觉质量迅速下降。我们通过以下贡献来解决这个问题。首先,我们引入强化学习 (RL) 后训练 方案,该方案在其自身的自回归滚动预测上而不是在 真值 历史上训练世界模型。我们通过将最近的扩散模型的对比 RL 目标适应我们的设置来实现这一目标,并表明其收敛性保证了精确的延续。其次,我们设计了一个训练协议,该协议可以生成并比较来自同一滚动预测状态的多个候选可变长度未来,从而增强对低保真度预测的高保真度预测。第三,我们开发了高效的多视图视觉保真度奖励,该奖励结合了跨摄像机视图的互补感知指标,并在剪辑级别聚合以获得密集、低方差的训练信号。第四,我们表明,我们的方法在 DROID 数据集上建立了新的最先进的展示保​​真度,在所有指标上都优于最强的基线(例如,外部摄像头的 LPIPS 降低了 14%,手腕摄像头的 SSIM 提高了 9.1%),赢得了 98% 的配对比较,并在盲人研究中获得了 80% 的偏好率。