论文

ViVa:机器人强化学习的视频生成价值模型

ViVa: A Video-Generative Value Model for Robot Reinforcement Learning

模型训练奖励建模与过程监督

摘要

视觉-语言-动作(VLA)模型通过大规模预训练实现了先进的机器人操作,但由于部分可观察性和延迟反馈,现实世界的部署仍然具有挑战性。强化学习通过价值函数来解决这个问题,价值函数评估任务进展并指导政策改进。然而,基于视觉语言模型(VLM)构建的现有价值模型难以捕捉时间动态和物理交互,从而破坏了长期任务中可靠的价值估计。在本文中,我们提出了 ViVa,一种视频生成价值模型,它重新利用预训练的视频生成器来联合预测未来的本体感觉和标量值。通过将价值估计建立在预期的实施例动态中,ViVa 利用时空先验将价值与超越静态快照的远见本质上结合起来。 ViVa 在三个任务的基于指标的评估中取得了最先进的结果,产生了可靠的价值信号,可以准确跟踪任务进度并检测执行错误。集成到 RECAP 中后,它的平均成功率达到 80%,凸显了视频生成模型在价值评估方面的前景。