论文

WCM:视觉-语言-动作强化学习的世界批评模型

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

模型训练强化学习

摘要

视觉-语言-动作 (VLA) 模型的强化学习 (RL) 后训练 在机器人操作方面显示出了强大的前景。在 RL 方法中,基于批评家的方法依赖于主要在单帧观察或单帧 VLM 主干潜伏上运行的值估计器,这与机器人控制的部分可观察性质根本不匹配。将观察历史纳入批评家的幼稚方法会导致高维视觉空间的指数复杂性,并且仍然失败,因为纯标量返回回归为学习跨时间动态提供了足够的监督。我们将根本原因确定为状态近似问题:如果没有明确的世界建模目标,批评者的表示无法捕获准确的值估计所需的时间结构。为了解决这个问题,我们提出了世界评论模型(WCM),它建立在轻量级的 LeJEPA 架构之上; WCM 联合预测未来的潜在状态并估计值,以便对批评者的表示进行显式训练以捕获时间动态,而不仅仅是回归标量回报。 WCM 无缝集成到 同策略 和 离策略 训练管道中,并与最先进的 VLA 主干网兼容,包括 Pi0、Pi0.5 和 OpenVLA-OFT。对四个基准的 149 项任务进行的广泛实验表明,WCM 在分布内和分布外设置中始终实现最先进的性能,并且具有特别强大的泛化增益。我们使用 OpenVLA-OFT 和 Pi0.5 以及 离策略 RL 在七个实际操作任务上进一步验证 WCM,确认在不同设置中的稳定部署。