论文

Feat2Go:基于视觉特征的强化学习价值估计

Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

模型训练奖励建模与过程监督

摘要

强化学习是一种很有前途的方法,可以提高视觉-语言-动作(VLA)模型的能力,同时避免模仿学习的繁重数据要求。然而,它对 VLA 模型的有效性通常受到稀疏监督和设计用于长期操纵的信息奖励信号的困难的限制。在这项工作中,我们提出了 Feat2Go,一种用于具体强化学习的细粒度价值估计框架。具体来说,Feat2Go 首先通过测量子目标状态的块级相似性并使用基于趋势的聚类将片段划分为语义阶段,从预训练的视觉世界模型中导出连续进度目标。然后,我们训练一个体现价值模型,根据当前的观察和任务指令来预测这种结构性进展,并在政策优化期间使用预测值来重塑终端奖励。所提出的框架与现有的 VLA 策略强化学习管道(包括 PPO 和 GRPO)兼容,并且不依赖于手动奖励工程。 ManiSkill3 和 RoboTwin 2.0 上的大量实验表明,Feat2Go 在单臂和双手操作设置下都能持续提高现有 VLA 模型的性能。更具体地说,在 ManiSkill3 上,Feat2Go 将 OpenVLAOFT 的平均分布外成功率从 17.5% 提高到 82.9%,同时保留了 96.9% 的分布内性能。在 RoboTwin 2.0 上,Feat2Go 在领域随机任务设置中实现了 88.8% 的平均成功率,优于之前的强化学习方法。