论文
使用视觉-语言-动作模型进行长视野机器人操作的前视残差强化学习
Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models
摘要
视觉-语言-行动(VLA)策略提供了强大的通用操纵先验,但由于长期信用分配和子任务耦合,常常在严格公差、接触丰富的组装上失败:对于当前技能来说几何上成功的状态对于下游技能来说可能是脆弱的。我们在冻结的 VLA 基本策略上展示了剩余强化学习 (RL) 中的这种失败模式:恒定的稀疏成功奖励单独改善每个子任务,但当技能链接时几乎没有收益,因为最终状态质量不受控制。我们提出了 Foresight Residual RL,它通过使用离线估计的前瞻值(以当前子任务的最终状态为条件的未来子任务成功的概率)来增加每个子任务的稀疏成功奖励,从而优化切换质量。具体来说,我们(i)根据基本策略的最终状态图像训练视觉前瞻预测器,使用下游执行轨迹统计数据进行标记,以及(ii)通过后向前瞻归纳训练剩余策略,使用预测器输出作为奖励乘数。在 Isaac Gym 的基于扳手的三相螺母拧紧装配任务(抓取、移动插入、旋转)中,我们的方法实现了 85.6% 的完整任务成功率,优于标准子任务剩余 RL (54.5%) 和 VLA 基线,同时保持每个子任务成功率不变。这些结果强调,提高长期绩效需要塑造每个子任务产生哪些成功状态,而不仅仅是是否成功。