论文
时间 GRPO:视觉-语言-动作强化学习中超越轨迹级信用
Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning
摘要
结果驱动的强化学习提供了一种可扩展的方法,可以根据稀疏的任务成功反馈来训练视觉语言动作(VLA)策略。在常见的基于 GRPO 的 VLA 后训练 中,一个 rollout 级优势应用于轨迹中的每个动作。因此,完成几个有效阶段但稍后失败的执行轨迹可能会惩罚产生其早期进展的操作。我们称之为轨迹级信用别名。时间 GRPO 通过构建可检测的任务阶段、将每个执行轨迹与特定于阶段的操作间隔对齐以及仅比较已进入同一阶段的执行轨迹来解决此问题。由此产生的阶段优势将应用于单个策略更新中的相应间隔。在 RoboTwin 2.0 上,时态 GRPO 提高了任务成功率和样本效率,并在整个任务范围内获得一致的收益。 LIBERO-Long 的受控更新保留了共享的先决条件阶段,并将改进集中在执行轨迹结果存在差异的第一阶段。