论文

Prism-GRPO:通过拆分相同结果组加快 VLA 策略优化

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

模型训练强化学习

摘要

GRPO 越来越多地用于视觉-语言-行动(VLA)策略的强化学习,因为与 PPO 不同,它不需要训练批评者。这种简化会带来采样成本:相对于组的优势需要从每个场景进行多次执行轨迹。在二元成功奖励下,全部执行轨迹成功或全部失败的群体的优势为零,并被动态采样丢弃。这些群体在训练早期尤其常见,此时大多数执行轨迹都失败了,浪费了大量昂贵的机器人执行轨迹预算。我们引入了 Prism-GRPO,它通过加权轨迹级执行质量得分来增强二元结果奖励。通过将相同结果的组划分为质量谱,Prism-GRPO 可以恢复训练信号,同时确保每次成功仍然优于每次失败。质量分数可以从模拟器接触、执行的动作或视觉观察中得出,从而避免特定于任务的进度奖励。我们证明 Prism-GRPO 永远不会增加采样组因具有零优势而被丢弃的概率,并推导出一个梯度对齐条件,在该条件下其组合更新仍然是任务成功的局部上升方向。在跨越不同视野和协调模式的四项 RoboTwin 任务中,Prism-GRPO 在匹配的执行轨迹预算下提高了成功率和质量,并以最多减少 56% 的执行轨迹次数实现了目标成功率。它还抑制了 奖励作弊 快捷方式,将清洁行为直接执行轨迹到真实机器人上。通过消融,我们在接触、平滑度和 VLM 导出的质量信号上显示出一致的增益。