论文
StructRL:用于长视野视觉-语言-动作任务的在线结构化强化学习
StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks
摘要
视觉-语言-动作(VLA)模型在短期操作任务上表现良好,但在需要通过单个命令进行多个相关操作的长期任务上仍然表现不佳。在线强化学习(RL)可以通过环境交互来改进这些策略,但许多现有方法仅在完成任务成功后才提供奖励。然而,这种终端监督很少,并且无法区分早期失败和取得实质性部分进展的rollout。我们提出了 StructRL,一个在线强化学习框架,它根据可验证的子任务完成情况构建结构化中间监督。 StructRL 将每个任务分解为可验证的子任务,仅在先决子任务完成后才授予中间奖励,并根据完成速度调整每个奖励。在具有 GR00T-N1.5 和 pi 0.5 的 RoboCasa365 和 LIBERO-Long 中,StructRL 始终优于评估的在线 RL 基线。这些结果表明,可验证的、结构化的中间奖励可以改善长期 VLA 训练后效果。代码可在 https://github.com/amazon-science/StructRL. 获取