论文
Z-1:视觉-语言-动作模型的高效强化学习
Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型通过连接语言指令、视觉观察和连续控制,为机器人操作提供了一个有前途的框架。然而,大多数现有政策仍然受到行为克隆或来自固定演示的监督 微调 (SFT) 的限制,这提供了从政策自身失败中改进的有限机会。在本文中,我们提出了 Z-1,一种用于基于流的 VLA 模型的强化学习 (RL) 后训练 框架。 Z-1 建立在 $π_{0.5}$ 之上,仅使用公开发布的 RoboCasa 演示进行 SFT,然后在 $24$ 标准 RoboCasa 任务中应用任务明智的组相对策略优化 (GRPO) 策略。为了提高在线优化的效率和稳定性,Z-1结合了共享前缀rollout构建、树形结构轨迹分支、完成感知奖励校准以及VLM和Action Expert的选择性联合训练。在所有 $24$ RoboCasa 任务中,Z-1 的平均成功率为 $80.6\%$,比其 SFT 初始化提高了 $13.2\%$ 点,并且优于已发布的 sota 模型。这些结果表明,系统的 GRPO 后训练 可以显着改进基于流量的 VLA 策略,而无需额外的私人演示。