论文

边部署边学习:针对通用机器人策略的舰队规模强化学习

Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies

模型训练强化学习

摘要

通用机器人策略越来越受益于大规模预训练,但仅靠离线数据不足以实现稳健的现实部署。部署的机器人会遇到固定演示数据集无法完全捕获的分布变化、长尾故障、任务变化和人工纠正机会。我们提出了边部署边学习(LWD),这是一种舰队规模的线下到线上强化学习框架,用于持续 后训练 通才视觉-语言-行动(VLA)策略。从预先训练的 VLA 策略开始,LWD 通过使用在机器人队列中收集的自主部署和人工干预,闭合了部署、共享物理经验、策略改进和重新部署之间的循环。为了稳定地从异构、稀疏奖励的车队数据中进行学习,LWD 将分布式隐式价值学习 (DIVL) 与用于稳健价值估计的分布式隐式价值学习 (DIVL) 与通过伴随匹配 (QAM) 进行的 Q 学习相结合,以在基于流的 VLA 动作生成器中进行策略提取。我们在 16 个双臂机器人组成的车队上验证了 LWD,执行了 8 个现实世界的操作任务,包括语义杂货补货和 3--5 分钟的长视野任务。随着舰队经验的积累,单一的通才政策会得到改善,平均成功率达到 95%,其中在长期任务上收益最大。