论文
从预训练到熟练:以最少的人为干预进行长视野操纵的现实世界子任务强化学习
From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
摘要
预先训练的机器人基础策略可能会执行大部分长期任务,但在一些关键子任务上会反复失败。收集额外的全任务演示以进行监督微调(SFT)需要操作员重复策略已经表现良好的行为。强化学习(RL)微调为弥合这一差距提供了一条有希望的途径,但现有方法很难仅使用稀疏奖励来解决长期任务。我们提出了 PARTS(针对目标子任务的 RL 策略适应),这是一个现实世界的子任务 RL 框架,该框架将实践集中在这些瓶颈上,同时允许在最少的人为干预下进行训练。冻结的预训练策略在整个执行过程中提供名义操作,而代理生成的选择器和成功验证器则激活剩余修正并提供本地结果奖励。即使完成任务的成功很少,这些奖励也支持从成功的子任务中学习。训练将在线强化学习与成功重新加权再训练相结合,并且每个重新训练的剩余策略都会被重新部署以收集更多经验。人类在设置过程中识别瓶颈,并在需要时执行物理重置。在双手 YAM 和单臂 Franka 任务中,平均每个任务使用数十分钟的现实世界 RL 部署,PARTS 将完成任务的成功率分别从 32% 提高到 61% 和从 50% 提高到 95%。与现实世界中现有的 RL 微调方法相比,在相同的机器人部署预算下,PARTS 将完整任务的成功率提高了 25% 以上,同时需要更少的人工参与。