论文
RDGen:通过强化学习实现高质量机器人学习的演示生成
RDGen: Demonstration Generation for High-Quality Robot Learning via Reinforcement Learning
摘要
视觉-语言-动作(VLA)模型已成为通用机器人控制的有前途的范例。然而,它们的性能仍然从根本上受到高质量机器人轨迹数据可用性的限制。在当前的机器人学习实践中,此类数据主要通过人类远程操作来收集,这是劳动密集型、成本高昂且难以扩展的。在本文中,我们提出了 RDGen,这是一种用于生成高质量机器人演示的拟真强化学习框架。 RDGen 并没有仅仅使用强化学习作为最终控制策略,而是利用经过训练的强化学习策略作为结构化轨迹生成器。该系统由一个基于 VLM 的任务解析器(可识别任务相关对象)、一个基于 Grounding DINO 的对象定位器以及一个从模拟传输到真实机器人的强化学习策略组成。然后,成功的轨迹采样将作为下游 VLA 训练的干净、高质量的演示,而模拟阶段进一步以很少的边际成本提供可扩展的附加轨迹源。拾放任务的实验表明,迁移的 RL 策略实现了很高的任务成功率。与人类远程操作相比,RDGen 产生的轨迹明显更加平滑,并产生卓越的下游 VLA 性能。这些结果表明,强化学习生成的演示可以作为机器人策略学习的更可靠和一致的监督信号。