论文

Reward-DAgger:通用进度奖励模型门控的机器人交互模仿学习

Reward-DAgger: Robot-Gated Interactive Imitation Learning with General-Purpose Progress-Based Reward Models

模型训练监督微调与指令调优

摘要

机器人学习的最新进展使得通才控制策略能够完成广泛的任务。然而,当部署在看不见的环境中时,它们的性能会下降,因此检测故障和教授恢复行为至关重要。现有的运行时监控方法通常需要特定于任务和策略的训练或超参数调整,限制跨任务部署并在迭代策略更新期间引入额外的开销。我们提出了 Reward-DAgger,这是一种机器人门控的交互式模仿学习框架,它使用来自通用奖励模型的密集进度信号来确定何时需要人类干预。我们的方法与底层策略架构无关,不需要访问策略内部,并且可以跨任务应用而无需重新调整门控机制。我们的结果表明,与现有的运行时监控基线相比,Reward-DAgger 实现了更好的故障检测精度与延迟权衡。在八个模拟和现实世界任务中,Reward-DAgger 在整个交互式学习过程中持续提高下游策略的自主成功率,并实现了对人类努力的强劲回报,在大多数设置中优于基线。重要的是,跨任务使用相同的门控配置,无需进行特定于任务的超参数调整,从而演示了跨任务、环境和策略架构的传输。代码和视频可在 https://liralab.usc.edu/reward-dagger. 获取

Reward-DAgger:通用进度奖励模型门控的机器人交互模仿学习的原论文方法或结果图
图 1:Reward-DAgger 是一个机器人门控的交互式模仿学习框架,它使用通用奖励模型的进度估计的两个时间尺度规则来触发人类接管。收集的校正被附加到初始数据集,并且策略以迭代方式进行微调。