论文
通过学习奖励对大型行为模型进行连贯的 离策略 改进
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
摘要
使用行为克隆将专家演示数据提炼成大型生成模型是一种可扩展的方法,用于学习机器人控制的有效策略,特别是灵巧操作。强化学习 (RL) 可以用作利用额外经验进一步微调这些策略的方法。一个悬而未决的问题是,强化学习是否比收集更多的人类演示更有效。之前的工作通过将强化学习应用于纠正预训练模型的较小残差策略,以可扩展的方式对大型预训练策略进行了微调。然而,对于典型的稀疏奖励任务,强化学习算法可能很难以样本有效的方式优化行为。我们探索逆强化学习,从专家演示中学习密集奖励函数,有可能减少 RL 微调的挑战。我们特别考虑连贯模仿学习,这是一种 IRL 方法,通过使用具有理论保证的特定奖励公式来促进 BC 策略的改进。我们表明,我们的 IRL 方法在所有六个稀疏操作任务上保持或提高了 pi-0.5 的性能,并在六个复杂操作任务中的五个上实现了 $\geq 90\%$ 成功率,优于使用稀疏奖励的基于 RL 的基线。通过确保我们的初始预训练微调策略对于初始奖励和批评者来说是最佳的,我们的方法避免了 RL 微调中常见的初始下降,并实现更快的改进。