论文
事半功倍:事后看来强化学习
Learning More from Less: Reinforcement Learning from Hindsight
摘要
强化学习 (RL) 越来越多地用于后训练视觉语言动作 (VLA) 模型,但每次更新都会消耗机器人的执行轨迹,这些机器人的执行轨迹速度缓慢且收集成本高昂,这使得样本效率成为中心问题。操纵任务通常只提供稀疏的奖励,因此弱策略几乎在训练早期的每次执行轨迹都会失败,并且几乎没有什么可以学习的,即使这些失败执行了连贯的行为。然而,这样的失败却是另一项任务的成功。我们提出了 Learning from Hindsight (LfH),它通过根据实际完成的任务对失败的执行轨迹进行评分,为 VLA 的 RL 后训练 带来事后重新标记。单一视觉语言模型重新标记指令和奖励,为一组失败的执行轨迹提出后见之明的指令,并对每个指令的满足程度进行评分,并且策略对重新标记的和原始的执行轨迹进行联合训练。由于 VLA 可以跨语言泛化,因此用语言重新标记可以让策略从相同的轨迹中了解更多信息。在分布外的 LIBERO-PRO 任务中,标准 RL 改进缓慢,LfH 在样本效率方面实现了 $5\times$ 的改进,并且优于密集的进度奖励基线。增益在 VLA 骨干网和实体 Franka 机器人上都有效。