论文
RMTL:利用 VLM 奖励进行长视野操作的强化微任务学习
RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards
摘要
用于机器人操作的强化学习 (RL) 通常需要手动设计密集的奖励函数,该函数难以调整且通常很脆弱,或者从人类演示或偏好中学习奖励,这可能会很昂贵。最近的一项工作使用预训练的视觉语言模型(VLM)作为零样本奖励模型,用单个文本提示代替这些成本。然而,我们认为,对于具有随机初始条件的长视野操作任务来说,单个全局提示过于粗糙。单提示 VLM 奖励在大部分轨迹上几乎持平,这使得代理很难检测到早期进展。我们提出了强化微任务学习(RMTL),这种方法将操作任务分解为一小组语言描述的微任务,并训练代理在它们之间进行切换。在每一步中,代理都会收到一个多视图 VLM 奖励,该奖励是使用当前活动微任务的提示计算出来的,并在多个摄像机视图上进行平均,以减少特定于视图的遮挡的影响。反向课程逐渐让智能体面临更困难的初始条件,而 PPO 工作人员首先接受基于固定距离的规则的训练,该规则选择活动的微任务。然后,我们用学习的分层管理器替换该规则,将基于规则的阶段选择转变为完全学习的分层策略。我们使用三个简短的特定于阶段的提示在 Fetch 操作环境上实例化 RMTL,而无需额外的提示调整。实验表明,RMTL 比单提示 VLM 奖励提供了更多信息量的奖励信号,从而实现更快的学习。这些结果表明,将 VLM 奖励分解为特定于微任务的语言提示可以显着提高机器人操作的语言引导强化学习的可扩展性。