论文

HiRE:政策微调的事后奖励编辑

HiRE: Hindsight Reward Editing for Policy Finetuning

模型训练奖励建模与过程监督

摘要

预先训练的机器人策略总是需要微调以适应特定的环境。强化学习 (RL) 提供了高性能潜力,因为它提高了行动的最优性,而不是简单地模仿数据。然而,这种潜力在很大程度上取决于奖励质量。稀疏奖励缺乏过程反馈,人为设计的奖励成本高昂且存在偏见,并且来自基础表示的语义奖励通常不是以控制为中心的。我们提出了 Hindsight Reward Editing (HiRE),这是一个无需训练的框架来打破这个奖励瓶颈。 HiRE 通过事后对比成功和失败的轨迹,将基础表示模型的广泛知识与物理控制意识联系起来。它通过识别“陷阱状态”来校准基础表示模型,这些“陷阱状态”被预测为高回报状态,但最终会导致失败,反之亦然。 HiRE 明确惩罚这些陷阱,同时提高对关键成功状态的奖励。这种方法可以灵活地与任何基础表示和强化学习算法兼容。实验表明,HiRE 通过提供密集的、控制感知的反馈来防止价值函数崩溃和奖励作弊,从而始终优于其他奖励方案,从而实现卓越的样本效率、稳定的策略更新和更高的性能上限,例如,至少是基本策略的 3 倍性能。 Qualitative results are at this https URL .