论文

超越成对反馈:基于偏好的奖励学习的列表视觉语言监督

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

模型训练奖励建模与过程监督

摘要

视觉语言模型(VLM)已成为强化学习的强大监督来源,使代理能够在训练期间利用丰富的语义知识。受基于偏好的奖励学习(PbRL)在人类反馈强化学习(RLHF)中成功的启发,视觉语言模型生成的基于图像的偏好为学习奖励函数提供了有效的来源。这可以通过 Bradley-Terry (BT) 模型直观地比较两个结果来完成。然而,尽管 VLM 能够对多个候选者进行排名,但这种成对公式一次仅利用两个观察值。 Plackett-Luce (PL) 公式可以通过列表排名(而不是成对偏好)塑造奖励模型,从而更适合使用基于 VLM 的排名。据我们所知,在这项工作中,我们引入了第一个将 VLM 生成的偏好与用于奖励学习的 Plackett-Luce 模型相结合的框架。我们评估了我们在元世界操纵任务上的方法,并表明 Plackett-Luce (PL) 奖励模型可以像成对 Bradley-Terry、$K$-wise Bradley-Terry 和 RL-VLM-F 基线一样有效地根据 VLM 生成的排名训练机器人策略。在所有环境中,至少一种 PL 排名大小 ($K \in \{3,4,5\}$) 的平均成功率始终与其他方法一致或优于其他方法。与仅限于 $K=2$ 的成对方法不同,PL 支持不同的排名大小,因此可以适应环境和所需的反馈格式。我们最好的 PL 配置实现了 86% 的平均最终成功率,并且与 Drawer Open 的 Oracle 基线相匹配。总体而言,这些结果表明,列表式 VLM 偏好监督是一种有竞争力且灵活的强化学习奖励学习方法。