论文
VLM-AR3L:强化学习中绝对和相对奖励的视觉语言模型
VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning
摘要
设计有效的奖励函数仍然是强化学习(RL)中的一个主要挑战,特别是在任务目标抽象且难以量化的开放式环境中。在这项工作中,我们提出了 VLM-AR3L,这是一个利用视觉语言模型 (VLM) 为 RL 提供绝对和相对奖励的框架。 VLM-AR3L 在自然语言任务目标的背景下解释代理的视觉观察,并从 VLM 生成的偏好标签中学习绝对和相对奖励。绝对奖励模型预测各个状态的标量评估,而相对奖励模型比较连续观察以推断任务目标的进展或回归。它们的整合结合了基于国家的评估的稳定性和比较监督的稳健性。我们通过跨越经典控制、操纵和开放世界具体任务的基准来评估 VLM-AR3L,特别关注 Minecraft(我的世界),因为它的视觉复杂性和长期决策要求。实验结果表明,VLM-AR3L 始终优于先前基于 VLM 的奖励学习方法。