论文

在VLM标注的数据集上训练条件化电子游戏Agent

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

模型训练强化学习

摘要

强化学习(RL)是一种强大的但远非易用的技术,用于政策学习。在特定情况下,如视频游戏,获取奖励以训练(例如,从环境中收集奖励)通常需要访问游戏引擎。此外,正确识别和加权奖励往往需要困难的试错方法。最后,奖励通常是稀疏的,理解和最终如何影响学到的策略是一个非标准的工作。为减轻这些问题,我们提议使用视觉语言模型(VLMs)进行标注,这些模型被指示提取人类定义的奖励。然后,我们可以使用离线RL来训练一个相应反应的条件代理,并讨论我们在早期实验中遇到的困难和限制。

在VLM标注的数据集上训练条件化电子游戏Agent:论文配图
图 3:经过训练的智能体的架构。当省略返回输入时,它执行无条件行为克隆。