论文
在VLM标注的数据集上训练条件化电子游戏Agent
Training a Conditioned Video Game Agent on a VLM Annotated Dataset
摘要
强化学习(RL)是一种强大的但远非易用的技术,用于政策学习。在特定情况下,如视频游戏,获取奖励以训练(例如,从环境中收集奖励)通常需要访问游戏引擎。此外,正确识别和加权奖励往往需要困难的试错方法。最后,奖励通常是稀疏的,理解和最终如何影响学到的策略是一个非标准的工作。为减轻这些问题,我们提议使用视觉语言模型(VLMs)进行标注,这些模型被指示提取人类定义的奖励。然后,我们可以使用离线RL来训练一个相应反应的条件代理,并讨论我们在早期实验中遇到的困难和限制。
