论文

GameBoyWorlds:具身视频游戏中的自我改进测试平台

GameBoyWorlds: A Testbed for Self-Improvement in Embodied Video Games

智能体系统Agent任务评测

摘要

在专家指导的支持下,Agent可以在交互式环境中操作;然而,尚不清楚他们是否可以从自己的经验中自主学习。为了评估这种自我改进方法,我们引入了 GameBoyWorlds,这是 agentic 视频游戏自我改进的测试平台。 GameBoyWorlds-Execution 评估 5 个不同游戏系列的任务执行情况。Agent可以参加专门的训练游戏,但不会获得任何演示、文档或奖励。智能体必须通过自我引导的探索并从自己的经验中推断出可操作的知识,使自己扎根于环境中。在测试时,Agent必须完成短期任务,以评估他们在未见过的游戏中导航、交互和参与游戏特定机制的能力。由于多模式grounding失败,开箱即用的前沿模型只完成了 500 项任务中的不到 50%,这表明自我改进方法有提升性能的空间。我们证明了当代自我完善的方法是缺乏的,世界建模和自主技能发现都失败了,而一种利用基于好奇心的探索来编写指南的新颖策略仅取得了部分成功。 GameBoyWorlds-Playthrough 在两款粉丝制作的神奇宝贝游戏中测试端到端的游戏完成度。我们表明,虽然前沿模型已经预先接触过《神奇宝贝红》等官方版本,但它们缺乏有关我们测试台中游戏的基本信息。Agent必须从自己的经验中学习并在游戏过程中自主改进,而不是依靠参数知识来取得成功。我们证明,具有多模式内存和分层子目标的复杂 agentic 管道甚至未能达到这两款游戏中的第一个主要里程碑,从而将 GameBoyWorlds 确立为自我改进Agent的雄心勃勃的目标。

GameBoyWorlds:实体视频游戏自我完善的测试平台:图 5:GameboyWorlds-Execution 上的世界建模 (WM) 和自主技能获取 (PAE) 失败。我们的好奇心管道平均提高了性能 (+2%),但缺乏鲁棒性。
图 5:GameboyWorlds-Execution 上的世界建模 (WM) 和自主技能获取 (PAE) 失败。我们的好奇心管道平均提高了性能 (+2%),但缺乏鲁棒性。