论文
GameWorld:迈向多模式游戏代理的标准化和可验证评估
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
摘要
为了成为现实世界交互的多面手,多模式 大语言模型 (MLLM) 代理仍然面临着挑战性的延迟、稀疏的反馈和不可逆转的错误。视频游戏提供了一个理想的测试平台,具有丰富的视觉观察和闭环交互,需要细粒度的感知、长期的规划和精确的控制。然而,系统地评估这些功能目前受到异构操作接口和启发式验证的阻碍。为此,我们引入了 GameWorld,这是一个基准测试,旨在对 MLLM 作为浏览器环境中的通用游戏代理进行标准化和可验证的评估。研究了两种游戏代理接口:(i)直接发出键盘和鼠标控制的计算机使用代理,以及(ii)通过确定性语义动作解析在语义动作空间中动作的通用多模式代理。 GameWorld 包含 34 个不同的游戏和 170 个任务,每个任务都配有状态可验证的指标,用于基于结果的评估。 18 个模型-界面对的结果表明,即使是表现最好的智能体,也远未达到人类在视频游戏上的能力。重复的全基准重新运行的大量实验证明了基准的稳健性,而实时交互、上下文记忆敏感性和动作有效性的进一步研究则为游戏代理带来了更多挑战。通过提供标准化、可验证和可重复的评估框架,GameWorld 共同为推进多模式游戏代理及其他领域的研究奠定了坚实的基础。项目页面位于 https://gameworld-bench.github.io。