论文

OpenGameEval:有状态游戏引擎的智能体编程基准

OpenGameEval: Benchmarking Agentic Programming and Exploration in a Stateful Game Engine

模型评测基准与评测资源

摘要

我们提出OpenGameEval,Roblox Studio内Agentic 智能体游戏开发的基准与评估框架:以可复现、有状态的游戏引擎会话运行语言模型智能体,并用可执行检查对编辑场景与模拟游玩会话分别打分。多数智能体编码基准要求探索但只给最终任务成功打分;OpenGameEval在八工具动作空间中把观察工具与编辑工具分离,使探索可被直接测量。我们在84个人工策展核心任务(每任务16次尝试)上测量13个前沿模型的通过率与探索行为。任务对当前模型很难:最佳模型单次尝试解决51.7%、五次全对39.4%,且有六个任务无一模型解决。前沿模型以解不同任务达到相近通过率:按所需工作类型拆分,脚本编写任务上前五名差5.0个百分点,场景变更任务差12.5个百分点。探索行为预测运行成败:固定任务与模型,在场景类任务上,行动前检查过参照解触及的全部对象的运行比一个都不检查的通过率高13.4个百分点,脚本类任务高9.8个百分点。我们以MIT许可发布任务套件、place文件、逐任务标注、Roblox Studio插件与更新的排行榜。代码/项目页:https://github.com/Roblox/open-game-eval。