论文

GameDevBench:通过游戏开发评估Agentic能力

GameDevBench: Evaluating Agentic Capabilities Through Game Development

智能体系统Agent任务评测

摘要

尽管编码剂取得了快速进展,但其多模态对应物的进展却滞后。一个关键的挑战是缺乏将软件开发的复杂性与深入的多模态理解的需求结合起来的评估测试平台。游戏开发提供了这样一个测试平台,因为代理必须导航大型、密集的代码库,同时操纵视觉游戏场景中的着色器、精灵和动画等本质上的多模态资产。我们推出了 GameDevBench,这是第一个评估代理游戏开发任务的基准。 GameDevBench 包含源自网络和视频教程的 132 个任务。任务需要大量的多模态理解,而且很复杂——与之前的软件开发基准相比,平均解决方案需要的代码行数和文件更改量是三倍多。智能体在游戏开发方面仍然举步维艰,最好的智能体只能解决 54.5% 的任务。我们发现感知任务难度和多模态复杂性之间存在很强的相关性,游戏导向任务的成功率从 46.9% 下降到 2D 图形任务的 31.6%。为了提高多模态能力,我们为代理引入了两种简单的基于图像和视频的反馈机制。尽管这些方法很简单,但它们不断提高性能,其中最大的变化是 Claude Sonnet 4.5 的性能从 33.3% 提高到 47.7%。我们公开发布 GameDevBench 以支持对代理游戏开发的进一步研究。

GameDevBench:通过游戏开发评估Agentic能力
图2:GameDevBench 中一个要求创建 UI 小地图的示例任务。上半部分是可视化的 GUI 呈现及高亮显示的关注点。下半部分是以代码形式表示的相同场景和文件。任务既可以通过编辑器完成,也可以完全通过代码完成,但无论哪种方式都需要理解多模态资源。游戏开发任务十分复杂,需要编辑内容密集的文件、识别并以视觉方式理解各种资源,以及在各种节点(游戏元素)和场景(节点的集合)之间导航。