论文
GameDevBench:通过游戏开发评估Agentic能力
GameDevBench: Evaluating Agentic Capabilities Through Game Development
摘要
尽管编码剂取得了快速进展,但其多模态对应物的进展却滞后。一个关键的挑战是缺乏将软件开发的复杂性与深入的多模态理解的需求结合起来的评估测试平台。游戏开发提供了这样一个测试平台,因为代理必须导航大型、密集的代码库,同时操纵视觉游戏场景中的着色器、精灵和动画等本质上的多模态资产。我们推出了 GameDevBench,这是第一个评估代理游戏开发任务的基准。 GameDevBench 包含源自网络和视频教程的 132 个任务。任务需要大量的多模态理解,而且很复杂——与之前的软件开发基准相比,平均解决方案需要的代码行数和文件更改量是三倍多。智能体在游戏开发方面仍然举步维艰,最好的智能体只能解决 54.5% 的任务。我们发现感知任务难度和多模态复杂性之间存在很强的相关性,游戏导向任务的成功率从 46.9% 下降到 2D 图形任务的 31.6%。为了提高多模态能力,我们为代理引入了两种简单的基于图像和视频的反馈机制。尽管这些方法很简单,但它们不断提高性能,其中最大的变化是 Claude Sonnet 4.5 的性能从 33.3% 提高到 47.7%。我们公开发布 GameDevBench 以支持对代理游戏开发的进一步研究。
