论文

SWE-Game:编码Agent可以构建我们想要的游戏吗?

SWE-Game: Can Coding Agents Build the Games We Want?

智能体系统Agent任务评测

摘要

我们引入了 SWE-Game,这是一个包含 247 项任务的基准测试,基于 41 个可执行参考 Godot 游戏,涵盖 2D 和 3D 的 13 个游戏类别。五种任务类型包括从概要开始开发、从游戏设计文档开始实现、骨架完成、83个注入故障案例的修复以及Godot到Unity的移植。参考材料指定了预期的游戏玩法,而共享仪器接口允许评估者拥有的驱动程序和探测器执行操作并观察独立实施的游戏。评估结合了发动机状态检查、经过认证的参考输入回放和Agent编写的功能演示,以评估机械正确性、演示的可玩性以及维修后的行为恢复和保存。特定于游戏的视觉语言评分标准单独评估演示。在六种模型中,Opus5 在所有五种任务类型中获得了最高的总体得分。三项施工任务的最佳总分仍低于 60 分(满分 100 分),Brief-to-Game 达到 50.38。对审核提交的分析表明,需求遗漏和游戏逻辑错误是主要的实施问题。对于 100 个Agent构建的游戏中的人类标记行为,可执行检查的平衡准确度达到 92.59%,而基于视频的 VLM 判断的准确度为 78.41%。基于评分标准的视觉分数与 200 个游戏剪辑的人类评分的 Spearman 相关性达到 0.829。总之,这些结果描述了游戏开发活动中当前Agent的能力,并支持将运行时证据与视觉评估相结合。