论文

GameASG-Bench:面向游戏开发的自主软件生成基准

GameASG-Bench: Benchmarking Autonomous Software Generation for Game Development

智能体系统Agent任务评测

摘要

自主软件生成(ASG)旨在将人类需求转化为可执行应用,但交付这些应用并不必然保证其交互组件满足规定的行为需求。我们提出GameASG-Bench,一个将行为可测性纳入游戏开发生成任务的基准。我们的设计在生成前声明评估接口规范,固定合法起始场景、玩家级动作、稳定快照、拒绝行为与不变量,同时保持私有实现开放。具体包括:(i)评估源码级合规性的静态L1检查;(ii)将语义观察与真实输入及运行时证据相结合的浏览器执行L2检查。我们将该协议实现为47项浏览器原生游戏生成任务,覆盖12个主要类型及2D与3D交互,每项任务均带可执行检查与经独立验证的参考实现。实验回答了关于端到端Agent性能、工具访问与名义轮次预算、推理力度及Harness选择的四个关键问题。在九个Agent栈中,观测到的最高平均L2检查通过率为93.2%,但最高的严格任务成功率——要求全部L1及适用的L2前置与核心需求检查均通过——仅为55.3%(26/47任务)。对DeepSeek-V4-Flash而言,完整工具访问与更大的名义轮次预算带来更多严格任务成功,而严格任务成功率对推理力度并非单调。两个被测Harness均达到18项严格任务成功,但仅在两者下都成功的任务有10项。这些结果暴露了高平均检查通过率所掩盖的任务级合规缺口。