论文
A2Z GameSpec-Bench:编码Agent如何准确地根据游戏设计规范生成游戏?
A2Z GameSpec-Bench: How Faithfully Can Coding Agents Generate Games from Game Design Specifications?
摘要
将完整的应用程序开发委托给编码Agent需要保留预期的设计,而不是简单地通过天真的提示产生合理的输出。游戏开发提供了一个要求严格的测试平台,因为长篇游戏设计文档 (GDD) 描述了必须跨游戏逻辑、视觉渲染和玩家交互协同工作的要求。然而,现有的游戏开发基准通常使用紧凑的规范,并且为评估长格式 GDD 中这些方面的相互依赖的需求提供有限的支持。我们引入了 A2Z GameSpec-Bench,这是一个包含 100 个长格式 GDD 的基准,用于评估Agent的端到端游戏开发。我们通过检查游戏是否满足 GDD 要求并保留它们之间的关系来衡量忠诚度。每个 GDD 都变成一个依赖项感知契约,其中包含规则、约束和先决条件关系。遵循游戏开发实践,我们将源代码检查与Agent生成的测试策略相结合,以进行基于场景的重放和自适应游戏测试。合同在Agent和修订轮次中保持不变,而与相同要求相关的判断和证据支持一致的比较和故障检测。我们的评估表明,当前的Agent很难共同满足代码实现和实际游戏中相互依赖的要求。两轮后,相对于自我修订,特定需求的反馈将 GDD 保真度提高了 10.9%。 A2Z GameSpec-Bench 评估端到端规范遵循能力,超越实施判断,并提供有针对性的反馈以支持更忠实的游戏开发。代码和数据集可在 https://a2z-gamespec-bench.github.io. 获取