论文

Spec2Game:LLM能否根据详细规格生成完整的可玩游戏?

Spec2Game: Can LLMs Generate Complete Playable Games from Detailed Specifications?

模型评测基准与评测资源

摘要

生成可执行程序并不一定意味着它正确地实现了自然语言指定的行为要求。为了评估大语言模型将详细规范实现为完整交互程序的能力,我们引入了 Spec2Game,这是一个基准测试,要求模型从详细的自然语言游戏规范生成完整的 Pygame 项目。 Spec2Game 包含 15 个游戏系列和 150 个任务实例,每个系列有一个规范任务和 9 个受控规则变体,跨越三个实现复杂度级别。使用源代码、运行时和视觉证据,我们从四个维度评估生成的项目——可执行性、规范实现、代码质量和面向用户的质量。在 14 个LLM和 3,330 个生成的项目中,我们发现高可执行性并不意味着忠实的规范实现。组件级分析进一步表明,模型在游戏元素建模上的表现明显优于规则和机制建模或目标和终止建模,这表明忠实地实现游戏规则和终止逻辑仍然是一个重大挑战。

Spec2Game:LLM能否根据详细规格生成完整的可玩游戏?的原论文方法或结果图
图 1.Spec2Game 概述。 (a) 基准测试包括 15 个游戏系列,每个游戏系列都有一个规范任务和 9 个受控变体,形成 Core-15(15 个规范任务)和 Full-150(150 个任务实例)。 (b) 固定的分阶段生成协议生成完整的 Pygame 项目,然后进行独立执行和评估证据收集。 (c) 生成的项目按照四个互补维度(D1-D4)进行评估。代码片段、跟踪和屏幕截图都是示意性的。