论文
Spec2Game:LLM能否根据详细规格生成完整的可玩游戏?
Spec2Game: Can LLMs Generate Complete Playable Games from Detailed Specifications?
摘要
生成可执行程序并不一定意味着它正确地实现了自然语言指定的行为要求。为了评估大语言模型将详细规范实现为完整交互程序的能力,我们引入了 Spec2Game,这是一个基准测试,要求模型从详细的自然语言游戏规范生成完整的 Pygame 项目。 Spec2Game 包含 15 个游戏系列和 150 个任务实例,每个系列有一个规范任务和 9 个受控规则变体,跨越三个实现复杂度级别。使用源代码、运行时和视觉证据,我们从四个维度评估生成的项目——可执行性、规范实现、代码质量和面向用户的质量。在 14 个LLM和 3,330 个生成的项目中,我们发现高可执行性并不意味着忠实的规范实现。组件级分析进一步表明,模型在游戏元素建模上的表现明显优于规则和机制建模或目标和终止建模,这表明忠实地实现游戏规则和终止逻辑仍然是一个重大挑战。
