论文

可执行 Unity 游戏场景的知识条件单通 LLM 综合:跨 26 个目标可玩概念的编译器错误普查

Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

模型评测模型能力评测

摘要

大语言模型 (LLM) 为游戏场景编写Unity C\#。然而,几乎所有演示都依赖于迭代修复循环,该循环会重新生成代码直至编译,从而将模型编写的内容与循环修复的内容混为一谈。我们删除循环并评估单次传递,其中初稿是最终的。这隔离了模型的参数知识,这是对无辅助生成最严格的测试。模型实例化目标可玩概念,即目标模式的可玩对应物,跨越 10,400 个代(四个开放权重模型,7B--30B;两个生成模式;四个中间表示 (IR) 调节级别;26 个目标模式;20 个种子)。没有一个被编译成可运行的场景,不留下任何幸存者偏差。为了了解生成的 C# 脚本如何失败,我们将 90{,}673 个编译器错误背后的 99 个错误代码分类为 Grounding(发明或滥用 Unity 类型和 API)或 Hygiene(不需要 Unity 知识的结构缺陷)。划分因目标模式而异(例如,Stealth 主要在发明的引擎引用上失败;Capture 在普通的 C\# 结构上失败)。更大的模型、更严格的 IR 和不同的生成模式可以消除错误,但永远不会产生编译场景。瓶颈在于缺少特定于引擎的知识。普查根据需求对目标模式进行排序,向设计人员展示单遍生成的中断点。