论文
Mage:对 LLM 生成的可执行游戏场景进行多轴评估,超越编译通过率
Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate
摘要
编译通过率是 LLM 代码生成的主要评估信号,但对于多组件特定于域的工件,它可能会产生误导。我们用四轴评估协议(名为“Mage”)在可执行游戏场景合成上演示了这一点——编译成功、运行时成功、结构保真度和机制遵守——应用于四个开放权重 LLM (7B--30B) 的 858 代尝试、26 个手工制作的 Unity 目标模式可玩概念和两个自动提取的 IR 粒度级别。直接 NL 到 C# 生成实现了最高的运行时通过率(平均 43%),但产生了结构上空洞的场景(机制 $F_1 \大约 0.12$)。结构红外调节将运行时间减半,但恢复了域忠实结构($F_1$ 高达 1.00)。在 IR 调节中,仅行为粒度和全场景粒度在统计上无法区分 (McNemar $p = 1.0$),表明输入级粒度饱和。这些结果表明,编译率与该领域的功能正确性反相关,并且需要多轴评估来检测差异。我们发布基准、重播日志和每条记录的指标以进行独立验证。