论文

CraftBench-UE:Unreal Engine中编码Agent的确定性评测

CraftBench-UE: Deterministic Evaluation for Coding Agents in Unreal Engine

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

在游戏引擎中构建玩法特性所需的不只是代码,因为能编译运行的代码未必实现了所要求的玩法。我们提出 CraftBenchUE,一个评测工具:它在隔离的 Unreal Engine 环境中运行智能体,在新项目中重建其保存的提交,并应用确定性的构建、资产和运行时检查,而不使用 LLM 评判。基于该工具,我们构建了一个包含 70 个任务的基准,横跨 C++ 源码、Blueprint 资产和编辑器脚本。我们在两种编辑器工具配置下评测七个模型,并在 C++ 任务上设置文件与 shell 基线。我们还进一步配对了两类任务:它们规定相同玩法并使用相同运行时测试,但交付物分别要求 C++ 和 Blueprint。在这 10 组配对任务中,两种工具配置下 C++ 完成率分别超出 Blueprint 30.0 和 42.9 个百分点。在该配对集合中按时提交且通过资产检查的 Blueprint 作品中,有 42.2% 和 50.0% 未通过显式运行时断言:这些提交满足资产要求,却无法通过所要求的玩法测试。工具、任务基准和我们的轨迹发现将随报告一同发布。

CraftBench-UE:Unreal Engine中编码Agent的确定性评测:论文配图
图 1:三个交付组中的基准任务示例。截图展示了滑翔任务(gp-glide-stamina-cpp)和涉泥任务(t1-mud-wade-bp)。编辑器脚本面板展示 kp-spawn-level-actors 任务,该任务要求创建并保存一个包含六个命名对象的关卡。