论文

Code4Scene:用于构建和编辑 3D 场景的基准编码Agent

Code4Scene: Benchmarking Coding Agents for Constructing and Editing 3D Scenes

智能体系统Agent任务评测

摘要

前沿编码Agent现在可以编写和执行创建 3D 环境的代码,但它们是否可靠地理解 3D 结构并精确控制场景状态仍不清楚。生成的 3D 场景是持久的、可执行的工件:令人信服的渲染可以隐藏不正确的空间关系、相交的对象或意外的修改。我们推出了 Code4Scene,它是由人工组装的场景构建的 190 个虚幻引擎案例的基准测试,可在共享执行接口下的两个互补设置上评估编码Agent。构建测试来自开放式语言规范的场景级空间推理,其中许多实现都是有效的;编辑测试对场景状态的精确控制,其中Agent必须从参考图像恢复目标场景,同时保留其他所有内容。 Code4Scene 不是对代码或渲染视图进行评分,而是评估生成的引擎本机场景的任务完成情况、工件完整性和静态物理有效性,并将编辑内容与保留的基本事实进行比较。在 95 个案例公共集上的 14 个编码Agent配置中,构建和编辑性能密切相关,但不可互换(Spearman $ρ= 0.78$):Claude Fable 5.1 领先构建,Gemini 3.8 Flash 领先编辑,GPT-6 Astra 总体领先。空间合成是每个智能体中最弱的构建类别,而编辑仍然不精确:最佳修复 F1 仅 0.527,并且完全恢复目标的编辑中有 35.8% 仍然会在场景中的其他地方引入意外的变化。这些结果揭示了合理的 3D 生成与可靠的空间推理和状态控制之间的差距。