论文

3DCodeBench:通过代码对代理程序 3D 建模进行基准测试

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

模型评测基准与评测资源

摘要

通过代码进行的程序 3D 建模正在成为一种通用范例,提供神经 3D 生成器固有缺乏的确定性、引擎就绪且可精确编辑的资产。然而,编写此类程序内容需要在 3D 软件 API、参数化设计和代码级几何推理方面拥有深厚的专业知识。在本文中,我们提出了 3DCodeBench,这是一个用于评估 3D 建模软件中程序 3D 生成的视觉语言模型 (VLM) 代理的系统基准。具体来说,3DCodeBench 通过将文本和图像参考转换为 3D 建模软件的程序代码,评估 12 个高级 VLM 作为程序 3D 建模器的有效性。认识到自动化指标可能无法完全捕捉 3D 形状的感知质量,我们构建了 3DCodeArena,这是一个基于人类对生成的 3D 输出的成对偏好的排名平台。从广泛的评估和结果中,我们观察到:(1) 失败主要是由于 API 不匹配造成的,而成功的渲染仍然受到断开或浮动的 3D 几何组件的影响。 (2) 测试时间扩展,例如更高的思考预算和多轮细化,可以提高整体性能。我们的研究结果强调了对高质量程序编码数据的迫切需求,以推动商业 VLM 的发展。此外,有效的程序 3D 建模需要强大的执行环境,为迭代细化提供高保真反馈。我们发布了 3DCodeBench,包括多模式(文本/图像)提示、程序代码、3D 对象三元组、评估协议和公共 3DCodeArena 平台的精选大型数据集,作为探索基于 VLM 的程序 3D 建模器的基础工具包。