论文
VoxelCodeBench:通过代码生成对 3D 世界建模进行基准测试
VoxelCodeBench: Benchmarking 3D World Modeling Through Code Generation
摘要
评估 3D 空间推理的代码生成模型需要在现实环境中执行生成的代码并评估超出表面级别正确性的输出。我们引入了一个平台 VoxelCode,用于分析代码生成功能以实现 3D 理解和环境创建。我们的平台集成了自然语言任务规范、虚幻引擎中 API 驱动的代码执行以及支持自动化指标和人工评估的统一评估管道。为了证明其实用性,我们构建了 VoxelCodeBench,这是体素操作任务的基准,涵盖三个推理维度:符号解释、几何构造和艺术构成。通过评估领先的代码生成模型,我们发现生成可执行代码比生成空间正确的输出要容易得多,其中几何构造和多对象组合尤其具有挑战性。通过开源我们的平台和基准,我们为社区提供可扩展的基础设施,用于开发新的 3D 代码生成基准并探索未来模型中的空间推理。