论文

P3D-Bench:参数 3D 生成和结构推理的 MLLM 基准测试

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

模型评测基准与评测资源

摘要

多模态 大语言模型 可以编写代码来生成复杂的程序,也可以使用程序进行 3D 建模,这为基于先验、世界知识和推理的 3D 生成开辟了一条新途径。然而现有的基准测试很少通过代码评估 3D 建模。此类建模需要的不仅仅是可运行的代码:模型必须根据文本或视觉规范生成几何精确、语义对齐且装配一致的参数化 3D 程序。我们推出 P3D-Bench,这是参数化 3D 生成的基准。与 3D 网格不同,参数化 3D 程序公开明确的尺寸、构造操作和零件关系,揭示模型是否恢复设计的结构,而不仅仅是其外观。在统一协议下,P3D-Bench 涵盖三个任务系列(文本到 3D、图像到 3D 和程序集 3D),并对每个输出的可执行性、几何保真度、拓扑、基于文本的约束、多视图语义对齐和零件级结构进行评分。我们以特定领域的模型作为参考点,在 400 个文本案例、400 个图像案例和 203 个带注释的程序集上评估前沿 MLLM 和纯文本 LLM。我们的广泛评估得出了三项发现。首先,装配是最难的设置,模型仍然无法将多个零件组合成连贯的结构。其次,模型通常可以恢复目标对象的全局形状和语义标识,但无法重现输入指定的精确参数几何形状。第三,零件级建模在装配上仍然很薄弱,其中模型既不能恢复每个零件的几何形状,也不能恢复正确的零件数量。这些结果将 P3D-Bench 定位为评估参数化 3D 生成中精确参数化几何和零件级结构的基准。