论文

RealCADBench:根据工业设计意图对参数化 CAD 建模进行基准测试

RealCADBench: Benchmarking Parametric CAD Modeling from Industrial Design Intents

模型评测基准与评测资源

摘要

参数化计算机辅助设计 (CAD) 建模很难用单一指标进行评估。现有 CAD 基准通常强调合成或 CAD 原生设置、有限的输入模式或单独的可执行性和 IoU。我们推出 RealCADBench,这是一个根据真实工业设计意图进行编程 CAD 建模的基准。它包含来自 19 个工厂自动化类别的 12,632 个任务,涵盖文本描述、2D 工程图、真实产品图片以及零件和装配体建模的渲染图像。我们报告了 1,770 个任务评估切片的结果:跨四种输入机制和 RCB-Assm25 的 1,745 个零件任务,RCB-Assm25 是在每个报告的装配比较中使用的 25 任务装配研究。每种方法都会生成 FreeCAD API Python,共享运行时执行该 API 以导出 3D 模型。我们使用可执行性、Solid IoU、Surface IoU 和基于标题的视觉语义识别 Judge 来评估导出的模型。在评估的九个独立前沿大型模型中,没有一个模型领先于所有四个指标。在六个前沿规模的大型模型中,四个部分体系中的可执行性范围从 0.565 到 0.812,Solid IoU 从 0.2841 到 0.5379,Surface IoU 从 0.112 到 0.217。最高的政权平衡综合数据来自与四个组成指标上的领先者不同的模型。在 RCB-Assm25 上,使用 GPT-5.5 的 Codex 比独立的 GPT-5.5 提高了可执行性和 IoU 指标,但使 Judge 分数降低了 6.98 个百分点,使 GPT-5.5 成为 Judge 领先者。我们还观察到反复出现的故障模式,最明显的是精细结构缺失、零件标识丢失以及装配放置不正确。这些结果表明,仅执行不足以表征真实的 CAD 建模,并且前沿模型和代理在可执行性、IoU 和视觉语义标识方面存在很大差异。