论文

MUSE:面向可制造、具功能性与可装配性Text-to-CAD生成的基准评测

MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation

模型评测基准与评测资源

摘要

大语言模型(LLM)近来推动了文本驱动的3D生成,但Text-to-CAD仍远不能支撑工业产品设计。现有基准主要关注单零件CAD模型的生成,并用无法捕捉功能性、可制造性与可装配性的几何相似度指标进行评估。为填补这一空白,我们提出MUSE,一个聚焦复杂、可编辑边界表示(B-Rep)装配体的Text-to-CAD基准。MUSE将实用设计实例与结构化设计规范(Design Specifications)配对,并通过三阶段协议评估生成模型:代码检查、几何检查与设计意图对齐。最后阶段使用针对具体设计的量规评估功能性、可制造性与可装配性,从形状匹配走向实用设计质量。为实现可扩展评估,我们采用基于量规的视觉语言模型(VLM)裁判,并通过人工标注验证其可靠性。在闭源与开源LLM上的实验揭示了从可执行代码到有效几何、再到工程可用设计的清晰失败级联,即便最强模型在细粒度工程标准上的成功也十分有限。总体而言,MUSE为推动Text-to-CAD从几何生成迈向真正的工程设计提供了现实的基准与评估框架。我们的项目网站(含排行榜、数据集与代码)发布于https://dong7313.github.io/muse-benchmark/。

MUSE:面向可制造、具功能性与可装配性Text-to-CAD生成的基准评测:论文配图
图1:MUSE基准中的部分CAD设计样例,用于评估文本生成CAD的可制造性、功能性与可装配性。