论文

学习文本到 CAD 的分层和几何感知图形表示

Learning Hierarchical and Geometry-Aware Graph Representations for Text-to-CAD

摘要

文本到 CAD 代码生成是一项长期任务,它将文本指令转换为相互依赖的操作的长序列。现有方法通常将文本直接解码为可执行代码(例如 bpy),而无需显式建模装配层次结构或几何约束,这会扩大搜索空间,累积局部错误,并经常导致复杂装配中的级联故障。为了解决这个问题,我们提出了一种层次结构和几何感知图作为中间表示。该图将多级零件和组件建模为节点,并将显式几何约束编码为边。我们的框架不是直接将文本映射到代码,而是首先预测结构和约束,然后条件操作排序和代码生成,从而提高几何保真度和约束满足。我们进一步引入了一种结构感知的渐进式课程学习策略,该策略通过受控的结构编辑构建分级任务,探索模型的能力边界,并综合迭代训练的边界示例。此外,我们还构建了一个 12K 数据集,其中包含指令、分解图、动作序列和 bpy 代码,以及面向图和约束的评估指标。大量的实验表明,我们的方法在几何保真度和几何约束的准确满足方面始终优于现有方法。