论文

GIFT:通过几何反馈引导图像到 CAD 程序合成

GIFT: Bootstrapping Image-to-CAD Program Synthesis via Geometric Feedback

模型训练合成数据

摘要

从图像生成可执行 CAD 程序需要视觉几何和符号程序表示之间的对齐,随着设计复杂性的增加,当前的方法无法可靠地学习这种能力。现有的 微调 方法依赖于有限的监督数据集或昂贵的 后训练 管道,导致系统脆弱,限制了生成 CAD 设计的进展。我们认为,主要瓶颈不在于模型或算法能力,而在于缺乏将视觉几何与程序语法保持一致的多样化训练示例。这种限制尤其严重,因为收集多样化且经过验证的工程数据集既昂贵又难以扩展,限制了稳健的生成 CAD 模型的开发。我们引入了几何推理反馈调整(GIFT),这是一种数据增强框架,利用几何反馈将测试时计算转变为一组自举的高质量训练样本。 GIFT 结合了两种机制:软拒绝采样(GIFT-REJECT)和故障驱动增强(GIFT-FAIL),软拒绝采样(GIFT-REJECT)保留了超出精确 真值 匹配范围的各种高保真度程序,而故障驱动增强(GIFT-FAIL)将几乎未命中的预测转换为合成训练示例,从而提高了在具有挑战性的几何形状上的鲁棒性。通过将推理时间搜索分摊到模型参数中,GIFT 获得了测试时间扩展的优势,同时将推理计算量减少了 80%。与强监督基线相比,它的平均 IoU 提高了 12%,并且与更复杂的多模态系统保持竞争力,而不需要额外的人工注释或专门的架构。