论文
尽您所能:在遮挡情况下进行 CAD 重建的活动视图选择
Look Where You Can: Active View Selection for CAD Reconstruction under Occlusion
摘要
CAD 重建方法假设了一个很少允许的奢侈现实:不受限制的视觉访问对象,从任何所需的角度拍摄。然而,真实的物体是嵌入场景的,用螺栓固定在墙上,楔入角落,搁在地板上,场景使大部分视域无法到达,而其余视图的信息量也不相同。我们引入 \textbf{SightCAD},这是一个参数化 CAD 重建框架,它将视图可行性视为一流约束。在这项工作中,我们考虑嵌入真实室内场景中的标准 CAD 基准的对象,并在离散视球上具有物理导出的可见性约束。学习的视图选择器必须为视觉语言模型 (VLM) 选择 $K$ 可行视图,该模型生成可执行的 CadQuery 代码,并根据执行实体的几何保真度进行评分。由于只有在离散视图选择、自回归生成和 CAD 内核执行之后才会获得奖励,因此我们提出了一种联合训练范例,其中视图选择器和 CAD 生成 VLM 针对此奖励一起进行训练。这 学习选择策略与随机、均匀和贪婪覆盖的替代方案截然不同,在预算 $K\in\{1,\dots,5\}$ 的预算中,比表面积最大化 (SA-max) 的交并 (IoU) 点高出高达 $6.4$ 的交集 (IoU) 点。整个系统在 DeepCAD 和 Fusion360 对象的场景嵌入、遮挡多视图渲染上超越了强大的外部基线(分别超过最佳基线 $+21$ 和 $+17$ 有效 mIoU 点),以及来自工业 T-LESS 基准的测试时域规范化真实图像以及来自 MP6D 工业金属零件基准的合成图像和真实图像,同时生成了所有方法中最高的可执行程序率(无效码率 ${\leq}1.5\%$)。