论文
MV-GEL:语言驱动的网格上多视图几何实体定位
MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes
摘要
识别和奠定精确的几何实体(例如 3D 对象中的边缘、平面区域和曲面)是计算机辅助设计 (CAD)、机器人操作和科学模拟的基础。尽管现代视觉语言模型 (VLM) 在图像领域具有先进的引用分割 (RIS),但将这种语言驱动的本地化扩展到结构化 3D 几何要困难得多。 3D 物体外观对视点高度敏感;单一视角可能使目标实体清晰可见,而另一个视角可能会遭受严重遮挡或透视缩短。在这项工作中,我们尝试使用 MV-GEL(多视图几何实体本地化)来解决这些挑战,MV-GEL 是一个用于根据自然语言查询在多边形网格上本地化细粒度几何实体的框架。我们的主要见解是,可靠的 CAD 实体(即面、边或实体)本地化取决于选择使查询实体最大限度地可解释的视图。我们引入了 GELviews,这是一个提示条件排序模块,它根据语言提示的几何 CAD 实体的可观察性对观点进行优先级排序。选定的视图由基于 VLM 的推理分割主干进行处理,并通过几何感知光线投射将预测掩模提升到相应的网格。我们的框架完全与 CAD 无关,仅依赖于 3D 网格。实验表明,与普通基线相比,面级 IoU 提高了 1.7 倍,边缘级 F1 提高了 4.5 倍以上,大大优于基于 CLIP 和随机视图采样,特别是对于薄型和视图敏感结构。数据集、代码和经过训练的检查点可在 https://github.com/kbali1297/MV-GEL 上获取。