论文
IGLOSS:激光雷达开放词汇语义分割的图像生成
IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation
摘要
本文提出了一种对 3D 汽车激光雷达数据进行零样本开放词汇语义分割 (OVSS) 的新方法。为了规避基于视觉语言模型(VLM)(例如 CLIP)的方法所固有的公认的图像-文本模态差距,我们的方法依赖于从文本生成图像来创建原型图像。给定从 2D 视觉基础模型 (VFM) 中提取的 3D 网络,然后我们通过将 3D 点特征与这些原型的 2D 图像特征进行匹配来标记点云。我们的方法对于 nuScenes 和 SemanticKITTI 上的 OVSS 来说是最先进的。代码、预训练模型和生成的图像可在 https://github.com/valeoai/IGLOSS 上获取。