论文
Sense:立体开放词汇语义分割
SENSE: Stereo OpEN Vocabulary SEmantic Segmentation
摘要
开放词汇语义分割使模型能够分割固定类别集之外的对象或图像区域,从而在动态环境中提供灵活性。然而,现有的方法通常依赖于单视图图像,并且在空间精度方面存在困难,特别是在遮挡和靠近物体边界的情况下。我们提出了 SENSE,这是关于 Stereo OpEN Vocabulary SEmantic Segmentation 的第一个工作,它利用立体视觉和视觉语言模型来增强开放词汇语义分割。通过合并立体图像对,我们引入了提高空间推理和分割准确性的几何线索。在 PhraseStereo 数据集上进行训练后,我们的方法在基于短语的任务中实现了强大的性能,并在零样本设置中展示了泛化能力。在 PhraseStereo 上,我们发现平均精度比基准方法提高了 2.9%,比最佳竞争方法提高了 0.76%。与基线工作相比,SENSE 在 Cityscapes 上的 mIoU 相对提高了 +3.5%,在 KITTI 上相对提高了 +18%。通过语义和几何的联合推理,SENSE 支持自然语言的准确场景理解,这对于自主机器人和智能交通系统至关重要。