论文

具有 3D 感知几何约束的开放词汇 BEV 分割

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

应用与实践视觉感知与空间理解

摘要

鸟瞰图 (BEV) 感知将多摄像头图像融合为自动驾驶的统一自上而下表示。尽管最近取得了进展,但最先进的方法仍然局限于封闭场景,这使得它们容易受到不可预测的现实环境的影响。在这项工作中,我们引入了开放词汇 BEV 分割 (OVBS),它利用视觉语言模型 (VLM) 来识别训练集之外的类别,同时保持精确的 BEV 感知和实时效率。 OVBS 的一个关键挑战在于将 2D VLM 语义不适当地提升到 BEV 所固有的 3D 几何不一致。为了解决这个问题,我们提出了 OVBEVSeg,一种几何感知的 OVBS 框架,它通过在三个渐进阶段利用强大的 3D 几何约束来增强基于高斯分布 (GS) 的高效非投影:(1) 通过可靠的 3D 投影进行 2D 到 BEV 伪标记以实现 OV 泛化; (2) 联合 2D-BEV 每场景优化与 BEV 结构约束以实现 3D 几何一致性; (3) 3D几何蒸馏,提高在线效率。在 nuScenes 数据集上,OVBEVSeg 实现了最先进的性能,在未见过的类别上比闭集方法高出 15.3 mIoU。值得注意的是,即使没有新颖的 真值 标签,它仍然比使用高达 40% 的 真值 注释进行训练的自监督和半监督基线具有竞争力。此外,它的推理速度提高了 2.5 倍,而内存消耗仅为基于投影的方法的 0.22 倍。项目页面:https://hchoi256.github.io/projects/ovbevseg/。