论文

用于自动驾驶的基于几何的统一 3D 感知

Geometry-Grounded Unified 3D Perception for Autonomous Driving

模型架构Transformer

摘要

基于摄像头的自动驾驶感知需要一种共享表示,以在同步的多摄像头流中保留度量 3D 结构。然而,现有的基于图像的框架通常依赖于预训练的语义识别主干,并通过下游特定于任务的模块引入 3D 几何。因此,它们的共享表示可能无法保留显式的度量几何和一致的 3D 场景结构。在本文中,我们提出了一种基于几何的统一 3D 感知 (GeoUP) 框架,该框架将 VGGT 的面向重建的潜在特征适应于校准的流式多摄像头驾驶场景。 GeoUP 将跨图像交互分解为自我、时间和视图注意力,以捕获结构上不同的时间和跨视图对应关系。它进一步注入校准感知光线图编码以提供公制比例和相机几何形状。所得到的基于几何的潜在数据被解码,用于度量深度估计、3D 对象检测和语义占用预测,对应于同一 3D 场景的表面、实例和体积级读数。通过联合多任务和多数据集训练,GeoUP 有效地利用异构注释并泛化不同的传感器配置和感知范围。在 nuScenes、Argoverse 2、Waymo、KITTI 和 DDAD 上进行的大量实验表明,GeoUP 在检测、占用和深度估计方面实现了 SOTA 性能。这些结果验证了基于几何的表示对于统一 3D 驾驶感知的有效性。