论文

LiAuto-GeoX:高效几何感知驾驶 Transformer

LiAuto-GeoX: Efficient Grounded Driving Transformer

模型优化端侧模型

摘要

密集 3D 重建已展现出空间理解的巨大潜力,但其作为自动驾驶实时车载表示的可行性仍然是一个开放的挑战。现有的大规模视觉几何模型通常需要大量的计算资源,并且缺乏动态驾驶环境所需的远程几何保真度、环视一致性和实时效率。为了弥补这一差距,我们提出了 \textbf{LiAuto-GeoX},这是一种高效的几何感知 Transformer,专为可部署、以自我为中心的 3D 场景理解而设计。我们的方法首先从大规模环视数据中学习高容量驾驶几何模型,利用稀疏 LiDAR 先验在遥远、模糊或结构稀疏的区域提供强大的几何基础。然后,我们通过新颖的几何保留 蒸馏 框架将此功能实例化为高度紧凑的 155M 参数板载模型。该框架采用掩模引导的深度感知 蒸馏 通过强调几何信息区域来保留细粒度的度量结构,并采用相对姿势关系 蒸馏 通过姿势引起的几何关系来强制跨视图空间一致性。广泛的评估表明,\textbf{LiAuto-GeoX} 在 KITTI 上以 220 FPS 的速度运行,同时保持高保真密集重建,从而实现实时部署。学习到的几何形状无缝转移到下游自主任务,在轨迹预测中实现 90.6 PDMS,在占用预测中实现 24.63 mIoU,在未来帧预测中实现 47.67 IoU。这些都表明,高效的密集 3D 重建可以超越其作为感知目标的传统角色,作为下一代自动驾驶的可扩展的基础几何表示。