论文
OmniSpace:自动驾驶汽车 MLLM 的高效几何感知
OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs
摘要
多模态 大语言模型 (MLLM) 在 2D 视觉任务上取得了卓越的性能,但增强自动驾驶汽车 (AV) 等现实应用的空间智能仍然是一个开放的挑战。现有的几何感知 MLLM 通常在推理时依赖辅助 3D 模型,从而引入管道复杂性和级联故障的风险。在本文中,我们提出了 OmniSpace,这是一种简单而有效的即插即用范例,用于根据纯 2D 观测进行几何感知空间推理。我们发现当前的 MLLM 受到薄弱的跨视图对应和深度估计的瓶颈的启发,OmniSpace 引入了相机姿势注入器、多视图极线注意力模块和 3D 几何 蒸馏 目标,通过将几何知识转移到模型中来共同解决这两个限制。大量实验表明,OmniSpace 在规划基准(nuScenes、Bench2Drive)、风险检测(nuInstruct)、语言(Omnidrive)和泛化(DriveBench)方面超越了现有方法。