论文

CRUISE:视觉语言模型引导的不确定性感知跨模态传感器融合,实现鲁棒自动驾驶

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

应用与实践视觉感知与空间理解

摘要

现代自动驾驶汽车配备多种传感器,如摄像头、LiDAR 和雷达,以实现全面的环境感知。然而,鲁棒的跨模态特征融合仍是一个关键挑战,因为各传感器的可靠性在多样的真实驾驶条件下(包括能见度差和恶劣天气)差异显著。虽然不确定性量化(UQ)通过让模型优先采用可靠信号来缓解这一问题,现有的不确定性感知融合方法通常依赖简单的特征级不确定性估计,因此在复杂的分布外场景中往往无法有效泛化。为解决这一局限,我们提出 CRUISE,一个新颖的不确定性感知跨模态传感器融合框架。CRUISE 集成了一个由视觉语言模型(VLM)引导的 UQ 模块,生成细粒度的像素级不确定性估计。通过利用 VLM 丰富的先验知识和出色的情境推理,我们的方法为融合过程提供了信息量极高的引导。此外,我们引入一个动态自适应机制,显式建模并捕捉跨模态依赖,确保框架充分利用多传感器输入固有的互补性。

CRUISE:视觉语言模型引导的不确定性感知跨模态传感器融合,实现鲁棒自动驾驶:论文配图
图2:面向自动驾驶感知任务的不确定性感知多模态传感器融合框架的3D架构。该框架包含三个状态:特征变换到BEV空间;VLM引导的UQ模块,利用模态特定提示生成细粒度不确定性热图;以及不确定性感知融合模块,利用动态适配机制产生用于目标检测和语义分割的融合特征。