论文
CRUISE:视觉语言模型引导的不确定性感知跨模态传感器融合,实现鲁棒自动驾驶
CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving
摘要
现代自动驾驶汽车配备多种传感器,如摄像头、LiDAR 和雷达,以实现全面的环境感知。然而,鲁棒的跨模态特征融合仍是一个关键挑战,因为各传感器的可靠性在多样的真实驾驶条件下(包括能见度差和恶劣天气)差异显著。虽然不确定性量化(UQ)通过让模型优先采用可靠信号来缓解这一问题,现有的不确定性感知融合方法通常依赖简单的特征级不确定性估计,因此在复杂的分布外场景中往往无法有效泛化。为解决这一局限,我们提出 CRUISE,一个新颖的不确定性感知跨模态传感器融合框架。CRUISE 集成了一个由视觉语言模型(VLM)引导的 UQ 模块,生成细粒度的像素级不确定性估计。通过利用 VLM 丰富的先验知识和出色的情境推理,我们的方法为融合过程提供了信息量极高的引导。此外,我们引入一个动态自适应机制,显式建模并捕捉跨模态依赖,确保框架充分利用多传感器输入固有的互补性。
