论文

LLM-赋能自动驾驶多模态融合框架:语义增强和通道自适应设计

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

应用与实践视觉感知与空间理解

摘要

视觉雷达融合是强大自动驾驶的核心,它将密集的视觉语义与雷达的精确距离和速度测量相结合。然而,现实世界的融合质量从根本上受到由于遮挡、恶劣天气和信道噪声而动态变化的输入质量的挑战。为了解决这个问题,我们将问题从静态数据融合重新构建为通道感知语义推理,并提出了一个以 大语言模型 为中心的语义层通道感知集成感知(LM-SCIP)框架。它将 大语言模型 (LLM) 作为中央推理核心,将本地视觉流与质量变化的外部雷达流融合在一起,用于覆盖感知盲点。具体来说,LM-SCIP 将分层雷达视觉编码器与通道自适应语义模块 (CASM) 相结合,将链路指示器映射到“通道提示”中,以动态地控制外部雷达功能。然后,参数高效、LoRA 调谐的 LLM 与异构专家混合 (H-MoE) 相结合,在本地视觉线索和通道调节雷达上下文之间进行仲裁。最后,解耦的多任务解码器输出定位、轨迹预测和图像重建。 nuScenes 和 VIRAT 上的实验验证了我们的方法。在 nuScenes 上,在雷达输入的受控切换下,LM-SCIP 与仅视觉基线相比,将定位 RMSE 降低了 40.0%。在 VIRAT 上,该模型获得了 0.214m 本地化 RMSE 和 0.179m minFDE (k=1)。这些结果表明,所提出的 LM-SCIP 能够在低 SNR 下实现稳健的视觉主导回退,并在高 SNR 下实现协同融合。