论文
增强多模态 大语言模型 以实现安全关键型驾驶视频分析
Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis
摘要
多模态 大语言模型 (MLLM) 的最新进展在一般视觉理解方面展示了令人印象深刻的能力。然而,它们在安全关键驾驶场景中的应用仍然受到限制,因为无法准确感知和推理罕见的高风险动态事件,例如碰撞或接近碰撞。为了解决这个问题,我们引入了一种管道,通过将下采样视频帧与同步高频远程信息处理数据(IMU 和 GPS)以及来自专业计算机视觉模型的语义见解融合来增强 MLLM 感知。我们的管道生成高质量的伪标签,包括描述性标题和问答对,专门用于训练 MLLM 识别和描述现实世界驾驶镜头中的安全关键事件 (SCE)。我们通过 DoRA 适配器展示了我们的方法 微调(开源 QwenVL-2.5 模型)的有效性:我们的实验证明了在识别和解释安全关键事件方面的显着改进,可训练参数少于 50M,计算预算也有限。