论文
ExpressMind:面向高速公路运营的多模态预训练大语言模型
ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation
摘要
当前高速公路运营依赖基于规则的孤立模型,限制了跨系统联合分析知识的能力。与此同时,大语言模型(LLM)在智能交通中的应用日益增多,推动交通模型从算法智能迈向认知智能。然而,通用LLM无法有效理解高速公路领域非常规场景中事件的规章与因果关系。因此,本文构建了面向高速公路的预训练多模态大语言模型(MLLM)ExpressMind,作为智慧高速运营的认知核心。本文构建了业界首个全栈高速公路数据集,涵盖交通知识文本、应急推理链和标注视频事件,以克服数据稀缺。本文提出基于自监督训练与无监督学习的双层LLM预训练范式。此外,本研究引入图增强RAG框架,对高速公路知识库进行动态索引。为增强对高速公路事件响应策略的推理,我们开发了RL对齐思维链(RL-CoT)机制,强制模型推理与专家事件处置的解题启发式保持一致。最后,ExpressMind集成跨模态编码器,对齐视觉与文本通道下的动态特征序列,使其能理解视频与图像两种模态的交通场景。在我们新发布的多模态高速公路基准上的大量实验表明,ExpressMind在事件检测、安全响应生成和复杂交通分析上全面超越现有基线。代码与数据发布于:https://wanderhee.github.io/ExpressMind/。
