论文
迈向安全出行:由开放式视觉语言数据集支持的统一交通基础模型
Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset
摘要
城市交通系统面临着日益严峻的安全挑战,新兴的智能移动基础设施需要可扩展的智能。虽然基础模型和大规模多模态数据集的最新进展加强了智能交通系统(ITS)的感知和推理,但现有研究仍然主要集中在微观自动驾驶(AD)上,对城市规模的交通分析的关注有限。特别是,开放式安全导向视觉问答(VQA)和用于对异构路边摄像头观测进行推理的相应基础模型仍未得到充分探索。为了解决这一差距,我们引入了陆地交通数据集(LTD),这是一个大型开源视觉语言数据集,用于城市交通环境中的开放式推理。 LTD 包含从异构路边摄像机收集的 11.6K 高质量 VQA 对,涵盖不同的道路几何形状、交通参与者、照明条件和恶劣天气。该数据集集成了三个互补的任务:细粒度多对象定位、多图像相机选择和多图像风险分析,需要对最小相关视图进行联合推理,以推断危险对象、影响因素和危险道路方向。为了确保注释保真度,我们将多模型视觉语言生成与交叉验证和人机交互细化相结合。在 LTD 的基础上,我们进一步提出了 UniVLT,这是一种通过基于课程的知识转移训练的交通基础模型,可在单一架构内统一微观 AD 推理和宏观交通分析。对 LTD 和多个 AD 基准的大量实验表明,UniVLT 在跨不同领域的开放式推理任务上实现了 SOTA 性能,同时暴露了复杂多视图流量场景中现有基础模型的局限性。