论文
OmniTraffic:时空流量推理的可控生成管道和基准
OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning
摘要
交通场景理解需要模型进行超越对象识别的推理,包括车道拓扑、多视图几何、时间演化和信号相位语义。然而,现有的面向流量的多模态基准主要强调被动视觉识别或孤立的视频理解,为评估受控条件下的结构感知流量推理提供有限的支持。我们介绍 OmniTraffic,一种可控生成管道和时空流量推理基准。 OmniTraffic 围绕 12 个现实世界的十字路口构建,重建为可编辑的 3D 交通环境,并辅以来自两个国家的监控录像,支持受控和自然条件评估。它定义了一个三级任务层次结构,涵盖场景感知、多视图和时间推理以及决策支持。使用结构化交通元数据,OmniTraffic 生成同步的多视图 VQA 样本,涵盖车辆状态、车道功能、视图-BEV 对应、时间动态和信号相位分析,从而产生 8M VQA 样本和 3K 人工验证的测试集。对 11 个前沿 MLLM 的评估揭示了人类模型之间的巨大差距,其中最明显的失败是基于拓扑和时空推理任务。 微调 是一种基于模拟 OmniTraffic 数据的轻量级 MLLM,进一步提高了现实世界交通场景的性能,展示了模拟生成的监督对于特定于交通的多模态推理的价值。除了固定数据集之外,OmniTraffic 还提供可扩展的管道,其中包含可配置的交叉路口、摄像机视图、交通需求、信号相位、视觉条件和罕见事件。