论文
从检测到理解:用于多任务流量异常推理的 TAR 和 TAR-Bench
From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning
摘要
检测交通异常并不能确定视频语言模型是否可以解释发生的情况、及时定位或识别其原因。我们引入了 TAR(流量异常推理)和 TAR-Bench,这是用于在涵盖问答、时间推理和场景理解的 10 项任务中训练和评估这些互补能力的配对资源。 TAR 包含 44,040 个自动生成的注释,以及来自 8 个公共数据集的 3,670 个 CCTV 视频的思想链轨迹。 TAR-Bench 为来自 17 个 YouTube 公共视频的 80 个保留剪辑提供了 960 个人工注释。对十一种视觉语言模型的评估揭示了问答性能与时间或场景推理之间的差距。在受监督的 微调 期间逐步添加任务组可提高 Cosmos-Reason2-8B 和 Qwen3-VL-8B-Instruct 上的总体性能。对所有 10 项任务进行训练后,它们的平均基准分数分别从 34.3 提高到 55.7,从 30.9 提高到 53.9。这些结果支持跨互补任务的联合训练,作为理解交通异常的一种有前途的方法,同时强调了时间精度和因果归因方面的持续局限性。 TAR 和 TAR-Bench 是 AI City Challenge 2026 Track 3 的官方训练和域内评估资源。该数据集可在 https://huggingface.co/datasets/nvidia/PhysicalAI-Traffic-Anomaly-Reasoning 上获取。