论文
TrafficImag:超越画质的反事实路侧视频生成基准
TrafficImag: A Benchmark for Counterfactual Roadside Traffic Video Generation
摘要
现有的路边交通数据集支持感知、预测和视觉问答,但它们不评估反事实视频生成,其中修改选定的参与者,并且生成的未来应与道路拓扑和不相关的交通保持一致。我们推出 TrafficImag,这是反事实路边交通视频生成的第一个基准。 TrafficImag 将大规模路边数据集(9,022 个带注释的图像、7,043 个重复数据删除的视频剪辑和 31,145 个以交通参与者为中心的历史-未来样本)与支持行为推理、干预感知图像编辑和条件视频生成的可执行协议相结合。每个干预措施都表示为一个参与者级程序,描述目标参与者、预期行为、合法路线、交互顺序和时间约束,从而实现跨异构基础模型的统一评估界面。 TrafficImag 评估四个互补的有效性维度:初始状态正确性、路线和行为有效性、交互一致性和非目标保留,并且只有当这四个维度都满足时才认为端到端反事实成功。在最先进的基础模型中,最强的推理器达到 80.4% 的宏 F1,完整的条件接口将最佳生成器的端到端成功率从 23.3% 提高到 55.0%。 Oracle 研究进一步表明,条件视频执行是主要的剩余瓶颈。 TrafficImag 提供了一个可重复的基准,用于评估和诊断超出感知视频质量的反事实交通视频生成。
