论文

CASCADE:用于驾驶的时空因果推理表示和数据集

CASCADE: A Spatio-Temporal-Causal Reasoning Representation and Dataset for Driving

模型评测基准与评测资源

摘要

推理是实现自动驾驶长尾所需的泛化的一种有前途的途径,因为它可以推断场景的元素如何相互依赖,并遍历这些依赖关系,得出超出观察到的结论。然而,很难判断模型的结论是否遵循场景的依赖性,因为没有驾驶表示使它们足够明确以进行测试。基于文本的推理痕迹缺乏时空基础,时空场景图缺乏因果联系,大规模推理注释越来越多地由模型生成且难以验证。为此,我们引入了 CASCADE(驾驶环境因果时空分析),它包含两个组成部分:(1)用于驾驶场景推理的结构化场景表示和(2)基于其构建的人工注释数据集。对于与自我车辆交互的每个参与者,只要参与者可见,CASCADE 表示就会逐帧记录采取的动作、发生的位置以及它如何依赖于其他人的动作和状态。由此产生的结构使得推理预测可以通过机器验证:可以逐个元素对其进行评分,而无需依赖 (M)LLM 法官。 CASCADE 数据集为 PhysicalAI 数据集的 2,066 个驾驶片段提供了全面的人工注释,其中包含超过 34K 个元素,用于建立每个场景的时空和因果背景,包括 8.6K 个带时间戳的自我和代理动作、3.7K 个因果链接和 2.9K 个潜在影响,以及针对代理、物体、交通灯和环境的 6.1K 个注释。 CASCADE 完全由人工注释,为这种比较提供了参考:对物理 AI 模型的推理能力进行基准测试,并验证自动生成的推理标签的质量。 CASCADE 数据集可从 https://huggingface.co/datasets/nvidia/cascade 获取。