论文
DRIVESPATIAL:自动驾驶 VLM 时空智能的基准
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
摘要
自动驾驶 (AD) 中的时空智能需要代理将多视图观察集成到连贯的场景表示中,保持跨视点和时间的对象连续性,并对空间关系、交互和未来动态进行推理。然而,现有的自动驾驶视觉语言基准主要集中在单视图、静态、以自我为中心或单一来源的问答上,目前尚不清楚当前的视觉语言模型(VLM)是否能够真正构建和推理动态驾驶场景。我们推出了 DriveSpatial,这是一个基准测试,包含来自 5 个大型 AD 数据集的 20 个任务中的 15,600 个经过人工验证的 QA 对。 DriveSpatial 评估四种能力:认知场景构建、多视图关系理解、时间推理和泛化。与之前的基准测试不同,DriveSpatial 是根据动态多关系场景图生成的,该场景图对对象状态、空间关系、交互、相机可见性和时间对应关系进行编码,从而使 QA 对能够执行真正的跨视图和时空推理。对 15 个代表性 VLM 的评估揭示了人类模型之间的巨大差距:最强的模型落后人类 28.4 个百分点,而认知场景构建成为关键瓶颈。进一步的诊断表明,仅使用语言提示是不够的,而明确的 BEV 空间对齐可以持续提高性能。这些结果表明,当前的 VLM 缺乏可靠的时空驾驶智能所需的场景构建能力。 DriveSpatial 及其构建管道将被发布以支持未来的研究。