论文
DriveHierarchy:分层诊断VLM的驾驶理解与闭环执行
DriveHierarchy: A Benchmark for Diagnosing VLM Driving Capabilities from Open-Loop Understanding to Closed-Loop Execution
摘要
基于VLM的自动驾驶仍难以评估,因为驾驶能力由多项能力组成:系统必须识别交通参与者与风险,整合跨视角和时间的上下文,推理未来演化,并在闭环交互中采取合适行动。现有基准通常只评估开环理解或闭环驾驶,对于这些能力的组织方式、相互关系以及如何支持模型诊断和改进,缺乏结构化解释。我们提出DriveHierarchy,以四个层级组织VLM自动驾驶能力,涵盖感知定位、上下文记忆、心智推理和闭环执行。为实现这一层次,我们将多个开源自动驾驶数据集整合为统一开环基准,包含84279帧上的76798组问答;同时在真实道路网络上建立支持交互场景构造的闭环仿真平台,从中整理100个用于具身评测的驾驶场景。对15种VLM的实验表明,DriveHierarchy能够捕捉具有结构性且不冗余的能力差异,将开环理解与闭环驾驶关联起来,为诊断及基准指导的优化提供实用依据。因此,DriveHierarchy为评估和改进基于VLM的自动驾驶系统提供统一框架。项目已公开。 https://github.com/PerfectXu88/DriveHierarchy