论文

DriveJudge:利用视觉语言模型重新思考自动驾驶评估

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

模型评测评测方法与指标

摘要

自动驾驶已经转向端到端的政策学习,其中可靠、可解释的政策评估是一项根本挑战,因为驾驶质量高度依赖于环境。常用的基于规则的驾驶指标(如 EPDMS)是可解释的,但缺乏上下文感知,而最近的基于 VLM 的评估是上下文感知的,但受到模糊的 VLM 输出和对物理规律的依据不足的限制。为了以可解释和情境感知的方式评估驾驶,我们引入了 DriveJudge。 DriveJudge 是一种驾驶评估代理,它将基于规则的评估与视觉语言模型 (VLM) 推理相结合,并在解释环境上下文后选择性地调用基于物理的确定性规则函数。为了训练和评估 DriveJudge,我们整理了一个包含 33,577 个具有挑战性的驾驶样本的大型数据集,并通过人工注释来判断给定场景中驾驶行为是否合理。通过这个数据集,我们解决了尚未充分探索的驾驶指标评估问题,并引入了两个人性化的基准任务:驾驶质量分类和轨迹偏好选择。 DriveJudge 在驾驶质量分类方面优于 EPDMS 21.23 AUC,在轨迹偏好选择方面优于最近基于 VLM 的 DriveCritic 6.5%,为可解释和精确的驾驶评估设立了新标准。