论文
AUTOPILOT-VQA:面向事件中心行车记录仪理解的视觉语言模型基准
AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding
摘要
视觉语言模型、大语言模型与多模态大语言模型的最新进展改善了自动驾驶任务——场景理解、决策、轨迹预测与视觉问答。但评估这些模型能否可靠推理安全攸关事件仍具挑战。为弥合该差距,我们提出AUTOPILOT-VQA:面向行车记录仪视频理解的事件中心视觉问答基准。数据集经围绕真实驾驶事件与未遂事件设计的结构化问题评估不同系统。基准覆盖多样安全相关类别:天气与光照条件、交通环境、道路布局、路面状态、标识、涉及实体、事故发生、碰撞位置与可避免性相关推理。通过要求模型回答关于情境场景属性与事件级细节的落地问题——AUTOPILOT-VQA超越物体识别、走向时间落地、安全感知推理。数据集作为AUTOPILOT CVPR 2026竞赛的一部分发布,为评估自动驾驶系统在不同场景下的可靠性提供标准化基准。支持为真实自动驾驶开发更可解释、鲁棒、安全感知的视觉语言系统。
