论文

AnchorReasoning:长尾自动驾驶场景的视觉定位与因果推理数据集

AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios

模型训练奖励建模与过程监督

摘要

视觉语言模型(VLM)为长尾自动驾驶提供了一种有前途的方法,但现有的驾驶数据集在将决策关键视觉证据与推理和规划连接起来方面提供的监督有限。我们引入了 AnchorReasoning,这是一个基于 WOD-E2E 构建的视觉推理数据集,包含 416,119 个带注释的帧和 395,379 个决策关键元素,涵盖四个主要类别和 19 个细粒度类型。每个框架都被组织为一个视觉基础的思想链(VG-CoT),它将决策关键元素识别和定位、元素属性和含义、驾驶动作原理以及动作和轨迹规划联系起来。我们进一步开发了一种课程监督的微调策略,该策略逐步学习这些分层功能,以及用于评估本地化质量的对象大小感知基础指标。跨八个通用、嵌入式 AI 和 AV 特定骨干网的实验表明,VG-CoT 监督改善了基础推理和轨迹预测。在各个模型中,5 秒 ADE 和 FDE 分别降低了 7.84 和 11.86,而 RFS Frame 和 Cluster 则提高了 1.66 和 1.70。这些收益是通过平均减少 18.5 个推理标记和降低 0.32 秒/帧的推理延迟来实现的,这证明了基于视觉、以决策为中心的监督对于长尾自动驾驶中的 VLM 推理和规划的价值。