论文

VeriDrive:可验证的反事实监督,实现经济高效的视觉语言规划

VeriDrive: Verifiable Counterfactual Supervision for Cost-Efficient Vision-Language Planning

模型训练合成数据

摘要

视觉语言驾驶模型越来越多地使用推理监督来连接感知、预测和规划,但现有的驾驶原理通常是自由形式的,并且使用前沿模型生成成本高昂。我们提出了 VeriDrive,一个构建面向规划、可验证的反事实监管的框架。 VeriDrive 将驾驶推理转换为结构化的感知-评估-修正链,为未来运动中的关键物体奠定基础,利用可规则检查的证据评估替代的自我轨迹,修正对专家行为的风险意图,并产生最终的规划目标。为了扩展数据构建,VeriDrive 将本地生成与验证器引导的选择性校正相结合,仅升级无效或困难的样本。我们在 nuScenes 上构建 VeriDrive 数据集并在 Omni-Q 协议下进行训练。受控开环实验表明,VeriDrive 相对于 OmniDrive 改进了 L2、碰撞和交叉,同时减少了记录的词元使用情况、生成时间和实际支付的 LLM/VLM 成本。这些结果表明,可审核的中间字段和结构化修订目标可以在现实的注释预算下改善视觉语言规划监督。代码、提示和验证器脚本即将推出,并将在审核过程后发布。