论文
判断,然后驾驶:自动驾驶的以评论家为中心的视觉语言行动框架
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
摘要
视觉语言动作(VLA)模型的最新进展通过直接将多模态输入映射到控制信号,显示出自动驾驶的巨大潜力。然而,之前基于 VLA 的方法并未明确利用 VLA 的关键能力来改进驾驶决策,尽管这种能力已在其他基于 LLM 的领域中得到了很好的证明,从而限制了它们在复杂闭环场景中的性能。在这项工作中,我们提出了一个受理论启发的两阶段框架 CriticVLA,它将 VLA 的作用从行动扩展到了判断。 CriticVLA 首先生成粗略轨迹,然后在基于 VLA 的批评家的指导下通过多模态评估和单步优化对其进行细化,从而产生更高质量的驾驶行为。为了支持这一过程,我们构建了一个包含 1290 万条带注释轨迹的大规模综合数据集,涵盖不同的驾驶场景,从而增强了批评者的推理和细化能力。 Bench2Drive 基准测试的广泛闭环实验表明,CriticVLA 显着超越了最先进的基线,实现了 73.33% 的总成功率,并在具有挑战性的场景中提供了约 30% 的改进。