论文
GRAVA:将场景证据、推理与可执行动作衔接的自动驾驶框架
GRAVA: Grounded Reasoning-to-Action Representation and Learning for Autonomous Driving
摘要
驾驶视觉-语言-动作(VLA)模型越来越多地在行动之前进行推理,但它们的中间推理通常基于物理场景证据的基础薄弱,并且与可执行行为松散地联系在一起。我们提出了 GRAVA,一个围绕扎根推理到行动 (GRA) 构建的框架,它将扎根、推理和行动生成统一在一个自回归流中。 GRA 将与动作相关的语言参考链接到 2D 视觉区域和以自我为中心的物理状态,在轨迹锚定类型图中组织对象交互和决策,并将该结构序列化为基础推理。单个 VLM 生成此推理,然后是紧凑的可执行规划器操作,该操作被确定性地解码为连续轨迹。我们进一步引入了一种将前向场景证据对齐与后向轨迹锚定相结合的代理 GRA 数据构建管道,并用它来构建具有 2.2M 基于场景证据的问答对和 70K GRA 推理轨迹的 GR-NavSim。渐进式训练策略通过预训练发展扎根认知,通过模仿建立推理到行动的界面,并通过强化学习和探索改善驾驶行为。 GRAVA-8B 使用约 60% 的可用人类驾驶演示进行动作监督,在完整的 NAVSIM 基准上实现了纯自回归驾驶模型中最先进的性能。在内部长尾基准上,完整的 GRA 比仅行动预测分别将关键对象合规性和闭环驾驶分数提高了 19.3% 和 20.5%。这些结果表明,通过生成可执行的动作来保留来自扎根推理的与动作相关的物理证据的好处。