论文

具有结构化场景知识和可验证推理-动作一致性的自动驾驶认知双流程规划

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

模型推理推理策略与问题分解

摘要

自动驾驶的高层规划是一项知识密集型的工程决策任务,需要准确的场景理解、及时的推理和内部一致的动作选择。视觉语言模型(VLM)可以使中间推理变得明确,但它们在部署的规划器中的使用受到成本高昂的结构化监督、日常场景中不必要的推理以及生成的基本原理和驾驶行为之间可能存在的不一致的限制。我们提出了一种认知双流程规划框架,该框架以机器可解析的结构化思想链(S-CoT)模式表示与规划相关的场景知识。自动化数据引擎集成了感知基础模型、关键路径过滤和专家 VLM,可生成 S-CoT 监督,无需手动注释各个基本原理。轻量级视觉仲裁器在语言解码之前根据多级视觉编码器特征估计场景复杂性,并将每个输入路由到快速元动作预测或慢速结构化推理。对于慢路径输出,基于确定性规则的验证器检查解析的 S-CoT 字段是否与最终元操作一致,并为组相对策略优化 (GRPO) 提供可验证的奖励。在 195 个场景的手动审核中,生成的注释实现了 91.8% CoT 准确率和 98.5% 逻辑一致性分数 (LCS)。在 574 个手动验证的 NAVSIM 测试样本上,规划器实现了 80.14\% 的规划精度和 97.20\% LCS,同时相对于对每个场景应用慢速推理,平均延迟降低了 17.39\%。对外部长尾子集的评估进一步确定了路由和规划性能下降的条件。这些结果共同表明了如何通过自适应推理和基于规则的验证来操作显式场景知识,以支持高级 VLM 规划决策。