论文

C-CoT:安全自动驾驶视觉语言模型的反事实思维链

C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

模型推理推理策略与问题分解

摘要

复杂环境中的安全关键规划,特别是城市十字路口,仍然是自动驾驶的基本挑战。现有的方法,无论是基于规则的还是数据驱动的,经常难以捕获复杂的场景语义、推断潜在风险并在罕见的高风险情况下做出可靠的决策。虽然视觉语言模型(VLM)为这些环境中的安全决策提供了有前途的方法,但大多数当前方法缺乏反思和因果推理,从而限制了它们的整体稳健性。为了解决这个问题,我们提出了一个反事实思想链(C-CoT)框架,利用 VLM 将驾驶决策分解为五个连续阶段:场景描述、关键对象识别、风险预测、反事实风险推理和最终行动规划。在反事实推理阶段,我们引入了结构化元动作评估树,以明确评估替代动作组合的潜在后果。这种自我反思推理在行动选择和安全结果之间建立了因果联系,提高了长尾和分布外场景的鲁棒性。为了验证我们的方法,我们基于 DeepAccident 基准构建了 DeepAccident-CCoT 数据集,并使用低秩自适应微调 Qwen2.5-VL (7B) 模型。我们的模型实现了 81.9% 的风险预测召回率,将碰撞率降低至 3.52%,并将 L2 误差降低至 1.98 m。消融研究进一步证实了反事实推理和元动作评估树在增强安全性和可解释性方面的关键作用。