论文

推理监管:理解交通规则的思路

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

模型推理推理策略与问题分解

摘要

了解并遵守交通法规是自动驾驶的一项安全关键要求,但由于交通标志的多样性和环境依赖性,仍然具有挑战性。重要的是,规则理解不是一个简单的识别任务,而是一个推理问题:规则是否适用取决于对与车道空间布局和场景上下文相关的标志的解释。为了支持这种推理,MapDR 提供了细粒度的注释,将每个交通标志的监管规则与其管辖的特定车道联系起来。然而,现有的方法在很大程度上将其视为直接序列预测,忽略了连接符号语义和地图结构的潜在推理。为了解决这个限制,我们明确地将推理纳入到这项任务中,并提出了一个为视觉语言模型(VLM)配备思想链(CoT)功能的框架。我们首先设计了一个可扩展的 CoT 管理管道,通过两轮策略从强大的 LLM 引导基本原理,并采用基于 VLM 的验证器来过滤掉不正确的案例,从而产生一组高质量的(CoT,答案)对。在此基础上,我们采用两阶段训练方案:有监督的 微调 (SFT) 来教授原理到答案的生成,然后进行 GRPO 强化学习,以答案为基础的细粒度奖励,以进一步提高最终答案的准确性。 MapDR 上的大量实验表明,我们的方法显着提高了可解释性和准确性,为监管感知自动驾驶建立了第一个基于推理的框架。