论文
延迟暴露未来轨迹以支持自动驾驶VLM的可验证推理
Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
摘要
最近的视觉-语言-行动(VLA)模型在自主驾驶(AD)中越来越多地利用链式思考(CoT)监督来增强其视觉-语言模型(VLM)组件的推理能力,但现有的标注管道通常暴露教师模型到已记录的地面真值(GT)未来轨迹。我们实验证明,这种轨迹锚定偏见:教师模型基于已记录的未来轨迹进行理性化,而不是从场景证据中推断决策,导致生成的因果性忠实的CoTs显著减少,特别是在因果性挑战性场景中,且产生更严重的幻觉。去除GT轨迹消除了这个捷径,但开放的未来轨迹生成纠缠了高层决策与精确几何合成和低层动态。为了使基于轨迹的驾驶决策可验证,而无需要求开放的未来轨迹合成,我们引入了自主驾驶多项选择问题(AD-MCQ),将规划视为从明确的轨迹候选中选择。进一步,我们提出了一种延迟暴露未来轨迹的方法(DEFT-RLVR),将未来的轨迹从决策点锚定转换为决策后的验证目标。实验结果表明,DEFT-RLVR在AD推理中改进了AD推理,同时保留或甚至增强了通用视觉能力。通过使用VLM-只有推理和通过候选构造可控的难度,AD-MCQ为未来的可验证AD推理研究提供了一种灵活、可扩展和可扩展的基础。
