论文

意图、反思、完善:自动驾驶的自适应多模态反思框架

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

模型推理推理验证与自校正

摘要

最近的视觉-语言-动作(VLA)模型通过结合推理以实现更好的可解释性和规划质量,从而实现了先进的端到端自动驾驶。然而,大多数现有方法直接生成最终轨迹,而没有明确检查其未来后果,这限制了它们在复杂和动态环境中的可靠性。为了解决这一限制,我们提出了 IRR-Drive(Intend、Reflect、Refine),这是一种用于自动驾驶的自适应多模态反射框架。具体来说,为了将高级推理与物理约束紧密结合起来,IRR-Drive 首先生成初步的文本意图,并通过预测未来的语义鸟瞰图 (BEV) 表示来预测潜在的交互。这种双模态(文本 + BEV)反射空间明确地模拟了预期的场景演变,使模型能够在生成最终轨迹之前严格自我纠正和完善其初始意图。此外,为了平衡规划性能和计算效率,我们构建了面向反射的训练数据并设计了自适应反射奖励,使模型能够根据场景复杂性自适应地选择其推理模式。 IRR-Drive 没有主要使用推理作为辅助解释,而是直接将自适应反射机制集成到规划框架中,从而实现由场景复杂性驱动的有场景依据、感知决策的轨迹校正。我们的方法在 PDMS 和 EPDMS 的 NAVSIM 基准上实现了最先进的性能。大量的实验证明了我们的多模态反射框架的有效性,并验证了所提出的自适应反射策略的有效性。