论文

BrainWAM:自动驾驶的语义先验和预测动力学的动作空间协调

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

模型架构混合架构

摘要

自动驾驶需要在语义约束和预测动态下进行规划。然而,现有的端到端驱动方法通常只强调这一要求的一方面:视觉-语言-动作(VLA)模型利用 VLM 先验进行语义推理,而世界动作模型(WAM)通过生成世界建模提供未来感知的预测。这自然会激发一个可以利用语义先验和预测动态的统一规划器。然而,我们发现通过联合 词元级 注意力的简单组合会遇到注意力分配不匹配的问题,其中语义快捷方式主导共享注意力空间并抑制预测动态。受神经科学证据的启发,复杂的行为源于功能专门系统之间的协调,我们提出了 BrainWAM,这是一种结构化的动作空间协调框架,它将语义推理和预测世界建模转换为两个专门的面向动作的路径,并在紧凑的动作表示层面上将它们对齐。我们进一步引入了一种具有解耦视频和动作去噪功能的异步整流流推理策略,该策略可以缩短推理延迟,同时保留与规划相关的预测上下文。 BrainWAM 在 NAVSIM v1 (89.5 PDMS) 和 NAVSIM v2 (89.6 EPDMS) 上均达到了最先进的性能,始终优于仅 VLA 或仅 WAM 的方法,凸显了 BrainWAM 作为自动驾驶系统的实用且有前途的方向。