论文
WCog-VLA:用于端到端自动驾驶的双层世界认知视觉-语言-动作模型
WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
摘要
视觉-语言-动作(VLA)模型具有先进的端到端自动驾驶能力。然而,现有的方法要么缺乏全面的世界认知,要么缺乏碎片化的世界预见,本质上将这些模型限制在被动驾驶。为了解决这一限制,我们提出了 WCog-VLA,这是一种新颖的双层世界认知 VLA 框架,成功地将语义世界预测与生成世界进化联系起来,以实现主动自动驾驶。在语义层面,WCog-VLA 通过结合 3D 空间感知和注入代理词元来捕获世界动态,从而统一世界认知和推理,同时实现博弈论思想链 (Game-CoT) 推理。在生成层面,我们引入了对齐解耦扩散 Transformer (ADDT) 作为一个强大的生成世界模型,可以合成物理上合理的联合多智能体轨迹。通过场景表示对齐,ADDT 减少了所需的去噪步骤数量,从而显着加快了推理速度。为了促进策略推理,我们进一步构建了一个包含 85k Game-CoT 注释的大规模数据集。 NAVSIM 基准的大量实验表明,WCog-VLA 的最新 (SOTA) PDMS 分数为 92.9。