论文
S-squared-VLA:自动驾驶视觉-语言-动作模型中语义流和空间流的解耦
S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving
摘要
视觉语言模型 (VLM) 在自动驾驶的高级推理方面表现出了巨大的潜力,但它们从根本上难以生成精确的底层控制动作。这种限制的根源在于离散语言标记和连续轨迹规划之间固有的不匹配造成的语义-物理差距。虽然视觉-语言-行动 (VLA) 架构试图通过将感知和控制统一到单个策略中来弥合这一差距,但这种纠缠造成了新的瓶颈。标准 VLA 经历了严重的空间表示崩溃,这不可逆转地降低了安全、边界感知导航所必需的细粒度空间和几何先验。为了解决这个限制,我们提出了 S-squared-VLA,它明确地解耦了视觉-语言-动作模型中的语义和空间流。语义流利用分层桥接来提取多尺度 VLM 特征,以进行稳健的意图推理。同时,独立的空间流绕过自回归语言瓶颈,直接保留来自视觉编码器的未压缩空间特征。通过集成辅助感知监督,该流明确地为模型配备了丰富的空间和几何先验。最后,双流规划适配器通过级联注意机制将高级语义意图与精确的空间约束融合在一起。 NAVSIM 闭环基准评估表明,S-squared-VLA 的预测驾驶员模型得分 (PDMS) 达到 87.1,在纯监督 微调 (SFT) 设置下建立了 VLA 模型的新的最先进水平。通过减轻传统 VLM 的空间表示崩溃,我们的框架显着优于基线,在所有评估方法中实现了最高的无冲突 (NC) 率 98.4。