论文

HyWorldVLA:用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

模型训练预训练

摘要

通过世界建模增强的视觉-语言-动作(VLA)模型代表了端到端自动驾驶的有前途的范例。虽然像素级的未来预测可以实现细粒度的时空推理,但它会损害噪声驾驶场景中的鲁棒性。相反,基于潜在的世界模型减轻了这种敏感性,但由于缺乏像素级基础,通常会导致可解释性有限和表征退化。为了协调这种权衡,我们提出了 HyWorldVLA,这是一种混合世界 VLA 框架,统一了像素级监督和潜在表示学习。在 预训练 阶段,HyWorldVLA 预测由预训练视频 VAE 编码的视频潜伏,同时重建视频帧以提供精确的像素级基础。在随后的 co-微调 阶段,该模型专门预测潜在特征,这些特征被输入到动作专家中以生成轨迹。 NAVSIM v1 和 v2 基准的大量实验表明,HyWorldVLA 显着优于基于像素和基于潜在的世界模型基准。值得注意的是,我们首次对自动驾驶中的世界模型噪声稳健性进行了全面的定性和定量分析,为评估未来架构建立了新的基准。