论文

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

模型训练强化学习

摘要

视觉语言动作模型(VLA)利用视觉语言模型(VLM)的高级推理能力,在复杂的自动驾驶场景中显示出有希望的泛化能力。现有的 VLA 通常根据 2D 图像预测和优化 3D 轨迹。虽然很直观,但这种 2D 到 3D 的预测本质上与相机参数纠缠在一起,导致跨异构驾驶数据集的数据可扩展性有限。此外,直接在 3D 空间中进行优化会导致严重收敛到琐碎的解决方案,其中 VLA 依赖于自我状态而不是视觉场景理解。为了解决这些问题,我们提出了 PixelPilot,这是一种新颖的 VLA,具有解耦的规划和提升范式。在规划阶段,PixelPilot 将场景理解和轨迹预测重新表述为图像平面中与传感器无关的 2D 到 2D 任务,从而促进跨不同数据集的可扩展训练。然后,仅在推理过程中,规划的 2D 轨迹才会确定性地提升为 3D,从而确保充分利用视觉线索并在不同车辆之间进行泛化。为了实现这一范式,我们提出了一种灌输知识的策略学习策略,该策略通过组相对策略优化(GRPO)应用密集的中间奖励,以强制执行从视觉感知到空间规划的严格因果链。大量实验表明,PixelPilot 在开环和闭环设置中均实现了最先进的性能,验证了其卓越的可扩展性和视觉推理能力。