论文

RAF-VLA:表示与端到端自动驾驶的未来保持一致

RAF-VLA: Representation Alignment with the Future for End-to-End Autonomous Driving

模型训练监督微调与指令调优

摘要

最近的自动驾驶视觉-语言-动作(VLA)模型通过预测未来的驾驶场景和驾驶动作,融入了世界建模,展示了强大的规划性能。未来的驾驶场景被用作密集监督,鼓励策略学习对规划有用的丰富内部表示。然而,这些世界建模 VLA 依赖于显式的未来生成来学习此类表示,从而引入了两个关键限制:额外的训练负担和推理延迟。为了解决这些限制,我们提出了 RAF-VLA(与未来的表示对齐),这是一种基于 VLA 的自动驾驶框架,可通过未来框架表示的直接指导来塑造与规划相关的内部表示。 RAF-VLA 采用未来对齐的监督微调,其中简单的正则化将策略的隐藏状态与从预训练的世界编码器获得的未来帧表示对齐,同时学习驾驶动作。这种简单的对齐方式使 RAF-VLA 能够避免与下一代相关的训练负担和推理延迟。 NAVSIM 基准的大量实验表明,RAF-VLA 在训练样本少得多的情况下,实现了与最先进的 VLA 规划器相比的竞争性规划性能。此外,RAF-VLA 仅产生 3.8% 的训练开销和可忽略不计的 1 ms 推理开销。