论文
DriveMA:通过可验证的元动作驱动视觉-语言-动作模型
DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
摘要
驱动视觉-语言-动作模型(Driving VLA)旨在使用语言来改进端到端规划,但语言与动作之间的差距限制了这一承诺。我们提出了 DriveMA,一个建立在可验证的元动作上的驾驶 VLA 框架,它将未来的自我运动总结为紧凑的语言域意图,并且可以通过具有基于轨迹的注释管道的专家轨迹来构建,并且可以通过基于规则的投影对生成的轨迹进行验证。 DriveMA 通过以行动为中心的监督训练和数据高效的轮级贡献分配强化学习框架来利用这种可验证性,通过密集的奖励和精确的贡献分配,明确地将高层决策与低层轨迹规划保持一致。 DriveMA 在基于 Waymo 开放数据集视觉的 E2E 驾驶上树立了新的技术水平,2B 模型的评分者反馈分数达到 8.060,4B 模型进一步提高到 8.079;它还在NAVSIM上获得了有竞争力的闭环规划性能。这些结果表明,即使是简单的元动作界面,只要经过验证并针对语言动作对齐进行优化,也可以实现最先进的规划。代码、数据和模型可在 https://tsinghua-mars-lab.github.io/DriveMA 获取。