论文
SpanVLA:视觉-语言-动作模型的有效动作桥接和从负恢复样本中学习
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
摘要
视觉-语言-动作(VLA)模型提供了一种有前途的自动驾驶范例,可以利用世界知识和推理能力,特别是在长尾场景中。然而,现有的 VLA 模型经常会遇到使用自回归生成框架的动作生成的高延迟问题,并且鲁棒性有限。在本文中,我们提出了 SpanVLA,一种新颖的端到端自动驾驶框架,集成了自回归推理和流程匹配动作专家。首先,SpanVLA引入了一个高效的桥梁,利用VLM的视觉和推理指导,使用以历史轨迹初始化为条件的流匹配策略来有效地规划未来轨迹,从而显着减少推理时间。其次,为了进一步提高SpanVLA模型的性能和鲁棒性,我们提出了一种基于GRPO的后训练方法,使VLA模型不仅能够从积极驾驶样本中学习,而且能够学习如何避免典型的消极行为并学习恢复行为。我们进一步介绍了mReasoning,一个新的现实世界驾驶推理数据集,专注于复杂的推理需求场景和负恢复样本。 NAVSIM(v1 和 v2)上的大量实验证明了 SpanVLA 模型的竞争性能。此外,不同场景的定性结果凸显了我们模型的规划性能和稳健性。