论文

教授视觉-语言-动作模型“看什么”和“看哪里”

Teaching Vision-Language-Action Models What to See and Where to Look

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型已成为端到端自动驾驶的有前途的范例。然而,现有 VLA 的训练严重依赖于以文本为中心的视觉问答和思维链推理数据,强调语言推理而不是基于行动的规划。因此,学习到的表示捕获了语义知识,但缺乏对于可靠的轨迹预测至关重要的空间依赖性。我们提出了 DriveTeach-VLA,这是一个明确教导 VLA 看什么以及看哪里的框架。驾驶感知视觉 蒸馏 (DVD) 将驾驶特定的感知先验注入视觉编码器,而 2D 轨迹引导提示 (2D-TGP) 提供与可行驾驶轨迹一致的空间调节。它们共同形成了一个视觉引导的学习管道:看什么(DVD 预训练)- 看哪里(TGP 引导的 SFT)- 如何行动(TGP 引导的 GRPO)。 DriveTeach-VLA 在 NAVSIM 和 nuScenes 上实现了最先进的性能。我们的代码位于:https://github.com/ShivaTeam/DriveTeach-VLA。