论文
Vega:使用自然语言指令学习驾驶
Vega: Learning to Drive with Natural Language Instructions
摘要
视觉-语言-动作模型重塑了自动驾驶,将语言纳入决策过程。然而,大多数现有管道仅利用语言模态进行场景描述或推理,缺乏遵循不同用户指令进行个性化驾驶的灵活性。为了解决这个问题,我们首先构建了一个大规模驾驶数据集(InstructScene),其中包含大约 100,000 个场景,并用不同的驾驶指令和相应的轨迹进行注释。然后,我们提出了一个统一的视觉-语言-世界-动作模型 Vega,用于基于指令的生成和规划。我们采用自回归范式来处理视觉输入(视觉)和语言指令(语言),并采用扩散范式来生成未来预测(世界建模)和轨迹(行动)。我们进行联合关注以实现模态之间的交互,并为不同模态使用单独的投影层以获得更多功能。大量的实验表明,我们的方法不仅实现了卓越的规划性能,而且表现出强大的指令跟踪能力,为更智能和个性化的驾驶系统铺平了道路。