论文
具有基于语言记忆的视觉-语言-动作自动驾驶Agent
Vision-Language-Action Autonomous Driving Agent with Language-based Memory
摘要
视觉-语言-动作(VLA)基础模型最近已成为自动驾驶的主流解决方案之一,因为它们可以利用在视觉语言预训练过程中获得的知识来实现准确且可解释的驾驶。然而,由于图像的词元成本较高,VLA 只能采用有限数量的帧作为视觉输入,这对于依赖于内存的任务(例如确定全路停靠点的到达顺序和长视距驾驶场景理解)来说是有问题的。现有的解决方案使用通过交叉注意力访问的潜在向量存储器,这些存储器既不可解释也不可移植。在本文中,我们提出了 AD-Memo,一种具有基于语言记忆的通用 VLA 驱动Agent。Agent输出记忆作为其思维链(CoT)的延伸,以记录对驾驶至关重要的周围物体;该记忆成为智能体未来输入的一部分。我们策划基于记忆的数据集,并使用两阶段方法训练 VLA:监督微调(SFT)和 Da Capo,这是一种新颖的半闭环强化学习(RL)算法,该算法利用轨迹级优势进行记忆,并利用步骤级优势进行驾驶,从而实现更好的学分分配。 AD-Memo在全程停车、一般驾驶等场景中,提升驾驶质量,实现更好的驾驶场景问答,并为其他车型提供即插即用的内存。