论文
FIVE-VLA:具有循环动作记忆的快速有效的自动驾驶
FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action Memory
摘要
用于自动驾驶的最先进的视觉语言动作模型(VLA)面临着严重的限制:参数数量过多、高分辨率图像处理效率低下以及缺乏时间记忆。我们引入快速有效的 VLA (FIVE-VLA),通过两个关键贡献来解决这些问题。首先,我们采用高效的视觉编码器,可以处理高分辨率(448 美元×896 美元)图像,同时仅生成 98 个标记,比现有方法少 5 美元以上,并且完全绕过文本生成以进行单通道轨迹预测。其次,我们提出了循环动作记忆(RAM),这是一个轻量级模块,可以根据先前的动作标记进行动作预测,为超车和紧急制动等操作提供至关重要的时间上下文。只需 6.41 亿个参数,FIVE-VLA 在具有挑战性的 Bench2Drive 闭环驾驶基准测试中,比之前最先进的 VLA 多完成 $\sim$10% 的路线,且没有违反交通规则。对大规模真实 NVIDIA 物理 AI AV 数据集进行的非反应式开环仿真显示,在单视图和四视图设置中,碰撞违规率分别比 SimLingo 低 10.2% 和 7.7%。此外,FIVE-VLA 在 A100 上的运行速度为 $\sim$30 fps,在 T4 GPU(边缘设备的代理)上的运行速度为 $\sim$4 fps,与之前的方法相比,速度提高了 8-30$\times$。