论文

蓝色:在自动驾驶的高效视觉-语言-动作模型中更好地使用语言

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

模型推理推理加速

摘要

我们提出了 BLUE,这是一种在自动驾驶 (AD) 的视觉-语言-动作 (VLA) 模型中更好地使用语言的最小方法。通过广泛的分析,我们发现语言只在一小部分路线上起作用,但在这些路线上它可以极大地提高或降低性能。因此,在每一帧生成语言效率很低,因为大部分计算都花在不能从语言中受益的帧上。我们进一步表明,预训练的 VLA 隐藏状态可能已经对语言是否有益于给定帧进行了编码,尽管场景复杂性和运动学特征本身很难预测这一点。基于这一发现,BLUE 在冻结的 VLA 隐藏状态上训练一个轻量级门,以决定每帧是否激活语言生成或直接预测动作,而无需修改主干网络或需要额外的人工注释。仅用 0.11M 参数门,BLUE 在两个基准测试中都创下了新的最先进水平,在 Bench2Drive 上实现了 76.2% 的成功率,在 Longest6 v2 上获得了 36 的驱动分数,同时与主干网相比,推理速度提高了 2.54 倍,成功率提高了 8.9%。 BLUE 提供了一条通往高效语言增强 AD 的实用途径,表明 VLA 模型可以以很小的成本保留语言的优势。我们的代码、数据、日志和检查点均可在 https://github.com/George-Ling3/BLUE 上获取。