论文
驾驶 VLA 对 8 级卡车的数据高效适应
Data-Efficient Adaptation of a Driving VLA to Class 8 Trucks
摘要
8 级卡车在几何形状、动力学和操纵要求方面与客车不同。因此,针对乘用车训练的视觉-语言-动作 (VLA) 模型不容易转移到 8 类卡车上,特别是在事故现场和施工区域等非结构化场景中。我们不是从头开始训练卡车驾驶 VLA,而是提出了一种先适应后转向的策略,该策略采用现成的 VLA 来生成 8 级卡车在这些具有挑战性的场景中的轨迹。在适应阶段,我们使用 NVIDIA 的 Alpamayo 1.5 作为基础模型,仅在数百个真实建筑和事故相关的高速公路场景中微调其动作生成堆栈。在转向阶段,我们引入流速转向(FVS)以进一步细化模型的预测,同时保持调整后的 VLA 固定。 FVS 是一个紧凑的、流时间调节的残差模块,它向动作空间流速添加学习修正,用于更新每个生成步骤的动作序列。在对场景不相交的保留集进行开环评估时,与基本模型相比,在整个 6.4 秒范围内进行有针对性的微调,使单候选平均位移误差 (ADE) 和最终位移误差 (FDE) 减少一半以上。使用相同的针对性演示,FVS 进一步将微调模型的全视野 ADE 和 FDE 分别降低了 13.9% 和 16.5%。在匹配的数据预算下,有针对性的监管产生的全视野 ADE 比一般卡车驾驶监管低 19-26%,而目标模型与在大约 65 倍的一般卡车驾驶场景上进行微调的模型相比仍然具有竞争力。这些结果支持先适应后转向,以将数据高效的车辆域传输到 8 级卡车。我们的项目网站位于 https://truckvla.github.io.