论文

实现跨驱动 VLA 的实施例的零射击传输

Towards Zero-Shot Transfer Across Embodiments For Driving VLAs

摘要

视觉-语言-动作模型 (VLA) 通过利用多模态预训练进行指令跟踪、视觉推理和场景级泛化,在自动驾驶方面显示出强大的潜力。在机器人操作中,跨多个机器人设置缩放 VLA 微调(尤其是在统一跨实施例的表示时)已被证明可以提高数据集内的性能和跨实施例的泛化能力;然而,在自动驾驶中,VLA 仍然主要在单个数据集上进行训练,并且很少评估零镜头传输到未见过的数据集和摄像头设备的情况;此外,天真地将更多数据集添加到训练数据并不一定会导致所见实施例中更好的性能。为了解决这些问题,我们研究了驾驶任务和 BEV-Forcing 的多数据集训练,BEV-Forcing 是一种辅助目标,可将地平面对象布局信息从专门的鸟瞰图模型传输到 VLA 主干。通过鼓励模型通过共享 BEV 空间接口表示对象位置,我们表明,在少量相机装备上进行训练时,BEV-Forcing 等辅助任务可以提高分布内和分布外性能。然而,随着训练实施例数量的增加,辅助任务的好处就会减少;我们将此作为证据表明,当简单地扩大训练多样性时,文献中的新技术可能会发现其好处会减弱,这会促使在考虑数据扩展的情况下呈现结果。