论文
更少的语言,更多的潜在:用于驾驶的高效注释 VLA
Less Language, More Latents: Annotation-Efficient VLAs for Driving
摘要
视觉语言动作模型(VLA)有望实现人类可操纵的自动驾驶,但其训练因缺乏与自然语言指令配对的帧而受到瓶颈:虽然摄像头流和专家轨迹被大规模记录,但语言注释(例如,在十字路口左转)仍然稀缺且获取成本昂贵。为了应对这一挑战,我们引入了潜在动作驱动注释(LADA),这是一个三阶段管道,可将大量未标记的观察轨迹对转换为语言条件控制的基础。首先,我们训练具有矢量量化瓶颈的潜在动作模型,生成高级车辆意图的紧凑密码本。其次,使用一个小的语言注释子集来训练视觉语言翻译器,将观察结果和语言指令映射到该密码本中。第三,我们在完整的未标记语料库上训练观察-潜在动作对的驱动 VLA。使用不到 5% 的语言注释,并且不利用任何辅助的思维链推理或视觉问答流,LADA 在闭环 Bench2Drive 基准上获得了 87.98 的驾驶分数和 70.46% 的成功率,匹配或超越了完全监督的基线。