论文
基于VLA的端到端自动驾驶的多模态协作交互
A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving
摘要
视觉-语言-动作(VLA)模型通过在统一的多模式框架内联合集成感知、推理和决策,已成为端到端自动驾驶的强大范例。然而,大多数现有的 VLA 模型将端到端自动驾驶制定为视觉问答任务,导致决策推理不可靠且难以解释。此外,它们无法跨异构传感器建立有效的多模态交互,从而限制了长尾驾驶场景中鲁棒的场景感知和可靠的驾驶推理。为此,我们提出了一种强大的基于VLA的端到端自动驾驶系统,该系统将多模态交互与多轨迹规划和优化相结合,从而实现更可靠、可解释和更安全的驾驶决策。我们的方法包括三个核心组成部分:(1)用于主辅助模态双向交互的亲和力引导最优传输; (2) 分布一致模态传输,用于异构模态分布传输和跨模态交互; (3)多模态多轨迹规划以及面向感知的轨迹细化,以针对长尾驾驶场景提供更好的驾驶决策。开环和闭环数据集的实验结果表明,与现有驾驶系统相比,安全长视野驾驶推理和道路场景感知方面有所改进,突出了我们针对可扩展的基于 VLA 的系统的多模态交互以及多轨迹规划和优化的能力。