论文
VLADriver-RAG:自动驾驶的检索增强视觉-语言-动作模型
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
摘要
视觉-语言-动作(VLA)模型已成为端到端自动驾驶的一种有前途的范例,但它们对隐式参数知识的依赖限制了长尾场景中的泛化。虽然检索增强生成(RAG)通过访问外部专家先验提供了解决方案,但标准视觉检索存在高延迟和语义模糊的问题。为了应对这些挑战,我们提出了 \textbf{VLADriver-RAG},一个将规划建立在明确的、结构感知的历史知识基础上的框架。具体来说,我们通过 \textit{Visual-to-Scenario} 机制将感官输入抽象为时空语义图,有效过滤视觉噪声。为了确保检索相关性,我们采用 \textit{场景对齐嵌入模型},该模型利用 Graph-DTW 度量对齐来优先考虑内在拓扑一致性而不是表面视觉相似性。然后将这些检索到的先验融合到基于查询的 VLA 主干中,以合成精确的、解开的轨迹。 Bench2Drive 基准测试的大量实验建立了新的最先进水平,驾驶得分达到 89.12。