论文

DriveVLA-M0:用于自动驾驶的故障感知内存增强

DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving

上下文与知识记忆Agent记忆

摘要

视觉-语言-动作(VLA)模型最近已成为端到端自动驾驶的一种有前途的范例,它支持跨感知、语言和规划的统一推理。然而,现有方法缺乏利用过去失败或适应分布变化的机制,导致模型在以前失败的类似场景中持续表现不佳。在本文中,我们提出了 DriveVLA-M0,一种具有故障感知潜在内存的检索增强 VLA。我们构建了一个潜在内存池,用于存储故障案例及其结构场景表示和专家轨迹标签,并设计了一个专用的检索模型,该模型将静态道路结构和动态代理交互解耦,以实现结构性检索。在推理时,检索到的案例通过基于 LoRA 的轻量级解耦测试时训练 (TTT) 机制注入模型中,从而无需修改主干网即可进行有针对性的和特定于场景的校正。对 NAVSIMv1 和 NAVSIMv2 基准的大量实验表明,我们的方法始终优于先前的方法,在 Navtest 上实现 94.1 PDMS,在 Navhard 上实现 47.0 EPDMS,而 TTT 后向延迟开销仅为 26.44 ms。此外,我们还表明 DriveVLA-M0 可通过额外内存进行有效扩展,从而通过内存扩展实现 无需训练 性能提升。该代码可从 https://github.com/ZebinX/DriveVLA-M0 获取。