论文
后见之明和先见之明:自动驾驶分层内存的基于工具的协同推理
Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving
摘要
VLM 已显示出自动驾驶的前景,但仍然存在幻觉、时空感知能力弱和泛化能力有限的问题。最近的方法通过 CoT 解释、检索增强生成或工具输出的静态注入来改进推理和决策。虽然这些机制丰富了上下文,但模型既没有主动感知场景信息,也没有在回答后积累经验。为了克服这些限制,据我们所知,我们提出了第一个协同框架,它将分层内存与封闭推理循环中的主动工具调用紧密耦合。我们的贡献是三重的。 (i)分层驾驶记忆:场景级短期记忆维持动态场景状态,不断发展的长期记忆检索可重用的经验和工具策略。 (ii)记忆工具协同推理框架:在场景状态和检索经验的指导下,模型在推理时自适应地调用工具来完善其推理,并将可重用的经验整合到离线的长期记忆池中。 (iii) 数据生成和两阶段训练管道:通过多步骤教师轨迹采样构建的经过验证的记忆工具轨迹用于使用 SFT 和 GRPO 进行训练。我们的 7B 模型在 DriveLMM-o1 上的整体推理得分为 80.03,MCQ 准确度为 79.09%,比最强基线高出 7.74 MCQ 分,并且在基准测试中具有很强的泛化能力。值得注意的是,消融和分析研究验证了每个组件的有效性,并进一步揭示了分层记忆的互补作用。短期记忆增强了时空理解,将 STSBench 准确率提高了 24.2 点,而离线长期记忆巩固则在所有参数冻结的情况下额外获得了 3.57 点的 MCQ 增益,展示了通过积累的驾驶经验不断自我进化。