论文

DH-VLM:自动驾驶的双视野协作潜在推理

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

智能体系统Agent 协作

摘要

自动驾驶的大规模语言模型可以增强全球理解和长期规划。然而,当部署在孤立的车辆中时,有限的传感范围和遮挡限制了可靠的决策,并且大量的计算和延迟开销使得车载部署不切实际。协同驾驶通过利用外部代理进行信息交换提供了潜在的解决方案,但现有方法在实际约束下语义推理能力仍然有限。为了应对这些挑战,我们提出了 DH-VLM,这是一种双视野合作潜在推理框架,可实现基础设施和自我车辆之间的不对称语义合作。基础设施聚合多层隐藏状态,形成全局推理水平潜在指导,通过基础设施驱动的潜在进化机制将其集成到自我模型中,以进行条件潜在细化。这使得自我车辆能够利用远程上下文理解,同时在其本地规划范围内保留自主决策。此外,我们构建了一个面向合作的问答(QA)数据集,涵盖基本场景理解和自我个性化理解,以支持反事实和安全意识推理。大量实验表明,DH-VLM 实现了最先进的规划性能,L2 错误率比之前的最先进技术高出 14.6%,碰撞率高出 26.9%。与基于查询的端到端协同驾驶方法相比,我们的方法降低了57.3%的通信成本和25.5%的GPU内存使用量,同时保持了针对基础设施引导错误的强大鲁棒性,为协同自动驾驶提供了实用且鲁棒的范例。