论文
UniDrive:用于自动驾驶中可解释风险理解的统一视觉语言和视觉定位框架
UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving
摘要
最近的多模态 大语言模型 (MLLM) 在自动驾驶场景理解方面显示出强大的潜力,但现有方法仍然面临时间推理和空间精度之间的基本权衡。依赖单帧或低分辨率输入的模型经常会错过小的、遥远的或部分遮挡的危险,而以语言为中心的驾驶模型经常为其解释提供有限的依据证据。为了解决这一差距,我们提出了 UniDrive,这是一种统一的视觉语言和视觉定位框架,用于理解自动驾驶中的可解释风险。 UniDrive 将时间推理分支与高分辨率感知分支相结合,该分支可根据多帧视觉输入对场景动态进行建模,该高分辨率感知分支可保留最新帧的细粒度空间细节。这两个分支通过门控交叉注意力融合模块进行集成,使动态上下文与精确的空间证据保持一致。基于融合表示,UniDrive 联合生成自然语言风险描述和风险对象定位框输出。 DRAMA-Reasoning 基准测试表明,UniDrive 在场景描述和风险对象定位方面均优于基于图像和基于视频的代表性基线。特别是,UniDrive 在验证分割上实现了最佳的整体性能,并在小对象定位、NuScenes 和 BDD100K 的零样本泛化以及人类评级的可解释性和可信度方面表现出明显的优势。这些结果表明,明确地结合时间语义和高分辨率感知为可解释和面向安全的自动驾驶系统提供了更坚实的基础。该代码可从 https://github.com/pixeli99/unidrive-dev 获取。