论文

D3VL:使用语言模型从 3D 时间序列数据和视频中理解驾驶场景

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

应用与实践视觉感知与空间理解

摘要

多模式 大语言模型 (MLLM) 的最新进展引发了自动驾驶端到端 MLLM 的开发。然而,迄今为止的主要重点是使用 2D 图像和视频的 MLLM。相比之下,本文考虑了使用 3D 传感器(特别是 LiDAR 和立体相机)的 MLLM 有效性。 LiDAR 对 MLLM 内的集成提出了独特的挑战,主要是因为数据稀疏且缺乏数据网格结构。出于类似的原因,MLLM 管道中相机和 LiDAR 数据的融合也不常见。然而,大多数自主系统依赖于基于 LiDAR 的传感,并且合并 3D 数据已被证明可以提高传统 3D 场景感知任务的性能。本文介绍了 D3VL,这是一种新颖的 MLLM 框架,它将 2D 和 3D 时间序列数据集成在一个简单但简单的架构中。该模型旨在回答涉及交通场景理解和安全的问题。与处理 2D 和 3D 时间序列数据的基线方法相比,D3VL 在 KITTI 问答 (QA) 数据集中显示出 11% 的改进。本文进一步介绍了 Waymo QA 数据集扩展,该扩展可评估模型在不同驾驶条件下处理 3D 和时间序列数据的能力。 D3VL 实现代码和 WaymoQA 扩展可以在我们的补充网站上找到:https://automotivesafety-lvlm.github.io