论文
D3VL:使用语言模型从 3D 时间序列数据和视频中理解驾驶场景
D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models
摘要
多模式 大语言模型 (MLLM) 的最新进展引发了自动驾驶端到端 MLLM 的开发。然而,迄今为止的主要重点是使用 2D 图像和视频的 MLLM。相比之下,本文考虑了使用 3D 传感器(特别是 LiDAR 和立体相机)的 MLLM 有效性。 LiDAR 对 MLLM 内的集成提出了独特的挑战,主要是因为数据稀疏且缺乏数据网格结构。出于类似的原因,MLLM 管道中相机和 LiDAR 数据的融合也不常见。然而,大多数自主系统依赖于基于 LiDAR 的传感,并且合并 3D 数据已被证明可以提高传统 3D 场景感知任务的性能。本文介绍了 D3VL,这是一种新颖的 MLLM 框架,它将 2D 和 3D 时间序列数据集成在一个简单但简单的架构中。该模型旨在回答涉及交通场景理解和安全的问题。与处理 2D 和 3D 时间序列数据的基线方法相比,D3VL 在 KITTI 问答 (QA) 数据集中显示出 11% 的改进。本文进一步介绍了 Waymo QA 数据集扩展,该扩展可评估模型在不同驾驶条件下处理 3D 和时间序列数据的能力。 D3VL 实现代码和 WaymoQA 扩展可以在我们的补充网站上找到:https://automotivesafety-lvlm.github.io