论文

Inter-3D VQA:3D 时空视觉问答的路边多模态基准

Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering

模型评测基准与评测资源

摘要

视觉问答 (VQA) 和多模态 大语言模型 (MLLM) 的最新进展使得能够对交通场景进行自然语言推理。然而,现有的基准测试主要是根据自我车辆视图或 2D 路边视频构建的,限制了它们评估现实世界距离、轨迹、基础设施拓扑和安全关键交互的 3D 推理的能力。我们推出 Inter-3D VQA,这是一种用于交叉口 3D 基于三维时空证据的推理 VQA 的大型路边多模式基准。 Inter-3D VQA 由同步点云和多视图图像构建而成,包含 407K 个 QA 对,涵盖车道级位置、对象关系、运动模式和面向未遂事件的交互推理。我们进一步提出了 Inter-Geo(一种集成了对象级和场景级对齐 LiDAR 表示的 MLLM 基线)和 Inter-Metrics(一种用于文本一致性、数值准确性和语义正确性的统一评估框架)。实验表明,Inter-Geo 的性能优于基于图像的 VLM,尤其是在基于空间和时间的推理任务上。我们的基准测试和代码可在 https://github.com/ASU-Suo-Lab/Inter-3D-VQA 获取。