论文

4DP-QA:视觉语言模型中 4D 感知的可扩展 QA

4DP-QA: Scalable QA for 4D Perception in Vision Language Models

模型训练合成数据

摘要

尽管最近取得了进展,视觉语言模型(VLM)仍然难以掌握世界的动态。我们注意到,推理 4D 场景的能力本身就具有挑战性,但由于两个因素而变得更加复杂。首先,VLM 通过投影到 2D 图像上来间接观察运动。其次,现有数据集无法理清物体和相机运动的关系。为了应对这些挑战,我们提出了一个专注于运动相关场景理解的 QA 生成流程。我们通过以传统方式和新颖的固定参考系统(称为真实运动跟踪)进行跟踪来特别关注相机和物体运动的纠缠,​​该系统提供了对运动的直观描述。从这个管道中,我们生成了包含 400K 样本的大规模训练数据集、4DP-QA(4D Perception QA)和 2.2K 样本基准测试 4DP-QA-Bench。在我们的数据集上训练现有模型可以提高外部基准的性能,验证我们方法的有效性。