论文

4DVLT:通过以世界线为中心的视觉语言跟踪进行动态场景理解

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

模型评测基准与评测资源

摘要

4D 动态场景理解需要将语言与持久世界线结合起来,将身份、度量 3D 运动和同步多视图 2D 投影结合起来。现有的范式仅捕获了这种结构的一部分:大型多模态模型对丰富的视觉证据进行推理,但很少保留度量拓扑,而视觉语言跟踪仍然与分散的 2D 或 3D 输出和局部延续相关。因此,我们引入了 \textbf{4DVLT},一个以世界线为中心的任务,用于在完全观察的多视图视频中进行指令条件的 4D 动态场景理解,以及 \textbf{Instruct-4D},一个包含 129.4K 问答对、64.7K 目标实体、851 个场景和 9 种面向推理的查询类型的基准。为了解决这个问题,我们提出了 \textbf{4DTrack},它通过以对象为中心的 4D 状态图、度量引导路由、双向解码和运动学校准,将指令条件跟踪转换为图条件世界线推理。在 Instruct-4D 上,4DTrack-Qwen3.5-9B 达到 62.68 $\mathrm{TGA}_{\mathrm{Top1}}$,超过最佳适应的 VLT 基线 19.62 点。这些结果表明,以世界线为中心的建模提高了目标落地和恢复的世界线质量。该项目页面位于 https://github.com/mikubaka88/4DVLT。