论文
CL4D:动态场景中视觉语言推理的对比语言 4D 预训练
CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes
摘要
4D 理解和推理是在动态物理环境中运行的具体人工智能代理的基本能力。然而,现有的视觉编码器很大程度上仅限于没有时间建模的静态 2D 图像或 3D 点云,或者缺乏精确几何深度推理的 2D 视频。因此,当前的方法无法联合捕获动态场景中的空间结构和运动演化。我们推出了 CL4D,这是第一个直接在动态点云上运行的基础 4D 视觉编码器,通过对比学习目标进行训练,以将时空几何表示与自然语言描述对齐。通过学习文本和 4D 场景动态之间的共享嵌入空间,CL4D 可在动态环境中实现零镜头运动到文本和文本到运动检索,并充当下游 4D 视觉语言任务的基础 4D 视觉编码器。在此编码器的基础上,我们引入了 4DVLM,这是一种 4D 视觉语言模型,可根据动态几何表示来生成语言。 4DVLM 是第一个设计为直接在 4D 点云上运行而不依赖 2D 图像、2D 视频或静态 3D 点云的 VLM。我们在一个新构建的数据集(称为 DynAction4D)上训练 CL4D 和随后的 4DVLM,该数据集捕获不同对象交互和场景环境中的不同人体运动。跨多个 4D 人类动作基准的大量实验表明,CL4D 实现了最先进的性能,比之前的方法提高了约 16.75%。此外,4DVLM 的性能优于 Gemini 和 GPT-5 等前沿视频 VLM,即使这些模型提供了与 4DVLM 的 4D 点云表示的相同场景相对应的 RGB 视频序列。