论文

4DThinker:用 4D 图像思考动态空间理解

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

模型训练监督微调与指令调优

摘要

单目视频的动态空间推理对于连接视觉智能和物理世界至关重要,但对于视觉语言模型 (VLM) 来说仍然具有挑战性。先前的方法要么将时空推理完全表述为文本,这对于复杂的动力学来说本质上是冗长且不精确的,要么依赖外部几何模块来增加推理复杂性而不培养内在的模型能力。在本文中,我们提出了 4DThinker,这是第一个使 VLM 通过动态潜在心理意象“用 4D 思考”的框架,即内部模拟场景如何在连续隐藏空间内演变。具体来说,我们首先引入一个可扩展、无注释的数据生成管道,该管道从原始视频合成 4D 推理数据。然后,我们提出 Dynamic-Imagery 微调 (DIFT),它联合监督文本标记和 4D 潜在变量,以动态视觉语义为模型奠定基础。在此基础上,4D 强化学习 (4DRL) 通过基于结果的奖励进一步处理复杂的推理任务,将策略梯度限制在文本标记上以确保稳定的优化。跨多个动态空间推理基准的大量实验表明,4DThinker 始终优于强大的基线,并为 VLM 中的 4D 推理提供了新的视角。我们的代码可在 https://github.com/zhangquanchen/4DThinker 获取。