论文
LMM-Track4D:通过基于轨迹的对话在 LMM 中引发 4D 动态推理
LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue
摘要
最近的大型多模态模型 (LMM) 在图像和视频理解方面的能力越来越强,但仍难以维持 4D 连续时空动态推理。为了研究这种能力差距,我们制定了基于轨迹的多轮时空对话,这是一项新任务,其中模型必须回答时空查询,同时返回整个短剪辑或较长剪辑的指定片段上的结构化 3D 目标轨迹,并引入 Track4D-Bench,这是一个基准测试,包含跨越 23.5k 帧和 7.5k 对象注释的 526 个剪辑级对话样本,用于训练和评估。在此任务的基础上,我们提出了 LMM-Track4D,它结合了 RTGE(光线时间几何编码)、用于长视野动态传播的专用流状态词元 TRK 和对象槽运动学残差锚点 (OSK-RA) 解码器,用于在遮挡和视点变化下进行稳定的 4 步 3D 状态估计。 Track4D-Bench 上的实验显示了相对于强基线的一致改进,这表明显式动态建模是在 LMM 中引发 4D 动态推理的有用设计原则。我们的代码和数据集将在 https://github.com/mikubaka88/LMM-Track4D 上公开提供。