论文
TrackCraft3R:重新利用视频扩散 Transformer 进行密集 3D 跟踪
TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking
摘要
单目视频的密集 3D 跟踪是动态场景理解的基础。虽然最近的 3D 基础模型提供了可靠的每帧几何结构,但恢复该几何结构中的对象运动仍然具有挑战性,并且可以从从现实世界视频中学到的强运动先验中受益。现有的 3D 跟踪器要么遵循在合成数据上从头开始训练的迭代范例,要么微调从静态多视图图像中学习的 3D 重建模型,两者都缺乏真实世界的运动先验。预训练的视频扩散 Transformer(视频 DiT)提供来自互联网规模视频的丰富时空先验,使它们成为 3D 跟踪的有前途的基础。然而,他们生成每个帧内容的帧锚定公式从根本上与参考锚定密集 3D 跟踪不匹配,后者必须随时间跟踪来自参考帧的相同物理点。我们提出了 TrackCraft3R,这是第一种将视频 DiT 重新用作前馈密集 3D 跟踪器的方法。给定单目视频及其帧锚定重建点图,TrackCraft3R 会预测一个参考锚定跟踪点图,该点图在单次前向传递中随时间推移跟踪第一帧的每个像素及其可见性。我们通过两种设计实现这一点:(i)双潜在表示,使用每帧几何潜在和参考锚定轨道潜在作为密集查询,以及(ii)时间 RoPE 对齐,它指定每个轨道潜在的目标时间戳。这些设计共同将视频 DiT 的每帧生成范例转换为 LoRA 微调 的参考锚定跟踪公式。 TrackCraft3R 在标准稀疏和密集 3D 跟踪基准测试中实现了最先进的性能,同时与之前最强的方法相比,运行速度提高了 1.3 倍,峰值内存使用量减少了 4.6 倍。我们进一步证明了对大动作和长视频的鲁棒性。