论文

VideoTok4D:用于紧凑世界表示的 4D 感知视频标记器

VideoTok4D: A 4D-Aware Video Tokenizer for Compact World Representation

模型架构新型架构

摘要

视频分词器已成为现代视频建模的基石,通过将高维视觉信号映射到紧凑的潜在空间来支撑压缩、重建和生成方面的进展。然而,尽管取得了这些进展,当前的标记化范式很大程度上仍停留在 2D 视觉领域,将视频视为图像序列,而不是对底层动态 3D 世界的观察。因此,学习到的 token 继承了这种以观察为中心的偏差,限制了它们紧凑地表示现实世界 4D 场景的能力。为了缓解这个问题,我们提出了 VideoTok4D,一种新颖的 4D 感知视频标记器,用于紧凑的世界表示。具体来说,我们的方法包括三个关键设计:1)时空解缠策略,将视频分解为静态和动态标记,以进行整体世界建模; 2)轨迹感知动态注意机制,聚合轨迹对齐线索以促进跨视图运动一致性; 3) Co4DGen,是在生成的 VideoTok4D 词元空间上先学习的扩散,用于高效的 4D 场景生成。大量实验表明,我们提出的方法实现了最先进的性能,同时所需的存储空间比密集 4D 表示少了 4 个数量级。此外,紧凑的词元空间大大缩短了扩散序列,从而实现了高效的生成。