论文

TivTok:广播用于可扩展视频标记化的时间不变标记

TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

模型架构Transformer

摘要

视频标记化是可扩展视频生成的基础,因为标记的数量直接决定了计算成本和可以建模的视频长度。现有的标记器主要通过将视频压缩为更少的标记来提高可扩展性,但它们通常会继续跨帧和块重复表示持久内容,例如静态背景和一致的对象外观。在本文中,我们提出了 \textbf{TivTok} (\textit{Time-Invariant Tokenizer}),这是一种具有重用意识的视频分词器,可以使持久信息可以跨时间重用。 TivTok 表示具有对跨帧共享的信息进行编码的时不变 (TIV) 标记和对特定于帧的残差进行编码的时变 (TV) 标记的剪辑。为了获得这种分解,我们引入了范围诱导分解(SIF),它将不同的注意力范围分配给两个词元组:TIV词元对整个片段计算注意力,而每个TV词元仅与TIV词元一起访问其相应的帧。在解码器中,不变广播 (IB) 跨帧和块重复使用相同的 TIV 标记,以进行并行重建和长视频标记化。实验表明,与评估的基线相比,TivTok 在标准 $16{\times}256{\times}256$ 基准上实现了 12.65 的 rFVD,并将 128 帧视频的压缩效率提高了 2.91$\times$,而在我们的评估中仅使用基于下采样的标记器所需的 1.1\% 的标记。