论文
SemanTok:用于高效自回归视频生成的可预测语义标记
SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation
摘要
最近基于视频的世界模型将自回归 (AR) 预测的可扩展性与扩散模型的视觉质量结合起来。场景分词器的选择对于其中每一个的最佳性能至关重要,无论是在保真度还是语义方面。长度灵活、从粗到细的分词器产生的结果正是:第一个粗分词携带剪辑的全局语义,而后面的分词进一步指定细节。现有的灵活分词器仅在早期解码器隐藏状态上应用表示对齐(REPA)损失,解码器可以通过其噪声输入部分满足目标。我们引入了 SemanTok,这是一种灵活的视频分词器,它将冻结的 DINO 特征输入到其编码器中,并添加轻量级头,仅根据每个保留的分词前缀来重建它们。 SemanTok 在每种 AR 模型尺寸上都实现了高语义对齐和视频保真度:201M SemanTok AR 模型与 VideoFlexTok AR 模型 $3.4\times$ 的尺寸相匹配或优于其尺寸,而更大的 SemanTok AR 模型进一步提高了保真度。它保持分布外类的语义对齐,并为解码器在每个噪声级别(包括纯噪声)提供更高的语义对齐。它在重建和生成方面都表现良好,并且其短标记前缀的预测成本更低,并提供更好的生成保真度,像素细节推迟到后续标记。