论文

通过时间冗余掩蔽和潜在修复的自适应标记化

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

模型优化稀疏化

摘要

自适应视频标记化旨在根据序列的底层视觉复杂性动态分配 词元预算。当前的连续机制方法通过迭代二值化搜索或训练的神经回归器来实现这一点,而离散方法通常需要全速率解码器传递来估计信息内容。我们证明这种计算开销并不是绝对必要的。我们表明,冻结连续视频标记器的潜在空间本质上编码了可以直接利用的时间冗余:其潜在表示在连续帧之间变化最小的空间位置携带接近零的附加信息。我们引入了一种无参数自适应词元分配机制,该机制对每个位置的时间 L1 差异应用固定阈值,识别并删除冗余的潜在位置。因此,压缩率自然地从输入内容中产生,而不是自上而下强制执行:静态场景被积极压缩,而高度动态的序列保留更多标记。为了重建丢失的位置,我们提出了潜在修复 Transformer (LIT),一种轻量级分解的时空注意力架构。由此产生的推理管道非常高效,只需要一次编码器传递和一次 LIT 前向传递,从而无需辅助路由网络。对 TokenBench 和 DAVIS(最近 tokenisers 使用的标准基准)的评估表明,我们的框架在保持竞争性重建保真度的同时,产生了有意义的、内容驱动的词元分配,并在连续自适应基线(ElasticTok-CV)上提供了 31\times$ 的推理时间加速,在离散信息理论基线上提供了 $\approx2\times$ 的加速(信息托克)。