论文
通过引导标记化平衡图像压缩和生成
Balancing Image Compression and Generation with Bootstrapped Tokenization
摘要
尽管图像标记化取得了进展,但标准方法通过混合每个标记内的所有粒度来编码冗余信息,因此标记之间仍然存在冗余。不同粒度信息的混合也使生成器的训练变得复杂。本文介绍了 SelfBootTok,这是一种通过将信息干净地分解为全局和本地词元组来解决此问题的方法。通过自引导学习,该模型仅根据全局标记预测局部细节,将视觉细节的负担从生成器转移到标记器。因此,我们的生成器效率更高,仅需要全局词元并将计算量减少约 40%,同时提供卓越的重建和生成。此外,这种范式可以优雅地扩展:通过利用更多数据或参数来自我监督本地表示学习,SelfBootTok 仅使用 64 个词元就实现了新的最先进的 gFID 分数 1.56。