论文

WinTok:以可迁移词元分离视觉理解与生成的混合编码器

WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

摘要

构建统一的视觉分词器对于弥合视觉理解和生成之间的差距至关重要。然而,现有的方法很难解决这些任务之间的固有冲突,因为单个标记空间被迫支持高级语义抽象和低级像素重建。我们提出了 WinTok,一种简洁的混合分词器,通过显式解耦两个目标来实现双赢的性能。 WinTok 用一组可学习的语义标记来补充像素标记,有效地减轻跨任务干扰,而不会产生双标记器的计算开销。为了进一步增强理解能力,我们引入了非对称词元 蒸馏 机制:语义词元由来自任何视觉基础模型的预训练语义嵌入引导,使它们能够继承强大的判别力,同时保持灵活性。在 10 个具有挑战性的基准测试中,WinTok 在重建、理解和生成方面提供了持续的改进。尽管使用的训练数据少得多,但仅使用 50M 开源数据进行训练,WinTok 在分类准确度方面超越了强大的基线 UniTok 11.2%,并实现了 0.41 的有竞争力的重建 rFID。代码发布于 https://github.com/markywg/WinTok。