论文

QuadTok:面向自回归图像生成的四叉树视觉Tokenizer

QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

模型架构模型优化应用与实践新型架构稀疏化内容创作

摘要

我们介绍 QuadTok,这是一种用于视觉标记化和自回归图像生成的新颖框架。与使用 2D 网格或 1D Token序列的传统方法相比,我们提出了一种分层四叉树结构,弥合了 2D 空间绑定和 1D 序列级灵活性之间的差距。 QuadTok 分词器动态地将表征能力分配给视觉上复杂的区域,同时以粗分辨率保留同质区域。与固定的 256 个Token网格相比,我们的 ImageNet 训练Token生成器在 ImageNet 上节省了大约 10% 的Token,在零样本传输到 COCO 数据集时节省了 9%,同时保持了相当的重建保真度。此外,树结构引入的自然因果关系无缝地实现了自回归图像生成。以生成前提供的四叉树拓扑为条件,我们的 947M GPT 式生成模型在 ImageNet $256 × 256$ 基准上实现了 2.08 gFID。此外,利用四叉树结构保留的强空间相关性,QuadTok 生成器可以实现零样本 空间控制的图像生成能力。代码:https://github.com/myc634/QuadTok。

QuadTok:面向自回归图像生成的四叉树视觉Tokenizer:论文原图
图 2:(a) QuadTok 概述。通过广度优先遍历将图像从四叉树序列化为一维标记序列。 ViT 特征被聚合成四叉树标记,并进行量化和分层解码。 (b)分层解码。粗略Token恢复全局结构;精Token细化地方区域。 (c) 区域复杂性指南。互补探测树估计每个区域的重建效益,以构建内容自适应四叉树。