论文
InsightTok:提高自回归图像生成的离散标记化中的文本和面部保真度
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
摘要
文本和面部是视觉生成中感知上最显着且实际上最重要的模式之一,但对于基于离散标记化的自回归生成器来说,它们仍然具有挑战性。一个中心瓶颈是分词器:激进的下采样和量化通常会丢弃保留可读字形和独特面部特征所需的细粒度结构。我们将这一差距归因于标准离散分词器目标与文本易读性和面部保真度的一致性较弱,因为这些目标通常会优化通用重建,同时统一压缩不同的内容。为了解决这个问题,我们提出了 InsightTok,这是一个简单而有效的离散视觉标记化框架,它通过局部的、内容感知的感知损失来增强文本和面部保真度。凭借紧凑的 16k 码本和 16 倍下采样率,InsightTok 在文本和面部重建方面显着优于先前的分词器,而不会影响总模型权重建质量。这些成果持续转移到 InsightAR 中的自回归图像生成,生成具有更清晰文本和更忠实面部细节的图像。总的来说,我们的结果凸显了分词器训练中专门监督对于推进离散图像生成的潜力。