论文

超越最后一层:视觉标记化的多层表示融合

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

模型架构新型架构

摘要

将冻结的预训练视觉编码器重新用作视觉分词器的表示自动编码器已经实现了强大的重建和生成质量。然而,现有的方法普遍只从最后一个编码器层提取特征,丢弃了分布在中间层的丰富的层次信息。我们表明,低级视觉细节仅作为多层语义抽象后的衰减残差保留在最后一层,并且显式融合多层特征可以基本上恢复这些丢失的信息。我们提出了 DRoRAE(深度路由表示自动编码器),这是一种轻量级融合模块,它通过能量约束路由和增量校正自适应地聚合所有编码器层,产生与冻结的预训练解码器兼容的丰富潜在层。三相解耦训练策略首先在冻结解码器的隐式分布约束下学习融合,然后微调解码器以充分利用丰富的表示。在 ImageNet-256 上,DRoRAE 将 rFID 从 0.57 降低到 0.29,并将生成 FID 从 1.74 提高到 1.65(使用 AutoGuidance),增益也转移到文本到图像合成。此外,我们发现了融合能力和重建质量之间的对数线性缩放定律($R^2{=}0.86$),将 \textit{表示丰富度} 识别为视觉分词器的新的、可预测的可扩展维度,类似于 NLP 中的词汇量。