论文
HiRAE:具有剩余预算的分层表示自动编码
HiRAE: Hierarchical Representation Autoencoding with Residual Budgets
摘要
预训练的视觉表示支持图像生成,但可能无法完全保留忠实重建所需的细粒度细节。同时,中间编码器层包含互补的视觉细节,但学习融合它们进行重建可能会产生难以建模的潜在分布。现有的融合方法需要根据经验调整层选择或融合和解码的分阶段优化,从而增加配置工作量或训练复杂性。我们引入了 HiRAE(分层表示自动编码器),它在整个编码器层次上学习分层融合框架,以提高重建保真度,同时保持与生成建模的兼容性。 HiRAE 按深度对编码器层进行分组,并学习对最深表示的残差校正。分组标准上限限制了相对于深层锚定的这些修正,浅层分组的预算更紧。我们的 HiRAE-24 保留了潜在词元计数和通道维度。在 ImageNet-256 上,相对于 RAEv2,HiRAE-24 将重建 FID 从 0.299 降低到 0.209,同时保持有竞争力的引导生成质量。对于文本到图像的生成,HiRAE-24 在监督微调之前和之后都改进了 GenEval、DPG-Bench 和 GenAI-Bench 上的 RAEv2 对齐。在相同的生成器训练和评估协议下,微调后的 GenEval 从 84.86 增加到 87.70。