论文

DecQ:用于增强表示自动编码器重建和生成的细节压缩查询

DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders

应用与实践内容创作

摘要

表示自动编码器 (RAE) 利用冻结视觉基础模型 (VFM) 作为分词器编码器,提供强大的高级表示,促进潜在扩散模型的快速收敛和高质量生成。然而,冻结VFM本质上限制了其空间重建能力,限制了细粒度的生成和图像编辑;相反,通过 微调 合并面向重建的信号会破坏预先训练的语义空间并降低生成保真度。为了解决这种权衡问题,我们提出了 DecQ,一个简单而有效的 RAE 框架。具体来说,DecQ 引入了轻量级细节压缩查询,通过压缩器模块从中间 VFM 特征中提取细粒度信息。这些查询被合并到解码器中以支持重建,并在生成建模期间与补丁标记联合生成。通过聚合浅层和深层的信息,DecQ 有效地减轻了重建与生成的权衡,提高了重建质量和生成性能。我们的实验表明:(1)仅需要 8 个额外查询和 3.9% 的额外计算,DecQ 就可以改进基于冻结 DINOv2 的 RAE 的重建,将 PSNR 从 19.13 dB 增加到 22.76 dB; (2) 对于生成建模,DecQ 的收敛速度比 RAE 快 3.3 倍,在没有指导的情况下达到 1.41 的 FID,在有指导的情况下达到 1.05。