论文

从像素出发、无需预训练:同一模型中的生成与自监督表示学习

From Pixels, Without Pre-training: Joint Generative and Self-Supervised Representation Learning in One Model

模型训练预训练

摘要

强大的图像生成模型以类标签为条件,与冻结的预训练编码器对齐,或构建在单独训练的自动编码器上。虽然有效,但生成取决于监督或预训练:必须对标签进行注释,并针对目标域对编码器或自动编码器进行预训练。我们在单个模型中研究联合生成和自监督表示学习,从而实现无需标签或预训练模型的自调节生成。这是具有挑战性的,因为目标不匹配:对比学习消耗干净的增强视图并有利于粗粒度、稳定的语义,而流匹配消耗噪声图像并且必须保留对比学习丢弃的精细细节和空间布局。我们提出 SCION(自监督表示的自条件生成),其核心是一个以流时间步长和嵌入为条件的单个像素空间编码器。对于表示学习,这种条件嵌入是跨图像共享的学习全局向量,编码器的 [CLS] token 产生通过对比损失训练的语义表示。对于生成式训练,条件嵌入是图像自己的 [CLS] 表示,而补丁 token 通过解码器来预测图像。为了在推理时没有参考图像的情况下进行采样,我们共同学习嵌入的先验。 梯度范数平衡和停止梯度机制可在一次运行中实现联合优化。 SCION 是自我监督和独立的,没有标签或预训练模型。在 ImageNet 256x256 上,使用 JiT-B 配方且没有表示指导,SCION 达到 8.92 FID,超过类无条件 iREPA(与预训练的 DINOv2 (46.44) 一致)和 RCG(以它为条件)(14.27)。借助 JiT-L,SCION 在没有指导的情况下实现了 5.89 FID,在有代表性指导的情况下实现了 3.47,优于使用 ADM 配方的 RCG (6.24)。