论文

视觉生成的表示 Fréchet 损失

Representation Fréchet Loss for Visual Generation

模型训练预训练

摘要

我们证明,长期以来被认为作为训练目标不切实际的弗雷切距离(FD)实际上可以在表示空间中进行有效优化。我们的想法很简单:将 FD 估计的总体大小(例如 50k)与梯度计算的批量大小(例如 1024)分离。我们将这种方法称为 FD 损失。优化 FD 损失揭示了一些令人惊讶的发现。首先,后训练 是一个在不同表示空间中具有 FD 损失的基础生成器,持续提高视觉质量。在 Inception 特征空间下,一步生成器在 ImageNet 256x256 上实现了 0.72 FID。其次,相同的 FD 损失将多步生成器重新调整为强大的单步生成器,无需教师 蒸馏、对抗性训练或每个样本目标。第三,FID 可能会对视觉质量进行错误排名:尽管 Inception FID 较差,但现代表示可以产生更好的样本。这激发了 FDr$^k$,一种多表示指标。我们希望这项工作将鼓励进一步探索不同表示空间中的分布距离,作为生成模型的训练目标和评估指标。