论文

FID 彩票:量化生成模型评估中隐藏的随机性

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

模型评测评测方法与指标

摘要

Frechet 起始距离 (FID) 是图像生成事实上的仲裁者,但大多数论文仅报告使用单个采样种子的单个训练模型的单个数字。如果我们重新训练模型,或者只是从中重新采样,这个数字的可重复性如何?在本文中,我们将 FID 视为训练和生成种子的两轴面板上的随机变量,并直接在数百个在类条件 ImageNet 256x256 上训练的 SiT 网络上测量其方差。我们报告了令人惊讶的发现:(a) 使用具有不同种子的相同配方重新训练模型,FID 移动量(在 Inception 特征空间中)比从固定网络重新绘制样本多 3.2 倍。 (b) 该差距由三个因素驱动:随机初始化、数据排序和流匹配损失的每步高斯噪声。 (c) 增加计算或模型大小几乎不会收紧扩散,将 FID 变异系数 (CoV) 保持在 1-2% 的范围内。 (d) 每个单元的无分类器引导调整将传播范围减半,但重新调整了哪些种子效果最好,幸运的训练种子达到相同的 FID 时,计算量比不幸的种子少 2 倍。基于这些发现,我们推荐一种新的 FID 评估方案:在每个细胞的最佳指导下进行评估,将低于经验测量的 ~1.3% CoV 的任何 FID 差距视为不确定,并报告多个训练种子的误差条,而不是单个 FID 数字。