论文
FID 隐藏了什么:生成评估中的偏差检测、排序和诊断
What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
摘要
生成模型通常按 Fréchet 起始距离 (FID) 和内核起始距离 (KID) 进行排名,但 FID 的前两时刻摘要可能会错过分布差异,并且单独报告的标量间隙并不是针对采样变化的校准测试。 FID 的矩限制具有具体的后果:在 ImageNet 上,视觉上无法识别的图像仅经过优化以匹配参考初始均值和协方差,获得的 FID 为 24.7 美元,而保留的真实图像为 58.6 美元(越低越好)。此外,FID 和 KID 是标量差异,在交换两个样本时不会改变,因此不会编码离散程度变化的方向:离散程度不足(如模式崩溃中可能发生的情况)与离散程度过度。我们引入了\textbf{ZID}(\emph{Z-resolved Integrated Diagnostic}),它结合了来自等级图(RISE)和高斯内核(两个带宽的GPK)的六个标准化位置和离散程度敏感臂。 ZID 不是要求一个标量充当不兼容的角色,而是报告三个链接的输出:用于排名偏离幅度的索引、用于测试分布相等的置换检验p值以及用于诊断的带正负方向的离散程度读数。在受控实验中,ZID 检测到广泛的偏离,其分数跟踪相应扫描中逐渐增加的严重性,包括 FID 持平或反转的情况。在 DiT-XL/2 和 SiT-XL/2 制导扫描中,ZID 检测到与真实数据的偏离,其签名读数将高制导分集崩溃标记为离散程度不足。