论文

空是最难的部分:生成模型中记忆的精确测试

The Null Is the Hard Part: Exact Tests for Memorization in Generative Models

模型评测评测方法与指标

摘要

生成模型的记忆审核根据阈值读取相似性分数,没有零分布,并且它们支持的结论可能是错误的。根据 MemBench 的规则,基准测试的缓解措施大约使稳定扩散的记忆量减半;通过错误发现控制进行审核,三分之二的认证图像在随机提示扰动下不再被检测到,六分之五在注意力重新调整下不再被检测到,并且所有这些图像都在嵌入优化下。该字段的数据复制测试,针对其自身的空值进行读取,标记了二十四个生成器中的十个,这些生成器不复制任何内容。我们认为对于记忆来说,零是最难的部分,并提供了两个。对于整个模型,训练和保留的图像在给定样本的情况下是可以交换的,并且重新标记它们是一种排列测试,当保留的图像是随机分割时,对于任何统计数据都是精确的;在此基础上,最近邻偏好仍然对这 24 个中的 7 个起作用,并且计数仅限于几乎重复的范围(McNemar p=0.016)。对于单个图像,自然零值会失败两次,这是可测量的:在随机图像中对图像进行排名会在 2,365 个对照中产生 596 个错误发现,而对独立代进行重新采样会使零值过窄三倍。根据匹配的控制进行校准,审核以 5% 的错误发现率证明了 61 个 MemBench 图像中的 36 个,保留的控制在 0.01% 的校准分割中得到了认证,并且在此基准上,每个图像的两代都恢复了该计数。校准的最大值(读取偶尔而不是典型的复制)证明了 46。作为尺度限制的统计量,我们建议使用交点欧拉特征剖面的小尺度质量,它还对复制的不同图像进行计数,并测试两个模型是否复制相同的图像。