论文

通过校准内容认证来认证真实图像

Certification of Real Images through Calibrated Content Authentication

模型评测安全与风险评测

摘要

生成模型可以合成高质量的不真实的多媒体内容,而这些内容已经被大规模滥用。我们针对过去四年发布的 10 个生成器评估了 20 个 Deepfake 探测器,发现准确度随着时间的推移而下降,从近乎完美的 99.5% 下降到 76%。对抗性扰动进一步将每个基线检测器的准确度降低到 2% 以下,从而有效地颠倒了检测器分配的标签。我们认为,这种不可靠性反映了一种根本性的模糊性:生成器可以准确地再现真实内容(例如,通过记忆),因此仅靠内容无法揭示真实的出处标签。因此,生成器生成的内容必须承认同一生成器的忠实重建,而找到这样的重建使得合成出处合理且真实性可信可否认。因此,我们提出并评估一种检测范式,该检测范式输出真实性是否可信可否认的校准预测:任何已知生成器的忠实重建都会建立合理的否认性,而校准则限制了已知生成器的内容无法再现的频率。我们的评估表明,(i) 我们的检测器可以进行校准,以便最多 1% 的生成内容被错误认证,在该操作点上,大多数基线检测器达到接近零的召回率,包括准确度高达 93% 的最强检测器; (ii) 对受攻击样本校准更严格的安全阈值,保留了针对评估的有界扰动攻击空间内的自适应对手的界限,这些对手的扰动打破了每个基线,但不涵盖任意的对抗性转换; (iii) 事后可验证性正在受到侵蚀,因为 3,000 张 Reddit 图像中有 1,116 张抵制 2022 年生成器的复制,但只有 55 到 79 个抵制 2024 年生成器的复制。

通过校准内容认证来认证真实图像的原论文方法或结果图
图 2:我们方法的概念图。 (A) 传统的事后检测器使用特征线索区分真假,但随着生成器的改进而陷入困境。 (B) 我们的方法改为测试生成器是否可以重新合成查询图像 $x$。 $x$ 与其再合成 $\tilde{x}$ 之间的相似性 $s(x,\tilde{x})$ 被校准为真实性得分,其中高相似性意味着似是而非的否认性,低相似性表明可能是真实的。在此图及后续图中,A-index 表示真实性得分。