论文
通过校准内容认证来认证真实图像
Certification of Real Images through Calibrated Content Authentication
摘要
生成模型可以合成高质量的不真实的多媒体内容,而这些内容已经被大规模滥用。我们针对过去四年发布的 10 个生成器评估了 20 个 Deepfake 探测器,发现准确度随着时间的推移而下降,从近乎完美的 99.5% 下降到 76%。对抗性扰动进一步将每个基线检测器的准确度降低到 2% 以下,从而有效地颠倒了检测器分配的标签。我们认为,这种不可靠性反映了一种根本性的模糊性:生成器可以准确地再现真实内容(例如,通过记忆),因此仅靠内容无法揭示真实的出处标签。因此,生成器生成的内容必须承认同一生成器的忠实重建,而找到这样的重建使得合成出处合理且真实性可信可否认。因此,我们提出并评估一种检测范式,该检测范式输出真实性是否可信可否认的校准预测:任何已知生成器的忠实重建都会建立合理的否认性,而校准则限制了已知生成器的内容无法再现的频率。我们的评估表明,(i) 我们的检测器可以进行校准,以便最多 1% 的生成内容被错误认证,在该操作点上,大多数基线检测器达到接近零的召回率,包括准确度高达 93% 的最强检测器; (ii) 对受攻击样本校准更严格的安全阈值,保留了针对评估的有界扰动攻击空间内的自适应对手的界限,这些对手的扰动打破了每个基线,但不涵盖任意的对抗性转换; (iii) 事后可验证性正在受到侵蚀,因为 3,000 张 Reddit 图像中有 1,116 张抵制 2022 年生成器的复制,但只有 55 到 79 个抵制 2024 年生成器的复制。
