论文
SSAFE:通过 Frozen Vision 编码器进行简单而强大的 AI 生成图像检测
SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders
摘要
生成模型的快速发展模糊了合成图像和真实图像之间的界限,迫切需要可靠的深度伪造检测。然而,大多数现有方法都依赖于大量的真假数据集,随着新生成器的不断出现,这些数据集越来越难以维护。在这项工作中,我们研究了现代多模态视觉表示中已经编码了多少有关图像真实性的信息。我们发现,冻结的多模态编码器在其嵌入空间中自然地分离真实图像和合成图像,使简单的线性分类器能够在没有特定于任务的 微调 的情况下实现强大的性能。受这一观察的启发,我们开发了一种表示感知数据管理策略,该策略选择一组紧凑的代表性生成器进行训练。生成的训练集仅包含 10K 图像,而 AIGIBench 中为 288K,OpenFake 中为 4M,同时提高了对看不见的生成器和分布变化的鲁棒性。我们还介绍了 RealWorldBench,这是一个由现代相机照片、当代库存图像和最新商业生成器的输出组成的基准。跨多个基准的实验表明,将冻结的多模态表示与精心策划的训练数据相结合,为人工智能生成的图像检测提供了一种简单有效的方法。