论文
为以人为中心的场景中人工智能生成的图像检测奠定基础并解释视觉证据
Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes
摘要
图像生成模型的快速发展需要可解释的人工智能生成图像检测方法,这些方法不仅可以确定真实性,还可以提供支持的视觉证据。现有方法可能会在生成的解释和局部证据区域之间产生不一致,从而破坏真实性决策解释的可靠性。与此同时,现有的基准对生成图像中普遍存在的各种以人为中心的场景的覆盖范围有限。为了解决这些局限性,我们在以人为中心的场景中利用有根据的、可解释的视觉证据来研究真实性检测。我们提出了 HAVE(以人为中心的人工智能生成的视觉证据),这是一个以人为中心的多样化数据集,包含来自 10 个最新生成器的 40K 真实图像和 39K AI 生成图像,以及跨 8 个证据类别的 106K 本地化证据实例,每个证据实例都带有边界框和区域对齐解释。我们进一步提出了 PAVE,一种感知感知视觉证据框架,它联合执行真实性预测、视觉证据基础和区域对齐解释生成。 PAVE 采用法官引导的对齐奖励来评估区域解释一致性和证据有效性,以及感知感知正则化,对比原始图像和随机屏蔽图像之间的 词元级 预测,以促进对视觉输入的依赖。 HAVE 和外部数据集上的实验证明了其在真实性检测、视觉证据基础和解释质量方面的强大性能。代码和数据将在发布后发布。