论文

GAP-SAM:通用人工智能生成图像操作定位的全局先验

GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization

应用与实践视觉感知与空间理解

摘要

AI 生成的图像处理定位可识别已编辑的像素,但其 OOD 性能落后于图像级检测,部分原因是像素监督将取证证据与数据集特定的掩模几何形状和语义边界纠缠在一起。将图像级分布对齐扩展到定位,我们使用源图像 Canny 边缘和深度图构建 COCO-ControlNet,以对齐语义和几何形状,从而提高跨多个定位器的 OOD 性能。然而,更严格的 Mask-VAE 重建对齐 (Mask-VAE) 的表现不如 COCO-ControlNet,这表明 VAE 重建伪影很难转移到局部扩散修复伪影。我们还识别了\emph{边界粘附},其中微调的分割模型将预测捕捉到语义对象轮廓而不是真实的操作边界。这些发现激发了 GAP-SAM,它将图像及其冻结的 VAE 重建编码为全局伪像标记,并在像素解码之前通过零门控 FiLM 将其注入 SAM3 的特征金字塔。在不规定空间区域的情况下,该词元调节密集解码以保留定位,同时抑制语义边界捷径。在六个数据集中,GAP-SAM 的平均 Pixel-F1 为 79.8,比最强的现有方法高出 12.6 个点。它还在 JPEG 压缩、高斯模糊和调整大小的每个测试严重性方面都表现最佳。