论文

当伪造者是法官:GPT-Image-2 无法识别自己的伪造文件

When the Forger Is the Judge: GPT-Image-2 Cannot Recognize Its Own Faked Documents

模型评测基准与评测资源

摘要

OpenAI 的 GPT-Image-2 有效消除了真实文档图像和 AI 编辑文档图像之间的视觉界限:收据上的单个数字可以在不到一秒的时间内更换,只需几美分。我们发布了 AIForge-Doc v2,这是一个由 3,066 个 GPT-Image-2 文档伪造组成的配对数据集,采用与 DocTamper 兼容的格式,具有像素精确的掩码,并对四道防线进行了基准测试:人工检查员(通过公共 2AFC 站点 CanUSpotAI.com,N=120,n=365 配对投票)、TruFor(通用取证)、DocTamper(qcf-568,特定于文档)、以及与零样本自我判断相同的 GPT-Image-2 模型——询问,以避免琐碎的“图像大部分是真实的”阅读,是否有任何区域是由 AI 图像模型生成或编辑的。人类 2AFC 准确度为 0.501,无法区分偶然性:即使并排检查,检查员也无法区分 GPT-Image-2 收据伪造品和真实收据。三位计算法官仅略高于(TruFor 0.599、DocTamper 0.585、自我判断 0.532)。自我判断始终失败,而不是偶然:在五种即时策略和四种处理模糊响应的策略中,AUC 从未升至 0.59 以上。为了排除两个取证检测器在我们的源域上被破坏而不是对 AI 修复视而不见的可能性,我们在为其训练分布构建的同域传统篡改集上对每个探测器进行校准:TruFor 在我们的数据集的跨摄像机拼接上达到 AUC 0.962,DocTamper 在使用两遍 JPEG 重新编码的跨文档 OCR 词元拼接上达到 0.852。两者都保留了即将发布的传统篡改性能;切换到 GPT-Image-2 修复会使 AUC 下降 0.27-0.36(0.962->0.599 TruFor;0.852->0.585 DocTamper),隔离特定于 GPT-Image-2 修复的检测间隙。我们发布了数据集、管道、四法官协议和校准集。