论文
MLLM 生成图像检测的基准数据集:GPT Image2 和 Nano Banana2
A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2
摘要
近年来,GPT Image2 和 Nano Banana2 等多模态 大语言模型 (MLLM) 生成的图像的真实感迅速提高。与早期的生成模型相比,当前的模型在文本渲染方面取得了明显的进步。它们可以生成与现实应用场景非常相似的高质量图像。当前 MLLM 增强的生成能力对人工智能生成的图像检测提出了越来越严峻的挑战。检测不再局限于识别早期生成器留下的明显伪影。相反,它需要为新一代生成内容制定系统且现实的基准。然而,大多数现有基准仍然是围绕早期生成模型建立的,无法充分评估高质量和多形式生成图像带来的取证挑战。为了解决这一差距,本文构建了一个用于检测 MLLM 生成的图像的基准数据集。该基准测试涵盖了多个实际应用场景,并采用三种生成协议来模拟直接生成、基于参考的重建和本地编辑。基于此基准,我们评估了从传统场景到 MLLM 生成图像的检测器退化,并分析了三种样本类型的误报率和漏报率,揭示了现有方法的失败模式。我们进一步提出了一个结构工件优先引导的双流提示框架(SAP-DSP)作为强大的基线。 SAP-DSP 使用双流提示学习和结构感知路由融合来改进表示学习。大量实验表明,所提出的基准暴露了现有检测器在高质量生成图像上的性能下降,而 SAP-DSP 在此基准上实现了更稳定的检测结果。我们的代码和数据集可在 https://github.com/xbrainnet/SAP-DSP 上公开获取。