论文

GenSyn10:用于图像分类基准测试的多生成人工智能数据集

GenSyn10: A Multi-Generative AI Dataset For Benchmarking Image Classification

模型评测基准与评测资源

摘要

生成式人工智能的快速发展已经超出了我们可靠检测其输出的能力,特别是当检测器遇到他们以前从未见过的生成器时。我们引入了 GenSyn10,这是一个 CIFAR-10 对齐的合成图像数据集,包含 60,000 张图像(10 个类别,32$\times$32,50k/10k 分割),使用三种架构不同的最先进模型生成:FLUX.2-dev (整流流 Transformer)、HunyuanImage-3.0 (MoE Transformer)、和 Qwen-Image-2512(多模态扩散 Transformer),以推进人工智能生成图像检测的研究。该领域的一个主要挑战是探测器在已知的发生器上表现良好,但在不可见的发生器上性能下降。 GenSyn10 通过在标准化生成协议下整理来自多个当代架构的数据来解决这一限制,从而能够对新型生成器的分布外 (OOD) 泛化进行受控和系统评估。图像是使用基于模板的提示引擎生成的,并进行下采样以确保一致性。我们在四阶段协议下评估了 17 个图像分类模型:真实数据基线、零样本传输、微调 和保留。尽管存在可测量的域差距,CIFAR-10 训练的模型在 GenSyn10 上实现了高达 96.86% 的零样本准确率,在 微调 后增加到 99.88%。在二元真实与合成分类中,微调模型在见过的生成器上实现了 97-99.9% 的准确度,但在来自未见过的生成器的图像上下降到 79-96%,突出了 OOD 泛化中持续存在的局限性。这些结果将 GenSyn10 确立为研究单生成器设置之外的合成图像检测的受控基准,支持鲁棒性、域适应和跨生成器泛化的研究。