论文

TextRich:用于从 GPT-Image-2 检测 AI 生成的富文本图像的多域基准

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

模型评测基准与评测资源

摘要

富含文本的图像通常包含隐私敏感、事务或决策相关信息。随着最近的多模态图像生成模型越来越能够合成真实的文本内容和结构化视觉设计,检测人工智能生成的富含文本的图像已成为数字信任和内容真实性的重要挑战。然而,现有的基准主要关注以对象为中心的图像,并且对以文本语义和布局组织为中心的场景提供有限的覆盖。在本文中,我们介绍了 TextRich,这是一个多域基准测试,用于检测由 OpenAI 的 GPT-Image-2 生成的富含文本的图像。该基准包含六个代表性类别的 12,095 张图像:商业海报、信息图表、学术海报、收据、表格和 UI 屏幕截图。使用这个基准,我们在零样本设置下评估了五个具有代表性的人工智能生成的图像检测器,并进一步探索了多模态视觉语言模型用于此任务的能力。我们的结果揭示了文本丰富的领域中存在巨大的性能差异,其中现有的人工智能生成的图像检测器表现出独特的优势和故障模式。尽管最强的检测器实现了具有竞争力的整体性能,但它在某些结构化类别上仍然无效,并且对 JPEG 压缩高度敏感。视觉语言模型提供了一种有前途的补充方法,但仍然难以处理高度结构化的文本丰富的图像。这些发现凸显了现代人工智能生成图像需要文本和布局感知的检测方法。我们的数据集发布于 https://huggingface.co/datasets/Shuyiww/TextRich。