论文
TextFake:在富含文本的图像上对人工智能生成的图像检测进行基准测试
TextFake: Benchmarking AI-Generated Image Detection on Text-Rich Images
摘要
最近的人工智能生成图像(AIGI)检测器在自然图像基准上表现良好,但它们在富含文本的伪造物(例如虚假信息中普遍存在的伪造屏幕截图、文档和新闻页面)上的行为仍未经过测试。我们推出了 TextFake,这是一个包含 20,000 张图像的基准测试,用于跨 28 种语言、4 个主题类别和 2 种场景模式的丰富文本 AIGI 检测。假图像通过四阶段管道合成,该管道沿三个受控维度注释真实图像,并通过分布对齐的结构化提示生成对应图像,排除协变量捷径。对 14 个专用检测器和 3 个前沿 VLM API 的零样本评估揭示了巨大的系统差距:没有一种方法的准确度超过 80%,有些方法比自然图像基准下降了 60% 以上。诊断评估确定了三种故障模式:文本密度诅咒,密集的字形压倒了低级检测器;通过渲染保真度进行伪装,更强的文本渲染会抑制生成伪影;阈值崩溃,其中常规扰动驱动探测器达到机会级性能。